专业语音克隆(PVC)
- PVC API:推出一套完整的 API 端点,用于管理专业语音克隆(PVC)。现在可通过编程创建音色、添加/管理/删除音频样本、获取音频/波形、管理说话人分离、处理验证及启动训练。完整的新端点列表请参阅下方 API 变更摘要,或查看 PVC API 参考文档此处。
语音转文本
- 增强导出选项:通过 API 以分段 JSON 格式导出语音转文本结果时,新增可包含或排除时间戳和说话人 ID 的选项。
智能体平台
- 新增 LLM 模型:新增支持 GPT-4.1 模型:
gpt-4.1、gpt-4.1-mini和gpt-4.1-nano,详见此处 - VAD 分数:新增客户端事件,用于向客户端发送 VAD 分数,参考文档见此处
API
查看 API 变更
新增端点
- 新增 16 个端点:
- 创建 PVC 音色 - 创建新的 PVC 音色。
- 编辑 PVC 音色 - 编辑 PVC 音色元数据。
- 向 PVC 音色添加样本 - 向 PVC 音色添加音频样本。
- 更新 PVC 音色样本 - 更新 PVC 音色样本(降噪、说话人选择、剪辑)。
- 删除 PVC 音色样本 - 从 PVC 音色中删除样本。
- 获取音色样本音频 - 获取 PVC 音色样本的音频。
- 获取音色样本可视化波形 - 获取 PVC 音色样本的可视化波形。
- 获取说话人分离状态 - 获取样本的说话人分离状态。
- 启动说话人分离 - 对样本启动说话人分离。
- 获取分离后说话人音频 - 获取特定已分离说话人的音频。
- 获取 PVC 音色验证码 - 获取用于 PVC 音色验证的验证码。
- 验证 PVC 音色验证码 - 提交 PVC 音色验证码验证。
- 运行 PVC 训练 - 启动 PVC 音色训练流程。
- 请求人工验证 - 为 PVC 音色请求人工验证。
更新端点
语音转文本
- 已更新端点:
- 创建强制对齐任务 - 新增
enabled_spooled_file参数,支持流式传输大型文件(POST /v1/forced-alignment)。
- 创建强制对齐任务 - 新增
Schema 变更
智能体平台
GET conversation details:新增has_audio、has_user_audio、has_response_audio布尔字段,详见此处
配音
GET dubbing resource:为每个渲染结果新增status字段,详见此处