Scribe v2
我们发布了 Scribe v2,这一全新的先进转录模型。在文档中详细了解 Scribe v2。
智能体平台
- 批量通话排期的时区支持:现在可以在安排批量通话时选择时区。排期时间会根据所选时区转换为 UTC。默认会自动选择浏览器时区,验证机制会阻止在所选时区内安排已过时间的通话。这让你可以更轻松地在收件人所在时区的合适时间安排外呼。
- 知识库源文件 URL:新增端点,用于获取知识库文档的原始源文件 URL,以便直接访问已上传的文件。
- LLM 回退级联超时:为智能体备用 LLM 配置新增
cascade_timeout_seconds选项,可控制级联至下一个 LLM 前的等待时间。默认值为 8 秒,允许范围为 2 至 15 秒。 - 软超时 LLM 生成消息:在软超时配置中新增
use_llm_generated_message选项。启用后,触发软超时时,智能体将使用 LLM 生成符合上下文的消息,而非使用预定义消息。 - 知识库文件夹导航:知识库文档响应现包含
folder_path字段,显示从根目录到父文件夹的路径段,方便了解文档层级。 - 按发起来源筛选对话:获取对话端点现支持按
conversation_initiation_source查询参数筛选。
配音
- 新转录格式端点:新增
GET /v1/dubbing/{dubbing_id}/transcripts/{language_code}/format/{format_type}端点,支持srt、webvtt和json输出格式。此前的GET /v1/dubbing/{dubbing_id}/transcript/{language_code}端点现已弃用。 - 配音文件需要文件名:知识库文件模型现要求提供
filename字段。
语音转文字
- 实体检测:在语音转文字请求中新增
entity_detection选项。接受'all'、特定实体类型字符串或实体类型数组。检测到的实体将通过新的entities响应字段,使用DetectedEntity架构返回。 - 关键词提示:在语音转文字请求中新增
keyterms数组参数,用于使转录更倾向于特定术语或短语。
SDK 发布
Python SDK
- v2.29.0 - 为语音转文字新增实体检测和关键词提示、LLM 级联超时配置、软超时 LLM 消息生成及批量通话时区支持
- v2.28.0 - 新增智能体版本控制字段、音色集合 ID、批量通话增强和电话号码标签
JavaScript SDK
- v2.30.0 - 为语音转文字新增实体检测和关键词提示、LLM 级联超时配置、软超时 LLM 消息生成及批量通话时区支持
- v2.29.0 - 新增智能体版本控制字段、音色集合 ID、批量通话增强和电话号码标签
MCP 服务器
- v0.9.1 - 新增 Gemini Extension 支持,修复非绝对
output_directory和缺失base_path的路径处理
API
查看 API 变更
新端点
- 获取指定格式的配音转录文本 -
GET /v1/dubbing/{dubbing_id}/transcripts/{language_code}/format/{format_type}- 以 SRT、WebVTT 或 JSON 格式获取配音转录文本 - 获取知识库源文件 URL -
GET /v1/convai/knowledge-base/{documentation_id}/source-file-url- 获取知识库文档的原始源文件 URL
已弃用的端点
GET /v1/dubbing/{dubbing_id}/transcript/{language_code}- 请改用新的特定格式端点
更新的端点
智能体平台
- 提交批量通话
- 在请求正文中新增
timezone(字符串,可选),用于感知时区的排期 - 新增
scheduled_time(字符串,可选),作为scheduled_time_unix的 ISO 字符串替代方案
- 在请求正文中新增
- 获取批量通话、取消批量通话、重试批量通话
- 在批量通话响应模型中新增
timezone(字符串,必填)
- 在批量通话响应模型中新增
- 创建智能体、更新智能体、获取智能体
- 在备用 LLM 配置中新增
cascade_timeout_seconds(整数,默认 8,范围 2 至 15,可为空) - 在软超时配置中新增
use_llm_generated_message(布尔值,默认false)
- 在备用 LLM 配置中新增
- 获取对话
- 新增
conversation_initiation_source(字符串,可选)查询参数,用于按发起来源筛选对话
- 新增
- 模拟对话、模拟对话流
- 更新
entity_detection,使其接受'all'、字符串或字符串数组,而非布尔值
- 更新
知识库
- 列出知识库文档
- 移除已弃用的
use_typesense查询参数 - 在文档响应模型中新增
folder_path(路径段数组) - 在知识库文件模型中新增
filename(字符串,必填)
- 移除已弃用的
语音转文字
- 转录语音
- 新增
keyterms(字符串数组,可选),用于使转录更倾向于特定术语 - 新增
entity_detection(字符串、数组或'all',可选),用于检测转录文本中的实体 - 在响应模型中新增
entities(DetectedEntity数组,可选)
- 新增
配音
- 创建配音项目
- 更新
mode说明,注明manual模式仍处于实验阶段,不建议用于生产环境
- 更新