Scribe v2

我们发布了 Scribe v2,这一全新的先进转录模型。在文档中详细了解 Scribe v2。

智能体平台

  • 批量通话排期的时区支持:现在可以在安排批量通话时选择时区。排期时间会根据所选时区转换为 UTC。默认会自动选择浏览器时区,验证机制会阻止在所选时区内安排已过时间的通话。这让你可以更轻松地在收件人所在时区的合适时间安排外呼。
  • 知识库源文件 URL:新增端点,用于获取知识库文档的原始源文件 URL,以便直接访问已上传的文件。
  • LLM 回退级联超时:为智能体备用 LLM 配置新增 cascade_timeout_seconds 选项,可控制级联至下一个 LLM 前的等待时间。默认值为 8 秒,允许范围为 2 至 15 秒。
  • 软超时 LLM 生成消息:在软超时配置中新增 use_llm_generated_message 选项。启用后,触发软超时时,智能体将使用 LLM 生成符合上下文的消息,而非使用预定义消息。
  • 知识库文件夹导航:知识库文档响应现包含 folder_path 字段,显示从根目录到父文件夹的路径段,方便了解文档层级。
  • 按发起来源筛选对话:获取对话端点现支持按 conversation_initiation_source 查询参数筛选。

配音

  • 新转录格式端点:新增 GET /v1/dubbing/{dubbing_id}/transcripts/{language_code}/format/{format_type} 端点,支持 srt、webvtt 和 json 输出格式。此前的 GET /v1/dubbing/{dubbing_id}/transcript/{language_code} 端点现已弃用。
  • 配音文件需要文件名:知识库文件模型现要求提供 filename 字段。

语音转文字

  • 实体检测:在语音转文字请求中新增 entity_detection 选项。接受 'all'、特定实体类型字符串或实体类型数组。检测到的实体将通过新的 entities 响应字段,使用 DetectedEntity 架构返回。
  • 关键词提示:在语音转文字请求中新增 keyterms 数组参数,用于使转录更倾向于特定术语或短语。

SDK 发布

Python SDK

  • v2.29.0 - 为语音转文字新增实体检测和关键词提示、LLM 级联超时配置、软超时 LLM 消息生成及批量通话时区支持
  • v2.28.0 - 新增智能体版本控制字段、音色集合 ID、批量通话增强和电话号码标签

JavaScript SDK

  • v2.30.0 - 为语音转文字新增实体检测和关键词提示、LLM 级联超时配置、软超时 LLM 消息生成及批量通话时区支持
  • v2.29.0 - 新增智能体版本控制字段、音色集合 ID、批量通话增强和电话号码标签

MCP 服务器

  • v0.9.1 - 新增 Gemini Extension 支持,修复非绝对 output_directory 和缺失 base_path 的路径处理

API

新端点

已弃用的端点

  • GET /v1/dubbing/{dubbing_id}/transcript/{language_code} - 请改用新的特定格式端点

更新的端点

智能体平台

  • 提交批量通话
    • 在请求正文中新增 timezone(字符串,可选),用于感知时区的排期
    • 新增 scheduled_time(字符串,可选),作为 scheduled_time_unix 的 ISO 字符串替代方案
  • 获取批量通话、取消批量通话、重试批量通话
    • 在批量通话响应模型中新增 timezone(字符串,必填)
  • 创建智能体、更新智能体、获取智能体
    • 在备用 LLM 配置中新增 cascade_timeout_seconds(整数,默认 8,范围 2 至 15,可为空)
    • 在软超时配置中新增 use_llm_generated_message(布尔值,默认 false)
  • 获取对话
    • 新增 conversation_initiation_source(字符串,可选)查询参数,用于按发起来源筛选对话
  • 模拟对话、模拟对话流
    • 更新 entity_detection,使其接受 'all'、字符串或字符串数组,而非布尔值

知识库

  • 列出知识库文档
    • 移除已弃用的 use_typesense 查询参数
    • 在文档响应模型中新增 folder_path(路径段数组)
    • 在知识库文件模型中新增 filename(字符串,必填)

语音转文字

  • 转录语音
    • 新增 keyterms(字符串数组,可选),用于使转录更倾向于特定术语
    • 新增 entity_detection(字符串、数组或 'all',可选),用于检测转录文本中的实体
    • 在响应模型中新增 entities(DetectedEntity 数组,可选)

配音

  • 创建配音项目
    • 更新 mode 说明,注明 manual 模式仍处于实验阶段,不建议用于生产环境