Scribe v2 Realtime

Scribe v2 Realtime 是我们速度最快、准确率最高的实时语音识别模型,现已正式发布。它支持超过 92 种语言,具备业界领先的准确率和低至 150ms 的延迟。在此了解更多。

智能体平台

  • 组件通话结束反馈:组件现支持自定义通话结束反馈收集,可选评分和评论字段,让你能直接在智能体对话中收集用户反馈。
  • 软超时配置:新增全面的软超时设置,用于控制智能体如何处理对话停顿,并可在轮次和对话层级配置提示词和行为。
  • 高级对话筛选:对话端点现支持按通话时长范围、评估参数、数据收集参数和特定工具名称筛选。
  • 增强对话反馈:更新对话反馈系统,加入评分和评论等结构化反馈类型,更好地追踪用户体验。

ElevenCreative Studio

  • 扩展项目元数据:项目现提供完整的资源追踪,包括视频缩略图、外部音频引用,以及包含音频时长的增强快照信息。

计费

  • 增强发票详情:发票响应现通过新的 discounts 数组提供详细折扣信息,替代已弃用的 discount_percent_off 和 discount_amount_off 字段。subtotal_cents 和 tax_cents 字段可更清晰地展示发票明细。

音乐 API

  • 音轨分离延迟优化:已更新音轨分离端点,以更好地处理音频文件,并为处理请求提供更可预测的延迟。

SDK 发布

JavaScript SDK

  • v2.23.0 - 将 Speech to Text(Scribe)端点更新为 scribe_realtime,并导出额外的 TypeScript 类型,改善开发体验。
  • v2.22.0 - 更新至最新 API 架构变更,包括对话筛选、软超时配置和组件反馈功能。

Python SDK

  • v2.22.1 - 将 Speech to Text(Scribe)端点更新为 scribe_realtime,并修复循环导入问题,提升稳定性。
  • v2.22.0 - 更新至最新 API 架构变更,包括对话筛选、软超时配置和组件反馈功能。

智能体软件包

Android SDK

  • v0.5.0 - 新增 setVolume 和 getVolume 函数,用于通过编程控制音频;示例应用中包含音量滑动条实现示例。

API

已更新端点

智能体平台

对话管理

  • 获取对话

    • 新增 call_duration_min_secs 查询参数(整数),按最短通话时长筛选对话
    • 新增 call_duration_max_secs 查询参数(整数),按最长通话时长筛选对话
    • 新增 evaluation_params 查询参数(字符串数组),按评估条件筛选
    • 新增 data_collection_params 查询参数(字符串数组),按数据收集参数筛选
    • 新增 tool_names 查询参数(字符串数组),筛选使用特定工具的对话
  • 提交对话反馈

    • 现使用具有结构化反馈类型的 ConversationFeedbackRequestModel
    • 新增 type 字段,用于指定反馈类别
    • 新增 rating 字段,用于数值反馈
    • 新增 comment 字段,用于文本反馈

智能体配置

  • 获取智能体组件
    • 新增带有 WidgetEndFeedbackConfig 的 end_feedback 字段,用于配置通话结束反馈收集
    • 反馈表单支持可选评分和评论字段
  • 获取智能体 & 更新智能体
    • 响应架构已更新,包含新的平台配置选项
    • 请求架构已增强,包含额外设置字段

轮次和对话配置

  • 创建智能体、模拟对话、模拟对话流

    • 新增 soft_timeout_config 字段,用于控制对话中的停顿行为
    • 通过 TurnConfigOverride 和 TurnConfigOverrideConfig 新增 turn 配置覆盖
    • 在 TurnConfig 中新增 initial_wait_time,用于控制初始响应时机
    • 可在对话和 workflow 覆盖层级配置

测试

  • 运行智能体测试

    • 请求架构已增强,支持 workflow 表达式
    • 响应架构已更新,包含额外测试结果字段
  • 获取测试调用

    • 响应包含增强的测试结果数据
    • 已更新 workflow 表达式结果的架构

ElevenCreative Studio

  • 获取项目

    • 新增必填 assets 字段,包含视频和外部音频引用
    • 引入用于视频资源元数据的 ProjectVideoResponseModel
    • 引入用于外部音频追踪的 ProjectExternalAudioResponseModel
    • 引入用于视频缩略图的 ProjectVideoThumbnailSheetResponseModel
  • 获取项目快照

    • 使用新的 ProjectSnapshotExtendedResponseModel 重构响应
    • 在快照数据中新增必填 audio_duration_secs 字段
    • 从 ProjectSnapshotResponseModel 中移除 character_alignments
    • 引入用于快照集合的 ProjectSnapshotsResponseModel

计费

  • 获取订阅
    • 新增必填 discounts 数组,包含 DiscountResponseModel 条目
    • 弃用 discount_percent_off 字段(仍可用,但已标记为将移除)
    • 弃用 discount_amount_off 字段(仍可用,但已标记为将移除)
    • 新增 subtotal_cents 字段(整数、可为空),用于税前发票总额
    • 新增 tax_cents 字段(整数、可为空),用于税额
    • 更新发票示例,包含新的折扣和总额字段

语音转文本

  • 转写音频
    • 响应架构已更新,包含增强的转写数据

文本转语音

音色管理

专业语音克隆(PVC)

语言预设

  • 语言预设模型现包含 soft_timeout_translation 字段,用于本地化软超时消息

API 集成触发器

  • 注册新的 API 集合:convai_api_integration_trigger_connections

弃用项

  • 发票字段 discount_percent_off 和 discount_amount_off 已弃用;请改用 discounts 数组