配音

  • JSON 转录格式:GET /v1/dubbing/{dubbing_id}/transcript/{language_code} 端点现支持 JSON 格式转录,通过 DubbingTranscriptResponseModel 返回详细的词级和字符级时间数据。

智能体平台

  • GPT-5.1 支持:智能体配置现支持 gpt-5.1 和 gpt-5.1-2025-11-13 LLM 模型。
  • 推理强度控制:在 LLMReasoningEffort 中新增 none 选项,更好地控制模型推理行为。
  • 智能体工具请求事件:在 ClientEvent 中新增 agent_tool_request,以便更好地追踪实时对话中的工具交互。
  • 带外 DTMF:在 PlayDTMFToolConfig 中新增 use_out_of_band_dtmf 标志,改善电话系统集成。
  • 新增 LLM 模型:LLM 枚举扩展了 gemini-3-pro-preview,增强对话式 AI 功能。

语音转文本

  • Scribe 配额超限事件:在 SDK 中新增 quota_exceeded 事件和 include_timestamps 参数,更好地管理配额和控制时间戳。

ElevenCreative Studio

  • 章节音色追踪:在章节响应模型中新增 voice_ids 字段,更好地管理多音色项目中的音色。
  • 项目图像资源:引入用于图像资源支持的 ProjectImageResponseModel,现已包含在 ProjectResponseModel.assets 中。
  • 基础音色字段:在 ProjectResponseModel 中新增 base_voices 字段,改善音色管理。

文本转语音

  • 文本规范化控制:在所有 TTS 音色设置中新增 TextNormalisationType 枚举和 text_normalisation_type 字段,以精细控制文本处理。
  • TTS WebSocket 令牌:将 SingleUseTokenType 扩展为包含 tts_websocket,实现安全的 WebSocket 身份验证。

SDK 发布

JavaScript SDK

  • v2.25.0 - 更新至最新 API 架构变更,包括 JSON 配音转录和 GPT-5.1 支持。
  • v2.24.1 - 在 Scribe API 中新增 include_timestamps 参数,用于控制转录中的时间戳。

Python SDK

  • v2.24.0 - 更新至最新 API 架构变更,包括 JSON 配音转录和 GPT-5.1 支持。
  • v2.23.0 - 在 Scribe API 中新增 include_timestamps 参数和 quota_exceeded 事件,更好地管理配额。

软件包

API

已更新端点

配音

  • GET /v1/dubbing/{dubbing_id}/transcript/{language_code}
    • language 路径参数现接受 'original' 值
    • format_type 查询参数现支持 'json'(除 srt 和 webvtt 外)
    • 200 响应现包含 application/json 媒体类型,返回包含以下内容的 DubbingTranscriptResponseModel:
      • DubbingTranscriptUtterance - 话语级数据
      • DubbingTranscriptWord - 词级时间信息
      • DubbingTranscriptCharacter - 字符级时间信息
  • 新增 DubbingModel 枚举,包含 dubbing_v2 和 dubbing_v3 值

智能体平台

  • 提交批量呼叫
    • 请求正文架构已更新(向后兼容)
    • 响应架构已更新(向后兼容)
  • 获取批量呼叫状态
    • 响应架构已更新(向后兼容)
  • 取消批量呼叫
    • 响应架构已更新(向后兼容)
  • 重试批量呼叫
    • 响应架构已更新(向后兼容)
  • 获取智能体设置
    • 响应架构已更新(向后兼容)
  • 更新智能体设置
    • 请求和响应架构已更新(向后兼容)
  • 创建智能体
    • 请求架构已更新,改进了安全护栏结构(破坏性变更:将 guardrails 简化为直接引用,移除 oneOf)
  • 获取智能体
    • 响应架构已更新(破坏性变更:移除受功能标志控制的 version_id 和 branch_id 字段)
  • 更新智能体
    • 响应架构已更新(破坏性变更:移除受功能标志控制的 version_id 和 branch_id 字段)
  • 模拟对话
    • 请求架构已更新(向后兼容)
  • 模拟对话流
    • 请求架构已更新(向后兼容)
  • 获取对话
    • 响应架构已更新(向后兼容)
  • 客户端事件已更新:
    • 新增 agent_tool_request 事件类型
  • 工具配置已更新:
    • 在 PlayDTMFToolConfig 中新增 use_out_of_band_dtmf
    • 移除 ApiIntegrationWebhookToolConfigExternal-* 架构及其判别器映射

文本转语音

音色管理

ElevenCreative Studio

  • 获取项目
    • 响应架构已更新(向后兼容)
    • 新增支持图像的 assets 字段
    • 新增 base_voices 字段
  • 添加章节
    • 响应架构已更新(向后兼容)
    • 新增 voice_ids 字段
  • 获取章节
    • 响应架构已更新(向后兼容)
    • 新增 voice_ids 字段
  • 更新章节
    • 响应架构已更新(向后兼容)
    • 新增 voice_ids 字段

音乐

其他更新

已移除功能

  • 从 TTS 枚举中移除已弃用的 eleven_expressive 和 expressive 选项