推出 Music v2

现可通过 ElevenLabs API 使用 Music v2。在生成音乐、流式生成音乐、生成音乐详情和上传音乐中将 model_id 设为 music_v2,即可使用新模型。Music v2 引入了由 GenerationChunk 和 AudioRefChunk 片段构建的分块式编曲计划,相比基于提示词的 music_v1 流程,可更精细地控制结构、节奏和编排。

可在生成和上传请求中使用 music_v2 编曲计划,或先通过编曲计划端点生成计划。请求和响应正文均支持 v1 或 v2 计划结构,因此可逐个端点迁移。MusicPrompt 仍仅适用于 music_v1。

  • 上传时间戳:上传音乐支持可选 with_timestamps;响应可能包含 words_timestamps。

ElevenAgents

  • 运行对话评估:新增运行对话评估端点(POST /v1/convai/conversations/{conversation_id}/analysis/evaluations/run),可使用 RunConversationEvaluationsRequest 针对已完成的对话重新运行单项评估标准。
  • Workflow 进入行为:Workflow 覆盖智能体节点新增可选 entry_behavior(generate_immediately、wait_for_user、auto),用于控制子智能体是先发言还是等待用户输入。
  • 结束流程系统工具:新增 end_procedure 系统工具配置及对应错误状态。start_procedure 工具的错误状态新增 already_active。
  • 转接 TTS 覆盖:AgentTransfer、workflow 独立智能体节点和成功的 transfer_to_agent 工具结果新增可选 preserve_client_tts_overrides(布尔值),用于在转接后保留客户端 TTS 覆盖。
  • 交互预算枚举:InteractionBudget 移除 async,新增 5_minutes、10_minutes 和 1_hour。请更新仍引用 async 的配置或 SDK 枚举。
  • 自定义护栏模型选择:自定义护栏配置新增可选 model,支持 Gemini、Claude 和 GPT 变体。护栏配置还新增可选 history_message_count(整数)。
  • 电话号码列表筛选:列出电话号码新增可选 provider、agent_id 和 branch_id 查询参数,用于筛选导入的号码。
  • WhatsApp 账户筛选:列出 WhatsApp 账户新增可选 agent_id 查询参数,可按分配的智能体筛选账户。
  • 主题时间范围筛选:获取智能体对话主题新增可选 from_unix_secs 和 to_unix_secs 查询参数,用于限定主题发现结果。
  • SIP 编解码器配置:出站 SIP 中继请求和响应模型新增可选 enabled_codecs(MediaCodec 枚举)。
  • 记忆工具类型:新增 LoadableMemoryEntry 和 LoadMemoryEntryToolErrorStatus schema,用于处理记忆工具错误。
  • 智能体测试批量限制:智能体测试附加、运行和重新提交请求 schema 将可附加测试数上限从 1000 提升至 5000。
  • 音素标签支持:智能体 TTS 设置新增可选 enable_phoneme_tags(布尔值),可选择启用 V3 SSML 音素处理。
  • 数组 schema 省略覆盖:数组 JSON schema 属性新增可选 is_omitted(与其他值来源互斥)。ConstantSchemaOverride 可使用数组常量值。
  • 转接错误上下文:转接至号码的错误负载可包含可选 agent_message(字符串)。

工作区

  • 服务账户 API 密钥更新:更新服务账户 API 密钥不再要求请求正文。编辑字段支持通过 no_update 和可为空的 name 进行部分更新,包括 permissions 和 character_limit。
  • 用量时区分桶:工作区按产品分时用量请求新增可选 time_zone(IANA 时区字符串),并明确了 interval_seconds 分桶规则。
  • 历史来源筛选:历史记录列表和详情的 source 筛选条件新增 Flows。

ElevenCreative Studio

  • 项目音色引用:项目模型、章节 TTS 节点、音色列表和音色统计均改用 project_voice_ref_id 作为标准音色字段。原 voice_id 字段仍保留在响应中,作为已弃用的只读兼容镜像。

语音转文本

  • 说话人库分轨:将语音转换为文本新增可选 use_speaker_library(布尔值,默认 false),用于批量转录说话人分轨。

音色

  • 共享音色排序:列出共享音色的 sort 查询参数新增明确枚举、created_date 默认值和更新后的说明。

SDK 发布

JavaScript SDK

  • v2.53.0 - 基于最新 OpenAPI schema 重新生成,包含对话评估重新运行支持、音乐 v2 编曲计划联合类型、workflow entry_behavior、电话号码和 WhatsApp 列表筛选、主题时间范围参数、告警 schema 更新、Studio project_voice_ref_id 字段,以及扩展后的智能体测试批量限制。

Python SDK

  • v2.53.0 - 基于最新 OpenAPI schema 重新生成,包含对话评估重新运行支持、音乐 v2 编曲计划、workflow 进入行为和结束流程工具、电话筛选参数、告警和服务账户部分更新模型,以及 Studio 音色引用字段。

软件包

iOS SDK

  • v3.2.1 - 新增新加坡数据驻留支持,并为 WebRTC 会话启用 singlePeerConnection。

API

新端点

ElevenAgents

  • 运行对话评估 - POST /v1/convai/conversations/{conversation_id}/analysis/evaluations/run
    • 请求正文使用 RunConversationEvaluationsRequest 重新运行单项评估标准

已更新端点

ElevenAgents

音乐

语音转文本

  • 将语音转换为文本 - POST /v1/speech-to-text
    • 新增可选 use_speaker_library 查询参数(布尔值,默认 false)

音色

  • 列出共享音色 - GET /v1/shared-voices
    • sort 查询参数现在使用明确枚举,默认值为 created_date

Schema 变更

ElevenAgents

  • Workflow 覆盖智能体节点
    • 新增可选 entry_behavior 枚举(generate_immediately、wait_for_user、auto)
  • 系统工具
    • 新增 end_procedure 工具配置和错误状态
  • 转接和交互 schema
    • 转接和转接工具结果新增可选 preserve_client_tts_overrides
    • InteractionBudget 移除 async;新增 5_minutes、10_minutes、1_hour
  • 护栏和 TTS
    • 自定义护栏新增可选 model 和 history_message_count
    • 智能体 TTS 设置新增可选 enable_phoneme_tags
  • 电话
    • SIP 中继模型新增可选 enabled_codecs(MediaCodec 枚举)
  • 记忆和代码工具
    • 新增 LoadableMemoryEntry 和 LoadMemoryEntryToolErrorStatus
  • 智能体测试
    • 运行和重新提交请求的附加测试上限从 1000 提升至 5000
  • 工具 JSON schema 属性
    • 数组属性新增可选 is_omitted

工作区

  • 服务账户
    • API 密钥 PATCH 支持使用 no_update 标记进行部分更新
  • 用量和历史记录
    • 按产品分时用量新增可选 time_zone
    • 历史记录 source 筛选条件新增 Flows

音乐

  • 编曲计划
    • 为 music_v2 新增基于分块的 CompositionPlan、GenerationChunk 和 AudioRefChunk
    • 请求和响应正文支持 anyOf v1 或 v2 计划结构

ElevenCreative Studio

  • 项目音色模型
    • 新增 project_voice_ref_id 作为标准音色引用
    • 响应中保留已弃用的只读 voice_id 镜像