Eleven v4
最富情感表现力的语音模型
Eleven v4 基于全新架构打造,像配音演员一样理解脚本。它知道谁在说话、刚刚发生了什么,以及每句台词应如何呈现。

John - 主持人,戏剧化
Sia - 对话式,英式口音
John - 主持人,戏剧化
John - 主持人,戏剧化丰富的情感与音效
支持超过 90 种语言,以出色的情感表现生成语音,并内置多说话人和音效,为场景增添氛围。

基于全新架构打造
在脚本中直接添加指令
直接在脚本中加入 [laughs]、[whispers] 和 [door slams] 等指令。Eleven v4 对标签序列的遵循比 v3 更可靠,包括音效。
无缝衔接长篇音频
上下文拼接让任意长度脚本的节奏和表达保持稳定。整本有声书从第一页到最后一页,都像一次连续录制。
反复生成,音色依然稳定
一句话重做 1 次或 50 次,依然是同一个人在说话。无论对话、旁白还是其他内容,说话人特征都保持稳定。
使用专业语音克隆
v3 不支持专业语音克隆。Eleven v4 重新支持该功能,并能在所有支持的语言中展现模型完整的情感范围。
Eleven v4 Turbo
介绍 Eleven v4 Turbo专为实时应用和智能体打造
速度最快的实时语音模型,兼具 Eleven v4 的丰富表现力,可通过 API 和 ElevenAgents 使用。Eleven v4 Turbo 的中位推理延迟约为 100 ms,首句语音时间约为 150 ms,并能在长时间交互中保持一致。
来电者几乎察觉不到的响应速度
首句语音中位响应时间仅 150 ms,延迟几乎消失,对话自然流畅。
在真实通话中试听
与由 Eleven v4 Turbo 驱动的智能体通话,了解更多信息。
专为实时对话优化
文本流入,音频流出
LLM 生成文本时即可持续推送,句子尚未完成便开始返回音频。双向流式传输,专为智能体循环打造。
对话速度下的丰富表达
Turbo 具备 Eleven v4 完整的表现力。确认、升级处理和等待提示各有不同表达,不会千篇一律。
每一轮对话保持同一声音
专业语音克隆在两种模型中的表现完全一致,让同一品牌声音从通话第一轮到最后一轮始终如一。
像母语者一样说话
输入日语、西班牙语或葡萄牙语文本,声音便能以地道口音流畅朗读。





从超过 17,500 种声音中挑选



从超过 17,500 种声音中挑选



我们通过确定性控制扩大了 Agentforce Voice 的应用。客户持续反馈,他们信赖它,是因为智能体的每项行动都有依据、受到治理,而不是即兴发挥。这项策略的关键,是在确定性与高品质、高情商语音模型之间取得平衡。Eleven v4 Turbo 正是在这里提高了标准:响应更快、更自然,达到客户期待的水平,让他们能将 Agentforce Voice 用于更多场景。
我们与数百家出版商合作,将新闻内容转为音频,深知语音质量有多重要。与 ElevenLabs 合作以来,许多出版商的互动率和收听时长均有提升。Eleven v4 为出版商提供更多方式,确保这些声音既引人入胜、又令人熟悉,并拥有鲜明的自身特色。
ElevenLabs v4 为语音对话带来全新的自然感。声音不仅更具表现力,也更易于控制,让我们能够打造更丰富、更沉浸的语音体验。
我第一次使用它(Eleven v4)时,它干净又逼真,感觉就像在录音棚里与配音演员一起工作。
我们一直在寻找一款既足够快速、能带来真实对话感,又不牺牲质量的语音模型。Eleven v4 Turbo 是首个同时做到这两点的模型。对于自动化销售 workflow 而言,这标志着开发不再像是一场实验。
决定声音风格在开口之前
每次生成都从声音开始。克隆已有声音、根据描述设计新声音,或借助 IPA 修正特定词语的读法。


语音克隆
用 10 秒音频克隆声音,或训练专业语音克隆,实现近乎完美的匹配。
声音设计
用一句话描述声音即可生成,无需录音或选角。
发音词典
定义姓名、缩写和技术术语的发音。设置一次音标,之后每次生成都会使用。
免费开始创作需要更多时再升级
可通过 API 使用将 Eleven v4 集成到应用
通过 ElevenAPI 使用 Eleven v4 Turbo,构建实时体验和语音智能体。
访问 Eleven v4 和 Eleven v4 Turbo API
通过 REST API、流式端点或 TypeScript 和 Python SDK,为任何产品添加富有表现力的语音。
- 通过一个 model_id 切换模型
- 实时流式输入文本并接收音频
- 在长篇内容生成中保持连贯性


