推出 Eleven v4认识 Eleven v4:迄今情感表现最丰富的模型。 Creator+ 套餐含 3 倍点数优惠,截止至 10 月 12 日

跳至内容

推出 Eleven v4:迄今情感最丰富的模型

发布时间
最近更新

收听收听本文

一句话的含义会因说法不同而大不相同。“我需要你保持冷静”这句话,若是医生温和地对受惊的患者说,和游戏角色跳入战场前对小队高喊,听起来应截然不同。

今天,我们发布 Eleven v4,这是迄今情感表现力最强的文本转语音模型,以及其低延迟版本 Eleven v4 Turbo。

Eleven V4.

获 Artificial Analysis 评为第 1 名1,在与竞品模型的盲测一对一对比中,约 75% 的听众更偏好它2。Eleven v4 专为理解语气、节奏、情绪、角色和上下文而设计。它能在保持说话者身份特征的同时,生成戏剧化、温柔、紧迫、诙谐或自然交谈式的语音。更自然的多说话者互动,让对话更具即时回应感,而非由各自独立的台词拼接而成。说话者会结合对话上下文做出回应,生成更自然的对话和角色互动。

Eleven v4 wins 65%–81% of blind head-to-head TTS preference tests.

为性能打造的全新架构

基于全新架构打造,Eleven v4 是我们情感表现力最强的 文本转语音 模型,获 Artificial Analysis 评为第 1 名1。Eleven v4 Turbo 将同样的技术带入智能体等低延迟场景。其推理延迟中位数约为 100ms,响应速度比两人交谈时的平均停顿更快。

两款模型都能生成富有情感、而非机械生硬的语音。整体音频保真度也更高,输出更干净、更自然。

早期文本转语音模型能朗读文本,但 Eleven v4 赋予语音更自然的情感深度。模型可以理解预期语气、语音节奏、文字风格和文本上下文,生成能引起情感共鸣的语音。

[excited, happy] Big news, everyone. Our summer menu drops this Friday. And yes, the mango sticky rice is finally back.
0:00
[sleepy drowsy voice] Mmm, five more minutes. [yawning] I promise I'll get up right after this dream finishes.
0:00

用户还能精细控制输出,用自然语言描述一句话该如何表达。也可以借助内联标签添加具体指令,例如特定短语的说法、应传达的情绪,甚至音效,如 [laughs]、[said angrily in French accent]、[light rain] 或 [phone buzzing]。与以往模型相比,Eleven v4 能更准确地遵循这些音频标签和提示词,因此你描述的表达效果就是最终生成的效果。这让旁白指导、角色及其对话塑造,以及其他重视表达方式的场景都更轻松。

ElevenLabs 开发者文档 详细介绍了完整的标签语法,以及如何通过 API 应用这些标签。对国际音标(IPA)音素的支持也显著提升,自定义发音更加可靠。

Eleven v4 还提升了多说话者之间的一致性和动态对话表现。通过一种新的说话者身份捕捉方法,Eleven v4 能保留每种音色的独特特征。在智能体对话、有声书或广告中,也能保持语音一致。由于模型理解整个场景的上下文,它能生成自然的对话,让说话者回应刚刚说过的内容,而不是拼接孤立的台词。

面向低延迟场景的 Turbo 模型

高质量语音模型往往生成较慢,用户不得不在速度和富有表现力的语音智能体之间取舍。许多人选择了能力出色但语调单一的智能体;对于只想解决问题的焦急客户而言,这类智能体可能显得很机械。

Eleven v4 Turbo 兼具速度与情感,首次出声时间中位数约为 150ms3,可将强大的智能体部署到众多行业:从医疗领域能准确发音医学术语、语气温暖且令人安心的智能体,到游戏中语速快、善用俚语来娱乐玩家的智能体。

Median time to first speech: Eleven v4 Turbo is fastest at 150ms, versus 262–814ms.

Eleven v4 Turbo 专为与 ElevenLabs 的对话式智能体平台 ElevenAgents 协同工作而打造。其他智能体构建平台会拼接不同供应商的模型和软件,用户难以针对自身场景优化或改进模型输出。ElevenLabs 的研究与工程团队将 Eleven v4 Turbo 和 ElevenAgents 作为一个系统协同优化,带来更具表现力、更可靠且低延迟的智能体。

一种音色,多种语言

我们的沟通方式会因情境、地点,甚至一天中的时段而变化。要在多种语言中构建与之相符、富有表现力的语音,仍是 AI 音频领域最难的挑战之一。

Eleven v4 在这些方面都有提升,改进不止于模型对短语的发音。Eleven v4 能更好地捕捉不同语言中的节奏、情绪和表达方式,帮助创作者生成符合语言和语境的自然语音。例如,你在日本与陌生老人说话的方式,与在意大利时会很不一样。

Eleven v4 和 Eleven v4 Turbo 均支持超过 90 种语言。现在,用一种语言录制的音色也能流利说出其他任何语言:采用母语者口音,同时保留原始身份特征。对口音的遵循明显强于以往,因此生成过程中音色不会再逐渐偏回原始口音。

加泰罗尼亚语

Sovint caminem per la vida amb la mirada fixada en l'horitzó, preocupats pel demà, sense adonar-nos que el miracle real està passant just sota els nostres peus.
0:00

西班牙语

El viento susurra historias olvidadas entre las hojas secas del parque. La ciudad aún duerme bajo un manto de neblina dorada, ajena al bullicio que pronto inundará sus calles. Un viejo farol parpadea por última vez antes de ceder su lugar a los primeros rayos del sol. En este preciso instante, el tiempo parece detenerse.
0:00

对于配音和本地化,这意味着你选定的品牌声音——无论是合作的知名演员,还是最符合公司风格的语调——都能在 Eleven v4 支持的任何语言中表现出色。

更真实、一致的语音克隆

Eleven v4 和 Eleven v4 Turbo 的语音克隆更加真实、强大且一致,与原始源音色的说话者相似度显著提升。现在,Instant Voice Clones 仅需 10 秒音频即可高保真捕捉音色。

真实语音

Hey, thanks so much for holding. Um, so I've got your account pulled up now and it does look like the charge did go through twice on the eleventh which, yeah, definitely shouldn't have happened. Let me get that refund started for you right now.
0:00

Eleven v4

Hey, thanks so much for holding. Um, so I've got your account pulled up now, and it does look like the charge did go through twice on the 11th, which, yeah, definitely shouldn't have happened. Um, let me get that refund started for you right now.
0:00

Eleven v4 还能在多次生成、对话、旁白和重新生成的台词中,更可靠地保留说话者身份特征。这意味着在长篇项目中,角色、旁白和克隆音色能在整个作品中保持一致。Eleven v4 还新增对专业语音克隆(PVC)的支持,满足最高保真度的克隆需求。

请求拼接——将多次生成串联为更长的内容——在 Eleven v4 中也显著更加可靠,提升了在 ElevenLabs Studio 和 ElevenLabs Reader App 中的使用体验。

亲自听听差异

Eleven v4 和 Eleven v4 Turbo 凝聚了我们最新的表现力语音生成研究成果。它们专为表达方式与文字本身同样重要的内容而打造,包括有声书、角色表演、旁白配音、配音,以及对话式智能体本地化。

两款模型现已在 ElevenAgents、ElevenCreative 和 ElevenAPI 中提供。创建免费账户,立即使用 Eleven v4 或 Eleven v4 Turbo 开始生成。

  1. Artificial Analysis,Provider Voice Arena 排行榜,2026 年 9 月
  2. 基于 2026 年 9 月针对 Cartesia Sonic 3.6、Inworld TTS-2、Google Gemini 3.8 Flash-Lite TTS 和 Google Gemini 3.8 Flash TTS 开展的盲测用户偏好测试。每组测试中,评测者在不知道来源的情况下试听 Eleven v4 和一款竞品生成的同一句文本,并判断哪一个表现力更强、听起来更自然;平局按半票计算。
  3. 从请求发出到可听到语音的中位时间。2026 年 9 月,使用相同脚本和默认设置,与 Cartesia Sonic 3.6、xAI TTS、Google Gemini 3.8 Flash-Lite TTS 和 OpenAI GPT-4o mini TTS 进行测量;所有系统均已测量并剔除网络延迟。Eleven v4 Turbo 通过 WebSocket 流式传输。

相关内容

用高质量 AI 音频创作