Eleven v4

我们最新、最先进的文本转语音模型。

Eleven v4 是我们最新、最先进的文本转语音模型,也是新一代模型中的首款产品。与 Eleven v3 相比,它提升了输出质量、音色准确性、一致性、情感、表达、音频标签和语言覆盖范围。

总体而言,Eleven v4 是对 Eleven v3 的全面升级,几乎在所有情况下都能带来更好的效果。强烈建议切换到 v4,并使用自己的音色和内容进行测试,亲自感受差异。尽管少数边缘情况可能更适合其他选择,但对大多数用户来说,v4 都是更好的选择。

有关标签、标点符号和对话提示词编写,请参阅 Eleven v4 提示词编写。

语音克隆

Eleven v4 大幅提升了语音克隆准确性。克隆音色能够比任何以往模型都更忠实地捕捉源音色的特征——音质、节奏和表达方式。

Eleven v4 中的即时语音克隆(IVC)比以往更准确。它能更忠实地捕捉源音色的定义性特征,让你能根据一小段音频样本快速创建逼真的克隆音色。

即时语音克隆在 Eleven v4 中获得了显著升级,整体准确性明显提升。如果还未尝试,现在正适合用自己的音频进行测试。

Eleven v4 完全支持专业语音克隆(PVC)。它同样受益于音色准确性的提升,可为需要最高一致性和控制力的工作流程提供更忠实的源音色复现。

Eleven v4 的专业语音克隆支持目前正逐步向所有用户推出,预计未来几天内可用。

由于准确性显著提升,Eleven v4 的声音可能与 Eleven v3 有很大差异。Eleven v3 为 Eleven v4 奠定了基础,尤其注重表达和准确性;Eleven v4 则在此基础上大幅提升了音色准确性。因此,Eleven v4 旨在更忠实地捕捉源音色,但你仍可能更喜欢音色在 Eleven v3 中的表现。准确性与个人偏好并不总是一回事,因此建议使用自己的内容对比两个版本,为具体使用场景选择最适合的版本。

Eleven v4 能更忠实地再现源音色的特征,包括口音、表达、音量及其他独特特质,因此源录音的质量比以往更加重要。清晰、干净的训练音频有助于 Eleven v4 准确捕捉音色,不会引入不需要的声音或特征。背景噪音、失真或其他录制问题都可能影响结果。

我们仍在探索 Eleven v4 的最佳使用方式。目前来看,它更擅长捕捉细微的音频特征,尤其是在训练音频量较大时,例如专业语音克隆。随着继续测试如何通过更多样的数据集控制模型,我们关于使用多样化训练数据的建议可能会有所调整。目前建议训练音频保持单一说话风格,Eleven v4 应能比早期模型更好地捕捉这种风格。

原生口音处理

这是 Eleven v4 相比所有旧模型最大的变化之一,值得充分了解。

当生成语言与参考音色的语言一致时,原始口音会与之前一样完整保留。

当生成语言不同于参考音色的语言时,Eleven v4 会生成目标语言中流畅、自然的语音,而不是保留参考音色原始语言的口音。

实际使用中:如果克隆一位韩语说话者的声音并生成英语,Eleven v4 会生成自然流畅的英语,而非带有韩语口音的英语。这让每种音色都能用于所有支持的语言,尤其适合配音、多语言内容,以及需要通过单一音色服务不同语言用户的语音智能体。

如果工作流程依赖于让音色在其他语言中保留原生口音,请在迁移前直接使用 Eleven v4 测试这一行为——这是跨语言生成方式的有意调整,并非 bug。

不过,这项新功能仍在持续微调。我们正在探索将其改为可切换选项,而非始终启用。这仍是一项研究项目,因此目前尚无时间表或更多信息可提供。

模型变体

Eleven v4 提供两种变体,可根据使用场景选择质量与速度之间的适当平衡:

  • Eleven v4(eleven_v4)——我们质量最高的模型,适合内容创作、有声书、角色旁白配音,以及任何将质量放在首位的使用场景。
  • Eleven v4 Turbo(eleven_v4_turbo)——在保持极高质量的同时提供出色的低延迟,专为对话式智能体和交互式语音体验等实时场景打造。

两种变体均使用两项音色设置:稳定性和相似度。

稳定性控制多次生成之间表达的一致程度。较低的值可带来更具表现力、更多变化的表达;较高的值则让表达更接近固定基准。

相似度控制输出与参考音色的贴合程度。较高的值会更严格地遵循参考音色,但可能牺牲部分自然度。

Eleven v4 不提供风格和速度滑块,也不支持 SSML。

音频标签(例如 [whispering]、[shouting]、[laughing])可让你精细控制表达方式,而 Eleven v4 对它们的细微处理能力超越以往模型。目前还不算完美,我们会持续迭代,提升模型遵循标签指令的可靠性——这是持续投入的重点领域,效果也会不断改善。

展示

这些示例均为原始音频,未进行大量后期处理:没有均衡、压缩、归一化、齿音处理、爆破音去除或类似处理。如果听到任何反复出现的问题,例如削波、爆破音、均衡不均或音量跳变,它们很可能存在于该音色的训练数据中。Eleven v4 模型只是将这些问题捕捉了下来,因为它的准确性很高,即使是缺陷也会捕捉。我们保留了未经处理的音频,以便你听到模型生成的原始效果。

语音克隆准确性

每个示例均以声音库预览开始。随后,我们选取一段文本,分别使用该音色的即时语音克隆在 Eleven v3 和 Eleven v4 中生成语音。

这不是完美的对比。Eleven v4 还支持专业语音克隆,匹配效果可以更进一步。不过,为了让对比更公平,我们在 Eleven v3 和 Eleven v4 中均使用即时语音克隆。

这些示例展示了模型捕捉到多少原始音色特征。需要注意的是,这还包括音频中的均衡、质量、音量及其他细节和瑕疵,例如爆破音、刺耳的齿音和音量波动。

请依次试听预览、Eleven v3 和 Eleven v4。

音色 NfUrCNRReUL9RXS9upG1。

"Brother... I must cross the sea, though I'd rather stay beside you. If the gods will it, we'll see each other again. Until then, when the sun sinks beyond the waves, know that I'll be looking toward home."
He clasped my forearm beneath the pale morning sky. I held on a moment longer, then watched him turn toward the waiting ship.

音色 HBDoL4wkcalemIO0nUAu。

"When I was young, I thought the mountain stood because it was strong. Then winter came, and the mountain wore its crown of snow without complaint. Spring followed, and it let every stream run free.
"So remember, traveler: strength is not always holding fast. Sometimes it is knowing what to carry, and what the season asks you to release."

配音表演

这些是 Eleven v4 的生成结果。文本中的音频标签会控制表达方式。

音色 EkK5I93UQWFDigLMpZcX。

[casual] "You're looking for work, eh? Hmm, I might have something for you. Just outside the valley, there's a group of wild horned boars I need you to take care of - nasty little beasts. The village would be grateful if you could get that done, and I'll make it worth your while."
------------
[annoyed] [under his breath] "Oh, you again... [sigh] Did you take care of that little problem I mentioned earlier? No, not yet? All right, off you go. I don't have time to chitchat. I'm busy standing here... handing out quests."
------------
[ecstatic] "You did it, you crazy bastard! [dismissive] Not that I didn't have any faith in you, but you wouldn't be the first one to fail. Yes, yes, I know. One of them might have been a little bigger than the others. But hey, you survived. You got it done. You helped the village."

音色 t7VaN65ClS2VrEUwk1nR。

[quietly curious] "Hmm… that mark. I haven't seen one like it in years. Where did you get it? Oh, you gonna make me guess? [giggle]"
------------
[measured] "No need to explain, if you'd rather not. This town has a way of leaving its mark on people. [soft chuckle] Usually not quite so literally."
------------
[lower, thoughtful] "Keep it covered when you can. There are still a few who remember what it means, and they may not ask as politely as I have."

有声书

这是 Eleven v4 的旁白。标签设定了场景的节奏和基调。

音色 KHRvDizAHFVPzoSehNY6。

[Quiet, measured narration] The moonlit training court lay beneath the keep, its stone walls silvered with frost. Beyond the battlements, a dragon's distant call rolled over the mountains.
Sir Alden lifted his blunted practice sword. "Ready?"
Bram, his broad shoulders wrapped in a travel-worn cloak, studied the wooden shield strapped to his arm. "I've faced worse odds."
[Pause, dry amusement] "You lost to a turnip cart yesterday," Sir Alden said.
"It was a very determined cart," Bran muttered
[Gradually building energy] They circled across the frost-dusted stones. One step. Another. Alden watched Bram's hands; Bram watched the faint blue glow gathering along Alden's blade. The air between them prickled with harmless magic.
[Quick, light, playful pace] Bram charged. Alden slipped aside. Clack! Wood met steel. Bram turned, his cloak flaring, and swung wide. Alden ducked beneath it. Bram's boot skidded on the frost; he windmilled, caught himself, and bowed as if he'd meant to do that all along.
"Magnificent," Alden said.
"I was giving you time to admire the cloak," Bran retorted.

模型将持续演进

Eleven v4 正在积极持续开发中。随着我们在发布后继续训练和改进模型,其行为可能会随质量提升而逐渐变化。建议随着模型演进定期重新测试使用场景,我们也会在重要更新推出时分享相关信息。

常见问题

Eleven v4 支持南非荷兰语、阿姆哈拉语、阿拉伯语、亚美尼亚语、阿萨姆语、阿斯图里亚斯语、阿塞拜疆语、白俄罗斯语、孟加拉语、波斯尼亚语、保加利亚语、缅甸语、粤语、加泰罗尼亚语、宿务语、克罗地亚语、捷克语、丹麦语、荷兰语、英语、爱沙尼亚语、菲律宾语、芬兰语、法语、富拉语(Pulaar)、加利西亚语、格鲁吉亚语、德语、希腊语、古吉拉特语、豪萨语、希伯来语、印地语、匈牙利语、冰岛语、印度尼西亚语、意大利语、日语、卡纳达语、哈萨克语、韩语、吉尔吉斯语、老挝语、林加拉语、立陶宛语、卢干达语、卢森堡语、马其顿语、马来语、马拉雅拉姆语、马耳他语、普通话、毛利语、马拉地语、蒙古语、尼泊尔语、挪威博克马尔语、奥克语、奥里亚语、普什图语、波斯语、波兰语、葡萄牙语(巴西)、旁遮普语、罗马尼亚语、俄语、塞尔维亚语、绍纳语、信德语、斯洛伐克语、斯洛文尼亚语、索马里语、索拉尼库尔德语、西班牙语(拉丁美洲)、斯瓦希里语、瑞典语、塔吉克语、泰米尔语、泰卢固语、泰语、土耳其语、乌克兰语、乌尔都语、乌兹别克语、越南语、威尔士语和沃洛夫语。

某些语言的流畅度高于其他语言,但总体而言,Eleven v4 对其中绝大多数语言的处理效果都很好。

当参考音色和生成语音使用相同语言时,音色的口音会被保留。例如,如果克隆一位使用特定英语口音说英语的人,并生成英语语音,该口音将被保留。

默认情况下,当生成语言不同于参考音色的语言时,Eleven v4 会优先生成目标语言中流畅、自然的语音,而不是保留参考口音。你可以尝试使用音频标签引导口音或表达风格,但结果可能有所不同,因此请测试具体音色和使用场景。

总体而言,Eleven v4 比 Eleven v3 更准确地再现源音色的特征,包括音质、节奏、表达方式和其他习惯。因此,Eleven v4 克隆音色通常会更接近源音色,也可能与其 Eleven v3 版本有明显差异。

Eleven v4 同时支持即时语音克隆和专业语音克隆。

使用即时语音克隆时,无需单独训练即可创建音色。上传一段通常为 1 到 2 分钟的短样本,数秒内即可获得可用音色。

专业语音克隆的使用方式与早期模型相同。它会使用更长的一组录音训练专用模型。

如果已有专业语音克隆并希望在 Eleven v4 上训练它,请打开 我的音色,在列表中找到该音色并将鼠标悬停其上。你会看到该音色可用的模型。点击 Eleven v4 旁边的加号按钮即可开始微调。

声音设计音色可用于 Eleven v4,但其表现力或音质可能不如早期模型。