Eleven v4
我们最新、最先进的文本转语音模型。
Eleven v4 是我们最新、最先进的文本转语音模型,也是新一代模型中的首款产品。与 Eleven v3 相比,它提升了输出质量、音色准确性、一致性、情感、表达、音频标签和语言覆盖范围。
总体而言,Eleven v4 是对 Eleven v3 的全面升级,几乎在所有情况下都能带来更好的效果。强烈建议切换到 v4,并使用自己的音色和内容进行测试,亲自感受差异。尽管少数边缘情况可能更适合其他选择,但对大多数用户来说,v4 都是更好的选择。
有关标签、标点符号和对话提示词编写,请参阅 Eleven v4 提示词编写。
语音克隆
Eleven v4 大幅提升了语音克隆准确性。克隆音色能够比任何以往模型都更忠实地捕捉源音色的特征——音质、节奏和表达方式。
Eleven v4 中的即时语音克隆(IVC)比以往更准确。它能更忠实地捕捉源音色的定义性特征,让你能根据一小段音频样本快速创建逼真的克隆音色。
即时语音克隆在 Eleven v4 中获得了显著升级,整体准确性明显提升。如果还未尝试,现在正适合用自己的音频进行测试。
Eleven v4 完全支持专业语音克隆(PVC)。它同样受益于音色准确性的提升,可为需要最高一致性和控制力的工作流程提供更忠实的源音色复现。
Eleven v4 的专业语音克隆支持目前正逐步向所有用户推出,预计未来几天内可用。
由于准确性显著提升,Eleven v4 的声音可能与 Eleven v3 有很大差异。Eleven v3 为 Eleven v4 奠定了基础,尤其注重表达和准确性;Eleven v4 则在此基础上大幅提升了音色准确性。因此,Eleven v4 旨在更忠实地捕捉源音色,但你仍可能更喜欢音色在 Eleven v3 中的表现。准确性与个人偏好并不总是一回事,因此建议使用自己的内容对比两个版本,为具体使用场景选择最适合的版本。
Eleven v4 能更忠实地再现源音色的特征,包括口音、表达、音量及其他独特特质,因此源录音的质量比以往更加重要。清晰、干净的训练音频有助于 Eleven v4 准确捕捉音色,不会引入不需要的声音或特征。背景噪音、失真或其他录制问题都可能影响结果。
我们仍在探索 Eleven v4 的最佳使用方式。目前来看,它更擅长捕捉细微的音频特征,尤其是在训练音频量较大时,例如专业语音克隆。随着继续测试如何通过更多样的数据集控制模型,我们关于使用多样化训练数据的建议可能会有所调整。目前建议训练音频保持单一说话风格,Eleven v4 应能比早期模型更好地捕捉这种风格。
原生口音处理
这是 Eleven v4 相比所有旧模型最大的变化之一,值得充分了解。
当生成语言与参考音色的语言一致时,原始口音会与之前一样完整保留。
当生成语言不同于参考音色的语言时,Eleven v4 会生成目标语言中流畅、自然的语音,而不是保留参考音色原始语言的口音。
实际使用中:如果克隆一位韩语说话者的声音并生成英语,Eleven v4 会生成自然流畅的英语,而非带有韩语口音的英语。这让每种音色都能用于所有支持的语言,尤其适合配音、多语言内容,以及需要通过单一音色服务不同语言用户的语音智能体。
如果工作流程依赖于让音色在其他语言中保留原生口音,请在迁移前直接使用 Eleven v4 测试这一行为——这是跨语言生成方式的有意调整,并非 bug。
不过,这项新功能仍在持续微调。我们正在探索将其改为可切换选项,而非始终启用。这仍是一项研究项目,因此目前尚无时间表或更多信息可提供。
模型变体
Eleven v4 提供两种变体,可根据使用场景选择质量与速度之间的适当平衡:
- Eleven v4(
eleven_v4)——我们质量最高的模型,适合内容创作、有声书、角色旁白配音,以及任何将质量放在首位的使用场景。 - Eleven v4 Turbo(
eleven_v4_turbo)——在保持极高质量的同时提供出色的低延迟,专为对话式智能体和交互式语音体验等实时场景打造。
两种变体均使用两项音色设置:稳定性和相似度。
稳定性控制多次生成之间表达的一致程度。较低的值可带来更具表现力、更多变化的表达;较高的值则让表达更接近固定基准。
相似度控制输出与参考音色的贴合程度。较高的值会更严格地遵循参考音色,但可能牺牲部分自然度。
Eleven v4 不提供风格和速度滑块,也不支持 SSML。
音频标签(例如 [whispering]、[shouting]、[laughing])可让你精细控制表达方式,而 Eleven v4 对它们的细微处理能力超越以往模型。目前还不算完美,我们会持续迭代,提升模型遵循标签指令的可靠性——这是持续投入的重点领域,效果也会不断改善。
展示
这些示例均为原始音频,未进行大量后期处理:没有均衡、压缩、归一化、齿音处理、爆破音去除或类似处理。如果听到任何反复出现的问题,例如削波、爆破音、均衡不均或音量跳变,它们很可能存在于该音色的训练数据中。Eleven v4 模型只是将这些问题捕捉了下来,因为它的准确性很高,即使是缺陷也会捕捉。我们保留了未经处理的音频,以便你听到模型生成的原始效果。
语音克隆准确性
每个示例均以声音库预览开始。随后,我们选取一段文本,分别使用该音色的即时语音克隆在 Eleven v3 和 Eleven v4 中生成语音。
这不是完美的对比。Eleven v4 还支持专业语音克隆,匹配效果可以更进一步。不过,为了让对比更公平,我们在 Eleven v3 和 Eleven v4 中均使用即时语音克隆。
这些示例展示了模型捕捉到多少原始音色特征。需要注意的是,这还包括音频中的均衡、质量、音量及其他细节和瑕疵,例如爆破音、刺耳的齿音和音量波动。
请依次试听预览、Eleven v3 和 Eleven v4。
音色 NfUrCNRReUL9RXS9upG1。
音色 HBDoL4wkcalemIO0nUAu。
配音表演
这些是 Eleven v4 的生成结果。文本中的音频标签会控制表达方式。
音色 EkK5I93UQWFDigLMpZcX。
音色 t7VaN65ClS2VrEUwk1nR。
有声书
这是 Eleven v4 的旁白。标签设定了场景的节奏和基调。
音色 KHRvDizAHFVPzoSehNY6。
模型将持续演进
Eleven v4 正在积极持续开发中。随着我们在发布后继续训练和改进模型,其行为可能会随质量提升而逐渐变化。建议随着模型演进定期重新测试使用场景,我们也会在重要更新推出时分享相关信息。
常见问题
Eleven v4 支持哪些语言?
Eleven v4 支持南非荷兰语、阿姆哈拉语、阿拉伯语、亚美尼亚语、阿萨姆语、阿斯图里亚斯语、阿塞拜疆语、白俄罗斯语、孟加拉语、波斯尼亚语、保加利亚语、缅甸语、粤语、加泰罗尼亚语、宿务语、克罗地亚语、捷克语、丹麦语、荷兰语、英语、爱沙尼亚语、菲律宾语、芬兰语、法语、富拉语(Pulaar)、加利西亚语、格鲁吉亚语、德语、希腊语、古吉拉特语、豪萨语、希伯来语、印地语、匈牙利语、冰岛语、印度尼西亚语、意大利语、日语、卡纳达语、哈萨克语、韩语、吉尔吉斯语、老挝语、林加拉语、立陶宛语、卢干达语、卢森堡语、马其顿语、马来语、马拉雅拉姆语、马耳他语、普通话、毛利语、马拉地语、蒙古语、尼泊尔语、挪威博克马尔语、奥克语、奥里亚语、普什图语、波斯语、波兰语、葡萄牙语(巴西)、旁遮普语、罗马尼亚语、俄语、塞尔维亚语、绍纳语、信德语、斯洛伐克语、斯洛文尼亚语、索马里语、索拉尼库尔德语、西班牙语(拉丁美洲)、斯瓦希里语、瑞典语、塔吉克语、泰米尔语、泰卢固语、泰语、土耳其语、乌克兰语、乌尔都语、乌兹别克语、越南语、威尔士语和沃洛夫语。
某些语言的流畅度高于其他语言,但总体而言,Eleven v4 对其中绝大多数语言的处理效果都很好。
克隆音色会保留口音吗?
当参考音色和生成语音使用相同语言时,音色的口音会被保留。例如,如果克隆一位使用特定英语口音说英语的人,并生成英语语音,该口音将被保留。
能否让音色用原始口音说另一种语言?
默认情况下,当生成语言不同于参考音色的语言时,Eleven v4 会优先生成目标语言中流畅、自然的语音,而不是保留参考口音。你可以尝试使用音频标签引导口音或表达风格,但结果可能有所不同,因此请测试具体音色和使用场景。
Eleven v4 克隆音色会和 Eleven v3 版本听起来一样吗?
总体而言,Eleven v4 比 Eleven v3 更准确地再现源音色的特征,包括音质、节奏、表达方式和其他习惯。因此,Eleven v4 克隆音色通常会更接近源音色,也可能与其 Eleven v3 版本有明显差异。
需要训练 Eleven v4 吗?
应该在 Eleven v4 中使用声音设计吗?
声音设计音色可用于 Eleven v4,但其表现力或音质可能不如早期模型。