跳至内容

全新上线:变声器

发布时间

收听收听本文

Voice Changer 最初名为语音转语音。在 AI 语音智能体 的语境中,“语音转语音”也指由单个模型直接处理音频输入和输出的融合式架构。ElevenAgents 平台采用先进的级联式架构。了解更多:级联式模型与融合式模型

Voice Changer

我们已将 Voice Changer 添加到语音合成中。Voice Changer 是一款变声工具,可将一种声音的录音转换为另一种声音,同时保留原始演绎。这意味着录音中的情感、时机、节奏和发音都会传递到输出音色中。

这让你获得了仅靠 文本转语音 提示词不一定能实现的控制力。主要有两种使用方式。

让音色表达更多情感。 并非所有音色都能同样有效地响应文本转语音提示词中的情感指令。Voice Changer 让你录制或上传极具表现力的语音,并在另一种音色中复现这种情感范围。如果你希望专业旁白听起来更温暖,或让儿童读物角色更加活泼,可以亲自演绎,再由 Voice Changer 将这种演绎转移到目标音色。

微调语音演绎。 我们的文本转语音模型通常能很好地处理语调。但当你需要精准控制某句话的表达方式——重音落在哪里、停顿如何呈现、节奏感如何——Voice Changer 可以让你用自己的声音示范,再将这种演绎应用到任意选定的音色。等我们将 Voice Changer 直接集成到 Studio 后,这会更加实用;但目标始终不变:让你精准控制输出。

以下是一位社区成员的演示:

研究

要将源语音转换为目标语音,需要用目标语音的特征来呈现源语音的内容。可以类比换脸:应用将两张脸融合,把一个人的特征呈现在另一个人的映射结构中。

具体做法是提取一张人脸图像并映射其属性。下例中的标记正是如此——它们界定了渲染另一张脸的范围。

Comparison of facial recognition and facial mapping technology.
Audio waveform with a corresponding speech transcription in a visual format.

语音转换的关键在于,使用目标语音的音素来呈现源语音内容。但这与换脸示例一样存在取舍:用于映射一张脸属性的标记越多,对映射到其中的另一张脸施加的约束就越多。标记越少,约束也越少。

语音转换也是如此。越优先考虑目标语音,就越可能与源语音不同步;但优先级不够,又可能丢失原语音的重要特征。举例来说,如果要用轻声细语的音色来呈现某人愤怒大喊的录音,就会很棘手。过于优先保留源语音的情感,就会失去轻声说话的感觉;过于强调轻声的语音模式,又会失去源语音的情感张力。

产品与近期更新

预设音色变更

我们正在调整语音合成中默认提供的音色。部分音色将退役并由新音色替代,未来几周还计划新增超过 20 个音色。

我们还将开始在 UI 中说明每个音色预计可用多久。整个 12 月期间,我们将升级音色分享和使用补偿功能,以丰富音色选择。更多详情即将公布。

Eleven Turbo v2 与 uLaw 8kHz 格式

Turbo v2 是团队历经数月研究的成果。它专为实时交互设计,但适用于任何使用场景。它还支持用于 IVR 系统的标准 (m)uLaw 8kHz 格式。

Studio 的标准化与元数据功能

Studio 现已支持行业标准的 有声书 提交指南,包括增益调整和动态压缩。还可以直接在 Studio 项目中嵌入元数据(ISBN、作者和标题)。

发音词典

这是呼声最高的功能之一。上个月,我们为英语模型新增了 SSML 标签支持,可通过 IPA 和 CMU 词典指定发音。现在,我们已在 Studio UI 中推出发音词典支持,可上传使用 IPA、CMU 或词语替换(别名)指定发音的文件。词典文件采用行业标准的开放式 .PLS 词汇文件格式

Turbo v2 English 目前支持 IPA 和 CMU。所有模型和语言都支持词语替换。完整文档见 此处

Upload area for a Lexicon file with instructions to click or drag and drop a .pls/.txt/.xml file, size limit 1.5MB.
Pronunciation diary

如有任何反馈,欢迎通过 Discord 联系我们!

试用 Voice Changer

按你想要的方式表达,再以截然不同的音色呈现,同时完全掌控演绎效果。捕捉耳语、笑声、口音和细微的情感线索。

随心表达,体验完全不同的声音,全面掌控表现力。可捕捉耳语、笑声、口音和细微情感。

相关内容

用高质量 AI 音频创作