推出 Eleven v4认识 Eleven v4:迄今情感表现最丰富的模型。 Creator+ 套餐含 3 倍点数优惠,截止至 10 月 12 日

跳至内容

全新上线:变声器

发布时间

收听收听本文

Voice Changer 最初名为语音转语音。在 AI 语音智能体的语境中,“语音转语音”也指由单个模型直接处理音频输入和输出的融合式架构。Eleven Agents 平台采用先进的级联架构。了解更多:级联模型与融合模型。

变声器

我们已将 Voice Changer 添加到语音合成中。Voice Changer 是一款声音转换工具,可将一种声音的录音转换为仿佛由另一种声音说出的效果,同时保留原始演绎。这意味着录音中的情感、时机、节奏和发音都会传递到输出音色中。

这让你获得仅靠 文本转语音 提示词不一定能实现的控制力。主要有两种使用方式。

让声音表达更多情感。 并非所有音色都能通过文本转语音提示词同样出色地响应情感指引。Voice Changer 支持录制或上传表现力丰富的语音,并用不同音色复现这种 情感范围。如果需要让专业旁白更温暖,或让儿童读物角色更活泼,你可以亲自演绎,再让 Voice Changer 将其转换到目标音色。

微调语音演绎。 我们的文本转语音模型通常可直接很好地处理语调。但当你需要精准控制特定短语的表达方式——重音落在哪里、停顿如何呈现、节奏感如何——Voice Changer 可让你用自己的声音示范,再将这种演绎应用到任意选定的音色。待我们将 Voice Changer 直接集成到 Studio 后,这会更加实用,但目标不变:让你精准控制输出效果。

以下是一位社区成员的操作演示:

研究

要将源语音转换为目标语音,需要用目标语音的特征来表达源语音内容。一个有用的类比是换脸:应用将两张脸融合,把一个人的特征呈现在另一个人的映射结构中。

实现这一点的方法是提取人脸图像并映射其属性。下例中的标记正是如此——它们界定了另一张脸的渲染范围。

Comparison of facial recognition and facial mapping technology.
Audio waveform with a corresponding speech transcription in a visual format.

声音转换的关键,是使用目标语音的音素来渲染源语音内容。但这与换脸示例一样存在取舍:用于映射一张脸属性的标记越多,对映射到其中的人脸限制就越多。标记越少,限制也越少。

声音转换也是如此。越优先考虑目标语音,就越可能与源语音不同步;但优先程度不足,又可能丢失让该语音独具特征的大部分元素。例如,若要用轻声细语的音色来渲染某人愤怒呐喊的录音,就会遇到难题。过度优先保留源语音的情感,就会失去轻声说话的感觉;过度强调轻声语音模式,又会失去源语音的情感张力。

产品与近期更新

预设音色变更

我们正在调整语音合成中的默认音色。将停用少量音色并以新音色替代,未来几周计划新增超过 20 个音色。

我们还会在 UI 中提供每个音色预计可用时长的信息。整个 12 月,我们将改进声音分享和使用补偿功能,以丰富音色选择。更多详情即将公布。

Eleven Turbo v2 与 uLaw 8kHz 格式

Turbo v2 是团队历经数月研究的成果。它专为实时交互设计,但适用于任何使用场景。同时支持用于 IVR 系统的标准(m)uLaw 8kHz 格式。

Studio 中的标准化与元数据

Studio 现已支持行业标准的 有声书 提交规范,包括增益调整和动态压缩。还可直接在 Studio 项目中嵌入元数据(ISBN、作者和标题)。

发音词典

这是最受期待的功能之一。上个月,我们为英语模型新增了 SSML 标签支持,可通过 IPA 和 CMU 词典指定发音。现已在 Studio UI 中推出 发音词典 支持,可上传使用 IPA、CMU 或词语替换(别名)指定发音的文件。词典文件采用行业标准的开放式 .PLS 词典文件格式。

Turbo v2 English 目前支持 IPA 和 CMU。所有模型和语言均支持词语替换。完整文档见 此处。

Upload area for a Lexicon file with instructions to click or drag and drop a .pls/.txt/.xml file, size limit 1.5MB.
Pronunciation diary

如有任何反馈,欢迎随时通过 Discord 联系我们!

试用 Voice Changer

随心表达,用截然不同的音色呈现,同时完全掌控演绎效果。捕捉耳语、笑声、口音和细微的情感变化。

随心表达,体验完全不同的声音,全面掌控表现力。可捕捉耳语、笑声、口音和细微情感。

相关内容

用高质量 AI 音频创作