推出 Eleven v4认识 Eleven v4:迄今情感表现最丰富的模型。 Creator+ 套餐含 3 倍点数优惠,截止至 10 月 12 日

跳至内容

Eleven 亮相 INTERSPEECH 2022

发布时间

收听收听本文

参会回顾

我们刚从今年的 INTERSPEECH 会议归来。这是迄今展示过去几个月的研发成果并收集反馈的最佳机会。

能向领域内顶尖同行学习、交流想法,并在此过程中建立未来合作关系,令我们倍感欣喜。我们遇到了许多优秀初创团队,他们与我们一样专注于语音克隆、语音合成(TTS)和语音转换(VC),例如 Supertone 和 LOVO。我们也很高兴能与 Meta、Google 等知名公司交流,探讨开发 TTS 和 VC 软件背后的工作。

我们很快进入正题。大家对我们工作的真诚热情超出预期,令我们十分欣喜。接下来的 4 天里,我们讨论了上述 3 个语音技术领域的研究与进展——这是开发自有自动配音工具至关重要的第一步。我们计划在明年初发布其 1.0 版本。

对我们来说,最重要的是证明能够忠实克隆声音:在用于训练算法的原始语音数据与合成生成的同一声音之间,保持声音相似度。其次,我们还需证明,凭借出色的韵律和音调,我们的 TTS 工具正朝着打造最具人声感、最自然的合成语音平台稳步迈进。

前者的重要性不言而喻,因为新生成的话语需要让人一听就能辨认出是谁说的——我们必须准确保留说话人身份。韵律和音调同样重要,因为语气和节奏传递意图,而这正是语音听起来像人声的关键。我们的终极目标,是让程序不仅能流畅发音,还能为话语赋予恰当的情感色彩,仿佛理解自己在说什么。

TTS 演示

下方可以看到我们在会议期间使用的一段 TTS 演示。第一个链接是原始视频,随后是我们用不同声音演绎相同内容的示例。请注意,这是文本转语音,不是语音转换。我们唯一的输入,是写下原始视频中的台词,再生成你听到的语音。所有韵律和语调都由算法自行生成,没有经过后期处理。看看你能否认出这是谁的声音!

下一篇文章将专门介绍 Eleven TTS 技术,带你了解如何根据文本输入生成语音。

如果你喜欢我们的技术,并希望成为 Beta 测试者,可点击此处注册。

原始视频:

Eleven Labs 语音克隆 TTS:

内容优先于形式

会议前的几个月里,我们几乎将全部精力放在展示可验证的技术示例和自有研究成果上。毕竟,INTERSPEECH 是一场研究会议,我们坚信,尤其在这样高度专业的活动中,内容必须优先于形式。不过到了会议当天,我们开始开玩笑说,过度专注技术或许让品牌展示显得过于极简。很快我们便发现,其他参会者,甚至行业巨头,也选择了更朴素的布置,这让我们如释重负,甚至觉得自己的选择得到了印证!

明年再见

此次韩国之行对 Eleven 来说非常成功,也激励我们继续全力推进。想到未来一年能在研究和展示方式上取得的进展,我们已经倍感期待。希望到那时,达到生产级质量的 配音 工具已准备就绪,我们将能用人们自己的声音,让他们说出原本不会的语言。

相关内容

用高质量 AI 音频创作