跳至内容

这个声音不存在 - 生成式语音 AI

发布时间

收听收听本文

最近,似乎所有人都在谈论生成式 AI。ChatGPT、Stable Diffusion、DALL-E 和 Midjourney 等由深度学习驱动的大语言模型和文生图模型,在科技界乃至更广泛领域掀起了热潮。许多人将其视为近期 AI 最重要的发展之一。无论你是否认同,普遍的感觉是:一种强大的新技术已经出现。2023 年,我们将听到更多能帮助你绘画或制作视频的模型。就像人们会问最新、最好的智能手机是什么,我们很快也会问:最新、最好的基础模型是什么?然而,在这股热潮中,我们认为生成式媒体有一个领域仍被严重低估:AI 语音。这也是我们希望成为行业领导者的领域。在 ElevenLabs,我们每天依托深度学习技术释放的潜力,为逼真的文本转语音语音克隆工具提供支持。现在,我们还部署了自己的生成式模型,让你从零开始设计全新的合成音色。

语音生成器:设计音色

用户每天使用平台让角色鲜活起来——无论是用于有声书、游戏还是同人小说。我们发现,现有音色库规模太小,无法让每位用户都找到既符合内容需求、又专属于自己的音色。解决方案就是让你设计全新的合成音色。

在研究目前用于语音合成和语音克隆的方法时,我们想到了实现这一目标的方式。这两个过程都需要对特定音色的特征进行编码。承载这种身份信息的是说话人嵌入——即说话人声音的向量表示。我们发现,通过训练专用模型从说话人嵌入的分布中采样,就能创建无限多种新音色。

由于用户大多在寻找特定的语音特征,我们需要让这一过程具备一定的可控性。我们为模型加入条件控制,根据特征生成音色。现在,你可以设置决定新音色核心身份的基本参数:性别、年龄、口音、音高和说话风格。换句话说,每次点击“生成”,即使选择相同的基础参数,也会获得此前不存在的全新音色

以下是通过这种方式设计的音色示例:

00:00
00:00
00:00
00:00
00:00
00:00

“设计音色”将于今年 2 月作为 Voice Lab 的一部分,在平台上线。

有什么用途?

我们的工具已能生成与真人一样逼真的语音,人工语音的潜在应用范围还会持续扩大。许多新应用——包括为新闻出版物或广告录制音频——要求某个音色仅限于特定品牌或使用场景,并能被识别为专属音色,不能在其他地方使用。另一些使用场景,如叙事和电子游戏,则更重视开发早期的灵活性与实验自由。因此,我们没有创建庞大的虚拟说话人集合,而是让用户最终决定哪些音色最适合其用途。

图书作者不仅可以轻松将作品转换为音频,还能保留设计定制旁白的艺术掌控权。这为读者带来与出版物互动的有趣新方式,也大幅增加了我们能够聆听的图书数量。

新闻出版商正越来越多地进军音频领域,为出版物选择有辨识度的声音是一项重要工作——许多听众既看重形式,也看重内容。同样重要的是,出版商现在可以确信,某个特定音色只代表自己。

电子游戏开发者现在可以借助触手可及的工具,为大量原本无声的 NPC 配音。他们不仅能在不牺牲质量的前提下提高成本效益,还能设计完全属于所创建虚拟世界的独特音色。

广告创意人员需要适合特定活动的旁白配音,因此能在开发初期设计出有共鸣、为目标而设的旁白,是一项显著优势。现在,他们无需投入额外资源,即可立即尝试多种音色和表达风格。

从制作各类音视频内容的创作者,到希望为企业沟通内容配音的企业管理人员,如今设计既独特又贴合特定使用场景的出色音频,有着无限可能。

AI 伦理

与语音克隆可能被滥用而引发担忧类似,越来越多人担心 AI 技术的普及会威胁专业人士的生计。在 ElevenLabs,我们设想的未来是:配音演员可以授权使用其声音训练特定用途的语音模型,并获得相应报酬。客户和工作室仍会乐于在项目中采用专业配音人才,而 AI 只会帮助加快交付,并让人们在开发早期有更大的实验和确定方向的自由。这项技术会改变语音音频的设计和录制方式,但配音演员无需亲自到场参与每次录音,这让他们能同时参与更多项目,也能真正让声音长久留存。

此外,许多原本无力承担录音成本的图书、新闻、独立游戏及其他内容,如今将能通过另一种媒介被获取。可及性提高,也为这些内容拓展受众带来了机会。

在 ElevenLabs,我们坚定致力于尊重知识产权,并采取措施防范技术可能被滥用:

  • 我们只与遵守服务条款的客户合作。条款禁止将我们的技术恶意用于任何可能被视为非法或有害的目的;
  • 我们也在为模型生成的所有音频添加水印,以便能立即追溯至我们;
  • 使用可识别的声音时,仅用于演示目的,并在不会产生利益冲突的场景中使用;
  • 同时,我们致力于支持声音所有者及其被许可方维护权利,并将审查和处理所有已知侵权行为。

展望未来:增强自己的声音

未来,我们计划结合语音生成和语音克隆模型的能力,让用户增强自己的声音。你可以克隆声音,再将其调整为想要的效果。如果觉得自然的说话风格有些单调,可以为它增添变化。如果你确实不喜欢被录音,也可以调整输出,让声音听起来更自然。无论是预录演示还是语音消息,任何需要制作包含自己声音的音频的人,都能通过我们的工具套件一键完成。

新年快乐

随着 2022 年接近尾声,我们想感谢各位 Beta 用户持续参与并提供反馈。许多正在开发的功能都源于你们的意见和建议。很高兴有你们一路同行,祝大家新年快乐。

ElevenLabs Beta
前往此处注册 Beta 平台,亲自体验。我们持续改进产品,在这个早期阶段,所有用户洞察都非常宝贵。

相关内容

用高质量 AI 音频创作