跳至内容

如何用 ElevenLabs 克隆声音:深度解析

发布时间
最近更新

收听收听本文

没有两个人的声音完全相同。声音由生理条件和环境塑造,并在多年的表达中逐渐形成。它独一无二。

直到最近,这种独特性还无法复制。但 AI 的进步让高精度语音克隆成为可能。只需几分钟音频,AI 系统就能生成与原声非常接近的语音。

本指南将详细介绍如何使用 ElevenLabs 克隆声音,包括该录制什么、如何在即时语音和专业语音克隆之间选择,以及克隆完成后如何使用。我们还为两种方式准备了可逐步操作的详细说明。

摘要

  • ElevenLabs 提供即时语音克隆和专业语音克隆服务。
  • 即时语音克隆需要几分钟干净、稳定的音频。
  • 专业语音克隆最多需要 3 小时语音数据。
  • 创建克隆后,可将其连接到其他 ElevenLabs 产品。
  • 克隆声音必须获得明确授权。使用这些服务前,ElevenLabs 要求确认已获得授权。

即时克隆与专业语音克隆:该选哪个?

ElevenLabs 提供两种不同的语音克隆方式。

即时克隆几分钟内就能生成可用音色,让你快速开始实际使用。专业语音克隆耗时更长,但能生成保真度极高的模型。

以下快速指南可帮助你选择最适合的方案:

Instant Voice Cloning
Training time
Near-instant
Audio input required
1-3 minutes
Quality
Excellent for the vast majority of voices
Best for
Testing, iteration, content creators, quick projects
ElevenLabs plan required
Free and above
Professional Voice Cloning
Training time
Fine-tuning can take up to 6 hours, with some use cases reaching over 24 hours
Audio input required
30 minutes minimum, 2-3 hours recommended
Quality
Virtually indistinguishable from the original
Best for
Voice actors and professionals; long-form production; unique accents
ElevenLabs plan required
Creator plan and above

了解两种方式的区别,能节省前期时间并快速开始。

使用 ElevenLabs 克隆声音前的准备

无论选择 ElevenLabs 专业语音克隆还是即时语音克隆,先做好一些基础准备都会有所帮助。虽然并非强制要求,尤其是即时克隆,但会显著影响克隆质量。

点击录制前,先考虑以下几点:

  • 音频质量要求:专业录音麦克风会带来明显改善。最低要求是能录制 44.1 kHz 或 48 kHz、位深至少 24 bit 的 WAV 文件。尽量在安静环境中,使用支持 WAV 文件的数字音频工作站(DAW)录制。Audacity 是一款不错的免费工具。
  • 最短样本时长:请确认需要提供多少音频数据。重要的是所有文件的总时长,而不是文件数量。专业语音克隆请尽可能上传接近 3 小时的文件。
  • 录制内容:ElevenCreative 的语音克隆旨在复刻你提供的声音。如果用缓慢、单调的声音朗读,录音也会呈现这些特点。请自然表达,并加入不同的情绪和语速。ElevenLabs 为专业语音克隆提供内置脚本。

多花几分钟提前准备这些事项,就能获得质量更高的最终语音克隆。

如何使用 ElevenLabs 创建即时语音克隆

如果有几分钟时间且身处安静环境,就可以开始克隆声音。ElevenCreative会创建声音的数字副本,可用于 32 种以上语言,同时匹配自然语言的情感和韵律。

以下是使用 ElevenLabs 即时语音克隆的方法:

  1. 进入音色
  2. 上传样本
  3. 命名并保存音色
  4. 用脚本测试
  5. 调整稳定性和相似度设置

下面详细介绍这些步骤。

第 1 步:在“音色”中进入即时语音克隆页面

先登录 ElevenLabs 控制台。在左侧边栏选择“音色”,然后点击加号图标。

屏幕上会显示如下弹窗,提供几个选项:

  • 声音设计
  • 即时语音克隆
  • 专业语音克隆
  • 声音混音

在模块中选择“即时语音克隆”,即可进入相应页面。

Voice creation interface with options for designing, cloning, remixing, and selecting voices.

第 2 步:上传样本

按照屏幕提示上传预录音频文件,或直接在浏览器中录制。此时可向引擎上传多个文件。ElevenLabs 进行语音克隆时采用所有文件的总时长,而非单个文件的时长。

Voice cloning interface for uploading or recording audio, emphasizing quality and consistency.

建议至少提供 1 至 2 分钟干净、稳定的音频。

此处还会显示一些最佳实践,例如避开嘈杂环境、检查麦克风质量,以及在所有录音中使用相同设备。

第 3 步:命名并保存音色

录制完成后,ElevenLabs 会开始合成语音克隆。此时可以预览声音效果,并为它命名。

还可为克隆添加语言、口音、性别和年龄等标签。描述框中可填写其他信息,便于整理该音色或供自己日后参考。

Voice cloning interface for uploading and describing audio samples.

最后,需勾选授权确认框,确认已阅读并接受相关内容。无论克隆自己的声音还是他人的声音,都必须获得授权。

第 4 步:测试即时语音克隆

创建音色后,进入“我的音色”并点击“使用音色”,即可在文本转语音体验区中使用克隆。写一段简短脚本让它朗读。要充分测试效果,请使用训练音频中未包含的内容。

选择语音克隆并写好文本后,点击页面底部的“生成语音”,让它开口说话。

ElevenLabs interface showing text-to-speech settings with a skeleton joke entered.

第 5 步:调整模型,持续优化

如果觉得语音克隆听起来不太对,无需从头开始。ElevenLabs 提供多项滑块设置,可调整最终音频效果。

试着调整屏幕右侧的以下控件,看看它们如何影响语音克隆:

  • 稳定性:较高的稳定性能让声音更一致、可预测。较低的值可带来更多表现力,但可能出现不一致。大多数使用场景适合中等设置。
  • 相似度:定义语音克隆与所提供语音样本的贴近程度。提高此滑块可让声音更像原声;如果出现失真,请降低此值。
  • 风格:想增强训练音频中的表现力?提高此滑块即可。但数值过高可能导致最终样本失真。

调整这些滑块后,再次点击“生成语音”,观察模型的变化。

完成这 5 步后,就拥有可立即使用的 ElevenLabs 语音克隆。

原声
语音克隆
Lily
Lily
原声
Lily
Lily
克隆
Chris
Chris
原声
Chris
Chris
克隆
Laura
Laura
原声
Laura
Laura
克隆
创建与你声音高度相似的克隆音色。

如何使用 ElevenLabs 创建专业语音克隆

使用 ElevenLabs 专业克隆声音比即时方案耗时更长,但能获得高度准确、非常接近原声的模型。

如果使用 Creator 或更高版本套餐,可按以下步骤通过 ElevenLabs 创建专业语音克隆:

  1. 进入音色
  2. 上传音频
  3. 查看样本时长反馈
  4. 处理音频样本以提升质量
  5. 验证本人声音以保障安全
  6. 等待语音微调完成
  7. 使用语音克隆

下面详细介绍这些步骤。

第 1 步:在“音色”中进入专业语音克隆页面

登录 ElevenLabs 控制台,在左侧边栏选择“音色”,然后点击“创建音色”。在弹窗中可看到与之前相同的选项。

这次请选择“专业语音克隆”。随后会显示多项建议,包括:

  • 使用防喷罩
  • 保持录音无噪声
  • 在经过声学处理的房间录制
  • 预处理音频
  • 全程保持音量一致
  • 提供至少 30 分钟音频,理想时长接近 3 小时

第 2 步:上传音频

点击“上传样本”并添加预录音频文件。也可以自行录制并直接上传到软件。我们提供了多种脚本,可用于广告、叙事或对话建模等不同用途。

Professional Voice Clone interface for uploading and describing audio samples.

这些音频文件应仅包含人声。目前不支持将歌唱作为输入或输出。

第 3 步:查看样本时长反馈

成功上传音频后,请查看时长反馈。即时语音克隆使用 1 至 2 分钟音频已足够,但此服务建议上传 1 至 3 小时音频。

记得加入包含多种情绪的音频文件。多样化的录音室级内容可为模型提供尽可能充分的信息。

Professional Voice Clone interface showing voice sample upload and configuration options.

第 4 步:处理音频样本以提升质量

在专业语音克隆平台中,可直接提升音频样本质量。从去除背景噪声到分离不同说话人,ElevenLabs 可帮助创建高质量音频输入。

虽然并非绝对必要,但这一步很有用,能提升最终语音克隆模型的质量。

Audio settings panel with options for noise removal and speaker separation. Save or cancel changes.

第 5 步:验证本人声音以保障安全

创建专业语音克隆时,ElevenLabs 要求进行验证。上传完所有内容后,需要直接在界面中录制一段简短音频。请尽量使用与训练录音相同的麦克风和房间设置,并尽可能保持相近的语气和表达风格。

如果验证失败,可在 24 小时后重试。如需提前开始,可直接联系ElevenLabs 支持团队获取帮助。

第 6 步:等待语音微调完成

验证声音后,ElevenLabs 将开始微调模型。通常需要 3 至 6 小时;如果前面还有许多专业语音克隆任务排队,耗时可能更长。

要查看克隆状态,请进入“我的音色”。音色模型可用后,也会收到通知。

第 7 步:使用语音克隆

恭喜,现在拥有功能完整的专业级语音克隆。完成的模型将显示在“我的音色”中,可用于其他 ElevenLabs 产品,例如文本转语音、Studio、配音、API 和语音智能体。

在音色选择器中选择创建时命名的音色,即可开始使用。

ElevenLabs 语音克隆最佳实践

按上述即时或专业语音克隆流程操作即可创建克隆,但还可以提前做一些额外准备。这些小调整可应用于录音工具或录制策略,帮助提升语音克隆质量。

以下 AI 语音克隆最佳实践适用于即时和专业克隆:

  • 房间声学与背景噪声:音频的干净程度会直接影响最终质量。请在没有背景噪声或回声的地方录制。专业录音适合使用录音棚。如果不想预订录音棚,可看看当地共享办公空间是否有隔音舱可用。
  • 麦克风距离:说话时,与麦克风保持约两个拳头的距离。虽然这是个实用准则,但请查看麦克风规格以了解更多信息。
  • 样本的情绪范围:AI 模型会利用声音自然的韵律和语音特征。如果表达平淡,模型的表现也可能缺乏变化。请充分展现自己,在不同语境下提供体现自然说话风格的多种情绪样本。
  • 句式多样性与朗读脚本:朗读脚本是提供较长样本的实用起点,但可能显得排练过度或不够自然。尤其首次朗读时,可能无法准确表达句子应有的细腻情绪。为取得平衡,请提供多段不同脚本,并以更接近日常对话的方式表达。

遵循这些最佳实践,可为 ElevenLabs 提供更高质量的输入,从而创建更准确反映声线特征的语音克隆。

ElevenLabs 语音克隆有哪些用途?

通过 ElevenLabs 完成专业或即时语音克隆后,音色会显示在“我的音色”中。之后可从所有其他 ElevenLabs 产品访问它。

可在以下场景使用 ElevenLabs 语音克隆:

  • 应用中的文本转语音:ElevenLabs 文本转语音体验区可让你选择音色,并朗读输入的任意内容。适合一次性生成旁白配音、播客片头等语音。记得在实时设置中调整风格、相似度和稳定性,让声音尽可能符合预期。
  • 通过 API:可使用List Voices API endpoint返回 API 调用可用的所有音色列表。每个音色都有唯一的 voice ID,可在接入ElevenAPI的任何位置使用。
  • 在语音智能体中:将 ElevenLabs 语音克隆连接到智能体,让它说话时使用该声音。对于希望在不同平台保持一致声音形象的企业,这有助于为智能体打造统一的品牌体验。
  • 跨语言使用:语音克隆支持 32 种语言,可翻译内容并以自己的声音生成语音。即使没有该语言的声音样本,ElevenCreative 也能在不同语言中高度还原语音的韵律和情感特点。

部署到所有产品后,就可以让声音发挥作用,并规模化创作高质量内容。

使用 ElevenCreative 克隆声音

无论是想加快视频制作的内容创作者,还是只想保存自己的声音,ElevenLabs 语音克隆都简单、快速且高效。

免费套餐提供即时语音克隆,只需几分钟即可完成。使用 Creator 套餐即可开始专业语音克隆。了解更多ElevenLabs 语音克隆信息,或注册,立即克隆声音。

常见问题

相关内容

用高质量 AI 音频创作