跳至内容

如何用 ElevenLabs 克隆声音:深度解析

发布时间
最近更新

收听收听本文

没有两种声音完全相同。声音由生理特征和环境塑造,并在多年的表达中逐渐形成。它独一无二。

直到最近,这种独特性还无法复制。但 AI 的进步让高精度语音克隆成为可能。只需几分钟音频,AI 系统就能生成与原声高度相似的语音。

本指南将详细介绍如何使用 ElevenLabs 克隆声音,包括录制内容、如何选择 即时和专业语音克隆,以及克隆完成后如何使用。两种方式都附有可跟随操作的详细步骤。

摘要

  • ElevenLabs 提供即时语音克隆和专业语音克隆服务。
  • 即时语音克隆需要几分钟清晰、稳定的音频。
  • 专业语音克隆最多需要 3 小时语音数据。
  • 克隆创建后,可将其连接到其他 ElevenLabs 产品。
  • 克隆声音必须获得明确同意。使用这些服务前,ElevenLabs 要求确认已获得同意。

即时克隆与专业语音克隆:该选哪个?

ElevenLabs 提供两种不同的 语音克隆方式供你选择。

即时克隆只需几分钟即可生成可用音色,让你快速开始实际使用。专业语音克隆耗时更长,但能生成保真度极高的模型。

以下速查指南可帮助你选择最适合的方案:

Instant Voice Cloning
Training time
Near-instant
Audio input required
1-3 minutes
Quality
Excellent for the vast majority of voices
Best for
Testing, iteration, content creators, quick projects
ElevenLabs plan required
Free and above
Professional Voice Cloning
Training time
Fine-tuning can take up to 6 hours, with some use cases reaching over 24 hours
Audio input required
30 minutes minimum, 2-3 hours recommended
Quality
Virtually indistinguishable from the original
Best for
Voice actors and professionals; long-form production; unique accents
ElevenLabs plan required
Creator plan and above

提前了解两种方式的区别,可以节省时间并快速开始。

使用 ElevenLabs 克隆声音前的准备

无论选择专业还是即时 ElevenLabs 语音克隆,都有一些基础事项值得准备。它们并非必需,尤其对即时克隆而言,但会显著影响克隆质量。

开始录音前,请考虑以下几点:

  • 音频质量要求:专业录音麦克风会带来明显提升。最低要求是以 44.1 kHz 或 48 kHz、至少 24 位比特率录制 WAV 文件。尽量在安静环境中,使用支持 WAV 文件的数字音频工作站(DAW)录制。Audacity 是不错的免费选择。
  • 最短样本时长:请查看需要提供多少音频数据。关键在于所有文件的总时长,而非文件数量。专业语音克隆请尽量上传接近 3 小时的文件。
  • 录什么内容:ElevenCreative 的语音克隆会复现所提供的声音。若以缓慢、单调的声音朗读,录音也会体现这些特征。请自然说话,并变化情绪和语速。ElevenLabs 为专业语音克隆提供内置脚本。

多花几分钟提前准备这些事项,能获得质量更高的最终语音克隆。

如何使用 ElevenLabs 创建即时语音克隆

如果有几分钟时间且身处安静环境,就可以开始克隆声音。ElevenCreative可创建声音的数字副本,支持部署到 32+ 种语言,同时匹配自然语言的情感表达和韵律。

以下是使用 ElevenLabs 即时语音克隆的方法:

  1. 进入音色
  2. 上传样本
  3. 命名并保存音色
  4. 用脚本测试
  5. 调整稳定性和相似度设置

下面详细介绍这些步骤。

第 1 步:在音色中进入即时语音克隆页面

首先登录 ElevenLabs 控制台。在左侧边栏选择音色,然后点击加号图标。

屏幕上会出现如下弹窗,提供以下选项:

  • 声音设计
  • 即时语音克隆
  • 专业语音克隆
  • 声音混音

在模块中选择即时语音克隆,即可进入相应页面。

Voice creation interface with options for designing, cloning, remixing, and selecting voices.

第 2 步:上传样本

按照屏幕提示上传预录音频文件,或直接在浏览器中录音。此时可以向引擎上传多个文件。ElevenLabs 进行语音克隆时使用的是总时长,而非单个文件时长。

Voice cloning interface for uploading or recording audio, emphasizing quality and consistency.

建议至少提供 1–2 分钟清晰、稳定的音频。

这里还会显示一些最佳实践,例如避开嘈杂环境、检查麦克风质量,并在所有录音中使用相同设备。

第 3 步:命名并保存音色

录制声音后,ElevenLabs 将开始合成语音克隆。此时可以预览声音效果,并为它命名。

还可以添加语言、口音、性别和年龄等标签。描述框可填写其他有助于整理该音色或供自己备注的信息。

Voice cloning interface for uploading and describing audio samples.

最后,点击同意框以确认已阅读并接受相关内容。无论克隆自己的声音还是他人的声音,都必须获得相应同意。

第 4 步:测试即时语音克隆

创建音色后,前往我的音色并点击使用音色,即可在 文本转语音体验区使用克隆。写一段简短脚本供语音克隆朗读。为了充分测试效果,请使用训练音频中未包含的内容。

选择语音克隆并输入文本后,点击页面底部的生成语音,即可试听效果。

ElevenLabs interface showing text-to-speech settings with a skeleton joke entered.

第 5 步:调整模型并迭代

如果觉得语音克隆听起来不太对,无需从头开始。ElevenLabs 提供多项设置滑块,可调整最终音频效果。

尝试调整屏幕右侧的以下控件,了解它们对语音克隆的影响:

  • 稳定性:稳定性越高,声音越一致、可预测。较低的值可带来更多表现力,但也可能引入不一致。大多数场景适合中等设置。
  • 相似度:决定语音克隆与所提供语音样本的贴合程度。提高此滑块可让声音更接近原声。若听到失真,请降低此滑块。
  • 风格:想增强训练音频中的表现力,可提高此滑块。但数值过高可能导致最终样本失真。

调整这些滑块后,再次点击生成语音,查看模型如何变化。

完成这 5 步后,即可获得可用的 ElevenLabs 语音克隆。

原声
语音克隆
Lily
Lily
原声
Lily
Lily
克隆
Chris
Chris
原声
Chris
Chris
克隆
Laura
Laura
原声
Laura
Laura
克隆
创建与你声音高度相似的克隆音色。

如何使用 ElevenLabs 创建专业语音克隆

使用 ElevenLabs 专业克隆声音比即时方案耗时更长,但可生成高度精准、极其接近原声的模型。

如果使用的是创作者套餐或更高级别套餐,可按以下步骤使用 ElevenLabs 创建专业语音克隆:

  1. 进入音色
  2. 上传音频
  3. 查看样本时长反馈
  4. 处理音频样本以提升质量
  5. 验证本人声音以保障安全
  6. 等待声音微调完成
  7. 使用语音克隆

下面详细介绍这些步骤。

第 1 步:在音色中进入专业语音克隆页面

登录 ElevenLabs 控制台,在左侧边栏选择音色,然后点击创建音色。弹窗中会显示与之前相同的选项。

这次请选择专业语音克隆。页面将显示一系列建议,包括:

  • 使用防喷罩
  • 确保录音无噪声
  • 在经过声学处理的房间录音
  • 预处理音频
  • 全程保持音量一致
  • 至少提供 30 分钟音频,理想情况下接近 3 小时

第 2 步:上传音频

点击上传样本,添加预录音频文件。也可以自行录音并直接上传到软件。我们提供了多种脚本,可用于广告、叙述或对话建模等用途。

Professional Voice Clone interface for uploading and describing audio samples.

这些音频文件应仅包含说话声。目前不支持将歌唱作为输入或输出。

第 3 步:查看样本时长反馈

成功上传音频后,请查看时长反馈。即时语音克隆只需 1–2 分钟,而此服务建议上传 1 至 3 小时音频。

请记得加入包含多种情绪表达的音频文件。多样化、录音室级别的内容能为模型提供尽可能丰富的信息。

Professional Voice Clone interface showing voice sample upload and configuration options.

第 4 步:处理音频样本以提升质量

在专业语音克隆平台中,可以直接提升音频样本质量。从去除背景噪声到分离不同说话人,ElevenLabs 可帮助创建高质量音频输入。

这一步并非绝对必要,但有助于提升最终语音克隆模型的质量。

Audio settings panel with options for noise removal and speaker separation. Save or cancel changes.

第 5 步:验证本人声音以保障安全

创建专业语音克隆时,ElevenLabs 要求进行验证。上传所有内容后,系统会要求直接在界面中录制一段短音频。尽可能使用与训练录音相同的麦克风和房间设置,并尽量匹配语气和表达风格。

如果验证失败,可在 24 小时后重试。如需提前开始,可以直接联系 ElevenLabs 支持团队获取帮助。

第 6 步:等待声音微调完成

验证声音后,ElevenLabs 将开始微调模型。通常需要 3 至 6 小时;如果前面排队等待的专业语音克隆较多,可能需要更久。

要查看克隆状态,请前往我的音色。声音模型可用后,也会收到通知。

第 7 步:使用语音克隆

恭喜,现在已拥有一个功能完整的专业级语音克隆。完成的模型会显示在我的音色中,可用于其他所有 ElevenLabs 产品,如文本转语音、Studio、配音、API 和语音智能体。

在音色选择器控制台中选择该音色(使用创建过程中设定的名称),即可开始使用。

ElevenLabs 语音克隆最佳实践

按上述即时或专业语音克隆流程即可创建克隆,但还可以提前做一些额外准备。这些小调整可从录音工具或策略上提升语音克隆质量。

以下 AI 语音克隆最佳实践适用于即时和专业克隆:

  • 房间声学和背景噪声:音频的纯净度会直接影响最终质量。请在没有背景噪声和回声的地方录音。专业录音可使用录音棚。若不想预订录音室,可查看当地共享办公空间是否有隔音舱。
  • 麦克风距离:说话时,与麦克风保持约两拳距离。虽然这是一个实用原则,仍建议查看麦克风规格以了解更多细节。
  • 样本中的情绪范围:AI 模型会使用声音自然的韵律和语音特征。如果表达平淡,模型的表达也可能不足。请充分展现不同情境下自然说话风格,并提供涵盖多种情绪的样本。
  • 句子多样性与朗读脚本:朗读脚本是提供较长样本的实用起点,但可能显得排练感过强或不自然。尤其是第一次阅读时,未必能准确表达句子应有的情绪细微差别。为取得平衡,请提供多段不同脚本,并以更自然的对话方式朗读。

遵循这些最佳实践,可为 ElevenLabs 提供更高质量的输入,从而创建更准确反映声音特征的语音克隆。

ElevenLabs 语音克隆有哪些用途?

使用 ElevenLabs 创建专业或即时语音克隆后,音色会显示在我的音色中。之后可从所有其他 ElevenLabs 产品访问它。

可以在以下场景使用 ElevenLabs 语音克隆:

  • 应用中的文本转语音:ElevenLabs 文本转语音体验区支持选择音色并朗读输入的任何内容。可用于一次性生成旁白配音、播客片头等。记得在实时设置中调整风格、相似度和稳定性,让声音尽可能符合预期。
  • 通过 API:可以使用 List Voices API endpoint返回可供 API 调用的所有音色列表。每个音色都有唯一的 voice ID,可在连接 ElevenAPI的任何位置使用。
  • 在语音智能体中:将 ElevenLabs 语音克隆连接到智能体,使其说话时使用该声音。对于希望在不同平台保持一致声音形象的企业,这有助于打造统一的品牌智能体体验。
  • 跨语言使用:语音克隆支持 32 种语言,可翻译内容并用该声音生成语音。即使没有该语言的声音样本,ElevenCreative 也能在不同语言中高度匹配语音的韵律和情感特征。

部署到所有产品后,就可以让声音发挥作用,并大规模创作高质量内容。

使用 ElevenCreative 克隆声音

无论是希望加快视频制作的内容创作者,还是只想保存声音,ElevenLabs 语音克隆都简单、快速且有效。

即时语音克隆包含在免费套餐中,只需几分钟。使用创作者套餐即可开始专业语音克隆。了解更多 ElevenLabs 语音克隆信息,或 注册,立即克隆声音。

常见问题

相关内容

用高质量 AI 音频创作