推出 Eleven v4认识 Eleven v4:迄今情感表现最丰富的模型。 Creator+ 套餐含 3 倍点数优惠,截止至 10 月 12 日

跳至内容

如何用 ElevenLabs 克隆声音:深度解析

发布时间
最近更新

收听收听本文

没有两个人的声音完全相同。声音由生理特征和所处环境塑造,并在多年的表达中逐渐形成。它独一无二。

直到最近,这种独特性还无法被复制。但 AI 的进步让高精度语音克隆成为可能。只需几分钟音频,AI 系统就能生成与原声极为接近的语音。

本指南将详细介绍如何使用 ElevenLabs 克隆声音,包括录制什么内容、如何在 即时和专业语音克隆之间选择,以及克隆完成后如何投入使用。两种方式都提供了可跟随操作的详细步骤。

摘要

  • ElevenLabs 提供即时语音克隆和专业语音克隆服务。
  • 即时语音克隆需要几分钟干净、稳定的音频。
  • 专业语音克隆最多需要 3 小时语音数据。
  • 克隆发布后,可将其连接到其他 ElevenLabs 产品。
  • 克隆声音必须获得明确同意。使用这些服务前,ElevenLabs 要求确认已获得同意。

即时克隆与专业语音克隆:该选哪个?

ElevenLabs 提供两种不同的 语音克隆 方法可供选择。

即时克隆只需几分钟即可生成可用音色,让你快速将声音克隆用于实际场景。专业语音克隆耗时更长,但能生成保真度极高的模型。

以下快速参考指南可帮助你选择最适合的方案:

Instant Voice Cloning
Training time
Near-instant
Audio input required
1-3 minutes
Quality
Excellent for the vast majority of voices
Best for
Testing, iteration, content creators, quick projects
ElevenLabs plan required
Free and above
Professional Voice Cloning
Training time
Fine-tuning can take up to 6 hours, with some use cases reaching over 24 hours
Audio input required
30 minutes minimum, 2-3 hours recommended
Quality
Virtually indistinguishable from the original
Best for
Voice actors and professionals; long-form production; unique accents
ElevenLabs plan required
Creator plan and above

了解两种方式的区别,可帮你节省前期时间并快速开始。

使用 ElevenLabs 克隆声音前需要准备什么

无论选择专业还是即时 ElevenLabs 语音克隆,都有一些基础准备很有帮助。虽然并非必需,尤其是即时克隆,但它们会显著影响克隆质量。

开始录制前,请考虑以下几点:

  • 音频质量要求:专业录音麦克风能带来明显提升。最低要求是能以 44.1 kHz 或 48 kHz 录制位深至少为 24 位的 WAV 文件。尽量在安静环境中使用支持 WAV 文件的数字音频工作站(DAW)录音。Audacity 是一款不错的免费工具。
  • 最短样本时长:请确认需要提供多少音频数据。关键是所有文件的总时长,而非文件数量。专业语音克隆请尽量上传接近 3 小时的文件。
  • 录制内容:ElevenCreative 的声音克隆旨在复刻所提供的声音。如果用缓慢、单调的语调朗读,录音也会呈现这些特点。请自然说话,并保持多样的情绪和节奏。ElevenLabs 为专业语音克隆提供了内置脚本。

多花几分钟提前做好这些准备,就能获得质量更高的最终声音克隆。

如何使用 ElevenLabs 创建即时声音克隆

如果有几分钟时间并身处安静环境,就可以开始克隆声音。ElevenCreative可创建声音的数字副本,支持在 32+ 种语言中使用,同时匹配母语的情感表达和韵律。

以下是使用 ElevenLabs 即时语音克隆的方法:

  1. 进入音色
  2. 上传样本
  3. 命名并保存声音
  4. 用脚本测试
  5. 调整稳定性和相似度设置

下面详细介绍这些步骤。

第 1 步:在“音色”中进入即时语音克隆页面

首先,登录 ElevenLabs 控制台。在左侧边栏选择“音色”,然后点击加号图标。

屏幕上会显示一个弹出窗口(如下图),其中提供几个选项:

  • 声音设计
  • 即时声音克隆
  • 专业声音克隆
  • 声音混音

在该模块中选择“即时声音克隆”,即可进入相应页面。

Voice creation interface with options for designing, cloning, remixing, and selecting voices.

第 2 步:上传样本

按照屏幕提示上传预录音频文件,或直接在浏览器中录音。此时可向引擎上传多个文件。ElevenLabs 进行语音克隆时使用的是全部文件的总时长,而非单个文件时长。

Voice cloning interface for uploading or recording audio, emphasizing quality and consistency.

建议提供至少 1—2 分钟干净、稳定的音频供我们处理。

这里还会显示一些最佳实践,例如避开嘈杂环境、检查麦克风质量,以及所有录音使用同一套设备。

第 3 步:命名并保存声音

录制声音后,ElevenLabs 将开始合成声音克隆。此时可以预览声音效果,并为其命名。

还可以为克隆添加语言、口音、性别和年龄等标签。描述框中可填写其他信息,便于归档该声音或供日后参考。

Voice cloning interface for uploading and describing audio samples.

最后,需要点击同意框,确认已阅读并接受相关内容。无论克隆自己的声音还是他人的声音,都必须获得声音所有者的同意。

第 4 步:测试即时声音克隆

创建声音后,前往“我的音色”,点击“使用音色”,即可在 文本转语音工作台中使用克隆。为声音克隆写一段简短脚本。要充分测试,请确保内容未出现在训练音频中。

选定声音克隆并写好文本后,点击页面底部的“生成语音”,让它开口说话。

ElevenLabs interface showing text-to-speech settings with a skeleton joke entered.

第 5 步:调整模型并迭代

如果觉得声音克隆有些不对劲,无需从头开始。ElevenLabs 提供多项滑块设置,可用于配置最终音频效果。

可调整屏幕右侧的以下控件,看看它们如何影响声音克隆:

  • 稳定性:稳定性越高,声音越一致、可预测。较低的值能带来更多表现力,但也可能出现一些不一致。中等设置最适合大多数使用场景。
  • 相似度:定义声音克隆与所提供声音样本的贴合程度。提高此滑块可让声音更接近原声。如果听到失真,请降低此滑块。
  • 风格:想增强训练音频中的表现力?调高此滑块即可。但数值过高可能导致最终样本失真。

调整这些滑块的数值后,再次点击“生成语音”,看看模型如何变化。

完成这 5 步后,就拥有可立即使用的 ElevenLabs 声音克隆。

原声
语音克隆
Lily
Lily
原声
Lily
Lily
克隆
Chris
Chris
原声
Chris
Chris
克隆
Laura
Laura
原声
Laura
Laura
克隆
创建与你声音高度相似的克隆音色。

如何使用 ElevenLabs 创建专业声音克隆

使用 ElevenLabs 专业克隆声音比即时方案耗时更长,但能生成高度准确、贴近原声的模型。

如果使用 Creator 或更高版本套餐,可按以下步骤通过 ElevenLabs 创建专业声音克隆:

  1. 进入音色
  2. 上传音频
  3. 查看样本时长反馈
  4. 处理音频样本以提升质量
  5. 为安全起见验证本人声音
  6. 等待声音 Finetune 过程完成
  7. 使用声音克隆

下面详细介绍这些步骤。

第 1 步:在“音色”中进入专业语音克隆页面

登录 ElevenLabs 控制台,在左侧边栏选择“音色”,然后点击“创建声音”。弹出窗口中会显示与之前相同的选项。

这次请选择“专业声音克隆”。随后会显示多项建议,包括:

  • 使用防喷罩
  • 保持录音无噪声
  • 在经过声学处理的房间录音
  • 预处理音频
  • 全程保持音量一致
  • 至少提供 30 分钟音频,最好接近 3 小时

第 2 步:上传音频

点击“上传样本”,添加预录音频文件。也可以自行录音并直接上传到软件。我们提供了多种脚本,可用于广告、叙事或对话建模等不同用途。

Professional Voice Clone interface for uploading and describing audio samples.

这些音频文件应仅包含人声。目前不支持将歌唱作为输入或输出来源。

第 3 步:查看样本时长反馈

成功上传音频后,请务必查看时长反馈。即时声音克隆只需 1—2 分钟,而此服务建议上传 1—3 小时音频。

请记得加入包含多种情绪的音频文件。提供多样化、录音室级别的内容,能让模型获得最佳处理信息。

Professional Voice Clone interface showing voice sample upload and configuration options.

第 4 步:处理音频样本以提升质量

在专业语音克隆平台内,可直接提升音频样本质量。从移除背景噪声到分离不同说话人,ElevenLabs 可帮助创建高质量音频输入。

虽然不是绝对必要,但这一步很有用,能够提升最终声音克隆模型的质量。

Audio settings panel with options for noise removal and speaker separation. Save or cancel changes.

第 5 步:为安全起见验证本人声音

创建专业声音克隆时,ElevenLabs 要求进行验证。上传所有内容后,系统会要求直接在界面中录制一段短音频。请尽量使用与训练录音相同的麦克风和房间设置,并尽可能匹配语气和表达风格。

如果验证失败,可在 24 小时后重试。如需在此之前开始使用,可直接联系 ElevenLabs 支持团队获取帮助。

第 6 步:等待声音 Finetune 过程

验证声音后,ElevenLabs 将开始 Finetune 模型。通常需要 3—6 小时;如果队列中有许多其他专业声音克隆排在前面,耗时可能更长。

要查看克隆状态,请前往“我的音色”。声音模型可用后,也会收到通知。

第 7 步:使用声音克隆

恭喜,现在已拥有功能完整的专业级声音克隆。完成的模型将显示在“我的音色”中,可用于其他所有 ElevenLabs 产品,例如文本转语音、Studio、配音、API 和语音智能体。

在音色选择器控制台中选择声音(使用制作过程中为它命名的名称)即可开始。

ElevenLabs 语音克隆最佳实践

按上述即时或专业语音克隆流程操作即可创建克隆,但提前做好一些额外准备会更好。这些建议可帮助微调录音工具或策略,提升声音克隆质量。

以下 AI 语音克隆最佳实践适用于即时和专业克隆:

  • 房间声学与背景噪声:音频的纯净度会直接影响最终质量。请在没有背景噪声或回声的环境中录音。对于专业录音,录音棚效果很好。如果不想预订录音棚又想达到类似质量,可以看看当地共享办公空间是否有隔音舱可用。
  • 麦克风距离:说话时,与麦克风保持约两个拳头的距离。虽然这是个不错的参考规则,但请查看麦克风规格以获取更多细节。
  • 情绪范围:AI 模型会使用声音的自然 韵律和语音特征。如果表达平淡,模型也可能缺乏表现力。请充分展现自己,提供包含多种情绪的样本,展示在不同情境下自然的说话风格。
  • 句式多样性与朗读脚本:朗读脚本是提供较长样本的实用起点,但可能显得经过排练或不够自然。尤其是首次阅读时,可能无法准确表达句子应有的情感细微差别。为取得平衡,请提供多段不同的脚本内容,并以更自然的对话式方式表达。

遵循这些最佳实践,可为 ElevenLabs 提供质量更高的输入,从而创建更准确反映声音特征的声音克隆。

如何使用 ElevenLabs 声音克隆?

使用 ElevenLabs 创建专业或即时声音克隆后,声音会显示在“我的音色”中。在那里可从其他所有 ElevenLabs 产品访问它。

以下场景可使用 ElevenLabs 声音克隆:

  • 应用内文本转语音:ElevenLabs 文本转语音工作台可让你选择声音,并朗读输入框中的任何内容。它适合一次性生成语音,例如旁白配音或播客片头。记得在实时设置中调整风格、相似度和稳定性,让声音尽可能符合预期。
  • 通过 API:可使用 List Voices API 端点返回 API 调用可用的所有音色列表。每个音色都有唯一的 voice ID,可在连接 ElevenAPI 的任何位置使用。
  • 在语音智能体中:将 ElevenLabs 声音克隆连接到智能体,让它说话时使用你的声音。对于希望在不同平台保持一致声音形象的企业,这有助于打造统一品牌体验的智能体。
  • 跨语言使用:声音克隆支持 32 种语言,可翻译内容并用自己的声音生成。即使没有该语言的语音样本,ElevenCreative 也能在不同语言中高度匹配语音的韵律和情感特质。

将其部署到所有产品后,就可以让声音焕发生机,开始大规模创作高质量内容。

使用 ElevenCreative 克隆声音

无论是希望加快视频制作的内容创作者,还是单纯想保留声音,ElevenLabs 语音克隆都简单、快速且有效。

免费套餐提供即时语音克隆,只需几分钟。使用 Creator 套餐即可开始专业语音克隆。了解更多 ElevenLabs 语音克隆,或立即 注册克隆声音。

常见问题

相关内容

用高质量 AI 音频创作