如何用 ElevenLabs 克隆声音:深度解析
- 发布时间
- 最近更新
没有两个人的声音完全相同。声音由生理特征和所处环境塑造,并在多年的表达中逐渐形成。它独一无二。
直到最近,这种独特性还无法被复制。但 AI 的进步让高精度语音克隆成为可能。只需几分钟音频,AI 系统就能生成与原声极为接近的语音。
本指南将详细介绍如何使用 ElevenLabs 克隆声音,包括录制什么内容、如何在 即时和专业语音克隆之间选择,以及克隆完成后如何投入使用。两种方式都提供了可跟随操作的详细步骤。
摘要
- ElevenLabs 提供即时语音克隆和专业语音克隆服务。
- 即时语音克隆需要几分钟干净、稳定的音频。
- 专业语音克隆最多需要 3 小时语音数据。
- 克隆发布后,可将其连接到其他 ElevenLabs 产品。
- 克隆声音必须获得明确同意。使用这些服务前,ElevenLabs 要求确认已获得同意。
即时克隆与专业语音克隆:该选哪个?
ElevenLabs 提供两种不同的 语音克隆 方法可供选择。
即时克隆只需几分钟即可生成可用音色,让你快速将声音克隆用于实际场景。专业语音克隆耗时更长,但能生成保真度极高的模型。
以下快速参考指南可帮助你选择最适合的方案:
了解两种方式的区别,可帮你节省前期时间并快速开始。
使用 ElevenLabs 克隆声音前需要准备什么
无论选择专业还是即时 ElevenLabs 语音克隆,都有一些基础准备很有帮助。虽然并非必需,尤其是即时克隆,但它们会显著影响克隆质量。
开始录制前,请考虑以下几点:
- 音频质量要求:专业录音麦克风能带来明显提升。最低要求是能以 44.1 kHz 或 48 kHz 录制位深至少为 24 位的 WAV 文件。尽量在安静环境中使用支持 WAV 文件的数字音频工作站(DAW)录音。Audacity 是一款不错的免费工具。
- 最短样本时长:请确认需要提供多少音频数据。关键是所有文件的总时长,而非文件数量。专业语音克隆请尽量上传接近 3 小时的文件。
- 录制内容:ElevenCreative 的声音克隆旨在复刻所提供的声音。如果用缓慢、单调的语调朗读,录音也会呈现这些特点。请自然说话,并保持多样的情绪和节奏。ElevenLabs 为专业语音克隆提供了内置脚本。
多花几分钟提前做好这些准备,就能获得质量更高的最终声音克隆。
如何使用 ElevenLabs 创建即时声音克隆
如果有几分钟时间并身处安静环境,就可以开始克隆声音。ElevenCreative可创建声音的数字副本,支持在 32+ 种语言中使用,同时匹配母语的情感表达和韵律。
以下是使用 ElevenLabs 即时语音克隆的方法:
- 进入音色
- 上传样本
- 命名并保存声音
- 用脚本测试
- 调整稳定性和相似度设置
下面详细介绍这些步骤。
第 1 步:在“音色”中进入即时语音克隆页面
首先,登录 ElevenLabs 控制台。在左侧边栏选择“音色”,然后点击加号图标。
屏幕上会显示一个弹出窗口(如下图),其中提供几个选项:
- 声音设计
- 即时声音克隆
- 专业声音克隆
- 声音混音
在该模块中选择“即时声音克隆”,即可进入相应页面。

第 2 步:上传样本
按照屏幕提示上传预录音频文件,或直接在浏览器中录音。此时可向引擎上传多个文件。ElevenLabs 进行语音克隆时使用的是全部文件的总时长,而非单个文件时长。

建议提供至少 1—2 分钟干净、稳定的音频供我们处理。
这里还会显示一些最佳实践,例如避开嘈杂环境、检查麦克风质量,以及所有录音使用同一套设备。
第 3 步:命名并保存声音
录制声音后,ElevenLabs 将开始合成声音克隆。此时可以预览声音效果,并为其命名。
还可以为克隆添加语言、口音、性别和年龄等标签。描述框中可填写其他信息,便于归档该声音或供日后参考。

最后,需要点击同意框,确认已阅读并接受相关内容。无论克隆自己的声音还是他人的声音,都必须获得声音所有者的同意。
第 4 步:测试即时声音克隆
创建声音后,前往“我的音色”,点击“使用音色”,即可在 文本转语音工作台中使用克隆。为声音克隆写一段简短脚本。要充分测试,请确保内容未出现在训练音频中。
选定声音克隆并写好文本后,点击页面底部的“生成语音”,让它开口说话。

第 5 步:调整模型并迭代
如果觉得声音克隆有些不对劲,无需从头开始。ElevenLabs 提供多项滑块设置,可用于配置最终音频效果。
可调整屏幕右侧的以下控件,看看它们如何影响声音克隆:
- 稳定性:稳定性越高,声音越一致、可预测。较低的值能带来更多表现力,但也可能出现一些不一致。中等设置最适合大多数使用场景。
- 相似度:定义声音克隆与所提供声音样本的贴合程度。提高此滑块可让声音更接近原声。如果听到失真,请降低此滑块。
- 风格:想增强训练音频中的表现力?调高此滑块即可。但数值过高可能导致最终样本失真。
调整这些滑块的数值后,再次点击“生成语音”,看看模型如何变化。
完成这 5 步后,就拥有可立即使用的 ElevenLabs 声音克隆。
如何使用 ElevenLabs 创建专业声音克隆
使用 ElevenLabs 专业克隆声音比即时方案耗时更长,但能生成高度准确、贴近原声的模型。
如果使用 Creator 或更高版本套餐,可按以下步骤通过 ElevenLabs 创建专业声音克隆:
- 进入音色
- 上传音频
- 查看样本时长反馈
- 处理音频样本以提升质量
- 为安全起见验证本人声音
- 等待声音 Finetune 过程完成
- 使用声音克隆
下面详细介绍这些步骤。
第 1 步:在“音色”中进入专业语音克隆页面
登录 ElevenLabs 控制台,在左侧边栏选择“音色”,然后点击“创建声音”。弹出窗口中会显示与之前相同的选项。
这次请选择“专业声音克隆”。随后会显示多项建议,包括:
- 使用防喷罩
- 保持录音无噪声
- 在经过声学处理的房间录音
- 预处理音频
- 全程保持音量一致
- 至少提供 30 分钟音频,最好接近 3 小时
第 2 步:上传音频
点击“上传样本”,添加预录音频文件。也可以自行录音并直接上传到软件。我们提供了多种脚本,可用于广告、叙事或对话建模等不同用途。

这些音频文件应仅包含人声。目前不支持将歌唱作为输入或输出来源。
第 3 步:查看样本时长反馈
成功上传音频后,请务必查看时长反馈。即时声音克隆只需 1—2 分钟,而此服务建议上传 1—3 小时音频。
请记得加入包含多种情绪的音频文件。提供多样化、录音室级别的内容,能让模型获得最佳处理信息。

第 4 步:处理音频样本以提升质量
在专业语音克隆平台内,可直接提升音频样本质量。从移除背景噪声到分离不同说话人,ElevenLabs 可帮助创建高质量音频输入。
虽然不是绝对必要,但这一步很有用,能够提升最终声音克隆模型的质量。

第 5 步:为安全起见验证本人声音
创建专业声音克隆时,ElevenLabs 要求进行验证。上传所有内容后,系统会要求直接在界面中录制一段短音频。请尽量使用与训练录音相同的麦克风和房间设置,并尽可能匹配语气和表达风格。
如果验证失败,可在 24 小时后重试。如需在此之前开始使用,可直接联系 ElevenLabs 支持团队获取帮助。
第 6 步:等待声音 Finetune 过程
验证声音后,ElevenLabs 将开始 Finetune 模型。通常需要 3—6 小时;如果队列中有许多其他专业声音克隆排在前面,耗时可能更长。
要查看克隆状态,请前往“我的音色”。声音模型可用后,也会收到通知。
第 7 步:使用声音克隆
恭喜,现在已拥有功能完整的专业级声音克隆。完成的模型将显示在“我的音色”中,可用于其他所有 ElevenLabs 产品,例如文本转语音、Studio、配音、API 和语音智能体。
在音色选择器控制台中选择声音(使用制作过程中为它命名的名称)即可开始。
ElevenLabs 语音克隆最佳实践
按上述即时或专业语音克隆流程操作即可创建克隆,但提前做好一些额外准备会更好。这些建议可帮助微调录音工具或策略,提升声音克隆质量。
以下 AI 语音克隆最佳实践适用于即时和专业克隆:
- 房间声学与背景噪声:音频的纯净度会直接影响最终质量。请在没有背景噪声或回声的环境中录音。对于专业录音,录音棚效果很好。如果不想预订录音棚又想达到类似质量,可以看看当地共享办公空间是否有隔音舱可用。
- 麦克风距离:说话时,与麦克风保持约两个拳头的距离。虽然这是个不错的参考规则,但请查看麦克风规格以获取更多细节。
- 情绪范围:AI 模型会使用声音的自然 韵律和语音特征。如果表达平淡,模型也可能缺乏表现力。请充分展现自己,提供包含多种情绪的样本,展示在不同情境下自然的说话风格。
- 句式多样性与朗读脚本:朗读脚本是提供较长样本的实用起点,但可能显得经过排练或不够自然。尤其是首次阅读时,可能无法准确表达句子应有的情感细微差别。为取得平衡,请提供多段不同的脚本内容,并以更自然的对话式方式表达。
遵循这些最佳实践,可为 ElevenLabs 提供质量更高的输入,从而创建更准确反映声音特征的声音克隆。
如何使用 ElevenLabs 声音克隆?
使用 ElevenLabs 创建专业或即时声音克隆后,声音会显示在“我的音色”中。在那里可从其他所有 ElevenLabs 产品访问它。
以下场景可使用 ElevenLabs 声音克隆:
- 应用内文本转语音:ElevenLabs 文本转语音工作台可让你选择声音,并朗读输入框中的任何内容。它适合一次性生成语音,例如旁白配音或播客片头。记得在实时设置中调整风格、相似度和稳定性,让声音尽可能符合预期。
- 通过 API:可使用 List Voices API 端点返回 API 调用可用的所有音色列表。每个音色都有唯一的 voice ID,可在连接 ElevenAPI 的任何位置使用。
- 在语音智能体中:将 ElevenLabs 声音克隆连接到智能体,让它说话时使用你的声音。对于希望在不同平台保持一致声音形象的企业,这有助于打造统一品牌体验的智能体。
- 跨语言使用:声音克隆支持 32 种语言,可翻译内容并用自己的声音生成。即使没有该语言的语音样本,ElevenCreative 也能在不同语言中高度匹配语音的韵律和情感特质。
将其部署到所有产品后,就可以让声音焕发生机,开始大规模创作高质量内容。
使用 ElevenCreative 克隆声音
无论是希望加快视频制作的内容创作者,还是单纯想保留声音,ElevenLabs 语音克隆都简单、快速且有效。
免费套餐提供即时语音克隆,只需几分钟。使用 Creator 套餐即可开始专业语音克隆。了解更多 ElevenLabs 语音克隆,或立即 注册克隆声音。




