优质输入带来优质输出 第一个因素,也是最重要的因素之一,是优质、高质量且一致的输入会带来优质、高质量且一致的输出。
如果为 AI 提供的音频不够理想,例如噪音很大、清晰语音中带有混响、有多个说话者,或音量、演绎和表达方式不一致,AI 就会变得更不稳定,输出也会更难预测。
如果计划克隆自己的音色,强烈建议阅读文档中有关正确创建语音克隆的指南,这能为你提供尽可能好的基础。即使只打算使用即时语音克隆,也建议阅读专业语音克隆部分。尽管这两项技术的要求略有不同,该部分仍包含许多创建语音克隆的重要信息。
使用合适的音色 第二个需要考虑的因素是,所选音色会对输出产生巨大影响。如第一个因素所述,用于创建该克隆音色的样本质量和一致性极其重要,音色的语言和音调也同样重要。
如果想要听起来快乐、开朗的音色,应使用通过快乐、开朗的样本克隆而成的音色。相反,如果希望音色听起来内省、忧郁,则应选择具备这些特征的音色。
不过,使用以正确语言训练的音色也至关重要。例如,我们提供的所有默认专业语音克隆都是英语音色,且基于英语样本训练。因此,让它们说其他语言时,其表现可能难以预测。必须使用从该语言样本中克隆出的音色,即音色在样本中说的是你希望 AI 随后生成的语言。
使用正确格式 这看似有些琐碎,但可能带来很大差异。AI 会根据文本本身的上下文理解应如何朗读,不仅包括所用词语,还包括词语组合方式、标点用法、语法和文本整体格式。
这会对 AI 的表达产生微小但重要的影响。若拼错单词,AI 不会自动纠正,而会按原样尝试朗读。
非确定性 AI 的设置具有非确定性,也就是说,即使初始条件相同(音色、设置、模型),输出也会略有不同,就像配音演员每次都会呈现稍有差异的演绎。
这种变化可能由多种因素导致,例如前面提到的音色、设置和模型。通常可通过稳定性滑块控制变化范围。较低的稳定性设置意味着不同生成结果之间的变化范围更大,但也会增加跨次生成的差异,使 AI 的演绎感更强。
更大的变化范围通常是理想的,因为稳定性设得过高可能会让某些音色听起来单调,限制 AI 生成更多变化内容的空间。不过,稳定性设得过低也可能造成其他问题,尤其是某些在克隆过程中使用了不够理想音频的音色,生成结果可能会变得不稳定。
默认值 50 通常是大多数应用的良好起点。
什么是 Eleven v4?
建议切换到 Eleven v4,并用自己的内容进行测试。
Eleven v4 是我们最新、最先进的文本转语音模型,也是新一代模型中的首款产品。与 Eleven v3 相比,它提升了输出质量、音色准确度、情感表现、音频标签和语言覆盖范围。
Eleven v4 大幅提升了语音克隆准确度。与以往任何模型相比,克隆音色能更准确地还原源音色的特征——音色质感、节奏和表达方式。
Eleven v4 中的即时语音克隆(IVC)比以往更加准确。它能更忠实地捕捉源音色的关键特征,让你更轻松地通过短音频样本快速创建逼真的克隆音色。
Eleven v4 完全支持专业语音克隆(PVC)。它同样基于音色准确度的提升,为需要最高一致性和控制力的 workflow 提供更忠实的源音色还原。
Eleven v4 提供两个版本,可根据使用场景选择合适的质量与速度平衡:
Eleven v4 (eleven_v4)——我们质量最高的模型,适合内容创作、有声书、角色旁白配音,以及任何将质量放在首位的使用场景。
Eleven v4 Turbo (eleven_v4_turbo)——在保持极高质量的同时实现出色的低延迟,专为对话式智能体和交互式语音体验等实时场景打造。
两个版本均使用两项音色设置:稳定性和相似度。Eleven v4 不提供风格和速度滑块,也不支持 SSML。
当生成语言与参考音色的语言一致时,会像以前一样完全保留原始口音。当生成语言与参考音色语言不同时,Eleven v4 会生成流畅自然的目标语言语音,而不会保留参考音色原始语言的口音。
可使用 Create speech 和 Stream speech ,并指定模型 ID eleven_v4 来生成语音。对于多说话人内容,请使用 Create dialogue 和 Stream dialogue 。
如需了解克隆、口音、对比及完整说明,请参阅 Eleven v4 。如需了解标签和提示词,请参阅 Eleven v4 提示词 。
什么是 Eleven v3? Eleven v3 是一款情感丰富、表现力强的文本转语音模型。它可在 70 多种语言中生成自然逼真、情感层次丰富且具备上下文理解能力的语音。
Eleven v3 提供:
支持音频标签
情绪:[sad] [angry] [happily]
演绎指令:[whispers] [shouts]
非语言反应:[laughs] [clears throat] [sighs]
支持多说话人的自然对话模式
支持 70 多种语言
该模型适合角色对话、有声书旁白和情感对话。
可通过 API 使用 Create speech 和 Stream speech 端点,并指定模型 ID eleven_v3 来生成语音。
还可以使用 Create dialogue 和 Stream dialogue 端点,创建多说话人的自然对话。
更多信息请查看以下资源:
可以改变音色的语速吗? 文本转语音可通过 Speech Synthesis、Studio、ElevenAgents 和 API 控制语速。
可通过“速度”设置控制语速。
可选值范围为 0.7 至 1.2。低于 1 会减慢语速,高于 1 会加快语速。极端值可能影响生成语音的质量。
所有音色和模型均可使用此设置,可在音色设置中找到。
如需了解如何通过 API 控制语速,请参阅 API 参考文档。
可以让同一个克隆/设计音色用于不同语言吗? Any voice can speak any of the supported languages.
The way the current model works is that you don’t select a specific language, you instead write in the language you want the AI to speak and the AI understands automatically. However, since there can be some overlap between different languages where they use similar words and vocabulary but with quite different pronunciations and accents, you should use a cloned voice that was cloned speaking the language with the correct accent.
The language is determined by the text, the accent and pronunciation is determined by the voice itself. It needs both of these contexts to function optimally.
We are looking into developing new technology to facilitate the selection of language, but the way the AI is built means that all of this is still in progress.
如何从文本转语音下载生成的文件? 可通过两种方式下载生成的文件:
生成内容后,点击右下角的下载按钮即可立即下载生成的文件。
之前生成的文件可从历史记录中下载。
要查看历史记录,请登录账户,在侧边栏选择 文本转语音 ,然后点击屏幕右侧面板中的历史记录标签。在窄屏设备上,点击 生成语音 按钮上方的历史记录图标即可查看历史记录。
在历史记录中,点击下载图标,可选择下载为 MP3(128kbps)或 WAV 文件。
还可点击 高级 ,下载更多格式的文件:
MP3(192kbps)
MP3(256kbps)
M4A
FLAC
可以让音色发出呼吸声吗? 可以。使用 Eleven v4 和 Eleven v3 时,可通过 [sighs] 或 [exhales] 等音频标签,为生成的语音添加呼吸声及类似反应。
有关音频标签和表达控制的更多详情,请参阅提示指南 。
是否提供用于对话或聊天机器人的 AI 模型? 我们的 Flash 和 Turbo 模型专为低延迟应用开发。
Flash v2 和 Flash v2.5 是我们的超低延迟模型,可在不到 75ms 内生成音频。Flash v2 仅支持英语,Flash v2.5 支持 32 种语言。可在此处 查看完整的支持语言列表。
我们的 Turbo 模型同样具备低延迟特性,但 Flash 模型的效果非常接近,因此建议优先使用 Flash 模型,而非 Turbo。Turbo v2 仅支持英语,Turbo v2.5 支持 32 种语言,速度比 Turbo v2 快 25%,可在约 300ms 内生成音频。
Flash 和 Turbo 都经过高度优化,专为低延迟应用打造,在不牺牲人声表现的前提下,保持我们模型一贯的质量标准。
通过 API 生成时,这两个模型均享有折扣。详情请参阅 API 定价。
我们还提供 ElevenAgents,这是一个用于部署定制交互式语音智能体的平台。请访问 ElevenAgents 文档了解更多。
如何添加停顿? 有几种方法可以加入停顿或间隔,并影响说话人的节奏和韵律。具体方法取决于模型。
音频标签(Eleven v4 和 Eleven v3) 使用 Eleven v4 和 Eleven v3 时,可通过音频标签和标点控制节奏与表达。这些模型不支持 SSML break 标签。
有关提示停顿和表达的指导,请参阅提示指南 。
Break 标签(Multilingual v2、Flash v2 和 Flash v2.5) 在 Multilingual v2、Flash v2 和 Flash v2.5 中,最稳定的停顿添加方式是使用 SSML break 标签语法 <break time="1.5s" />。这会在语音中创建精确而自然的停顿,并非只是在词语间插入静音——模型能理解该语法,并添加自然停顿。
模型处理这些停顿的方式可能有所不同。所用音色对输出至关重要。有些音色训练时包含一些“uh”和“ah”,可能会在停顿期间插入这些发声习惯,就像真实说话人一样。
示例如下:
“让我花一秒想想。” <break time="1.0s" /> “对,这样可行。”
Break 时长应以秒描述。AI 最多可处理 3 秒的停顿,可用于文本转语音和 API。
如果文本中使用过多 SSML break,可能会导致问题。语音可能加快,或音频可能出现更多噪声和其他瑕疵。我们正在解决这个问题。
标点 这些方式不如 break 标签或音频标签稳定,但仍可影响节奏。
简单的连字符 - 或破折号 — 通常效果不错。可添加多个连字符,例如 -- --,以获得更长的停顿。
“现在 - 很 - 晚了。”
省略号 ... 有时可在词语之间加入停顿,但通常也会让音色带有些犹豫或紧张感,并不一定适合所有场景。
“我……嗯,我想是的……”
如何强制指定某个单词或名字的发音? Eleven v3 原生支持国际音标(IPA)。详见 Eleven v3 中的 IPA 。
SSML 音素标签(仅限 Flash v2 和 Turbo v2) 在 Flash v2 和 Turbo v2 中,可通过 SSML 音素标签强制指定发音。我们同时支持 IPA 和 CMU。以当前实现来看,CMU 通常更可预测、更稳定。更多信息请参阅发音指南 。
替代拼写 另一种解决方法是找到替代拼写,以更符合发音的方式书写单词。可以使用多种技巧,例如大写字母、连字符、撇号,甚至将单个字母或多个字母用单引号括起来。
例如,像“trapezii”这样的单词可拼写为“trapezIi”,以强调其中的“ii”。
音频标签如何在 Eleven v3 和 v4 中使用? Eleven v4 和 Eleven v3 支持音频标签。建议使用 Eleven v4。将简短指令放在方括号中,并置于需要改变表达方式的文本位置。两种模型均可使用相同的标签。
情绪:[curious] [crying] [mischievously]
表达指示:[whispers] [shouts]
人类反应:[laughs] [clears throat] [sighs]
更多详细信息,请参阅提示指南 。
通过指定模型 ID eleven_v4 或 eleven_v3,可使用 API 的创建语音 和流式语音 端点进行生成。
还可使用创建对话 和流式对话 端点,创建包含多位说话人的自然对话。
对于实时应用,Eleven v4 Turbo(eleven_v4_turbo)也支持音频标签。
访问以下资源了解更多信息:
如何下载 WAV、M4A 和 FLAC 文件? 使用文本转语音或变声器生成的文件可下载为 MP3、WAV、M4A 或 FLAC 格式。WAV、M4A 和 FLAC 文件需要从历史记录中下载。
如何下载 WAV 文件 在侧边栏选择 文本转语音 或 变声器 ,然后点击屏幕右侧面板中的历史记录标签。在窄屏设备上,点击 生成语音 按钮上方的历史记录图标即可查看历史记录。
在历史记录中,点击下载图标,可选择下载为 MP3 或 WAV 文件。
如何下载 FLAC 或 M4A 文件 在侧边栏选择 文本转语音 或 变声器 ,然后点击屏幕右侧面板中的历史记录标签。在窄屏设备上,点击 生成语音 按钮上方的历史记录图标即可查看历史记录。
在历史记录中,点击下载图标,可选择下载为 MP3 或 WAV 文件。要使用包括 FLAC 和 M4A 在内的更多文件格式,请点击 高级 并选择所需格式。
如何选择语言和口音? 通过网站生成时的语言 在 ElevenLabs 网站上生成音频时,AI 会根据提示词文本的上下文自动识别语言。因此,最好避免在同一提示词中使用多种语言,否则可能导致无法确定应使用哪种语言。目前无法在网站上生成时指定语言。
通过 API 生成时的语言 通过 API 生成音频时,可使用 language_code 参数手动指定提示词的语言。这是一个可选参数,接受 ISO 639-1 语言代码。
这对于仅包含数字等简短或含义不明确的提示词非常有用。指定语言可确保标准化器应用该语言的正确规则。
有关标准化的更多信息,请参阅 这篇文章。
口音 生成内容所使用的口音取决于所选音色。如果使用未经所生成语言训练的音色,可能会听到该音色原始语言的轻微口音。
为获得最佳效果,建议使用经所生成语言音频训练、且符合偏好口音的音色。这有助于 AI 更准确地理解发音和语调。
对于相似或有许多共同词汇的语言,这一点尤其重要。选择经正确语言训练的音色,可确保 AI 使用正确的发音和口音。
你可以:
使用偏好语言和口音的音频创建克隆音色 。
浏览声音库 ,并使用搜索筛选条件查找符合需求的合适音色。
使用 Eleven v3(Alpha)生成内容的费用是多少? 在网站上使用 Eleven v3 生成内容的费用为每个字符 1 个积分。通过 API 生成可享折扣,详见 API 定价 。
更多信息请参阅以下资源:
如何让音色笑起来? 使用 Eleven v4 和 Eleven v3 时,可通过 [laughs] 等 音频标签 ,为生成的语音添加笑声和其他反应。详情请参阅提示词指南 。
对于其他模型,情感表达取决于上下文、标点和音色设置。请参阅如何生成情感? 。
如何生成情绪? 模型会关注每句话所处的整体语境,通过与前后文本的关联判断内容是否合理。这种全局视角使模型能够以统一的情感模式贯穿多句话的思路,为较长片段添加恰当的语调。
生成情感的技巧:
上下文是生成特定情感的关键。输入带有笑声或有趣的文本,可能会得到愉悦的输出。愤怒、悲伤和其他情感也是如此——设定上下文至关重要。
标点和音色设置对输出的表达方式起主要作用。
将相关词语或短语放在引号中,以加强强调效果。
使用克隆音色生成语音时,上传用于克隆的样本中的说话风格会在输出中复现。如果上传样本中的语音单调,模型将难以生成富有表现力的输出。
使用 Eleven v4 和 Eleven v3 时,还可使用音频标签 更直接地控制情感和表达方式,例如 [happy]、[sad]、[angry]、[whispers] 和 [laughs]。详情请参阅提示词指南 。
这些技巧有助于引导情感表达,但不能保证得到特定结果。
下载前是否可以预览音频而不消耗配额? 很遗憾,目前不提供按下载扣除额度的方式,以替代按生成扣除额度。目前无法在不扣除配额的情况下预览生成内容。
在网站上点击“生成”后,会扣除积分,因为服务器需要启动并生成音频。无法在不使用积分的情况下,用自己的文本测试或预览音色。
在以下情况下,可通过网站在文本转语音中免费重新生成 2 次:
提示词(用于文本转语音)或文件(用于变声器)、音色和模型保持不变。可以调整音色设置滑块。
首次生成是在 2 小时内完成的。
生成原始音频后,未刷新页面。
如果符合以上条件,将看到“重新生成语音”。将鼠标悬停在“重新生成语音”按钮上,可查看剩余免费重新生成次数:
免费重新生成次数用完后,按钮将恢复为“生成语音”,并显示本次生成将使用的积分数量:
免费重新生成仅可通过网站在文本转语音中使用,API 不支持此功能。
我们正在研究如何在不提高价格或成本的前提下,提供这种质量的预览。我们也在探索让 AI 更易于控制的方法,以便无需预览也能获得所需结果,并希望首次尝试就能实现。
什么是对话模式? Eleven v4 和 Eleven v3 提供对话模式,可生成节奏自然的动态多说话人对话,并能根据对话上下文处理打断、语气变化和情感提示。
通过网站使用多个说话人时,可使用对话模式。
还可使用文本转对话 API 端点生成多说话人互动。更多信息请参阅我们的 API 文档 :
更多信息请参阅以下资源:
AI 可以说哪些语言? 任何音色都能说 AI 当前支持的任何语言;但如果使用的音色并非该语言的母语音色,例如使用生成的音色,或克隆自英语语音的音色,AI 可能会带有轻微英语口音,或在相近语言之间切换。
如需查看所有支持语言的完整列表,请参阅此文章:支持哪些语言?
当前模型无需选择具体语言。只需使用希望 AI 说出的语言撰写文本,AI 会自动识别。不过,不同语言有时会使用相似的单词和词汇,但发音和口音可能截然不同。因此,建议使用以该语言及正确口音克隆的音色,这能让 AI 获得最充分的上下文,了解该如何发音以及应使用哪种语言。
文本决定语言,音色本身决定口音和发音。
我们正在研究便于选择语言的新技术,但受 AI 构建方式影响,这些功能仍在开发中。
最多可以生成多少字符和文本? 在网站的 文本转语音 中,任何付费套餐单次最多可生成 5,000 个字符,所有免费套餐单次最多可生成 2,500 个字符。
不过,如果计划生成超过数千字符的长篇内容,强烈建议使用 Studio 。它可以轻松生成书籍、小说等超长内容。可在这里 了解更多。
如果通过 API 生成,最大输入长度取决于所用模型:
文本转语音 Flash v2.5 - 最多 40,000 个字符(约 40 分钟音频)
Turbo v2.5 - 最多 40,000 个字符(约 40 分钟音频)
Flash v2 - 最多 30,000 个字符(约 30 分钟音频)
Turbo v2 - 最多 30,000 个字符(约 30 分钟音频)
Multilingual v2 - 最多 10,000 个字符(约 10 分钟音频)
变声器 Multilingual v2 - 最多 10 分钟音频
声音库中哪些音色是特定语言的母语音色? 所有预制音色和生成音色均为英语音色。这意味着它们说其他语言时,可能无法使用正确的口音或发音。
在声音库的专业类别下,可以找到社区与我们分享的音色。这些音色是用户为自己声音创建的专业语音克隆 。这些音色通常带有语言标签,标明克隆时所使用的语言,因此属于该语言的母语音色。还可以使用语言搜索筛选器筛选特定语言。
为什么数字、日期、符号和首字母缩略词没有被正确发音,或没有以正确语言朗读? 数字、日期、符号和缩写可能会给 AI 带来挑战,因为它们通常有多种正确的读法。这也取决于所用语言,例如,“11” 可以读作英语的 “Eleven”,也可以是西班牙语的 “Once” 或德语的 “Elf”。
可通过多种方式确保数字、日期、缩写和符号被正确读出。
完整写成文字 为获得最佳效果,建议按照希望 AI 读出的方式,将数字、缩写、日期和符号完整写成文字。这能让 AI 获得最充分的上下文,从而提供正确输出。例如,对于 “$100”,建议写成 “a hundred dollars” 或 “one hundred dollars”,以确保获得想要的结果。
使用 LLM 如果使用大语言模型生成文本提示词,例如使用 ElevenAgents 时,可以提示模型始终按照希望 AI 读出的方式,将数字、日期、符号和缩写写成文字。
规范化 如果通过 API 生成,可以使用 apply_text_normalization 参数指定是否应用文本规范化。文本规范化会将数字和日期写成文字,以确保更好的发音。此选项会增加延迟,因为规范化过程需要额外处理时间。
apply_text_normalization 参数有三种模式:
on,表示始终应用
off,表示从不应用
auto,表示 AI 会自动决定何时应用文本规范化
还可以使用 language_code 参数指定提示词语言。这是一个可选参数,接受 ISO 639-1 语言代码。
这对于简短或有歧义的提示词很有用,例如文本只包含数字或符号时。指定语言可确保规范化器应用该语言的正确规则。
更多信息请参阅我们的 API 参考文档。
通过网站使用文本转语音生成时,默认启用规范化。
在 Studio 中,默认自动应用规范化,即由 AI 决定何时应用文本规范化。也可以将规范化设为始终应用——该选项位于项目设置 的高级 标签页下。
为什么我的音色会误读某些单词? 误读可能由多种原因造成。最常见的原因是单词拼写错误。AI 不会尝试纠正拼写错误的单词,而会按其写法原样读取。因此,在让 AI 朗读前,请务必再次检查,确保文本已校对完成。
如果想强制使用特定发音,可以在 Flash v2 模型中使用 SSML 音素标签。更多信息请参阅发音指南 。
有时,AI 可能会误读单词,或使用与预期不符的奇怪口音。这可能由多种原因造成,大多数情况下高度依赖所用音色和语言。确保口音和发音正确的最佳方式,是克隆具有正确口音和发音的音色。这样可让 AI 在生成音频时获得最充分的上下文。
文本决定语言,音色决定口音。因此,如果使用的语言与另一种语言共享许多常用词,或两种语言关系较为接近,AI 可能难以理解某些单词该如何发音,或可能在不同口音之间切换。
不过,在某些情况下,即使英语单词拼写正确,AI 也可能会误读。这似乎高度依赖所用音色和文本,但应属罕见情况。