文本转语音

了解如何使用 ElevenLabs 将文本转换为语音

概述

ElevenLabs 的文本转语音技术是我们产品的重要组成部分,为全球各类应用提供高质量的 AI 生成语音。你很可能已经在实际应用中听过我们的音色,它们能带来逼真的音频体验。

使用文本转语音生成第一段音频非常简单。不过,如需充分利用这项功能,有几点需要注意。

指南

文本转语音演示

1

文本输入

在文本转语音页面的输入框中输入或粘贴文本。

2

选择音色

在屏幕左下角的音色列表中,选择要使用的音色。

3

调整设置(可选)

调整音色设置,以获得所需输出效果。
4

生成

点击“生成”按钮,创建音频文件。

设置

了解用于创建高质量语音的音色、模型和设置。

所用的设置,尤其是音色和模型,会显著影响输出效果。熟悉这些设置并了解一些最佳实践非常重要。其他设置也会影响输出,但与所选音色和模型相比,影响较小。

重要性排序如下:音色选择最重要,其次是模型选择,最后是模型设置。这些因素及其组合都会影响输出。

音色

文本转语音音色
选择

我们提供多种音色,包括精选的默认音色、拥有几乎所有你能想到的音色的庞大声音库 w、使用声音设计工具创建的完全合成音色,以及通过两项技术创建的专属克隆音色集:即时语音克隆和专业语音克隆。

音色并不都一样,其表现很大程度取决于创建时使用的源音频。有些音色能带来更自然、更像真人的演绎和表达,有些则更加稳定。

为具体内容选择合适的音色至关重要。 这很可能是对最终输出影响最大的决定。它决定了性别、语气、口音、节奏和表达方式。值得多花些时间选择理想的音色并充分测试,确保其表现稳定且符合预期。

若要生成特定语言的语音,使用声音库中该语言的母语音色,或克隆带有正确口音、说该语言的音色,效果最佳。虽然从技术上说任何音色都能说任何语言,但它会保留原有口音。例如,使用英语母语音色生成法语语音,输出很可能是带有英语口音的法语,因为 AI 必须推断该音色说未经训练语言时会是什么效果。

了解更多音色信息

如果喜欢某个音色但希望调整表达方式,可以使用我们的音色重混工具。它支持通过自然语言提示词改变音色的表达、节奏、语气、性别,甚至口音。改变口音时,基础音色和目标口音都非常重要。结果可能有所不同:有时效果完美,有时则需要多试几次。

使用音色重混可以获得不错的结果,但通常不如精心克隆的专业语音克隆效果好。效果会更接近即时语音克隆。

请注意,音色重混仅适用于特定音色。例如,不能重混声音库中的音色;只能重混你自己创建的音色或默认音色。

模型

文本转语音模型
选择

我们提供两类模型:Standard(高质量) 模型和专为极低延迟优化的Flash模型。大多数系列都包含纯英语版和多语言版。

Eleven v4 是我们的最新模型,提供两个版本:Eleven v4 和 Eleven v4 Turbo。

模型选择是仅次于音色选择、对最终音频输出影响第二大的因素。建议花些时间用选定的音色测试不同模型,找到最适合的组合。所有模型都有各自的优缺点,且与某些音色搭配时表现更好,因此找到合适的组合很重要。

如果输出内容仅为英语,强烈建议使用纯英语模型。它们通常更易使用、更稳定,并且在纯英语内容上总体表现更优。如果内容为其他语言或可能包含多种语言,则必须使用多语言模型。

了解更多模型信息

音色设置

文本转语音音色
设置

最常用的设置是稳定性约为 50、相似度约为 75、风格保持为 0,之后仅作微调。当然,这也取决于原始音色以及你希望达到的演绎风格。

请注意,AI 具有非确定性;将滑块设为特定值并不能保证每次获得相同结果。滑块更像是一个范围,决定每次生成之间允许的随机变化幅度。

速度

速度设置可加快或减慢生成语音的语速。默认值为 1.0,表示不调整语速。低于 1.0 的值会减慢语速,最低为 0.7;高于 1.0 的值会加快语速,最高为 1.2。极端值可能影响生成语音的质量。

Eleven v3 模型不支持速度设置。

稳定性

稳定性滑块决定音色的稳定程度以及每次生成之间的随机性。降低此滑块会让音色呈现更广泛的情绪变化。如前所述,这也会受到原始音色的显著影响。滑块设得过低可能导致演绎效果异常随机,让角色说话过快;设得过高则可能使音色单调,情绪有限。

若希望获得更生动、更有戏剧性的演绎,建议调低稳定性滑块并生成几次,直到找到满意的效果。

另一方面,如果想要更严肃的演绎,甚至在极高值下接近单调,建议调高稳定性滑块。由于效果更一致、更稳定,通常无需生成太多样本即可达到理想结果。多尝试,找到最适合你的设置!

相似度

相似度滑块决定 AI 在尝试复现原始音色时应保持多高的一致性。如果原始音频质量较差且相似度滑块设得过高,原始录音中存在的瑕疵或背景噪音可能会在 AI 模仿音色时被一并复现。

Eleven v3 模型不支持相似度设置。

风格夸张度

随着新模型推出,我们还增加了风格夸张度设置。此设置会尝试强化原始说话者的风格。它会消耗额外计算资源,设为非 0 时可能增加延迟。请注意,使用此设置会使模型稳定性略有下降,因为模型会努力强调并模仿原始音色的风格。

通常建议始终将此设置保持为 0。

说话者增强

此设置可增强与原始说话者的相似度。但使用此设置需要略高的计算负载,从而增加延迟。此设置带来的差异通常较为细微。

Eleven v3 模型不支持说话者增强。

生成

选择音色、模型并配置设置后,生成过程非常简单:输入文本,点击“生成语音”,即可生成音频。

虽然表面上流程很简单,但输入的文本对于获得理想输出极其重要。使用 AI 在训练期间很少见到的“分布外”内容时,例如奇怪的名字、不常见的缩写、符号,甚至表情符号,可能会让 AI 感到困惑,导致输出更不稳定。表情符号和某些符号尤其难以让 AI 正确理解。

通过 UI 使用文本转语音时,我们会自动对输入进行规范化处理,以提高文本可读性并让 AI 更易处理。通常,此步骤会将符号和数字转换为文字形式,从而引导 AI 正确发音。

强烈建议避免将数字写成阿拉伯数字或使用符号,尤其是在使用多语言模型时(尽管这同样适用于纯英语模型)。由于数字和符号在许多语言中的书写形式相同,但发音不同,依赖阿拉伯数字会给 AI 带来歧义。例如,数字“1”在英语和许多其他语言中的写法完全一致,但发音不同。将数字写成文字,例如“one”,就无需让 AI 判断应如何处理。

我们正在开发更高级的 workflow,让你能通过我们称为音频标签的功能影响 AI 的表达和演绎。Eleven v4 和 Eleven v3 均支持此功能。如想进一步了解,建议阅读我们的提示词指南。

常见问题

第一个因素,也是最重要的因素之一,是优质、高质量且一致的输入会带来优质、高质量且一致的输出。

如果为 AI 提供的音频不够理想,例如噪音很大、清晰语音中带有混响、有多个说话者,或音量、演绎和表达方式不一致,AI 就会变得更不稳定,输出也会更难预测。

如果计划克隆自己的音色,强烈建议阅读文档中有关正确创建语音克隆的指南,这能为你提供尽可能好的基础。即使只打算使用即时语音克隆,也建议阅读专业语音克隆部分。尽管这两项技术的要求略有不同,该部分仍包含许多创建语音克隆的重要信息。

第二个需要考虑的因素是,所选音色会对输出产生巨大影响。如第一个因素所述,用于创建该克隆音色的样本质量和一致性极其重要,音色的语言和音调也同样重要。

如果想要听起来快乐、开朗的音色,应使用通过快乐、开朗的样本克隆而成的音色。相反,如果希望音色听起来内省、忧郁,则应选择具备这些特征的音色。

不过,使用以正确语言训练的音色也至关重要。例如,我们提供的所有默认专业语音克隆都是英语音色,且基于英语样本训练。因此,让它们说其他语言时,其表现可能难以预测。必须使用从该语言样本中克隆出的音色,即音色在样本中说的是你希望 AI 随后生成的语言。

这看似有些琐碎,但可能带来很大差异。AI 会根据文本本身的上下文理解应如何朗读,不仅包括所用词语,还包括词语组合方式、标点用法、语法和文本整体格式。

这会对 AI 的表达产生微小但重要的影响。若拼错单词,AI 不会自动纠正,而会按原样尝试朗读。

AI 的设置具有非确定性,也就是说,即使初始条件相同(音色、设置、模型),输出也会略有不同,就像配音演员每次都会呈现稍有差异的演绎。

这种变化可能由多种因素导致,例如前面提到的音色、设置和模型。通常可通过稳定性滑块控制变化范围。较低的稳定性设置意味着不同生成结果之间的变化范围更大,但也会增加跨次生成的差异,使 AI 的演绎感更强。

更大的变化范围通常是理想的,因为稳定性设得过高可能会让某些音色听起来单调,限制 AI 生成更多变化内容的空间。不过,稳定性设得过低也可能造成其他问题,尤其是某些在克隆过程中使用了不够理想音频的音色,生成结果可能会变得不稳定。

默认值 50 通常是大多数应用的良好起点。

建议切换到 Eleven v4,并用自己的内容进行测试。

Eleven v4 是我们最新、最先进的文本转语音模型,也是新一代模型中的首款产品。与 Eleven v3 相比,它提升了输出质量、音色准确度、情感表现、音频标签和语言覆盖范围。

Eleven v4 大幅提升了语音克隆准确度。与以往任何模型相比,克隆音色能更准确地还原源音色的特征——音色质感、节奏和表达方式。

Eleven v4 中的即时语音克隆(IVC)比以往更加准确。它能更忠实地捕捉源音色的关键特征,让你更轻松地通过短音频样本快速创建逼真的克隆音色。

Eleven v4 完全支持专业语音克隆(PVC)。它同样基于音色准确度的提升,为需要最高一致性和控制力的 workflow 提供更忠实的源音色还原。

Eleven v4 提供两个版本,可根据使用场景选择合适的质量与速度平衡:

  • Eleven v4(eleven_v4)——我们质量最高的模型,适合内容创作、有声书、角色旁白配音,以及任何将质量放在首位的使用场景。
  • Eleven v4 Turbo(eleven_v4_turbo)——在保持极高质量的同时实现出色的低延迟,专为对话式智能体和交互式语音体验等实时场景打造。

两个版本均使用两项音色设置:稳定性和相似度。Eleven v4 不提供风格和速度滑块,也不支持 SSML。

当生成语言与参考音色的语言一致时,会像以前一样完全保留原始口音。当生成语言与参考音色语言不同时,Eleven v4 会生成流畅自然的目标语言语音,而不会保留参考音色原始语言的口音。

可使用 Create speech 和 Stream speech,并指定模型 ID eleven_v4 来生成语音。对于多说话人内容,请使用 Create dialogue 和 Stream dialogue。

如需了解克隆、口音、对比及完整说明,请参阅 Eleven v4。如需了解标签和提示词,请参阅 Eleven v4 提示词。

建议切换到 Eleven v4,并用自己的内容进行测试。Eleven v4 的许多提示词技巧同样适用于 Eleven v3。

Eleven v3 是一款情感丰富、表现力强的文本转语音模型。它可在 70 多种语言中生成自然逼真、情感层次丰富且具备上下文理解能力的语音。

Eleven v3 提供:

  • 支持音频标签
    • 情绪:[sad] [angry] [happily]
    • 演绎指令:[whispers] [shouts]
    • 非语言反应:[laughs] [clears throat] [sighs]
  • 支持多说话人的自然对话模式
  • 支持 70 多种语言

该模型适合角色对话、有声书旁白和情感对话。

可通过 API 使用 Create speech 和 Stream speech 端点,并指定模型 ID eleven_v3 来生成语音。

还可以使用 Create dialogue 和 Stream dialogue 端点,创建多说话人的自然对话。

更多信息请查看以下资源:

文本转语音可通过 Speech Synthesis、Studio、ElevenAgents 和 API 控制语速。

可通过“速度”设置控制语速。

可选值范围为 0.7 至 1.2。低于 1 会减慢语速,高于 1 会加快语速。极端值可能影响生成语音的质量。 

所有音色和模型均可使用此设置,可在音色设置中找到。

如需了解如何通过 API 控制语速,请参阅 API 参考文档。

Any voice can speak any of the supported languages.

The way the current model works is that you don’t select a specific language, you instead write in the language you want the AI to speak and the AI understands automatically. However, since there can be some overlap between different languages where they use similar words and vocabulary but with quite different pronunciations and accents, you should use a cloned voice that was cloned speaking the language with the correct accent.

The language is determined by the text, the accent and pronunciation is determined by the voice itself. It needs both of these contexts to function optimally.

We are looking into developing new technology to facilitate the selection of language, but the way the AI is built means that all of this is still in progress.

可通过两种方式下载生成的文件:

生成内容后,点击右下角的下载按钮即可立即下载生成的文件。

之前生成的文件可从历史记录中下载。

要查看历史记录,请登录账户,在侧边栏选择 文本转语音,然后点击屏幕右侧面板中的历史记录标签。在窄屏设备上,点击 生成语音 按钮上方的历史记录图标即可查看历史记录。

在历史记录中,点击下载图标,可选择下载为 MP3(128kbps)或 WAV 文件。

还可点击 高级,下载更多格式的文件:

  • MP3(192kbps)
  • MP3(256kbps)
  • M4A
  • FLAC

可以。使用 Eleven v4 和 Eleven v3 时,可通过 [sighs] 或 [exhales] 等音频标签,为生成的语音添加呼吸声及类似反应。

有关音频标签和表达控制的更多详情,请参阅提示指南。

我们的 Flash 和 Turbo 模型专为低延迟应用开发。

Flash v2 和 Flash v2.5 是我们的超低延迟模型,可在不到 75ms 内生成音频。Flash v2 仅支持英语,Flash v2.5 支持 32 种语言。可在此处查看完整的支持语言列表。

我们的 Turbo 模型同样具备低延迟特性,但 Flash 模型的效果非常接近,因此建议优先使用 Flash 模型,而非 Turbo。Turbo v2 仅支持英语,Turbo v2.5 支持 32 种语言,速度比 Turbo v2 快 25%,可在约 300ms 内生成音频。

Flash 和 Turbo 都经过高度优化,专为低延迟应用打造,在不牺牲人声表现的前提下,保持我们模型一贯的质量标准。

通过 API 生成时,这两个模型均享有折扣。详情请参阅 API 定价。

我们还提供 ElevenAgents,这是一个用于部署定制交互式语音智能体的平台。请访问 ElevenAgents 文档了解更多。

有几种方法可以加入停顿或间隔,并影响说话人的节奏和韵律。具体方法取决于模型。

音频标签(Eleven v4 和 Eleven v3)

使用 Eleven v4 和 Eleven v3 时,可通过音频标签和标点控制节奏与表达。这些模型不支持 SSML break 标签。

有关提示停顿和表达的指导,请参阅提示指南。

Break 标签(Multilingual v2、Flash v2 和 Flash v2.5)

在 Multilingual v2、Flash v2 和 Flash v2.5 中,最稳定的停顿添加方式是使用 SSML break 标签语法 <break time="1.5s" />。这会在语音中创建精确而自然的停顿,并非只是在词语间插入静音——模型能理解该语法,并添加自然停顿。

模型处理这些停顿的方式可能有所不同。所用音色对输出至关重要。有些音色训练时包含一些“uh”和“ah”,可能会在停顿期间插入这些发声习惯,就像真实说话人一样。

示例如下:

“让我花一秒想想。” <break time="1.0s" /> “对,这样可行。”

Break 时长应以秒描述。AI 最多可处理 3 秒的停顿,可用于文本转语音和 API。

如果文本中使用过多 SSML break,可能会导致问题。语音可能加快,或音频可能出现更多噪声和其他瑕疵。我们正在解决这个问题。

标点

这些方式不如 break 标签或音频标签稳定,但仍可影响节奏。

简单的连字符 - 或破折号 — 通常效果不错。可添加多个连字符,例如 -- --,以获得更长的停顿。

“现在 - 很 - 晚了。”

省略号 ... 有时可在词语之间加入停顿,但通常也会让音色带有些犹豫或紧张感,并不一定适合所有场景。

“我……嗯,我想是的……”

Eleven v3 原生支持国际音标(IPA)。详见 Eleven v3 中的 IPA。

SSML 音素标签(仅限 Flash v2 和 Turbo v2)

在 Flash v2 和 Turbo v2 中,可通过 SSML 音素标签强制指定发音。我们同时支持 IPA 和 CMU。以当前实现来看,CMU 通常更可预测、更稳定。更多信息请参阅发音指南。

替代拼写

另一种解决方法是找到替代拼写,以更符合发音的方式书写单词。可以使用多种技巧,例如大写字母、连字符、撇号,甚至将单个字母或多个字母用单引号括起来。

例如,像“trapezii”这样的单词可拼写为“trapezIi”,以强调其中的“ii”。

Eleven v4 和 Eleven v3 支持音频标签。建议使用 Eleven v4。将简短指令放在方括号中,并置于需要改变表达方式的文本位置。两种模型均可使用相同的标签。

  • 情绪:[curious] [crying] [mischievously]
  • 表达指示:[whispers] [shouts]
  • 人类反应:[laughs] [clears throat] [sighs]

更多详细信息,请参阅提示指南。

通过指定模型 ID eleven_v4 或 eleven_v3,可使用 API 的创建语音和流式语音端点进行生成。

还可使用创建对话和流式对话端点,创建包含多位说话人的自然对话。

对于实时应用,Eleven v4 Turbo(eleven_v4_turbo)也支持音频标签。

访问以下资源了解更多信息:

使用文本转语音或变声器生成的文件可下载为 MP3、WAV、M4A 或 FLAC 格式。WAV、M4A 和 FLAC 文件需要从历史记录中下载。

如何下载 WAV 文件

在侧边栏选择 文本转语音 或 变声器,然后点击屏幕右侧面板中的历史记录标签。在窄屏设备上,点击 生成语音 按钮上方的历史记录图标即可查看历史记录。

在历史记录中,点击下载图标,可选择下载为 MP3 或 WAV 文件。

如何下载 FLAC 或 M4A 文件

在侧边栏选择 文本转语音 或 变声器,然后点击屏幕右侧面板中的历史记录标签。在窄屏设备上,点击 生成语音 按钮上方的历史记录图标即可查看历史记录。

在历史记录中,点击下载图标,可选择下载为 MP3 或 WAV 文件。要使用包括 FLAC 和 M4A 在内的更多文件格式,请点击 高级 并选择所需格式。

通过网站生成时的语言

在 ElevenLabs 网站上生成音频时,AI 会根据提示词文本的上下文自动识别语言。因此,最好避免在同一提示词中使用多种语言,否则可能导致无法确定应使用哪种语言。目前无法在网站上生成时指定语言。

通过 API 生成时的语言

通过 API 生成音频时,可使用 language_code 参数手动指定提示词的语言。这是一个可选参数,接受 ISO 639-1 语言代码。

这对于仅包含数字等简短或含义不明确的提示词非常有用。指定语言可确保标准化器应用该语言的正确规则。

有关标准化的更多信息,请参阅 这篇文章。

口音

生成内容所使用的口音取决于所选音色。如果使用未经所生成语言训练的音色,可能会听到该音色原始语言的轻微口音。

为获得最佳效果,建议使用经所生成语言音频训练、且符合偏好口音的音色。这有助于 AI 更准确地理解发音和语调。

对于相似或有许多共同词汇的语言,这一点尤其重要。选择经正确语言训练的音色,可确保 AI 使用正确的发音和口音。

你可以:

  • 使用偏好语言和口音的音频创建克隆音色。
  • 浏览声音库,并使用搜索筛选条件查找符合需求的合适音色。

在网站上使用 Eleven v3 生成内容的费用为每个字符 1 个积分。通过 API 生成可享折扣,详见 API 定价。

更多信息请参阅以下资源:

使用 Eleven v4 和 Eleven v3 时,可通过 [laughs] 等 音频标签,为生成的语音添加笑声和其他反应。详情请参阅提示词指南。

对于其他模型,情感表达取决于上下文、标点和音色设置。请参阅如何生成情感?。

模型会关注每句话所处的整体语境,通过与前后文本的关联判断内容是否合理。这种全局视角使模型能够以统一的情感模式贯穿多句话的思路,为较长片段添加恰当的语调。

生成情感的技巧:

  • 上下文是生成特定情感的关键。输入带有笑声或有趣的文本,可能会得到愉悦的输出。愤怒、悲伤和其他情感也是如此——设定上下文至关重要。
  • 标点和音色设置对输出的表达方式起主要作用。
  • 将相关词语或短语放在引号中,以加强强调效果。
  • 使用克隆音色生成语音时,上传用于克隆的样本中的说话风格会在输出中复现。如果上传样本中的语音单调,模型将难以生成富有表现力的输出。

使用 Eleven v4 和 Eleven v3 时,还可使用音频标签更直接地控制情感和表达方式,例如 [happy]、[sad]、[angry]、[whispers] 和 [laughs]。详情请参阅提示词指南。

这些技巧有助于引导情感表达,但不能保证得到特定结果。

很遗憾,目前不提供按下载扣除额度的方式,以替代按生成扣除额度。目前无法在不扣除配额的情况下预览生成内容。

在网站上点击“生成”后,会扣除积分,因为服务器需要启动并生成音频。无法在不使用积分的情况下,用自己的文本测试或预览音色。

在以下情况下,可通过网站在文本转语音中免费重新生成 2 次:

  • 提示词(用于文本转语音)或文件(用于变声器)、音色和模型保持不变。可以调整音色设置滑块。
  • 首次生成是在 2 小时内完成的。
  • 生成原始音频后,未刷新页面。

如果符合以上条件,将看到“重新生成语音”。将鼠标悬停在“重新生成语音”按钮上,可查看剩余免费重新生成次数:

免费重新生成次数用完后,按钮将恢复为“生成语音”,并显示本次生成将使用的积分数量:

免费重新生成仅可通过网站在文本转语音中使用,API 不支持此功能。

我们正在研究如何在不提高价格或成本的前提下,提供这种质量的预览。我们也在探索让 AI 更易于控制的方法,以便无需预览也能获得所需结果,并希望首次尝试就能实现。

Eleven v4 和 Eleven v3 提供对话模式,可生成节奏自然的动态多说话人对话,并能根据对话上下文处理打断、语气变化和情感提示。

通过网站使用多个说话人时,可使用对话模式。

还可使用文本转对话 API 端点生成多说话人互动。更多信息请参阅我们的 API 文档:

更多信息请参阅以下资源:

任何音色都能说 AI 当前支持的任何语言;但如果使用的音色并非该语言的母语音色,例如使用生成的音色,或克隆自英语语音的音色,AI 可能会带有轻微英语口音,或在相近语言之间切换。

如需查看所有支持语言的完整列表,请参阅此文章:支持哪些语言?

当前模型无需选择具体语言。只需使用希望 AI 说出的语言撰写文本,AI 会自动识别。不过,不同语言有时会使用相似的单词和词汇,但发音和口音可能截然不同。因此,建议使用以该语言及正确口音克隆的音色,这能让 AI 获得最充分的上下文,了解该如何发音以及应使用哪种语言。

文本决定语言,音色本身决定口音和发音。

我们正在研究便于选择语言的新技术,但受 AI 构建方式影响,这些功能仍在开发中。

在网站的 文本转语音 中,任何付费套餐单次最多可生成 5,000 个字符,所有免费套餐单次最多可生成 2,500 个字符。

不过,如果计划生成超过数千字符的长篇内容,强烈建议使用 Studio。它可以轻松生成书籍、小说等超长内容。可在这里了解更多。

如果通过 API 生成,最大输入长度取决于所用模型:

文本转语音

Flash v2.5 - 最多 40,000 个字符(约 40 分钟音频)

Turbo v2.5 - 最多 40,000 个字符(约 40 分钟音频)

Flash v2 - 最多 30,000 个字符(约 30 分钟音频)

Turbo v2 - 最多 30,000 个字符(约 30 分钟音频)

Multilingual v2 - 最多 10,000 个字符(约 10 分钟音频)

变声器

Multilingual v2 - 最多 10 分钟音频

所有预制音色和生成音色均为英语音色。这意味着它们说其他语言时,可能无法使用正确的口音或发音。

在声音库的专业类别下,可以找到社区与我们分享的音色。这些音色是用户为自己声音创建的专业语音克隆。这些音色通常带有语言标签,标明克隆时所使用的语言,因此属于该语言的母语音色。还可以使用语言搜索筛选器筛选特定语言。

数字、日期、符号和缩写可能会给 AI 带来挑战,因为它们通常有多种正确的读法。这也取决于所用语言,例如,“11” 可以读作英语的 “Eleven”,也可以是西班牙语的 “Once” 或德语的 “Elf”。

可通过多种方式确保数字、日期、缩写和符号被正确读出。

完整写成文字

为获得最佳效果,建议按照希望 AI 读出的方式,将数字、缩写、日期和符号完整写成文字。这能让 AI 获得最充分的上下文,从而提供正确输出。例如,对于 “$100”,建议写成 “a hundred dollars” 或 “one hundred dollars”,以确保获得想要的结果。

使用 LLM

如果使用大语言模型生成文本提示词,例如使用 ElevenAgents 时,可以提示模型始终按照希望 AI 读出的方式,将数字、日期、符号和缩写写成文字。

规范化

如果通过 API 生成,可以使用 apply_text_normalization 参数指定是否应用文本规范化。文本规范化会将数字和日期写成文字,以确保更好的发音。此选项会增加延迟,因为规范化过程需要额外处理时间。

apply_text_normalization 参数有三种模式:

  • on,表示始终应用
  • off,表示从不应用
  • auto,表示 AI 会自动决定何时应用文本规范化

还可以使用 language_code 参数指定提示词语言。这是一个可选参数,接受 ISO 639-1 语言代码。

这对于简短或有歧义的提示词很有用,例如文本只包含数字或符号时。指定语言可确保规范化器应用该语言的正确规则。

更多信息请参阅我们的 API 参考文档。

通过网站使用文本转语音生成时,默认启用规范化。

在 Studio 中,默认自动应用规范化,即由 AI 决定何时应用文本规范化。也可以将规范化设为始终应用——该选项位于项目设置的高级标签页下。

误读可能由多种原因造成。最常见的原因是单词拼写错误。AI 不会尝试纠正拼写错误的单词,而会按其写法原样读取。因此,在让 AI 朗读前,请务必再次检查,确保文本已校对完成。

如果想强制使用特定发音,可以在 Flash v2 模型中使用 SSML 音素标签。更多信息请参阅发音指南。

有时,AI 可能会误读单词,或使用与预期不符的奇怪口音。这可能由多种原因造成,大多数情况下高度依赖所用音色和语言。确保口音和发音正确的最佳方式,是克隆具有正确口音和发音的音色。这样可让 AI 在生成音频时获得最充分的上下文。

文本决定语言,音色决定口音。因此,如果使用的语言与另一种语言共享许多常用词,或两种语言关系较为接近,AI 可能难以理解某些单词该如何发音,或可能在不同口音之间切换。

不过,在某些情况下,即使英语单词拼写正确,AI 也可能会误读。这似乎高度依赖所用音色和文本,但应属罕见情况。

No results