跳至内容

什么是音频标签?情感 TTS 全面指南

发布时间
最近更新

收听收听本文

音频标签是用方括号括起的自然语言提示,例如 [laughs]、[gasps]、[excited] 和 [worried]。Eleven v3 会将它们视为表演指令,而非需要朗读的文字。为文本转语音模型编写脚本时,插入这些音频标签,即可精细控制文本的情感表达。

Eleven v3 于 2026 年 3 月正式向公众开放。在 v3 之前,要让文本转语音模型呈现特定情感,往往只能反复生成并寄希望于结果。音频标签消除了这种不确定性,让你能全面掌控情感化文本转语音的表现。

本指南将介绍音频标签的定义、工作原理、所有可用标签类别,以及它们与 SSML(语音合成标记语言)的区别。还会介绍常见使用场景,并附上各场景的专门指南链接。

摘要:

  • 音频标签是 [shouts] 或 [excited] 这类方括号提示,可在 Eleven v3 的 TTS 中控制情感、节奏、表达方式和语气。
  • Eleven v3 不支持 SSML,但以音频标签替代,带来更自然的写作体验。
  • 标签涵盖情感、表达方式与节奏、人类反应、口音和音效等类别。
  • 文本中的标点和大小写可帮助塑造 AI 语音表现的节奏。
  • 可通过 ElevenLabs UI 或 API 使用音频标签。

音频标签如何工作?

音频标签直接嵌入文稿,并用方括号括起。每当需要改变表达方式,例如从普通语气转为 [worried],只需添加一个音频标签。

单个句子中也可使用多个标签,并将其组合以获得更丰富的表现,例如 [tired] It’s been a long day… [upset] How many more days can I take?

Eleven v3 的架构让模型能比早期模型更深入地理解上下文,无需单独的参数或设置,便能识别情感提示、语气变化、说话人切换和上下文线索。只要告诉模型当前场景需要什么,它就会按你的设想演绎这句台词。

Eleven v3 还能仅凭标签和脚本结构,处理自然流畅的多说话人对话,包括打断、情绪变化以及真实对话中的自然互动。

音频标签与 SSML

如果用过其他 TTS 系统,可能见过语音合成标记语言(Speech Synthesis Markup Language)。Amazon Polly、Microsoft Azure Speech 等平台会使用 <break> 或 <emphasis> 等 SSML 标签,为 TTS 脚本提供额外上下文。

Eleven v3 不支持 SSML 的 break 标签及其他 SSML 标签。取而代之的是音频标签、标点和文本结构本身,同时仍可精细控制表达效果。

可使用下表将常见 SSML 标签对应到 Eleven v3 的等效方式。

What it does
<break time=”1s”>
Inserts a pause
<prosody rate=”slow”>
Slows down speech
<prosody rate=”fast”>
Speeds speech up
<emphasis>
Stresses a particular word
<prosody pitch=”high”>
Shifts pitch higher
<prosody pitch=”low”>
Shifts pitch lower
Eleven v3 equivalent
<break time=”1s”>
[pause], an ellipsis in your text, or a line break
<prosody rate=”slow”>
[drawn out] or [slowly]
<prosody rate=”fast”>
[rushed]
<emphasis>
[shouts] or capitalizing a word
<prosody pitch=”high”>
Emotional tags like [excited]
<prosody pitch=”low”>
Emotional TTS tags like [softly] or [sorrowful]

从写作角度看,在一句台词中添加 [whispers],比配置 韵律 速率轻松得多。

v3 中的音频标签类别:用音频标签指导表演

可在脚本任何位置添加音频标签,实时塑造表达效果。还可在整段脚本甚至单个句子中组合多个标签。

标签主要分为以下类别。

情感

这些标签可设定语音的情感基调,无论是低沉、强烈还是欢快。例如,可单独或组合使用 [sad]、[angry]、[happily] 和 [sorrowful]。

Background
Background

表达方式与节奏

这类标签更侧重语气和表演。可用于调整音量和能量感,适合需要克制或爆发力的场景,例如 [whispers]、[shouts] 和 [softly]。

Background
Background

人类反应

真正自然的语音包含各种反应。可将自然、即兴的片段嵌入语音,提升真实感。[laughs]、[clears throat] 和 [sighs] 等标签,都能帮助 TTS 模型呈现人类情感。

其他音频标签类别示例:

  • 口音与角色声音:口音标签无需切换模型,即可让声音转为特定地区口音或角色人设,例如 [French accent]、[British accent] 或 [pirate voice]。它能让单个音色化身为灵活的角色阵容,而非固定的一种演绎。
  • 音效:音效标签可将非语音音频直接加入生成内容,例如 [gunshot]、[explosion] 和 [clapping]。它们非常适合沉浸式音频、游戏和戏剧化旁白,让场景不止有声音。或者,使用 ElevenCreative AI 音效生成器

标签可提供高度控制,你也可以用标点塑造节奏和强调效果。例如,用省略号营造自然停顿,或用逗号形成自然的呼吸节奏。还可将单词全部大写来加强强调:“I want it right NOW.”

Background
Background

音频标签能做什么?

音频标签能以直观方式呈现脚本的复杂情感。自然写作,并随时添加标签。

以下简要介绍音频标签在情感化 TTS 中的一些使用场景。

AI 音频中的情境感知

[whisper] 或 [shouting] 等标签让 Eleven v3 能针对当前场景做出反应。从放轻警告语气,到为悬念保留一段延长停顿,都能在脚本中构建动态情境感知。

如需完整了解,请查看我们的 AI 音频中的情境感知指南。

指导语音中的角色表演

编写多角色脚本时,需要清晰展现各个声音的不同之处。通过 [sarcastically] 调整角色个性,或用 [British accent] 定义说话方式,借助我们的 TTS 引擎即可呈现完整的情感范围。

进一步了解如何 指导 AI 语音中的角色表演

在语音中表达情感语境

音频标签可随着台词推进,塑造其情感表达。你可以在整段发言中逐步铺陈情绪,并在设想中角色达到最佳状态的那一刻推向高潮。[awe]、[booming] 和 [big laugh] 等标签可为 AI 语音表演构建完整的情感范围。

了解更多关于 AI 语音中的情感语境

让多角色对话生动起来

构建多角色对话表演时,可在每句开头添加音频标签,打造丰富的角色互动。

例如:Tom: [coughing] [beginning to speak] sorry I’m a little bit ill today— Emma: [interrupting] —Ill? You know how I hate coughing, Tom! Tom: [surprised] It’s just a little cough, it’s nothing serious. How would you feel if— Emma: [overlapping] [annoyed] —I think you need to go home.

了解如何通过 Eleven v3 中的多角色对话实现更多效果。

AI 语音的精准表达控制

可通过音频标签或标点,使用 Eleven v3 控制语音节奏。[pause]、[rushed] 或 [drawn out] 等标签让你精确塑造台词。也可以添加省略号、句号和感叹号,自然地为 TTS 表演注入情感。

我们还撰写了一份关于 Eleven v3 精准表达控制的详细指南。

API 支持情感化 TTS

通过文本转语音 API 使用音频标签的方式,与 ElevenLabs UI 完全相同。将标签直接写入脚本文本,API 就会在生成的音频中返回带相应表演效果的内容,适用于有声书 workflow、广告旁白配音等场景。

进一步了解 Eleven v3,或 联系销售,立即开始。

音频标签与情感化 TTS 常见问题

相关内容

用高质量 AI 音频创作