什么是 Audio Tags?情感 TTS 完整指南
- 发布时间
- 最近更新
Audio Tags 是用方括号标注的自然语言提示,例如 [laughs]、[gasps]、[excited] 和 [worried]。Eleven v3 会将其识别为表演指导,而非需要朗读的文字。为文本转语音模型编写脚本时,插入这些 Audio Tags,即可精细控制文本的情感表达。
Eleven v3 于 2026 年 3 月正式面向公众开放。在 v3 之前,要让 文本转语音模型需要反复重新生成内容,并寄希望于获得理想结果。Audio Tags 消除了这种不确定性,让你完全掌控情感化文本转语音的表达。
本指南将介绍 Audio Tags 是什么、如何工作、可用的所有标签类别,以及它们与 SSML(语音合成标记语言)的区别。还会讲解常见使用场景,并链接到对应的详细指南。
摘要
- Audio Tags 是方括号内的提示,如 [shouts] 或 [excited],可在 Eleven v3 的 TTS 中指导情绪、节奏、表达方式和语调。
- Eleven v3 不支持 SSML,但以 Audio Tags 替代,让编写体验更自然。
- 标签涵盖情绪、表达与节奏、人类反应、口音和音效等类别。
- 文本中的标点和大写可用于塑造 AI 语音的节奏。
- 可通过 ElevenLabs 的 UI 或 API 使用 Audio Tags。
Audio Tags 如何工作?
Audio Tags 直接嵌入文稿,并用方括号包裹。想让表达方式发生变化时,例如从普通语气转为 [worried],只需添加相应的音频标签。
单个句子中也可以使用多个标签,将它们组合起来,呈现更丰富的表达效果,例如 [tired] 今天真是漫长的一天…… [upset] 我还能撑多少天?
Eleven v3 的架构让模型比早期模型更深入地理解上下文,无需单独参数或设置,即可遵循情感提示、语调变化、说话人切换和上下文线索。只要告诉模型当下需要什么,它就会按你的设想演绎这句话。
Eleven v3 还能处理自然流畅的多说话人对话,包括打断、情绪变化和真实对话中的自然互动,这些都仅需依靠标签和脚本结构实现。
Audio Tags 与 SSML
如果你用过其他 TTS 系统,可能接触过语音合成标记语言。Amazon Polly 和 Microsoft Azure Speech 等平台会使用 <break> 或 <emphasis> 等 SSML 标签,为 TTS 脚本提供额外上下文。
Eleven v3 不支持 SSML 的 break 标签及其他 SSML 标签。Audio Tags、标点符号和文本结构将取代这些功能,同时提供精细的表达控制。
可使用下表,将常见 SSML 标签对应到 Eleven v3 中的等效方式。
从写作者的角度来看,在一句话中加入 [whispers],比配置 韵律 速率省力得多。
v3 中的 Audio Tags 类别:用 Audio Tags 指导表演
可在脚本任何位置添加 Audio Tags,实时调整表达。也可以在脚本甚至单个句子中组合使用多个标签。
标签分为以下核心类别。
情绪
这些标签可设定声音的情感基调,无论是低沉、强烈还是欢快。例如,可以单独或组合使用 [sad]、[angry]、[happily] 和 [sorrowful]。
表达与节奏
这类标签更侧重语调和演绎。可用于调整音量和能量,适用于需要克制或强烈表现的场景,例如 [whispers]、[shouts] 和 [softly]。
人类反应
真正自然的语音包含反应。例如,可将自然、即兴的瞬间嵌入语音,增添真实感。[laughs]、[clears throat] 和 [sighs] 等标签都有助于让 TTS 模型传达出人类情感。
其他音频标签类别还包括:
- 口音和角色声音: 口音标签无需切换模型,即可让声音转换为特定地区口音或角色,例如 [French accent]、[British accent] 或 [pirate voice]。用它们可将单一声音变为灵活的角色阵容,而不是固定的一种演绎。
- 音效: 音效标签可直接将非语音音频加入生成结果,例如 [gunshot]、[explosion] 和 [clapping]。它们适合沉浸式音频、游戏和戏剧化旁白等需要不止声音的场景。或者,也可以使用 ElevenCreative AI 音效生成器。
标签能提供高度控制,标点同样可用于塑造节奏和强调。例如,添加省略号可形成自然停顿,使用逗号可营造自然的呼吸节奏。还可将单词全部大写来强调:“我现在就要。”
Audio Tags 能做什么?
Audio Tags 能以直观方式释放脚本的情感复杂度。自然写作,随写随加标签即可。
以下简要介绍 Audio Tags 在情感化 TTS 中的一些应用场景。
AI 音频中的情境感知
[whisper] 或 [shouting] 等标签让 Eleven v3 能对当下情境作出反应。从柔和地发出警告,到用拉长的停顿营造悬念,都可以在脚本中构建动态情境感知。
如需完整解析,请查看我们的 AI 音频中的情境感知 指南。
指导语音中的角色演绎
构建多角色脚本时,需要清楚展现每种声音的差异。从用 [sarcastically] 调整角色个性,到用 [British accent] 定义说话方式,都能借助我们的 TTS 引擎捕捉完整的情感范围。
了解更多关于 指导 AI 语音中的角色演绎 的内容。
表达语音中的情感语境
Audio Tags 可随台词推进塑造情感表达。你可以在整段演讲中逐步铺陈情绪,在设想角色达到最佳状态的时刻推向高潮。[awe]、[booming] 和 [big laugh] 等标签可为 AI 语音表演构建完整的情感范围。
详细了解如何在 AI 语音中运用情感语境。
让多角色对话生动起来
构建多角色对话表演时,可在每句开头添加音频标签,打造丰富的角色互动。
例如:Tom:[coughing] [beginning to speak] 抱歉,我今天有点不舒服—— Emma:[interrupting] ——不舒服?你知道我有多讨厌咳嗽,Tom!Tom:[surprised] 只是有点咳嗽,没什么严重的。要是你会怎么想—— Emma:[overlapping] [annoyed] ——我觉得你该回家了。
了解使用 Eleven v3 多角色对话 还能实现什么。
AI 语音的精准表达控制
可通过 Audio Tags 或标点符号控制 Eleven v3 的语音节奏。[pause]、[rushed] 或 [drawn out] 等标签可让你精确塑造台词。也可以加入省略号、句号和感叹号,自然地为 TTS 表演注入情感。
我们撰写了关于 Eleven v3 精准表达控制 的深入指南。
API 支持情感化 TTS
通过 文本转语音 API 使用音频标签的方式与 ElevenLabs UI 相同。将标签直接写入脚本文本,API 就会在生成的音频中返回带相应演绎效果的结果,适用于有声书流程、广告旁白等场景。










