跳至内容

什么是 Audio Tags?情感 TTS 完整指南

发布时间
最近更新

收听收听本文

Audio Tags 是用方括号标注的自然语言提示,例如 [laughs]、[gasps]、[excited] 和 [worried]。Eleven v3 会将其识别为表演指导,而非需要朗读的文字。为文本转语音模型编写脚本时,插入这些 Audio Tags,即可精细控制文本的情感表达。 

Eleven v3 于 2026 年 3 月正式面向公众开放。在 v3 之前,要让 文本转语音模型需要反复重新生成内容,并寄希望于获得理想结果。Audio Tags 消除了这种不确定性,让你完全掌控情感化文本转语音的表达。

本指南将介绍 Audio Tags 是什么、如何工作、可用的所有标签类别,以及它们与 SSML(语音合成标记语言)的区别。还会讲解常见使用场景,并链接到对应的详细指南。

摘要

  • Audio Tags 是方括号内的提示,如 [shouts] 或 [excited],可在 Eleven v3 的 TTS 中指导情绪、节奏、表达方式和语调。
  • Eleven v3 不支持 SSML,但以 Audio Tags 替代,让编写体验更自然。
  • 标签涵盖情绪、表达与节奏、人类反应、口音和音效等类别。
  • 文本中的标点和大写可用于塑造 AI 语音的节奏。
  • 可通过 ElevenLabs 的 UI 或 API 使用 Audio Tags。

Audio Tags 如何工作?

Audio Tags 直接嵌入文稿,并用方括号包裹。想让表达方式发生变化时,例如从普通语气转为 [worried],只需添加相应的音频标签。

单个句子中也可以使用多个标签,将它们组合起来,呈现更丰富的表达效果,例如 [tired] 今天真是漫长的一天…… [upset] 我还能撑多少天?

Eleven v3 的架构让模型比早期模型更深入地理解上下文,无需单独参数或设置,即可遵循情感提示、语调变化、说话人切换和上下文线索。只要告诉模型当下需要什么,它就会按你的设想演绎这句话。

Eleven v3 还能处理自然流畅的多说话人对话,包括打断、情绪变化和真实对话中的自然互动,这些都仅需依靠标签和脚本结构实现。

Audio Tags 与 SSML

如果你用过其他 TTS 系统,可能接触过语音合成标记语言。Amazon Polly 和 Microsoft Azure Speech 等平台会使用 <break> 或 <emphasis> 等 SSML 标签,为 TTS 脚本提供额外上下文。

Eleven v3 不支持 SSML 的 break 标签及其他 SSML 标签。Audio Tags、标点符号和文本结构将取代这些功能,同时提供精细的表达控制。

可使用下表,将常见 SSML 标签对应到 Eleven v3 中的等效方式。

What it does
<break time=”1s”>
Inserts a pause
<prosody rate=”slow”>
Slows down speech
<prosody rate=”fast”>
Speeds speech up
<emphasis>
Stresses a particular word
<prosody pitch=”high”>
Shifts pitch higher
<prosody pitch=”low”>
Shifts pitch lower
Eleven v3 equivalent
<break time=”1s”>
[pause], an ellipsis in your text, or a line break
<prosody rate=”slow”>
[drawn out] or [slowly]
<prosody rate=”fast”>
[rushed]
<emphasis>
[shouts] or capitalizing a word
<prosody pitch=”high”>
Emotional tags like [excited]
<prosody pitch=”low”>
Emotional TTS tags like [softly] or [sorrowful]

从写作者的角度来看,在一句话中加入 [whispers],比配置 韵律 速率省力得多。

v3 中的 Audio Tags 类别:用 Audio Tags 指导表演

可在脚本任何位置添加 Audio Tags,实时调整表达。也可以在脚本甚至单个句子中组合使用多个标签。

标签分为以下核心类别。

情绪

这些标签可设定声音的情感基调,无论是低沉、强烈还是欢快。例如,可以单独或组合使用 [sad]、[angry]、[happily] 和 [sorrowful]。

Background
Background

表达与节奏

这类标签更侧重语调和演绎。可用于调整音量和能量,适用于需要克制或强烈表现的场景,例如 [whispers]、[shouts] 和 [softly]。

Background
Background

人类反应

真正自然的语音包含反应。例如,可将自然、即兴的瞬间嵌入语音,增添真实感。[laughs]、[clears throat] 和 [sighs] 等标签都有助于让 TTS 模型传达出人类情感。

其他音频标签类别还包括:

  • 口音和角色声音: 口音标签无需切换模型,即可让声音转换为特定地区口音或角色,例如 [French accent]、[British accent] 或 [pirate voice]。用它们可将单一声音变为灵活的角色阵容,而不是固定的一种演绎。
  • 音效: 音效标签可直接将非语音音频加入生成结果,例如 [gunshot]、[explosion] 和 [clapping]。它们适合沉浸式音频、游戏和戏剧化旁白等需要不止声音的场景。或者,也可以使用 ElevenCreative AI 音效生成器

标签能提供高度控制,标点同样可用于塑造节奏和强调。例如,添加省略号可形成自然停顿,使用逗号可营造自然的呼吸节奏。还可将单词全部大写来强调:“我现在就要。”

Background
Background

Audio Tags 能做什么?

Audio Tags 能以直观方式释放脚本的情感复杂度。自然写作,随写随加标签即可。

以下简要介绍 Audio Tags 在情感化 TTS 中的一些应用场景。

AI 音频中的情境感知

[whisper] 或 [shouting] 等标签让 Eleven v3 能对当下情境作出反应。从柔和地发出警告,到用拉长的停顿营造悬念,都可以在脚本中构建动态情境感知。

如需完整解析,请查看我们的 AI 音频中的情境感知 指南。

指导语音中的角色演绎

构建多角色脚本时,需要清楚展现每种声音的差异。从用 [sarcastically] 调整角色个性,到用 [British accent] 定义说话方式,都能借助我们的 TTS 引擎捕捉完整的情感范围。

了解更多关于 指导 AI 语音中的角色演绎 的内容。

表达语音中的情感语境

Audio Tags 可随台词推进塑造情感表达。你可以在整段演讲中逐步铺陈情绪,在设想角色达到最佳状态的时刻推向高潮。[awe]、[booming] 和 [big laugh] 等标签可为 AI 语音表演构建完整的情感范围。

详细了解如何在 AI 语音中运用情感语境

让多角色对话生动起来

构建多角色对话表演时,可在每句开头添加音频标签,打造丰富的角色互动。

例如:Tom:[coughing] [beginning to speak] 抱歉,我今天有点不舒服—— Emma:[interrupting] ——不舒服?你知道我有多讨厌咳嗽,Tom!Tom:[surprised] 只是有点咳嗽,没什么严重的。要是你会怎么想—— Emma:[overlapping] [annoyed] ——我觉得你该回家了。

了解使用 Eleven v3 多角色对话 还能实现什么。

AI 语音的精准表达控制

可通过 Audio Tags 或标点符号控制 Eleven v3 的语音节奏。[pause]、[rushed] 或 [drawn out] 等标签可让你精确塑造台词。也可以加入省略号、句号和感叹号,自然地为 TTS 表演注入情感。

我们撰写了关于 Eleven v3 精准表达控制 的深入指南。

API 支持情感化 TTS

通过 文本转语音 API 使用音频标签的方式与 ElevenLabs UI 相同。将标签直接写入脚本文本,API 就会在生成的音频中返回带相应演绎效果的结果,适用于有声书流程、广告旁白等场景。

了解更多 Eleven v3,或 联系销售团队,立即开始。

Audio Tags 与情感化 TTS 常见问题

相关内容

用高质量 AI 音频创作