Eleven v3 Audio Tags:让 AI 音频具备情境感知
- 发布时间
- 最近更新
Audio Tags 是新版 Eleven v3(alpha)文本转语音模型的核心功能。它能让你控制台词的呈现方式——通过调整语气、情绪和节奏,贴合真实场景。
最简单来说,Audio Tags 就是方括号中的词。模型会将其理解为表演提示。因此,你可以在句中调整表达,以体现情绪变化或场景转换——让 AI 具备一定的情境感知能力。
AI 语音中的情境感知是什么?
情境感知意味着 AI 会根据当下场景调整表达方式。借助 Audio Tags,你不仅能控制模型说什么,还能控制它如何回应。
无论是用 [SHOUTING] 标签增强紧迫感,用 [WHISPER] 柔化警告语气,还是用 [SIGH] 表示犹豫,标签都能将叙述转化为表演。在高情境或动态场景中尤其有用。
不只是朗读,而是表演
想象一下,你正在为 11 United 对阵 12 United 的足球比赛编写 Veo 3 精彩集锦视频脚本。你希望紧张感随比赛推进而升级:“他晃过一名后卫——[EXCITED] 传中来了——[SHOUTING] 进——球——了!”
或者,你正在为一段悬疑 有声书片段配音:“[WHISPERING] 我觉得屋里有人。[PAUSE] 别出声。”
这不是简单的风格点缀。它们定义了场景,并塑造感受。模型不是在朗读,而是在表演。
常用情境标签
Audio Tags 可模拟多种情绪和肢体反应:
- 情绪语气: [EXCITED]、[NERVOUS]、[FRUSTRATED]、[TIRED]
- 反应: [GASP]、[SIGH]、[LAUGHS]、[GULPS]
- 音量与能量: [WHISPERING]、[SHOUTING]、[QUIETLY]、[LOUDLY]
- 节奏与韵律: [PAUSES]、[STAMMERS]、[RUSHED]
可以叠加标签,增添细腻变化:“[NERVOUSLY] 我……我不确定这能不能行。[GULPS] 但还是试试吧。”
可精准引导的表演
Eleven v3 通过更深入的上下文模型支持这些标签。它能在一句话中切换语气、处理打断并保持流畅,让表达更自然,无需重写脚本。
对于 声音设计师、游戏开发者和故事创作者而言,这开启了新的创作维度。你不只是在写台词,也是在指导表演。
选择合适的声音
专业语音克隆(PVC)目前尚未针对 Eleven v3 完全优化,与早期模型相比,克隆质量可能较低。在这一研究预览阶段,如果需要使用 v3 功能,建议为项目选择即时 语音克隆(IVC)或设计的音色。针对 v3 的 PVC 优化即将推出。



