推出 Eleven v4认识 Eleven v4:迄今情感表现最丰富的模型。 Creator+ 套餐含 3 倍点数优惠,截止至 10 月 12 日

跳至内容

Eleven v3 Audio Tags:让 AI 音频具备情境感知

发布时间
最近更新

收听收听本文

Audio Tags 是新版 Eleven v3(alpha)文本转语音模型的核心功能。它能让你控制台词的呈现方式——通过调整语气、情绪和节奏,贴合真实场景。

最简单来说,Audio Tags 就是方括号中的词。模型会将其理解为表演提示。因此,你可以在句中调整表达,以体现情绪变化或场景转换——让 AI 具备一定的情境感知能力。

AI 语音中的情境感知是什么?

We're off under the lights here for this semifinal clash, the stadium buzzing with anticipation. Eleven Labs united in their iconic black and white shirts, pushing forward with intent straight from the opening whistle. [excited] The ball is zipped out wide, early attack here. Driving down the wing, pace to burn, [shouting] he skids past one, skips past two. Oh, this is beautiful. One-on-one with the fullback, cuts inside. Oh, that's a lovely bit of footwork. PURE MAGIC on the pitch. ElevenLabs on top form tonight.
0:00

情境感知意味着 AI 会根据当下场景调整表达方式。借助 Audio Tags,你不仅能控制模型说什么,还能控制它如何回应。

无论是用 [SHOUTING] 标签增强紧迫感,用 [WHISPER] 柔化警告语气,还是用 [SIGH] 表示犹豫,标签都能将叙述转化为表演。在高情境或动态场景中尤其有用。

不只是朗读,而是表演

想象一下,你正在为 11 United 对阵 12 United 的足球比赛编写 Veo 3 精彩集锦视频脚本。你希望紧张感随比赛推进而升级:“他晃过一名后卫——[EXCITED] 传中来了——[SHOUTING] 进——球——了!”

或者,你正在为一段悬疑 有声书片段配音:“[WHISPERING] 我觉得屋里有人。[PAUSE] 别出声。”

这不是简单的风格点缀。它们定义了场景,并塑造感受。模型不是在朗读,而是在表演。

常用情境标签

Audio Tags 可模拟多种情绪和肢体反应:

  • 情绪语气: [EXCITED]、[NERVOUS]、[FRUSTRATED]、[TIRED]
  • 反应: [GASP]、[SIGH]、[LAUGHS]、[GULPS]
  • 音量与能量: [WHISPERING]、[SHOUTING]、[QUIETLY]、[LOUDLY]
  • 节奏与韵律: [PAUSES]、[STAMMERS]、[RUSHED]

可以叠加标签,增添细腻变化:“[NERVOUSLY] 我……我不确定这能不能行。[GULPS] 但还是试试吧。”

可精准引导的表演

Eleven v3 通过更深入的上下文模型支持这些标签。它能在一句话中切换语气、处理打断并保持流畅,让表达更自然,无需重写脚本。

对于 声音设计师、游戏开发者和故事创作者而言,这开启了新的创作维度。你不只是在写台词,也是在指导表演。

选择合适的声音

专业语音克隆(PVC)目前尚未针对 Eleven v3 完全优化,与早期模型相比,克隆质量可能较低。在这一研究预览阶段,如果需要使用 v3 功能,建议为项目选择即时 语音克隆(IVC)或设计的音色。针对 v3 的 PVC 优化即将推出。

相关内容

用高质量 AI 音频创作