Eleven v3 Audio Tags:让多角色对话生动呈现
- 发布时间
- 最近更新
对话推动故事发展。有了 Eleven v3 Audio Tags,现在可以编写包含声音重叠、快速交锋和情绪互动的场景——全部由一个模型完成演绎。
结合 [interrupting]、[overlapping] 或 [laughs] 等标签,可以创作如真人对话般自然流畅的内容——包含打断、语气变化和即兴反应。
这不只是逐句语音,而是多角色表演。
什么是 AI 语音中的多角色对话?
多角色对话是指 一个语音模型 在同一场景中演绎多个不同角色。每个角色都有不同的风格、语气或节奏——有时还会打断对方或同时说话。
使用 Eleven v3,可以直接这样编写: Marissa:[starting to speak] 我刚在想,我们可以—— Chris:[interrupting] ——测试新的时间控制功能?Marissa:[surprised] 没错!你怎么—— Chris:[overlapping] ——知道我在想什么?蒙对了!Marissa:[laughs] 说真的?这还挺有趣。
效果就像真实对话,而不是拼接出来的旁白。
从配音到互动
过去需要多位说话者、多次录制和时间调整才能完成的内容,现在一份脚本就能处理。标签让你能在同一场景中独立指导每个声音。
示例:Jessica:[whispers] 像这样。Von Fusion:[sarcastically] 哦,看看你,时髦小姐。Jessica:[French accent] 太精彩了,不是吗?
这些声音不只是轮流出现——还会互动、回应和重叠。
多角色控制常用标签
以下是编写自然、灵活对话的一些关键标签:
- 轮流说话提示: [interrupting]、[overlapping]、[cuts in]
- 情绪变化: [excited]、[annoyed]、[flustered]、[casual]
- 节奏控制: [fast-paced]、[hesitates]、[pause]、[drawn out]
- 身份切换: [childlike tone]、[deep voice]、[pirate voice]、[robotic tone]
可叠加使用这些标签,营造富有表现力的互动:[frustrated] 你从来不听我说话—— [interjecting] 因为你从来不把话说清楚!
重叠、节奏与临场感
Eleven v3 支持感知时机的表达方式,让声音能自然地打断彼此或同时说话。这对呈现幽默、紧张感或真实感至关重要。
以下片段:Marissa:[panicking] 等等,我们要崩溃了吗?我分不清这是功能还是—— Chris:[interrupting] Bug!Marissa:[sighing] 是,但说真的?这还挺有趣。`
场景充满活力,因为互动流畅自然,而非按顺序逐句编排。
指导场景,而不只是句子
借助 Eleven v3,对话场景将成为精心编排的表演。只需一份脚本和一个模型,就能构建完整对话——包括角色、时机、情绪和表达方式。
对于故事创作者、游戏编剧和交互设计师,这让你无需增加制作成本,也能创作复杂场景。你不只是在写台词,而是在指导角色之间的互动。
选择合适的声音
专业语音克隆(PVC)目前尚未针对 Eleven v3 完全优化,因此克隆质量可能低于早期模型。在此研究预览阶段,如果需要使用 v3 功能,建议为项目选择即时 语音克隆(IVC)或设计音色。面向 v3 的 PVC 优化即将推出。


