推出 Eleven v4认识 Eleven v4:迄今情感表现最丰富的模型。 Creator+ 套餐含 3 倍点数优惠,截止至 10 月 12 日

跳至内容

情感文本转语音:如何使用 Eleven v4 指导演绎 AI 语音

发布时间
最近更新

收听收听本文

情感文本转语音(TTS)能将脚本变成一场表演。情感 TTS 模型不再单调朗读,而是带着情绪演绎每个词,让愤怒、喜悦、悲伤、挫败等情感赋予场景生命力。

将 Audio Tags 融入脚本,就能像导演一样塑造文本转语音的演绎效果。添加 [furious] 可增强台词力度,添加 [sarcastic] 可带来一丝冷幽默,或使用任何其他标签,告诉模型你希望如何演绎这句台词。

借助 Eleven v4,你可以逐句指导情感 TTS。下面介绍如何编写让文字鲜活起来的脚本。

什么是情感文本转语音?

情感文本转语音是由 AI 生成的语音,它不是简单朗读,而是演绎台词。它能够表达情绪,理解时机和节奏,强调恰当的词语,并加入叹息、笑声等非语言声音。

Eleven v4 是一款突破性模型,能将文本转化为真正的表演。通过行内描述,同一句话可以根据你的构想以耳语、呐喊或泪中带泣的方式呈现。

无论是在为下一次产品发布撰写广告活动文案,还是让小说章节鲜活起来,Eleven v4 都能通过 最高质量的文本转语音 助你实现创作。

Eleven v4 如何理解情感指导

Eleven v4 会从脚本中的 Audio Tags 获取情感指导线索,并将其转化为自然的音频表演。

以下是几种使用 Eleven v4 为文本添加情感指导、提升最终输出效果的方法:

  • Audio Tags: 在指令中写入 Audio Tags,例如 [whispers] 或 [cries],即可在脚本中加入行内指导。你可以像指导舞台表演者一样指导 v4,创建富有情感层次的场景。
  • 标点符号: 配合 Audio Tags 使用标点符号,塑造节奏和表达方式。省略号让台词放慢,破折号让说话者在句中停下,感叹号则增强力度,无需添加标签也能提供另一层指导。
  • 情感延续: 以一种情绪开启句子,Eleven v4 会将这种语气延续至整句。逐步构建场景,并在 v4 中通过音频标签创建丰富、有上下文的脚本。

为了展示 Audio Tags 如何通过 v4 让文字鲜活起来,下面以带标签和不带标签的音频为例进行对比。

第一个示例仅使用默认句子。供参考,这些示例使用的是 Siren。

Eleven v4 中不含 Audio Tags 的故事段落

The night was quiet, almost unnaturally so. Until I heard the old gate creak open behind me.
I turned slowly and called out, "Is anyone there?"
No answer.
Then, from somewhere in the darkness came a low, quiet laugh.
I took a step back. "You really shouldn't have come here," a voice whispered.
And then the lights went out.
0:00

第二个示例使用相同的句子,但添加了 Audio Tags。其中包含情感提示、音效,甚至还有文字之外的声音,例如邪恶的笑声。

Eleven v4 中含 Audio Tags 的故事段落

[hesitant] The night was quiet, almost unnaturally so.
[nervous] Then I heard the old gate creak open behind me. [gate creaking] [scared] I turned slowly and called out, "Is anyone there?"
[tense, cautious] No answer.
[silence] [whispering, fearful] Then, from somewhere in the darkness, came a low, quiet laugh. [evil laugh] [alarmed] I took a step back. [footstep] [low, threatening] "You really shouldn't have come here." A voice whispered.
[whisper] [terrified] And then the lights went out. [light switch clicking]
0:00
Eleven v4 emotional text to speech uses audio tags, punctuation, and emotional continuity to direct emotion.

使用 Eleven v4 演绎 5 种情感文本转语音

想了解 Eleven v4 的完整表现范围,最好的方法就是亲自试用。创建账户后,几分钟内即可开始使用 Eleven v4。

为了展示这款情感文本转语音模型的能力,下面将同一句台词演绎 5 次。每句都配有不同的舞台指导,清楚展示模型能做到什么。

以下 5 张卡片均使用“我没想到你真的会回来。”这句文本,并搭配情感丰富的 Audio Tag。供参考,这些示例同样使用 Siren。

添加 [furious]

辅音更加硬朗,爆破音也更明显。台词听起来怒气冲冲,仿佛是在指责对方。

[furious]

[furious] I didn't think you'd actually come back
0:00

添加 [excited]

音高上扬、语速加快,同一句话变成了愉快的欢迎。

[excited]

[excited] I didn't think you'd actually come back.
0:00

添加 [sarcastic]

音高变得平缓,词语中的元音被拉长。讽刺是 Audio Tags 的绝佳用法,因为说出的字词与语气传达的含义恰好相反。

[sarcastic]

[sarcastic] I didn't think you'd actually come back.
0:00

添加 [crying]

这一版催人泪下。表达变慢,并在句中哽咽中断。你会发现,呼吸声在这里发挥了重要作用。

[crying]

[crying] I didn't think you'd actually come back.
0:00

添加 [worried]

声音更轻,也略显犹豫,[worried] 让这句台词失去了原有的笃定。

[worried] I didn't think you'd actually come back.
0:00

编写 AI 可演绎脚本的技巧

我们让 ElevenLabs 文本转语音应用尽可能直观易用。进入页面后即可开始输入,也可以添加描述性 Audio Tags,将特定声音或情绪融入场景。

以下技巧可帮助你通过 Eleven v4 的情感文本转语音获得最佳效果:

  1. 反复调整指导: 如果一句台词效果不理想,换个标签,而不是重写文本。尝试用 [worried] 替换 [sad],或用 [sarcastic] 替换 [annoyed],不断重新生成,直到表达效果符合预期。
  2. 一次生成完整场景: 单独的句子也能带来细腻的演绎效果(如上文所示),但 Eleven v4 最适合处理段落或文本片段。为模型提供足够文本以建立场景上下文,有助于提升整段表现。使用 Eleven v4 时,每次可在 TTS 应用中输入最多 10,000 个字符。
  3. 每个短语只用一种情绪: 虽然可以在一个句子中叠加多个 Audio Tags,但最好每个句子片段只使用一个,以免造成混淆。使用相互矛盾的情绪作为指导,可能导致输出不够准确。或者,在想要影响的确切分句之前添加标签;如果想在句中改变情绪,则在该分句之后添加新标签。

掌握这些技巧后,很快就能将文本转化为表演。

Three tips for AI-ready scripts: iterate, generate full scenes, and use one emotion per phrase.

使用 Eleven v4 开始创作情感文本转语音

本文中的所有内容,均通过 ElevenLabs 文本转语音应用,使用脚本、音色以及 Eleven v4 中少量的 Audio Tags 生成。

要创建自己的场景,只需选择一种音色,粘贴写好的台词,然后指导你的第一场表演。

了解更多 Eleven v4,或注册并开始使用,生成你的第一段音频。

情感文本转语音 AI 常见问题

相关内容

用高质量 AI 音频创作