首个会笑的 AI
- 发布时间
在上一篇文章中,我们展示了几段由语音合成工具生成的长文本示例,并简要介绍了模型的独特设计如何让语音节奏自然、不显机械。今天,我们将向你展示,它的情感更丰富、上下文理解能力也比其他任何模型更强。因此,它不仅更引人入胜,也适用于图书、有声游戏和广告等多种场景。
情感
模型的两大优势——流畅度和恰当的语调——源于其学习过的大量训练数据(超过 50 万小时!)。但更关键的是它从这些数据中学习的方式,而这取决于模型的构建方式。从最基础层面来说,它能理解文字中的情感,并判断说话者应表现得开心、愤怒、悲伤还是平静。来看几个例子:
语调和情绪的所有差异完全来自文本,没有其他因素影响输出。标点和词义在决定一句话该如何表达时起着关键作用。不过,请注意,当说话者为胜利感到高兴时,模型还能逼真地生成笑声等不属于常规语言的声音(我们很快会发布 AI 能生成的各种笑声合集!)。同样,当说话者觉得某件事特别好笑时,它会恰当地夸张这种反应——太太太好笑了。
上下文
但仅仅了解单个词的含义还不够。模型同样能感知每句话所处的更广泛语境,通过与前后文本的关联判断内容是否合理。正如上一篇长篇内容文章所展示的,这种全局视角让它能用统一的情感模式贯穿多个句子的思路,从而准确处理较长段落的语调。同时,它也能避免逻辑错误。例如,有些词拼写相同却含义不同,如现在时和过去时的 “read”,或表示时间单位和微小之意的 “minute”。具体该选择哪个含义,取决于上下文:
书面语与口语
我们的平台面向长文本内容,因此模型还需要理解:书面语中常见的符号、缩写和某些表达惯例,应以特定方式发音,或不应按字面读出。例如,模型需要知道 FBI、TNT 和 ATM 的读法不同于 UNESCO 或 NASA。同样,$3tr 在书面语中完全没问题,但朗读时应读作“3 万亿美元”。
人工干预
识别这些细微差别至关重要,因为我们的目标是尽量减少生成过程中的人工干预。毕竟,我们宣传工具能在几分钟内生成有声书,并不是为了让人听完整段音频后再重写全文。尽管我们持续更新模型的发音规则,它仍有可能被某些内容难住。为此,我们正在开发不确定性标记系统,让用户立即看到模型认为有问题的文本片段,并教它这些内容该如何发音。
丰富应用
我们展示的所有能力,都是让软件成为最灵活 AI 配音工具的重要一步。
新闻出版商早已发现,增加音频内容是留住订阅者的好方法。为每篇文章嵌入音频朗读,最大的好处是人们可以一边做其他事一边收听。这样做的出版商通常会聘请配音演员,成本高昂,而且无法覆盖所有文章;或者让记者自己朗读报道,耗时也意味着成本高。使用合成语音为内容配音虽能省钱,却往往要牺牲质量。现在,有了 ElevenLabs,无需再做取舍,两者可以兼得。
再想象一下,在几分钟内生成有声书,让每个角色都有独特且富有情感张力的旁白配音。这不仅提供了全新的阅读方式,也大大改善了有学习障碍人士的获取体验。
想想如今为视频游戏开发者带来的可能性:他们不再需要考虑某个角色是否足够重要,是否值得花高昂成本请真人配音。现在,所有 NPC 都能拥有自己的声音和个性。
广告代理商和制作人现在可以自由尝试并调整旁白配音,以适应任何广告活动的调性——无论是体育电视频道还是奢侈腕表品牌。任何演员的声音都可以获得授权进行克隆,无需演员亲自到场即可立即完成修改。或者,如果选择完全合成的声音,广告主也无需担心支付声音使用权的买断费用。
虚拟助手可以变得更加逼真,这既是因为语音克隆让它们能使用特定用户熟悉的声音说话,也是因为这种更丰富的表达让互动感觉更自然。
ElevenLabs Beta
前往这里注册 Beta 平台,亲自体验。我们持续改进产品,在这个早期阶段,每一条用户反馈都非常宝贵。尽情体验吧!



