跳至内容

迈向实时配音之路

发布时间
最近更新

收听收听本文

对一些人来说,实时配音会让人想起《银河系漫游指南》中的巴别鱼。 

巴别鱼会“以脑波能量为食,吸收无意识频率,并将有意识频率矩阵排入大脑的语言中枢”。实际上,这意味着只要把它放进耳朵,无论有人用什么语言和你说话,你都会立刻听到仿佛用母语说出的内容(而且完全听不到原始音频)。 

在能够读取脑波之前,我们仍需聆听说话者的话语,再将其翻译成目标语言。试图在每个词刚说出口时就立刻翻译,会面临真正的挑战。 

假设要将英语翻译成西班牙语。说话者先说“The”。在西班牙语中,阳性词前的“The”译为“El”,阴性词前则译为“La”。因此,在听到更多内容前,我们无法确定该如何翻译“The”。 

Realtime Dubbing Diagram 1

假设说话者接着说“The running water”。现在已有足够信息,可将前三个词译为“El agua corriente”。如果后半句是“The running water is too cold for swimming”,那就很顺利。 

Real-time dubbing diagram 2

但如果说话者接着说“The running water buffalo…”,我们就得回头修正。 

Real-time dubbing diagram 3

再进一步说,如果说话者接着说“The running water buffalo protected her calf”,句首本应使用“La búfala”,而不是“El búfalo”。

这类“花园路径”句子在许多语言中都存在:它们开头容易让听者产生错误的初步理解。 

对于某些应用场景,你或许可以接受因过早开始配音而需要回头修正。对于其他场景,则可以通过增加延迟来提高准确性。考虑到所有配音应用都不可避免存在一定延迟,我们将“实时”配音定义为一种可持续流式传输音频并返回译文内容的服务。

Translation Pipeline

实时配音的最佳应用场景

实时配音最适合以下商业应用:

  • 面向全球受众
  • 直播内容
  • 可接受一定 播出延迟

体育赛事

Forbes 在 2019 年报道,NBA 的国际电视转播权收入达 $500m。NFL 目前正在 巴西、英国、德国和墨西哥举办比赛,因为其将国际扩张视为未来的核心收入驱动力。 

虽然大多数体育赛事都面向直播观看,但无论是否意识到,人们早已习惯一定的延迟。从体育场拍摄的画面传到家中屏幕,可能需要 5 秒到数分钟不等。

通常,现场会有多位摄像和收音人员,将画面传送至制作中心。制作中心会切换不同机位、混合音频、叠加图形并添加解说。他们还可能有意增加额外延迟,以便监听并消除脏话或其他意外内容。

主制作信号会发送至广播网络,后者会加入自身品牌和广告,再分发给各地网络。最后,最后一公里服务商通过有线网络、卫星信号和流媒体服务将内容提供给消费者。

Broadcast latency

许多制作方表示,配音额外增加最多 20 秒延迟是可以接受的。观众能用母语收听,这一优势足以弥补额外延迟。

体育公司最重视提供高质量产品,而他们认为关键在于准确捕捉解说员的情绪和节奏。“他射门了,进球了!”必须充满激情地传达。 

支撑配音服务的语音克隆模型能够捕捉原说话者的情绪和表达方式。与翻译不同,更多上下文不一定带来更好的结果。不过,我们目前还达不到西班牙足球解说员那样的情绪表现力!

每个克隆音色都是其输入内容的平均结果。如果将平淡说出的“They are going to need to be more aggressive with only two minutes remaining.”与“He shoots, he scores!”结合,生成的克隆音色会呈现两者的平均表达方式。 

Dubbing Studio Soccer Announcer

目前,我们可以通过为 语音克隆设置比文本转录翻译更短的上下文长度来解决这个问题。未来,我们预计可通过向配音模型提供更多上下文(如图像和视频),或创建原说话者的“情绪转录稿”并据此指导配音音频的表达,进一步提升效果。

新闻播报

与“直播”体育赛事一样,新闻播报也要经过会增加延迟的制作流程。根据我们与媒体公司的交流,精准还原情绪固然重要,但相对没那么关键,通常也更容易做到,因为大多数新闻主播的表达方式十分稳定。不过,翻译既准确又细腻至关重要。 

除了自动翻译服务可能出错外,某些概念也没有直接对应的译法。请看以下示例:

“社区民众齐聚一堂,举行纪念日活动。幸存者分享了他们的故事,长者则进行了传统祈祷,以祈求疗愈。”

西班牙语:“La comunidad se reunió para un día conmemorativo, donde los sobrevivientes compartieron sus historias y los ancianos realizaron oraciones tradicionales para la sanación.”

虽然从技术上说译文准确,但在历史创伤语境中,“survivors”和“sobrevivientes”承载的意味不同:英语中的前者往往暗含坚韧与尊严,而“sobrevivientes”则可能更强调受害者身份。同样,“performed prayers”和“realizaron oraciones”在庄重感上也有差异:“performed”承认仪式的重要性,而“realizaron”听起来更像是程序化操作。

延伸:迈向对话式配音之路

若要让说不同语言的人自然地面对面交流,就需要近乎即时的翻译。 

利用 LLM 的下一词元预测概率,可以实时建立句子后续走向的可能性模型。

LLM Probabilities - Hugging Face

图片来源:Hugging Face《如何生成文本》

如果针对个体说话者微调这一下一词元预测模型,就能较为合理地判断他们接下来可能说什么。利用这些信息,在高度确定说话者后续表达时,我们可以通过提前进行翻译和语音生成来“抢跑”。

觉得这很有意思,并想与我们一起探索 AI 音频的未来?查看 这里的开放职位

相关内容

用高质量 AI 音频创作