声音设计:首款音频生成式 AI
- 发布时间
上个月,我们宣布用于创建音色的生成式模型即将推出。现在,它终于来了,也是同类产品中的首创——我们称之为声音设计。通过这项功能,你可以选择性别、年龄、口音等核心特征,从零开始创建新音色。即使核心参数相同,每次点击生成时,模型也会加入随机性,确保听到的每个音色都独一无二。声音设计是我们为出版商和创作者提供更灵活的 AI 叙事工具所做的更广泛努力的一部分。
声音设计
声音设计背后的模型主要源自我们在语音合成和语音克隆方面的研究,不过我们一直都很喜欢生成式语音工具这个想法。生成式文生图和聊天机器人模型已展现出实际应用价值,但音频领域一直缺少类似工具。自产品推出以来,我们不断收到希望在声音库中增加更多说话人的请求。与其让声音库塞满数不清的音色,让你逐个试听预览来辨别它们,不如反过来,由你决定说话人身份,同时在这些限制内提供无限变化。
为音色选择提供一定程度的控制很重要,因为用户常常需要与脚本匹配的具体语音特征。确保每个生成的音色都独一无二同样关键,因为许多使用场景需要或至少能受益于专属音色。除了为用户提供新的创作方式,声音设计生成的音色完全由人工生成,不属于任何真实人物。
应用场景
除了使用我们的核心语音合成工具,轻松将文字转为高品质音频外,图书作者现在还可以使用声音设计,掌控叙述风格,并通过定制音色塑造每个角色的个性。
新闻出版商进军音频领域时,需要为报道选择音色。由于叙述者会与其代表的出版物形成关联,选择合适的旁白配音是一项重要且通常无需反复进行的工作。声音设计让出版商能立即挑选和比较几乎无数种叙述者音色,也让他们安心拥有一款仅代表自身的专属音色。
游戏开发者不再需要权衡某个角色是否值得投入录音成本。数以万计原本沉默的 NPC 如今都能拥有独特个性,进一步拓展虚拟沉浸感的边界。
无论你是正在筹备下一次发布的内容创作者,还是希望为公司沟通内容配音的企业管理者,现在都可以针对特定使用场景和受众,设计逼真且富有感染力的音频,可能性无限。
生态系统
声音设计是我们计划在今年推出的多项旁白编辑功能之一。接下来是Studio——这款全新工作站可用于组织长文本、插入停顿、重新生成音频片段,以及将部分文本分配给不同说话人。Studio 将于 3 月下旬推出,今年第 2 季度稍后还将加入语调编辑支持。



.jpg&w=3840&q=80)
