Eleven Multilingual v1 全新多语言语音合成模型上线
- 发布时间
今天,我们很高兴推出 Eleven Multilingual v1——这款先进的语音合成模型新增支持 7 种语言:法语、德语、印地语、意大利语、波兰语、葡萄牙语和西班牙语。该模型基于驱动 Eleven Monolingual v1 的研究打造。当前的深度学习方案在日益复杂的模型中采用更多数据、更强算力和创新技术,能够理解文本中的细微差别,并呈现丰富情感。这项进展拓展了创作者、游戏开发者和出版商的创作空间,也为通过生成式媒体打造更本地化、更易获取、更具想象力的内容铺平道路。
新模型适用于所有订阅套餐,现在即可在 Beta 平台试用。
只需在“语音合成”面板新增的下拉菜单中选择即可使用。
研究概览
与前代产品一样,新模型完全基于内部研究。它保留了让 Eleven Monolingual v1 成为出色叙事工具的所有优势,例如可根据上下文调整表达方式,并以高度逼真的方式传达意图和情感。现在,这些能力已通过多语言数据训练扩展至新增支持的语言。
该模型的一项显著功能是能够识别多语言文本,并以恰当方式表达。现在,你可以使用单个提示词生成多种语言的语音,同时保留每位说话者独特的音色特征。为获得最佳效果,建议每个提示词只使用一种语言。虽然模型目前已能较好地同时处理多种语言,但仍有待进一步优化。
新模型兼容 VoiceLab 的其他功能,例如即时语音克隆和声音设计。创建的所有音色预计都能在各种语言中保留大部分原有语音特征,包括原始口音。
不过,该模型也存在已知限制:使用非英语提示词时,数字、缩写和外来词有时会默认按英语发音。例如,在西班牙语提示词中输入数字“11”或单词“radio”,可能会按英语发音。我们正持续改进,建议暂时用目标语言完整拼写缩写和数字。
让语音更普及
ElevenLabs 创立时的梦想,就是让所有内容能以任何语言、任何声音为所有人所用。团队成员来自欧洲、亚洲和美国各地。随着团队和世界日益多语言化,我们更加坚定地致力于让每种语言都能使用媲美真人的 AI 语音。
最新一代 文本转语音(TTS) 模型,只是实现这一愿景的第一步。随着媲美真人的 AI 语音 出现,用户和企业如今可以根据需求、重点和偏好制作并定制音频内容。这已展现出为创作者、小型企业和独立艺术家创造更公平条件的潜力。借助 AI 音频,用户可以打造高质量听觉体验,与资源更充足的大型机构制作的内容相媲美。
这些优势如今还延伸至多语言、多文化和教育应用,帮助用户、企业和机构制作能引起更广泛受众共鸣的真实音频。通过提供丰富多样的音色、口音和语言,AI 有助于弥合文化差异,促进全球理解。在 Eleven,我们相信这种新获得的可及性最终将推动更多创造力、创新和多样性。
内容创作者若想与多元受众互动,如今已有工具弥合文化差异,促进包容。
游戏开发者和出版商可以为国际受众打造沉浸式、本地化体验,跨越语言障碍并连接玩家和听众,在不牺牲质量或准确性的前提下提升参与度和效率。
教育机构如今能够以目标语言为不同用户制作音频内容,增强语言理解能力甚至发音技能,同时满足不同教学方式和学习需求。
无障碍机构如今可以进一步帮助视障人士或有学习困难的人群,轻松将不易获取的资源转换为在内容和形式上都适合他们的媒介。
我们迫不及待想看到现在和未来的创作者与开发者突破可能性的边界!




