Presentamos Eleven Multilingual v1: Nuestro nuevo modelo de síntesis de voz
- Publicado
EscucharEscucha este artículo
Hoy nos entusiasma lanzar Eleven Multilingual v1, nuestro avanzado modelo de síntesis de voz compatible con siete idiomas nuevos: francés, alemán, hindi, italiano, polaco, portugués, y español. Basado en la investigación que impulsó Eleven Monolingual v1, nuestro enfoque actual de aprendizaje profundo aprovecha más datos, mayor capacidad de procesamiento y técnicas innovadoras en un modelo cada vez más sofisticado, capaz de comprender matices textuales y ofrecer una interpretación con gran riqueza emocional. Este avance amplía los horizontes creativos de creadores, desarrolladores de videojuegos y editores, y abre la puerta al uso de medios generativos para crear contenido más localizado, accesible e imaginativo.
El nuevo modelo está disponible en todos los planes de suscripción y ya puedes probarlo en nuestra plataforma Beta.
Para usarlo, solo tienes que seleccionarlo en el nuevo menú desplegable del panel de Síntesis de Voz.
Resumen de la investigación
Al igual que su predecesor, el nuevo modelo se basa íntegramente en nuestra investigación interna. Conserva todos los puntos fuertes que hicieron de Eleven Monolingual v1 una excelente herramienta para narrar historias, como la capacidad de ajustar la entonación según el contexto y transmitir intención y emociones de forma hiperrealista. Estas funciones se han ampliado ahora a los nuevos idiomas compatibles mediante el entrenamiento con datos multilingües.
Una característica destacable del modelo es su capacidad para identificar texto multilingüe y expresarlo correctamente. Ahora puedes generar voz en varios idiomas con un único prompt y mantener las características de voz únicas de cada hablante. Para obtener los mejores resultados, recomendamos usar un prompt en un único idioma. Aunque el modelo ya puede funcionar razonablemente bien con varios idiomas a la vez, aún necesita mejoras.
El nuevo modelo es compatible con otras funciones de VoiceLab, como Clonar Voz IA Instantáneo y Clonar Voz IA y Diseño de Voz. Se espera que todas las voces creadas mantengan la mayoría de sus características de habla originales en todos los idiomas, incluido su acento original.
Dicho esto, el modelo tiene limitaciones conocidas: los números, las siglas y las palabras extranjeras a veces se pronuncian en inglés cuando se usan en un prompt de otro idioma. Por ejemplo, el número «11» o la palabra «radio», escritos en un prompt en español, pueden pronunciarse como en inglés. Mientras trabajamos en mejoras, recomendamos escribir las siglas y los números con palabras en el idioma de destino.
Democratizar la voz
ElevenLabs nació con el sueño de hacer que todo el contenido sea accesible para todos, en cualquier idioma y con cualquier voz. Nuestro equipo procede de toda Europa, Asia y Estados Unidos. A medida que nuestro equipo y el mundo son cada vez más multilingües, estamos más unidos que nunca por la visión de poner voces IA con calidad humana voces IA a disposición de todos los idiomas.
La última versión de nuestro modelo de Texto a Voz (TTS) es solo el primer paso para hacer realidad esta visión. Con la llegada de voces IA con calidad humana, usuarios y empresas ya pueden crear y personalizar contenido de audio según sus necesidades, prioridades y preferencias. Esto ya ha demostrado su potencial para igualar las condiciones para creadores, pequeñas empresas y artistas independientes. Al aprovechar el poder del audio creado con IA, usuarios pueden desarrollar experiencias auditivas de alta calidad que rivalizan con las de organizaciones más grandes y con más recursos.
Estas ventajas se extienden ahora a aplicaciones multilingües, multiculturales y educativas, al permitir que usuarios, empresas e instituciones produzcan audio auténtico que conecte con un público más amplio. Al ofrecer una amplia variedad de voces, acentos e idiomas, la IA ayuda a salvar diferencias culturales y fomenta la comprensión global. En Eleven, creemos que esta nueva accesibilidad impulsa en última instancia una mayor creatividad, innovación y diversidad.
Creadores de contenido que buscan conectar con públicos diversos ahora cuentan con herramientas para salvar diferencias culturales y fomentar la inclusión.
Desarrolladores de videojuegos y editores pueden crear experiencias inmersivas y localizadas para públicos internacionales, superar las barreras lingüísticas y conectar con jugadores y oyentes para maximizar la interacción y la eficiencia, sin perder calidad ni precisión.
Instituciones educativas ya cuentan con los medios para producir contenido de audio para distintos usuarios en sus idiomas de destino, reforzando la comprensión lingüística e incluso las habilidades de pronunciación, además de adaptarse a diferentes estilos de enseñanza y necesidades de aprendizaje.
Instituciones de accesibilidad ahora pueden ayudar aún más a personas con discapacidad visual o dificultades de aprendizaje, ofreciéndoles medios para convertir fácilmente recursos menos accesibles en un formato que se adapte a sus necesidades, tanto en contenido como en forma.
¡Estamos deseando ver cómo creadores y desarrolladores actuales y futuros llevan al límite lo que es posible!




