ElevenLabs sale de la fase beta y lanza Eleven Multilingual v2: un modelo de inteligencia artificial de voz básico para casi 30 idiomas
- Publicado
EscucharEscucha este artículo
- La plataforma de voz IA ElevenLabs da un salto radical en sus esfuerzos por eliminar las barreras lingüísticas del contenido con el lanzamiento de un nuevo modelo fundacional de aprendizaje profundo que ofrece capacidades multilingües en 28 idiomas: el Eleven Multilingual v2
- Este avance permitirá a empresas de medios, desarrolladores de videojuegos, editoriales y creadores independientes de todo el mundo mejorar significativamente la accesibilidad de su contenido
- Estas nuevas capacidades, que llegan tras una serie de lanzamientos de funciones y mejoras desde que la plataforma se lanzó en enero, también marcan el fin oficial de la fase beta de la empresa
- La misión de ElevenLabs es hacer que todo el contenido sea accesible universalmente, en cualquier idioma y con cualquier voz
ElevenLabs, líder mundial en software de voz IA, ha lanzado hoy un nuevo modelo de generación de voz multilingüe capaz de producir con precisión audio creado con IA «rico en emociones» en casi 30 idiomas.
Este avance, basado íntegramente en investigación propia, permitirá a creadores producir contenido de audio localizado para mercados internacionales de Europa, Asia y Oriente Medio. Durante los últimos 18 meses, ElevenLabs ha analizado los rasgos del habla humana y desarrollado nuevos mecanismos para comprender el contexto y transmitir emociones en la generación de voz, además de sintetizar voces nuevas y únicas.
Con Eleven Multilingual v2, cuando se introduce texto en la plataforma de Texto a Voz de ElevenLabs, el nuevo modelo puede identificar automáticamente casi 30 lenguas escritas y generar voz en ellas con un nivel de autenticidad sin precedentes.
Al mismo tiempo, independientemente de si se utiliza una voz sintética o clonada, las características únicas de la voz del hablante se mantienen en todos los idiomas, incluido su acento original. Esto significa que se puede usar la misma voz para dar vida al contenido en 28 idiomas distintos.
Este lanzamiento llega tras la disponibilidad pública de la función Professional Clonar Voz IA para todos los creadores de la plataforma. Esta actualización de producto, disponible junto con funciones adicionales de seguridad y protección, permite a usuarios crear una copia digital perfecta de su propia voz, prácticamente indistinguible de la original. El lanzamiento de hoy significa que tu voz podrá hablar en los casi 30 idiomas que ofrece el modelo multilingüe.
Los idiomas compatibles ahora incluyen: chino, coreano, neerlandés, turco, sueco, indonesio, filipino, japonés, ucraniano, griego, checo, finés, rumano, danés, búlgaro, malayo, eslovaco, croata, árabe clásico árabe y tamil.
Se suman a los idiomas disponibles anteriormente, entre ellos inglés, polaco, alemán, español, francés, italiano, hindi y portugués.
Tras los recientes lanzamientos de funciones y las mejoras continuas de la plataforma, ElevenLabs también ha confirmado hoy que la plataforma abandona oficialmente la fase beta. Esta transición marca un momento decisivo en el compromiso de la empresa de ofrecer herramientas fiables y de vanguardia a sus más de un millón de usuarios de todo el mundo.
De cara al futuro, ElevenLabs planea introducir un mecanismo que permita a usuarios compartir voces en la plataforma y beneficiarse del desarrollo de nuevo audio, fomentando oportunidades de colaboración entre personas e IA.
Mati Staniszewski, CEO y cofundador de ElevenLabs, comenta:
ElevenLabs nació con el sueño de hacer que todo el contenido sea accesible universalmente, en cualquier idioma y con cualquier voz. Con el lanzamiento de Eleven Multilingual v2, estamos un paso más cerca de hacer realidad este sueño y poner voces de IA con calidad humana a disposición de todos los dialectos.
«Nuestras herramientas de generación de Texto a Voz ayudan a igualar las condiciones y ponen capacidades de audio hablado de la máxima calidad al alcance de todos los creadores. Ahora, esas ventajas se extienden a aplicaciones multilingües en casi 30 idiomas. Con el tiempo, esperamos cubrir aún más idiomas y voces con la ayuda de la IA y eliminar las barreras lingüísticas del contenido. En ElevenLabs, creemos que estos avances en accesibilidad acabarán fomentando una mayor creatividad, innovación y diversidad.
Al reducir el coste y los recursos necesarios para crear contenido de audio de alta calidad en varios idiomas, ElevenLabs permite a empresas y creadores producir contenido más imaginativo y accesible que conecte entre culturas e idiomas.
Para desarrolladores y editoriales de videojuegos independientes, la herramienta de generación de voz multilingüe ofrece nuevas oportunidades para traducir experiencias de juego y contenido de audio a públicos internacionales, conectando con jugadores y oyentes en sus propios idiomas sin renunciar a la calidad ni a la precisión del audio hablado.
Del mismo modo, las instituciones educativas ahora pueden proporcionar al instante a estudiantes contenido de audio preciso en los idiomas de destino, reforzando la comprensión lingüística y las habilidades de pronunciación, además de adaptarse a distintos estilos de enseñanza y necesidades de aprendizaje de estudiantes internacionales.
Creadores de todo tipo pueden utilizar la herramienta de ElevenLabs para mejorar la accesibilidad del contenido para personas con discapacidad visual o necesidades de aprendizaje adicionales, complementando el contenido visual con voz disponible en varios idiomas.
Su conjunto inicial de herramientas de voz IA, presentado en enero de 2023, incluía la capacidad de convertir cualquier texto en voz mediante una selección de voces sintéticas prediseñadas, así como la posibilidad de crear un clon de tu propia voz. La herramienta de síntesis de voz multilingüe es otro paso adelante en la misión de ElevenLabs de hacer que todo el contenido sea accesible universalmente, en cualquier idioma y con cualquier voz.
La tecnología ya se ha adoptado en numerosos ámbitos y sectores creativos: permite a autores independientes crear audiolibros, dar voz a personajes secundarios en videojuegos, ayudar a personas con discapacidad visual a acceder a contenido escrito en internet e impulsar la primera emisora de radio con IA del mundo. ElevenLabs también se ha asociado con diversos creadores de contenido y estudios líderes, entre ellos generadores de vídeo con IA como D-ID, una de las mayores editoriales de audiolibros del mundo, Storytel; la plataforma de vídeos científicos de acceso abierto ScienceCast, cuya herramienta de generación de vídeo resume artículos de investigación científica publicados en arXiv; la plataforma global líder para creadores de contenido TheSoul Publishing; desarrolladores de videojuegos tan destacados como Embark Studios y Paradox Interactive, y la plataforma de medios MNTN.
Contacto
press@elevenlabs.io




