ElevenLabs sort de la version bêta et publie Eleven Multilingual v2 - un modèle de parole IA fondamental pour près de 30 langues
- Publié
ÉcouterÉcouter cet article
- La plateforme d’IA vocale ElevenLabs franchit une étape majeure dans sa volonté d’éliminer les barrières linguistiques liées aux contenus, avec le lancement d’un nouveau modèle fondamental de deep learning prenant en charge des capacités multilingues dans 28 langues : le Eleven Multilingual v2
- Cette avancée permettra aux entreprises de médias, aux développeurs de jeux, aux éditeurs et aux créateurs indépendants du monde entier d’améliorer considérablement l’accessibilité de leurs contenus
- Ces nouvelles capacités, qui font suite à de nombreuses fonctionnalités et améliorations lancées depuis le lancement de la plateforme en janvier, marquent également la fin officielle de la phase bêta de l’entreprise
- La mission d’ElevenLabs est de rendre tous les contenus universellement accessibles, dans toutes les langues et avec toutes les voix
ElevenLabs, leader mondial des logiciels d’IA vocale, a lancé aujourd’hui un nouveau modèle multilingue de génération de voix capable de produire avec précision de l’audio IA « riche en émotions » dans près de 30 langues.
Cette avancée, entièrement fondée sur nos recherches internes, permettra aux créateurs de produire des contenus audio localisés pour les marchés internationaux d’Europe, d’Asie et du Moyen-Orient. Au cours des 18 derniers mois, ElevenLabs a analysé les caractéristiques de la parole humaine, conçu de nouveaux mécanismes pour comprendre le contexte et transmettre des émotions dans la génération vocale, tout en synthétisant de nouvelles voix uniques.
Avec Eleven Multilingual v2, lorsqu’un texte est saisi sur la plateforme ElevenLabs de synthèse vocale, le nouveau modèle peut identifier automatiquement près de 30 langues écrites et générer de la parole dans chacune d’elles avec un niveau d’authenticité inédit.
Parallèlement, qu’il s’agisse d’une voix synthétique ou clonée, les caractéristiques vocales uniques du locuteur sont conservées dans toutes les langues, y compris son accent d’origine. Une même voix peut ainsi donner vie à des contenus dans 28 langues distinctes.
Ce lancement fait suite à la mise à disposition publique de Professional Clonage de Voix pour tous les créateurs sur la plateforme. Cette mise à jour du produit, disponible avec des fonctionnalités supplémentaires de sécurité et de sûreté, permet aux utilisateurs de créer une copie numérique parfaite de leur propre voix, pratiquement impossible à distinguer de l’originale. Avec cette version, votre voix peut parler dans les près de 30 langues proposées par le modèle multilingue.
Les langues désormais prises en charge incluent : chinois, coréen, néerlandais, turc, suédois, indonésien, filipino, japonais, ukrainien, grec, tchèque, finnois, roumain, danois, bulgare, malais, slovaque, croate, l’arabe classique arabe et tamoul.
Elles s’ajoutent aux langues déjà disponibles, dont l’anglais, le polonais, l’allemand, l’espagnol, le français, l’italien, l’hindi et le portugais.
À la suite des récents lancements de fonctionnalités et des améliorations continues de la plateforme, ElevenLabs a également confirmé aujourd’hui la sortie officielle de la phase bêta. Cette transition marque une étape importante dans l’engagement de l’entreprise à fournir des outils fiables et de pointe à ses plus d’un million d’utilisateurs dans le monde.
À l’avenir, ElevenLabs prévoit d’introduire un mécanisme permettant aux utilisateurs de partager des voix sur la plateforme et de bénéficier du développement de nouveaux contenus audio, afin de favoriser les possibilités de collaboration entre les humains et l’IA.
Mati Staniszewski, PDG et cofondateur d’ElevenLabs, commente :
ElevenLabs est né du rêve de rendre tous les contenus universellement accessibles, dans toutes les langues et avec toutes les voix. Avec la sortie d’Eleven Multilingual v2, nous nous rapprochons de la réalisation de ce rêve en rendant des voix IA de qualité humaine accessibles dans chaque dialecte.
« Nos outils de synthèse vocale contribuent à mettre tous les créateurs sur un pied d’égalité et rendent des capacités audio parlées de haute qualité accessibles à chacun. Ces avantages s’étendent désormais aux applications multilingues dans près de 30 langues. À terme, nous espérons couvrir encore davantage de langues et de voix grâce à l’IA, et éliminer les barrières linguistiques liées aux contenus. Chez ElevenLabs, nous pensons que ces avancées en matière d’accessibilité favoriseront la créativité, l’innovation et la diversité.
En réduisant les coûts et les ressources nécessaires à la création de contenus audio de haute qualité dans plusieurs langues, ElevenLabs permet aux entreprises et aux créateurs de produire des contenus plus imaginatifs et accessibles, qui trouvent un écho auprès de différentes cultures et langues.
Pour les développeurs de jeux indépendants et les éditeurs, l’outil de génération vocale multilingue offre de nouvelles possibilités pour traduire les expériences de jeu et les contenus audio à destination d’audiences internationales, en s’adressant aux joueurs et aux auditeurs dans leur propre langue sans compromettre la qualité ni la précision de l’audio parlé.
De même, les établissements d’enseignement peuvent désormais fournir instantanément aux apprenants des contenus audio précis dans les langues cibles, afin de renforcer la compréhension linguistique et les compétences de prononciation, tout en répondant à différents styles d’enseignement et besoins d’apprentissage des étudiants internationaux.
Les créateurs de tous horizons peuvent utiliser l’outil d’ElevenLabs pour améliorer l’accessibilité des contenus pour les personnes malvoyantes ou ayant des besoins d’apprentissage spécifiques, en complétant les contenus visuels par de la parole disponible dans plusieurs langues.
Sa suite initiale d’outils de voix IA, dévoilée en janvier 2023, permettait de transformer n’importe quel texte en parole à partir d’une sélection de voix synthétiques préconçues, ainsi que de créer un clone de sa propre voix. L’outil de synthèse vocale multilingue constitue une nouvelle étape dans la mission d’ElevenLabs : rendre tous les contenus universellement accessibles, dans toutes les langues et avec toutes les voix.
Cette technologie a déjà été adoptée dans de nombreux domaines créatifs et secteurs. Elle permet notamment aux auteurs indépendants de créer des livres audio, de donner voix à des personnages secondaires dans les jeux vidéo, d’aider les personnes malvoyantes à accéder aux contenus écrits en ligne et d’alimenter la première station de radio IA au monde. ElevenLabs s’est également associé à plusieurs créateurs de contenu et studios de premier plan, notamment des générateurs de vidéos IA D-ID, à l’un des plus grands éditeurs de livres audio au monde, Storytel, à la plateforme de vidéos scientifiques en accès libre ScienceCast dont l’outil de génération vidéo condense des articles de recherche scientifique publiés sur arXiv, à la plateforme mondiale de créateurs de contenu TheSoul Publishing, à des développeurs de jeux tels que Embark Studios et Paradox Interactive, ainsi qu’à la plateforme média MNTN.
Contact
press@elevenlabs.io




