Présentation de Eleven Multilingual v1 : Notre nouveau modèle de synthèse vocale
- Publié
ÉcouterÉcouter cet article
Aujourd’hui, nous sommes heureux de lancer Eleven Multilingual v1, notre modèle avancé de synthèse vocale prenant en charge sept nouvelles langues : le français, l’allemand, l’hindi, l’italien, le polonais, le portugais et l’espagnol. S’appuyant sur les recherches à l’origine d’Eleven Monolingual v1, notre approche actuelle du deep learning mobilise davantage de données, de puissance de calcul et de techniques novatrices au sein d’un modèle toujours plus sophistiqué, capable de comprendre les nuances du texte et de produire une interprétation riche en émotions. Cette avancée élargit les possibilités créatives des créateurs, développeurs de jeux et éditeurs, et ouvre la voie à des contenus génératifs plus localisés, accessibles et imaginatifs.
Le nouveau modèle est disponible avec tous les abonnements et vous pouvez l’essayer dès maintenant sur notre plateforme Beta.
Pour l’utiliser, sélectionnez-le simplement dans le nouveau menu déroulant du panneau Speech Synthesis.
Aperçu de la recherche
Comme son prédécesseur, ce nouveau modèle repose entièrement sur nos recherches internes. Il conserve tous les atouts qui faisaient de Eleven Monolingual v1 un excellent outil de narration, notamment sa capacité à adapter l’interprétation au contexte et à transmettre intentions et émotions avec un réalisme remarquable. Ces capacités sont désormais étendues aux langues nouvellement prises en charge grâce à un entraînement sur des données multilingues.
L’une des caractéristiques notables du modèle est sa capacité à identifier un texte multilingue et à le prononcer de manière appropriée. Vous pouvez désormais générer de la parole dans plusieurs langues à partir d’un seul prompt tout en préservant les caractéristiques vocales propres à chaque locuteur. Pour des résultats optimaux, nous vous recommandons de fournir un prompt dans une seule langue. Bien que le modèle puisse déjà fonctionner de manière satisfaisante avec plusieurs langues simultanément, des améliorations restent nécessaires.
Le nouveau modèle est compatible avec d’autres fonctionnalités de VoiceLab, notamment Instant Clonage de Voix et Voice Design. Toutes les voix créées devraient conserver la plupart de leurs caractéristiques vocales d’origine dans toutes les langues, y compris leur accent d’origine.
Cela dit, le modèle présente des limites connues : les nombres, acronymes et mots étrangers sont parfois prononcés en anglais lorsqu’ils figurent dans un prompt rédigé dans une autre langue. Par exemple, le nombre « 11 » ou le mot « radio », saisis dans un prompt en espagnol, peuvent être prononcés comme en anglais. Nous vous recommandons d’écrire les acronymes et les nombres en toutes lettres dans la langue cible pendant que nous poursuivons nos améliorations.
Démocratiser la voix
ElevenLabs est né du rêve de rendre tous les contenus universellement accessibles, dans chaque langue et avec chaque voix. Les membres de notre équipe viennent de toute l’Europe, d’Asie et des États-Unis. À mesure que notre équipe et le monde deviennent toujours plus multilingues, nous sommes plus unis que jamais autour de notre vision : rendre des voix IA de qualité humaine accessibles dans toutes les langues.
La dernière version de notre modèle Text to Speech (TTS) n’est que la première étape pour concrétiser cette vision. Avec l’arrivée de voix IA de qualité humaine, utilisateurs et entreprises peuvent désormais créer et personnaliser des contenus audio selon leurs besoins, priorités et préférences. Cette technologie a déjà démontré son potentiel pour rééquilibrer les chances des créateurs, petites entreprises et artistes indépendants. En tirant parti de l’audio IA, les utilisateurs peuvent créer des expériences auditives de haute qualité comparables à celles de grandes organisations disposant de davantage de ressources.
Ces avantages s’étendent désormais aux applications multilingues, multiculturelles et éducatives, en permettant aux utilisateurs, entreprises et institutions de produire un audio authentique qui trouve un écho auprès d’un public plus large. En proposant un large choix de voix, d’accents et de langues, l’IA contribue à combler les écarts culturels et favorise la compréhension à l’échelle mondiale. Chez Eleven, nous sommes convaincus que cette nouvelle accessibilité stimule la créativité, l’innovation et la diversité.
Les créateurs de contenu qui cherchent à toucher des publics divers disposent désormais des outils nécessaires pour combler les écarts culturels et favoriser l’inclusion.
Les développeurs de jeux et éditeurs peuvent créer des expériences immersives et localisées pour des publics internationaux, en dépassant les barrières linguistiques et en créant du lien avec les joueurs et les auditeurs afin de maximiser l’engagement et l’efficacité, sans compromis sur la qualité ni la précision.
Les établissements d’enseignement disposent désormais des moyens de produire des contenus audio pour différents utilisateurs, dans leurs langues cibles, afin de renforcer la compréhension et même la prononciation, tout en répondant à divers styles d’enseignement et besoins d’apprentissage.
Les organismes spécialisés dans l’accessibilité peuvent désormais mieux accompagner les personnes malvoyantes ou ayant des difficultés d’apprentissage, en leur donnant les moyens de convertir facilement des ressources moins accessibles dans un format adapté à leurs besoins, tant sur le fond que sur la forme.
Nous avons hâte de voir nos créateurs et développeurs, actuels comme futurs, repousser les limites du possible !




