Eleven v4
Notre modèle Text to Speech le plus récent et le plus avancé.
Eleven v4 est notre modèle Text to Speech le plus récent et le plus avancé, et le premier d’une nouvelle génération de modèles. Il améliore la qualité des résultats, la fidélité vocale, la cohérence, l’émotion, l’interprétation, les balises audio et la couverture linguistique par rapport à Eleven v3.
En général, Eleven v4 constitue une amélioration globale par rapport à Eleven v3 et offre de meilleurs résultats dans presque tous les cas. Nous vous recommandons vivement de passer à v4 et de la tester avec vos propres voix et contenus pour constater la différence. Quelques cas particuliers peuvent nécessiter une autre solution, mais v4 devrait être le meilleur choix pour la plupart des utilisateurs.
Pour les balises, la ponctuation et les prompts de dialogue, consultez Instructions pour Eleven v4.
Clonage de voix
La précision du clonage de voix franchit un cap majeur avec Eleven v4. Les voix clonées reproduisent plus fidèlement que tout modèle précédent les caractéristiques de la voix source, notamment le timbre, le rythme et l’interprétation.
Les Instant Voice Clones (IVC) sont plus précis que jamais dans Eleven v4. Ils capturent plus fidèlement les caractéristiques distinctives d’une voix source, ce qui facilite la création rapide d’un clone convaincant à partir d’un court échantillon audio.
Instant Voice Cloning a bénéficié d’une amélioration majeure dans Eleven v4, avec une précision globale nettement supérieure. Si vous ne l’avez pas encore essayé, c’est le bon moment pour le tester avec votre propre audio.
Les Professional Voice Clones (PVC) sont entièrement pris en charge dans Eleven v4. Ils s’appuient sur les mêmes avancées en matière de précision vocale et offrent une reproduction plus fidèle de la voix source pour les workflows exigeant le plus haut niveau de cohérence et de contrôle.
La prise en charge de Professional Voice Clone pour Eleven v4 est actuellement en cours de déploiement pour tous les utilisateurs et devrait être disponible dans les prochains jours.
En raison de cette avancée majeure en matière de précision, Eleven v4 peut sembler très différent d’Eleven v3. Eleven v3 a posé les bases d’Eleven v4, en mettant fortement l’accent sur l’interprétation et la précision, tandis qu’Eleven v4 s’appuie sur ces bases avec une précision vocale considérablement améliorée. Par conséquent, Eleven v4 est conçu pour capturer plus fidèlement la voix source, même si vous pouvez préférer le rendu d’une voix dans Eleven v3. La précision et les préférences personnelles ne coïncident pas toujours. Nous vous recommandons donc de comparer les deux versions avec votre propre contenu afin de choisir celle qui convient le mieux à votre cas d’utilisation.
Comme Eleven v4 reproduit plus fidèlement les caractéristiques de la voix source, y compris son accent, son interprétation, son volume et d’autres qualités distinctives, la qualité de l’enregistrement source est plus importante que jamais. Un audio d’entraînement clair et propre aide Eleven v4 à capturer la voix avec précision, sans introduire de sons ou caractéristiques indésirables. Le bruit de fond, la distorsion ou d’autres problèmes d’enregistrement peuvent affecter le résultat.
Nous expérimentons encore avec Eleven v4 afin de mieux comprendre comment l’utiliser. Jusqu’à présent, il semble bien meilleur pour capturer les nuances audio, en particulier lorsqu’il dispose de nombreuses données d’entraînement, comme avec les Professional Voice Clones. Nos recommandations concernant l’utilisation de données d’entraînement variées peuvent évoluer à mesure que nous testons le contrôle du modèle avec un ensemble de données plus polyvalent. Pour l’instant, nous vous recommandons de vous en tenir à un seul style de parole dans vos données d’entraînement, qu’Eleven v4 devrait mieux capturer que les modèles précédents.
Gestion native des accents
C’est l’un des changements les plus importants d’Eleven v4 par rapport aux anciens modèles, et il est utile de bien le comprendre.
Lorsque la langue que vous générez correspond à celle de votre voix de référence, l’accent d’origine est conservé exactement comme auparavant.
Lorsque la langue générée diffère de celle de la voix de référence, Eleven v4 produit une parole fluide et naturelle dans la langue cible, au lieu de conserver l’accent de la voix de référence dans sa langue d’origine.
En pratique, si vous clonez la voix d’une personne coréenne et générez de l’anglais, Eleven v4 produira un anglais naturel et fluide plutôt qu’un anglais parlé avec un accent coréen. Chaque voix peut ainsi être utilisée dans toutes les langues prises en charge. C’est particulièrement utile pour le doublage, le contenu multilingue et les agents vocaux qui doivent servir des utilisateurs dans différentes langues à partir d’une seule voix.
Si votre workflow dépend du maintien de l’accent natif d’une voix dans d’autres langues, testez directement ce comportement avec Eleven v4 avant la migration. Il s’agit d’un changement volontaire du fonctionnement de la génération multilingue, et non d’un bug.
Cette nouvelle fonctionnalité est toutefois encore en cours d’ajustement, et nous étudions la possibilité d’en faire une option plutôt qu’un comportement toujours activé. Il s’agit encore d’un projet de recherche ; nous n’avons donc ni calendrier ni informations supplémentaires à partager pour le moment.
Variantes de modèle
Eleven v4 existe en deux variantes afin que vous puissiez choisir le bon équilibre entre qualité et vitesse pour votre cas d’utilisation :
- Eleven v4 (
eleven_v4) : notre modèle de la plus haute qualité, idéal pour la création de contenu, les livres audio, les voix de personnages et tout cas d’utilisation où la qualité est prioritaire. - Eleven v4 Turbo (
eleven_v4_turbo) : une qualité extrêmement élevée tout en conservant une latence remarquablement faible, conçu pour les cas d’utilisation en temps réel tels que les agents conversationnels et les expériences vocales interactives.
Les deux variantes utilisent deux paramètres vocaux : la stabilité et la similarité.
La stabilité contrôle la cohérence de l’interprétation entre les générations. Des valeurs plus faibles permettent une interprétation plus expressive et variée ; des valeurs plus élevées maintiennent l’interprétation plus proche d’une référence fixe.
La similarité contrôle à quel point le résultat respecte la voix de référence. Des valeurs plus élevées imposent une correspondance plus étroite avec la référence, ce qui peut réduire légèrement le naturel.
Les curseurs Style et Speed ne sont pas disponibles dans Eleven v4, et SSML n’est pas pris en charge.
Les balises audio, par exemple [whispering], [shouting] et [laughing], vous permettent de diriger l’interprétation avec précision. Eleven v4 les gère avec un niveau de nuance supérieur à celui des modèles précédents. Elles ne sont pas encore parfaites, et nous continuons d’itérer pour améliorer la fiabilité avec laquelle le modèle suit leurs instructions. C’est un domaine dans lequel nous continuons d’investir, et les résultats continueront de s’améliorer.
Exemples
Ces exemples sont bruts. Aucun traitement intensif n’a été appliqué : pas d’égalisation, de compression, de normalisation, de désaccentuation des sifflantes, de suppression des plosives ni de traitement similaire. Si vous entendez des problèmes récurrents, tels que de l’écrêtage, des plosives, une égalisation irrégulière ou des variations de volume, ils sont très probablement présents dans les données d’entraînement de cette voix. Le modèle Eleven v4 les a simplement capturés, car il est très précis, y compris lorsqu’il reproduit des défauts. Nous avons laissé l’audio intact afin que vous puissiez entendre ce que le modèle a produit.
Précision du clonage de voix
Chaque exemple commence par un aperçu de la Voice Library. Nous avons ensuite pris un texte et l’avons généré à l’aide d’un Instant Voice Clone de cette voix, avec Eleven v3 et Eleven v4.
Cette comparaison n’est pas parfaite. Eleven v4 fonctionne également avec les Professional Voice Clones, qui peuvent améliorer davantage la correspondance. Toutefois, afin de rendre la comparaison plus équitable, nous avons utilisé des Instant Voice Clones pour Eleven v3 comme pour Eleven v4.
Ces exemples montrent dans quelle mesure le modèle restitue la voix d’origine. Il est important de noter que cela inclut aussi l’égalisation, la qualité, le volume et tous les autres détails mineurs et imperfections de l’audio, comme les plosives, les sifflantes agressives et les variations de volume.
Écoutez l’aperçu, puis Eleven v3, puis Eleven v4.
Voix NfUrCNRReUL9RXS9upG1.
Voix HBDoL4wkcalemIO0nUAu.
Interprétation vocale
Il s’agit de générations Eleven v4. Les balises audio dans le texte dirigent l’interprétation.
Voix EkK5I93UQWFDigLMpZcX.
Voix t7VaN65ClS2VrEUwk1nR.
Livre audio
Il s’agit d’une narration Eleven v4. Les balises définissent le rythme et le ton de la scène.
Voix KHRvDizAHFVPzoSehNY6.
Le modèle continuera d’évoluer
Eleven v4 fait l’objet d’un développement actif et continu. À mesure que nous continuons d’entraîner et d’améliorer le modèle après son lancement, son comportement peut évoluer avec l’amélioration de la qualité. Nous vous recommandons de tester à nouveau votre cas d’utilisation régulièrement à mesure que le modèle évolue. Nous communiquerons les mises à jour importantes au fil de leur déploiement.
FAQ
Quelles langues Eleven v4 prend-il en charge ?
Eleven v4 prend en charge l’afrikaans, l’amharique, l’arabe, l’arménien, l’assamais, l’asturien, l’azerbaïdjanais, le biélorusse, le bengali, le bosnien, le bulgare, le birman, le cantonais, le catalan, le cebuano, le croate, le tchèque, le danois, le néerlandais, l’anglais, l’estonien, le filipino, le finnois, le français, le peul (pulaar), le galicien, le géorgien, l’allemand, le grec, le gujarati, le haoussa, l’hébreu, l’hindi, le hongrois, l’islandais, l’indonésien, l’italien, le japonais, le kannada, le kazakh, le coréen, le kirghiz, le lao, le lingala, le lituanien, le luganda, le luxembourgeois, le macédonien, le malais, le malayalam, le maltais, le chinois mandarin, le māori, le marathi, le mongol, le népalais, le norvégien bokmål, l’occitan, l’odia, le pachto, le persan, le polonais, le portugais (Brésil), le pendjabi, le roumain, le russe, le serbe, le shona, le sindhi, le slovaque, le slovène, le somali, le kurde sorani, l’espagnol (Amérique latine), le swahili, le suédois, le tadjik, le tamoul, le télougou, le thaï, le turc, l’ukrainien, l’ourdou, l’ouzbek, le vietnamien, le gallois et le wolof.
Certaines langues sont gérées avec plus d’aisance que d’autres, mais dans l’ensemble, Eleven v4 gère très bien la grande majorité d’entre elles.
Une voix clonée conservera-t-elle son accent ?
Lorsque la voix de référence et la parole générée sont dans la même langue, l’accent de la voix est conservé. Par exemple, si vous clonez une personne parlant anglais avec un accent anglais particulier et générez une parole en anglais, cet accent sera conservé.
Puis-je faire parler une voix dans une autre langue avec son accent d’origine ?
Par défaut, lorsque la langue générée diffère de celle de la voix de référence, Eleven v4 vise une parole fluide et naturelle dans la langue cible plutôt que de conserver l’accent de référence. Vous pouvez essayer d’utiliser des balises audio pour orienter un accent ou un style d’interprétation, mais les résultats peuvent varier. Testez donc votre voix et votre cas d’utilisation spécifiques.
Un clone Eleven v4 ressemblera-t-il à sa version Eleven v3 ?
En général, Eleven v4 reproduit les caractéristiques de la voix source bien plus précisément qu’ Eleven v3, notamment son timbre, son rythme, son interprétation et d’autres maniérismes. Par conséquent, un clone Eleven v4 ressemblera généralement davantage à la voix source et peut sembler très différent de sa version Eleven v3.
Dois-je entraîner Eleven v4 ?
Eleven v4 fonctionne avec Instant Voice Cloning et Professional Voice Cloning.
Avec Instant Voice Cloning, vous créez une voix sans étape d’entraînement distincte. Importez un court échantillon, généralement d’une à deux minutes, et vous disposez en quelques secondes d’une voix utilisable.
Professional Voice Cloning fonctionne comme pour les modèles précédents. Cette fonctionnalité entraîne un modèle dédié sur un ensemble d’enregistrements plus long.
Si vous avez déjà un Professional Voice Clone et souhaitez l’entraîner sur Eleven v4, ouvrez My Voices, trouvez la voix dans la liste et survolez-la. Vous verrez les modèles disponibles pour cette voix. Cliquez sur le bouton plus à côté d’Eleven v4 pour commencer le finetuning.
Dois-je utiliser Voice Design avec Eleven v4 ?
Les voix Voice Design fonctionnent avec Eleven v4, mais elles peuvent être moins performantes ou avoir un rendu moins bon que sur les modèles précédents.