Présentation d’Eleven v4, notre modèle le plus expressif
- Publié
ÉcouterÉcouter cet article
Une même phrase peut changer considérablement selon la manière dont elle est prononcée. « J’ai besoin que vous restiez calme » ne sonne pas de la même façon selon la personne qui la dit : un médecin l’adressant doucement à un patient effrayé, ou un personnage de jeu criant à son escouade avant d’entrer au combat.
Aujourd’hui, nous lançons Eleven v4, notre modèle de synthèse vocale le plus expressif à ce jour, ainsi que sa variante à faible latence, Eleven v4 Turbo.

Classé n° 1 par Artificial Analysis1, et préféré par environ 75 % des auditeurs lors de tests comparatifs en aveugle face à des modèles concurrents2, Eleven v4 a été conçu pour interpréter le ton, le rythme, l’émotion, le personnage et le contexte. Il génère une parole dramatique, tendre, urgente, comique ou conversationnelle, tout en préservant l’identité du locuteur. Des interactions plus naturelles entre plusieurs locuteurs rendent les conversations réactives, plutôt que composées de répliques juxtaposées. Les locuteurs réagissent au contexte de la conversation, produisant des dialogues et des interactions entre personnages plus naturels.

Une nouvelle architecture conçue pour la performance
Construit sur une architecture entièrement nouvelle, Eleven v4 est notre modèle de Text to Speech le plus expressif, classé n° 1 par Artificial Analysis1. Eleven v4 Turbo applique cette même technologie aux cas d’usage à faible latence, comme les agents. Avec une latence médiane d’inférence d’environ 100 ms, il peut répondre plus rapidement que la pause moyenne entre deux personnes qui parlent.
Les deux modèles génèrent une parole expressive plutôt que mécanique. La fidélité audio est également plus élevée sur tous les plans, pour un rendu plus net et plus naturel.
Les générations précédentes de modèles de synthèse vocale peuvent lire un texte à voix haute, mais Eleven v4 apporte une profondeur émotionnelle bien plus naturelle à la parole. Le modèle interprète le ton recherché, le rythme de l’élocution, le caractère du texte et son contexte pour produire une parole émotionnellement juste.
Les utilisateurs bénéficient aussi d’un contrôle précis sur les résultats et peuvent décrire en langage naturel la manière dont une réplique doit être prononcée. Ils peuvent ajouter des instructions spécifiques sur la prononciation de certaines phrases, l’émotion à transmettre et même des effets sonores, à l’aide de balises intégrées telles que [laughs], [said angrily in French accent], [light rain] ou [phone buzzing]. Eleven v4 suit ces balises audio et ces instructions de mise en scène avec plus de précision que les modèles précédents : vous obtenez donc le rendu que vous décrivez. Il devient ainsi plus simple de diriger une narration, de développer des personnages ou leurs dialogues, et tout contenu où l’interprétation compte.
La documentation destinée aux développeurs d’ElevenLabs présente la syntaxe complète des balises et explique comment les appliquer via l’API. La prise en charge des phonèmes de l’Alphabet phonétique international (API) a également été considérablement améliorée, afin de rendre les prononciations personnalisées plus fiables.
Eleven v4 améliore également la cohérence et le dynamisme des conversations entre plusieurs locuteurs. Grâce à une nouvelle méthode de capture de l’identité des locuteurs, Eleven v4 préserve les caractéristiques uniques de chaque voix. Il maintient une parole cohérente dans les conversations d’agents, les livres audio ou les publicités. Comme le modèle comprend le contexte d’une scène entière, il génère des dialogues naturels où les locuteurs répondent à ce qui vient d’être dit, au lieu d’assembler des répliques isolées.
Un modèle Turbo pour les cas d’usage à faible latence
Les modèles vocaux de haute qualité ont généralement été plus lents à générer la parole, obligeant les utilisateurs à choisir entre des agents vocaux rapides ou expressifs. Beaucoup ont opté pour des agents compétents mais monotones, qui peuvent sembler robotiques à un client désemparé cherchant simplement à résoudre son problème.
Eleven v4 Turbo associe vitesse et émotion, avec un délai médian avant la première parole d’environ 150 ms3, permettant de déployer des agents performants dans d’innombrables secteurs : des agents chaleureux et rassurants, capables de prononcer précisément les termes médicaux dans la santé, aux agents au débit rapide maîtrisant l’argot pour divertir les joueurs dans le gaming.

Le modèle Eleven v4 Turbo est conçu pour fonctionner avec ElevenAgents, la plateforme d’agents conversationnels d’ElevenLabs. D’autres solutions d’agents assemblent des modèles et des logiciels de différents fournisseurs, sans offrir aux utilisateurs de moyen d’affiner ou d’améliorer les résultats des modèles pour leurs cas d’usage spécifiques. Les équipes de recherche et d’ingénierie d’ElevenLabs ont optimisé Eleven v4 Turbo et ElevenAgents comme un seul système, pour offrir des agents plus expressifs, plus fiables et à faible latence.
Une voix, une multitude de langues
Notre manière de communiquer varie selon le contexte, le lieu et même le moment de la journée. Créer une parole expressive qui reflète ces variations, dans toutes les langues, reste l’un des défis les plus complexes de l’IA audio.
Eleven v4 progresse dans tous ces domaines, et ces améliorations vont bien au-delà de la simple prononciation des phrases. Eleven v4 restitue mieux le rythme, l’émotion et l’interprétation dans toutes les langues, pour aider les créateurs à produire une parole naturelle dans chaque langue et chaque contexte. Par exemple, la façon dont vous vous adresseriez à une personne âgée inconnue au Japon serait très différente de celle que vous adopteriez en Italie.
Eleven v4 et Eleven v4 Turbo prennent tous deux en charge plus de 90 langues. Désormais, une voix enregistrée dans une langue peut aussi parler couramment toute autre langue, en adoptant l’accent d’un locuteur natif tout en conservant l’identité de la voix d’origine. Cette fidélité à l’accent est nettement supérieure à celle d’auparavant : la voix ne revient plus progressivement vers son accent source au cours d’une génération.
Catalan
Espagnol
Pour le doublage et la localisation, cela signifie que la voix de marque que vous avez choisie, qu’il s’agisse d’un acteur célèbre avec lequel vous travaillez ou d’un ton correspondant au style de votre entreprise, sonnera parfaitement dans toutes les langues prises en charge par Eleven v4.
Un clonage de voix plus authentique et plus cohérent
Le clonage de voix est plus authentique, plus performant et plus cohérent avec Eleven v4 et Eleven v4 Turbo, avec une similarité au locuteur d’origine considérablement améliorée. Les Instant Voice Clones peuvent désormais capturer des voix en haute fidélité avec seulement 10 secondes d’audio.
Voix réelle
Eleven v4
Eleven v4 préserve également l’identité du locuteur de manière plus fiable d’une génération à l’autre, dans les dialogues, les narrations et les répliques régénérées. Ainsi, pour les projets de longue durée, les personnages, les narrateurs et les voix clonées restent cohérents tout au long de la production. Eleven v4 prend aussi en charge les Professional Voice Clones (PVC), pour les cas d’usage de clonage exigeant la plus haute fidélité.
L’enchaînement de requêtes, qui consiste à relier des générations pour créer des contenus plus longs, est aussi considérablement plus fiable dans Eleven v4. Cela améliore l’expérience de travail dans ElevenLabs Studio et l’application ElevenLabs Reader.
Écoutez la différence par vous-même
Eleven v4 et Eleven v4 Turbo sont l’aboutissement de nos dernières recherches en génération de parole expressive. Ils sont conçus pour les contenus où l’interprétation compte autant que les mots eux-mêmes : livres audio, performances de personnages, voix off, doublage ou localisation d’agents conversationnels.
Les deux modèles sont disponibles dès maintenant dans ElevenAgents, ElevenCreative et via ElevenAPI. S’inscrire pour commencer à générer avec Eleven v4 ou Eleven v4 Turbo dès aujourd’hui.
- Artificial Analysis, classement Provider Voice Arena, septembre 2026
- Basé sur des tests de préférence utilisateurs comparatifs en aveugle face à Cartesia Sonic 3.6, Inworld TTS-2, Google Gemini 3.8 Flash-Lite TTS et Google Gemini 3.8 Flash TTS, en septembre 2026. Pour chaque paire, les évaluateurs ont écouté la même réplique produite par Eleven v4 et par un concurrent, présentées à l’aveugle, puis ont déterminé laquelle était la plus expressive et laquelle semblait la plus naturelle ; les égalités comptaient pour moitié.
- Délai médian entre la requête et le début audible de la parole. Mesuré en septembre 2026 avec des scripts identiques et les paramètres par défaut, face à Cartesia Sonic 3.6, xAI TTS, Google Gemini Flash-Lite TTS et OpenAI GPT-4o mini TTS ; la latence réseau a été mesurée et retirée pour tous les systèmes. Eleven v4 Turbo via streaming WebSocket.




