Introducing Eleven v4Introducing Eleven v4, our fastest and most emotive voice model

Aller au contenu

Présentation d’Eleven v4, notre modèle le plus expressif

Publié

ÉcouterÉcouter cet article

Une même phrase peut changer considérablement selon la manière dont elle est prononcée. « J’ai besoin que vous restiez calme » ne sonne pas de la même façon selon la personne qui la dit : un médecin l’adressant doucement à un patient effrayé, ou un personnage de jeu criant à son escouade avant d’entrer au combat.

Aujourd’hui, nous lançons Eleven v4, notre modèle de synthèse vocale le plus expressif à ce jour, ainsi que sa variante à faible latence, Eleven v4 Turbo.

elevenv4 video cover

Classé n° 1 par Artificial Analysis1, et préféré par environ 75 % des auditeurs lors de tests comparatifs en aveugle face à des modèles concurrents2, Eleven v4 a été conçu pour interpréter le ton, le rythme, l’émotion, le personnage et le contexte. Il génère une parole dramatique, tendre, urgente, comique ou conversationnelle, tout en préservant l’identité du locuteur. Des interactions plus naturelles entre plusieurs locuteurs rendent les conversations réactives, plutôt que composées de répliques juxtaposées. Les locuteurs réagissent au contexte de la conversation, produisant des dialogues et des interactions entre personnages plus naturels.

Eleven v4 wins 65%–81% of blind head-to-head TTS preference tests.

Une nouvelle architecture conçue pour la performance

Construit sur une architecture entièrement nouvelle, Eleven v4 est notre modèle de Text to Speech le plus expressif, classé n° 1 par Artificial Analysis1. Eleven v4 Turbo applique cette même technologie aux cas d’usage à faible latence, comme les agents. Avec une latence médiane d’inférence d’environ 100 ms, il peut répondre plus rapidement que la pause moyenne entre deux personnes qui parlent.

Les deux modèles génèrent une parole expressive plutôt que mécanique. La fidélité audio est également plus élevée sur tous les plans, pour un rendu plus net et plus naturel. 

Les générations précédentes de modèles de synthèse vocale peuvent lire un texte à voix haute, mais Eleven v4 apporte une profondeur émotionnelle bien plus naturelle à la parole. Le modèle interprète le ton recherché, le rythme de l’élocution, le caractère du texte et son contexte pour produire une parole émotionnellement juste.

[excited, happy] Big news, everyone. Our summer menu drops this Friday. And yes, the mango sticky rice is finally back.
0:00
[sleepy drowsy voice] Mmm, five more minutes. [yawning] I promise I'll get up right after this dream finishes.
0:00

Les utilisateurs bénéficient aussi d’un contrôle précis sur les résultats et peuvent décrire en langage naturel la manière dont une réplique doit être prononcée. Ils peuvent ajouter des instructions spécifiques sur la prononciation de certaines phrases, l’émotion à transmettre et même des effets sonores, à l’aide de balises intégrées telles que [laughs], [said angrily in French accent], [light rain] ou [phone buzzing]. Eleven v4 suit ces balises audio et ces instructions de mise en scène avec plus de précision que les modèles précédents : vous obtenez donc le rendu que vous décrivez. Il devient ainsi plus simple de diriger une narration, de développer des personnages ou leurs dialogues, et tout contenu où l’interprétation compte. 

La documentation destinée aux développeurs d’ElevenLabs présente la syntaxe complète des balises et explique comment les appliquer via l’API. La prise en charge des phonèmes de l’Alphabet phonétique international (API) a également été considérablement améliorée, afin de rendre les prononciations personnalisées plus fiables.

Eleven v4 améliore également la cohérence et le dynamisme des conversations entre plusieurs locuteurs. Grâce à une nouvelle méthode de capture de l’identité des locuteurs, Eleven v4 préserve les caractéristiques uniques de chaque voix. Il maintient une parole cohérente dans les conversations d’agents, les livres audio ou les publicités. Comme le modèle comprend le contexte d’une scène entière, il génère des dialogues naturels où les locuteurs répondent à ce qui vient d’être dit, au lieu d’assembler des répliques isolées.

Un modèle Turbo pour les cas d’usage à faible latence

Les modèles vocaux de haute qualité ont généralement été plus lents à générer la parole, obligeant les utilisateurs à choisir entre des agents vocaux rapides ou expressifs. Beaucoup ont opté pour des agents compétents mais monotones, qui peuvent sembler robotiques à un client désemparé cherchant simplement à résoudre son problème. 

Eleven v4 Turbo associe vitesse et émotion, avec un délai médian avant la première parole d’environ 150 ms3, permettant de déployer des agents performants dans d’innombrables secteurs : des agents chaleureux et rassurants, capables de prononcer précisément les termes médicaux dans la santé, aux agents au débit rapide maîtrisant l’argot pour divertir les joueurs dans le gaming.

Median time to first speech: Eleven v4 Turbo is fastest at 150ms, versus 262–814ms.

Le modèle Eleven v4 Turbo est conçu pour fonctionner avec ElevenAgents, la plateforme d’agents conversationnels d’ElevenLabs. D’autres solutions d’agents assemblent des modèles et des logiciels de différents fournisseurs, sans offrir aux utilisateurs de moyen d’affiner ou d’améliorer les résultats des modèles pour leurs cas d’usage spécifiques. Les équipes de recherche et d’ingénierie d’ElevenLabs ont optimisé Eleven v4 Turbo et ElevenAgents comme un seul système, pour offrir des agents plus expressifs, plus fiables et à faible latence.  

Une voix, une multitude de langues 

Notre manière de communiquer varie selon le contexte, le lieu et même le moment de la journée. Créer une parole expressive qui reflète ces variations, dans toutes les langues, reste l’un des défis les plus complexes de l’IA audio. 

Eleven v4 progresse dans tous ces domaines, et ces améliorations vont bien au-delà de la simple prononciation des phrases. Eleven v4 restitue mieux le rythme, l’émotion et l’interprétation dans toutes les langues, pour aider les créateurs à produire une parole naturelle dans chaque langue et chaque contexte. Par exemple, la façon dont vous vous adresseriez à une personne âgée inconnue au Japon serait très différente de celle que vous adopteriez en Italie. 

Eleven v4 et Eleven v4 Turbo prennent tous deux en charge plus de 90 langues. Désormais, une voix enregistrée dans une langue peut aussi parler couramment toute autre langue, en adoptant l’accent d’un locuteur natif tout en conservant l’identité de la voix d’origine. Cette fidélité à l’accent est nettement supérieure à celle d’auparavant : la voix ne revient plus progressivement vers son accent source au cours d’une génération.

Catalan

Sovint caminem per la vida amb la mirada fixada en l'horitzó, preocupats pel demà, sense adonar-nos que el miracle real està passant just sota els nostres peus.
0:00

Espagnol

El viento susurra historias olvidadas entre las hojas secas del parque. La ciudad aún duerme bajo un manto de neblina dorada, ajena al bullicio que pronto inundará sus calles. Un viejo farol parpadea por última vez antes de ceder su lugar a los primeros rayos del sol. En este preciso instante, el tiempo parece detenerse.
0:00

Pour le doublage et la localisation, cela signifie que la voix de marque que vous avez choisie, qu’il s’agisse d’un acteur célèbre avec lequel vous travaillez ou d’un ton correspondant au style de votre entreprise, sonnera parfaitement dans toutes les langues prises en charge par Eleven v4.

Un clonage de voix plus authentique et plus cohérent

Le clonage de voix est plus authentique, plus performant et plus cohérent avec Eleven v4 et Eleven v4 Turbo, avec une similarité au locuteur d’origine considérablement améliorée. Les Instant Voice Clones peuvent désormais capturer des voix en haute fidélité avec seulement 10 secondes d’audio. 

Voix réelle

Hey, thanks so much for holding. Um, so I've got your account pulled up now and it does look like the charge did go through twice on the eleventh which, yeah, definitely shouldn't have happened. Let me get that refund started for you right now.
0:00

Eleven v4

Hey, thanks so much for holding. Um, so I've got your account pulled up now, and it does look like the charge did go through twice on the 11th, which, yeah, definitely shouldn't have happened. Um, let me get that refund started for you right now.
0:00

Eleven v4 préserve également l’identité du locuteur de manière plus fiable d’une génération à l’autre, dans les dialogues, les narrations et les répliques régénérées. Ainsi, pour les projets de longue durée, les personnages, les narrateurs et les voix clonées restent cohérents tout au long de la production. Eleven v4 prend aussi en charge les Professional Voice Clones (PVC), pour les cas d’usage de clonage exigeant la plus haute fidélité.

L’enchaînement de requêtes, qui consiste à relier des générations pour créer des contenus plus longs, est aussi considérablement plus fiable dans Eleven v4. Cela améliore l’expérience de travail dans ElevenLabs Studio et l’application ElevenLabs Reader.

Écoutez la différence par vous-même  

Eleven v4 et Eleven v4 Turbo sont l’aboutissement de nos dernières recherches en génération de parole expressive. Ils sont conçus pour les contenus où l’interprétation compte autant que les mots eux-mêmes : livres audio, performances de personnages, voix off, doublage ou localisation d’agents conversationnels.

Les deux modèles sont disponibles dès maintenant dans ElevenAgents, ElevenCreative et via ElevenAPI. S’inscrire pour commencer à générer avec Eleven v4 ou Eleven v4 Turbo dès aujourd’hui.

  1. Artificial Analysis, classement Provider Voice Arena, septembre 2026
  2. Basé sur des tests de préférence utilisateurs comparatifs en aveugle face à Cartesia Sonic 3.6, Inworld TTS-2, Google Gemini 3.8 Flash-Lite TTS et Google Gemini 3.8 Flash TTS, en septembre 2026. Pour chaque paire, les évaluateurs ont écouté la même réplique produite par Eleven v4 et par un concurrent, présentées à l’aveugle, puis ont déterminé laquelle était la plus expressive et laquelle semblait la plus naturelle ; les égalités comptaient pour moitié.
  3. Délai médian entre la requête et le début audible de la parole. Mesuré en septembre 2026 avec des scripts identiques et les paramètres par défaut, face à Cartesia Sonic 3.6, xAI TTS, Google Gemini Flash-Lite TTS et OpenAI GPT-4o mini TTS ; la latence réseau a été mesurée et retirée pour tous les systèmes. Eleven v4 Turbo via streaming WebSocket.

Articles similaires

Créez avec l'audio IA de la plus haute qualité