Text to Speech
et v4 Turbo
Créez une voix expressive et contrôlable, enrichie d’émotions, d’événements audio et de paysages sonores immersifs.
Eleven v4
Notre modèle vocal le plus rapide et le plus expressifmodèle vocal
Eleven v4 repose sur une toute nouvelle architecture qui lit un script comme le ferait un doubleur. Elle sait qui parle, ce qui vient de se passer et comment chaque réplique doit être interprétée.

John - animateur, théâtral
Sia - conversationnelle, britannique
John - animateur, théâtral
John - animateur, théâtralUne gamme d’émotions et de sons
Une voix dans plus de 90 langues, avec une gamme émotionnelle remarquable, plusieurs locuteurs et des effets sonores intégrés pour planter le décor.

Une nouvelle architecture
Intégrez les indications au script
Ajoutez directement au script des indications telles que [laughs], [whispers] et [door slams]. Eleven v4 suit les séquences de tags avec plus de fiabilité que v3, effets sonores inclus.
Assemblez des contenus longs sans rupture
L’assemblage contextuel préserve le rythme et l’interprétation sur un script de toute longueur. Un livre audio complet paraît enregistré en une seule prise, de la première à la dernière page.
Régénérez sans dérive vocale
Régénérez une réplique une ou cinquante fois, la même personne parle toujours. La stabilité du locuteur est préservée pour les dialogues, la narration et tout le reste.
Choisissez un clonage de voix professionnel
Les clonages de voix professionnels n’étaient pas pris en charge dans v3. Ils sont de retour dans Eleven v4 et exploitent toute la gamme émotionnelle du modèle dans chaque langue qu’ils parlent.
Eleven v4 Turbo
Découvrez Eleven v4 Turbopour le temps réel et les agents
Notre modèle vocal en temps réel le plus rapide, avec la gamme expressive d’Eleven v4, disponible via l’API et ElevenAgents. Eleven v4 Turbo affiche une latence médiane d’inférence d’environ 150 ms et reste cohérent lors des longues interactions.
Des temps de réponse imperceptibles pour vos appelants
Avec un délai médian de 150 ms avant le premier son, la latence disparaît et la conversation reste fluide.
Écoutez-le lors d’un appel réel
Découvrez Eleven v4 Turbo avec un agent propulsé par ce modèle.
Optimisé pour les conversations en direct
Diffusez le texte et recevez l’audio en continu
Envoyez le texte au fur et à mesure que votre LLM le génère, et l’audio revient avant la fin de la phrase. Un streaming bidirectionnel conçu pour les boucles d’agents.
De l’expression à la vitesse de la conversation
Turbo offre toute la gamme expressive d’Eleven v4. Confirmations, escalades et mises en attente sont interprétées différemment, au lieu d’être lues de façon identique.
Une même voix à chaque échange
Les clonages de voix professionnels fonctionnent à l’identique avec les deux modèles. Une même voix de marque reste cohérente du premier au dernier échange d’un appel.
Parlez chaque langue comme un local
Utilisez un texte en japonais, en espagnol ou en portugais, et la voix le parle couramment, avec un accent natif.





Choisissez parmi plus de 17 500 voix



Choisissez parmi plus de 17 500 voix



Voix de narration Un espace pour les conteurs. Des voix chaleureuses, affirmées et cohérentes pour chaque projet.
Voix conversationnelles Pour les conversations du quotidien, il faut une voix naturelle et détendue. Nos voix conversationnelles sont conçues pour les dialogues et les podcasts au ton spontané.
Voix pour les réseaux sociaux Des voix qui prennent vie dans les formats courts. Captez l’énergie et la personnalité nécessaires pour retenir votre audience sur TikTok ou Reel jusqu’au bout.
Voix de personnages Un vivier de voix pour votre univers de fiction. Choisissez parmi une distribution dynamique qui donne vie à votre jeu, livre audio ou animation.
Voix éducatives Des voix fiables et patientes pour guider les apprenants dans des sujets complexes. Elles excellent dans les cours, tutoriels, simulations de formation et guides, à tous les niveaux.
Voix publicitaires Des voix soignées et assurées pour porter votre prochaine vente de produit. Idéales pour les publicités digitales, télévisées ou radio.
Voix de divertissement Des bandes-annonces de cinéma percutantes aux voix comiques faites pour la scène, ces voix débordent de personnalité. Conçues pour les contenus où l’interprétation compte autant que le fond.
Voix multilingues Des voix conçues pour les contenus internationaux. Un rythme naturel, des expressions idiomatiques et des accents qui créent un lien avec les audiences de chaque marché.
« Nous avons accéléré l’adoption d’Agentforce Voice grâce à un contrôle déterministe. Nos clients nous disent régulièrement qu’ils lui font confiance parce que chaque action d’un agent est fondée et encadrée, plutôt qu’improvisée. Un élément clé de cette stratégie consiste à concilier ce déterminisme avec des modèles vocaux de haute qualité et à forte intelligence émotionnelle. C’est précisément là qu’Eleven v4 Turbo relève le niveau, avec des réponses plus rapides et plus naturelles qui répondent aux exigences de nos clients, leur permettant d’étendre Agentforce Voice à davantage de cas d’usage. »
« En travaillant avec des centaines d’éditeurs pour porter leur journalisme à l’audio, nous constatons directement l’importance de la qualité vocale. Depuis notre partenariat avec ElevenLabs, nombre de nos éditeurs ont observé un engagement accru et des temps d’écoute plus longs. Eleven v4 offre aux éditeurs davantage de moyens de rendre ces voix engageantes, familières et véritablement uniques. »
« ElevenLabs v4 apporte un nouveau niveau de naturel aux conversations vocales. Les voix sont non seulement plus expressives, mais aussi plus contrôlables, ce qui nous permet de créer des expériences vocales plus riches et plus immersives. »
« La première fois que je l’ai utilisé, Eleven v4 était si net et réaliste que j’avais l’impression d’enregistrer une session avec un talent en cabine. »
« Nous cherchions un modèle vocal suffisamment rapide pour donner l’impression d’une vraie conversation sans compromettre la qualité, et Eleven v4 Turbo est le premier à réussir les deux. Pour les workflows de vente automatisés, c’est le moment où le développement cesse de ressembler à une expérimentation. »
Choisissez son renduavant même son premier mot
Chaque génération commence par une voix. Clonez une voix existante, créez-en une à partir d’une description ou corrigez la prononciation de mots spécifiques grâce à la prise en charge de l’API.


Clonage de voix
Clonez une voix à partir de dix secondes d’audio, ou entraînez un clonage de voix professionnel pour une correspondance quasi parfaite.
Création de voix
Décrivez une voix en une phrase et générez-la, sans session d’enregistrement ni casting.
Dictionnaire de prononciation
Définissez la prononciation des noms, acronymes et termes techniques. Définissez-les une fois, chaque génération les utilisera.
Commencez à créer gratuitementPassez à un forfait supérieur lorsque vous avez besoin de plus
Disponible via APIIntégrez Eleven v4 à votre application
Développez avec Eleven v4 Turbo pour des expériences en temps réel et des agents vocaux, le tout via ElevenAPI.
Accédez à l’API Eleven v4 et Eleven v4 Turbo
Ajoutez une voix expressive à tout produit grâce à notre API REST, nos endpoints de streaming ou nos SDK TypeScript et Python.
- Changez de modèle avec un seul model_id
- Diffusez le texte et recevez l’audio en temps réel
- Préservez la continuité entre les générations de contenus longs


