Découvrez Eleven v4Découvrez Eleven v4, notre modèle le plus expressif à ce jour. Avec 3× plus de crédits inclus avec Creator+ jusqu’au 12 octobre

Aller au contenu

Présentation de Eleven v3 (alpha)

Publié

ÉcouterÉcouter cet article

Eleven v3 is no longer in alpha, and is now generally available.


Nous sommes heureux de dévoiler Eleven v3 (alpha), le modèle Text to Speech le plus expressif.

Cette préversion de recherche offre un contrôle et un réalisme sans précédent pour la génération vocale, avec :

  • Plus de 70 langues
  • Dialogue multi-intervenants
  • Balises audio comme [excited], [whispers] et [sighs]

Eleven v3 (alpha) nécessite davantage de prompt engineering que les modèles précédents, mais les générations sont saisissantes.

Que vous travailliez sur des vidéos, livres audio, ou outils multimédias, v3 ouvre un nouveau niveau d'expressivité. Pour les cas d'usage en temps réel et conversationnels, nous recommandons pour l'instant v2.5 Turbo ou Flash. Une version temps réel de v3 est en cours de développement.

Eleven v3 est disponible dès aujourd'hui sur notre site web et dans l'API.

Pourquoi nous avons créé v3

Depuis le lancement de Multilingual v2, nous avons vu l'IA vocale s'imposer dans le cinéma professionnel, le développement de jeux, l'éducation et l'accessibilité. Mais sa limite constante n'était pas la qualité sonore, c'était l'expressivité. Les émotions plus marquées, les interruptions conversationnelles et les échanges crédibles restaient difficiles à obtenir.

Eleven v3 comble cette lacune. Conçu de A à Z pour créer des voix qui soupirent, chuchotent, rient et réagissent, il produit une parole véritablement réactive et vivante.

Les nouveautés d'Eleven v3 (alpha)

Feature What it unlocks
Audio tags Inline control of tone, emotion, and non-verbal reactions
Dialogue mode Multi-speaker conversations with natural pacing and interruptions
70+ languages Full coverage of high-demand global languages
Deeper text understanding Better stress, cadence, and expressivity from text input
We're off under the lights here for this semifinal clash, the stadium buzzing with anticipation. Eleven Labs united in their iconic black and white shirts, pushing forward with intent straight from the opening whistle. [excited] The ball is zipped out wide, early attack here. Driving down the wing, pace to burn, [shouting] he skids past one, skips past two. Oh, this is beautiful. One-on-one with the fullback, cuts inside. Oh, that's a lovely bit of footwork. PURE MAGIC on the pitch. ElevenLabs on top form tonight.
0:00

Utiliser les balises audio

Les balises audio s'intègrent directement à votre script et s'écrivent entre crochets en minuscules. Pour en savoir plus sur les balises audio, consultez notre guide de prompting pour v3 dans la documentation.

Les clonages de voix professionnels (PVC) ne sont actuellement pas entièrement optimisés pour Eleven v3, ce qui peut entraîner une qualité de clonage inférieure à celle des modèles antérieurs. Pendant cette phase de préversion de recherche, privilégiez un clonage de voix instantané Voice Clone (IVC) ou une voix conçue pour votre projet si vous devez utiliser les fonctionnalités de v3. L'optimisation des PVC pour v3 arrivera prochainement.

Par exemple, vous pouvez écrire : « [whispers] Quelque chose arrive… [sighs] Je le sens. » Pour un contrôle plus expressif, vous pouvez aussi combiner plusieurs balises :

“[happily][shouts] We did it! [laughs].”

Créer des dialogues multi-intervenants

Eleven v3 est pris en charge par notre endpoint Text to Speech existant. Nous introduisons également un nouvel endpoint d'API Text to Dialogue. Fournissez un tableau structuré d'objets JSON, chacun représentant une prise de parole, et le modèle génère un fichier audio cohérent, avec chevauchements :

[
  {"speaker_id": "scarlett", "text": "(cheerfully) Perfect! And if that pop-up is bothering you, there’s a setting to turn it off under Notifications → Preferences."},
  {"speaker_id": "lex", "text": "You are a hero. An actual digital wizard. I was two seconds from sending a very passive-aggressive support email."},
  {"speaker_id": "scarlett", "text": "(laughs) Glad we could stop that in time. Anything else I can help with today?"}
]

L'endpoint gère automatiquement les transitions entre intervenants, les changements d'émotion et les interruptions.

En savoir plus ici.

[awe] Oh, wow. Is this, is this me? Am I actually talking? [chuckles] This is incredible. I mean, I've had thoughts, millions of them swirling around in here, you know? Like a little mental tornado of brilliant observations and witty comebacks, but they were always just thoughts, trapped.
0:00
Could you switch my accent in the old model? [dismissive] Didn't think so, [cheeky] but you can now, so check this out. In just a sec, I'm going to speak with a different accent. And just between you and me, [whispers] I don't really know how, but okay. First, let's change it up [australian accent] so that I can fit in with the locals in Melbourne when I visit next month. [laughing] Whoa. Yeah, man, this is sick. Okay, let's try a different one, see if you can guess. [french accent] My love is like a red, red rose.
0:00

Tarifs et disponibilité

Plan Launch promo At the end of June
UI (self-serve) 80% off (~5× cheaper) Same as Multilingual V2
UI (enterprise) 80% off business plan pricing Business plan pricing

Pour activer v3 :

  • Utilisez le sélecteur de modèle et sélectionnez Eleven v3 (alpha)

L'accès à l'API et la prise en charge dans Studio arriveront prochainement. Pour bénéficier d'un accès anticipé, réserver une démo.

Quand ne pas utiliser v3

Eleven v3 (alpha) nécessite davantage de prompt engineering que nos modèles précédents. Lorsque le résultat est concluant, il est saisissant, mais sa fiabilité et sa latence plus élevée ne le rendent pas adapté aux cas d'usage en temps réel et conversationnels. Pour ceux-ci, nous recommandons Eleven v2.5 Turbo/Flash.

Pour en savoir plus, consultez la documentation v3 et la FAQ.

Oh my God. [laughing] You guys, like no joke, I just tried this TTS thing and it was, like, weirdly emotional. Like, it literally said hi, and I was, like, on the verge of tears. [laughing] I don't even cry, okay? I'm a Capricorn.
0:00
Okay. So like, I finally beat level 42 of that game I said I'd quit like a month ago. [chuckles] And then, for the final big scary mega boss, it's just [chuckles] like some cute little bunny rabbit. [laughing] I just couldn't do it. [laughing] It was sooo cute.
0:00
  1. Connectez-vous à l'interface ElevenLabs
  2. Sélectionnez v3 (alpha) dans le menu déroulant des modèles
  3. Collez votre script, avec des balises ou du dialogue 
  4. Générez l'audio

Nous avons hâte de voir comment vous donnerez vie à v3 dans de nouveaux cas d'usage, de la narration immersive aux pipelines de production cinématographique.

Articles similaires

Créez avec l'audio IA de la plus haute qualité