Aller au contenu

Présentation de Eleven v3 (alpha)

Publié

ÉcouterÉcouter cet article

Eleven v3 is no longer in alpha, and is now generally available.


Nous sommes heureux de présenter Eleven v3 (alpha) — un modèle Text to Speech à l’expressivité avancée.

Cet aperçu de recherche offre un niveau de contrôle et de réalisme inédit pour la génération de parole, avec :

  • Plus de 70 langues
  • Dialogues avec plusieurs locuteurs
  • Balises audio telles que [excited], [whispers] et [sighs]

Eleven v3 (alpha) nécessite davantage de prompt engineering que les modèles précédents, mais les générations sont saisissantes.

Pour vos vidéos, livres audio ou outils multimédias, v3 ouvre de nouvelles possibilités d’expression. Pour les cas d’usage en temps réel et conversationnels, nous recommandons pour l’instant v2.5 Turbo ou Flash. Une version temps réel de v3 est en cours de développement.

Eleven v3 est disponible dès aujourd’hui sur notre site et via l’API.

Pourquoi nous avons créé v3

Depuis le lancement de Multilingual v2, l’IA vocale a été adoptée dans le cinéma professionnel, le développement de jeux, l’éducation et l’accessibilité. Mais sa limite persistante n’était pas la qualité sonore, c’était l’expressivité. Il était difficile d’obtenir des émotions plus marquées, des interruptions conversationnelles et des échanges crédibles.

Eleven v3 répond à ce besoin. Conçu de A à Z, il produit des voix qui soupirent, chuchotent, rient et réagissent, pour une parole véritablement vivante et réactive.

Les nouveautés d’Eleven v3 (alpha)

Feature What it unlocks
Audio tags Inline control of tone, emotion, and non-verbal reactions
Dialogue mode Multi-speaker conversations with natural pacing and interruptions
70+ languages Full coverage of high-demand global languages
Deeper text understanding Better stress, cadence, and expressivity from text input

Écoutez v3 par vous-même

Background
Background

Utiliser les balises audio

Les balises audio s’intègrent directement à votre script et s’écrivent entre crochets en minuscules. Consultez notre guide de prompting v3 dans la documentation.

Les Clonages de Voix professionnels (PVC) ne sont pas encore entièrement optimisés pour Eleven v3, ce qui peut entraîner une qualité de clonage inférieure à celle des modèles précédents. Durant cette phase d’aperçu de recherche, privilégiez un clonage instantané Clonage de Voix (IVC) ou une voix conçue pour votre projet si vous souhaitez utiliser les fonctionnalités de v3. L’optimisation des PVC pour v3 arrivera prochainement.

Par exemple, vous pouvez écrire : « [whispers] Something’s coming… [sighs] I can feel it. » Pour un contrôle plus expressif, combinez plusieurs balises :

“[happily][shouts] We did it! [laughs].”

Créer des dialogues avec plusieurs locuteurs

Eleven v3 est compatible avec notre endpoint Text to Speech existant. Nous introduisons également un nouvel endpoint API Text to Dialogue. Fournissez un tableau structuré d’objets JSON, chacun représentant une prise de parole, et le modèle génère un fichier audio cohérent, avec chevauchements :

[
  {"speaker_id": "scarlett", "text": "(cheerfully) Perfect! And if that pop-up is bothering you, there’s a setting to turn it off under Notifications → Preferences."},
  {"speaker_id": "lex", "text": "You are a hero. An actual digital wizard. I was two seconds from sending a very passive-aggressive support email."},
  {"speaker_id": "scarlett", "text": "(laughs) Glad we could stop that in time. Anything else I can help with today?"}
]

L’endpoint gère automatiquement les transitions entre locuteurs, les changements d’émotion et les interruptions.

En savoir plus ici.

v3 est notre modèle le plus expressif

Background
Background

Tarifs et disponibilité

Plan Launch promo At the end of June
UI (self-serve) 80% off (~5× cheaper) Same as Multilingual V2
UI (enterprise) 80% off business plan pricing Business plan pricing

Pour activer v3 :

  • Utilisez le sélecteur de modèles et sélectionnez Eleven v3 (alpha)

L’accès à l’API et la prise en charge dans Studio arrivent prochainement. Pour un accès anticipé, contactez notre équipe commerciale.

Quand ne pas utiliser v3

Eleven v3 (alpha) nécessite davantage de prompt engineering que nos modèles précédents. Lorsque le modèle fonctionne bien, le résultat est saisissant, mais sa fiabilité et sa latence plus élevée ne conviennent pas aux cas d’usage en temps réel et conversationnels. Pour ces usages, nous recommandons Eleven v2.5 Turbo/Flash.

Pour en savoir plus, consultez la documentation complète de v3 et la FAQ.

Essayez-le dès aujourd’hui

Background
Background
  1. Connectez-vous à l’interface ElevenLabs
  2. Sélectionnez v3 (alpha) dans le menu déroulant des modèles
  3. Collez votre script, puis utilisez des balises ou un dialogue 
  4. Générez l’audio

Nous avons hâte de voir comment vous donnerez vie à v3 dans de nouveaux cas d’usage, de la narration immersive aux chaînes de production cinématographiques.

Créez avec l'audio IA de la plus haute qualité