Présentation de Eleven v3 (alpha)
- Publié
ÉcouterÉcouter cet article
Nous sommes heureux de dévoiler Eleven v3 (alpha), le modèle Text to Speech le plus expressif.
Cette préversion de recherche offre un contrôle et un réalisme sans précédent pour la génération vocale, avec :
- Plus de 70 langues
- Dialogue multi-intervenants
- Balises audio comme [excited], [whispers] et [sighs]
Eleven v3 (alpha) nécessite davantage de prompt engineering que les modèles précédents, mais les générations sont saisissantes.
Que vous travailliez sur des vidéos, livres audio, ou outils multimédias, v3 ouvre un nouveau niveau d'expressivité. Pour les cas d'usage en temps réel et conversationnels, nous recommandons pour l'instant v2.5 Turbo ou Flash. Une version temps réel de v3 est en cours de développement.
Eleven v3 est disponible dès aujourd'hui sur notre site web et dans l'API.
Pourquoi nous avons créé v3
Depuis le lancement de Multilingual v2, nous avons vu l'IA vocale s'imposer dans le cinéma professionnel, le développement de jeux, l'éducation et l'accessibilité. Mais sa limite constante n'était pas la qualité sonore, c'était l'expressivité. Les émotions plus marquées, les interruptions conversationnelles et les échanges crédibles restaient difficiles à obtenir.
Eleven v3 comble cette lacune. Conçu de A à Z pour créer des voix qui soupirent, chuchotent, rient et réagissent, il produit une parole véritablement réactive et vivante.
Les nouveautés d'Eleven v3 (alpha)
| Feature | What it unlocks |
|---|---|
| Audio tags | Inline control of tone, emotion, and non-verbal reactions |
| Dialogue mode | Multi-speaker conversations with natural pacing and interruptions |
| 70+ languages | Full coverage of high-demand global languages |
| Deeper text understanding | Better stress, cadence, and expressivity from text input |
Utiliser les balises audio
Les balises audio s'intègrent directement à votre script et s'écrivent entre crochets en minuscules. Pour en savoir plus sur les balises audio, consultez notre guide de prompting pour v3 dans la documentation.
Les clonages de voix professionnels (PVC) ne sont actuellement pas entièrement optimisés pour Eleven v3, ce qui peut entraîner une qualité de clonage inférieure à celle des modèles antérieurs. Pendant cette phase de préversion de recherche, privilégiez un clonage de voix instantané Voice Clone (IVC) ou une voix conçue pour votre projet si vous devez utiliser les fonctionnalités de v3. L'optimisation des PVC pour v3 arrivera prochainement.
Par exemple, vous pouvez écrire : « [whispers] Quelque chose arrive… [sighs] Je le sens. » Pour un contrôle plus expressif, vous pouvez aussi combiner plusieurs balises :
Créer des dialogues multi-intervenants
Eleven v3 est pris en charge par notre endpoint Text to Speech existant. Nous introduisons également un nouvel endpoint d'API Text to Dialogue. Fournissez un tableau structuré d'objets JSON, chacun représentant une prise de parole, et le modèle génère un fichier audio cohérent, avec chevauchements :
L'endpoint gère automatiquement les transitions entre intervenants, les changements d'émotion et les interruptions.
En savoir plus ici.
Tarifs et disponibilité
| Plan | Launch promo | At the end of June |
|---|---|---|
| UI (self-serve) | 80% off (~5× cheaper) | Same as Multilingual V2 |
| UI (enterprise) | 80% off business plan pricing | Business plan pricing |
Pour activer v3 :
- Utilisez le sélecteur de modèle et sélectionnez Eleven v3 (alpha)
L'accès à l'API et la prise en charge dans Studio arriveront prochainement. Pour bénéficier d'un accès anticipé, réserver une démo.
Quand ne pas utiliser v3
Eleven v3 (alpha) nécessite davantage de prompt engineering que nos modèles précédents. Lorsque le résultat est concluant, il est saisissant, mais sa fiabilité et sa latence plus élevée ne le rendent pas adapté aux cas d'usage en temps réel et conversationnels. Pour ceux-ci, nous recommandons Eleven v2.5 Turbo/Flash.
Pour en savoir plus, consultez la documentation v3 et la FAQ.
- Connectez-vous à l'interface ElevenLabs
- Sélectionnez v3 (alpha) dans le menu déroulant des modèles
- Collez votre script, avec des balises ou du dialogue
- Générez l'audio
Nous avons hâte de voir comment vous donnerez vie à v3 dans de nouveaux cas d'usage, de la narration immersive aux pipelines de production cinématographique.




