API Text to Speech
Génération vocale ultra-réaliste et à faible latence
Créez avec un Text to Speech de haute qualité et contrôlable, adapté aux applications en temps réel ou en volume. Nos modèles sont optimisés pour la latence, la fidélité et la cohérence sur de longs contenus.
Démo
Code
Dans l'ancienne terre d'Eldoria, où les cieux scintillaient et les forêts murmuraient des secrets au vent, vivait un dragon nommé Zephyros. [sarcastically] Pas du genre à tout brûler... [giggles] mais il était doux, sage, avec des yeux comme de vieilles étoiles. [whispers] Même les oiseaux se taisaient quand il passait.
- Lovable
- Synthesia
- Stripe
- Perplexity
- Twilio
Basé sur les modèles de voix IA les plus puissants
Choisissez le modèle adapté à votre usage : agents ultra-rapides ou narration longue et expressive.

Flash v2.5
Notre modèle de synthèse vocale à la latence la plus faible
- Ultra-faible latence (~75ms)
- 32 langues prises en charge
- Limite de 40 000 caractères
- ~0,06 $ par minute

Turbo v2.5
Équilibre entre qualité et latence
- Faible latence (~250-300ms)
- Génération de voix de haute qualité
- 32 langues prises en charge
- Limite de 40 000 caractères
- ~0,06 $ par minute

Multilingue v2
Modèle de synthèse vocale naturel et constant
- Rendu naturel
- 29 langues prises en charge
- Limite de 10 000 caractères
- Pensé pour les longs formats
- ~0,12 $ par minute

Eleven v3
Notre modèle le plus expressif et riche en émotions
- Interprétation et expressivité poussées
- Plus de 70 langues prises en charge
- Limite de 3 000 caractères
- Dialogue multi-intervenants
- ~0,12 $ par minute
Tout ce qu’il vous faut pour créer une voix prête à l’emploi
Générez une voix expressive et contrôlable avec des modèles pensés pour le temps réel, le long format et la production.
Contrôlez l’émotion et l’intonation
Créez une voix expressive et contrôlable, enrichie d’émotions, d’événements audio et d’ambiances immersives.

Accédez à plus de 10 000 voix
Découvrez une collection grandissante de voix expressives et naturelles pour tous vos besoins.

Création et clonage de voix
Créez dans plus de 30 langues avec des voix naturelles, des accents expressifs et un audio localisé pour votre public.

Dialogue multi-intervenants
Créez des conversations naturelles avec plusieurs intervenants dans plus de 70 langues grâce à des voix expressives et modulables.

Événements audio et direction
Contrôlez l’intonation avec des balises audio, des repères temporels et une direction narrative intégrée à la voix.

Dictionnaires de prononciation
Définissez des prononciations personnalisées pour garantir une voix précise et cohérente pour les noms et termes spécifiques.

Au service des plus grandes entreprises et marques mondiales
“Du doublage de Reels en langues locales à la création de musiques et de voix de personnages dans Horizon, ElevenLabs permet aux créateurs, entreprises et organisations du monde entier de travailler la voix, la musique et le son à grande échelle.”
“Des millions de personnes apprennent les échecs chaque jour avec des créateurs comme Hikaru, Levy et Magnus sur YouTube et Twitch. Désormais, vous pouvez apprendre avec eux directement sur Chess.com, de façon immersive, personnalisée et pleine de caractère. Notre mission : créer un coach d’échecs qui enseigne au bon niveau, accueille tous les joueurs et démystifie les échecs tout en gardant le plaisir et la personnalité. Avec ElevenLabs et ces nouvelles voix incroyables, nous faisons un grand pas vers cette vision.”
“ElevenLabs nous a permis d’intégrer rapidement des fonctionnalités avancées de Text to Speech à notre SDK, pour que les agents répondent en temps réel avec des voix expressives aux questions des utilisateurs ou en retour sur ce qu’ils perçoivent.”

“Twilio a intégré la technologie de voix IA générative d’ElevenLabs à sa CPaaS, améliorant ConversationRelay. Cette intégration permet aux entreprises et développeurs de créer des interactions vocales IA naturelles, expressives et en temps réel directement depuis la plateforme CPaaS de Twilio. Chez ElevenLabs, nous sommes ravis que Twilio ait choisi ElevenLabs pour enrichir ConversationRelay avec les voix les plus expressives et naturelles disponibles.”
Des API conçues pour la production

Questions fréquentes
- Flash v2.5 - Ultra-faible latence (~75ms) pour les applications temps réel comme les agents vocaux
- Turbo v2.5 - Équilibre entre qualité et rapidité (~250-300ms) pour les usages interactifs
- Multilingual v2 - Qualité constante pour les contenus longs jusqu’à 10 000 caractères
- Eleven v3 - Expressivité et émotions maximales pour les usages créatifs
Flash v2.5 offre une latence d’environ 75ms.
Turbo v2.5 répond généralement en 250-300ms.
Les deux prennent en charge le streaming, ce qui permet de commencer la lecture avant la fin de la génération.
Eleven v3 prend en charge plus de 70 langues.
Flash v2.5 et Turbo v2.5 prennent en charge 32 langues.
Multilingual v2 prend en charge 29 langues.
Flash v2.5 et Turbo v2.5 : 40 000 caractères
Multilingual v2 : 10 000 caractères
Eleven v3 : 3 000 caractères
Utilisez des balises audio ([laughs], [whispers], [sighs], [door slam]) pour contrôler l’intonation, l’émotion, l’emphase, les pauses et les effets sonores. Eleven v3 offre le contrôle le plus expressif.
La Voice Library propose plus de 10 000 voix. Vous pouvez aussi cloner ou créer des voix personnalisées à partir de prompts textuels.
Oui. Le streaming permet de lancer la lecture avant que l’audio complet ne soit généré, ce qui réduit la latence perçue dans les applications temps réel.
Oui. Référencez n’importe quelle voix de votre bibliothèque via son ID, y compris les clones professionnels, les clones instantanés et les voix que vous avez créées.
L’API génère par défaut du MP3. Les autres formats disponibles sont PCM et μ-law.
Utilisez Flash v2.5 avec le streaming activé. Gardez les requêtes sous 1 000 caractères. Activez les connexions WebSocket pour les applications temps réel persistantes.
Oui. Utilisez l’orthographe phonétique ou les dictionnaires de prononciation pour contrôler la façon dont certains mots sont prononcés.
Des SDK officiels pour Python et JavaScript/TypeScript sont disponibles. Vous pouvez aussi utiliser l’API HTTP.
Le guide complet de l’API, des exemples de code et des guides d’intégration sont disponibles sur elevenlabs.io/docs/api-reference
Oui. Les offres entreprise incluent la conformité SOC 2, le support HIPAA, la conformité RGPD, la résidence des données UE, le mode sans conservation, un support dédié et des SLA personnalisés.
