Text to Speech
Découvrez comment transformer du texte en audio parlé réaliste avec ElevenLabs.
Présentation
L’API ElevenLabs Text to Speech (TTS) transforme le texte en audio réaliste avec une intonation, un rythme et une conscience émotionnelle nuancés. Nos modèles s’adaptent aux indices textuels dans 32 langues et à de multiples styles vocaux, et permettent de :
- Narrer des campagnes média et publicitaires internationales
- Produire des livres audio dans plusieurs langues avec des interprétations émotionnelles complexes
- Diffuser de l’audio en temps réel à partir de texte
Écoutez un exemple :
Explorez notre Voice Library pour trouver la voix idéale pour votre projet.
Qualité vocale
Pour les applications en temps réel, Flash v2.5 offre une latence ultra-faible de 75 ms, tandis que Multilingual v2 fournit un audio de la plus haute qualité avec une expression plus nuancée.
Options de voix
ElevenLabs propose des milliers de voix dans 32 langues, créées par différentes méthodes :
- Voice Library avec plus de 3 000 voix partagées par la communauté
- Clonage de voix professionnel pour des répliques d’une fidélité maximale
- Clonage de voix instantané pour reproduire rapidement une voix
- Création de voix pour générer des voix personnalisées à partir de descriptions textuelles
En savoir plus sur nos options de voix.
Formats de sortie pris en charge
Le format de réponse par défaut est mp3, mais d’autres formats, tels que pcm et ulaw, sont disponibles.
- MP3
- Fréquences d’échantillonnage : 22,05 kHz à 44,1 kHz
- Débits binaires : 32 kbps à 192 kbps
- 22,05 kHz à 32 kbps
- 44,1 kHz à 32 kbps, 64 kbps, 96 kbps, 128 kbps, 192 kbps
- PCM (S16LE)
- Fréquences d’échantillonnage : 16 kHz à 44,1 kHz
- Débits binaires : 8 kHz, 16 kHz, 22,05 kHz, 24 kHz, 44,1 kHz, 48 kHz
- Profondeur de 16 bits
- μ-law
- Fréquence d’échantillonnage de 8 kHz
- Optimisé pour les applications de téléphonie
- A-law
- Fréquence d’échantillonnage de 8 kHz
- Optimisé pour les applications de téléphonie
- Opus
- Fréquence d’échantillonnage : 48 kHz
- Débits binaires : 32 kbps à 192 kbps
Les options audio de qualité supérieure sont disponibles uniquement avec les forfaits payants. Consultez notre page des tarifs pour en savoir plus.
Langues prises en charge
Nos modèles multilingues v2 prennent en charge 29 langues :
Anglais (États-Unis, Royaume-Uni, Australie, Canada), japonais, chinois, allemand, hindi, français (France, Canada), coréen, portugais (Brésil, Portugal), italien, espagnol (Espagne, Mexique), indonésien, néerlandais, turc, filipino, polonais, suédois, bulgare, roumain, arabe (Arabie saoudite, Émirats arabes unis), tchèque, grec, finnois, croate, malais, slovaque, danois, tamoul, ukrainien et russe.
Flash v2.5 prend en charge 32 langues, toutes les langues des modèles v2 ainsi que :
Hongrois, norvégien et vietnamien
Saisissez simplement du texte dans l’une des langues prises en charge et sélectionnez une voix correspondante dans notre Voice Library. Pour un résultat plus naturel, choisissez une voix dont l’accent correspond à votre langue et région cibles.
Prompting
Les modèles interprètent directement le contexte émotionnel à partir du texte saisi. Par exemple, l’ajout de texte descriptif tel que « elle dit avec enthousiasme » ou l’emploi de points d’exclamation influencent l’émotion de la voix. Les réglages vocaux tels que la stabilité et la similarité permettent de contrôler la cohérence, tandis que l’émotion sous-jacente provient des indices textuels.
Consultez le guide de prompting pour en savoir plus.
Le texte descriptif sera prononcé par le modèle et devra être coupé ou supprimé manuellement de l’audio si nécessaire.
FAQ
Puis-je cloner ma propre voix ?
Oui, vous pouvez créer des clones vocaux instantanés de votre propre voix à partir de courts extraits audio. Pour des clones haute fidélité, découvrez notre fonctionnalité de clonage de voix professionnel.
Suis-je propriétaire de l’audio généré ?
Oui. Vous conservez la propriété de tout audio que vous générez. Toutefois, les droits d’utilisation commerciale sont uniquement disponibles avec les forfaits payants. Avec un abonnement payant, vous pouvez utiliser l’audio généré à des fins commerciales et monétiser les résultats si vous détenez les droits de propriété intellectuelle sur le contenu source.
Qu’est-ce qui donne droit à une régénération gratuite ?
Une régénération gratuite vous permet de générer à nouveau le même contenu de synthèse vocale sans frais supplémentaires, sous réserve des conditions suivantes :
- Vous pouvez régénérer chaque contenu jusqu’à 2 fois gratuitement
- Le contenu doit être exactement identique à la génération précédente. Toute modification du texte, des réglages vocaux ou d’autres paramètres nécessitera une nouvelle génération payante
Les régénérations gratuites sont utiles en cas de légère distorsion de l’audio généré. Selon les évaluations internes d’ElevenLabs, les régénérations résolvent environ la moitié des problèmes de qualité, les problèmes restants étant généralement dus à des données d’entraînement insuffisantes.
Comment réduire la latence pour les cas en temps réel ?
Utilisez les modèles Flash à faible latence (Flash v2 ou v2.5), optimisés pour des scénarios conversationnels ou interactifs quasi temps réel. Consultez notre guide d’optimisation de la latence pour en savoir plus.
Pourquoi le résultat est-il parfois incohérent ?
Les modèles sont non déterministes. Pour plus de cohérence, utilisez le paramètre seed facultatif, bien que de légères différences puissent subsister.
Quelle est la bonne pratique pour convertir de longs textes ?
Divisez les textes longs en segments et utilisez le streaming pour une lecture en temps réel et un traitement efficace. Pour préserver un flux prosodique naturel entre les segments, incluez les paramètres previous/next text ou previous/next request id.
Points clés
- Déterminisme : le résultat est non déterministe, utilisez le paramètre
seedpour des résultats plus cohérents - Régénérations gratuites : jusqu’à 2 régénérations gratuites par génération, uniquement pour le même contenu et les mêmes paramètres
- Propriété : vous conservez la propriété de l’audio généré ; l’utilisation commerciale nécessite un forfait payant
- Cas d’utilisation à faible latence : utilisez les modèles Flash (
eleven_flash_v2oueleven_flash_v2_5), consultez le guide d’optimisation de la latence - Textes longs : divisez les textes longs en segments ; utilisez les paramètres
previous_text/next_textpour préserver une prosodie naturelle entre les segments