WebSockets Text to Speech et Text to Dialogue
Ce guide explique comment choisir le WebSocket adapté au streaming de parole et en quoi les deux protocoles diffèrent.
ElevenLabs propose deux produits WebSocket différents pour diffuser de la parole synthétisée en continu. Ils répondent à des besoins distincts, acceptent différents formats de messages et ciblent différents modèles.
Quel WebSocket utiliser ?
Utilisez le WebSocket Text to Speech (TTS) lorsque vous diffusez du texte brut pour une voix par connexion (la voix est définie dans l’URL) et que vous souhaitez utiliser des modèles autres que v3, comme Flash ou Multilingual v2, le SSML facultatif, les plannings de segments ou la variante multi-contexte pour gérer les interruptions de type agent.
Utilisez le WebSocket Text to Dialogue (TTD) lorsque vous avez besoin du comportement de dialogue d’Eleven v3 : une restitution expressive, un **voice_id par segment **, des limites de tour (new_turn) et la même mise en mémoire tampon orientée dialogue que celle utilisée par v3 sur le serveur.
Pour le dialogue en traitement par lots ou diffusion HTTP (requête complète en un appel), utilisez plutôt Créer un dialogue ou Diffuser un dialogue qu’un WebSocket.
Comparaison
Quand le WebSocket TTS est le meilleur choix
- Vous intégrez déjà Flash ou Multilingual v2 pour leur faible latence ou leur couverture linguistique.
- Vous souhaitez une seule voix de narrateur par connexion et un protocole simple, avec un texte par trame.
- Vous avez besoin d’une orchestration multi-contexte pour les interruptions et les énoncés parallèles (guide multi-contexte).
Consultez Générer de l’audio en temps réel pour une présentation complète du WebSocket TTS.
Quand le WebSocket TTD est le meilleur choix
- Vous ciblez les dialogues Eleven v4 (balises expressives, rythme conversationnel, répliques multi-locuteurs).
- Vous diffusez des dialogues scénarisés ou générés par un LLM, où la voix parlante peut changer à chaque ligne sans ouvrir de nouvelle connexion.
- Vous souhaitez une entrée incrémentielle au format WebSocket avec une génération de dialogue réservée à v4 sur le serveur.
Pour une présentation pratique, consultez Text to Dialogue en temps réel. Les détails du protocole figurent dans le Guide de l’API.