WebSockets de Texto a Voz y Texto a Diálogo
WebSockets de Texto a Voz y Texto a Diálogo
Esta guía te muestra cómo elegir el WebSocket adecuado para transmitir voz y en qué se diferencian los dos protocolos.
ElevenLabs ofrece dos productos WebSocket diferentes para transmitir voz sintetizada en streaming. Resuelven problemas distintos, aceptan formatos de mensaje diferentes y están orientados a modelos distintos.
¿Qué WebSocket debo usar?
Usa el WebSocket de Texto a Voz (TTS) cuando transmitas texto sin formato para una voz por conexión (la voz se fija en la URL) y quieras usar modelos que no sean v3, como Flash o Multilingual v2, SSML opcional, programaciones de fragmentos o la variante de multicontexto para gestionar interrupciones al estilo de agentes.
Usa el WebSocket de Texto a Diálogo (TTD) cuando necesites el comportamiento de diálogo de Eleven v3: entonación expresiva, **voice_id por fragmento **, límites de turno (new_turn) y el mismo almacenamiento en búfer orientado al diálogo que se usa para v3 en el servidor.
Para diálogos mediante lotes o streaming HTTP (la solicitud completa en una llamada), usa Crear diálogo o Transmitir diálogo en lugar de un WebSocket.
Comparación
Cuándo encaja mejor el WebSocket de TTS
- Ya integras Flash o Multilingual v2 por latencia o cobertura de idiomas.
- Quieres una voz de narrador por conexión y un protocolo sencillo de texto por trama.
- Necesitas orquestación multicontexto para interrupciones y emisiones paralelas (guía de multicontexto).
Consulta Generar audio en tiempo real para ver una guía completa del WebSocket de TTS.
Cuándo encaja mejor el WebSocket de TTD
- Usas diálogos de Eleven v4 (etiquetas expresivas, ritmo conversacional, líneas con varias voces).
- Transmites diálogo generado por guion o LLM en el que la voz que habla puede cambiar en cada línea sin abrir una conexión nueva.
- Quieres una entrada incremental con formato de WebSocket con generación de diálogo solo para v4 en el servidor.
Para una guía práctica, consulta Texto a Diálogo en Tiempo Real. Los detalles del protocolo están en la referencia de la API.