WebSockets de Text to Speech vs Text to Dialogue
A ElevenLabs oferece dois produtos WebSocket diferentes para transmitir fala sintetizada. Eles resolvem problemas distintos, aceitam formatos de mensagem diferentes e são voltados para modelos diferentes.
Qual WebSocket devo usar?
Use o WebSocket de Text to Speech (TTS) quando transmitir texto simples para uma voz por conexão (a voz é fixa na URL) e quiser usar modelos não v3, como Flash ou Multilingual v2, SSML opcional, agendamentos de chunks ou a variante de multicontexto para lidar com interrupções no estilo de agentes.
Use o WebSocket de Text to Dialogue (TTD) quando precisar do comportamento de diálogo do Eleven v3: entrega expressiva, **voice_id por chunk **, limites de turno (new_turn) e o mesmo buffering voltado para diálogos usado para v3 no servidor.
Para diálogos por lote ou streaming HTTP (solicitação completa em uma chamada), use Criar diálogo ou Transmitir diálogo em vez de um WebSocket.
Comparação
Quando o WebSocket TTS é a melhor opção
- Você já integra Flash ou Multilingual v2 para reduzir a latência ou ampliar a cobertura de idiomas.
- Você quer uma voz de narrador por conexão e um protocolo simples de texto por frame.
- Você precisa de orquestração multicontexto para interrupções e falas paralelas (guia de multicontexto).
Consulte Gerar áudio em tempo real para ver um guia completo do WebSocket TTS.
Quando o WebSocket TTD é a melhor opção
- Você usa diálogos do Eleven v4 (tags expressivas, ritmo de conversa, falas de vários participantes).
- Você transmite diálogos roteirizados ou gerados por LLM em que a voz pode mudar a cada fala sem abrir uma nova conexão.
- Você quer entrada incremental no formato de WebSocket, com geração de diálogos exclusiva do v4 no servidor.
Para um guia prático, use Text to Dialogue em tempo real. Os detalhes do protocolo estão na referência da API.