WebSocket Text to Speech e Text to Dialogue
ElevenLabs offre due diversi prodotti WebSocket per lo streaming del parlato sintetizzato. Risolvono problemi diversi, accettano formati di messaggio diversi e sono destinati a modelli diversi.
Quale WebSocket devo usare?
Usa il WebSocket Text to Speech (TTS) quando trasmetti testo semplice per una voce per connessione (la voce è fissa nell’URL) e vuoi usare modelli non v3 come Flash o Multilingual v2, SSML facoltativo, pianificazioni dei blocchi o la variante multi-contesto per la gestione delle interruzioni in stile agente.
Usa il WebSocket Text to Dialogue (TTD) quando hai bisogno del comportamento di dialogo di Eleven v3: interpretazione espressiva, **voice_id per blocco **, confini di turno (new_turn) e lo stesso buffering orientato al dialogo utilizzato per v3 sul server.
Per dialoghi batch o in streaming HTTP (richiesta completa in una sola chiamata), utilizza invece Crea dialogo o Trasmetti dialogo anziché un WebSocket.
Confronto
Quando il WebSocket TTS è la scelta migliore
- Hai già integrato Flash o Multilingual v2 per la latenza o la copertura linguistica.
- Vuoi una voce narrante per connessione e un semplice protocollo con testo per frame.
- Ti serve l’orchestrazione multi-contesto per barge-in e enunciati paralleli (guida multi-contesto).
Consulta Generare audio in tempo reale per una guida completa al WebSocket TTS.
Quando il WebSocket TTD è la scelta migliore
- Il tuo obiettivo sono dialoghi Eleven v4 (tag espressivi, ritmo conversazionale, battute con più parlanti).
- Trasmetti dialoghi scritti o generati da LLM in cui la voce parlante può cambiare per ogni battuta senza aprire una nuova connessione.
- Vuoi input incrementali in formato WebSocket con generazione di dialoghi solo v4 sul server.
Per una guida pratica, utilizza Text to Dialogue in tempo reale. I dettagli del protocollo sono nel riferimento API.