Cos’è l’API WebSockets Text to Speech?
Cos’è l’API WebSockets Text to Speech?
L’endpoint di streaming WebSocket, talvolta chiamato anche input streaming, offre la conversione text-to-speech in tempo reale tramite WebSockets. Ti permette di inviare un messaggio di testo e ricevere dati audio in tempo reale.
È progettato per iniziare a generare frammenti audio a partire da frammenti di testo anche parziali. Può contribuire a ridurre al minimo la latenza iniziando a generare l’output prima che venga fornito l’intero contesto ed è pensato per essere usato insieme ad altri strumenti, come i Large Language Models (LLM). L’audio generato avrà comunque il suono di un parlato continuo.
Pur essendo molto flessibile, l’API WebSockets non è una soluzione adatta a ogni caso d’uso.
È particolarmente indicata quando:
- Il testo di input viene trasmesso in streaming o generato in frammenti.
- Serve la latenza più bassa possibile.
- Sono richieste informazioni di allineamento tra parole e audio.
Potrebbe non essere la scelta migliore quando:
- L’intero testo di input viene fornito in una sola volta. Poiché le generazioni sono parziali, è necessario un certo buffering, che potrebbe comportare una latenza leggermente maggiore rispetto a una richiesta HTTP standard. In casi come questo, usare soltanto l’endpoint di output streaming è probabilmente l’opzione migliore.
- Vuoi sperimentare o creare rapidamente un prototipo. Lavorare con WebSockets può essere più difficile e complesso rispetto a usare un’API HTTP standard, rallentando lo sviluppo e i test rapidi.
- La massima coerenza possibile è fondamentale. Devi considerare la comprensione del contesto da parte dell’IA. Poiché all’IA non viene fornito il contesto completo all’inizio della richiesta, avrà solo una comprensione parziale del testo, che in alcuni casi può causare problemi. Puoi però sperimentare alcune impostazioni disponibili quando usi lo streaming WebSocket, come “chunk_length_schedule”. Questo parametro determina quanto devono essere grandi i frammenti prima che l’IA inizi a generare il testo.
In questi casi, usa invece l’API Text to Speech.
Per saperne di più, consulta il Riferimento API WebSockets.