Vad är Text-to-Speech WebSockets API?
WebSocket-slutpunkten för streaming, ibland även kallad input streaming, erbjuder text-till-tal-konvertering i realtid med WebSockets. Det gör att du kan skicka ett textmeddelande och få tillbaka ljuddata i realtid.
Den är utformad för att börja generera ljudsegment från endast delar av inmatningstexten. Den kan minska latensen genom att börja generera utdata innan hela sammanhanget har skickats och är avsedd att användas tillsammans med andra verktyg, till exempel stora språkmodeller (LLM:er). Det genererade ljudet kommer fortfarande att låta som ett sammanhängande tal.
Även om WebSockets API är mycket flexibelt är det inte en universallösning.
Det passar bra för scenarier där:
- Indatatexten streamas eller genereras i delar.
- Lägsta möjliga latens behövs.
- Information om ord-till-ljud-justering krävs.
Det är kanske inte det bästa valet när:
- Hela indatatexten skickas på en gång. Eftersom genereringarna är partiella krävs viss buffring, vilket kan ge något högre latens jämfört med en vanlig HTTP-förfrågan. I sådana fall är det troligen bättre att bara använda slutpunkten för output streaming.
- Du vill experimentera eller skapa en prototyp snabbt. Att arbeta med WebSockets kan vara svårare och mer komplext än att använda ett vanligt HTTP API, vilket kan göra snabb utveckling och testning långsammare.
- Högsta möjliga konsekvens är mycket viktigt. Då behöver du ta hänsyn till AI:ns förståelse av sammanhanget. Eftersom AI:n inte får hela sammanhanget i början av förfrågan har den bara en delvis förståelse av texten, vilket i vissa fall kan orsaka problem. Du kan dock experimentera med några av inställningarna som är tillgängliga när du använder WebSocket-streaming, till exempel “chunk_length_schedule”. Den här parametern avgör hur stora segmenten måste vara innan AI:n börjar generera text.
Använd i stället Text to Speech API i dessa fall.
Mer information finns i WebSockets API-referensen.