Strömma tal med tidsinformation
Omvandlar text till tal med en röst du väljer och returnerar en ström av JSON-objekt med ljud som en base64-kodad sträng samt information om när varje tecken uttalades.
Sökvägsparametrar
ID för rösten som ska användas. Använd endpointen Hämta röster för att lista alla tillgängliga röster.
Headers
Frågeparametrar
När enable_logging är satt till false används nollkvarhållningsläge för begäran. Det innebär att historikfunktioner, inklusive sammanfogning av begäranden, inte är tillgängliga för denna begäran. Nollkvarhållningsläge får endast användas av företagskunder.
Du kan aktivera latensoptimeringar på bekostnad av viss kvalitet. Bästa möjliga slutliga latens varierar beroende på modell. Möjliga värden: 0 - standardläge (inga latensoptimeringar) 1 - normala latensoptimeringar (cirka 50 % av den möjliga latensförbättringen med alternativ 3) 2 - kraftiga latensoptimeringar (cirka 75 % av den möjliga latensförbättringen med alternativ 3) 3 - maximala latensoptimeringar 4 - maximala latensoptimeringar, men även med textnormaliseraren avstängd för ännu större latensbesparingar (bästa latens, men kan uttala till exempel siffror och datum fel).
Standardvärdet är None.
Output format of the generated audio. Formatted as codec_sample_rate_bitrate. So an mp3 with 22.05kHz sample rate at 32kbs is represented as mp3_22050_32. MP3 with 192kbps bitrate requires you to be subscribed to Creator tier or above. PCM with 44.1kHz sample rate requires you to be subscribed to Pro tier or above. Note that the μ-law format (sometimes written mu-law, often approximated as u-law) is commonly used for Twilio audio inputs.
Förfrågan
Identifierare för modellen som ska användas. Du kan fråga efter modellerna med GET /v1/models. Modellen måste ha stöd för Text to Speech, vilket du kan kontrollera med egenskapen can_do_text_to_speech.
Språkkod (ISO 639-1) som används för att tillämpa ett språk för modellen och textnormalisering. Om modellen inte stöder den angivna språkkoden ignoreras den. Parametern stöds inte för multilingual_v2-modeller.
Röstinställningar som åsidosätter lagrade inställningar för den angivna rösten. De tillämpas endast på den angivna begäran.
En lista med pekare till uttalslexikon (id, version_id) som ska tillämpas på texten. De tillämpas i ordning. Du kan ha upp till 3 pekare per begäran
Om angivet försöker systemet sampla deterministiskt, så att upprepade förfrågningar med samma seed och parametrar bör ge samma resultat. Determinism garanteras inte. Måste vara ett heltal mellan 0 och 4294967295.
Texten som kom före texten i den aktuella begäran. Kan användas för att förbättra talets kontinuitet när flera genereringar sammanfogas eller för att påverka talets kontinuitet i den aktuella genereringen.
Texten som kommer efter texten i den aktuella begäran. Kan användas för att förbättra talets kontinuitet när flera genereringar sammanfogas eller för att påverka talets kontinuitet i den aktuella genereringen.
En lista med request_id för proverna som genererades före den här genereringen. Kan användas för att förbättra talets kontinuitet när en stor uppgift delas upp i flera begäranden. Resultatet blir bäst när samma modell används för alla genereringar. Om både previous_text och previous_request_ids skickas ignoreras previous_text. Högst 3 request_ids kan skickas.
A list of request_id of the samples that come after this generation. next_request_ids is especially useful for maintaining the speech's continuity when regenerating a sample that has had some audio quality issues. For example, if you have generated 3 speech clips, and you want to improve clip 2, passing the request id of clip 3 as a next_request_id (and that of clip 1 as a previous_request_id) will help maintain natural flow in the combined speech. The results will be best when the same model is used across the generations. In case both next_text and next_request_ids is send, next_text will be ignored. A maximum of 3 request_ids can be send.
Om IVC-versionen av en professionell röst ska användas. Det kan förbättra uttrycksfullheten och minska latensen.
Den här parametern styr textnormalisering med tre lägen: 'auto', 'on' och 'off'. När den är inställd på 'auto' avgör systemet automatiskt om textnormalisering ska användas (t.ex. att skriva ut siffror med bokstäver). Med 'on' används textnormalisering alltid, medan den hoppas över med 'off'.
Den här parametern styr språklig textnormalisering. Den hjälper till med korrekt uttal av text på vissa språk som stöds. VARNING: Den här parametern kan öka fördröjningen för begäran avsevärt. Stöds för närvarande endast för japanska.
Svar
Ström av transkriptionssegment
Base64-kodade ljuddata
Tidsstämpelinformation för varje tecken i originaltexten
Tidsstämpelinformation för varje tecken i den normaliserade texten