Skapa dialog
Omvandlar en lista med text- och röst-ID-par till tal (dialog) och returnerar ljud.
Headers
Frågeparametrar
Output format of the generated audio. Formatted as codec_sample_rate_bitrate. So an mp3 with 22.05kHz sample rate at 32kbs is represented as mp3_22050_32. MP3 with 192kbps bitrate requires you to be subscribed to Creator tier or above. PCM and WAV formats with 44.1kHz sample rate requires you to be subscribed to Pro tier or above. Note that the μ-law format (sometimes written mu-law, often approximated as u-law) is commonly used for Twilio audio inputs.
När enable_logging är satt till false används nollkvarhållningsläge för begäran. Det innebär att historikfunktioner, inklusive sammanfogning av begäranden, inte är tillgängliga för denna begäran. Nollkvarhållningsläge får endast användas av företagskunder.
Förfrågan
En lista med dialogindata som var och en innehåller text och ett röst-ID som konverteras till tal. Det högsta antalet unika röst-ID:n är 10. För tillförlitlig generering bör det sammanlagda antalet tecken i alla inputs[].text-värden vara högst 2 000 tecken per begäran. Längre begäranden kan avslutas i förtid i streamade svar eller returnera ett valideringsfel.
Identifierare för modellen som ska användas. Du kan fråga efter modellerna med GET /v1/models. Modellen måste ha stöd för Text to Speech, vilket du kan kontrollera med egenskapen can_do_text_to_speech.
Språkkod (ISO 639-1) som används för att tillämpa ett språk för modellen och textnormalisering. Om modellen inte stöder den angivna språkkoden ignoreras den. Parametern stöds inte för multilingual_v2-modeller.
Inställningar som styr dialoggenereringen.
Texten som kommer direkt före den här genereringen och används för att styra modellen mot prosodisk kontinuitet. Högst 100 tecken kan skickas. Stöds inte av alla modeller.
Texten som kommer direkt efter den här genereringen och används för att styra modellen mot prosodisk kontinuitet. Högst 100 tecken kan skickas. Stöds inte av alla modeller.
En lista med pekare till uttalslexikon (id, version_id) som ska tillämpas på texten. De tillämpas i ordning. Du kan ha upp till 3 pekare per begäran
Om angivet försöker systemet sampla deterministiskt, så att upprepade förfrågningar med samma seed och parametrar bör ge samma resultat. Determinism garanteras inte. Måste vara ett heltal mellan 0 och 4294967295.
Den här parametern styr textnormalisering med tre lägen: 'auto', 'on' och 'off'. När den är inställd på 'auto' avgör systemet automatiskt om textnormalisering ska användas (t.ex. att skriva ut siffror med bokstäver). Med 'on' används textnormalisering alltid, medan den hoppas över med 'off'.
Om IVC-versionen av en professionell röst ska användas. Det kan förbättra uttrycksfullheten och minska latensen.
En lista med request_ids för dialoggenereringar som kom före den här. Används för att styra modellen mot kontinuitet när en stor uppgift delas upp i flera begäranden. Högst 3 request_ids kan skickas. Det sista request_id:t är ljudet som ligger närmast den aktuella begäran. Stöds inte av alla modeller.
En lista med request_ids för dialoggenereringar som kommer efter den här. Användbart för att bibehålla kontinuitet när du återskapar ett klipp mitt i en sekvens. Högst 3 request_ids kan skickas. Det första request_id:t är ljudet som ligger närmast den aktuella begäran. Stöds inte av alla modeller.