Hoppa till navigering

Voice Changer-ström

Streama ljud från en röst till en annan. Behåll full kontroll över känsla, timing och framförande.

Sökvägsparametrar

voice_idstringObligatorisk

ID för rösten som ska användas. Använd endpointen Hämta röster för att lista alla tillgängliga röster.

Headers

xi-api-keystringValfri

Frågeparametrar

enable_loggingbooleanValfriStandard är true

När enable_logging är satt till false används nollkvarhållningsläge för begäran. Det innebär att historikfunktioner, inklusive sammanfogning av begäranden, inte är tillgängliga för denna begäran. Nollkvarhållningsläge får endast användas av företagskunder.

optimize_streaming_latencyinteger or nullValfriDeprecated

Du kan aktivera latensoptimeringar på bekostnad av viss kvalitet. Bästa möjliga slutliga latens varierar beroende på modell. Möjliga värden: 0 - standardläge (inga latensoptimeringar) 1 - normala latensoptimeringar (cirka 50 % av den möjliga latensförbättringen med alternativ 3) 2 - kraftiga latensoptimeringar (cirka 75 % av den möjliga latensförbättringen med alternativ 3) 3 - maximala latensoptimeringar 4 - maximala latensoptimeringar, men även med textnormaliseraren avstängd för ännu större latensbesparingar (bästa latens, men kan uttala till exempel siffror och datum fel).

Standardvärdet är None.

output_formatenumValfriStandard är mp3_44100_128

Output format of the generated audio. Formatted as codec_sample_rate_bitrate. So an mp3 with 22.05kHz sample rate at 32kbs is represented as mp3_22050_32. MP3 with 192kbps bitrate requires you to be subscribed to Creator tier or above. PCM with 44.1kHz sample rate requires you to be subscribed to Pro tier or above. Note that the μ-law format (sometimes written mu-law, often approximated as u-law) is commonly used for Twilio audio inputs.

Förfrågan

This endpoint expects a multipart form containing a file.
audiofileObligatorisk

Ljudfilen som innehåller innehållet och känslan som styr det genererade talet.

model_idstringValfriStandard är eleven_english_sts_v2

Identifierare för modellen som ska användas. Du kan fråga efter modellerna med GET /v1/models. Modellen måste ha stöd för Speech to Speech, vilket du kan kontrollera med egenskapen can_do_voice_conversion.

voice_settingsstring or nullValfri

Röstinställningar som åsidosätter lagrade inställningar för den angivna rösten. De tillämpas endast på den angivna begäran. Måste skickas som en JSON-kodad sträng.

seedinteger or nullValfri

Om angivet försöker systemet sampla deterministiskt, så att upprepade förfrågningar med samma seed och parametrar bör ge samma resultat. Determinism garanteras inte. Måste vara ett heltal mellan 0 och 4294967295.

remove_background_noisebooleanValfriStandard är false

Om angivet tas bakgrundsbrus bort från din ljudinmatning med vår ljudisoleringsmodell. Gäller endast Voice Changer.

file_formatenum or nullValfriStandard är other

The format of input audio. Options are 'pcm_s16le_16' or 'other' For pcm_s16le_16, the input audio must be 16-bit PCM at a 16kHz sample rate, single channel (mono), and little-endian byte order. Latency will be lower than with passing an encoded waveform.

Tillåtna värden:

Svar

Strömmande ljuddata

Fel

422
Unprocessable Entity Error