Vai alla navigazione

Streaming del Modificatore di Voce

Trasmetti l'audio da una voce a un'altra. Mantieni il pieno controllo su emozione, tempistiche e resa.

Parametri di percorso

voice_idstringObbligatorio

ID della voce da usare. Usa l'endpoint Get voices per elencare tutte le voci disponibili.

Header

xi-api-keystringOpzionale

Parametri di query

enable_loggingbooleanOpzionalePredefinito a true

Quando enable_logging è impostato su false, per la richiesta verrà usata la modalità senza conservazione dei dati. Di conseguenza, le funzionalità della cronologia non saranno disponibili per questa richiesta, incluso il collegamento delle richieste. La modalità senza conservazione dei dati può essere usata solo dai clienti enterprise.

optimize_streaming_latencyinteger or nullOpzionaleDeprecated

Puoi attivare le ottimizzazioni della latenza a scapito della qualità. La migliore latenza finale possibile varia in base al modello. Valori possibili: 0 - modalità predefinita (nessuna ottimizzazione della latenza) 1 - ottimizzazioni normali della latenza (circa il 50% del miglioramento di latenza possibile con l'opzione 3) 2 - ottimizzazioni avanzate della latenza (circa il 75% del miglioramento di latenza possibile con l'opzione 3) 3 - ottimizzazioni massime della latenza 4 - ottimizzazioni massime della latenza, con il normalizzatore del testo disattivato per ridurre ulteriormente la latenza (latenza ottimale, ma potrebbe pronunciare in modo errato, ad esempio, numeri e date).

Il valore predefinito è None.

output_formatenumOpzionalePredefinito a mp3_44100_128

Output format of the generated audio. Formatted as codec_sample_rate_bitrate. So an mp3 with 22.05kHz sample rate at 32kbs is represented as mp3_22050_32. MP3 with 192kbps bitrate requires you to be subscribed to Creator tier or above. PCM with 44.1kHz sample rate requires you to be subscribed to Pro tier or above. Note that the μ-law format (sometimes written mu-law, often approximated as u-law) is commonly used for Twilio audio inputs.

Richiesta

This endpoint expects a multipart form containing a file.
audiofileObbligatorio
Il file audio che contiene il contenuto e l'emozione che controlleranno il parlato generato.
model_idstringOpzionalePredefinito a eleven_english_sts_v2

Identificatore del modello che verrà usato; puoi interrogarli tramite GET /v1/models. Il modello deve supportare la conversione da voce a voce; puoi verificarlo tramite la proprietà can_do_voice_conversion.

voice_settingsstring or nullOpzionale
Impostazioni vocali che sovrascrivono quelle salvate per la voce specificata. Vengono applicate solo alla richiesta indicata. Devono essere inviate come stringa codificata in JSON.
seedinteger or nullOpzionale

Se specificato, il nostro sistema farà del suo meglio per eseguire il campionamento in modo deterministico, così che richieste ripetute con lo stesso seed e gli stessi parametri restituiscano lo stesso risultato. Il determinismo non è garantito. Deve essere un numero intero compreso tra 0 e 4294967295.

remove_background_noisebooleanOpzionalePredefinito a false
Se impostato, rimuove il rumore di fondo dall'input audio usando il nostro modello di isolamento audio. Si applica solo al Modificatore di Voce.
file_formatenum or nullOpzionalePredefinito a other

The format of input audio. Options are 'pcm_s16le_16' or 'other' For pcm_s16le_16, the input audio must be 16-bit PCM at a 16kHz sample rate, single channel (mono), and little-endian byte order. Latency will be lower than with passing an encoded waveform.

Valori consentiti:

Risposta

Dati audio in streaming

Errori

422
Unprocessable Entity Error