Vai alla navigazione

Trasmetti in streaming il parlato

Converte il testo in parlato usando una voce a tua scelta e restituisce l'audio come stream audio.

Parametri di percorso

voice_idstringObbligatorio

ID della voce da usare. Usa l'endpoint Get voices per elencare tutte le voci disponibili.

Header

xi-api-keystringOpzionale

Parametri di query

enable_loggingbooleanOpzionalePredefinito a true

Quando enable_logging è impostato su false, per la richiesta verrà usata la modalità senza conservazione dei dati. Di conseguenza, le funzionalità della cronologia non saranno disponibili per questa richiesta, incluso il collegamento delle richieste. La modalità senza conservazione dei dati può essere usata solo dai clienti enterprise.

optimize_streaming_latencyinteger or nullOpzionaleDeprecated

Puoi attivare le ottimizzazioni della latenza a scapito della qualità. La migliore latenza finale possibile varia in base al modello. Valori possibili: 0 - modalità predefinita (nessuna ottimizzazione della latenza) 1 - ottimizzazioni normali della latenza (circa il 50% del miglioramento di latenza possibile con l'opzione 3) 2 - ottimizzazioni avanzate della latenza (circa il 75% del miglioramento di latenza possibile con l'opzione 3) 3 - ottimizzazioni massime della latenza 4 - ottimizzazioni massime della latenza, con il normalizzatore del testo disattivato per ridurre ulteriormente la latenza (latenza ottimale, ma potrebbe pronunciare in modo errato, ad esempio, numeri e date).

Il valore predefinito è None.

output_formatenumOpzionalePredefinito a mp3_44100_128

Output format of the generated audio. Formatted as codec_sample_rate_bitrate. So an mp3 with 22.05kHz sample rate at 32kbs is represented as mp3_22050_32. MP3 with 192kbps bitrate requires you to be subscribed to Creator tier or above. PCM with 44.1kHz sample rate requires you to be subscribed to Pro tier or above. Note that the μ-law format (sometimes written mu-law, often approximated as u-law) is commonly used for Twilio audio inputs.

Richiesta

This endpoint expects an object.
textstringObbligatorio

Il testo che verrà convertito in parlato.

model_idstringOpzionalePredefinito a eleven_multilingual_v2

Identificatore del modello che verrà usato; puoi interrogarli tramite GET /v1/models. Il modello deve supportare la sintesi vocale; puoi verificarlo tramite la proprietà can_do_text_to_speech.

language_codestring or nullOpzionale

Codice lingua (ISO 639-1) usato per applicare una lingua al modello e alla normalizzazione del testo. Se il modello non supporta il codice lingua fornito, verrà ignorato. Questo parametro non è supportato per i modelli multilingual_v2.

voice_settingsobject or nullOpzionale
Impostazioni vocali che sovrascrivono quelle salvate per la voce specificata. Vengono applicate solo alla richiesta indicata.
pronunciation_dictionary_locatorslist of objects or nullOpzionale

Un elenco di locator dei dizionari di pronuncia (id, version_id) da applicare al testo. Verranno applicati nell'ordine indicato. Puoi includere fino a 3 locator per richiesta.

seedinteger or nullOpzionale

Se specificato, il nostro sistema farà del suo meglio per eseguire il campionamento in modo deterministico, così che richieste ripetute con lo stesso seed e gli stessi parametri restituiscano lo stesso risultato. Il determinismo non è garantito. Deve essere un numero intero compreso tra 0 e 4294967295.

previous_textstring or nullOpzionale

Il testo che precede quello della richiesta corrente. Può essere usato per migliorare la continuità del parlato concatenando più generazioni o per influenzarla nella generazione corrente.

next_textstring or nullOpzionale

Il testo che segue quello della richiesta corrente. Può essere usato per migliorare la continuità del parlato concatenando più generazioni o per influenzarla nella generazione corrente.

previous_request_idslist of strings or nullOpzionale

Un elenco di request_id dei campioni generati prima di questa generazione. Può essere usato per migliorare la continuità del parlato quando una grande attività viene suddivisa in più richieste. I risultati sono migliori quando viene usato lo stesso modello per tutte le generazioni. Se vengono inviati sia previous_text sia previous_request_ids, previous_text verrà ignorato. Puoi inviare al massimo 3 request_ids.

next_request_idslist of strings or nullOpzionale

Un elenco di request_id dei campioni successivi a questa generazione. next_request_ids è particolarmente utile per mantenere la continuità del parlato quando rigeneri un campione con problemi di qualità audio. Ad esempio, se hai generato 3 clip vocali e vuoi migliorare la clip 2, passare l'ID della richiesta della clip 3 come next_request_id, e quello della clip 1 come previous_request_id, aiuta a mantenere un flusso naturale nel parlato combinato. I risultati sono migliori quando viene usato lo stesso modello per tutte le generazioni. Se vengono inviati sia next_text sia next_request_ids, next_text verrà ignorato. Puoi inviare al massimo 3 request_ids.

use_pvc_as_ivcbooleanOpzionalePredefinito a false

Indica se usare la versione IVC di una voce professionale. Può migliorare l'espressività e ridurre la latenza.

apply_text_normalizationenumOpzionalePredefinito a auto

Questo parametro controlla la normalizzazione del testo con tre modalità: 'auto', 'on' e 'off'. Se impostato su 'auto', il sistema decide automaticamente se applicare la normalizzazione del testo, ad esempio scrivendo i numeri in lettere. Con 'on', la normalizzazione del testo viene sempre applicata, mentre con 'off' viene ignorata.

Valori consentiti:
apply_language_text_normalizationbooleanOpzionalePredefinito a false

Questo parametro controlla la normalizzazione del testo nella lingua. Aiuta a pronunciare correttamente il testo in alcune lingue supportate. ATTENZIONE: questo parametro può aumentare notevolmente la latenza della richiesta. Attualmente è supportato solo per il giapponese.

Risposta

Dati audio in streaming

Errori

422
Unprocessable Entity Error