Trasmetti in streaming il parlato
Parametri di percorso
ID della voce da usare. Usa l'endpoint Get voices per elencare tutte le voci disponibili.
Header
Parametri di query
Quando enable_logging è impostato su false, per la richiesta verrà usata la modalità senza conservazione dei dati. Di conseguenza, le funzionalità della cronologia non saranno disponibili per questa richiesta, incluso il collegamento delle richieste. La modalità senza conservazione dei dati può essere usata solo dai clienti enterprise.
Puoi attivare le ottimizzazioni della latenza a scapito della qualità. La migliore latenza finale possibile varia in base al modello. Valori possibili: 0 - modalità predefinita (nessuna ottimizzazione della latenza) 1 - ottimizzazioni normali della latenza (circa il 50% del miglioramento di latenza possibile con l'opzione 3) 2 - ottimizzazioni avanzate della latenza (circa il 75% del miglioramento di latenza possibile con l'opzione 3) 3 - ottimizzazioni massime della latenza 4 - ottimizzazioni massime della latenza, con il normalizzatore del testo disattivato per ridurre ulteriormente la latenza (latenza ottimale, ma potrebbe pronunciare in modo errato, ad esempio, numeri e date).
Il valore predefinito è None.
Output format of the generated audio. Formatted as codec_sample_rate_bitrate. So an mp3 with 22.05kHz sample rate at 32kbs is represented as mp3_22050_32. MP3 with 192kbps bitrate requires you to be subscribed to Creator tier or above. PCM with 44.1kHz sample rate requires you to be subscribed to Pro tier or above. Note that the μ-law format (sometimes written mu-law, often approximated as u-law) is commonly used for Twilio audio inputs.
Richiesta
Il testo che verrà convertito in parlato.
Identificatore del modello che verrà usato; puoi interrogarli tramite GET /v1/models. Il modello deve supportare la sintesi vocale; puoi verificarlo tramite la proprietà can_do_text_to_speech.
Codice lingua (ISO 639-1) usato per applicare una lingua al modello e alla normalizzazione del testo. Se il modello non supporta il codice lingua fornito, verrà ignorato. Questo parametro non è supportato per i modelli multilingual_v2.
Un elenco di locator dei dizionari di pronuncia (id, version_id) da applicare al testo. Verranno applicati nell'ordine indicato. Puoi includere fino a 3 locator per richiesta.
Se specificato, il nostro sistema farà del suo meglio per eseguire il campionamento in modo deterministico, così che richieste ripetute con lo stesso seed e gli stessi parametri restituiscano lo stesso risultato. Il determinismo non è garantito. Deve essere un numero intero compreso tra 0 e 4294967295.
Il testo che precede quello della richiesta corrente. Può essere usato per migliorare la continuità del parlato concatenando più generazioni o per influenzarla nella generazione corrente.
Il testo che segue quello della richiesta corrente. Può essere usato per migliorare la continuità del parlato concatenando più generazioni o per influenzarla nella generazione corrente.
Un elenco di request_id dei campioni generati prima di questa generazione. Può essere usato per migliorare la continuità del parlato quando una grande attività viene suddivisa in più richieste. I risultati sono migliori quando viene usato lo stesso modello per tutte le generazioni. Se vengono inviati sia previous_text sia previous_request_ids, previous_text verrà ignorato. Puoi inviare al massimo 3 request_ids.
Un elenco di request_id dei campioni successivi a questa generazione. next_request_ids è particolarmente utile per mantenere la continuità del parlato quando rigeneri un campione con problemi di qualità audio. Ad esempio, se hai generato 3 clip vocali e vuoi migliorare la clip 2, passare l'ID della richiesta della clip 3 come next_request_id, e quello della clip 1 come previous_request_id, aiuta a mantenere un flusso naturale nel parlato combinato. I risultati sono migliori quando viene usato lo stesso modello per tutte le generazioni. Se vengono inviati sia next_text sia next_request_ids, next_text verrà ignorato. Puoi inviare al massimo 3 request_ids.
Indica se usare la versione IVC di una voce professionale. Può migliorare l'espressività e ridurre la latenza.
Questo parametro controlla la normalizzazione del testo con tre modalità: 'auto', 'on' e 'off'. Se impostato su 'auto', il sistema decide automaticamente se applicare la normalizzazione del testo, ad esempio scrivendo i numeri in lettere. Con 'on', la normalizzazione del testo viene sempre applicata, mentre con 'off' viene ignorata.
Questo parametro controlla la normalizzazione del testo nella lingua. Aiuta a pronunciare correttamente il testo in alcune lingue supportate. ATTENZIONE: questo parametro può aumentare notevolmente la latenza della richiesta. Attualmente è supportato solo per il giapponese.