Vai alla navigazione

Testo in dialogo

Scopri come creare dialoghi immersivi e dal suono naturale con ElevenLabs.

Panoramica

L’API ElevenLabs Text to Dialogue crea dialoghi espressivi dal suono naturale a partire dal testo usando Eleven v4 ed Eleven v3. Ti consigliamo Eleven v4. Tra i casi d’uso più comuni:

  • Generare conversazioni perfette per i videogiochi
  • Creare dialoghi immersivi per podcast e altri contenuti audio
  • Dare vita agli audiolibri con una narrazione espressiva

Potrebbero essere necessarie più generazioni per ottenere i risultati desiderati. Quando integri Text to Dialogue nella tua applicazione, valuta di generare più versioni e consentire all’utente di selezionare la migliore.

Ascolta un esempio:

Opzioni vocali

ElevenLabs offre migliaia di voci attraverso vari metodi di creazione. Eleven v4 supporta più di 90 lingue ed Eleven v3 più di 70 lingue.

Scopri di più sulle nostre opzioni vocali.

Prompting

I modelli interpretano il contesto emotivo direttamente dal testo inserito. Ad esempio, l’aggiunta di testo descrittivo come “disse eccitata” o l’uso di punti esclamativi influenzerà l’emozione del parlato. Impostazioni vocali come Stability e Similarity aiutano a controllare la coerenza, mentre l’emozione di base deriva dagli indizi testuali.

Leggi la guida al prompting per maggiori dettagli.

Interpretazioni emotive con tag audio

Questa funzionalità è ancora in fase di sviluppo attivo; i risultati effettivi possono variare.

Eleven v4 ed Eleven v3 consentono di usare eventi audio non vocali per influenzare l’interpretazione del dialogo. Per farlo, inserisci gli eventi audio nel testo tra parentesi quadre.

In Text to Dialogue, ogni turno di dialogo ha il proprio testo e la propria voce. Aggiungi i tag audio nel testo del turno che devono influenzare. voice_id seleziona comunque la voce del parlante per quel turno, mentre i tag guidano l’interpretazione.

Ad esempio, un parlante può usare una voce mentre il testo inizia con [giggling], e il parlante successivo può usare una voce diversa mentre il testo inizia con [whispering]. Per un esempio API che combina i tag con voice_id, consulta la guida rapida di Text to Dialogue.

I tag audio sono istruzioni in linguaggio naturale, non parametri enum. Inserisci l’istruzione tra parentesi quadre e posizionala nel testo nel punto in cui l’interpretazione deve cambiare. Gli esempi seguenti non sono esaustivi; consulta la guida al prompting per ulteriori indicazioni sui tag efficaci.

I tag audio hanno diverse forme:

Emozioni e interpretazione

Ad esempio, [sad], [laughing] e [whispering]

Eventi audio

Ad esempio, [leaves rustling], [gentle footsteps] e [applause].

Indicazioni generali

Ad esempio, [football], [wrestling match] e [auctioneer].

Alcuni esempi:

"[giggling] That's really funny!"
"[groaning] That was awful."
"Well, [sigh] I'm not sure what to say."

Puoi anche usare la punteggiatura per indicare il flusso del dialogo, ad esempio le interruzioni:

"[cautiously] Hello, is this seat-"
"[jumping in] Free? [cheerfully] Yes it is."

Puoi usare i puntini di sospensione per indicare frasi lasciate in sospeso:

"[indecisive] Hi, can I get uhhh..."
"[quizzically] The usual?"
"[elated] Yes! [laughs] I'm so glad you knew!"

Il formato di risposta predefinito è mp3, ma sono disponibili anche altri formati come pcm e ulaw.

  • MP3
    • Frequenze di campionamento: 22.05kHz - 44.1kHz
    • Bitrate: 32kbps - 192kbps
    • 22.05kHz @ 32kbps
    • 44.1kHz @ 32kbps, 64kbps, 96kbps, 128kbps, 192kbps
  • PCM (S16LE)
    • Frequenze di campionamento: 16kHz - 44.1kHz
    • Bitrate: 8kHz, 16kHz, 22.05kHz, 24kHz, 44.1kHz, 48kHz
    • Profondità a 16 bit
  • μ-law
    • Frequenza di campionamento di 8kHz
    • Ottimizzato per applicazioni di telefonia
  • A-law
    • Frequenza di campionamento di 8kHz
    • Ottimizzato per applicazioni di telefonia
  • Opus
    • Frequenza di campionamento: 48kHz
    • Bitrate: 32kbps - 192kbps

Le opzioni audio di qualità superiore sono disponibili solo nei piani a pagamento: consulta la pagina dei prezzi per i dettagli.

Lingue supportate

Eleven v4 supporta più di 90 lingue. Eleven v3 supporta più di 70 lingue. Consulta Eleven v4 ed Eleven v3 per gli elenchi completi.

FAQ

Text to Dialogue è disponibile sui modelli Eleven v4 ed Eleven v3.

Sì. Mantieni la proprietà di qualsiasi audio che generi. Tuttavia, i diritti di utilizzo commerciale sono disponibili solo con i piani a pagamento. Con un abbonamento a pagamento, puoi usare l’audio generato per scopi commerciali e monetizzare gli output se possiedi i diritti di proprietà intellettuale sui contenuti di input.

Una rigenerazione gratuita ti consente di rigenerare lo stesso contenuto da testo a parlato senza costi aggiuntivi, alle seguenti condizioni:

  • Disponibile solo nella dashboard di ElevenLabs.
  • Puoi rigenerare gratuitamente ogni contenuto fino a 2 volte.
  • Il contenuto deve essere esattamente identico alla generazione precedente. Qualsiasi modifica al testo, alle impostazioni vocali o ad altri parametri richiederà una nuova generazione a pagamento.

Le rigenerazioni gratuite sono utili in caso di leggere distorsioni nell’output audio. Secondo i benchmark interni di ElevenLabs, le rigenerazioni risolvono circa la metà dei problemi di qualità, mentre quelli rimanenti sono generalmente dovuti a dati di addestramento di scarsa qualità.

I modelli non sono deterministici. Per una maggiore coerenza, usa il parametro seed facoltativo, anche se potrebbero comunque verificarsi lievi differenze.

Per una generazione affidabile, mantieni la lunghezza totale di tutti i valori inputs[].text pari o inferiore a 2.000 caratteri per richiesta. Dividi i testi più lunghi in blocchi e concatena l’audio risultante nella tua applicazione.

Informazioni chiave

  • Modelli: Disponibile con Eleven v4 ed Eleven v3
  • Parlanti: Nessun limite al numero di parlanti per dialogo
  • Dimensione della richiesta: Mantieni la lunghezza totale di tutti i valori inputs[].text pari o inferiore a 2.000 caratteri per richiesta
  • Determinismo: L’output non è deterministico: usa il parametro seed per risultati più coerenti
  • Rigenerazioni gratuite: Fino a 2 rigenerazioni gratuite per generazione (stesso contenuto, stessi parametri, solo dashboard)
  • Proprietà: Mantieni la proprietà dell’audio generato; l’uso commerciale richiede un piano a pagamento