Testo in dialogo
Panoramica
L’API ElevenLabs Text to Dialogue crea dialoghi espressivi dal suono naturale a partire dal testo usando Eleven v4 ed Eleven v3. Ti consigliamo Eleven v4. Tra i casi d’uso più comuni:
- Generare conversazioni perfette per i videogiochi
- Creare dialoghi immersivi per podcast e altri contenuti audio
- Dare vita agli audiolibri con una narrazione espressiva
Potrebbero essere necessarie più generazioni per ottenere i risultati desiderati. Quando integri Text to Dialogue nella tua applicazione, valuta di generare più versioni e consentire all’utente di selezionare la migliore.
Ascolta un esempio:
Opzioni vocali
ElevenLabs offre migliaia di voci attraverso vari metodi di creazione. Eleven v4 supporta più di 90 lingue ed Eleven v3 più di 70 lingue.
- Voice Library con oltre 3.000 voci condivise dalla community
- Clonazione vocale professionale per repliche della massima fedeltà
- Clonazione vocale istantanea per replicare rapidamente una voce
- Progettazione vocale per generare voci personalizzate da descrizioni testuali
Scopri di più sulle nostre opzioni vocali.
Prompting
I modelli interpretano il contesto emotivo direttamente dal testo inserito. Ad esempio, l’aggiunta di testo descrittivo come “disse eccitata” o l’uso di punti esclamativi influenzerà l’emozione del parlato. Impostazioni vocali come Stability e Similarity aiutano a controllare la coerenza, mentre l’emozione di base deriva dagli indizi testuali.
Leggi la guida al prompting per maggiori dettagli.
Interpretazioni emotive con tag audio
Eleven v4 ed Eleven v3 consentono di usare eventi audio non vocali per influenzare l’interpretazione del dialogo. Per farlo, inserisci gli eventi audio nel testo tra parentesi quadre.
In Text to Dialogue, ogni turno di dialogo ha il proprio testo e la propria voce. Aggiungi i tag audio nel testo del turno che devono influenzare. voice_id seleziona comunque la voce del parlante per quel turno, mentre i tag guidano l’interpretazione.
Ad esempio, un parlante può usare una voce mentre il testo inizia con [giggling], e il parlante successivo può usare una voce diversa mentre il testo inizia con [whispering]. Per un esempio API che combina i tag con voice_id, consulta la guida rapida di Text to Dialogue.
I tag audio sono istruzioni in linguaggio naturale, non parametri enum. Inserisci l’istruzione tra parentesi quadre e posizionala nel testo nel punto in cui l’interpretazione deve cambiare. Gli esempi seguenti non sono esaustivi; consulta la guida al prompting per ulteriori indicazioni sui tag efficaci.
I tag audio hanno diverse forme:
Emozioni e interpretazione
Ad esempio, [sad], [laughing] e [whispering]
Eventi audio
Ad esempio, [leaves rustling], [gentle footsteps] e [applause].
Indicazioni generali
Ad esempio, [football], [wrestling match] e [auctioneer].
Alcuni esempi:
Puoi anche usare la punteggiatura per indicare il flusso del dialogo, ad esempio le interruzioni:
Puoi usare i puntini di sospensione per indicare frasi lasciate in sospeso:
Formati di output supportati
Il formato di risposta predefinito è mp3, ma sono disponibili anche altri formati come pcm e ulaw.
- MP3
- Frequenze di campionamento: 22.05kHz - 44.1kHz
- Bitrate: 32kbps - 192kbps
- 22.05kHz @ 32kbps
- 44.1kHz @ 32kbps, 64kbps, 96kbps, 128kbps, 192kbps
- PCM (S16LE)
- Frequenze di campionamento: 16kHz - 44.1kHz
- Bitrate: 8kHz, 16kHz, 22.05kHz, 24kHz, 44.1kHz, 48kHz
- Profondità a 16 bit
- μ-law
- Frequenza di campionamento di 8kHz
- Ottimizzato per applicazioni di telefonia
- A-law
- Frequenza di campionamento di 8kHz
- Ottimizzato per applicazioni di telefonia
- Opus
- Frequenza di campionamento: 48kHz
- Bitrate: 32kbps - 192kbps
Le opzioni audio di qualità superiore sono disponibili solo nei piani a pagamento: consulta la pagina dei prezzi per i dettagli.
Lingue supportate
Eleven v4 supporta più di 90 lingue. Eleven v3 supporta più di 70 lingue. Consulta Eleven v4 ed Eleven v3 per gli elenchi completi.
FAQ
Quali modelli posso usare?
Text to Dialogue è disponibile sui modelli Eleven v4 ed Eleven v3.
Possiedo l'output audio?
Sì. Mantieni la proprietà di qualsiasi audio che generi. Tuttavia, i diritti di utilizzo commerciale sono disponibili solo con i piani a pagamento. Con un abbonamento a pagamento, puoi usare l’audio generato per scopi commerciali e monetizzare gli output se possiedi i diritti di proprietà intellettuale sui contenuti di input.
Cosa rende gratuita una rigenerazione?
Una rigenerazione gratuita ti consente di rigenerare lo stesso contenuto da testo a parlato senza costi aggiuntivi, alle seguenti condizioni:
- Disponibile solo nella dashboard di ElevenLabs.
- Puoi rigenerare gratuitamente ogni contenuto fino a 2 volte.
- Il contenuto deve essere esattamente identico alla generazione precedente. Qualsiasi modifica al testo, alle impostazioni vocali o ad altri parametri richiederà una nuova generazione a pagamento.
Le rigenerazioni gratuite sono utili in caso di leggere distorsioni nell’output audio. Secondo i benchmark interni di ElevenLabs, le rigenerazioni risolvono circa la metà dei problemi di qualità, mentre quelli rimanenti sono generalmente dovuti a dati di addestramento di scarsa qualità.
Quanti parlanti può avere il mio dialogo?
Non esiste alcun limite al numero di parlanti in un dialogo.
Perché il mio output a volte è incoerente?
I modelli non sono deterministici. Per una maggiore coerenza, usa il parametro seed facoltativo, anche se potrebbero comunque verificarsi lievi differenze.
Qual è la procedura consigliata per convertire testi lunghi?
Per una generazione affidabile, mantieni la lunghezza totale di tutti i valori inputs[].text pari o inferiore a 2.000 caratteri per richiesta. Dividi i testi più lunghi in blocchi e concatena l’audio risultante nella tua applicazione.
Informazioni chiave
- Modelli: Disponibile con Eleven v4 ed Eleven v3
- Parlanti: Nessun limite al numero di parlanti per dialogo
- Dimensione della richiesta: Mantieni la lunghezza totale di tutti i valori
inputs[].textpari o inferiore a 2.000 caratteri per richiesta - Determinismo: L’output non è deterministico: usa il parametro
seedper risultati più coerenti - Rigenerazioni gratuite: Fino a 2 rigenerazioni gratuite per generazione (stesso contenuto, stessi parametri, solo dashboard)
- Proprietà: Mantieni la proprietà dell’audio generato; l’uso commerciale richiede un piano a pagamento