> This is a page from the ElevenLabs documentation. For a complete page index, fetch https://elevenlabs.io/docs/llms.txt. For the full documentation in a single file, fetch https://elevenlabs.io/docs/llms-full.txt.

# Testo in dialogo

## Panoramica

L'API ElevenLabs [Text to Dialogue](/docs/it/api-reference/text-to-dialogue/convert) crea dialoghi espressivi dal suono naturale a partire dal testo usando [Eleven v4](/docs/it/overview/capabilities/text-to-speech/eleven-v4) ed Eleven v3. Ti consigliamo Eleven v4. Tra i casi d'uso più comuni:

* Generare conversazioni perfette per i videogiochi
* Creare dialoghi immersivi per podcast e altri contenuti audio
* Dare vita agli audiolibri con una narrazione espressiva

Potrebbero essere necessarie più generazioni per ottenere i risultati desiderati. Quando integri Text to Dialogue nella tua applicazione, valuta di generare più versioni e consentire all'utente di selezionare la migliore.

Ascolta un esempio:

<elevenlabs-audio-player audio-title="Dialogue example" audio-src="https://storage.googleapis.com/eleven-public-cdn/documentation_assets/audio/dialogue.mp3" />

#### [Sviluppatori](/docs/it/eleven-api/guides/cookbooks/text-to-dialogue)

Scopri come integrare la conversione da testo a dialogo nella tua applicazione.

#### [Guida al prompting](/docs/it/overview/capabilities/text-to-speech/best-practices#prompting-eleven-v4)

Scopri come creare prompt per dialoghi espressivi con i tag audio.

#### [Riferimento API](/docs/it/api-reference/text-to-dialogue/convert)

Riferimento API completo per l'endpoint Text to Dialogue.

## Opzioni vocali

ElevenLabs offre migliaia di voci attraverso vari metodi di creazione. Eleven v4 supporta più di 90 lingue ed Eleven v3 più di 70 lingue.

* [Voice Library](/docs/it/overview/capabilities/voices) con oltre 3.000 voci condivise dalla community
* [Clonazione vocale professionale](/docs/it/overview/capabilities/voices#cloned) per repliche della massima fedeltà
* [Clonazione vocale istantanea](/docs/it/overview/capabilities/voices#cloned) per replicare rapidamente una voce
* [Progettazione vocale](/docs/it/overview/capabilities/voices#voice-design) per generare voci personalizzate da descrizioni testuali

Scopri di più sulle nostre [opzioni vocali](/docs/it/overview/capabilities/voices).

## Prompting

I modelli interpretano il contesto emotivo direttamente dal testo inserito. Ad esempio, l'aggiunta
di testo descrittivo come "disse eccitata" o l'uso di punti esclamativi influenzerà l'emozione
del parlato. Impostazioni vocali come Stability e Similarity aiutano a controllare la coerenza, mentre
l'emozione di base deriva dagli indizi testuali.

Leggi la [guida al prompting](/docs/it/overview/capabilities/text-to-speech/best-practices#prompting-eleven-v4) per maggiori dettagli.

### Interpretazioni emotive con tag audio

> **Warning**
>
> Questa funzionalità è ancora in fase di sviluppo attivo; i risultati effettivi possono variare.

Eleven v4 ed Eleven v3 consentono di usare eventi audio non vocali per influenzare l'interpretazione del dialogo. Per farlo, inserisci gli eventi audio nel testo tra parentesi quadre.

In Text to Dialogue, ogni turno di dialogo ha il proprio testo e la propria voce. Aggiungi i tag audio nel testo del turno che devono influenzare. `voice_id` seleziona comunque la voce del parlante per quel turno, mentre i tag guidano l'interpretazione.

Ad esempio, un parlante può usare una voce mentre il testo inizia con `[giggling]`, e il parlante successivo può usare una voce diversa mentre il testo inizia con `[whispering]`. Per un esempio API che combina i tag con `voice_id`, consulta la [guida rapida di Text to Dialogue](/docs/it/eleven-api/guides/cookbooks/text-to-dialogue).

I tag audio sono istruzioni in linguaggio naturale, non parametri enum. Inserisci l'istruzione tra parentesi quadre e posizionala nel testo nel punto in cui l'interpretazione deve cambiare. Gli esempi seguenti non sono esaustivi; consulta la [guida al prompting](/docs/it/overview/capabilities/text-to-speech/best-practices#prompting-eleven-v4) per ulteriori indicazioni sui tag efficaci.

I tag audio hanno diverse forme:

### Emozioni e interpretazione

Ad esempio, \[sad], \[laughing] e \[whispering]

### Eventi audio

Ad esempio, \[leaves rustling], \[gentle footsteps] e \[applause].

### Indicazioni generali

Ad esempio, \[football], \[wrestling match] e \[auctioneer].

Alcuni esempi:

```
"[giggling] That's really funny!"
"[groaning] That was awful."
"Well, [sigh] I'm not sure what to say."
```

<elevenlabs-audio-player audio-title="Expressive dialogue" audio-src="https://storage.googleapis.com/eleven-public-cdn/documentation_assets/audio/dialogue-emotive.mp3" />

Puoi anche usare la punteggiatura per indicare il flusso del dialogo, ad esempio le interruzioni:

```
"[cautiously] Hello, is this seat-"
"[jumping in] Free? [cheerfully] Yes it is."
```

<elevenlabs-audio-player audio-title="Interruption" audio-src="https://storage.googleapis.com/eleven-public-cdn/documentation_assets/audio/dialogue-interruption.mp3" />

Puoi usare i puntini di sospensione per indicare frasi lasciate in sospeso:

```
"[indecisive] Hi, can I get uhhh..."
"[quizzically] The usual?"
"[elated] Yes! [laughs] I'm so glad you knew!"
```

<elevenlabs-audio-player audio-title="Ellipses" audio-src="https://storage.googleapis.com/eleven-public-cdn/documentation_assets/audio/dialogue-ellipses.mp3" />

#### Formati di output supportati

Il formato di risposta predefinito è `mp3`, ma sono disponibili anche altri formati come `pcm` e `ulaw`.

* **MP3**
  * Frequenze di campionamento: 22.05kHz - 44.1kHz
  * Bitrate: 32kbps - 192kbps
  * 22.05kHz @ 32kbps
  * 44.1kHz @ 32kbps, 64kbps, 96kbps, 128kbps, 192kbps
* **PCM (S16LE)**
  * Frequenze di campionamento: 16kHz - 44.1kHz
  * Bitrate: 8kHz, 16kHz, 22.05kHz, 24kHz, 44.1kHz, 48kHz
  * Profondità a 16 bit
* **μ-law**
  * Frequenza di campionamento di 8kHz
  * Ottimizzato per applicazioni di telefonia
* **A-law**
  * Frequenza di campionamento di 8kHz
  * Ottimizzato per applicazioni di telefonia
* **Opus**
  * Frequenza di campionamento: 48kHz
  * Bitrate: 32kbps - 192kbps

> **Success**
>
> Le opzioni audio di qualità superiore sono disponibili solo nei piani a pagamento: consulta la [pagina dei prezzi](https://elevenlabs.io/pricing/api) per i dettagli.

## Lingue supportate

Eleven v4 supporta più di 90 lingue. Eleven v3 supporta più di 70 lingue. Consulta [Eleven v4](/docs/it/overview/models#eleven-v4) ed [Eleven v3](/docs/it/overview/models#eleven-v3) per gli elenchi completi.

## FAQ

#### Quali modelli posso usare?

Text to Dialogue è disponibile sui modelli Eleven v4 ed Eleven v3.

#### Possiedo l'output audio?

Sì. Mantieni la proprietà di qualsiasi audio che generi. Tuttavia, i diritti di utilizzo commerciale sono
disponibili solo con i piani a pagamento. Con un abbonamento a pagamento, puoi usare l'audio generato per scopi commerciali
e monetizzare gli output se possiedi i diritti di proprietà intellettuale sui contenuti di input.

#### Cosa rende gratuita una rigenerazione?

Una rigenerazione gratuita ti consente di rigenerare lo stesso contenuto da testo a parlato senza costi aggiuntivi, alle seguenti condizioni:

* Disponibile solo nella dashboard di ElevenLabs.
* Puoi rigenerare gratuitamente ogni contenuto fino a 2 volte.
* Il contenuto deve essere esattamente identico alla generazione precedente. Qualsiasi modifica al testo, alle impostazioni vocali o ad altri parametri richiederà una nuova generazione a pagamento.

Le rigenerazioni gratuite sono utili in caso di leggere distorsioni nell'output audio. Secondo i benchmark interni di ElevenLabs, le rigenerazioni risolvono circa la metà dei problemi di qualità, mentre quelli rimanenti sono generalmente dovuti a dati di addestramento di scarsa qualità.

#### Quanti parlanti può avere il mio dialogo?

Non esiste alcun limite al numero di parlanti in un dialogo.

#### Perché il mio output a volte è incoerente?

I modelli non sono deterministici. Per una maggiore coerenza, usa il parametro [seed facoltativo](/docs/it/api-reference/text-to-speech/convert#request.body.seed), anche se potrebbero comunque verificarsi lievi
differenze.

#### Qual è la procedura consigliata per convertire testi lunghi?

Per una generazione affidabile, mantieni la lunghezza totale di tutti i valori `inputs[].text` pari o inferiore a 2.000 caratteri per richiesta. Dividi i testi più lunghi in blocchi e concatena l'audio risultante nella tua applicazione.

## Informazioni chiave

* **Modelli**: Disponibile con Eleven v4 ed Eleven v3
* **Parlanti**: Nessun limite al numero di parlanti per dialogo
* **Dimensione della richiesta**: Mantieni la lunghezza totale di tutti i valori `inputs[].text` pari o inferiore a 2.000 caratteri per richiesta
* **Determinismo**: L'output non è deterministico: usa il parametro `seed` per risultati più coerenti
* **Rigenerazioni gratuite**: Fino a 2 rigenerazioni gratuite per generazione (stesso contenuto, stessi parametri, solo dashboard)
* **Proprietà**: Mantieni la proprietà dell'audio generato; l'uso commerciale richiede un piano a pagamento