> This is a page from the ElevenLabs documentation. For a complete page index, fetch https://elevenlabs.io/docs/llms.txt. For the full documentation in a single file, fetch https://elevenlabs.io/docs/llms-full.txt.

# Text to Speech

## Panoramica

L'API ElevenLabs [Text to Speech (TTS)](/docs/it/api-reference/text-to-speech/convert) trasforma il testo in audio realistico con intonazione, ritmo e consapevolezza emotiva ricchi di sfumature. [I nostri modelli](/docs/it/overview/models) si adattano agli indizi testuali in 32 lingue e a diversi stili vocali e possono essere usati per:

* Narrare campagne media e annunci pubblicitari globali
* Produrre audiolibri in più lingue con interpretazioni emotive complesse
* Trasmettere audio in tempo reale dal testo

Ascolta un esempio:

<elevenlabs-audio-player audio-title="George" audio-src="https://storage.googleapis.com/eleven-public-cdn/audio/marketing/george.mp3" />

Esplora la nostra [Voice Library](https://elevenlabs.io/app/voice-library) per trovare la voce perfetta per il tuo progetto.

> **Warning**
>
> La Voice Library non è disponibile tramite API per gli utenti del piano gratuito.

#### [Prodotti](/docs/it/eleven-creative/playground/text-to-speech)

Guida passo passo per usare la sintesi vocale in ElevenLabs.

#### [Sviluppatori](/docs/it/eleven-api/quickstart)

Scopri come integrare la sintesi vocale nella tua applicazione.

#### [Riferimento API](/docs/it/api-reference/text-to-speech/convert)

Riferimento API completo per l'endpoint Text to Speech.

#### [MCP](/docs/it/eleven-agents/operate/hosted-mcp)

Genera parlato da Claude o da qualsiasi client MCP con il server MCP fornito.

#### [Eleven v4](/docs/it/overview/capabilities/text-to-speech/eleven-v4)

Scopri cosa è cambiato in Eleven v4, con confronti sulla clonazione vocale.

### Qualità della voce

Per le applicazioni in tempo reale, Flash v2.5 offre una latenza ultra bassa di 75 ms, mentre Multilingual v2 fornisce audio della massima qualità con un'espressività più ricca di sfumature.

#### [Eleven v4](/docs/it/overview/models#eleven-v4)

Il nostro modello di sintesi vocale più espressivo e di alta qualità

Eccezionali capacità di clonazione vocale

Supporto per oltre 90 lingue

Limite di 10.000 caratteri

Supporto per dialoghi naturali con più parlanti

#### [Eleven v4 Turbo](/docs/it/overview/models#eleven-v4-turbo)

Il nostro modello di sintesi vocale in tempo reale più espressivo

Latenza ultra-bassa (latenza di inferenza mediana di \~100ms†)

Eccezionali capacità di clonazione vocale

Supporto per oltre 90 lingue

Tag audio per un controllo preciso

#### [Eleven v3](/docs/it/overview/models#eleven-v3)

Il nostro modello di sintesi vocale espressivo e ricco di emozioni

Interpretazione e resa drammatica

Supporto per oltre 70 lingue

Limite di 5.000 caratteri

Supporto per dialoghi naturali con più parlanti

#### [Eleven v3 Conversational](/docs/it/overview/models#eleven-v3-conversational)

Il nostro modello di sintesi vocale espressivo in tempo reale

Bassa latenza (\~280ms)

Interpretazione e resa drammatica

Supporto per oltre 70 lingue

Tag audio per un controllo preciso

#### [Eleven Multilingual v2](/docs/it/overview/models#multilingual-v2)

Modello di sintesi vocale realistico e dalla qualità costante

Output dal suono naturale

Supporto per 29 lingue

Limite di 10.000 caratteri

Massima stabilità nelle generazioni di lunga durata

#### [Eleven Flash v2.5](/docs/it/overview/models#flash-v25)

Il nostro modello di sintesi vocale veloce e conveniente

Latenza ultra-bassa (\~75ms†)

Supporto per 32 lingue

Limite di 40.000 caratteri

Modello più veloce, prezzo per carattere inferiore del 50% per le generazioni API

[Esplora tutti](/docs/it/overview/models)

### Opzioni vocali

ElevenLabs offre migliaia di voci in 32 lingue attraverso vari metodi di creazione:

* [Voice Library](/docs/it/overview/capabilities/voices) con oltre 3.000 voci condivise dalla community
* [Clonazione vocale professionale](/docs/it/overview/capabilities/voices#cloned) per repliche della massima fedeltà
* [Clonazione vocale istantanea](/docs/it/overview/capabilities/voices#cloned) per replicare rapidamente una voce
* [Progettazione vocale](/docs/it/overview/capabilities/voices#voice-design) per generare voci personalizzate da descrizioni testuali

Scopri di più sulle nostre [opzioni vocali](/docs/it/overview/capabilities/voices).

#### Formati di output supportati

Il formato di risposta predefinito è `mp3`, ma sono disponibili anche altri formati come `pcm` e `ulaw`.

* **MP3**
  * Frequenze di campionamento: 22.05kHz - 44.1kHz
  * Bitrate: 32kbps - 192kbps
  * 22.05kHz @ 32kbps
  * 44.1kHz @ 32kbps, 64kbps, 96kbps, 128kbps, 192kbps
* **PCM (S16LE)**
  * Frequenze di campionamento: 16kHz - 44.1kHz
  * Bitrate: 8kHz, 16kHz, 22.05kHz, 24kHz, 44.1kHz, 48kHz
  * Profondità a 16 bit
* **μ-law**
  * Frequenza di campionamento di 8kHz
  * Ottimizzato per applicazioni di telefonia
* **A-law**
  * Frequenza di campionamento di 8kHz
  * Ottimizzato per applicazioni di telefonia
* **Opus**
  * Frequenza di campionamento: 48kHz
  * Bitrate: 32kbps - 192kbps

> **Success**
>
> Le opzioni audio di qualità superiore sono disponibili solo nei piani a pagamento: consulta la [pagina dei prezzi](https://elevenlabs.io/pricing/api) per i dettagli.

### Lingue supportate

I nostri modelli multilingue v2 supportano 29 lingue:

*inglese (Stati Uniti, Regno Unito, Australia, Canada), giapponese, cinese, tedesco, hindi, francese (Francia, Canada), coreano, portoghese (Brasile, Portogallo), italiano, spagnolo (Spagna, Messico), indonesiano, olandese, turco, filippino, polacco, svedese, bulgaro, rumeno, arabo (Arabia Saudita, Emirati Arabi Uniti), ceco, greco, finlandese, croato, malese, slovacco, danese, tamil, ucraino e russo.*

Flash v2.5 supporta 32 lingue: tutte le lingue dei modelli v2, più:

*ungherese, norvegese e vietnamita*

Inserisci il testo in una delle lingue supportate e seleziona una voce corrispondente dalla nostra [Voice Library](https://elevenlabs.io/app/voice-library). Per risultati più naturali, scegli una voce con un accento adatto alla lingua e alla regione di destinazione.

### Prompting

I modelli interpretano il contesto emotivo direttamente dal testo inserito. Ad esempio, l'aggiunta
di testo descrittivo come "disse eccitata" o l'uso di punti esclamativi influenzerà l'emozione
del parlato. Impostazioni vocali come Stability e Similarity aiutano a controllare la coerenza, mentre
l'emozione di base deriva dagli indizi testuali.

Leggi la [guida al prompting](/docs/it/overview/capabilities/text-to-speech/best-practices) per maggiori dettagli.

> **Note**
>
> Il testo descrittivo verrà pronunciato dal modello e, se necessario, dovrà essere tagliato o rimosso manualmente dall'
> audio.

## FAQ

#### Posso clonare la mia voce?

Sì, puoi creare [cloni vocali istantanei](/docs/it/overview/capabilities/voices#cloned) della tua voce
a partire da brevi clip audio. Per cloni ad alta fedeltà, scopri la nostra funzionalità di [clonazione vocale professionale](/docs/it/overview/capabilities/voices#cloned).

#### Possiedo l'output audio?

Sì. Mantieni la proprietà di qualsiasi audio che generi. Tuttavia, i diritti di utilizzo commerciale sono
disponibili solo con i piani a pagamento. Con un abbonamento a pagamento, puoi usare l'audio generato per scopi commerciali
e monetizzare gli output se possiedi i diritti di proprietà intellettuale sui contenuti di input.

#### Cosa rende gratuita una rigenerazione?

Una rigenerazione gratuita ti consente di rigenerare lo stesso contenuto da testo a parlato senza costi aggiuntivi, alle seguenti condizioni:

* Puoi rigenerare gratuitamente ogni contenuto fino a 2 volte
* Il contenuto deve essere esattamente identico alla generazione precedente. Qualsiasi modifica al testo, alle impostazioni vocali o ad altri parametri richiederà una nuova generazione a pagamento

Le rigenerazioni gratuite sono utili in caso di leggere distorsioni nell'output audio. Secondo i benchmark interni di ElevenLabs, le rigenerazioni risolvono circa la metà dei problemi di qualità, mentre quelli rimanenti sono generalmente dovuti a dati di addestramento di scarsa qualità.

#### Come posso ridurre la latenza per i casi d'uso in tempo reale?

Usa i [modelli](/docs/it/overview/models) Flash a bassa latenza (Flash v2 o v2.5), ottimizzati per scenari
conversazionali o interattivi quasi in tempo reale. Consulta la nostra [guida all'ottimizzazione della latenza](/docs/it/eleven-api/guides/how-to/best-practices/latency-optimization) per maggiori dettagli.

#### Perché il mio output a volte è incoerente?

I modelli non sono deterministici. Per una maggiore coerenza, usa il parametro [seed facoltativo](/docs/it/api-reference/text-to-speech/convert#request.body.seed), anche se potrebbero comunque verificarsi lievi
differenze.

#### Qual è la procedura consigliata per convertire testi lunghi?

Dividi il testo lungo in segmenti e usa lo streaming per una riproduzione in tempo reale e un'elaborazione efficiente.
Per mantenere un flusso prosodico naturale tra i blocchi, includi i [parametri previous/next text o previous/next request id](/docs/it/api-reference/text-to-speech/convert#request.body.previous_text).

## Informazioni chiave

* **Determinismo**: L'output non è deterministico: usa il parametro `seed` per risultati più coerenti
* **Rigenerazioni gratuite**: Fino a 2 rigenerazioni gratuite per generazione (solo stesso contenuto e parametri)
* **Proprietà**: Mantieni la proprietà dell'audio generato; l'uso commerciale richiede un piano a pagamento
* **Casi d'uso a bassa latenza**: Usa i modelli Flash (`eleven_flash_v2` o `eleven_flash_v2_5`): consulta la [guida all'ottimizzazione della latenza](/docs/it/eleven-api/guides/how-to/best-practices/latency-optimization)
* **Testi lunghi**: Dividi il testo lungo in segmenti; usa i parametri `previous_text` / `next_text` per mantenere una prosodia naturale tra i blocchi