API Text to Speech
Generazione vocale ultra-realistica e a bassa latenza
Crea con un Text to Speech di alta qualità e controllabile, ideale per applicazioni in tempo reale e su larga scala. I modelli sono ottimizzati per latenza, fedeltà e coerenza nei contenuti lunghi.
Demo
Codice
Nell'antica terra di Eldoria, dove i cieli scintillavano e le foreste sussurravano segreti al vento, viveva un drago di nome Zephyros. [sarcastically] Non il tipo che “brucia tutto... [giggles] ma era gentile, saggio, con occhi come stelle antiche. [whispers] Perfino gli uccelli tacevano quando passava.
- Lovable
- Synthesia
- Stripe
- Perplexity
- Twilio
Basato sui modelli di Voice AI più potenti
Scegli il modello più adatto al tuo caso d’uso: da agenti a bassissima latenza a narrazione espressiva e lunga durata.

Flash v2.5
Il nostro modello di sintesi vocale con la latenza più bassa
- Latenza ultra-bassa (~75ms)
- 32 lingue supportate
- Limite di 40.000 caratteri
- ~$0,06 al minuto

Turbo v2.5
Qualità e latenza bilanciate
- Bassa latenza (~250-300ms)
- Generazione vocale di alta qualità
- 32 lingue supportate
- Limite di 40.000 caratteri
- ~$0,06 al minuto

Multilingue v2
Modello di sintesi vocale realistico e costante
- Output dal suono naturale
- 29 lingue supportate
- Limite di 10.000 caratteri
- Pensato per generazioni lunghe
- ~$0,12 al minuto

Eleven v3
Il nostro modello più espressivo e ricco di emozioni
- Interpretazione drammatica ed espressiva
- Oltre 70 lingue supportate
- Limite di 3.000 caratteri
- Dialoghi multi-speaker
- ~$0,12 al minuto
Tutto ciò che ti serve per creare parlato pronto per la produzione
Genera parlato espressivo e controllabile con modelli pensati per l’uso in tempo reale, su contenuti lunghi e in produzione.
Controlla emozione e interpretazione
Crea parlato controllabile ed espressivo, arricchito da emozioni, eventi audio e paesaggi sonori immersivi.

Accedi a oltre 10.000 voci
Scopri una raccolta in continua crescita di voci espressive e realistiche per ogni esigenza.

Design e clonazione voci
Crea in oltre 30 lingue con voci naturali, accenti espressivi e audio localizzato per il tuo pubblico.

Dialoghi multi-speaker
Crea conversazioni naturali tra più speaker in oltre 70 lingue con voci espressive e controllabili.

Eventi audio e direzione
Gestisci l’interpretazione con tag audio, segnali di tempo e indicazioni narrative integrate nel parlato.

Dizionari di pronuncia
Definisci pronunce personalizzate per garantire parlato coerente e preciso su nomi e termini specifici.

Al servizio delle aziende e dei brand leader nel mondo
“Dai Reels doppiati nelle lingue locali, alla generazione di musica e voci di personaggi in Horizon, la piattaforma ElevenLabs permette a creator, aziende e imprese di tutto il mondo di creare con voce, musica e suoni su larga scala.”
“Milioni di persone imparano gli scacchi ogni giorno da creator come Hikaru, Levy e Magnus su YouTube e Twitch. Ora puoi imparare da loro anche su Chess.com in modo immersivo, personale e ricco di carattere. La nostra missione è creare un coach di scacchi che insegni al livello giusto, accolga giocatori di ogni livello e renda gli scacchi più accessibili e divertenti. Con ElevenLabs e queste nuove voci straordinarie, abbiamo fatto un grande passo verso la realizzazione di questa visione.”
“Con ElevenLabs abbiamo integrato facilmente potenti funzionalità text-to-speech nel nostro SDK, permettendo agli agent di rispondere in tempo reale con voci espressive alle domande degli utenti o come feedback su ciò che vedono.”

“Twilio ha integrato la tecnologia di generazione vocale IA di ElevenLabs nel suo CPaaS, migliorando ConversationRelay. Questa integrazione permette ad aziende e sviluppatori di creare interazioni vocali AI conversazionali che suonano umane, sono espressive e rispondono in tempo reale direttamente dalla piattaforma CPaaS di Twilio. Noi di ElevenLabs siamo entusiasti che Twilio abbia scelto ElevenLabs per rendere ConversationRelay ancora più espressivo e naturale.”
API pensate per la produzione

Domande frequenti
- Flash v2.5 - Latenza ultra-bassa (~75ms) per applicazioni in tempo reale come voice agent
- Turbo v2.5 - Qualità e velocità bilanciate (~250-300ms) per casi d’uso interattivi
- Multilingual v2 - Qualità costante per contenuti lunghi fino a 10.000 caratteri
- Eleven v3 - Massima espressività e gamma emotiva per applicazioni creative
Flash v2.5 offre una latenza di circa 75ms.
Turbo v2.5 risponde di solito in 250-300ms.
Entrambi supportano output in streaming, così puoi iniziare l’ascolto prima che la generazione sia completata.
Eleven v3 supporta più di 70 lingue.
Flash v2.5 e Turbo v2.5 supportano 32 lingue.
Multilingual v2 supporta 29 lingue.
Flash v2.5 e Turbo v2.5: 40.000 caratteri
Multilingual v2: 10.000 caratteri
Eleven v3: 3.000 caratteri
Usa i tag audio ([laughs], [whispers], [sighs], [door slam]) per controllare interpretazione, emozione, enfasi, pause ed effetti sonori. Eleven v3 offre il controllo più espressivo.
La Voice Library include oltre 10.000 voci. Puoi anche clonare voci o crearne di personalizzate tramite prompt testuali.
Sì. Lo streaming ti permette di iniziare l’ascolto prima che l’audio sia generato completamente, riducendo la latenza percepita nelle applicazioni in tempo reale.
Sì. Puoi richiamare qualsiasi voce nella tua libreria tramite ID della voce, incluse voci clonate professionalmente, cloni istantanei e voci che hai creato.
L’API restituisce MP3 come formato predefinito. Sono disponibili anche PCM e μ-law.
Usa Flash v2.5 con streaming attivo. Mantieni le richieste sotto i 1.000 caratteri. Abilita le connessioni WebSocket per applicazioni real-time persistenti.
Sì. Usa la scrittura fonetica o i dizionari di pronuncia per controllare come vengono pronunciate parole specifiche.
Sono disponibili SDK ufficiali per Python e JavaScript/TypeScript. Puoi anche usare l’API HTTP.
Riferimento API completo, esempi di codice e guide all’integrazione sono disponibili su elevenlabs.io/docs/api-reference
Sì. I piani enterprise includono conformità SOC 2, supporto HIPAA, conformità GDPR, residenza dati UE, modalità zero retention, supporto dedicato e SLA personalizzati.
