Presentazione di Eleven v4, il nostro modello più espressivo
- Pubblicato
AscoltaAscolta questo articolo
Una frase può cambiare molto a seconda di come viene pronunciata. «Ho bisogno che tu mantenga la calma» dovrebbe suonare in modo diverso a seconda di chi la dice: un medico che la rivolge con delicatezza a un paziente spaventato o un personaggio di un videogioco che urla alla sua squadra prima di lanciarsi in battaglia.
Oggi lanciamo Eleven v4, il nostro modello di sintesi vocale più espressivo di sempre, e la sua variante a bassa latenza, Eleven v4 Turbo.

Classificato al primo posto da Artificial Analysis1, e preferito da circa il 75% degli ascoltatori nei test comparativi alla cieca rispetto ai modelli concorrenti2, Eleven v4 è stato progettato per interpretare tono, ritmo, emozione, carattere e contesto. Genera un parlato che può risultare drammatico, delicato, urgente, comico o colloquiale, mantenendo al contempo l'identità di chi parla. Le dinamiche più naturali tra più interlocutori rendono le conversazioni più reattive, anziché sembrare frasi separate assemblate insieme. Gli interlocutori rispondono al contesto della conversazione, creando dialoghi e interazioni tra personaggi più naturali.

Una nuova architettura pensata per le prestazioni
Basato su un'architettura completamente nuova, Eleven v4 è il nostro modello di Text to Speech più espressivo, classificato al primo posto da Artificial Analysis1. Eleven v4 Turbo porta la stessa tecnologia a casi d'uso a bassa latenza come gli agenti. Con una latenza mediana di inferenza di circa 100 ms, può rispondere più rapidamente della pausa media tra due persone che parlano.
Entrambi i modelli possono generare un parlato espressivo, anziché meccanico. Anche la fedeltà audio di base è complessivamente superiore, con risultati più puliti e naturali.
Le generazioni precedenti di modelli di sintesi vocale sanno leggere un testo ad alta voce, ma Eleven v4 conferisce al parlato una profondità emotiva molto più naturale. Il modello interpreta il tono desiderato, il ritmo del parlato, il carattere del testo e il suo contesto, per produrre un parlato emotivamente coinvolgente.
Gli utenti hanno anche un controllo preciso sugli output e possono descrivere in linguaggio naturale come pronunciare una frase. Possono inoltre aggiungere istruzioni specifiche su come dire determinate espressioni, quale emozione trasmettere e persino effetti sonori, usando tag inline come [laughs], [said angrily in French accent], [light rain] o [phone buzzing]. Eleven v4 segue questi tag audio e prompt di regia con più precisione rispetto ai modelli precedenti, quindi ottieni l'interpretazione che descrivi. In questo modo è più facile dirigere la narrazione, sviluppare i personaggi e i loro dialoghi, e gestire tutti gli altri casi in cui l'interpretazione conta.
La documentazione per sviluppatori di ElevenLabs illustra la sintassi completa dei tag e come applicarli tramite l'API. Anche il supporto per i fonemi dell'Alfabeto Fonetico Internazionale (IPA) è stato notevolmente migliorato, così le pronunce personalizzate funzionano in modo più affidabile.
Eleven v4 migliora anche la coerenza e le conversazioni dinamiche tra più interlocutori. Grazie a un nuovo metodo per acquisire l'identità degli interlocutori, preserva le qualità uniche di ogni voce. Riesce a mantenere coerente il parlato nelle conversazioni degli agenti, negli audiolibri o nelle pubblicità. Poiché il modello comprende il contesto di un'intera scena, genera dialoghi naturali in cui gli interlocutori rispondono a ciò che è stato appena detto, anziché unire frasi isolate.
Un modello Turbo per casi d'uso a bassa latenza
I modelli vocali di alta qualità hanno tendenzialmente tempi di generazione più lunghi, costringendo gli utenti a scegliere tra agenti vocali veloci o espressivi. Molti hanno scelto agenti capaci ma monotoni, che possono sembrare robotici a un cliente agitato che vuole semplicemente risolvere il proprio problema.
Eleven v4 Turbo combina velocità ed emozione con un tempo mediano alla prima emissione vocale di circa 150 ms3, rendendo possibile l'implementazione di agenti potenti in innumerevoli settori: da agenti cordiali e rassicuranti, capaci di pronunciare correttamente termini medici in ambito sanitario, ad agenti dal parlato rapido che usano lo slang per intrattenere i giocatori nel gaming.

Il modello Eleven v4 Turbo è progettato per funzionare con ElevenAgents, la piattaforma di agenti conversazionali di ElevenLabs. Altri strumenti per creare agenti combinano modelli e software di fornitori diversi, lasciando gli utenti senza un modo per perfezionare o migliorare gli output dei modelli per i propri casi d'uso. I team di ricerca e ingegneria di ElevenLabs hanno ottimizzato insieme Eleven v4 Turbo ed ElevenAgents come un unico sistema, offrendo agenti più espressivi, affidabili e a bassa latenza.
Una voce, moltissime lingue
Il modo in cui comunichiamo varia in base al contesto, al luogo e persino all'ora del giorno. Creare un parlato espressivo che rifletta tutto questo, in più lingue, resta una delle sfide più difficili dell'audio IA.
Eleven v4 migliora sotto tutti questi aspetti, e i progressi vanno oltre la semplice pronuncia delle frasi. Eleven v4 cattura meglio ritmo, emozione e interpretazione nelle diverse lingue, aiutando i creatori a produrre un parlato naturale per la lingua e il contesto. Per esempio, il modo in cui parleresti a un anziano sconosciuto in Giappone è molto diverso da come gli parleresti in Italia.
Sia Eleven v4 sia Eleven v4 Turbo supportano più di 90 lingue. Ora, una voce registrata in una lingua può parlare fluentemente anche qualsiasi altra lingua, adottando l'accento di un madrelingua e mantenendo l'identità dell'originale. L'aderenza all'accento è sensibilmente maggiore rispetto al passato, quindi la voce non torna più gradualmente al suo accento d'origine nel corso della generazione.
Catalano
Spagnolo
Per il doppiaggio e la localizzazione, questo significa che la voce del brand che hai scelto — che si tratti di un attore famoso con cui collabori o del tono più adatto allo stile della tua azienda — suonerà al meglio in qualsiasi lingua supportata da Eleven v4.
Clonazione vocale più autentica e coerente
La clonazione vocale è più autentica, potente e coerente sia in Eleven v4 sia in Eleven v4 Turbo, con una somiglianza con la voce originale significativamente maggiore. Ora Instant Voice Clones può acquisire voci in alta fedeltà usando appena 10 secondi di audio.
Voce reale
Eleven v4
Eleven v4 preserva inoltre l'identità di chi parla in modo più affidabile tra generazioni, dialoghi, narrazioni e frasi rigenerate. Ciò significa che, nei progetti di lunga durata, personaggi, narratori e voci clonate restano coerenti per tutta la produzione. Eleven v4 aggiunge inoltre il supporto per Professional Voice Clones (PVC), per i casi d'uso di clonazione che richiedono la massima fedeltà.
Anche il request stitching — concatenare generazioni per creare contenuti più lunghi — è notevolmente più affidabile in Eleven v4, migliorando l'esperienza di lavoro in ElevenLabs Studio e nell'app ElevenLabs Reader.
Ascolta la differenza
Eleven v4 ed Eleven v4 Turbo rappresentano il culmine delle nostre più recenti ricerche sulla generazione di parlato espressivo. Sono pensati per contenuti in cui l'interpretazione conta quanto le parole stesse: audiolibri, performance di personaggi, voci fuori campo, doppiaggio o localizzazione di agenti conversazionali.
Entrambi i modelli sono già disponibili in ElevenAgents, ElevenCreative e tramite ElevenAPI. Crea un account gratuito per iniziare oggi a generare con Eleven v4 o Eleven v4 Turbo.
- Artificial Analysis, Provider Voice Arena Leaderboard, settembre 2026
- Basato su test comparativi alla cieca delle preferenze degli utenti rispetto a Cartesia Sonic 3.6, Inworld TTS-2, Google Gemini 3.8 Flash-Lite TTS e Google Gemini 3.8 Flash TTS, settembre 2026. Per ogni coppia, i valutatori hanno ascoltato la stessa frase di Eleven v4 e di un concorrente, presentate alla cieca, e hanno giudicato quale fosse più espressiva e quale suonasse più naturale; i pareggi sono stati conteggiati come metà.
- Tempo mediano dalla richiesta al parlato udibile. Misurato a settembre 2026 con script identici e impostazioni predefinite rispetto a Cartesia Sonic 3.6, xAI TTS, Google Gemini Flash-Lite TTS e OpenAI GPT-4o mini TTS; la latenza di rete è stata misurata e rimossa per tutti i sistemi. Eleven v4 Turbo tramite streaming WebSocket.




