Presentiamo Eleven v3 (alpha)
- Pubblicato
AscoltaAscolta questo articolo
Siamo lieti di presentare Eleven v3 (alpha), il modello Text to Speech più espressivo.
Questa anteprima di ricerca offre un controllo e un realismo senza precedenti nella generazione del parlato, con:
- Oltre 70 lingue
- Dialoghi con più interlocutori
- Tag audio come [excited], [whispers] e [sighs]
Eleven v3 (alpha) richiede più prompt engineering rispetto ai modelli precedenti, ma i risultati sono straordinari.
Se lavori a video, audiolibri o strumenti per i media, v3 apre un nuovo livello di espressività. Per i casi d'uso in tempo reale e conversazionali, per ora ti consigliamo di continuare a usare v2.5 Turbo o Flash. È in fase di sviluppo una versione di v3 in tempo reale.
Eleven v3 è disponibile da oggi sul nostro sito web e nelle API.
Perché abbiamo creato v3
Dal lancio di Multilingual v2, abbiamo visto l'IA vocale adottata nel cinema professionale, nello sviluppo di videogiochi, nell'istruzione e nell'accessibilità. Ma la limitazione costante non era la qualità audio: era l'espressività. Era difficile ottenere emozioni più marcate, interruzioni conversazionali e scambi credibili.
Eleven v3 colma questa lacuna. È stato progettato da zero per offrire voci che sospirano, sussurrano, ridono e reagiscono, generando un parlato davvero reattivo e naturale.
Novità di Eleven v3 (alpha)
| Feature | What it unlocks |
|---|---|
| Audio tags | Inline control of tone, emotion, and non-verbal reactions |
| Dialogue mode | Multi-speaker conversations with natural pacing and interruptions |
| 70+ languages | Full coverage of high-demand global languages |
| Deeper text understanding | Better stress, cadence, and expressivity from text input |
Uso dei tag audio
I tag audio vengono inseriti direttamente nello script e sono formattati tra parentesi quadre in minuscolo. Scopri di più sui tag audio nella nostra guida al prompting per v3 nella documentazione.
Al momento, le Professional Voice Clones (PVC) non sono completamente ottimizzate per Eleven v3, quindi la qualità del clone potrebbe essere inferiore rispetto ai modelli precedenti. In questa fase di anteprima di ricerca, se hai bisogno di utilizzare le funzionalità di v3 per il tuo progetto, è preferibile scegliere una Instant Voice Clone (IVC) o una voce progettata. L'ottimizzazione delle PVC per v3 arriverà a breve.
Ad esempio, puoi usare questo prompt: “[whispers] Sta arrivando qualcosa… [sighs] Lo sento.” Per un controllo più espressivo, puoi anche combinare più tag:
Creare dialoghi con più interlocutori
Eleven v3 è supportato dal nostro endpoint Text to Speech esistente. Abbiamo inoltre introdotto un nuovo endpoint API Text to Dialogue. Fornisci un array strutturato di oggetti JSON, ciascuno dei quali rappresenta il turno di un interlocutore, e il modello genera un file audio coerente con voci sovrapposte:
L'endpoint gestisce automaticamente le transizioni tra interlocutori, i cambiamenti emotivi e le interruzioni.
Scopri di più qui.
Prezzi e disponibilità
| Plan | Launch promo | At the end of June |
|---|---|---|
| UI (self-serve) | 80% off (~5× cheaper) | Same as Multilingual V2 |
| UI (enterprise) | 80% off business plan pricing | Business plan pricing |
Per abilitare v3:
- Usa il selettore di modelli e seleziona Eleven v3 (alpha)
L'accesso alle API e il supporto in Studio saranno disponibili a breve. Per l'accesso anticipato, contatta il team vendite.
Quando non usare v3
Eleven v3 (alpha) richiede più prompt engineering rispetto ai nostri modelli precedenti. Quando funziona, il risultato è straordinario, ma la minore affidabilità e la latenza più elevata lo rendono inadatto ai casi d'uso in tempo reale e conversazionali. Per questi, consigliamo Eleven v2.5 Turbo/Flash.
Per saperne di più, consulta la documentazione completa di v3 e le FAQ.
- Accedi a ElevenLabs UI
- Seleziona v3 (alpha) dal menu a discesa del modello
- Incolla lo script: usa tag o dialoghi
- Genera l'audio
Non vediamo l'ora di scoprire come darai vita a v3 in nuovi casi d'uso, dalla narrazione immersiva ai workflow di produzione cinematografica.







.jpg&w=3840&q=80)
.png&w=3840&q=80)

