Vai al contenuto

Presentiamo Eleven v3 (alpha)

Pubblicato

AscoltaAscolta questo articolo

Eleven v3 is no longer in alpha, and is now generally available.


Siamo lieti di presentare Eleven v3 (alpha), il modello Text to Speech più espressivo.

Questa anteprima di ricerca offre un controllo e un realismo senza precedenti nella generazione del parlato, con:

  • Oltre 70 lingue
  • Dialoghi con più interlocutori
  • Tag audio come [excited], [whispers] e [sighs]

Eleven v3 (alpha) richiede più prompt engineering rispetto ai modelli precedenti, ma i risultati sono straordinari.

Se lavori a video, audiolibri o strumenti per i media, v3 apre un nuovo livello di espressività. Per i casi d'uso in tempo reale e conversazionali, per ora ti consigliamo di continuare a usare v2.5 Turbo o Flash. È in fase di sviluppo una versione di v3 in tempo reale.

Eleven v3 è disponibile da oggi sul nostro sito web e nelle API.

Perché abbiamo creato v3

Dal lancio di Multilingual v2, abbiamo visto l'IA vocale adottata nel cinema professionale, nello sviluppo di videogiochi, nell'istruzione e nell'accessibilità. Ma la limitazione costante non era la qualità audio: era l'espressività. Era difficile ottenere emozioni più marcate, interruzioni conversazionali e scambi credibili.

Eleven v3 colma questa lacuna. È stato progettato da zero per offrire voci che sospirano, sussurrano, ridono e reagiscono, generando un parlato davvero reattivo e naturale.

Novità di Eleven v3 (alpha)

Feature What it unlocks
Audio tags Inline control of tone, emotion, and non-verbal reactions
Dialogue mode Multi-speaker conversations with natural pacing and interruptions
70+ languages Full coverage of high-demand global languages
Deeper text understanding Better stress, cadence, and expressivity from text input

Ascolta v3 in prima persona

Background
Background

Uso dei tag audio

I tag audio vengono inseriti direttamente nello script e sono formattati tra parentesi quadre in minuscolo. Scopri di più sui tag audio nella nostra guida al prompting per v3 nella documentazione.

Al momento, le Professional Voice Clones (PVC) non sono completamente ottimizzate per Eleven v3, quindi la qualità del clone potrebbe essere inferiore rispetto ai modelli precedenti. In questa fase di anteprima di ricerca, se hai bisogno di utilizzare le funzionalità di v3 per il tuo progetto, è preferibile scegliere una Instant Voice Clone (IVC) o una voce progettata. L'ottimizzazione delle PVC per v3 arriverà a breve.

Ad esempio, puoi usare questo prompt: “[whispers] Sta arrivando qualcosa… [sighs] Lo sento.” Per un controllo più espressivo, puoi anche combinare più tag:

“[happily][shouts] We did it! [laughs].”

Creare dialoghi con più interlocutori

Eleven v3 è supportato dal nostro endpoint Text to Speech esistente. Abbiamo inoltre introdotto un nuovo endpoint API Text to Dialogue. Fornisci un array strutturato di oggetti JSON, ciascuno dei quali rappresenta il turno di un interlocutore, e il modello genera un file audio coerente con voci sovrapposte:

[
  {"speaker_id": "scarlett", "text": "(cheerfully) Perfect! And if that pop-up is bothering you, there’s a setting to turn it off under Notifications → Preferences."},
  {"speaker_id": "lex", "text": "You are a hero. An actual digital wizard. I was two seconds from sending a very passive-aggressive support email."},
  {"speaker_id": "scarlett", "text": "(laughs) Glad we could stop that in time. Anything else I can help with today?"}
]

L'endpoint gestisce automaticamente le transizioni tra interlocutori, i cambiamenti emotivi e le interruzioni.

Scopri di più qui.

v3 è il nostro modello più espressivo

Background
Background

Prezzi e disponibilità

Plan Launch promo At the end of June
UI (self-serve) 80% off (~5× cheaper) Same as Multilingual V2
UI (enterprise) 80% off business plan pricing Business plan pricing

Per abilitare v3:

  • Usa il selettore di modelli e seleziona Eleven v3 (alpha)

L'accesso alle API e il supporto in Studio saranno disponibili a breve. Per l'accesso anticipato, contatta il team vendite.

Quando non usare v3

Eleven v3 (alpha) richiede più prompt engineering rispetto ai nostri modelli precedenti. Quando funziona, il risultato è straordinario, ma la minore affidabilità e la latenza più elevata lo rendono inadatto ai casi d'uso in tempo reale e conversazionali. Per questi, consigliamo Eleven v2.5 Turbo/Flash.

Per saperne di più, consulta la documentazione completa di v3 e le FAQ.

Provalo oggi

Background
Background
  1. Accedi a ElevenLabs UI
  2. Seleziona v3 (alpha) dal menu a discesa del modello
  3. Incolla lo script: usa tag o dialoghi 
  4. Genera l'audio

Non vediamo l'ora di scoprire come darai vita a v3 in nuovi casi d'uso, dalla narrazione immersiva ai workflow di produzione cinematografica.

Crea con l'audio IA della massima qualità