Modalità espressiva
Crea agenti vocali che adattano tono, tempi ed espressività emotiva in base al contesto della conversazione.
Panoramica
La modalità espressiva consente agli agenti di generare un parlato che riflette intenzione, emozione ed enfasi, adattandosi in tempo reale a come gli utenti parlano e a ciò che dicono. Si basa su due miglioramenti a livello di sistema dello stack conversazionale:
- Eleven v3 Conversational — il modello Text to Speech più intelligente dal punto di vista emotivo e più consapevole del contesto disponibile in ElevenAgents.
- Un nuovo sistema di gestione dei turni — risposte sincronizzate in modo più accurato e con meno interruzioni.
La modalità espressiva è abilitata per impostazione predefinita quando selezioni Eleven v3 Conversational come modello TTS del tuo agente.
Eleven v3 Conversational
Eleven v3 Conversational è una versione di Eleven v3 a latenza ultra-ridotta, ottimizzata per dialoghi dal vivo e bidirezionali. Mantiene il contesto conversazionale tra un turno e l’altro e adatta l’espressività al tono e all’intento di ogni scambio.
- Espressività consapevole del contesto: gli agenti adattano il tono in base al contesto della conversazione, rispondendo con più calma quando un utente sembra preoccupato o in modo più diretto quando serve chiarezza.
- Controllo emotivo esplicito: guida l’espressività tramite regole nel system prompt, da trigger precisi a scenari più ampi, per allinearla alla voce del brand e ai requisiti di conformità normativa.
- Supporto per oltre 70 lingue: rispetto alle circa 32 lingue dei modelli Flash, offre maggiore espressività nelle lingue in cui in precedenza le sfumature erano meno efficaci, incluso il giapponese.
- Tag espressivi: l’LLM può produrre tag come
[laughs],[whispers]o[sighs]per controllare momenti specifici dell’espressività.
Eleven v3 Conversational ha lo stesso prezzo degli altri modelli TTS di ElevenLabs in Agents, a partire da $0.08 al minuto.
Sistema di gestione dei turni
Il nuovo sistema di gestione dei turni usa segnali in tempo reale da Scribe v2 Realtime, inclusi segnali emotivi e pattern vocali, per stabilire quando un agente deve parlare, fare una pausa o attendere. Questo aiuta gli agenti a rispondere in modo più naturale, soprattutto nelle situazioni emotivamente intense.
Ad esempio, “sì” può essere una conferma completa oppure l’inizio di una frase che continua. Analizzando come è stato detto, inclusi segnali vocali come la prosodia, oltre alla trascrizione, il sistema sincronizza la risposta dell’agente in modo più naturale.
Puoi ottimizzare ulteriormente la gestione dei turni con l’impostazione propensione a intervenire.
Configurazione
Abilitare la modalità espressiva
Seleziona il modello TTS
Imposta il modello TTS del tuo agente su V3 Conversational. Con questo modello, la modalità espressiva è abilitata per impostazione predefinita.
Aggiorna dalla dashboard
Aggiorna tramite la CLI
Aggiorna tramite l'API
Apri il tuo agente nella dashboard, vai alla scheda Voce dell’agente e seleziona V3 Conversational come modello Text to Speech. Salva le modifiche.

Esempi di system prompt
Guida l’espressività emotiva del tuo agente tramite istruzioni in linguaggio naturale nel system prompt. Il modello le interpreta in base al contesto, quindi non sono necessari tag espliciti per ogni situazione.
Indicazioni generali
Trigger specifici
Uso dei tag espressivi
Oltre all’espressività consapevole del contesto, l’LLM può produrre tag espliciti per controllare momenti specifici. I tag più comuni includono:
[laughs]— Aggiunge una risata al parlato[whispers]— Abbassa il volume per sussurrare[sighs]— Aggiunge un tono di sospiro[slow]— Rallenta l’espressione vocale[excited]— Aggiunge entusiasmo all’espressività
Ogni tag influenza approssimativamente le 4-5 parole successive prima di tornare all’espressività normale.
Best practice
Adatta l'espressività al contesto
Guida il tuo agente affinché adatti la propria espressività emotiva alla situazione. Un cliente frustrato dovrebbe ricevere una risposta calma ed empatica. Un utente che condivide una buona notizia dovrebbe percepire un calore genuino. Un tono inappropriato mina la fiducia.
Usa regole nel system prompt per garantire coerenza
Definisci linee guida chiare sul tono nel system prompt, invece di affidarti esclusivamente al giudizio del modello. In questo modo garantisci un’espressività coerente, allineata alla voce del tuo brand e ai requisiti di conformità normativa.
Esegui test in diverse lingue
L’espressività può variare tra le lingue. Testa il tuo agente in ogni lingua di destinazione per assicurarti che la sfumatura emotiva venga trasmessa come previsto, soprattutto nelle lingue con norme conversazionali diverse.
Combina con le impostazioni della propensione a intervenire
Abbina la modalità espressiva a impostazioni appropriate di propensione a intervenire. La modalità paziente lascia più spazio agli utenti nelle conversazioni emotivamente delicate, mentre quella reattiva è adatta alle interazioni dal ritmo rapido.
Monitora e migliora
Usa le analisi delle conversazioni per monitorare come gli utenti reagiscono all’espressività. Perfeziona le linee guida sul tono in base agli esiti delle conversazioni e al feedback degli utenti.
Limitazioni
- Eleven v3 Conversational non preserva le caratteristiche dei cloni vocali professionali (PVC): l’output potrebbe non somigliare alla voce PVC originale.
- Gli effetti dei tag espressivi durano approssimativamente 4-5 parole prima di tornare all’espressività normale.
- L’espressività può variare tra voci e lingue.
Domande frequenti
La modalità espressiva costa di più?
No. Eleven v3 Conversational ha lo stesso prezzo degli altri modelli TTS di ElevenLabs in Agents, a partire da $0.08 al minuto.
Come abilito la modalità espressiva?
Seleziona V3 Conversational come modello TTS del tuo agente. Con questo modello, la modalità espressiva è abilitata per impostazione predefinita.
Come funziona il sistema di gestione dei turni?
Il sistema usa segnali in tempo reale da Scribe v2 Realtime, inclusi segnali emotivi e pattern vocali, per prevedere quando l’agente deve rispondere. Analizza sia la trascrizione sia il modo in cui le parole sono state pronunciate, ossia la prosodia, per sincronizzare le risposte in modo naturale.
Posso usare la modalità espressiva con il mio Clone Vocale Professionale?
Al momento Eleven v3 Conversational non preserva bene le caratteristiche dei PVC. Se mantenere l’identità vocale del tuo PVC è fondamentale, valuta di usare Flash v2.
Quante lingue supporta Eleven v3 Conversational?
Eleven v3 Conversational supporta oltre 70 lingue, rispetto alle circa 32 dei modelli Flash. Questo include una migliore espressività in lingue come il giapponese, in cui in precedenza le sfumature erano meno efficaci.
Come si confronta con gli altri modelli TTS di ElevenAgents?
Eleven v3 Conversational offre una gamma emotiva più ampia rispetto a Flash e Multilingual v2, con la capacità di adattare l’espressività in base al contesto conversazionale. Supporta oltre 70 lingue rispetto alle circa 32 di Flash. Ha lo stesso prezzo degli altri modelli.