Vai alla navigazione

Modalità espressiva

Crea agenti vocali che adattano tono, tempi ed espressività emotiva in base al contesto della conversazione.

Panoramica

La modalità espressiva consente agli agenti di generare un parlato che riflette intenzione, emozione ed enfasi, adattandosi in tempo reale a come gli utenti parlano e a ciò che dicono. Si basa su due miglioramenti a livello di sistema dello stack conversazionale:

  1. Eleven v3 Conversational — il modello Text to Speech più intelligente dal punto di vista emotivo e più consapevole del contesto disponibile in ElevenAgents.
  2. Un nuovo sistema di gestione dei turni — risposte sincronizzate in modo più accurato e con meno interruzioni.

La modalità espressiva è abilitata per impostazione predefinita quando selezioni Eleven v3 Conversational come modello TTS del tuo agente.

Eleven v3 Conversational

Eleven v3 Conversational è una versione di Eleven v3 a latenza ultra-ridotta, ottimizzata per dialoghi dal vivo e bidirezionali. Mantiene il contesto conversazionale tra un turno e l’altro e adatta l’espressività al tono e all’intento di ogni scambio.

  • Espressività consapevole del contesto: gli agenti adattano il tono in base al contesto della conversazione, rispondendo con più calma quando un utente sembra preoccupato o in modo più diretto quando serve chiarezza.
  • Controllo emotivo esplicito: guida l’espressività tramite regole nel system prompt, da trigger precisi a scenari più ampi, per allinearla alla voce del brand e ai requisiti di conformità normativa.
  • Supporto per oltre 70 lingue: rispetto alle circa 32 lingue dei modelli Flash, offre maggiore espressività nelle lingue in cui in precedenza le sfumature erano meno efficaci, incluso il giapponese.
  • Tag espressivi: l’LLM può produrre tag come [laughs], [whispers] o [sighs] per controllare momenti specifici dell’espressività.

Eleven v3 Conversational ha lo stesso prezzo degli altri modelli TTS di ElevenLabs in Agents, a partire da $0.08 al minuto.

Sistema di gestione dei turni

Il nuovo sistema di gestione dei turni usa segnali in tempo reale da Scribe v2 Realtime, inclusi segnali emotivi e pattern vocali, per stabilire quando un agente deve parlare, fare una pausa o attendere. Questo aiuta gli agenti a rispondere in modo più naturale, soprattutto nelle situazioni emotivamente intense.

Ad esempio, “sì” può essere una conferma completa oppure l’inizio di una frase che continua. Analizzando come è stato detto, inclusi segnali vocali come la prosodia, oltre alla trascrizione, il sistema sincronizza la risposta dell’agente in modo più naturale.

Puoi ottimizzare ulteriormente la gestione dei turni con l’impostazione propensione a intervenire.

Configurazione

Abilitare la modalità espressiva

1

Seleziona il modello TTS

Imposta il modello TTS del tuo agente su V3 Conversational. Con questo modello, la modalità espressiva è abilitata per impostazione predefinita.

Apri il tuo agente nella dashboard, vai alla scheda Voce dell’agente e seleziona V3 Conversational come modello Text to Speech. Salva le modifiche.

Abilitazione della modalità espressiva

2

Guida l’espressività emotiva nel system prompt

Aggiungi istruzioni al system prompt del tuo agente per guidare il modo in cui adatta il proprio tono. Puoi usare indicazioni generali o trigger specifici.

Esempi di system prompt

Guida l’espressività emotiva del tuo agente tramite istruzioni in linguaggio naturale nel system prompt. Il modello le interpreta in base al contesto, quindi non sono necessari tag espliciti per ogni situazione.

Indicazioni generali

You are a customer support agent. When a user sounds frustrated or upset, respond
in a calm, reassuring tone. When delivering good news, allow your tone to reflect
genuine warmth. Maintain a professional but approachable delivery throughout.

Trigger specifici

You are a conversational AI agent with expressive speech capabilities.
Tone guidelines:
- When a user expresses frustration, use a calm and empathetic tone
- When explaining technical steps, use a clear and measured pace
- When a user shares good news, respond with warmth and enthusiasm
- When handling complaints, remain composed and solution-oriented

Uso dei tag espressivi

Oltre all’espressività consapevole del contesto, l’LLM può produrre tag espliciti per controllare momenti specifici. I tag più comuni includono:

  • [laughs] — Aggiunge una risata al parlato
  • [whispers] — Abbassa il volume per sussurrare
  • [sighs] — Aggiunge un tono di sospiro
  • [slow] — Rallenta l’espressione vocale
  • [excited] — Aggiunge entusiasmo all’espressività

Ogni tag influenza approssimativamente le 4-5 parole successive prima di tornare all’espressività normale.

You can also use expressive tags in your responses for precise control:
- [laughs] for moments of humor
- [whispers] for confidential or intimate moments
- [sighs] for resignation or relief
- [slow] when emphasizing important information
Example: "That's great to hear! [laughs] I'm glad we could sort that out for you."

Best practice

Guida il tuo agente affinché adatti la propria espressività emotiva alla situazione. Un cliente frustrato dovrebbe ricevere una risposta calma ed empatica. Un utente che condivide una buona notizia dovrebbe percepire un calore genuino. Un tono inappropriato mina la fiducia.

Definisci linee guida chiare sul tono nel system prompt, invece di affidarti esclusivamente al giudizio del modello. In questo modo garantisci un’espressività coerente, allineata alla voce del tuo brand e ai requisiti di conformità normativa.

L’espressività può variare tra le lingue. Testa il tuo agente in ogni lingua di destinazione per assicurarti che la sfumatura emotiva venga trasmessa come previsto, soprattutto nelle lingue con norme conversazionali diverse.

Abbina la modalità espressiva a impostazioni appropriate di propensione a intervenire. La modalità paziente lascia più spazio agli utenti nelle conversazioni emotivamente delicate, mentre quella reattiva è adatta alle interazioni dal ritmo rapido.

Usa le analisi delle conversazioni per monitorare come gli utenti reagiscono all’espressività. Perfeziona le linee guida sul tono in base agli esiti delle conversazioni e al feedback degli utenti.

Limitazioni

  • Eleven v3 Conversational non preserva le caratteristiche dei cloni vocali professionali (PVC): l’output potrebbe non somigliare alla voce PVC originale.
  • Gli effetti dei tag espressivi durano approssimativamente 4-5 parole prima di tornare all’espressività normale.
  • L’espressività può variare tra voci e lingue.

Domande frequenti

No. Eleven v3 Conversational ha lo stesso prezzo degli altri modelli TTS di ElevenLabs in Agents, a partire da $0.08 al minuto.

Seleziona V3 Conversational come modello TTS del tuo agente. Con questo modello, la modalità espressiva è abilitata per impostazione predefinita.

Il sistema usa segnali in tempo reale da Scribe v2 Realtime, inclusi segnali emotivi e pattern vocali, per prevedere quando l’agente deve rispondere. Analizza sia la trascrizione sia il modo in cui le parole sono state pronunciate, ossia la prosodia, per sincronizzare le risposte in modo naturale.

Al momento Eleven v3 Conversational non preserva bene le caratteristiche dei PVC. Se mantenere l’identità vocale del tuo PVC è fondamentale, valuta di usare Flash v2.

Eleven v3 Conversational supporta oltre 70 lingue, rispetto alle circa 32 dei modelli Flash. Questo include una migliore espressività in lingue come il giapponese, in cui in precedenza le sfumature erano meno efficaci.

Eleven v3 Conversational offre una gamma emotiva più ampia rispetto a Flash e Multilingual v2, con la capacità di adattare l’espressività in base al contesto conversazionale. Supporta oltre 70 lingue rispetto alle circa 32 di Flash. Ha lo stesso prezzo degli altri modelli.

Funzionalità correlate