Vai al contenuto

Riepilogo Webinar: Come creare agenti IA che suonano naturali

Scritto da
Luigi Sambuy
Pubblicato
Ultimo aggiornamento

AscoltaAscolta questo articolo

La maggior parte dei team vuole creare un agente dal suono naturale.

Il divario che la maggior parte dei team riscontra riguarda gli agenti che completano il compito, ma non comprendono il contesto, l'urgenza o le emozioni. E quando chi chiama se ne accorge, la fiducia cala, così come la qualità dell'interazione.

Nel nostro recente Workshop dal vivo: creare agenti IA dal suono naturale, Luigi Sambuy (Forward Deployed Engineering) ha illustrato cosa distingue un agente dal suono robotico da uno che sembra davvero umano.

Perché suonare naturali è più difficile di quanto sembri

La maggior parte dei team che implementa agenti ha già risolto il problema dell'accuratezza: l'agente fornisce la risposta giusta, prenota il tavolo giusto, annulla il volo giusto. 

La parte più difficile è rendere giusta la resa.

Un agente che non rispecchia le emozioni di chi chiama, non coglie l'urgenza e risponde a ogni domanda con lo stesso ritmo piatto sembrerà sempre artificiale, per quanto corrette siano le sue risposte. I clienti non vogliono soltanto che il loro problema venga risolto: vogliono sentirsi ascoltati mentre accade.

Le quattro caratteristiche di un agente dal suono naturale

  1. Ritmo e fluidità - ritmo naturale, pause e variazioni di velocità invece di una lettura monotona
  2. Rispecchiamento - rispondere con partecipazione a chi chiama frustrato e con calore alle buone notizie
  3. Contesto - integrare la cronologia dell'utente, i sistemi aziendali e riferimenti culturali o regionali per evitare risposte generiche
  4. Identità - una voce creata appositamente per il brand, non un'impostazione predefinita standard

Demo: un agente dal suono naturale in azione

Scenario: Un cliente chiama il Rosette Restaurant per spostare la sua prenotazione. È il suo quinto anniversario di matrimonio e farà tardi.

Cosa viene mostrato:

  • L'agente ha iniziato cordialmente, riconoscendo l'anniversario prima di fare qualsiasi altra cosa
  • Ha rilevato una piccola discrepanza tra l'orario della prenotazione indicato e quello effettivamente registrato, chiedendo chiarimenti invece di fare supposizioni
  • Ha spostato la prenotazione alle 21:00 e ha offerto proattivamente un tavolo vicino alla finestra per l'occasione, senza che gli venisse chiesto
  • Durante tutta la chiamata, l'agente ha usato pause naturali, parole di riempimento e un tono adatto al momento: rassicurante, cordiale, senza fretta

Perché è importante: Tutto questo non deriva da un modello diverso o da una piattaforma più potente. Deriva dal prompt. Il system prompt ha dato all'agente il permesso di correggersi a metà frase, interrompersi naturalmente mentre "cerca qualcosa" e cambiare il tono emotivo in base a chi chiama: le stesse tecniche oggi disponibili per qualsiasi team che sviluppa sulla piattaforma.

Sette leve per creare agenti naturali

  1. Tag emotivi - disponibili nella modalità espressiva del modello conversazionale v3; il fattore più importante per variare il tono
  2. Rumore di sottofondo - rumore d'ufficio, suoni urbani o rumore di digitazione per un contesto più familiare e umano
  3. Tono nel system prompt - è qui che risiede gran parte della differenza
  4. Impostazioni di eagerness (eager / normal / patient) - in base al tempo necessario per l'interazione
  5. Dizionario di pronuncia / parole chiave - per nomi, brand e parole straniere che altrimenti l'agente pronuncerebbe in modo errato. 
  6. Impostazioni di output - alcuni team aggiungono intenzionalmente squilli di telefono in sottofondo invece di un audio impeccabile, dato che i clienti provenienti da un contact center tradizionale sono abituati a quel tono leggermente ovattato
  7. Progettazione vocale o clonazione - creare una voce completamente personalizzata e in linea con il brand, invece di sceglierne una standard. La progettazione vocale ti consente di descrivere qualcosa di specifico nel prompt, ad esempio "un uomo sulla trentina che sembra parlare attraverso delle cuffie". Clonazione vocale va da una clonazione istantanea, con circa 30 secondi di audio, a una clonazione professionale, con più materiale e una fedeltà maggiore. 

Best practice per agenti dal suono naturale

Scrivi il tono direttamente nel system prompt. È qui che risiede gran parte della differenza tra un agente piatto e uno naturale. Dai all'agente il permesso esplicito di correggersi a metà frase ("come parlano davvero le persone"), di interrompersi naturalmente mentre cerca qualcosa e di lasciare spazio al silenzio dopo qualcosa di serio prima di rispondere.

Adatta i tag emotivi al momento. Un tag "excited" non è adatto a un momento serio o rischioso. Inserisci i tag con attenzione nei punti in cui compariranno davvero nella conversazione e adattali allo stato emotivo di chi chiama man mano che la chiamata procede, ad esempio un tono calmo e rassicurante per una persona ansiosa, oppure rapido ma cordiale per chi ha fretta.

Imposta l'eagerness con attenzione. Eager funziona per scambi rapidi e ricchi di informazioni; patient è adatto quando qualcuno ha bisogno di tempo per recuperare un documento o un numero. Usare eager come impostazione predefinita in ogni situazione può far sembrare l'agente insistente anziché naturale.

Scegli l'LLM per ogni nodo. Usa modelli più leggeri e veloci per semplici passaggi di instradamento e modelli più potenti per i nodi che prendono decisioni concrete. 

Considera la latenza percepita come parte della "naturalezza". Oltre alla scelta del modello, sia la generazione speculativa dei turni, che consente al modello di iniziare a formulare una risposta mentre chi chiama sta ancora parlando, sia le parole di riempimento in caso di soft timeout riducono la durata percepita di una pausa, anche quando il tempo di risposta effettivo non cambia.

Localizza anziché tradurre. Scegli voci effettivamente addestrate nella lingua di destinazione, usa un dizionario di pronuncia e, per i casi d'uso in un'unica lingua, valuta di scrivere il prompt direttamente in quella lingua per migliorare le prestazioni. Multilingual v2 rimane un'ottima opzione quando una latenza rapida tra più lingue conta più della gamma espressiva.

Monitora il tuo agente. Usa test di simulazione per convalidare un agente senza chiamate reali, criteri di valutazione per assegnare un esito positivo o negativo dopo la chiamata e analisi del sentiment turno per turno per individuare esattamente dove, in una conversazione, l'agente ha usato il tono sbagliato. Poi usa queste informazioni per ottimizzare il prompt.

Guarda la sessione completa

Guarda il webinar completo qui.

ElevenLabs workshop on building natural-sounding AI agents, hosted by Luigi Sambuy.

Articoli simili

Crea con l'audio IA della massima qualità