Aller au contenu

Résumé du webinaire : Concevoir des agents IA à la voix naturelle

Rédigé par
Luigi Sambuy
Publié
Dernière mise à jour

ÉcouterÉcouter cet article

La plupart des équipes souhaitent créer un agent à la voix naturelle.

L'écart que constatent la plupart des équipes concerne les agents qui accomplissent la tâche, mais ne comprennent ni le contexte, ni l'urgence, ni l'émotion. Dès que l'appelant s'en aperçoit, la confiance baisse, tout comme la qualité de l'interaction.

Lors de notre récent atelier en direct : créer des agents IA à la voix naturelle, Luigi Sambuy (Forward Deployed Engineering) a montré ce qui distingue un agent à la voix robotique d'un agent qui paraît véritablement humain.

Pourquoi une voix naturelle est plus difficile à obtenir qu'il n'y paraît

La plupart des équipes qui déploient des agents ont déjà résolu la question de la précision : l'agent donne la bonne réponse, réserve la bonne table, annule le bon vol. 

Le plus difficile est d'obtenir le bon rendu.

Un agent qui ne s'aligne pas sur l'émotion de l'appelant, ne perçoit pas l'urgence et répond à chaque question avec le même rythme plat paraîtra toujours artificiel, aussi justes que soient ses réponses. Les clients ne veulent pas seulement que leur problème soit résolu : ils veulent se sentir écoutés pendant ce processus.

Les quatre caractéristiques d'un agent à la voix naturelle

  1. Rythme et fluidité : un débit naturel, des pauses et des variations de vitesse, plutôt qu'une élocution monotone
  2. Mimétisme : répondre avec empathie à un appelant frustré et avec chaleur à une bonne nouvelle
  3. Contexte : exploiter l'historique de l'utilisateur, les systèmes de l'entreprise et les repères culturels ou régionaux afin d'éviter les réponses génériques
  4. Identité : une voix réellement conçue pour la marque, et non un réglage par défaut standard

Démo : un agent à la voix naturelle en action

Scénario : un client appelle le restaurant Rosette pour modifier sa réservation. C'est son cinquième anniversaire de mariage et il est en retard.

Ce que montre la démo :

  • L'agent a commencé chaleureusement en reconnaissant l'anniversaire avant toute autre chose
  • Il a détecté un léger décalage entre l'heure de réservation annoncée et celle effectivement enregistrée, puis a demandé une clarification plutôt que de faire une supposition
  • Il a déplacé la réservation à 21 h et proposé spontanément une table près de la fenêtre pour l'occasion, sans y être invité
  • Tout au long de l'appel, l'agent a utilisé des pauses naturelles, des mots de remplissage et un ton adapté au moment : rassurant, chaleureux, sans précipitation

Pourquoi c'est important : rien de tout cela ne vient d'un autre modèle ou d'une plateforme plus performante. Tout vient du prompt. Le prompt système a autorisé l'agent à se corriger en milieu de phrase, à laisser sa phrase s'interrompre naturellement pendant qu'il « cherchait une information », et à adapter son ton émotionnel à celui de l'appelant : des techniques aujourd'hui accessibles à toutes les équipes qui développent sur la plateforme.

Sept leviers pour créer des agents naturels

  1. Balises émotionnelles - disponibles avec le mode expressif du modèle conversationnel v3 ; le principal levier de variation du ton
  2. Bruit de fond : ambiance de bureau, bruits urbains ou sons de frappe au clavier, pour un contexte plus familier et humain
  3. Ton dans le prompt système : c'est là que se joue l'essentiel de la différence
  4. Réglages d'empressement (rapide / normal / patient) : à adapter au temps nécessaire à l'interaction
  5. Dictionnaire de prononciation / mots-clés : pour les noms, les marques et les mots étrangers que l'agent prononcerait autrement mal. 
  6. Réglages de sortie : certaines équipes ajoutent délibérément des sonneries de téléphone en arrière-plan plutôt qu'un audio impeccable, car les clients venant d'un centre de contact traditionnel sont habitués à ce son légèrement étouffé
  7. Conception de voix ou clonage : créer une voix entièrement personnalisée, fidèle à la marque, plutôt que d'en choisir une prête à l'emploi. La conception de voix permet de décrire précisément ce que vous recherchez (par exemple, « un homme d'une trentaine d'années qui semble parler via un casque »). Clonage de Voix va d'un clone instantané (environ 30 secondes d'audio) à un clone professionnel (davantage de matériel, une fidélité supérieure). 

Bonnes pratiques pour des agents à la voix naturelle

Indiquez directement le ton dans le prompt système. C'est là que se joue l'essentiel de la différence entre un agent plat et un agent naturel. Autorisez explicitement l'agent à se corriger en milieu de phrase (« comme les gens parlent réellement »), à laisser sa phrase s'interrompre naturellement pendant qu'il cherche une information et à laisser un silence s'installer après un sujet sérieux avant de répondre.

Adaptez les balises émotionnelles au moment. Une balise « excited » ne convient pas à un moment sérieux ou délicat. Placez les balises de manière réfléchie là où elles apparaîtront réellement dans la conversation, et adaptez-les à l'état émotionnel de l'appelant au fil de l'échange (par exemple, calme et rassurant pour un appelant anxieux, ou rapide mais chaleureux pour une personne pressée).

Réglez l'empressement avec intention. Le mode rapide convient aux échanges dynamiques et riches en informations ; le mode patient est adapté lorsqu'une personne a besoin de temps pour retrouver un document ou un numéro. Utiliser systématiquement le mode rapide peut donner à l'agent un ton insistant plutôt que naturel.

Choisissez votre LLM pour chaque nœud. Réservez les modèles plus légers et rapides aux étapes de routage simples, et les modèles plus performants aux nœuds qui prennent de véritables décisions. 

Considérez la latence perçue comme un élément du caractère « naturel ». Au-delà du choix du modèle, la génération spéculative de tours de parole — qui permet au modèle de commencer à formuler une réponse pendant que l'appelant parle encore — et les mots de remplissage lors d'expirations de délai souples réduisent toutes deux la durée perçue d'une pause, même lorsque le temps de réponse réel ne change pas.

Localisez plutôt que de traduire. Choisissez des voix réellement entraînées dans la langue cible, utilisez un dictionnaire de prononciation et, pour les cas d'usage monolingues, envisagez de rédiger le prompt directement dans cette langue afin d'améliorer les performances. Multilingual v2 reste une option solide lorsque la faible latence entre les langues compte davantage que l'étendue expressive.

Surveillez votre agent. Utilisez des tests de simulation pour valider un agent sans appels réels, des critères d'évaluation pour attribuer un score de réussite ou d'échec après l'appel, ainsi qu'une analyse du sentiment à chaque tour de parole pour déterminer précisément où l'agent a adopté le mauvais ton dans une conversation, puis utilisez ce signal pour ajuster le prompt.

Regardez la session complète

Regardez le webinaire complet ici.

ElevenLabs workshop on building natural-sounding AI agents, hosted by Luigi Sambuy.

Articles similaires

Créez avec l'audio IA de la plus haute qualité