Découvrez Eleven v4Découvrez Eleven v4, notre modèle le plus expressif à ce jour. Avec 3× plus de crédits inclus avec Creator+ jusqu’au 12 octobre

Aller au contenu

Conception de l’IA conversationnelle : comment créer des expériences utilisateur plus humaines

Rédigé par
Jack Limebear
Publié
Dernière mise à jour

ÉcouterÉcouter cet article

La conception d’IA conversationnelle consistait autrefois à créer un arbre de décision. Les premiers chatbots et menus SVI reposaient sur des embranchements rigides, préprogrammés : appuyez sur 1 pour la facturation, dites « oui » ou « non », et espérez que la question du client corresponde à l’un des parcours prévus. Ce modèle ne fonctionnait que tant que la conversation restait dans le cadre que vous aviez déjà conçu.

Les agents IA ont supprimé cette contrainte. Ils peuvent désormais raisonner sur une conversation en temps réel, s’appuyer sur une base de connaissances, appeler des outils et mémoriser ce qui a déjà été dit. Ils ne sont donc plus limités à un script fixe.

Ce changement n’a toutefois pas supprimé le besoin de conception d’IA conversationnelle. Il a relevé les exigences. Sans script rigide sur lequel s’appuyer, la persona, le workflow et les points de décision d’un agent doivent être suffisamment définis pour fonctionner dans une conversation ouverte et en temps réel, plutôt que prédéterminée.

Ce guide explique ce que la conception d’IA conversationnelle implique réellement pour le chat et les agents vocaux, pourquoi elle compte pour les indicateurs sur lesquels vos performances sont déjà évaluées, et ce que vous devez optimiser pour la rendre plus naturelle. Maîtrisez ces éléments pour déployer des agents IA qui créent un lien avec les clients et offrent un service plus rapide et plus efficace.

En résumé

  • La conception d’IA conversationnelle désigne la manière dont la communication d’un agent IA est structurée et optimisée pour rendre une conversation naturelle.
  • L’IA vocale tolère moins les imperfections que le texte : des problèmes de voix, de latence ou de rythme, imperceptibles dans une interface de chat, peuvent rendre une conversation vocale robotique.
  • ElevenAgents permet de créer des agents IA vocaux et de chat à l’apparence humaine grâce à des fonctionnalités qui vous donnent le contrôle de la voix, de la persona et du flux conversationnel, tout en optimisant la latence sur chaque canal.

Qu’est-ce que la conception d’IA conversationnelle ?

La conception d’IA conversationnelle est une pratique UX qui consiste à configurer le comportement d’un agent IA. Elle couvre tout, de sa persona aux garde-fous, workflows et bases de connaissances sur lesquels il s’appuie, afin que la conversation soit aussi aboutie que toute autre partie de l’expérience produit.

Cette configuration ne se présente toutefois pas de la même façon partout. Les agents peuvent fonctionner sur plusieurs canaux, comme le chat, la voix ou les SMS, à partir d’une seule configuration. Chaque canal a ses propres contraintes, mais c’est pour la voix qu’elles sont les plus strictes. Lorsque la voix fait partie des canaux d’un agent, celui-ci doit choisir et produire une voix, gérer le rythme et les prises de parole en temps réel, puis répondre avant qu’un silence ne donne l’impression que l’appel a été coupé. Rien de cela n’est facultatif comme cela peut l’être dans un chat, où une réponse légèrement lente ou imparfaite interrompt rarement l’échange.

Voici les éléments à prendre en compte pour mettre en œuvre une conception d’IA conversationnelle pour un agent de chat, ainsi que ce que la voix y ajoute.

Feature
Chat
Voice
Latency
Small delays are unnoticeable, and there is often more time to think as users type their own answers.
Voice agents have almost no room for delay. A pause that's fine in a chat window reads as dead air on a call, and the customer assumes it dropped.
Persona
Comes through in font, color, and word choice.
Persona also has to come through in accent, pacing, and tone, since the customer hears it instead of reading it.
Conversation flow
Messages simply queue up. No turn-taking, interruption handling, or silence detection needed.
The agent has to decide, in real time, when the customer is done talking and when it’s safe to respond.
Language and accent
The agent just needs to detect and match the right language.
The agent also has to get the accent right, since language detection alone won't catch it.

Les clients n’évaluent pas consciemment chacun de ces facteurs. Ils remarquent simplement quand quelque chose ne va pas, et ce ressenti suffit à éroder leur confiance envers l’agent dans son ensemble, compromettant les objectifs pour lesquels vous l’avez déployé.

Pourquoi la conception d’IA conversationnelle est essentielle à une bonne expérience utilisateur

Tous les facteurs présentés ci-dessus, de la gestion des prises de parole à la latence et à la persona, influencent la perception de votre marque par le client à un moment clé, qui peut en faire un ambassadeur ou un détracteur. Cette perception se reflète directement dans les indicateurs sur lesquels les équipes sont évaluées.

  • Taux de satisfaction et de résolution plus élevés : les clients évaluent mieux une interaction lorsque l’agent répond rapidement et ne les interrompt pas de manière maladroite.
  • Moins d’abandons : les clients quittent une conversation pour bien d’autres raisons qu’une attente trop longue. Une réponse qui ne correspond pas à leurs attentes, qu’il s’agisse d’un silence gênant lors d’un appel ou d’une réponse rigide qui ne reflète pas la marque dans un chat, peut susciter le même réflexe de mettre fin à la conversation.
  • Résolution plus rapide : des paramètres clairs du flux conversationnel et des workflows bien cartographiés réduisent les impasses, les questions répétées et les moments du type « je vais vous transférer ».
  • Moins d’escalades vers des agents humains : lorsqu’un agent gère naturellement le flux conversationnel et suit un workflow défini, il résout plus souvent le problème dès la première tentative, au lieu de dérouter le client au point qu’il demande à parler à une personne.

Prenons l’exemple de eDreams ODIGEO, l’une des plus grandes plateformes de voyage en ligne au monde. L’entreprise a déployé des agents IA avec ElevenAgents dans cinq langues principales et a constaté une amélioration à deux chiffres de la vitesse de résolution ainsi qu’une baisse à deux chiffres des taux de transfert d’appels, notamment grâce à une synthèse vocale à faible latence et à une reconnaissance des intentions plus précise au début de chaque appel. Ces résultats dépendent de nombreuses variables au-delà de la seule conception conversationnelle, mais ils illustrent ce qu’une conception d’IA conversationnelle efficace rend possible.

Comment fonctionne la conception d’IA conversationnelle dans ElevenAgents

Dans ElevenAgents, vous pouvez optimiser la persona, la voix, les prises de parole, les transferts et la latence, soit les mêmes facteurs qui déterminent si un agent paraît humain. Voici comment configurer et optimiser chacun d’eux afin que votre agent joue pleinement son rôle dans une vraie conversation.

Persona et choix de voix

La persona façonne la première impression du client, et toute incohérence peut éroder la confiance avant même que la conversation ne commence. Une persona trop rigide pour une marque de vente au détail conviviale amène les clients à douter de l’agent avant qu’il ait dit quoi que ce soit d’utile. Commencez à la définir dans le prompt système, où vous définissez le rôle, la personnalité et les garde-fous de l’agent avant toute autre chose.

Pour les agents vocaux, cette persona doit également transparaître dans la voix. Une voix trop décontractée pour un appel financier envoie le même signal qu’une persona inadaptée à l’écrit : le choix de la voix fait donc partie du même travail. Voici par où commencer :

  • Choix de la voix : adaptez la voix à votre marque, votre audience et votre domaine. L’accent, le genre et le ton contribuent à instaurer la confiance avec chaque appelant et à donner le ton de la conversation.
  • Prise en charge multilingue : choisissez une voix pour chaque langue prise en charge, plutôt que d’utiliser par défaut une seule voix sur tous les marchés. Une même voix imposée dans plusieurs langues semblera souvent étrangère dans au moins l’une d’elles, ce qui fragilise la confiance que vous cherchez à établir.

ElevenAgents vous donne accès à plus de 11 000 voix dans la Voice Library, où vous pouvez effectuer une recherche par accent, caractère et cas d’utilisation : vous partez donc rarement de zéro. Si aucune ne convient, deux autres options s’offrent à vous : cloner une voix existante à partir d’un court échantillon audio ou en créer une de A à Z à l’aide d’un prompt texte décrivant l’âge, l’accent, le ton et le rythme souhaités.

Paramètres du flux conversationnel

C’est dans la voix que la conversation est soumise au rythme le plus strict. Contrairement au chat, où une pause n’est qu’un espace vide, une rupture de rythme lors d’un appel est immédiatement perçue comme un silence ou une connexion coupée. Bien gérer ce rythme est le levier le plus important pour qu’un agent vocal paraisse être un participant naturel à la conversation, et cela commence par le modèle de prise de parole lui-même.

Le modèle de prise de parole d’ElevenLabs est un système fondé sur la recherche, conçu pour détecter lorsqu’une personne a réellement fini de parler plutôt que lorsqu’elle marque simplement une pause. Il peut ainsi déterminer quand un agent doit répondre, sans se fier à un délai fixe.

Vous pouvez également ajuster certains paramètres pour optimiser le flux conversationnel :

  • Délai d’expiration du tour de parole : le temps que l’agent attend en silence avant de répondre, afin de ne pas intervenir alors que le client réfléchit encore ni le laisser sans réponse après qu’il a terminé.
  • Délai d’expiration souple : une brève phrase de transition utilisée par l’agent pendant une pause de traitement, telle que « Un instant » ou « Je vérifie », pour éviter que les clients ne pensent que l’appel a été coupé. Évitez les formules qui promettent un délai précis, comme « une seconde », car le temps de réponse réel varie.
  • Interruptions : détermine si l’agent cesse de parler lorsque le client l’interrompt. Activez cette option pour un échange naturel. Désactivez-la lorsque la transmission complète est essentielle, notamment pour les mentions légales, les consignes de sécurité et tout contenu qui doit être entendu dans son intégralité.
  • Réactivité lors de la prise de parole : définit la rapidité avec laquelle l’agent répond lorsque le client cesse de parler. Le mode « Réactif » convient au service client, où la rapidité compte le plus. Le mode « Patient » est préférable pour recueillir des informations telles qu’un numéro de téléphone ou une adresse email, afin que l’agent ne coupe pas le client au milieu d’un chiffre. Le mode « Normal » constitue un bon choix par défaut pour les conversations générales.

De petits ajustements peuvent faire une grande différence. Une légère modification du délai d’expiration peut suffire à distinguer un agent attentif d’un agent qui donne l’impression de couper la parole.

Workflow, conception des transferts et scripts

Les workflows sont le point où une grande partie de la conception d’IA conversationnelle se concrétise dans ElevenAgents. Ils définissent ce qui se passe et à quel moment : les points de décision, les parcours d’escalade, les transferts, tout ce qui serait autrement laissé à l’improvisation de l’agent.

Les workflows s’associent à deux autres systèmes pour affiner votre agent. Le prompt système définit le comportement central de l’agent, notamment son rôle, son ton et ce qu’il peut ou ne peut pas dire, à des moments clés comme les salutations ou les transferts. Les procédures constituent une option plus prescriptive pour une tâche unique et bien définie, comme vérifier l’identité d’un client ou guider un retour. Au lieu de se ramifier selon les propos du client, elles suivent une séquence fixe, du début à la fin, étape par étape, quelle que soit l’évolution de la conversation.

Le moyen le plus simple de commencer à créer votre agent consiste à utiliser des modèles d’agents prédéfinis, qui fournissent une base pour les workflows et les prompts système. Vous pouvez ainsi les affiner plutôt que de tout créer de zéro. Voici quelques modifications pour les adapter à vos besoins :

  • Cartographie des décisions : définissez précisément ce que l’agent fait à chaque point de décision, afin que toute la conversation soit structurée, de l’ouverture à la résolution. Les nœuds de sous-agents vous permettent d’ajuster le prompt système, le modèle ou même la voix à des étapes précises du flux. Une vérification sensible peut ainsi fonctionner avec des garde-fous plus stricts que les échanges informels du début de l’appel.
  • Déclencheurs d’escalade : définissez des déclencheurs clairs pour transférer vers un agent humain, intégrés au workflow plutôt que laissés à la décision de l’agent au moment de l’échange. Par exemple, déclenchez une escalade lorsqu’un problème reste non résolu après deux tentatives, lorsque le client demande un superviseur, ou lorsque la transaction est suffisamment sensible ou importante pour nécessiter une personne.
  • Contexte de transfert : dans le prompt système, définissez les informations que l’agent doit recueillir avant le transfert, comme un identifiant de commande ou un numéro de compte, ainsi que les conditions qui déclenchent ce transfert. Associez ensuite ces informations enregistrées à la configuration de l’outil de transfert, afin qu’elles soient transmises automatiquement et que le client n’ait pas à se répéter auprès d’un représentant humain.
  • Formulations scriptées : définissez des formulations exactes dans le prompt système pour les moments critiques. Les salutations initiales, les messages d’erreur, les mentions légales et les transferts d’escalade ne doivent jamais être laissés à l’improvisation de l’agent. Une phrase précise comme « Je rencontre actuellement des difficultés pour accéder à ces informations » est plus fiable que de laisser l’agent deviner comment la formuler en cas de problème.

Le workflow est conçu sous la forme d’un graphique visuel dans ElevenAgents, où chaque point de décision et déclencheur d’escalade est représenté par un nœud que vous pouvez voir et modifier directement.

Conversational AI design. Workflow interface for managing agent transfers and meetings in ElevenLabs platform.

Une fois l’agent en ligne, les analyses superposent les données de conversations réelles à ce même graphique. Vous voyez ainsi précisément où les clients se trouvent bloqués ou abandonnent, puis corrigez le problème sans tâtonner.

Latence et performances

La latence est l’un des principaux facteurs qui déterminent si une interaction paraît humaine. Une réponse lente est l’un des moyens les plus rapides de rappeler au client qu’il parle à une machine, même si tout le reste de la conversation se déroule bien.

Chaque composant du pipeline ajoute sa propre latence, que l’agent fonctionne par chat ou par voix. Certains s’appliquent dans les deux cas, tandis que d’autres ne concernent que la voix.

  • LLM : chaque choix de modèle implique un compromis entre coût, qualité du raisonnement et rapidité, et le bon équilibre dépend de la conversation. Les interactions simples et fréquentes, comme les FAQ ou les confirmations de rendez-vous, peuvent s’appuyer sur un modèle plus rapide et plus léger sans dégrader l’expérience. Pour des tâches plus complexes, comme le conseil financier ou le dépannage en plusieurs étapes, il vaut généralement la peine d’opter pour un modèle au raisonnement plus performant, même s’il répond un peu moins vite.
  • Base de connaissances et RAG : chaque recherche dans la base de connaissances ajoute un aller-retour avant que l’agent puisse répondre. Une base de connaissances concise et ciblée répond donc plus vite qu’une base que l’agent doit parcourir largement.
  • Intégrations et appels d’outils : chaque appel à un outil externe, par exemple pour rechercher une commande dans Salesforce ou vérifier des disponibilités dans un calendrier, ajoute son propre aller-retour. Rédigez des descriptions d’outils claires pour que l’agent n’hésite pas sur celui à appeler, et n’appelez que les outils réellement nécessaires à la conversation.
  • Géographie et hébergement des données : faites correspondre votre région ElevenAgents à celle où vos données sont hébergées et, pour les déploiements téléphoniques, à celle de votre fournisseur de téléphonie, qu’il s’agisse de Twilio, SIP ou autre. Si la région de votre agent et celle de votre passerelle d’appels se trouvent de part et d’autre du monde, cet écart ajoute de la latence avant même le début de la conversation.
  • Speech to Text (voix uniquement) : Scribe transcrit les propos du client avant que l’agent puisse raisonner. Utilisez la version temps réel, Scribe v2 Realtime, pour les conversations en direct plutôt que la version par lots, conçue pour privilégier la précision à la rapidité.
  • Prise de parole (voix uniquement) : détermine quand l’agent décide de répondre, comme expliqué en détail plus haut. Il faut aussi la considérer comme un facteur de latence à part entière : un modèle qui hésite à détecter la fin d’un tour de parole ajoute un délai avant même que le reste du pipeline ne commence.
  • Text to Speech et choix de voix (voix uniquement) : les voix par défaut et synthétiques, ainsi que les Instant Voice Clones, répondent plus vite que les Professional Voice Clones. Utilisez les Professional Voice Clones uniquement lorsque leur fidélité accrue justifie le compromis sur la latence.

Pour approfondir la latence, consultez les bonnes pratiques d’optimisation de la latence et la manière dont la latence est mesurée et communiquée dans l’ensemble du pipeline.

Créez votre premier agent avec ElevenAgents

Les leviers présentés ici illustrent concrètement ce que signifie la conception d’IA conversationnelle pour un agent IA. Tous sont intégrés à ElevenAgents et configurables depuis une console no-code, afin que vous puissiez créer un agent capable de tenir une vraie conversation, plutôt que de simplement répondre correctement aux questions.

Pour les équipes qui souhaitent un accompagnement concret, les Forward Deployed Engineers d’ElevenLabs travaillent directement avec votre équipe pour cadrer, créer et lancer un agent prêt pour la production, puis continuent d’affiner ses performances après sa mise en ligne.

Que vous le créiez vous-même ou fassiez appel à un accompagnement, le moyen le plus rapide de constater la différence est de l’essayer. Commencez dès aujourd’hui en créant un agent ou en réservant une démo.

Concevez un agent prêt pour la production avec notre équipe

Vous cherchez autre chose ? Consultez notre centre d'aide

FAQ sur la conception d’IA conversationnelle

Rédigé par

Jack Limebear fait partie de l’équipe Growth, où il rédige et conçoit des contenus pour le blog et les pages d’analyses. Avant de rejoindre ElevenLabs, il a passé plus de dix ans à piloter la stratégie de contenu pour des organisations allant de start-ups SaaS en forte croissance à des entreprises du Fortune 500. Il est titulaire d’un master en littérature anglaise de l’Université de Cambridge.

Articles similaires

Créez avec l'audio IA de la plus haute qualité