Conception de l’IA conversationnelle : comment créer des expériences utilisateur plus humaines
- Rédigé par
- Jack Limebear
- Publié
- Dernière mise à jour
ÉcouterÉcouter cet article
La conception d'IA conversationnelle consistait autrefois à construire un arbre de décision. Les premiers chatbots et menus SVI reposaient sur des embranchements rigides et préprogrammés : appuyez sur 1 pour la facturation, dites « oui » ou « non », et espérez que la question du client corresponde à l'un des parcours prévus. Ce modèle ne fonctionnait que tant que la conversation restait dans le cadre de ce que vous aviez déjà conçu.
Les agents IA ont levé cette contrainte. Ils peuvent désormais raisonner sur une conversation en temps réel, consulter une base de connaissances, appeler des outils et se souvenir de ce qui a déjà été dit. Ils ne sont donc plus limités à un script fixe.
Ce changement n'a toutefois pas supprimé le besoin de concevoir l'IA conversationnelle. Il a relevé les exigences. Sans script rigide sur lequel s'appuyer, la persona, le workflow et les points de décision d'un agent doivent être suffisamment bien définis pour fonctionner dans une conversation ouverte et en temps réel, plutôt que prédéterminée.
Ce guide explique concrètement ce que recouvre la conception d'IA conversationnelle pour le chat et les agents vocaux, pourquoi elle influe sur les indicateurs selon lesquels vous êtes déjà évalué, et ce que vous devez optimiser pour rendre l'échange plus naturel. Maîtrisez ces éléments pour déployer des agents IA qui créent un lien avec les clients et offrent un service plus rapide et plus efficace.
En résumé
- La conception d'IA conversationnelle définit la manière dont la communication d'un agent IA est structurée et optimisée afin de rendre la conversation naturelle.
- L'IA vocale tolère moins les imperfections que le texte : les problèmes de voix, de latence ou de synchronisation qui passent inaperçus dans une interface de chat peuvent donner une impression robotique à une conversation vocale.
- ElevenAgents rend possibles des agents IA vocaux et de chat plus humains grâce à des fonctionnalités qui vous permettent de contrôler la voix, la persona et le déroulement de la conversation, tout en optimisant la latence sur chaque canal.
Qu'est-ce que la conception d'IA conversationnelle ?
La conception d'IA conversationnelle est une pratique UX qui consiste à configurer le comportement d'un agent IA. Elle englobe sa persona, les garde-fous, les workflows et les bases de connaissances sur lesquels il s'appuie, afin que la conversation soit aussi soignée que tout autre aspect de l'expérience produit.
Cette configuration n'est toutefois pas identique partout. Les agents peuvent être déployés sur plusieurs canaux, comme le chat, la voix ou les SMS, à partir d'une seule configuration. Chacun impose ses propres contraintes, mais elles sont particulièrement fortes pour la voix. Lorsqu'elle constitue l'un des canaux de l'agent, celui-ci doit choisir et produire une voix, gérer le rythme et l'alternance des prises de parole en temps réel, puis répondre avant qu'un silence ne fasse croire que l'appel a été coupé. Rien de cela n'est facultatif comme cela peut l'être dans un chat, où une réponse légèrement lente ou imparfaite interrompt rarement l'échange.
Voici les éléments à prendre en compte pour mettre en œuvre une conception d'IA conversationnelle pour un agent de chat, ainsi que ce que la voix y ajoute.
Les clients n'évaluent pas consciemment chacun de ces facteurs. Ils remarquent simplement lorsqu'un élément semble décalé, et ce ressenti suffit à entamer leur confiance dans l'agent dans son ensemble, compromettant les objectifs pour lesquels vous l'avez déployé.
Pourquoi la conception d'IA conversationnelle est essentielle à une bonne expérience utilisateur
Tous les facteurs évoqués ci-dessus, de l'alternance des prises de parole à la latence et à la persona, influencent la perception de votre marque par le client à un moment clé, susceptible d'en faire un ambassadeur ou un détracteur. Cette perception se reflète directement dans les indicateurs sur lesquels les équipes sont évaluées.
- Satisfaction et taux de résolution plus élevés : les clients évaluent mieux une interaction lorsque l'agent répond rapidement et ne les interrompt pas maladroitement.
- Moins d'abandons : les clients quittent une conversation pour d'autres raisons que les longues attentes. Une prestation qui ne répond pas à leurs attentes, qu'il s'agisse d'un silence gênant lors d'un appel ou d'une réponse rigide et peu conforme à votre marque dans un chat, peut susciter le même réflexe de mettre fin à la conversation.
- Résolution plus rapide : des paramètres de déroulement de conversation clairs et des workflows bien structurés réduisent les impasses, les questions répétées et les situations du type « je vais vous transférer ».
- Moins d'escalades vers des agents humains : lorsqu'un agent gère naturellement le déroulement de la conversation et suit un workflow défini, il résout davantage de demandes dès la première tentative, au lieu de dérouter le client au point qu'il demande à parler à une personne.
Prenons l'exemple de eDreams ODIGEO, l'une des plus grandes plateformes de voyage en ligne au monde. L'entreprise a déployé des agents IA avec ElevenAgents dans cinq langues principales et a constaté une amélioration à deux chiffres de la vitesse de résolution ainsi qu'une réduction à deux chiffres du taux de transfert d'appels, notamment grâce à une synthèse vocale à faible latence et à une reconnaissance des intentions plus précise au début de chaque appel. De tels résultats dépendent de nombreuses variables au-delà de la seule conception de la conversation, mais ils illustrent ce que permet une conception d'IA conversationnelle efficace.
Comment fonctionne la conception d'IA conversationnelle dans ElevenAgents
Dans ElevenAgents, vous pouvez optimiser la persona, la voix, l'alternance des prises de parole, les transferts et la latence : autant de facteurs qui déterminent si un agent semble humain. Voici comment configurer et optimiser chacun d'eux afin que votre agent tienne son rôle dans une véritable conversation.
Persona et choix de la voix
La persona façonne la première impression du client, et un décalage entame la confiance avant même que la conversation ne commence. Pour une marque de distribution conviviale, une persona trop rigide peut amener les clients à douter de l'agent avant qu'il ait dit quoi que ce soit d'utile. Commencez à la définir dans le prompt système, où vous définissez le rôle, la personnalité et les garde-fous de l'agent avant toute autre chose.
Pour les agents vocaux, cette persona doit aussi s'exprimer dans la voix. Une voix trop décontractée pour un appel financier envoie le même signal qu'une persona inadaptée dans un échange écrit : le choix de la voix fait donc partie du même travail. Voici par où commencer :
- Choix de la voix : adaptez la voix à votre marque, votre audience et votre domaine. L'accent, le genre et le ton contribuent tous à établir la confiance avec chaque interlocuteur et à donner le ton de la conversation.
- Prise en charge multilingue : choisissez une voix pour chaque langue prise en charge, plutôt que d'utiliser une seule voix sur tous les marchés. Une même voix imposée à plusieurs langues paraît souvent étrangère dans au moins l'une d'elles, ce qui nuit à la confiance que vous cherchez à instaurer.
ElevenAgents vous donne accès à plus de 11 000 voix dans la Voice Library, où vous pouvez effectuer une recherche par accent, caractère et cas d'usage. Vous partez donc rarement de zéro. Si aucune ne convient, deux autres options s'offrent à vous : cloner une voix existante à partir d'un court échantillon audio ou en concevoir une de A à Z à l'aide d'un prompt textuel décrivant l'âge, l'accent, le ton et le rythme souhaités.
Paramètres de déroulement de la conversation
C'est dans la voix que la conversation est soumise au rythme le plus exigeant. Contrairement au chat, où une pause n'est qu'un espace vide, une rupture de rythme lors d'un appel est immédiatement perçue comme un silence ou une connexion coupée. Trouver le bon rythme est le principal levier pour qu'un agent vocal semble participer naturellement à la conversation, et cela commence par le modèle d'alternance des prises de parole.
Le modèle d'alternance des prises de parole d'ElevenLabs s'appuie sur la recherche pour détecter si un interlocuteur a réellement fini de parler, plutôt que de simplement marquer une pause. Il peut ainsi déterminer quand un agent doit répondre, au lieu de se fier à un délai fixe.
Vous pouvez également ajuster les paramètres suivants pour maîtriser le déroulement de la conversation :
- Délai avant la prise de parole : durée pendant laquelle l'agent attend en silence avant de répondre, afin de ne pas intervenir alors que le client réfléchit encore ni de le faire attendre une fois qu'il a fini.
- Délai souple : courte phrase de remplissage utilisée par l'agent pour combler un temps de traitement, comme « Un instant » ou « Je regarde », afin que le client ne pense pas que l'appel a été coupé. Évitez les formulations qui promettent un délai précis, comme « une seconde », car le temps de réponse réel varie.
- Interruptions : indique si l'agent cesse de parler lorsque le client lui coupe la parole. Activez cette option pour un échange naturel. Désactivez-la lorsqu'une information doit être délivrée intégralement, par exemple pour des mentions légales, des consignes de sécurité ou tout contenu qui doit être entendu dans son intégralité.
- Réactivité à la prise de parole : vitesse à laquelle l'agent intervient dès que le client cesse de parler. Le réglage « Réactif » convient au service client, où la rapidité des réponses est primordiale. « Patient » est préférable lors de la collecte d'informations client, telles qu'un numéro de téléphone ou une adresse e-mail, afin que l'agent ne coupe pas le client au milieu d'un chiffre. « Normal » constitue un bon réglage par défaut pour les conversations générales.
De petits ajustements peuvent avoir un effet considérable. Une légère modification du délai peut faire toute la différence entre un agent attentif et un agent qui semble couper la parole.
Workflow, conception des transferts et scripts
Les workflows permettent de mettre concrètement en œuvre une grande partie de la conception d'IA conversationnelle dans ElevenAgents. Ils définissent ce qui se passe et à quel moment : les points de décision, les parcours d'escalade, les transferts, tout ce qui serait autrement laissé à l'improvisation de l'agent.
Les workflows s'appuient sur deux autres systèmes pour affiner votre agent. Le prompt système définit le comportement fondamental de l'agent : son rôle, son ton, ce qu'il dira ou non, à des étapes clés telles que l'accueil ou les transferts. Les procédures offrent une option plus prescriptive pour une tâche unique et bien définie, comme vérifier l'identité d'un client ou traiter un retour. Au lieu d'emprunter différentes branches selon les propos du client, elles suivent une séquence fixe du début à la fin, étape par étape, quel que soit le déroulement de la conversation.
Pour commencer plus facilement à créer votre agent, utilisez des modèles d'agents prédéfinis, qui fournissent une base pour les workflows comme pour les prompts système : vous les affinez au lieu de tout construire de zéro. Voici quelques modifications à apporter pour les adapter à vos besoins :
- Cartographie des décisions : définissez précisément les actions de l'agent à chaque point de décision afin que toute la conversation soit structurée, de l'ouverture à la résolution. Les nœuds de sous-agents vous permettent d'ajuster le prompt système, le modèle ou même la voix à des moments précis du flux. Une étape de vérification sensible peut ainsi appliquer des garde-fous plus stricts qu'une conversation informelle au début de l'appel.
- Déclencheurs d'escalade : définissez des déclencheurs clairs pour transférer vers une personne, intégrés au workflow plutôt que laissés à la décision de l'agent sur le moment. Par exemple, prévoyez une escalade lorsqu'un problème reste non résolu après deux tentatives, que le client demande un responsable ou que la transaction est suffisamment sensible ou importante pour nécessiter l'intervention d'une personne.
- Contexte de transfert : dans le prompt système, définissez les informations que l'agent doit recueillir avant un transfert, comme un identifiant de commande ou un numéro de compte, ainsi que les conditions qui le déclenchent. Associez ensuite ces données enregistrées à la configuration de l'outil de transfert, afin qu'elles soient transmises automatiquement et que le client n'ait pas à les répéter à un conseiller humain.
- Formulations scriptées : définissez des formulations exactes pour les moments critiques dans le prompt système. Les formules d'accueil, messages d'erreur, mentions légales et transferts d'escalade ne doivent jamais être laissés à l'improvisation de l'agent. Une phrase précise comme « Je rencontre actuellement des difficultés pour accéder à ces informations » est plus fiable que de laisser l'agent deviner comment le formuler en cas de problème.
Le workflow est conçu sous la forme d'un graphe visuel dans ElevenAgents, où chaque point de décision et chaque déclencheur d'escalade est représenté par un nœud que vous pouvez voir et modifier directement.

Une fois l'agent en service, les analyses superposent les données issues de conversations réelles sur ce même graphe. Vous identifiez ainsi précisément les points où les clients se bloquent ou abandonnent, puis les corrigez sans tâtonner.
Latence et performances
La latence est l'un des principaux facteurs qui déterminent si une interaction semble humaine. Une réponse lente est l'un des moyens les plus rapides de rappeler au client qu'il parle à une machine, même si tout le reste de la conversation se déroule bien.
Chaque étape du pipeline ajoute sa propre latence, que l'agent fonctionne par chat ou par voix. Certaines s'appliquent dans les deux cas, d'autres seulement lorsque la voix entre en jeu.
- LLM : chaque choix de modèle implique un compromis entre coût, qualité du raisonnement et rapidité ; le bon équilibre dépend de la conversation. Les interactions simples et fréquentes, comme les FAQ ou les confirmations de rendez-vous, peuvent s'appuyer sur un modèle plus rapide et léger sans dégrader l'expérience. Pour des tâches plus complexes, comme le conseil financier ou la résolution de problèmes en plusieurs étapes, il est généralement pertinent d'opter pour un modèle au raisonnement plus robuste, même s'il répond un peu moins vite.
- Base de connaissances et RAG : chaque consultation de la base de connaissances ajoute un aller-retour avant que l'agent puisse répondre. Une base ciblée et concise répond donc plus vite qu'une base dans laquelle l'agent doit effectuer une recherche étendue.
- Intégrations et appels d'outils : chaque appel à un outil externe, comme la recherche d'une commande dans Salesforce ou la vérification de disponibilités dans un calendrier, ajoute son propre aller-retour. Rédigez des descriptions d'outils claires afin que l'agent n'hésite pas sur celui à appeler, et n'appelez que les outils réellement nécessaires à la conversation.
- Géographie et hébergement des données : alignez la région de votre agent ElevenAgents sur celle de l'hébergement de vos données et, pour les déploiements téléphoniques, sur celle de votre fournisseur de téléphonie (Twilio, SIP ou autre). Si la région de votre agent et celle de votre passerelle d'appels se trouvent aux extrémités opposées du monde, cet écart ajoute de la latence avant même le début de la conversation.
- Speech to Text (voix uniquement) : Scribe transcrit les propos du client avant que l'agent puisse les analyser. Utilisez la version en temps réel (Scribe v2 Realtime) pour les conversations en direct, plutôt que la version par lots, conçue pour privilégier la précision à la vitesse.
- Alternance des prises de parole (voix uniquement) : détermine si et quand l'agent décide de répondre, comme expliqué plus haut. Il est important de la considérer comme un facteur de latence à part entière : un modèle qui hésite à détecter la fin d'une prise de parole ajoute un délai avant même le début du reste du pipeline.
- Text to Speech et choix de la voix (voix uniquement) : les voix par défaut et synthétiques, ainsi que les Instant Voice Clones, répondent plus rapidement que les Professional Voice Clones. Utilisez les Professional Voice Clones uniquement lorsque leur fidélité supplémentaire justifie le compromis en matière de latence.
Pour approfondir la question de la latence, consultez les bonnes pratiques d'optimisation de la latence et découvrez comment la latence est mesurée et communiquée tout au long du pipeline.
Concevez votre premier agent avec ElevenAgents
Les leviers présentés ici illustrent concrètement ce que signifie la conception d'IA conversationnelle pour un agent IA. Tous sont intégrés à ElevenAgents et configurables depuis une console no-code : vous pouvez ainsi créer un agent capable de tenir une véritable conversation, et pas seulement de répondre correctement aux questions.
Pour les équipes qui souhaitent un accompagnement concret, les Forward Deployed Engineers d'ElevenLabs travaillent directement avec votre équipe pour définir le périmètre, créer et lancer un agent prêt pour la production, puis continuent d'en affiner les performances après sa mise en service.
Que vous le créiez vous-même ou fassiez appel à un accompagnement, le moyen le plus rapide de constater la différence reste de l'essayer. Commencez dès aujourd'hui en créant un agent ou en échangeant avec notre équipe commerciale.



