Aller au contenu

Mesurer l’IA conversationnelle : les indicateurs essentiels de réussite

Rédigé par
Jack Limebear
Publié
Dernière mise à jour

ÉcouterÉcouter cet article

Les outils d’IA conversationnelle réduisent considérablement le coût d’un service client disponible 24 h/24. Sans devoir assurer des horaires de nuit ni prendre les risques liés à la confidentialité des données qu’implique l’externalisation de postes à l’étranger.

Mais ces économies ne comptent que si un agent IA peut résoudre les problèmes des clients. Mesurer l’IA conversationnelle à l’aide des bons indicateurs clés de performance permet de vérifier son efficacité, surtout pour les entreprises qui traitent un grand volume de demandes clients.

Cet article explique comment l’évaluation du flux conversationnel et de l’exactitude des réponses protège à la fois l’expérience client et votre marque. Nous montrons comment les équipes chargées de l’expérience client mènent des tests A/B efficaces sur les messages d’accueil des appelants. Vous découvrirez également comment maintenir une plateforme d’IA conversationnelle fiable et multilingue.

Overview of 10 conversational AI metrics, targets, and how latency affects satisfaction.

Résumé

  • Mesurer systématiquement l’IA conversationnelle selon des indicateurs de qualité, d’expérience et d’exploitation fournit les données nécessaires pour protéger l’expérience client.
  • Les outils d’évaluation automatisés suivent et améliorent en continu les indicateurs d’IA conversationnelle à grande échelle, tandis que des équipes humaines effectuent régulièrement des contrôles ponctuels.
  • Isoler une seule variable à la fois lors des tests A/B permet d’identifier précisément ce qui n’a pas fonctionné et de déployer des correctifs qui ciblent directement les problèmes détectés.
  • L’amélioration continue est indispensable, car les entreprises d’IA mettent fréquemment à jour les modèles sous-jacents, ce qui amène souvent des chatbots auparavant fiables à se comporter différemment en production.

Ce que signifie mesurer l’IA conversationnelle et pourquoi c’est important

Mesurer l’IA conversationnelle consiste à évaluer systématiquement la capacité de vos agents IA testés ou déployés à traiter les demandes des clients et à résoudre leurs problèmes. L’objectif est de déterminer l’efficacité avec laquelle vos systèmes automatisés gèrent les conversations à plusieurs tours dans des conditions réelles, selon les normes de performance que vous définissez. Ces normes reflètent généralement la capacité des modèles à comprendre l’intention de l’utilisateur, à respecter votre identité de marque, à fournir des réponses exactes et à résoudre le problème.

L’évaluation des modèles peut sembler représenter beaucoup de travail supplémentaire pour un système destiné à réduire la charge de votre équipe. Pourtant, sans évaluation régulière, il est difficile de savoir comment le modèle fonctionne dans des cas d’usage réels. En d’autres termes, vous savez que votre système d’IA réduit les coûts d’exploitation du service client, mais pouvez-vous confirmer qu’il satisfait vos clients plutôt que de les pousser à chercher d’autres solutions ?

Une mesure complète exige d’examiner le modèle selon trois grandes catégories :

  • Qualité : Évaluez l’exactitude, la cohérence et la pertinence des réponses de l’IA à partir de la demande initiale de l’utilisateur. La question centrale est la suivante : l’IA fournit-elle les bonnes réponses aux utilisateurs, ou hallucine-t-elle et commet-elle des erreurs ?
  • Expérience : Évaluez l’expérience client : l’IA a-t-elle répondu rapidement et combien de tours lui ont été nécessaires pour apporter une réponse satisfaisante ? La question centrale est la suivante : l’expérience paraît-elle naturelle et utile pour l’utilisateur, ou robotique et frustrante ?
  • Exploitation : Déterminez si le système fonctionne de manière fiable et demeure une solution rentable pour vos besoins de service client. Parmi les principales questions : le système offre-t-il une disponibilité élevée et génère-t-il le retour sur investissement nécessaire pour justifier son utilisation ?

La réussite prend une forme différente pour chaque équipe, et les difficultés rencontrées avant l’automatisation du support jouent un rôle déterminant. Par exemple, si votre équipe avait initialement du mal à maintenir un service client disponible 24 h/24 et 7 j/7, la disponibilité permanente des agents IA améliore facilement les performances du service client. Toutefois, chacune de ces catégories contribue à la réussite globale : un système toujours en ligne et rarement indisponible apporte peu aux clients s’il paraît robotique et hallucine des réponses.

Conversational AI should be measured by quality, experience, and operations—not one alone.

Indicateurs clés d’IA conversationnelle à suivre

Suivez des chiffres clairs et exploitables pour évaluer les performances des agents auprès des clients et déterminer si votre implémentation actuelle génère une réelle valeur commerciale. L’évaluation continue facilite aussi les améliorations régulières. Lorsque vous identifiez précisément les goulots d’étranglement de votre flux de travail ou les ajustements nécessaires, vous disposez des données pour traiter efficacement la cause profonde.

Utilisez ces indicateurs d’IA conversationnelle comme point de départ pour évaluer les appels vocaux et les performances des chatbots :

  • Taux de traitement automatisé : Suivez le pourcentage de demandes entièrement résolues dans le canal automatisé. Les objectifs varient selon le secteur, le contexte, les cas d’usage et le type de bot. Par exemple, 60 à 80 % est une norme assez courante dans le commerce de détail, tandis que les chiffres se situent entre 40 et 60 % pour les sites de voyage.
  • Taux d’escalade : Mesurez la fréquence à laquelle les agents IA gèrent les appels sans les transférer à un humain. Les entreprises proactives définissent des seuils automatiques pour transférer les appels dès que le sentiment devient négatif. Un bon taux d’escalade varie selon le secteur et la complexité de la tâche, mais visez 15 à 30 %.
  • Taux d’erreur sur les mots (WER) : Suivez la capacité de l’IA à « entendre » correctement les mots pendant un appel ou une transcription. Une bonne référence sectorielle est de 5 %, mais vous avez besoin d’un WER inférieur pour les cas d’usage dans des secteurs réglementés ou traitant des informations sensibles, comme la santé, la finance et le droit.
  • Exactitude de la reconnaissance d’intention : Au-delà des seuls mots, la performance d’un agent IA repose d’abord sur la compréhension précise du problème de l’utilisateur et de ses besoins. Les objectifs d’exactitude varient selon le cas d’usage et les catégories d’intention.
  • Exactitude des réponses : Déterminez avec quelle fiabilité le modèle fournit des réponses véridiques et pertinentes. C’est essentiel pour permettre aux clients de résoudre leurs problèmes. Les demandes générales de service client exigent 80 % ou plus, mais les cas d’usage sensibles, comme les paiements, nécessitent 99 % ou plus.
  • Taux d’hallucination : Étroitement lié à l’exactitude des réponses, ce taux mesure plus précisément l’exactitude factuelle des réponses au regard de la base de connaissances. Un faible taux d’hallucination est essentiel pour garantir l’utilité des réponses et empêcher les modèles de faire des promesses que l’entreprise ne peut pas tenir. 
  • Satisfaction client (CSAT) : Recueillez le sentiment des clients au moyen d’enquêtes après appel pour déterminer leur satisfaction. Les entreprises collectent ces données sur une échelle de cinq points, mais expriment souvent les résultats en pourcentage. Selon SurveyMonkey, de bons scores CSAT commencent généralement autour de 70 %, certaines entreprises visant 80 % ou plus.
  • Score d’opinion moyen (MOS) : Cet indicateur centré sur l’humain utilise également une échelle de cinq points, mais vise à mesurer le caractère naturel de la réponse de l’IA et la clarté de la voix synthétique. Visez un MOS d’environ 4,3 à 4,5.
  • Latence vocale de bout en bout : Mesurez le délai total entre la fin de la demande d’un utilisateur et le début de la réponse de l’agent. Les agents prêts pour la production visent un délai de bout en bout jusqu’au premier audio (TTFA) inférieur à 500 millisecondes. Le modèle ElevenLabs Flash v2.5 atteint actuellement une latence d’inférence interne de environ 75 ms. La latence réelle de bout en bout varie selon des facteurs tels que votre localisation et le type d’endpoint utilisé.
  • Coût par conversation : Mesurez le coût total d’exploitation de chaque interaction client automatisée par rapport aux échanges gérés par des humains. Les conversations ElevenLabs commencent à 10 centimes par minute, tandis que le salaire horaire moyen des conseillers du service client suggère que les conversations humaines coûtent environ 32 centimes par minute. Cela représente une économie d’environ 70 %, bien que les tarifs puissent varier selon l’offre et l’utilisation. Consultez la page des tarifs d’ElevenLabs pour connaître les tarifs en vigueur.

Lorsque vous choisissez les indicateurs qui serviront à mesurer les performances de votre modèle, tenez compte des domaines les plus importants pour votre secteur et votre modèle économique. Par exemple, l’exactitude et la factualité sont particulièrement importantes dans la banque et pour les informations patients, tandis que la latence, le MOS et les taux d’escalade sont essentiels pour les entreprises qui privilégient l’expérience client. 

Notez que certains indicateurs révèlent les causes profondes d’autres indicateurs. Par exemple, une latence élevée entraîne probablement un faible score MOS, puis une faible satisfaction client exprimée par le CSAT.

Comment mesurer l’exactitude de l’IA conversationnelle

Mesurez l’exactitude du modèle en constituant un jeu de test de référence à partir d’environ 500 à 1 000 conversations historiques réelles. Les journaux réels capturent les formulations naturelles et imparfaites que les données synthétiques omettent souvent, comme les fautes de frappe, l’argot et les erreurs des utilisateurs. Évaluez ensuite votre système sur ces journaux réels selon la reconnaissance d’intention, l’exactitude des réponses et le taux d’hallucination.

Effectuez des évaluations automatisées de ces interactions à l’aide d’une méthode de notation où un LLM joue le rôle de juge. Validez toutefois toujours les scores automatisés par rapport à des systèmes annotés par des humains afin de vérifier leur cohérence. Des évaluateurs humains effectuent ensuite des contrôles ponctuels hebdomadaires des performances du chatbot selon une grille simple à trois niveaux :

  • Correct : La réponse est factuelle, pertinente dans son contexte et satisfait directement l’intention principale de l’utilisateur.
  • Acceptable : La réponse est techniquement correcte et utile, mais présente quelques problèmes stylistiques mineurs, des formulations maladroites ou une mise en forme qui ne respecte pas l’identité de marque.
  • Incorrect: La réponse doit être corrigée immédiatement, car elle contient des erreurs factuelles, des hallucinations importantes ou interprète totalement mal l’intention de l’utilisateur.

Dans l’idéal, évaluez le modèle par intention, car les agents IA sont performants dans certains contextes et échouent nettement dans d’autres. Les chiffres agrégés peuvent masquer des faiblesses critiques derrière des domaines très performants.

Nous avons simplifié ce flux de travail en intégrant les tests Next Reply (Scenario) directement à nos tests ElevenAgents. La fonctionnalité Next Reply évalue le message de suivi envoyé par un agent plutôt que l’intégralité de la conversation à plusieurs tours. Vous fournissez toutefois l’historique du chat jusqu’au point d’évaluation et notez la réponse selon les normes de politique, de ton et de qualité.

Comment tester les réponses d’IA conversationnelle par A/B testing

Les tests A/B recueillent des retours réels pour éviter de deviner les préférences des clients. Vous utilisez ensuite ces données empiriques pour affiner les performances du modèle IA. Après avoir suivi les indicateurs, votre équipe a probablement une liste de modifications ou d’expériences à mener. Or, modifier plusieurs éléments en même temps rend difficile l’identification de ce qui a fonctionné ou non.

Un test valide exige donc d’isoler une variable spécifique à la fois, tout en maintenant le reste de la base de connaissances sous-jacente constant. Les éléments susceptibles de varier incluent :

  • Message d’accueil : Modifiez le message d’accueil initial avec une formulation précise, comme « Bonjour. Vous avez du mal à choisir un produit ? », plutôt que de dire simplement « Bonjour, comment puis-je vous aider ? »
  • Voix : Les clients peuvent réagir plus favorablement à certaines voix selon les circonstances, en fonction de caractéristiques masculines ou féminines, du ton, de l’intonation et même de l’accent.
  • Routage des modèles : Les modèles très performants coûtent généralement plus cher ; une approche efficace et rentable consiste donc à orienter les demandes complexes et simples vers les modèles appropriés.
  • Prompt : Les prompts comportent plusieurs composants : ne modifiez qu’un aspect à la fois, tel que le contexte, l’objectif, le style, le ton, l’audience ou le modèle de réponse (CO-STAR).

Les équipes doivent également adapter la durée des tests. Le trafic conversationnel est généralement bien inférieur au nombre de visites d’une page web : vous devrez donc mener le test pendant plusieurs semaines plutôt que quelques jours pour atteindre une significativité statistique. Si votre volume est très faible, testez des changements importants plutôt que de légers ajustements.

Un flux de travail opérationnel exige aussi des outils de versionnage des agents, de comparaison et de restauration. Nous les avons intégrés directement à ElevenAgents. 

Measuring conversational AI A/B testing guide for conversational AI: greeting copy, voice, model routing, and prompts.

Comment tester un agent d’IA conversationnelle avant son déploiement

Le service client constitue un point de contact direct avec les personnes qui influent sur vos résultats, et l’IA réagit parfois de façon imprévisible à de petits changements. Testez donc toujours un agent d’IA conversationnelle nouveau ou modifié avant de le lancer en production. Un simple « test au feeling » ne suffit pas.

Nous avons conçu notre framework de test ElevenAgents autour de trois principaux types de tests, qui ciblent des niveaux spécifiques de votre pipeline d’IA conversationnelle :

  • Test de simulation : Exécute une conversation complète à plusieurs tours avec un utilisateur simulé afin de confirmer que le dialogue atteint les niveaux de performance souhaités.
  • Test Next Reply : Teste uniquement les réponses immédiates de l’agent au regard de contraintes précises de ton, de politique ou autres, afin de confirmer leur pertinence et leur exactitude.
  • Test d’appel d’outil : Vérifie que les agents appellent correctement les API connectées et transmettent les paramètres exacts nécessaires aux recherches ou transferts critiques dans les bases de données.

Face au nombre d’attaquants qui cherchent à contourner les garde-fous des modèles à des fins malveillantes, vous avez également besoin d’une couche de tests adversariaux avant la mise en production. Collaborez avec les équipes QA, les ingénieurs prompt et les professionnels de la cybersécurité spécialisés en red team pour tester les injections de prompts, les sollicitations hors sujet et les tentatives de contournement des règles.

Enfin, procédez à un déploiement progressif en lançant des versions pilotes auprès d’un petit groupe d’utilisateurs et en surveillant leur comportement en conditions réelles. Définissez des critères stricts que le modèle doit satisfaire avant de le diffuser à un groupe plus large ou à l’ensemble de votre clientèle. Désignez une personne unique responsable de superviser la mise en production et prévoyez un moyen de revenir en arrière si un ajustement entraîne une baisse des indicateurs de performance.

Pre-deployment tests: simulation, next reply, tool calls, and adversarial testing.

Évaluer les performances des chatbots en production

Avant de lancer votre modèle d’IA conversationnelle, définissez ce qui constitue une réussite pour chaque cas d’usage. C’est particulièrement important pour les applications dans des secteurs fortement réglementés, où l’exactitude et la confidentialité des données sont soumises à des exigences et des critères plus élevés.

Les réponses automatisées facilitent les tests A/B de modèles à grande échelle, mais une évaluation objective nécessite de les associer à une lecture ponctuelle des transcriptions et aux retours de testeurs humains. Les humains dans la boucle détectent les nuances conversationnelles que les modèles IA ne perçoivent pas et les particularités des données qui se perdent autrement dans les chiffres agrégés. Une stratégie d’évaluation complète inclut également l’analyse des sentiments et les retours directs des utilisateurs.

L’amélioration continue distingue davantage les systèmes matures qui génèrent un fort retour sur investissement. Là où d’autres solutions traitent les tests et la surveillance comme des tâches distinctes, un pipeline mature les réunit. Les échecs en production alimentent alors directement votre jeu de test afin d’entraîner l’agent optimisé suivant.

Des ajustements réguliers deviennent également nécessaires lorsque les entreprises d’IA mettent à jour les modèles de base sur lesquels s’exécute votre agent. Ce changement peut amener un prompt auparavant efficace à contribuer soudainement à des réponses peu fiables, voire inappropriées.

Nous avons intégré cette boucle de rétroaction directement à notre plateforme. Utilisez nos outils d’analyse des conversations pour automatiser la collecte de données structurées et évaluer facilement le sentiment. Les grandes organisations utilisent également notre infrastructure d’IA conversationnelle pour les entreprises pour surveiller et faire évoluer leurs agents à l’échelle mondiale en toute confiance.

Utilisez ElevenAgents pour suivre les indicateurs de votre service client

Déployer avec succès l’IA conversationnelle à grande échelle exige plus que des voix de haute qualité et des modèles à faible latence. Vous avez besoin d’un écosystème intégré pour concevoir, créer, tester, déployer et ajuster des flux de travail multi-agents.

ElevenAgents vous fournit l’infrastructure évolutive dont vous avez besoin. Votre équipe accède à des outils tels que la vérification Next Reply, le suivi des sentiments et la collecte automatique de données pour surveiller et optimiser continuellement les modèles afin d’obtenir les meilleurs résultats. Mieux encore, vous détectez les régressions avant qu’elles n’atteignent vos clients.

Prêt à simplifier la mesure de l’IA conversationnelle ? Découvrez nos fonctionnalités de test des agents et voyez comment nos équipes entreprises déploient des agents fiables qui améliorent les indicateurs de votre service client. 

En savoir plus sur ElevenAgents ou s’inscrire pour commencer dès aujourd’hui.

Questions fréquentes sur la mesure de l’IA conversationnelle

Articles similaires

Créez avec l'audio IA de la plus haute qualité