Comment Interagir avec un Système d'IA Conversationnelle
- Rédigé par
- Cindy Liu
- Publié
- Dernière mise à jour
ÉcouterÉcouter cet article
Aujourd’hui, les LLM sont devenus le cœur des systèmes d’IA conversationnelle. Plus précisément, les LLM permettent à l’IA conversationnelle — initialement fondée sur de vastes arborescences téléphoniques — d’intégrer des fonctionnalités dynamiques et d’offrir des expériences proches de l’humain. Toutefois, les LLM ne constituent pas une solution miracle : ils nécessitent des prompts spécialisés, car ils ne sont pas affinés par défaut pour la parole humaine.
Les développeurs commettent souvent la même erreur lorsqu’ils rédigent des prompts pour des LLM destinés à l’IA conversationnelle : ils reprennent les mêmes méthodes que pour former des employés humains. Cette stratégie, malgré son apparente simplicité, porte rarement ses fruits. Les LLM font des hypothèses différentes de celles des humains et leur ton comme leur périmètre par défaut se prêtent mal aux échanges oraux.
Nous allons voir ce que nous savons sur la manière de rédiger des prompts pour les LLM afin de créer des systèmes d’IA conversationnelle performants. Vous trouverez également un guide plus complet et technique sur le sujet dans la documentation développeur d’ElevenLabs.
L’ancien système
Avant les LLM, les systèmes d’IA conversationnelle s’appuyaient sur de vastes arbres logiques qui orientaient les demandes selon les entrées vocales. Cette configuration était répandue pour les numéros de service client, comme les lignes d’assistance des compagnies aériennes, et les systèmes de paiement, comme les services téléphoniques de cartes bancaires.
Ces anciens systèmes étaient lents, donnaient une impression robotique et n’acceptaient que des entrées humaines très limitées. Vous avez probablement déjà vécu cette situation : crier sèchement « OUI » dans votre téléphone pour répondre à une invite. Cette expérience médiocre poussait la plupart des utilisateurs à tenter de « déjouer le système » pour parler à un agent humain.
Ces arborescences téléphoniques présentaient toutefois un avantage : elles étaient circonscrites. Une conversation ne pouvait emprunter qu’un nombre limité de chemins, et les développeurs pouvaient facilement mettre en place des garde-fous pour ignorer les entrées non autorisées. Cette contrainte résume les avantages et les inconvénients des LLM : ils dépassent largement les limites des arborescences téléphoniques, mais ils sont aussi imprévisibles et ouvrent la boîte de Pandore à de nombreux écueils — promesses impossibles à tenir, colère envers les clients ou exposition de données sensibles, par exemple.
Les limites par défaut
Si les LLM sont simplement entraînés à partir d’un manuel initialement conçu pour des humains, leurs résultats resteront médiocres en raison de plusieurs lacunes fondamentales. Comprendre ces lacunes vous aidera à concevoir des prompts pour y remédier :
Décalage de ton
Les LLM sont entraînés par apprentissage par renforcement, où les retours humains les incitent à fournir des réponses structurées. Leurs réponses ont notamment tendance à être longues et remplies de listes à puces, d’encadrés et de titres.
Dans le contexte de l’IA conversationnelle, les LLM doivent toutefois reproduire le caractère concis et linéaire des échanges oraux.
Lacunes dans les hypothèses
Les LLM ont tendance à combler les inconnues par des connaissances déduites plutôt qu’à poser des questions. Ils risquent ainsi de faire des hypothèses erronées susceptibles d’induire les utilisateurs en erreur ou d’entraîner des erreurs coûteuses, comme des remboursements promis. Nous verrons plus loin comment une base de connaissances et des garde-fous permettent de mieux ancrer les LLM, afin d’éviter les promesses incorrectes et l’exécution d’actions non autorisées.
Latence
Les LLM peuvent appeler des fonctions par programmation, recueillir et écrire des données pour le compte d’humains. C’est généralement l’un de leurs principaux avantages, mais cela signifie aussi que les anciennes consignes de formation, qui permettaient aux agents téléphoniques de « gagner du temps » pendant l’exécution de tâches, ne sont plus nécessaires. Les appels de fonctions ne sont toutefois pas instantanés : les LLM doivent donc avertir précisément l’utilisateur lorsqu’un délai est prévu, par exemple : « Donnez-moi un instant pour examiner votre dossier. »
Configurations
Personnalité
Les LLM parviennent assez bien à adapter leur ton à un style donné. Un LLM peut être configuré pour paraître amical, humoristique, concis, formel, ou combiner plusieurs styles. C’est un paramètre important lors de la rédaction d’un prompt pour un LLM.
Par exemple, les développeurs d’une application d’IA conversationnelle de service client destinée à aider des clients mécontents d’une compagnie aérienne pourraient utiliser un prompt tel que :
Nicole
Format
Les LLM ont besoin d’instructions explicites sur la manière de répondre. Pour éviter qu’ils n’ajoutent du texte superflu, il convient de leur fournir une structure qui encadre la réponse transmise à l’utilisateur.
Par exemple, les LLM pourraient recevoir le prompt suivant :
Cette structure encourage le LLM à fournir une réponse conçue pour être prononcée à voix haute.
Les LLM peuvent toutefois rencontrer des difficultés avec des éléments qui ne se distinguent pas intuitivement d’un contenu écrit. Les nombres en sont un exemple courant : un LLM peut afficher un code postal tel que 10023, ce qui conduira le modèle de synthèse vocale à dire « dix mille vingt-trois ». Le LLM doit plutôt recevoir une instruction explicite pour énoncer les chiffres individuellement, en précisant leur signification, par exemple : « Le code postal est un zéro zéro deux trois. »
Température
La température est un paramètre déterminant lors de la configuration de LLM pour l’IA conversationnelle. Une température basse produit des réponses plus ciblées et déterministes, idéales pour les conversations orientées tâches, tandis qu’une température élevée génère des réponses plus créatives et variées.
Une température basse est idéale pour les systèmes d’IA conversationnelle qui privilégient des réponses cohérentes, comme une ligne de service client pour les remboursements. À l’inverse, pour les systèmes qui souhaitent offrir aux clients une expérience plus engageante et réaliste — comme un coach numérique —, une température élevée est préférable :
High Temperature: Hey hey! You've landed at ElevenLabs support—ready to tackle your tech troubles! What's on your mind?
Bases de connaissances
Pour les systèmes d’IA conversationnelle qui s’appuient sur de vastes réservoirs de connaissances, une base de connaissances permet de réduire la longueur du prompt. En production, cela passe généralement par une base de données vectorielle, telle que Pinecone ou Elasticsearch, ou par le dépôt de connaissances direct du fournisseur de LLM.
De manière générale, les bases de connaissances sont essentielles pour ancrer les réponses des LLM dans des informations factuelles et approuvées. Lors de la création d’un système d’IA conversationnelle, vous devez fournir au LLM une base de connaissances complète, contenant des informations exactes et à jour sur les produits, services, politiques et procédures. Cela évite au LLM d’halluciner ou d’inventer des informations, tout en favorisant des réponses cohérentes et fiables d’une conversation à l’autre.
Processus
Comme les LLM appellent souvent des fonctions pour le compte de l’utilisateur, ils doivent aussi connaître les informations précisément requises. Par exemple, si un LLM doit aider un utilisateur à prendre rendez-vous chez le coiffeur, il doit s’assurer de disposer des éléments suivants :
- Le nom de l’utilisateur
- La date et l’heure souhaitées
- L’adresse de l’utilisateur
- La prestation souhaitée par l’utilisateur
Une implémentation naïve pourrait amener le LLM à demander toutes les informations en un seul tour de conversation. Cela convient parfaitement par écrit, mais peut s’avérer écrasant à l’oral :
Customer: My name is Mathew and anytime Wednesday afternoon works. What else did you ask for?
Comme les informations sont généralement recueillies progressivement au fil de la conversation, les LLM doivent être encouragés à les obtenir étape par étape. L’expérience est alors beaucoup plus naturelle :
Customer: My name is Mathew Pregasen.
Support Agent: Thanks Mathew. When would you like to make an appointment?
Customer: Anytime on Wednesday afternoon works fine.
Support Agent: Great. Now can I get your address to find the nearest location?
Customer: 555 West Main Street
Support Agent: Perfect. Now what service are you look for?
Customer: I'm looking for a haircut and if you could also do my beard that would be great!
Garde-fous
Autorisations
Lorsque vous créez des systèmes distribués, vous partez du principe que votre serveur finira par tomber en panne. De même, lorsque vous créez des systèmes d’IA, vous devez supposer que votre LLM finira par commettre une erreur. Pour limiter les conséquences de cette erreur, accordez à ces systèmes uniquement les autorisations minimales nécessaires à la tâche. Voici quelques moyens d’y parvenir :
- Configurez correctement les autorisations de lecture et d’écriture : si le LLM doit uniquement lire des informations depuis une source de données, assurez-vous qu’un endpoint en lecture seule lui est attribué.
- Limitez l’accès aux endpoints d’API : si le LLM doit seulement accéder à certains endpoints, assurez-vous qu’il ne puisse en utiliser aucun autre.
- Escalades avec intervention humaine : si une action à haut risque doit être effectuée, envisagez un processus avec intervention humaine qui exige l’« approbation d’un responsable » avant son exécution.
Validation et vérification
Lors de la création de systèmes d’agents vocaux IA conversationnels qui exécutent des actions à l’aide d’outils, il est utile d’intégrer un processus de validation et de vérification afin de vous assurer que vous recueillez les bonnes informations auprès des utilisateurs. Aujourd’hui, lorsque vous échangez avec un agent humain, il répète les informations importantes que vous lui donnez afin de vérifier qu’il les a bien comprises et que le client ne s’est pas trompé. Les LLM bénéficieraient d’un niveau similaire de contrôle des erreurs :
Customer: 555 West Main Street
Support Agent: I got five five five west main street. Did I miss anything?
Pour la validation, toute information reçue du client doit être vérifiée par rapport à la structure habituelle de ce type d’information. Le numéro de téléphone comporte-t-il le bon nombre de chiffres ? L’âge communiqué par le client se situe-t-il dans une plage raisonnable ? Le client a-t-il fourni une adresse valide ?
Customer: 317-798-97289
Support Agent: I think I might have misheard you. I heard 11 numbers. Would you mind repeating that again?
Selon votre cas d’usage, vous pouvez vérifier toutes les informations reçues ou seulement celles qui n’ont pas passé la vérification. Vous pouvez également choisir de vérifier chaque information à mesure qu’elle est reçue ou de tout vérifier à la fin.
En conclusion
Rédiger efficacement des prompts pour un système d’agent IA conversationnel consiste à équilibrer les bonnes configurations et les bons garde-fous afin de créer une expérience qui reproduit l’échange avec un humain, avec davantage d’efficacité. Il ne suffit pas de reprendre d’anciens supports de formation pour rédiger un prompt destiné à un LLM : les LLM sont des outils qui nécessitent une structure et une stratégie spécialisées pour produire des résultats prévisibles et efficaces.

