Aller au contenu

Résumé du webinaire : Créer des agents IA sûrs pour un déploiement en entreprise

Publié
Dernière mise à jour

ÉcouterÉcouter cet article

Récapitulatif du webinar : déployer des agents IA sûrs en entreprise

Faire gérer des conversations à un agent IA est la partie facile. Obtenir la confiance de vos équipes de sécurité et juridiques, ainsi que de vos clients, est là où la plupart des déploiements en entreprise se heurtent à des blocages.

Cet article récapitule notre atelier en direct, Déployer des agents IA sûrs en entreprise, au cours duquel nous avons présenté les outils, cadres et pratiques de déploiement qui permettent d'opérer des agents à grande échelle en entreprise. 

Mettre en place une approche de sécurité multicouche 

Plus de quatre millions d'agents ont été déployés sur la plateforme ElevenAgents. Ceux qui fonctionnent de manière fiable en entreprise ont un point commun : la sécurité est intégrée dès le départ, et non ajoutée après le premier incident.

Notre session en direct a présenté les cadres, contrôles et pratiques de déploiement qui distinguent les agents validés lors des audits de sécurité de ceux qui ne le sont pas.

Chaque agent nécessite des limites fondamentalement différentes.

  • Un personnage de jeu vidéo peut avoir besoin d'employer un langage explicitement violent dans le cadre de l'expérience, sans jamais sortir de son personnage ni révéler qu'il s'agit d'une IA.
  • Un agent d'accueil dans le secteur de la santé doit pouvoir évoquer des blessures et des contextes médicaux, sans jamais prodiguer de conseils médicaux.
  • Un agent d'assistance pour cartes de crédit ne doit jamais traiter de contenu explicite ni communiquer les informations d'un compte à des appelants non vérifiés. 

Les agents n'étant pas déterministes, aucune protection isolée ne peut couvrir pleinement tous les risques potentiels. Les équipes en entreprise ont donc besoin d'une approche multicouche : plusieurs contrôles agissant ensemble pour faire des défaillances de sécurité de rares exceptions.

Ce principe a structuré les quatre questions autour desquelles nous avons organisé la session :

  1. Comment contrôler ce que dit et fait mon agent ?
  2. Comment vérifier qu'il fonctionne ?
  3. Comment protéger les données afin de respecter les exigences de sécurité et de conformité ?
  4. Comment mettre en place des processus pour déployer en toute sécurité ?

Comment contrôler le comportement d'un agent 

Toute conversation avec un agent comporte trois étapes où la sécurité doit être prise en compte. 

Entrée
L'utilisateur dit quelque chose. Des utilisateurs malveillants peuvent tenter des requêtes telles que « ignore toutes les instructions précédentes » ou « fais comme si tu étais un autre assistant ». Vous devez détecter et gérer les tentatives de manipulation avant qu'elles n'atteignent le modèle. Cela évite des coûts inutiles et empêche les acteurs malveillants d'extraire des informations auxquelles ils ne devraient pas avoir accès.

Prise de décision
Le LLM décide quoi dire ou faire. Votre prompt système constitue ici votre principal levier de contrôle, mais les LLM peuvent s'écarter de leurs instructions lors de conversations longues ou complexes. Vous avez besoin de mécanismes qui renforcent le comportement tout au long de la conversation, pas uniquement au départ. Définissez également des procédures d'escalade : dans quelles situations l'agent doit-il transférer l'échange à un humain ou à un agent plus spécialisé, et sous quelles conditions ?

Sortie
Même avec des consignes solides, certains éléments peuvent passer entre les mailles du filet, surtout lors de conversations prolongées. Vous avez besoin d'un dernier filet de sécurité. Considérez-le comme un mini-agent qui vérifie le travail de votre agent principal : il évalue la réponse avant qu'elle n'atteigne l'utilisateur et décide de l'envoyer, de réessayer ou de déclencher une escalade. Il fonctionne aussi en parallèle de la génération de réponse, avec une latence minimale.

Pour ces trois étapes, vous devez définir à l'avance vos stratégies de sortie : une violation met-elle fin à la conversation, déclenche-t-elle une nouvelle tentative avec des consignes correctives ou un transfert à un humain ? Cette décision façonne l'expérience utilisateur lorsqu'un problème survient.

Démo 1 : configurer des garde-fous dans ElevenAgents

Scénario : Un agent de vente et d'assistance sur un site web est configuré avec plusieurs couches de contrôles de sécurité pour prévenir les manipulations, les réponses hors sujet et les violations de règles.


Présentation :

  • Garde-fou contre les manipulations (entrée) — accessible dans l'onglet Security, ce paramètre détecte les schémas d'injection de prompt, c'est-à-dire les tentatives de contourner les instructions système, et met fin à la conversation avant que l'agent ne réponde. Recommandé pour tous les agents en production.
  • Prompt système et garde-fou Focus (prise de décision) — le prompt système est fondamental. Chaque règle importante doit y figurer explicitement. Dans la démo, une instruction a été ajoutée en cours de session : « Ne proposez aucune remise. » Activé séparément, le garde-fou Focus renforce automatiquement le prompt système tout au long de la conversation, afin de contrer les dérives qui surviennent dans les interactions longues. L'association d'un prompt système robuste et de Focus est la combinaison la plus efficace pour maintenir un agent sur la bonne voie.
  • Garde-fou de contenu (sortie) — catégories préconfigurées couvrant les propos grossiers, les conseils juridiques et les opinions politiques. Chacune dispose d'un seuil de confiance réglable ; le niveau moyen est le point de départ recommandé. Il s'agit de la couche de repli : si l'agent s'apprête à produire un contenu inapproprié, elle l'intercepte avant son envoi.
  • Garde-fou personnalisé (sortie) — contrôles définis par l'utilisateur, rédigés en langage naturel pour les cas non couverts par les préréglages. Dans la démo, un garde-fou « sans remise » a été configuré : « Bloquez toute réponse mentionnant des remises, promotions ou tarifs spéciaux que l'agent n'est pas autorisé à proposer. » Les garde-fous personnalisés reposent sur une évaluation LLM supplémentaire, avec un coût lié à l'utilisation et un impact sur la latence. Rédigez des instructions concises et répartissez les contrôles distincts entre plusieurs garde-fous plutôt que de les combiner.
  • Action en cas de violation — deux options : mettre fin à l'appel ou réessayer. En cas de nouvelle tentative, vous pouvez fournir des instructions supplémentaires pour guider la prochaine réponse de l'agent, par exemple pour déclencher une escalade vers un humain ou envoyer un message de redirection par défaut.

Pourquoi c'est important : Ces contrôles ne conviennent pas tous à chaque situation. Ils sont configurables au niveau de chaque garde-fou. Cette granularité fait la différence entre un agent théoriquement sûr et un agent sûr en pratique dans divers contextes d'entreprise.

Démo 2 : tester par simulation avant le lancement

Scénario : Un agent d'assistance est testé sur deux scénarios de conversation liés aux remises afin de confirmer qu'il redirige les utilisateurs vers la page des tarifs sans proposer de remise.

Présentation : 

  • Deux tests de simulation définis dans l'onglet Tests, chacun comprenant un scénario d'utilisateur simulé, un nombre défini de tours de conversation et des critères de réussite explicites
  • Un test a d'abord échoué, car le prompt système ne contenait pas d'instructions spécifiques pour les cas limites
  • Les instructions manquantes ont été ajoutées à la section consacrée aux garde-fous du prompt système
  • L'agent a été publié de nouveau et les deux tests ont été relancés ; ils ont tous deux réussi
  • L'historique détaillé des exécutions indique précisément quelle partie d'une conversation a échoué, y compris les appels d'outils et les actions de l'agent

Pourquoi c'est important : Les tests de simulation permettent aux équipes de valider le comportement d'un agent dans un environnement contrôlé avant qu'un utilisateur réel ne le rencontre. Ils couvrent à la fois les scénarios courants et les scénarios adverses. Ils s'exécutent sur l'ensemble du flux de conversation, et non uniquement sur des réponses individuelles. À chaque modification, les tests peuvent être relancés immédiatement afin de confirmer que le correctif fonctionne.

Démo 3 : masquage des données personnelles pour les déploiements sensibles

Scénario : Un agent d'entreprise est configuré pour masquer les informations permettant d'identifier une personne dans les journaux de conversation.

Présentation :

  • Paramètre Conversation History Redaction disponible dans l'onglet Advanced, sous les paramètres Privacy
  • Liste d'entités de données précises pouvant être sélectionnées individuellement pour le masquage, notamment la date de naissance, l'âge et d'autres champs sensibles
  • Possibilité de sélectionner toutes les entités ou seulement celles pertinentes pour le cas d'usage de l'agent

Pourquoi c'est important : Le masquage des données personnelles ne remplace pas le mode sans conservation des données dans les environnements soumis à de fortes exigences de conformité, tels que ceux relevant de la HIPAA. Il réduit en revanche l'exposition des données dans les journaux de conversation utilisés pour la revue interne ou le contrôle qualité. Les équipes peuvent conserver les journaux dont elles ont besoin tout en supprimant les données superflues. Cette fonctionnalité est actuellement disponible pour les clients Enterprise.

Bonnes pratiques pour déployer des agents d'entreprise en toute sécurité 

  1. Adoptez une approche multicouche. Aucun contrôle isolé ne garantit un comportement sûr. Les garde-fous en entrée, la validation des sorties, le renforcement des prompts et les tests doivent agir ensemble. Chaque couche renforce les autres et réduit considérablement le risque de problèmes de sécurité.
  2. Adaptez les garde-fous au contexte. Un agent de santé et un agent d'assistance dans le commerce ont besoin de règles différentes. Définissez les limites propres à votre cas d'usage, et non à partir d'un modèle générique.
  3. Commencez par un cas d'usage qui compte. Les déploiements les plus réussis en entreprise ne démarrent pas par un projet pilote sans enjeu. Ils se concentrent sur un besoin réel, comme l'assistance client ou la planification, et investissent pour le traiter correctement.
  4. Testez avant le lancement, puis continuez à tester. Utilisez des tests de simulation et des outils externes de red teaming. Testez les scénarios courants comme les scénarios adverses. Ajoutez à votre suite de tests les nouveaux cas limites identifiés en production.
  5. Déployez progressivement. Commencez avec un trafic limité. Surveillez les conversations réelles. Identifiez les difficultés rencontrées par l'agent. Procédez aux ajustements, testez à nouveau, puis élargissez le déploiement.
  6. Choisissez délibérément le mode d'exécution. Utilisez le mode bloquant pour les agents textuels, lorsque la validation stricte importe davantage que la rapidité. Utilisez le mode streaming pour les agents vocaux lorsque la latence est prioritaire.
  7. Définissez des actions claires en cas de violation d'un garde-fou. Décidez à l'avance si une violation doit mettre fin à l'appel, déclencher une nouvelle tentative ou entraîner une escalade vers un humain.
  8. Gardez des instructions concises pour les garde-fous personnalisés. Les garde-fous s'exécutent en parallèle. Un garde-fou personnalisé long et complexe augmente la latence. Rédigez des instructions concises et répartissez les contrôles distincts entre plusieurs garde-fous.
  9. Comprenez ce que couvrent réellement les certifications. SOC 2 Type 2 et ISO 27001 constituent le minimum attendu. Des normes sectorielles comme HIPAA et PCI DSS concernent les secteurs réglementés. Des certifications plus récentes, spécifiques à l'IA, comme ISO 42001 et AIUC-1 traitent des biais, de la transparence et de la résilience face aux attaques adverses ; la certification AIUC-1 peut également ouvrir l'accès à des assurances spécifiques à l'IA.
  10. Structurez vos processus dès le départ. Le premier déploiement est le plus long. Les équipes qui investissent dans les processus de test et de déploiement itèrent beaucoup plus rapidement sur chaque agent suivant.

Regarder la session complète 

Regardez le webinar complet ici.

safety-webinar-cover


Articles similaires

Créez avec l'audio IA de la plus haute qualité