Aller au contenu

Notre cadre de sécurité à plusieurs niveaux pour les agents IA

Publié
Dernière mise à jour

ÉcouterÉcouter cet article

Alors que les agents IA prennent en charge des tâches à fort enjeu, les équipes doivent pouvoir compter sur un comportement sûr et prévisible de leurs agents. 

Dans ElevenAgents, nous nous appuyons sur une architecture de sécurité multicouche : guardrails à chaque étape d'une conversation, tests adversariaux avant le lancement, surveillance en production, protection des données et validation indépendante. 

Aucun système non déterministe ne peut éliminer tous les risques. Ce cadre de sécurité complet permet toutefois aux grandes entreprises et administrations qui s'appuient sur ElevenAgents de concevoir des agents qui échouent rarement, se rétablissent efficacement et répondent à des exigences élevées de sécurité.

Protection à chaque étape de la conversation

Activez et configurez facilement des contrôles qui protègent les trois étapes de chaque échange. C'est le fondement de Guardrails 2.0 dans ElevenAgents.

Entrée - Vérifications en temps réel de ce que l'utilisateur envoie.

  • Les guardrails de manipulation analysent indépendamment les entrées utilisateur et peuvent mettre fin aux conversations présentant des signes d'injection de prompt.

Décision - Comment l'agent est guidé et maintenu sur la bonne voie lorsqu'il décide de ses actions.

  • Les prompts système doivent inclure des instructions explicites pour l'agent, par exemple éviter les sujets inappropriés, définir la manière dont il se présente et limiter son champ d'action.
  • Les workflows et procédures peuvent soumettre les actions les plus sensibles à des appels d'outils, comme vérifier l'identité d'un appelant avant de communiquer des informations de compte.
  • Le guardrail Focus renforce les instructions système existantes et limite les dérives, un point particulièrement important lors d'interactions longues ou complexes.

Sortie - Des validateurs indépendants s'exécutent en parallèle de la génération des réponses, avec une latence minimale. Vous pouvez les activer pour bloquer les réponses contenant du contenu sensible ou ne respectant pas vos politiques.

  • Les guardrails de contenu filtrent les catégories sensibles selon des seuils définis pour chacune.
  • Les guardrails personnalisés appliquent des règles propres à chaque domaine, rédigées en langage naturel et évaluées individuellement par un modèle léger.
  • Les stratégies de sortie vous permettent de définir ce qui se passe lorsqu'un guardrail se déclenche : mettre fin à l'appel, transférer vers une personne ou réessayer la réponse avec des instructions correctives.

Tests rigoureux avant le lancement

ElevenAgents offre des fonctionnalités de test rigoureuses afin que les équipes qui s'appuient sur la plateforme puissent identifier et corriger les problèmes avant la mise en production d'un agent ou d'une modification de configuration.

Les simulations vous permettent d'exécuter une conversation complète à plusieurs tours avec un utilisateur simulé, avant toute interaction réelle. Vous définissez le scénario et le simulateur mène la conversation jusqu'à sa résolution, y compris avec des appels d'outils réels ou simulés. Puisque vous contrôlez l'utilisateur simulé, vous pouvez le rendre hostile ou manipulateur : le même mécanisme qui valide les parcours habituels met ainsi aussi à l'épreuve les parcours adversariaux.

Plusieurs fonctionnalités étendent cette couverture :

  • Les exécutions répétées exécutent un test à de multiples reprises et regroupent les échecs par cause pour faire ressortir les schémas d'erreur et les cas limites.
  • Les tests de réponse suivante et d'appel d'outil vérifient les réponses individuelles et les actions critiques.
  • Les tests spécifiques à chaque canal vérifient qu'un agent fonctionne comme prévu sur tous les supports où il est déployé, ses réponses pouvant être adaptées au canal, par exemple concises au téléphone et détaillées par e-mail.
  • Red teaming via l'API. Les tests peuvent également être exécutés via l'API à l'aide de SDK de red teaming.

Évaluer et améliorer les agents après leur lancement

Lorsque vous déployez vos agents, les évaluations s'exécutent en continu sur les conversations en direct. Grâce à une approche où un LLM fait office de juge, chaque appel peut être évalué automatiquement selon les critères que vous définissez. Consultez les résultats des conversations dans les dashboards et analysez les problèmes grâce à des journaux détaillés incluant des transcriptions consultables, les sources, les appels d'outils et les déclenchements de guardrails.

Les problèmes détectés en production peuvent facilement être intégrés à la suite de tests. Lorsqu'une modification est proposée, vous pouvez utiliser Experiments pour orienter une partie du trafic en direct vers une variante et mesurer les résultats réels avant de la généraliser.

Nous recommandons un déploiement progressif. Orientez une part limitée du trafic vers votre agent, évaluez ces conversations, puis, une fois son bon fonctionnement confirmé, étendez-le à d'autres cas d'usage, canaux ou régions.

Protection des données sensibles

Les agents peuvent traiter des données de paiement, des informations de santé et des identifiants personnels. Il est donc important de déterminer quelles données sont stockées, où elles le sont et pendant combien de temps. 

Nous proposons plusieurs mécanismes permettant à nos clients de protéger leurs données :

  • Zero Retention Mode peut être activé pour les services éligibles afin de garantir que certains types de données ne soient pas conservés, pour répondre aux exigences des environnements réglementaires les plus stricts.
  • La suppression des données sensibles de l'historique des conversations retire les entités sensibles après un appel et les remplace par des espaces réservés dans le texte et des signaux sonores dans l'audio, jusqu'au niveau de chaque type d'entité.
  • La rétention configurable adapte les durées de stockage à vos exigences réglementaires.
  • La résidence des données maintient le traitement dans la juridiction requise.
  • Les déploiements privés (VPC) isolent l'environnement pour les charges de travail hautement sensibles.
  • Le chiffrement protège les données en transit et au repos.

Protections au niveau de la plateforme et validation externe

Tous les éléments ci-dessus reposent sur nos protections au niveau de la plateforme, un programme complet couvrant la provenance des contenus, la détection des abus, l'application des règles d'utilisation interdite et le red teaming des modèles. Par l'intermédiaire de notre Safety Partnership Program, nous collaborons également avec des entreprises à la pointe de la sécurité de l'IA, en contribuant à leurs produits et aux normes émergentes du secteur.

Nous soumettons également notre approche à un examen indépendant, notamment au regard de normes générales de sécurité et de confidentialité telles que SOC 2 Type II, ISO 27001 et le RGPD, ainsi que de certifications propres à certains secteurs et cas d'usage, comme PCI DSS niveau 1 pour le traitement des paiements et HIPAA pour le secteur de la santé aux États-Unis. Consultez notre centre de confiance pour en savoir plus.

Nous respectons également des normes plus récentes, conçues pour l'IA, comme ISO 42001, qui régit les systèmes de management de l'IA, et AIUC-1 , qui exige que les agents IA résistent chaque trimestre à des simulations adversariales menées par des évaluateurs indépendants. Les capacités associées à AIUC-1 donnent également accès à certaines des premières polices d'assurance pour agents.

Pour les déploiements à grande échelle ou complexes, nos Forward Deployed Engineers travaillent aux côtés de votre équipe pour concevoir et mettre en œuvre votre stratégie d'agents, y compris la configuration, les guardrails, les tests, la surveillance et la stratégie de déploiement. 

Conclusion

Notre approche de la sécurité dans ElevenAgents repose sur plusieurs couches, dont chacune renforce les autres :

  • Configuration de l'agent : Prompts système, workflows et procédures qui façonnent le comportement, les actions les plus sensibles étant soumises à des appels d'outils.
  • Guardrails : Vérifications indépendantes à chaque étape : détection des manipulations à l'entrée, Focus lors de la décision, et validateurs de contenu et personnalisés à la sortie, avec des stratégies de sortie configurables.
  • Tests : Simulations adversariales, exécutions répétées, tests spécifiques à chaque canal et red teaming avant le lancement.
  • Surveillance : Déploiement progressif, suivi d'une évaluation continue, de journaux et transcriptions consultables, ainsi que d'une boucle de rétroaction après le lancement.
  • Protection des données : Suppression des données sensibles, Zero Retention Mode, rétention configurable, résidence des données, déploiements privés (VPC) et chiffrement.
  • Validation externe : Certifications, tests adversariaux indépendants d'AIUC-1, assurance pour agents, red teaming et accompagnement par des experts.

Articles similaires

Créez avec l'audio IA de la plus haute qualité