Découvrez Eleven v4Découvrez Eleven v4, notre modèle le plus expressif à ce jour. Avec 3× plus de crédits inclus avec Creator+ jusqu’au 12 octobre

Aller au contenu

Notre cadre de sécurité à plusieurs niveaux pour les agents IA

Publié
Dernière mise à jour

ÉcouterÉcouter cet article

Alors que les agents IA prennent en charge des tâches critiques, les équipes doivent avoir la certitude qu’ils se comporteront de manière sûre et prévisible. 

Dans ElevenAgents, nous nous appuyons sur une architecture de sécurité multicouche, qui associe des garde-fous à chaque étape d’une conversation, des tests adversariaux avant le lancement, une surveillance en production, la protection des données et une validation indépendante. 

Aucun système non déterministe ne peut éliminer tous les risques. Ce cadre de sécurité complet permet toutefois aux grandes entreprises et administrations qui développent avec ElevenAgents de concevoir des agents qui échouent rarement, se rétablissent efficacement et répondent à des exigences élevées de sécurité.

Une protection à chaque étape de la conversation

Vous pouvez facilement activer et configurer des contrôles qui protègent les trois étapes de chaque échange. C’est le fondement de Guardrails 2.0 dans ElevenAgents.

Entrée : vérifications en temps réel de ce que l’utilisateur envoie.

  • Les garde-fous contre la manipulation analysent indépendamment les données saisies par l’utilisateur et peuvent mettre fin aux conversations présentant des signes d’injection de prompt.

Décision : comment l’agent est guidé et reste sur la bonne voie lorsqu’il décide quoi faire.

  • Les prompts système doivent inclure des instructions explicites pour l’agent, par exemple éviter les sujets inappropriés, définir la manière dont l’agent se présente et limiter son périmètre.
  • Les workflows et procédures peuvent conditionner les actions les plus sensibles à des appels d’outils, par exemple vérifier l’identité d’un appelant avant de communiquer des informations de compte.
  • Le garde-fou Focus renforce les instructions système existantes et limite les dérives, un point particulièrement important lors d’interactions longues ou complexes.

Sortie : des validateurs indépendants fonctionnent en parallèle de la génération des réponses, avec une latence minimale. Ils peuvent être activés pour bloquer les réponses contenant du contenu sensible ou enfreignant vos politiques.

  • Les garde-fous de contenu filtrent les catégories sensibles selon des seuils propres à chacune.
  • Les garde-fous personnalisés appliquent des règles propres à votre domaine, rédigées en langage naturel et évaluées individuellement par un modèle léger.
  • Les stratégies de sortie vous permettent de définir ce qui se passe lorsqu’un garde-fou se déclenche, par exemple mettre fin à l’appel, transférer vers un humain ou réessayer la réponse avec des instructions correctives.

Des tests robustes avant le lancement

ElevenAgents propose des fonctionnalités de test robustes afin que les équipes qui développent sur la plateforme puissent détecter et corriger les problèmes avant la mise en production d’un agent ou d’un changement de configuration.

Les simulations vous permettent de mener une conversation complète à plusieurs tours avec un utilisateur simulé avant toute interaction réelle. Vous définissez le scénario et le simulateur mène la conversation jusqu’à sa résolution, y compris avec des appels d’outils réels ou simulés. Puisque vous contrôlez l’utilisateur simulé, vous pouvez le rendre hostile ou manipulateur, afin que le même mécanisme qui valide les parcours normaux teste aussi les parcours adversariaux.

Plusieurs fonctionnalités étendent cette couverture :

  • Les exécutions répétées exécutent un test de nombreuses fois et regroupent les échecs par motif afin de faire ressortir les schémas d’erreur et les cas limites.
  • Les tests de réponse suivante et d’appel d’outil vérifient les réponses individuelles et les actions critiques.
  • Les tests spécifiques à chaque canal vérifient qu’un agent fonctionne comme prévu sur chaque canal où il est déployé, car ses réponses peuvent être adaptées au canal, par exemple concises à l’oral et détaillées par email.
  • Le red teaming via API. Les tests peuvent aussi être exécutés via l’API avec des SDK de red teaming.

Évaluer et améliorer les agents après leur lancement

Lorsque vous déployez vos agents, les évaluations s’exécutent en continu sur les conversations réelles. Grâce à une approche où un LLM fait office de juge, chaque appel peut être évalué automatiquement selon les critères que vous définissez. Vous pouvez examiner les résultats des conversations dans les Dashboards et analyser les problèmes à l’aide de journaux détaillés incluant des transcriptions interrogeables, les sources, les appels d’outils et les déclenchements de garde-fous.

Les problèmes détectés en production peuvent facilement être réintégrés à la suite de tests. Lorsqu’une modification est proposée, vous pouvez utiliser Experiments pour rediriger une partie du trafic réel vers une variante et mesurer les résultats concrets avant de l’appliquer plus largement.

Nous recommandons un déploiement progressif. Redirigez une part limitée du trafic vers votre agent, évaluez ces conversations, puis, une fois que vous avez vérifié que votre agent fonctionne comme prévu, étendez-le à d’autres cas d’usage, canaux ou régions.

Protéger les données sensibles

Les agents peuvent traiter des données de paiement, des informations de santé et des identifiants personnels. Il est donc important de déterminer quelles données sont stockées, où et pendant combien de temps. 

Nous proposons plusieurs mécanismes permettant à nos clients de protéger leurs données :

  • Le Mode zéro rétention peut être activé pour les services éligibles afin de garantir que certains types de données ne sont pas conservés, pour répondre aux environnements réglementaires les plus exigeants.
  • La suppression des données sensibles de l’historique des conversations retire les entités sensibles après un appel et les remplace par des espaces réservés dans le texte et des bips dans l’audio, jusqu’au niveau des types d’entités individuels.
  • La rétention configurable aligne les durées de stockage sur vos exigences réglementaires.
  • La résidence des données garantit que le traitement reste dans la juridiction requise.
  • Les déploiements privés (VPC) isolent l’environnement pour les charges de travail très sensibles.
  • Le chiffrement protège les données en transit et au repos.

Protections au niveau de la plateforme et validation externe

L’ensemble de ces éléments repose sur nos protections au niveau de la plateforme, un programme complet couvrant la provenance des contenus, la détection des abus, l’application des règles relatives aux usages interdits et le red teaming des modèles. Par l’intermédiaire de notre Safety Partnership Program, nous collaborons également avec des entreprises à la pointe de la sécurité de l’IA, en contribuant à leurs produits et aux normes émergentes du secteur.

Nous soumettons également notre approche à un examen indépendant, notamment au regard de normes générales de sécurité et de confidentialité telles que SOC 2 Type II, ISO 27001 et le RGPD, ainsi que de certifications spécifiques à certains secteurs et cas d’usage, comme PCI DSS Level 1 pour le traitement des paiements et HIPAA pour le secteur de la santé aux États-Unis. Consultez notre centre de confiance pour en savoir plus.

Nous respectons également des normes plus récentes, conçues pour l’IA, comme ISO 42001, qui régit les systèmes de management de l’IA, et AIUC-1, qui exige que les agents IA résistent à des simulations adversariales trimestrielles menées par des évaluateurs indépendants. Les mêmes capacités sur lesquelles repose AIUC-1 donnent aussi accès à certaines des premières polices d’assurance pour agents.

Pour les déploiements d’envergure ou complexes, nos Forward Deployed Engineers travaillent aux côtés de votre équipe pour concevoir et mettre en œuvre votre stratégie d’agents, y compris la configuration, les garde-fous, les tests, la surveillance et la stratégie de déploiement. 

Conclusion

Notre approche de la sécurité dans ElevenAgents est multicouche, chaque élément renforçant les autres :

  • Configuration de l’agent : prompts système, workflows et procédures qui façonnent le comportement, les actions les plus sensibles étant conditionnées à des appels d’outils.
  • Garde-fous : vérifications indépendantes à chaque étape, détection des manipulations à l’entrée, Focus lors de la décision, et validateurs de contenu et personnalisés à la sortie, avec des stratégies de sortie configurables.
  • Tests : simulations adversariales, exécutions répétées, tests spécifiques aux canaux et red teaming avant le lancement.
  • Surveillance : déploiement progressif, puis évaluation continue, journaux et transcriptions interrogeables, et boucle de retour après le lancement.
  • Protection des données : suppression des données sensibles, Mode zéro rétention, rétention configurable, résidence des données, déploiements privés (VPC) et chiffrement.
  • Validation externe : certifications, tests adversariaux indépendants d’AIUC-1, assurance pour agents, red teaming et accompagnement d’experts.

Déployez des agents avec des contrôles de sécurité de niveau entreprise

Vous cherchez autre chose ? Consultez notre centre d'aide

Articles similaires

Créez avec l'audio IA de la plus haute qualité