Zum Inhalt springen

Unser mehrschichtiges Sicherheitskonzept für KI-Agenten

Veröffentlicht
Zuletzt aktualisiert

AnhörenArtikel anhören

Da KI-Agenten Aufgaben mit hohen Anforderungen übernehmen, müssen Teams darauf vertrauen können, dass ihre Agenten sicher und vorhersehbar handeln. 

ElevenAgents nutzt eine mehrschichtige Sicherheitsarchitektur: Guardrails für jede Phase eines Gesprächs, adversariale Tests vor dem Launch, Monitoring im Einsatz, Datenschutz und unabhängige Validierung. 

Kein nichtdeterministisches System kann vor jedem Risiko schützen. Dieser umfassende Sicherheitsrahmen ermöglicht es jedoch führenden Unternehmen und Behörden, die auf ElevenAgents setzen, Agenten zu entwickeln, die nur selten ausfallen, sich zuverlässig erholen und hohe Sicherheitsanforderungen erfüllen.

Schutz in jeder Phase des Gesprächs

Sie können Kontrollen zum Schutz der drei Phasen jeder Interaktion einfach aktivieren und konfigurieren. Das ist die Grundlage für Guardrails 2.0 in ElevenAgents.

Eingabe – Echtzeitprüfungen der Nutzereingaben.

  • Guardrails gegen Manipulation analysieren Nutzereingaben unabhängig und können Gespräche bei Anzeichen einer Prompt-Injection beenden.

Entscheidung – Wie der Agent bei seinen Entscheidungen angeleitet wird und auf Kurs bleibt.

  • System-Prompts sollten klare Anweisungen enthalten, etwa zum Vermeiden unangemessener Themen, zur Darstellung des Agenten und zur Begrenzung seines Aufgabenbereichs.
  • Workflows und Verfahren können die sensibelsten Aktionen an Tool-Aufrufe knüpfen, etwa die Identitätsprüfung eines Anrufers, bevor Kontodaten weitergegeben werden.
  • Das Focus-Guardrail verstärkt bestehende Systemanweisungen und mindert Abweichungen. Das ist besonders bei langen oder komplexen Interaktionen wichtig.

Ausgabe – Unabhängige Validatoren laufen parallel zur Antwortgenerierung und verursachen nur minimale Latenz. Sie können Antworten blockieren, die sensible Inhalte enthalten oder gegen Ihre Richtlinien verstoßen.

  • Content-Guardrails prüfen sensible Kategorien anhand kategoriebasierter Schwellenwerte.
  • Benutzerdefinierte Guardrails setzen domänenspezifische Regeln in natürlicher Sprache durch. Jede Regel wird von einem schlanken Modell bewertet.
  • Ausstiegsstrategien legen fest, was geschieht, wenn ein Guardrail ausgelöst wird: etwa das Gespräch beenden, an einen Mitarbeitenden weiterleiten oder die Antwort mit korrigierenden Anweisungen erneut generieren.

Robuste Tests vor dem Launch

ElevenAgents bietet robuste Testfunktionen, mit denen Teams auf der Plattform Probleme finden und beheben können, bevor ein Agent oder eine Konfigurationsänderung live geht.

Simulationen ermöglichen Ihnen, vor einer echten Interaktion ein vollständiges Gespräch mit mehreren Gesprächszügen mit einem simulierten Nutzer durchzuführen. Sie definieren das Szenario, und der Simulator führt das Gespräch bis zur Lösung – einschließlich echter oder nachgebildeter Tool-Aufrufe. Da Sie den simulierten Nutzer steuern, können Sie ihn feindselig oder manipulativ gestalten. So prüft derselbe Mechanismus, der reguläre Abläufe validiert, auch adversariale Szenarien.

Mehrere Funktionen erweitern diese Abdeckung:

  • Wiederholte Durchläufe führen einen Test vielfach aus. Fehler werden nach Ursache gruppiert, um Fehlermuster und Grenzfälle sichtbar zu machen.
  • Tests für nächste Antworten und Tool-Aufrufe prüfen einzelne Antworten und kritische Aktionen.
  • Kanalspezifische Tests prüfen, ob ein Agent auf jedem eingesetzten Kanal erwartungsgemäß funktioniert. Die Ausgaben eines Agenten können je nach Kanal angepasst werden, etwa kurz in einem Anruf und ausführlich per E-Mail.
  • Red-Teaming über die API. Tests lassen sich auch über die API mit Red-Teaming-SDKs ausführen.

Agenten nach dem Launch bewerten und verbessern

Nach der Bereitstellung Ihrer Agenten werden Live-Gespräche kontinuierlich bewertet. Mit einem LLM-as-a-Judge-Ansatz lässt sich jeder Anruf automatisch anhand Ihrer festgelegten Kriterien bewerten. Sie können Gesprächsergebnisse in Dashboards prüfen und Probleme anhand detaillierter Gesprächsprotokolle nachvollziehen, einschließlich durchsuchbarer Transkripte, Quellen, Tool-Aufrufe und ausgelöster Guardrails.

In der Produktion erkannte Probleme lassen sich einfach in die Testsuite zurückführen. Bei vorgeschlagenen Änderungen können Sie Experiments nutzen, um einen Teil des Live-Traffics auf eine Variante zu leiten und tatsächliche Ergebnisse zu messen, bevor sie breit eingesetzt wird.

Wir empfehlen eine schrittweise Bereitstellung. Leiten Sie einen begrenzten Teil des Traffics an Ihren Agenten, bewerten Sie diese Gespräche und erweitern Sie den Einsatz auf weitere Anwendungsfälle, Kanäle oder Regionen, sobald Sie bestätigt haben, dass Ihr Agent wie erwartet funktioniert.

Sensible Daten schützen

Agenten können Zahlungsdaten, Gesundheitsinformationen und persönliche Identifikatoren verarbeiten. Daher ist es wichtig zu berücksichtigen, welche Daten wo und wie lange gespeichert werden. 

Wir bieten Kunden verschiedene Mechanismen zum Schutz ihrer Daten:

  • Zero Retention Mode kann für berechtigte Dienste aktiviert werden, damit bestimmte Datentypen nicht gespeichert werden. Er ist für anspruchsvolle regulatorische Umgebungen konzipiert.
  • Schwärzung des Gesprächsverlaufs entfernt nach einem Anruf sensible Entitäten und ersetzt sie durch Platzhalter im Text und Signaltöne im Audio – bis hin zu einzelnen Entitätstypen.
  • Konfigurierbare Aufbewahrung passt Speicherfristen an Ihre regulatorischen Anforderungen an.
  • Datenresidenz stellt sicher, dass die Verarbeitung innerhalb der erforderlichen Rechtsordnung erfolgt.
  • Private Bereitstellungen (VPC) isolieren die Umgebung für Workloads mit hoher Sensibilität.
  • Verschlüsselung schützt Daten bei der Übertragung und im Ruhezustand.

Schutzmaßnahmen auf Plattformebene und externe Validierung

All dies baut auf unseren umfassenderen Schutzmaßnahmen auf Plattformebene auf: einem umfassenden Programm für Herkunftsnachweise von Inhalten, Missbrauchserkennung, Durchsetzung von Nutzungsverboten und Red-Teaming von Modellen. Über unser Safety Partnership Program arbeiten wir zudem mit Unternehmen zusammen, die im Bereich KI-Sicherheit führend sind. Damit tragen wir zu ihren Produkten und zu neuen Industriestandards bei.

Wir unterziehen unseren Ansatz außerdem einer unabhängigen Prüfung. Dazu gehören allgemeine Sicherheits- und Datenschutzstandards wie SOC 2 Type II, ISO 27001 und DSGVO sowie branchen- und anwendungsfallspezifische Zertifizierungen wie PCI DSS Level 1 für die Zahlungsabwicklung und HIPAA für das US-Gesundheitswesen. Weitere Informationen finden Sie in unserem Trust Center.

Wir erfüllen außerdem neuere, KI-spezifische Standards wie ISO 42001 für KI-Managementsysteme und AIUC-1. Dieser Standard verlangt, dass KI-Agenten vierteljährlichen adversarialen Simulationen unabhängiger Prüfer standhalten. Die gleichen Funktionen hinter AIUC-1 ermöglichen auch den Zugang zu einigen der branchenweit ersten Versicherungen für Agenten.

Bei großen oder komplexen Rollouts arbeiten unsere Forward Deployed Engineers mit Ihrem Team zusammen, um Ihre Agentenstrategie zu entwickeln und umzusetzen – einschließlich Konfiguration, Guardrails, Tests, Monitoring und Rollout-Strategie. 

Fazit

Unser Sicherheitsansatz für ElevenAgents ist mehrschichtig. Jede Komponente verstärkt die anderen:

  • Agentenkonfiguration: System-Prompts, Workflows und Verfahren, die das Verhalten prägen und die sensibelsten Aktionen an Tool-Aufrufe knüpfen.
  • Guardrails: Unabhängige Prüfungen in jeder Phase: Manipulationserkennung bei der Eingabe, Focus bei der Entscheidung sowie Content- und benutzerdefinierte Validatoren bei der Ausgabe – mit konfigurierbaren Ausstiegsstrategien.
  • Tests: Adversariale Simulationen, wiederholte Durchläufe, kanalspezifische Tests und Red-Teaming vor dem Launch.
  • Monitoring: Schrittweise Einführung, anschließend kontinuierliche Bewertung, durchsuchbare Protokolle und Transkripte sowie eine Feedbackschleife nach dem Launch.
  • Datenschutz: Schwärzung, Zero Retention Mode, konfigurierbare Aufbewahrung, Datenresidenz, private Bereitstellungen (VPC) und Verschlüsselung.
  • Externe Validierung: Zertifizierungen, die unabhängigen adversarialen Tests von AIUC-1, Versicherungen für Agenten, Red-Teaming und Unterstützung durch Experten.

Ähnliche Artikel

Erstellen Sie mit hochwertiger KI-Audio