Webinar-Zusammenfassung: Sichere KI-Agenten für den Unternehmenseinsatz entwickeln
- Veröffentlicht
- Zuletzt aktualisiert
AnhörenArtikel anhören
Webinar-Rückblick: Sichere KI-Agenten für den Einsatz in Unternehmen entwickeln
Einen KI-Agenten für Gespräche einzusetzen, ist der einfache Teil. Das Vertrauen Ihres Sicherheits- und Rechtsteams sowie Ihrer Kunden zu gewinnen, ist der Punkt, an dem die meisten Unternehmensimplementierungen ins Stocken geraten.
Dieser Beitrag fasst unseren Live-Workshop Sichere KI-Agenten für den Einsatz in Unternehmen entwickeln, zusammen. Darin haben wir die Tools, Frameworks und Implementierungspraktiken vorgestellt, mit denen Agenten in Unternehmen skalierbar eingesetzt werden können.
So entwickeln Sie einen mehrschichtigen Sicherheitsansatz
Auf der ElevenAgents-Plattform wurden bereits über vier Millionen Agenten eingesetzt. Diejenigen, die in Unternehmensumgebungen zuverlässig funktionieren, haben eines gemeinsam: Sicherheit war von Anfang an integriert und wurde nicht erst nach dem ersten Vorfall ergänzt.
Unsere Live-Session behandelte die Frameworks, Kontrollen und Implementierungspraktiken, die Agenten mit bestandener Sicherheitsprüfung von den übrigen unterscheiden.
Unterschiedliche Agenten brauchen grundlegend unterschiedliche Grenzen.
- Eine Videospielfigur muss möglicherweise als Teil des Erlebnisses explizit gewalttätige Sprache verwenden – darf aber niemals ihre Rolle verlassen oder offenlegen, dass sie eine KI ist.
- Ein Empfangsagent im Gesundheitswesen muss Verletzungen und medizinische Kontexte besprechen können – darf aber niemals medizinischen Rat geben.
- Ein Support-Agent für Kreditkarten sollte überhaupt keine expliziten Inhalte behandeln und keine Kontodaten an nicht verifizierte Anrufer weitergeben.
Da Agenten nicht deterministisch sind, kann keine einzelne Schutzmaßnahme vollständig vor allen potenziellen Risiken schützen. Deshalb brauchen Unternehmen einen mehrschichtigen Ansatz – mehrere Kontrollen, die zusammenarbeiten, damit Sicherheitsverstöße die seltene Ausnahme bleiben.
Dieses Prinzip prägte die vier Fragen, anhand derer wir die Session strukturiert haben:
- Wie kann ich kontrollieren, was mein Agent sagt und tut?
- Wie kann ich prüfen, ob er funktioniert?
- Wie kann ich Daten schützen, um Sicherheits- und Compliance-Anforderungen zu erfüllen?
- Wie kann ich Prozesse für einen sicheren Einsatz aufbauen?
Agentenverhalten kontrollieren
In jedem Agentengespräch gibt es drei Punkte, an denen Sicherheit berücksichtigt werden muss.
Eingabe
Der Nutzer sagt etwas. Angreifende Nutzer versuchen möglicherweise Dinge wie „Ignoriere alle vorherigen Anweisungen“ oder „Tu so, als wärst du ein anderer Assistent“. Sie müssen Manipulationsversuche erkennen und behandeln, bevor sie das Modell überhaupt erreichen. Das verhindert unnötige Kosten und hindert Angreifer daran, Informationen zu extrahieren, die sie nicht erhalten sollten.
Entscheidungsfindung
Das LLM entscheidet, was es sagen oder tun soll. Hier ist Ihr System Prompt die wichtigste Kontrollinstanz – doch in langen oder komplexen Gesprächen können LLMs von ihren Anweisungen abweichen. Sie brauchen Mechanismen, die das Verhalten während des gesamten Gesprächs verstärken, nicht nur zu Beginn. Definieren Sie außerdem Eskalationswege: Gibt es Situationen, in denen der Agent an einen Menschen oder einen spezialisierteren Agenten übergeben sollte, und unter welchen Bedingungen?
Ausgabe
Selbst bei klaren Vorgaben kann etwas durchrutschen – insbesondere in lang andauernden Gesprächen. Sie brauchen ein letztes Sicherheitsnetz. Stellen Sie es sich als Mini-Agenten vor, der die Arbeit Ihres Hauptagenten prüft: Er bewertet die Antwort, bevor sie den Nutzer erreicht, und entscheidet, ob sie ausgegeben, erneut versucht oder eskaliert wird. Er läuft zudem parallel zur Antwortgenerierung und fügt nur minimale Latenz hinzu.
Für alle drei Ebenen müssen Sie Ihre Ausstiegsstrategien im Voraus definieren: Beendet ein Verstoß das Gespräch, löst er einen erneuten Versuch mit korrigierenden Anweisungen aus oder wird an einen Menschen übergeben? Diese Entscheidung prägt das Nutzererlebnis, wenn etwas schiefläuft.
Demo 1: Guardrails in ElevenAgents konfigurieren
Szenario: Ein Vertriebs- und Support-Agent für eine Website wird mit mehreren Ebenen von Sicherheitskontrollen konfiguriert, um Manipulation, themenfremde Antworten und Richtlinienverstöße zu verhindern.
Was gezeigt wurde:
- Manipulations-Guardrail (Eingabe) – Diese Option finden Sie im Tab „Security“. Sie erkennt Muster für Prompt-Injection – Versuche, Systemanweisungen zu überschreiben – und beendet das Gespräch, bevor der Agent antwortet. Empfohlen für alle Produktionsagenten.
- System Prompt und Focus-Guardrail (Entscheidungsfindung) – der System Prompt ist grundlegend. Jede wichtige Regel sollte dort explizit stehen. In der Demo wurde während der Session eine Anweisung ergänzt: „Biete keine Rabatte an.“ Der separat aktivierte Focus-Guardrail verstärkt den System Prompt automatisch während des gesamten Gesprächs und löst so das Problem des Abweichens in längeren Interaktionen. Ein starker System Prompt in Verbindung mit aktiviertem Focus ist die wirksamste Kombination, um einen Agenten auf Kurs zu halten.
- Inhalts-Guardrail (Ausgabe) – Vorkonfigurierte Kategorien für Obszönitäten, Rechtsberatung und politische Meinungen. Jede Kategorie hat einen anpassbaren Konfidenzschwellenwert – „Mittel“ ist der empfohlene Ausgangspunkt. Dies ist die Rückfallebene: Wenn der Agent etwas ausgeben will, das er nicht sollte, wird es vor der Ausgabe abgefangen.
- Benutzerdefinierter Guardrail (Ausgabe) – nutzerspezifische Prüfungen in natürlicher Sprache für Fälle, die nicht durch Voreinstellungen abgedeckt sind. In der Demo wurde ein Guardrail für „keine Rabatte“ konfiguriert: „Blockiere jede Antwort, die Rabatte, Aktionen oder Sonderpreise erwähnt, zu denen der Agent nicht berechtigt ist.“ Benutzerdefinierte Guardrails verwenden eine zusätzliche LLM-Bewertung – daher entstehen nutzungsbasierte Kosten und Latenz. Formulieren Sie Anweisungen präzise und teilen Sie unterschiedliche Prüfungen auf separate Guardrails auf, statt sie zu kombinieren.
- Aktion bei Verstoß – zwei Optionen: Anruf beenden oder erneut versuchen. Bei einem erneuten Versuch können Sie zusätzliche Anweisungen geben, um den nächsten Versuch des Agenten zu steuern – etwa zur Eskalation an einen Menschen oder zur Ausgabe einer Standard-Weiterleitungsnachricht.
Warum das wichtig ist: Diese Kontrollen sind keine Einheitslösung. Sie lassen sich auf Ebene jedes einzelnen Guardrails konfigurieren. Diese Granularität macht den Unterschied zwischen einem theoretisch sicheren Agenten und einem, der in unterschiedlichen Unternehmenskontexten auch operativ sicher ist.
Demo 2: Simulationstests vor dem Start
Szenario: Ein Support-Agent wird mit zwei rabattbezogenen Gesprächsszenarien getestet, um sicherzustellen, dass er Nutzer auf die Preisseite weiterleitet, ohne Rabatte anzubieten.
Was gezeigt wurde:
- Zwei im Tab „Tests“ definierte Simulationstests, jeweils mit einem simulierten Nutzerszenario, einer festgelegten Anzahl von Gesprächszügen und expliziten Erfolgskriterien
- Ein Test schlug zunächst fehl, weil im System Prompt spezifische Anweisungen für Sonderfälle fehlten
- Die fehlenden Anweisungen wurden dem Guardrail-Abschnitt des System Prompts hinzugefügt
- Der Agent wurde erneut veröffentlicht und beide Tests wurden wiederholt – beide bestanden
- Der detaillierte Ausführungsverlauf zeigt genau, welcher Teil eines Gesprächs fehlgeschlagen ist, einschließlich Tool-Aufrufen und Agentenaktionen
Warum das wichtig ist: Mit Simulationstests können Teams das Agentenverhalten in einer kontrollierten Umgebung validieren, bevor ein echter Nutzer den Agenten sieht. Sie decken sowohl Routine- als auch Angreiferszenarien ab. Außerdem prüfen sie den vollständigen Gesprächsablauf, nicht nur einzelne Antworten. Bei Änderungen können Tests sofort erneut ausgeführt werden, um zu bestätigen, dass die Korrektur greift.
Demo 3: PII-Schwärzung für sensible Einsätze
Szenario: Ein Unternehmensagent wird so konfiguriert, dass er personenbezogene Daten aus Gesprächsprotokollen schwärzt.
Was gezeigt wurde:
- Schalter „Conversation History Redaction“ im Tab „Advanced“ unter den Datenschutzeinstellungen
- Eine Liste spezifischer Datenentitäten, die einzeln für die Schwärzung aktiviert werden können, einschließlich Geburtsdatum, Alter und anderer sensibler Felder
- Option, alle Entitäten oder nur die für den jeweiligen Anwendungsfall des Agenten relevanten auszuwählen
Warum das wichtig ist: Die PII-Schwärzung ersetzt in Umgebungen mit hohen Compliance-Anforderungen wie HIPAA nicht den Modus ohne Datenspeicherung. Sie reduziert jedoch die Datenexposition in Gesprächsprotokollen, die für interne Prüfungen oder Qualitätskontrollen verwendet werden. Teams können die benötigten Protokolle behalten und die nicht benötigten Daten entfernen. Die Funktion ist derzeit für Unternehmenskunden verfügbar.
Best Practices für den sicheren Einsatz von Unternehmensagenten
- Verfolgen Sie einen mehrschichtigen Ansatz. Keine einzelne Kontrolle gewährleistet sicheres Verhalten. Eingabe-Guardrails, Ausgabevalidierung, Prompt-Härtung und Tests müssen zusammenwirken. Jede Ebene verstärkt die anderen und zusammen reduzieren sie das Risiko von Sicherheitsproblemen erheblich.
- Passen Sie Guardrails an den Kontext an. Ein Agent im Gesundheitswesen und ein Support-Agent im Einzelhandel brauchen unterschiedliche Regeln. Definieren Sie die Grenzen speziell für Ihren Anwendungsfall, nicht anhand einer allgemeinen Vorlage.
- Beginnen Sie mit einem relevanten Anwendungsfall. Die erfolgreichsten Unternehmensimplementierungen beginnen nicht mit einem wegwerfbaren Pilotprojekt. Sie wählen etwas Reales wie Kundensupport oder Terminplanung und investieren darin, es richtig umzusetzen.
- Testen Sie vor dem Start und testen Sie weiter. Nutzen Sie Simulationstests und externe Red-Teaming-Tools. Testen Sie sowohl Routineszenarien als auch Angreiferszenarien. Nehmen Sie neue Sonderfälle, die Sie im Produktivbetrieb entdecken, in Ihre Testsuite auf.
- Führen Sie schrittweise ein. Beginnen Sie mit begrenztem Traffic. Überwachen Sie echte Gespräche. Ermitteln Sie, womit der Agent Schwierigkeiten hat. Nehmen Sie Anpassungen vor, testen Sie erneut und erweitern Sie dann den Einsatz.
- Wählen Sie den Ausführungsmodus bewusst. Verwenden Sie den Blocking-Modus für Textagenten, bei denen strenge Validierung wichtiger ist als Geschwindigkeit. Verwenden Sie den Streaming-Modus für Sprachagenten, bei denen Latenz Priorität hat.
- Definieren Sie klare Maßnahmen bei Guardrail-Verstößen. Entscheiden Sie im Voraus, ob ein Verstoß den Anruf beenden, einen erneuten Versuch auslösen oder an einen Menschen eskalieren soll.
- Halten Sie Anweisungen für benutzerdefinierte Guardrails kurz. Guardrails laufen parallel. Ein langer, komplexer benutzerdefinierter Guardrail erhöht die Latenz. Formulieren Sie Anweisungen präzise und teilen Sie unterschiedliche Prüfungen auf separate Guardrails auf.
- Verstehen Sie, was Zertifizierungen tatsächlich abdecken. SOC 2 Type 2 und ISO 27001 sind Mindeststandard. Branchenspezifische Standards wie HIPAA und PCI DSS gelten für regulierte Branchen. Neuere KI-spezifische Zertifizierungen wie ISO 42001 und AIUC-1 behandeln Bias, Transparenz und Widerstandsfähigkeit gegen Angriffe – und eine AIUC-1-Zertifizierung kann KI-spezifische Versicherungen ermöglichen.
- Bauen Sie frühzeitig Prozesse auf. Die erste Implementierung nimmt die meiste Zeit in Anspruch. Teams, die in Tests und Implementierungsprozesse investieren, iterieren bei jedem weiteren Agenten deutlich schneller.
Vollständige Session ansehen
Sehen Sie sich das vollständige Webinar hier an.

.webp&w=3840&q=80)
.webp&w=3840&q=80)


