Zum Inhalt springen

Guardrails 2.0: Eine überarbeitete Kontrollschicht in ElevenAgents

Veröffentlicht
Zuletzt aktualisiert

AnhörenArtikel anhören

Da Sprachagenten wichtige Aufgaben in Support, Vertrieb, Marketing, internen Workflows und weiteren Bereichen übernehmen, müssen Teams darauf vertrauen können, dass sie sicher, markenkonform und auf Enterprise-Niveau compliant bleiben.

Guardrails 2.0 in ElevenAgents ist eine neu entwickelte Kontrollebene, die Agenten zu den richtigen Antworten führt und falsche Antworten verhindert, bevor sie Endnutzer erreichen.

Guardrails Cover

Mehrschichtiger Schutz in Echtzeit

Ein gut formulierter System Prompt führt bei den meisten Interaktionen zu vorhersehbarem Verhalten. Da Agenten jedoch nicht deterministische Systeme sind, können sie in langen Gesprächen vom Thema abkommen. Nutzer können kreative Wege finden, Grenzen zu überschreiten, und selbst klar definierte Richtlinien halten nicht immer stand, wenn das Modell unter Druck steht.

Deshalb benötigen Teams, die Agenten in der Produktion einsetzen, mehrschichtige Schutzmechanismen: einen gehärteten System Prompt als Grundlage sowie unabhängige Prüfungen der Nutzereingaben und Agentenantworten.

Guardrails 2.0 schützt Gespräche auf drei Ebenen, die sich gegenseitig ergänzen:

Funktion
Härtung des System Prompts
Definieren Sie erlaubtes und nicht erlaubtes Verhalten im System Prompt. Das Focus Guardrail verstärkt diese Anweisungen während des gesamten Gesprächs.
Validierung von Nutzereingaben
Ein Sicherheitsnetz, das Prompt-Injection- und Manipulationsversuche erkennt und Gespräche beendet, die ein Sicherheitsrisiko darstellen.
Validierung von Agentenantworten
Bewertet jede Antwort in Echtzeit anhand Ihrer Richtlinien. Verstößt eine Antwort gegen Ihre Regeln, kann sie vor der Übermittlung blockiert werden.
Guardrails
Härtung des System Prompts
Focus
Validierung von Nutzereingaben
Manipulation
Validierung von Agentenantworten
Content, Custom Guardrails

Vorgefertigte Schutzmechanismen

Vorgefertigte Schutzmechanismen decken die häufigsten Risikobereiche ab.

Das Focus Guardrail verstärkt den System Prompt Ihres Agenten und sorgt dafür, dass Antworten zielgerichtet, relevant und mit Ihren definierten Zielen und Anweisungen vereinbar bleiben. Das ist besonders bei langen oder komplexen Gesprächen nützlich, bei denen der Agent eher von seinen vorgesehenen Zielen abweicht.

Manipulation Guardrails erkennen und blockieren Versuche von Nutzern, Systemanweisungen zu umgehen. Wenn sie aktiviert sind, analysiert das System Nutzereingaben auf Muster, die auf Prompt-Injection- oder Versuche zur Überschreibung von Anweisungen hinweisen. Gespräche mit Sicherheitsrisiko können beendet werden.

Content Guardrails helfen, angemessene Agentenantworten sicherzustellen, indem sie mehrere Kategorien potenziell sensibler oder unsicherer Inhalte mit jeweils anpassbaren Schwellenwerten prüfen.

Custom Guardrails: Ihre Regeln, automatisch durchgesetzt

Mit Custom Guardrails definieren Sie domänenspezifische Richtlinien in natürlicher Sprache und setzen sie automatisch bei jedem Anruf durch. Das reduziert Vorfälle, Eskalationen und Compliance-Prüfzyklen, die die Bereitstellung verzögern können.

Custom Guardrail Configuration Example

Ein schlankes Modell prüft jede Agentenantwort anhand Ihrer Regeln und gibt eine Entscheidung zum Blockieren oder Zulassen zurück. Es läuft unabhängig und parallel zur Antwortgenerierung.

Volle Kontrolle über die Ausführung von Guardrails

Sie steuern, wie Richtlinienverstöße erkannt werden und was anschließend geschieht.

Ausführungsmodi. Konfigurieren Sie den Kompromiss zwischen Geschwindigkeit und Strenge – entscheidend für Sprache, bei der Latenz besonders wichtig ist. Sie können Guardrails parallel zur Antwort ausführen, praktisch ohne Verzögerung. Dabei kann jedoch ein Bruchteil einer Sekunde Audio abgespielt werden, bevor die Antwort abgefangen wird. Oder Sie halten Antworten zurück, bis sie vollständig freigegeben sind – etwas langsamer, aber nichts erreicht Nutzer ungeprüft.

Ausstiegsstrategien. Wenn ein Guardrail ausgelöst wird, definieren Sie den nächsten Schritt: Gespräch beenden, an einen anderen Agenten übergeben, an einen Menschen eskalieren oder die Antwort mit korrigierenden Anweisungen erneut generieren.

Sensitivitätsstufen für Inhalte. Passen Sie die Sensitivität für einzelne Inhaltskategorien an. Verstärken Sie die Durchsetzung bei Anwendungsfällen mit höherem Risiko und lockern Sie sie, wenn übermäßiges Blockieren die Nutzererfahrung beeinträchtigen würde.

Granulare Konfiguration. Jedes Guardrail kann einzeln aktiviert oder deaktiviert werden, und verschiedene Agenten können unterschiedliche Konfigurationen verwenden.

Vollständige Transparenz. Jeder Auslöser wird in Ihrer Gesprächsanalyse protokolliert, einschließlich des ausgelösten Guardrails und der ergriffenen Maßnahme. So erhalten Teams die Daten, die sie benötigen, um ihre System Prompts und Guardrails fortlaufend zu verbessern.

Schwärzung des Gesprächsverlaufs

Nach Ende eines Anrufs können Sie sensible Informationen automatisch aus Transkripten, Aufzeichnungen und Webhook-Payloads schwärzen. Behalten Sie alles, was Sie für Analysen, Qualitätssicherung und Training benötigen, und entfernen Sie den Rest.

Erkannte Entitäten werden im Text durch Platzhalter und im Audio durch Signaltöne ersetzt. Sie steuern die Granularität bis auf einzelne Entitätstypen: Schwärzen Sie alle Namen oder nur Nachnamen, alle Finanzkennungen oder nur Zahlungskartennummern.

Dies ergänzt umfassendere Datenkontrollen wie den Zero Retention Mode, der für Bereitstellungen mit strengeren Compliance-Anforderungen genutzt werden kann.

Conversation History Redaction Example

Die Schwärzung des Gesprächsverlaufs und der Zero Retention Mode stehen Enterprise-Kunden zur Verfügung. Vertrieb kontaktieren für Zugriff.

Teil einer umfassenderen Grundlage für Vertrauen und Sicherheit

Guardrails 2.0 und Datenschutzfunktionen unterstützen Enterprise-Bereitstellungen von ElevenAgents – zusammen mit Sicherheitstools für jede Phase des Agentenlebenszyklus:

Agentenentwicklung

  • Design von System Prompts, Guardrail-Konfiguration, Red Teaming und Simulationen, um das Verhalten vor dem Livegang von Agenten auf Belastbarkeit zu prüfen

Jedes Gespräch

  • Währenddessen: Guardrails 2.0 (Focus, Manipulation, Content und Custom Guardrails), Protokollierung, optionaler Zero Retention Mode
  • Danach: Bewertungskriterien, Monitoring, optionale Schwärzung des Gesprächsverlaufs

Zusammen geben diese Funktionen Teams die Kontrolle, die sie brauchen, um mit weniger Vorfällen, schnelleren Freigabezyklen und konsistenterem Agentenverhalten vom Pilotprojekt in die Produktion zu gehen. Diese Grundlagen der Plattform unterstützen zudem die Eignung für die AIUC-1-Zertifizierung und den Zugang zu den ersten Versicherungspolicen für Agenten der Branche.

Guardrails noch heute nutzen

In den vergangenen Monaten haben wir Funktionen eingeführt. Die vollständige Guardrails-2.0-Suite ist jetzt als Alpha-Version in ElevenAgents verfügbar.

Aktivieren Sie sie im Tab Sicherheit in den Einstellungen Ihres Agenten oder konfigurieren Sie sie über die API. Weitere Informationen zu Enterprise-Bereitstellungen erhalten Sie von unserem Vertriebsteam.

Hinweise zur Einrichtung und Best Practices finden Sie hier:

Ähnliche Artikel

Erstellen Sie mit hochwertiger KI-Audio