Przejdź do treści

Guardrails 2.0: Nowa warstwa kontroli w ElevenAgents

Opublikowano
Ostatnia aktualizacja

PosłuchajPosłuchaj tego artykułu

Gdy agenci głosowi przejmują ważne zadania w obsłudze klienta, sprzedaży, marketingu, wewnętrznych workflow i nie tylko, zespoły muszą mieć pewność, że pozostaną bezpieczni, zgodni z marką i wymaganiami na skalę korporacyjną.

Guardrails 2.0 w ElevenAgents to przeprojektowana warstwa kontroli, która pomaga kierować agentów ku właściwym odpowiedziom i blokować niewłaściwe, zanim dotrą do użytkownika końcowego.

Guardrails Cover

Wielowarstwowa ochrona w czasie rzeczywistym

Dobrze przygotowany system prompt zapewnia przewidywalne zachowanie w większości interakcji. Agenci są jednak systemami niedeterministycznymi, więc w długich rozmowach mogą zboczyć z tematu, użytkownicy mogą kreatywnie próbować przekraczać granice, a nawet jasno określone zasady nie zawsze działają, gdy model jest pod presją.

Dlatego zespoły wdrażające agentów na produkcji potrzebują wielowarstwowej ochrony: wzmocnionego system promptu jako podstawy oraz niezależnych kontroli tego, co mówią użytkownicy i jak odpowiadają agenci.

Guardrails 2.0 chroni rozmowy na trzech poziomach, które wzajemnie się wzmacniają:

Co robi
Wzmocnienie system promptu
Określ dozwolone i niedozwolone zachowania w system prompcie. Focus Guardrail wzmacnia te instrukcje przez całą rozmowę.
Walidacja danych wejściowych użytkownika
Zabezpieczenie, które wykrywa próby prompt injection i manipulacji oraz kończy rozmowy stanowiące zagrożenie dla bezpieczeństwa.
Walidacja odpowiedzi agenta
Ocena każdej odpowiedzi względem twoich zasad w czasie rzeczywistym. Jeśli odpowiedź narusza reguły, może zostać zablokowana przed wysłaniem.
Guardrails
Wzmocnienie system promptu
Focus
Walidacja danych wejściowych użytkownika
Manipulation
Walidacja odpowiedzi agenta
Content, Custom Guardrails

Gotowe zabezpieczenia

Gotowe zabezpieczenia obejmują najczęstsze obszary ryzyka.

Focus Guardrail wzmacnia system prompt twojego agenta, pomagając utrzymać odpowiedzi na właściwym torze, zgodne z tematem oraz określonymi celami i instrukcjami. Jest to szczególnie przydatne w długich lub złożonych rozmowach, w których agent częściej może odejść od zamierzonych celów.

Manipulation Guardrails wykrywają i blokują próby obejścia instrukcji systemowych przez użytkowników. Po włączeniu system analizuje dane wejściowe użytkownika pod kątem wzorców wskazujących na prompt injection lub próby nadpisania instrukcji i może kończyć rozmowy stanowiące zagrożenie dla bezpieczeństwa.

Content Guardrails pomagają zapewnić odpowiednie odpowiedzi agentów, sprawdzając wiele kategorii potencjalnie wrażliwych lub niebezpiecznych treści. Każda z nich ma regulowane progi, które dają precyzyjną kontrolę.

Custom Guardrails: twoje zasady, egzekwowane automatycznie

Custom Guardrails pozwalają definiować zasady specyficzne dla danej branży w naturalnym języku i automatycznie egzekwować je w każdej rozmowie. Pomaga to ograniczyć incydenty, eskalacje i cykle weryfikacji zgodności, które mogą spowalniać wdrożenie.

Custom Guardrail Configuration Example

Lekki model ocenia każdą odpowiedź agenta względem twoich zasad i decyduje, czy ją zablokować, czy zezwolić na jej wysłanie. Działa niezależnie i równolegle z generowaniem odpowiedzi.

Pełna kontrola nad działaniem guardrails

Decydujesz, jak wykrywać naruszenia zasad i co ma się wydarzyć dalej.

Tryby działania. Ustaw kompromis między szybkością a rygorystycznością — kluczowy dla głosu, gdzie opóźnienia są najważniejsze. Guardrails mogą działać równolegle z odpowiedzią, niemal bez opóźnień, choć przed przechwyceniem może zostać odtworzony ułamek sekundy audio. Możesz też wstrzymać odpowiedzi do pełnej weryfikacji — trochę wolniej, ale nic nie trafia do użytkownika bez sprawdzenia.

Strategie zakończenia. Gdy guardrail zostanie uruchomiony, określasz, co dzieje się dalej: zakończenie rozmowy, przekazanie jej innemu agentowi, eskalacja do człowieka lub ponowna próba odpowiedzi z instrukcjami korygującymi.

Poziomy wrażliwości treści. Dostosuj czułość dla poszczególnych kategorii treści: zaostrz ją w zastosowaniach o wyższym ryzyku i zmniejsz tam, gdzie nadmierne blokowanie pogorszyłoby doświadczenie użytkownika.

Szczegółowa konfiguracja. Każdy guardrail możesz włączyć lub wyłączyć osobno, a różni agenci mogą działać z różnymi konfiguracjami.

Pełna widoczność. Każde uruchomienie jest zapisywane w analityce rozmów, wraz z informacją, który guardrail zadziałał i jakie działanie zostało podjęte. Dzięki temu zespoły mają dane potrzebne do ulepszania system promptów i guardrails z czasem.

Redakcja historii rozmów

Po zakończeniu rozmowy możesz automatycznie usuwać wrażliwe informacje z transkrypcji, nagrań i danych webhooków. Zachowaj wszystko, czego potrzebujesz do analityki, QA i szkolenia, a usuń to, czego nie potrzebujesz.

Wykryte dane są zastępowane placeholderami w tekście i sygnałami dźwiękowymi w audio. Kontrolujesz szczegółowość aż do pojedynczych typów danych: możesz usuwać wszystkie imiona i nazwiska albo tylko nazwiska, wszystkie identyfikatory finansowe albo tylko numery kart płatniczych.

To uzupełnia szersze mechanizmy kontroli danych, takie jak Zero Retention Mode, który można stosować we wdrożeniach z bardziej rygorystycznymi wymaganiami dotyczącymi zgodności.

Conversation History Redaction Example

Redakcja historii rozmów i Zero Retention Mode są dostępne dla klientów korporacyjnych. Skontaktuj się z działem sprzedaży , aby uzyskać dostęp.

Część szerszych podstaw zaufania i bezpieczeństwa

Guardrails 2.0 i funkcje prywatności danych wspierają korporacyjne wdrożenia ElevenAgents, wraz z narzędziami bezpieczeństwa na każdym etapie cyklu życia agenta:

Tworzenie agenta

  • Projektowanie system promptu, konfiguracja guardrails, red teaming i symulacje, które testują zachowanie agentów pod obciążeniem, zanim zaczną działać

Każda rozmowa

  • W trakcie: Guardrails 2.0 (Focus, Manipulation, Content i Custom Guardrails), logowanie, opcjonalny Zero Retention Mode
  • Po rozmowie: Kryteria oceny, monitoring, opcjonalna redakcja historii rozmów

Razem dają zespołom kontrolę potrzebną, by przejść od pilotażu do produkcji z mniejszą liczbą incydentów, szybszymi cyklami zatwierdzania i bardziej spójnym działaniem agentów. Te podstawy platformy wspierają też kwalifikację do certyfikacji AIUC-1 oraz dostęp do pierwszych w branży polis ubezpieczeniowych dla agentów.

Zacznij korzystać z Guardrails już dziś

W ostatnich miesiącach stopniowo udostępnialiśmy kolejne funkcje, a pełny zestaw Guardrails 2.0 jest już dostępny w wersji alfa w ElevenAgents.

Włącz je na karcie Security w ustawieniach agenta, lub skonfiguruj je przez API. Aby dowiedzieć się więcej o wdrożeniach korporacyjnych, skontaktuj się z naszym działem sprzedaży.

Wskazówki dotyczące konfiguracji i dobre praktyki znajdziesz tutaj:

Podobne artykuły

Twórz z najwyższej jakości audio AI