Poznaj Eleven v4Poznaj Eleven v4, nasz najbardziej emocjonalny model. 3× więcej kredytów w planie Creator+ do 12 października

Przejdź do treści

Guardrails 2.0: Nowa warstwa kontroli w ElevenAgents

Opublikowano
Ostatnia aktualizacja

PosłuchajPosłuchaj tego artykułu

W miarę jak agenci głosowi wykonują ważne zadania w obsłudze klienta, sprzedaży, marketingu, wewnętrznych workflow i nie tylko, zespoły muszą mieć pewność, że pozostaną bezpieczni, zgodni z marką i wymogami na skalę enterprise.

Guardrails 2.0 w ElevenAgents to przeprojektowana warstwa kontroli, która pomaga kierować agentów ku właściwym odpowiedziom i zapobiegać niewłaściwym, zanim dotrą do użytkownika końcowego.

Guardrails Cover

Wielowarstwowa ochrona w czasie rzeczywistym

Dobrze przygotowany system prompt zapewnia przewidywalne zachowanie w większości interakcji. Agenci są jednak systemami niedeterministycznymi: w długich rozmowach mogą zbaczać z tematu, użytkownicy mogą kreatywnie testować granice, a nawet jasno określone zasady nie zawsze działają, gdy model jest pod presją.

Dlatego zespoły wdrażające agentów na produkcji potrzebują wielowarstwowej ochrony: solidnego system promptu jako podstawy oraz niezależnych kontroli tego, co mówią użytkownicy i jak odpowiadają agenci.

Guardrails 2.0 chroni rozmowy na trzech poziomach, z których każdy wzmacnia pozostałe:

Jak działa
Wzmocnienie system promptu
Określ dozwolone i niedozwolone zachowania w system promcie. Focus Guardrail wzmacnia te instrukcje przez całą rozmowę.
Walidacja danych wejściowych użytkownika
Siatka bezpieczeństwa, która wykrywa próby prompt injection i manipulacji, kończąc rozmowy stanowiące zagrożenie dla bezpieczeństwa.
Walidacja odpowiedzi agenta
Ocena każdej odpowiedzi w czasie rzeczywistym pod kątem twoich zasad. Jeśli odpowiedź je narusza, może zostać zablokowana przed wysłaniem.
Guardrails
Wzmocnienie system promptu
Focus
Walidacja danych wejściowych użytkownika
Manipulation
Walidacja odpowiedzi agenta
Content, Custom Guardrails

Gotowe zabezpieczenia

Gotowe zabezpieczenia obejmują najczęstsze obszary ryzyka.

Focus Guardrail wzmacnia system prompt twojego agenta, pomagając utrzymać odpowiedzi na temat, adekwatne i zgodne z określonymi celami oraz instrukcjami. To szczególnie przydatne w długich lub złożonych rozmowach, gdy agent łatwiej odchodzi od zamierzonych celów.

Manipulation Guardrails wykrywają i blokują próby obejścia instrukcji systemowych przez użytkowników. Po włączeniu system analizuje dane wejściowe użytkownika pod kątem wzorców wskazujących na prompt injection lub próby nadpisania instrukcji i może zakończyć rozmowę stwarzającą zagrożenie dla bezpieczeństwa.

Content Guardrails pomagają zapewnić odpowiednie odpowiedzi agenta, sprawdzając wiele kategorii potencjalnie wrażliwych lub niebezpiecznych treści. Każda z nich ma regulowany próg, co pozwala na precyzyjną kontrolę.

Custom Guardrails: twoje zasady, egzekwowane automatycznie

Custom Guardrails pozwalają definiować zasady specyficzne dla danej branży w języku naturalnym i automatycznie egzekwować je w każdej rozmowie. Pomaga to ograniczać incydenty, eskalacje i cykle kontroli zgodności, które mogą opóźniać wdrożenie.

Custom Guardrail Configuration Example

Lekki model ocenia każdą odpowiedź agenta według twoich zasad i podejmuje decyzję o blokadzie lub zezwoleniu. Działa niezależnie i równolegle z generowaniem odpowiedzi.

Pełna kontrola nad działaniem guardrails

Możesz określić, jak wykrywane są naruszenia zasad i co dzieje się dalej.

Tryby działania. Ustaw kompromis między szybkością a rygorystycznością — kluczowy dla głosu, gdzie opóźnienia mają największe znaczenie. Możesz uruchamiać guardrails równolegle z odpowiedzią, niemal bez opóźnień, choć przed przechwyceniem może zostać odtworzony ułamek sekundy audio. Możesz też wstrzymać odpowiedzi do pełnej weryfikacji — będzie trochę wolniej, ale nic nie dotrze do użytkownika bez sprawdzenia.

Strategie wyjścia. Gdy guardrail zostanie uruchomiony, określasz, co stanie się dalej: zakończenie rozmowy, przekazanie jej innemu agentowi, eskalacja do człowieka lub ponowienie odpowiedzi z instrukcjami korygującymi.

Poziomy wrażliwości treści. Dostosuj czułość dla poszczególnych kategorii treści: zaostrz egzekwowanie w zastosowaniach o wyższym ryzyku i złagodź je tam, gdzie nadmierne blokowanie pogorszyłoby doświadczenie użytkownika.

Szczegółowa konfiguracja. Każdy guardrail można osobno włączyć lub wyłączyć, a różni agenci mogą działać z różnymi konfiguracjami.

Pełna widoczność. Każde uruchomienie jest rejestrowane w analityce rozmów — wraz z informacją, który guardrail zadziałał i jakie działanie podjęto. Dzięki temu zespoły mają dane potrzebne do ulepszania z czasem system promptów i guardrails.

Redakcja historii rozmów

Po zakończeniu rozmowy możesz automatycznie usunąć wrażliwe informacje z transkrypcji, nagrań i danych webhooków. Zachowaj wszystko, czego potrzebujesz do analityki, QA i szkoleń, usuwając to, czego nie potrzebujesz.

Wykryte encje są zastępowane placeholderami w tekście i sygnałami dźwiękowymi w audio. Kontrolujesz szczegółowość aż do pojedynczych typów encji: możesz redagować wszystkie imiona i nazwiska lub tylko nazwiska, wszystkie identyfikatory finansowe lub tylko numery kart płatniczych.

To uzupełnia szersze mechanizmy kontroli danych, takie jak Zero Retention Mode, który można stosować we wdrożeniach z bardziej rygorystycznymi wymogami zgodności.

Conversation History Redaction Example

Redakcja historii rozmów i Zero Retention Mode są dostępne dla klientów enterprise. Skontaktuj się ze sprzedażą, aby uzyskać dostęp.

Część szerszych podstaw zaufania i bezpieczeństwa

Guardrails 2.0 i funkcje prywatności danych wspierają wdrożenia ElevenAgents w firmach, wraz z narzędziami bezpieczeństwa na każdym etapie cyklu życia agenta:

Tworzenie agenta

  • Projektowanie system promptu, konfiguracja guardrails, red teaming i symulacje do testowania zachowania pod obciążeniem, zanim agenci trafią do użytkowników

Każda rozmowa

  • W trakcie: Guardrails 2.0 (Focus, Manipulation, Content i Custom Guardrails), logowanie, opcjonalny Zero Retention Mode
  • Po rozmowie: Kryteria oceny, monitoring, opcjonalna redakcja historii rozmów

Razem dają zespołom kontrolę potrzebną do przejścia od pilotażu do produkcji z mniejszą liczbą incydentów, szybszymi cyklami zatwierdzania i bardziej spójnym działaniem agentów. Te podstawy platformy wspierają też kwalifikację do certyfikacji AIUC-1 i dostęp do pierwszych w branży polis ubezpieczeniowych dla agentów.

Zacznij korzystać z Guardrails już dziś

W ciągu ostatnich kilku miesięcy stopniowo udostępnialiśmy kolejne funkcje, a pełen pakiet Guardrails 2.0 jest już dostępny w wersji alfa w ElevenAgents.

Włącz je w karcie Security w ustawieniach agenta lub skonfiguruj przez API. Aby dowiedzieć się więcej o wdrożeniach enterprise, skontaktuj się z naszym zespołem sprzedaży.

Wskazówki dotyczące konfiguracji i dobre praktyki znajdziesz tutaj:

Uzyskaj dostęp do firmowych mechanizmów kontroli danych

Szukasz czegoś innego? Zajrzyj do Centrum pomocy

Podobne artykuły

Twórz z najwyższej jakości audio AI