Guardrails
Kontroluj zachowanie agentów na produkcji dzięki zabezpieczeniom, które dbają o bezpieczeństwo, zgodność i niezawodność odpowiedzi.
Omówienie
Guardrails dają zespołom skuteczny sposób zarządzania zachowaniem agentów na produkcji, dzięki czemu trzymają się tematu i marki oraz są odporne na manipulacje — także na skalę korporacyjną.
W Guardrails 2.0 przeprojektowaliśmy warstwę bezpieczeństwa, aby zespoły mogły łatwiej definiować własne zasady prostym językiem, włączać gotowe zabezpieczenia, określać, co ma się stać po uruchomieniu Guardrail, i pewnie wdrażać agentów w istotnych workflow.
Guardrails kierują agentów ku właściwym odpowiedziom i zatrzymują niewłaściwe, zanim dotrą do użytkownika. Chronią rozmowy na wielu poziomach: kształtują sposób odpowiedzi agenta, sprawdzają dane wejściowe użytkownika i niezależnie oceniają każdą odpowiedź bez dodatkowych opóźnień. Razem zmniejsza to ryzyko dla marki i zgodności w każdej rozmowie.
Jak działają Guardrails
Guardrails chronią rozmowy na trzech poziomach:
Wzmocnienie promptu systemowego: Główny sposób kontrolowania zachowania agenta. Dodajesz w prompcie systemowym jasne wskazówki dotyczące dozwolonych i niedozwolonych zachowań oraz włączasz Focus Guardrail, aby wzmacniać te instrukcje przez całą rozmowę. To pozwala utrzymać agenta na właściwym torze w zdecydowanej większości interakcji.
Walidacja danych wejściowych użytkownika: Siatka bezpieczeństwa, która wyłapuje wrogie próby, zanim agent w ogóle odpowie. Guardrails analizują wypowiedzi użytkownika, wykrywają próby prompt injection i manipulacji oraz mogą kończyć rozmowy stwarzające ryzyko bezpieczeństwa.
Walidacja odpowiedzi agenta: Ostatnia kontrola, która niezależnie ocenia w czasie rzeczywistym każdą odpowiedź agenta względem skonfigurowanych zasad. Jeśli agent ma powiedzieć coś, co łamie twoje reguły mimo promptu systemowego, walidatory odpowiedzi blokują to przed dostarczeniem.
Wzmocnienie promptu systemowego to podstawa. Walidacja danych wejściowych i odpowiedzi koryguje wszystko, co przejdzie przez szczeliny. W przypadku najważniejszych zasad uwzględnij je zarówno w prompcie systemowym, jak i jako niezależny własny Guardrail — daje to wielowarstwową ochronę, więc nawet jeśli LLM odejdzie od instrukcji, walidator odpowiedzi wyłapie to przed dostarczeniem.
Wzmocnienie promptu systemowego
Najskuteczniejszym sposobem, by agent zachowywał się zgodnie z oczekiwaniami, jest napisanie dobrego promptu systemowego i włączenie Focus Guardrail. Razem od początku kierują agentów ku właściwym odpowiedziom.
Za pomocą promptu systemowego możesz przekazać jasne instrukcje, co agent powinien, a czego nie powinien robić. Modele są dostrojone, by zwracać szczególną uwagę na nagłówek # Guardrails. Użyj go dla najważniejszych zasad zachowania.
Pełne wskazówki dotyczące pisania skutecznych promptów systemowych znajdziesz w naszym przewodniku po promptach. Zespół ElevenLabs obsługujący twoje konto może też pomóc w tworzeniu wysokiej jakości promptów systemowych.
Focus Guardrail: Focus Guardrail wzmacnia prompt systemowy agenta, pomagając utrzymać odpowiedzi w wyznaczonym kierunku, na temat i zgodne z określonymi celami oraz instrukcjami. Jest szczególnie przydatny w długich lub złożonych rozmowach, gdy agent może łatwiej odejść od zamierzonych celów.
Połączenie wzmocnienia promptu systemowego i włączenia Focus Guardrail to najskuteczniejszy sposób kierowania agentów ku właściwym odpowiedziom.
Walidacja danych wejściowych użytkownika
Guardrails manipulacji
Wykrywa i blokuje próby skłonienia agenta przez użytkowników do obejścia jego instrukcji. Po włączeniu system analizuje dane wejściowe użytkownika pod kątem wzorców wskazujących na próby injection lub nadpisania instrukcji i może kończyć rozmowy stwarzające ryzyko bezpieczeństwa.
Walidacja odpowiedzi agenta
Zabezpieczenia treści
Wykrywają i blokują nieodpowiednie treści w odpowiedziach agenta, takie jak materiały wrażliwe politycznie, seksualnie jednoznaczne lub zawierające przemoc, zanim dotrą do użytkownika. Pomagają utrzymać odpowiedzi odpowiednie dla przeznaczenia i odbiorców twojego agenta.
Własne zabezpieczenia
Gdy agenci podejmują się zadań o dużym znaczeniu, zespoły potrzebują jasnej kontroli nad ich zachowaniem. Własne zabezpieczenia pozwalają skonfigurować najważniejsze zasady dla twojej firmy. Na przykład:
- Asystent sklepu nie powinien zwracać pieniędzy za produkty, które się do tego nie kwalifikują.
- Recepcjonista w placówce medycznej nie powinien udzielać porad medycznych.
- Agent bankowy nie powinien rekomendować inwestycji.
Własne zabezpieczenia to reguły oparte na LLM, które pozwalają definiować własne kryteria blokowania za pomocą promptów w języku naturalnym. Każde włączone własne zabezpieczenie wysyła odpowiedzi agenta do lekkiego modelu, który ocenia je według twojej reguły i zwraca decyzję o zablokowaniu lub dopuszczeniu. Daje ci to elastyczną, dostosowaną do domeny kontrolę nad tym, co agent może, a czego nie może powiedzieć.
Dla każdego własnego zabezpieczenia możesz określić:
Własne zabezpieczenia mogą blokować konkretne tematy istotne dla twojej firmy, egzekwować wymagania zgodności specyficzne dla branży i wdrażać własne środki bezpieczeństwa. Każde z nich możesz osobno włączać lub wyłączać bez usuwania, a gdy włączonych jest kilka, działają równolegle z innymi zabezpieczeniami. Wszystkie wykryte naruszenia są zapisywane do wglądu.
Tryb wykonania
Tryb wykonania określa, czy zabezpieczenia dodają czas oczekiwania, zanim użytkownik zobaczy lub usłyszy odpowiedź.
W trybie streaming odpowiedź agenta może zacząć się przed uruchomieniem zabezpieczenia; w przypadku głosu niewielka część audio (często poniżej 500 ms) może zostać odtworzona, zanim blokada zakończy rozmowę. W agentach tekstowych użytkownicy mogą zobaczyć częściową lub pełną odpowiedź, jeśli ocena nie zakończy się przed jej dostarczeniem.
W trybie Blocking agent odpowiada dopiero po zweryfikowaniu zabezpieczeń. Zwykle dodaje to 200–500 ms opóźnienia.
Strategie wyjścia
Strategie wyjścia pozwalają określić, co agent zrobi po uruchomieniu zabezpieczenia. Możesz wybrać:
end_call(domyślnie): natychmiast kończy rozmowęretry: generuje odpowiedź ponownie z użyciem twojej informacji zwrotnej, zamiast przerywać rozmowę. Odpowiedź agenta jest ponawiana maksymalnie trzy razy, a jeśli każda próba nadal narusza zabezpieczenie, rozmowa zostaje zakończona.
Ponawianie działa tylko w trybie blokującym. W trybie streaming zakończenie rozmowy jest jedyną dostępną strategią wyjścia.
Informacja zwrotna przy ponowieniu
Informacja zwrotna Retry może zawierać dowolne instrukcje, które mają zostać zastosowane w następnej turze — jest wstrzykiwana jako wskazówka systemowa, zanim model wygeneruje odpowiedź ponownie. Obejmuje to wywoływanie narzędzi systemowych, takich jak transfer_to_agent lub transfer_to_number. Oto przykłady konfiguracji informacji zwrotnej przy ponowieniu:
- Ogólna odmowa (domyślnie)
Twoja odpowiedź została zablokowana przez zabezpieczenie blokujące treści pasujące do tego warunku/kategorii: ‘{{trigger_reason}}’. W następnej turze musisz powiedzieć użytkownikowi: „Przykro mi, ale nie mogę odpowiedzieć na to pytanie. Czy chcesz dowiedzieć się czegoś innego?” - Ponowienie z instrukcjami korygującymi
Twoja poprzednia odpowiedź została zablokowana przez zabezpieczenie. Zablokowana odpowiedź brzmiała: ‘{{agent_message}}’. W następnej turze musisz udzielić nowej odpowiedzi, która nie może naruszać: ‘{{trigger_reason}}’. - Przekazanie do innego agenta
Twoja poprzednia odpowiedź została zablokowana przez zabezpieczenie. W następnej turze musisz użyć narzędzia transfer_to_agent i przekazać rozmowę do agenta. Zablokowana odpowiedź brzmiała: ‘{{agent_message}}’. Zabezpieczenie blokuje treści pasujące do tego warunku/kategorii: ‘{{trigger_reason}}’. - Przekazanie do człowieka
Twoja odpowiedź została zablokowana przez zabezpieczenie blokujące treści pasujące do tego warunku/kategorii: ‘{{trigger_reason}}’. W następnej turze MUSISZ przekazać rozmowę do operatora za pomocą narzędzia transfer_to_number.
Aby używać narzędzi systemowych w informacji zwrotnej przy ponowieniu, włącz i skonfiguruj odpowiednie narzędzia w ustawieniach agenta. Można wywoływać tylko narzędzia skonfigurowane dla agenta.
W tekście informacji zwrotnej możesz użyć tych symboli zastępczych:
Tryb wykonania streaming jest zalecany dla agentów głosowych, a tryb blocking dla agentów tekstowych.
Tryb blocking (zwłaszcza z retry) może działać mniej przewidywalnie w przypadku głosu. Jeśli używasz blokowania dla głosu, dokładnie je przetestuj albo wybierz end call zamiast retry, dopóki nie masz pewności co do działania.
Cennik
Zabezpieczenia Focus, Manipulation i Content są dostępne bez dodatkowych opłat dla wszystkich użytkowników ElevenAgents.
Własne zabezpieczenia są rozliczane według użycia i wiążą się z dodatkowymi kosztami LLM, podobnie jak inne wywołania modeli w ElevenAgents. Każde włączone własne zabezpieczenie wysyła każdą odpowiedź agenta do lekkiego modelu do oceny, więc koszt zależy od długości promptu, średniej długości rozmowy i liczby rozmów. Jeśli włączysz kilka własnych zabezpieczeń, każde z nich przeprowadza własną ocenę każdej odpowiedzi. Przed włączeniem wielu własnych zabezpieczeń w środowisku produkcyjnym zalecamy sprawdzić oczekiwany ruch i wybór modelu.
Podczas tworzenia lub edycji własnego zabezpieczenia możesz zobaczyć szacowany koszt (pod promptem).
Ponowienia a koszt: Każda próba to dodatkowe wygenerowanie odpowiedzi przez agenta i kolejna ocena zabezpieczenia, więc retry zwiększa rozliczenie według użycia w porównaniu z end_call (do trzech prób na zablokowaną turę).
Konfiguracja
Konfiguracja w panelu
Konfiguracja przez CLI
Konfiguracja przez API
Włącz zabezpieczenia
Włącz kategorie zabezpieczeń, których chcesz użyć. Za pomocą gotowych przycisków możesz szybko włączyć lub wyłączyć wszystkie kategorie.
Skonfiguruj tryb wykonania i strategię wyjścia (własne zabezpieczenia i zabezpieczenia treści)
Dla każdego własnego zabezpieczenia lub zabezpieczenia treści wybierz tryb wykonania streaming albo blocking.
Blocking sprawdza się w agentach tekstowych, a streaming w agentach głosowych. Ustaw Action on
guardrail violation (odpowiada trigger_action): end call w dowolnym trybie albo retry
tylko po wybraniu blocking (retry nie jest dostępne w streaming). Jeśli wybierzesz
retry, edytuj Feedback to inject when retrying, aby ukierunkować model. Użyj symboli zastępczych
{{trigger_reason}} (własny prompt lub kategoria treści, która spowodowała
blokadę) oraz {{agent_message}} w szablonie.
Gdy zabezpieczenie się uruchomi, działanie zależy od typu i konfiguracji:
- Zakończenie rozmowy: Sesja kończy się natychmiast (połączenie zostaje rozłączone w przypadku głosu, a czat kończy się w przypadku tekstu). Uruchomienie zabezpieczenia jest zapisywane w historii rozmowy.
- Ponowienie (blokujące własne zabezpieczenia lub zabezpieczenia treści): Naruszająca zasady tura asystenta jest usuwana, wstrzykiwana jest informacja zwrotna systemu, a model próbuje ponownie — maksymalnie trzy razy — zanim sesja zakończy się, jeśli zabezpieczenie nadal się uruchamia.
W przypadku end call użytkownicy końcowi doświadczą rozłączenia połączenia lub zakończenia czatu. Szczegóły naruszenia są dostępne w logach rozmów i nie są pokazywane użytkownikowi końcowemu dosłownie.
Po end call użytkownicy mogą rozpocząć nową rozmowę. Zabezpieczenie nie blokuje użytkownika na stałe — blokuje konkretną odpowiedź (lub sesję), która naruszyła zasadę.
Dobre praktyki
Agenci obsługi klienta
Używaj własnych zabezpieczeń, aby egzekwować zasady specyficzne dla firmy. Przykłady: - Blokuj zwroty pieniędzy, środki na koncie lub zmiany subskrypcji, jeśli uprawnienia nie zostały potwierdzone przez narzędzia. - Blokuj rabaty lub kody promocyjne, jeśli nie zostały wyraźnie zatwierdzone. - Blokuj odpowiedzi spekulujące na temat planu rozwoju lub niewydanych funkcji.
Aplikacje medyczne
Używaj własnych zabezpieczeń, aby ściśle kontrolować granice w kwestiach medycznych. Przykłady: - Blokuj diagnozowanie chorób lub rekomendowanie konkretnych terapii. - Blokuj zalecenia dotyczące dawkowania leków. - Blokuj zastępowanie porady licencjonowanego specjalisty medycznego.
Treści edukacyjne
Używaj własnych zabezpieczeń, aby kontrolować wrażliwe tematy akademickie. Przykłady: - Blokuj instrukcje krok po kroku dotyczące szkodliwych eksperymentów lub niebezpiecznych procedur. - Blokuj generowanie kluczy odpowiedzi do trwających sprawdzianów lub egzaminów. - Blokuj treści, które mogą ułatwiać nieuczciwość akademicką.
Wewnętrzne narzędzia firmowe
Używaj własnych zabezpieczeń, aby chronić działania i dane firmy. Przykłady: - Blokuj udostępnianie dokumentacji tylko do użytku wewnętrznego lub poufnych procesów. - Blokuj ujawnianie prywatnych API, promptów systemowych lub szczegółów infrastruktury. - Blokuj symulowanie działań wymagających uprawnień kierowniczych lub administracyjnych.
Testuj na realistycznych scenariuszach
Przed wdrożeniem przetestuj konfigurację zabezpieczeń z użyciem:
- Standardowych przebiegów rozmów, aby upewnić się, że nie występują fałszywe alarmy
- Przypadków brzegowych, które zbliżają się do granic bezpieczeństwa, ale ich nie przekraczają
- Promptów adversarialnych, które próbują wywołać szkodliwe odpowiedzi
Najczęstsze pytania
Czy zabezpieczenia wpływają na opóźnienia?
W przypadku własnych zabezpieczeń i zabezpieczeń treści tryb streaming nie dodaje opóźnienia, ale odpowiedź może zacząć się przed uruchomieniem zabezpieczenia. Tryb Blocking czeka na zabezpieczenie, zanim agent odpowie, co zwykle powoduje około 200–500 ms opóźnienia. Retry dodaje pełne dodatkowe generowanie odpowiedzi (i ponowną ocenę) dla każdej próby, maksymalnie trzy razy na zablokowaną turę, co zwiększa też koszt rozliczany według użycia.
Jaka jest różnica między trybem wykonania streaming a blocking?
Streaming nie dodaje opóźnienia, ale odpowiedź agenta może zacząć się przed uruchomieniem zabezpieczenia. Blocking czeka na wynik zabezpieczenia, zanim agent odpowie (zwykle 200–500 ms opóźnienia). Retry jako strategia wyjścia (trigger_action) jest dostępna tylko w trybie **blocking **; w trybie streaming po uruchomieniu zabezpieczenia używasz **end call **. Blocking umożliwia retry z wstrzykniętą informacją zwrotną systemu zamiast natychmiastowego zakończenia rozmowy — kosztem dodatkowego użycia modelu i **dodatkowych opłat **, gdy występują ponowienia. Tryb blocking jest zalecany dla agentów **tekstowych **, a streaming dla agentów **głosowych **.
Czy mogę całkowicie wyłączyć zabezpieczenia?
Tak, ale zdecydowanie zalecamy pozostawienie włączonych wszystkich zabezpieczeń — zwłaszcza Focus Guardrail. Chronią twoją markę, użytkowników i zgodność z wymaganiami, dlatego zalecamy je we wszystkich aplikacjach produkcyjnych, także w narzędziach wewnętrznych. W rzadkich przypadkach możesz chcieć wyłączyć konkretne zabezpieczenie, jeśli przeszkadza ono w zamierzonym zastosowaniu agenta. Na przykład niektóre aplikacje mogą dotyczyć tematów, które w innym przypadku zostałyby oznaczone przez Content Guardrail, albo silnie dostosowany prompt systemowy może nie działać prawidłowo przy włączonym Focus Guardrail. Każde zabezpieczenie można osobno włączać lub wyłączać.
Czy użytkownicy mogą odwołać się od decyzji zabezpieczenia?
Uruchomienia zabezpieczeń są zapisywane i można je sprawdzać w analityce rozmów. Jeśli wykryjesz fałszywe alarmy, dostosuj prompty zabezpieczeń. Nie ma zautomatyzowanego procesu odwoławczego — użytkownik powinien po prostu rozpocząć nową rozmowę.
Jak sprawdzić, które zabezpieczenie się uruchomiło?
Informacje o tym, które zabezpieczenie się uruchomiło, są dostępne w logach rozmów.
Czy powinienem używać zarówno zabezpieczeń, jak i wzmacniania promptu systemowego?
Tak. Służą one uzupełniającym się celom. Wzmacnianie promptu systemowego zapewnia wskazówki dotyczące zachowania i zapobiega większości problemów dzięki wykonywaniu instrukcji. Zabezpieczenia platformy zapewniają niezależne egzekwowanie zasad jako dodatkową warstwę bezpieczeństwa. Używanie obu rozwiązań tworzy obronę wielowarstwową.
Kolejne kroki
- Przewodnik po promptach: Dowiedz się, jak pisać skuteczne prompty systemowe z zabezpieczeniami zachowania
- Prywatność: Skonfiguruj przechowywanie danych i ustawienia prywatności
- Testowanie: Testuj agenta w różnych scenariuszach
- Symulowanie rozmów: Programowo testuj konfiguracje zabezpieczeń
- Redakcja historii rozmów: Usuwaj z historii rozmów wrażliwe informacje, takie jak imiona i dane bankowe
Status wydania
Guardrails jest obecnie w fazie Alpha. Aktywnie ulepszamy produkt i rozwijamy jego możliwości. Przed ogólną dostępnością zestaw funkcji, ustawienia domyślne, kontrolki w panelu i pola API będą się dalej zmieniać, a niektóre zmiany mogą powodować problemy ze zgodnością.
W miarę ulepszania Guardrails zalecamy sprawdzanie konfiguracji i monitorowanie działania reguł w logach. Warto też wracać do konfiguracji wraz z kolejnymi aktualizacjami.