Introducing Eleven v4Introducing Eleven v4, our fastest and most emotive voice model

Przejdź do treści

Nasz wielowarstwowy system zabezpieczeń dla agentów AI

Opublikowano
Ostatnia aktualizacja

PosłuchajPosłuchaj tego artykułu

Gdy agenci AI wykonują zadania o dużej wadze, zespoły muszą mieć pewność, że będą działać bezpiecznie i przewidywalnie. 

W ElevenAgents stosujemy wielowarstwową architekturę zabezpieczeń: zabezpieczenia na każdym etapie rozmowy, testy adversarialne przed wdrożeniem, monitorowanie na produkcji, ochronę danych i niezależną walidację. 

Żaden niedeterministyczny system nie ochroni przed każdym ryzykiem, ale dzięki temu kompleksowemu podejściu do bezpieczeństwa czołowe firmy i instytucje publiczne budujące na ElevenAgents mogą tworzyć agentów, którzy rzadko zawodzą, dobrze radzą sobie z błędami i spełniają wysokie standardy bezpieczeństwa.

Ochrona na każdym etapie rozmowy

Możesz łatwo włączyć i skonfigurować mechanizmy chroniące wszystkie trzy etapy każdej interakcji. To podstawa Guardrails 2.0 w ElevenAgents.

Dane wejściowe – Kontrole w czasie rzeczywistym tego, co wysyła użytkownik.

  • Zabezpieczenia przed manipulacją niezależnie analizują dane wejściowe użytkownika i mogą zakończyć rozmowę, gdy wykryją oznaki prompt injection.

Decyzja – Jak agent jest prowadzony i utrzymywany na właściwym torze, gdy decyduje, co zrobić.

  • Prompty systemowe powinny zawierać jasne instrukcje dla agenta, np. unikanie nieodpowiednich tematów, określenie, jak agent się przedstawia, i ograniczenie jego zakresu działania.
  • Workflow i procedury mogą wymagać wywołania narzędzia przed wykonaniem najbardziej wrażliwych działań, np. weryfikacji tożsamości dzwoniącego przed udostępnieniem danych konta.
  • Zabezpieczenie Focus wzmacnia istniejące instrukcje systemowe i ogranicza odchylenia, co jest szczególnie ważne w długich lub złożonych interakcjach.

Dane wyjściowe – Niezależne walidatory działają równolegle z generowaniem odpowiedzi, dodając minimalne opóźnienie. Możesz je włączyć, by blokować odpowiedzi zawierające wrażliwe treści lub naruszające twoje zasady.

  • Zabezpieczenia treści sprawdzają wrażliwe kategorie z osobnymi progami dla każdej z nich.
  • Niestandardowe zabezpieczenia egzekwują reguły specyficzne dla danej dziedziny, zapisane prostym językiem i oceniane przez lekki model.
  • Strategie wyjścia pozwalają określić, co dzieje się po uruchomieniu zabezpieczenia: zakończenie rozmowy, przekazanie jej człowiekowi lub ponowienie odpowiedzi z instrukcjami korygującymi.

Solidne testy przed wdrożeniem

ElevenAgents oferuje rozbudowane funkcje testowania, dzięki którym osoby budujące na naszej platformie mogą znajdować i naprawiać problemy, zanim agent lub zmiana konfiguracji trafi na produkcję.

Symulacje pozwalają przeprowadzić pełną, wieloturową rozmowę z symulowanym użytkownikiem przed prawdziwą interakcją. Określasz scenariusz, a symulator prowadzi rozmowę do rozwiązania, także z prawdziwymi lub pozorowanymi wywołaniami narzędzi. Ponieważ kontrolujesz symulowanego użytkownika, możesz sprawić, by był wrogi lub manipulacyjny. Ten sam mechanizm, który sprawdza standardowe ścieżki, testuje więc także te adversarialne.

Zakres testów rozszerzają dodatkowe funkcje:

  • Wielokrotne uruchomienia wykonują test wiele razy, grupując błędy według przyczyn, aby ujawnić wzorce błędów i przypadki brzegowe.
  • Testy następnej odpowiedzi i wywołań narzędzi sprawdzają pojedyncze odpowiedzi i kluczowe działania.
  • Testy dla konkretnych kanałów sprawdzają, czy agent działa zgodnie z oczekiwaniami w każdym kanale, w którym jest dostępny, ponieważ odpowiedzi agenta można dostosować do kanału (np. zwięzłe w rozmowie, a szczegółowe w e-mailu).
  • Red-teaming przez API. Testy możesz też uruchamiać przez API za pomocą SDK do red-teamingu.

Ocena i ulepszanie agentów po wdrożeniu

Po wdrożeniu agentów oceny są stale prowadzone na aktywnych rozmowach. Dzięki podejściu LLM-as-a-judge każda rozmowa może być automatycznie oceniona według ustawionych przez ciebie kryteriów. Wyniki możesz przeglądać w panelach, a problemy śledzić w szczegółowych logach rozmów z przeszukiwalnymi transkrypcjami, źródłami, wywołaniami narzędzi i aktywacjami zabezpieczeń.

Problemy wykryte na produkcji możesz łatwo przekazać z powrotem do pakietu testów. Gdy proponowana jest zmiana, możesz użyć Experiments do skierowania części aktywnego ruchu do wariantu i zmierzenia rzeczywistych wyników, zanim wdrożysz go szerzej.

Zalecamy wdrażanie etapami. Skieruj ograniczoną część ruchu do agenta, oceń te rozmowy, a gdy potwierdzisz, że agent działa zgodnie z oczekiwaniami, rozszerz wdrożenie o kolejne zastosowania, kanały lub regiony.

Ochrona wrażliwych danych

Agenci mogą obsługiwać dane płatnicze, informacje o zdrowiu i identyfikatory osobowe, dlatego warto rozważyć, jakie dane są przechowywane, gdzie i jak długo. 

Oferujemy klientom różne mechanizmy ochrony danych:

  • Zero Retention Mode można włączyć dla kwalifikujących się usług, aby nie przechowywać określonych typów danych. Rozwiązanie jest przeznaczone dla wymagających środowisk regulacyjnych.
  • Redakcja historii rozmów usuwa wrażliwe informacje po rozmowie, zastępując je placeholderami w tekście i sygnałami dźwiękowymi w audio, nawet na poziomie pojedynczych typów danych.
  • Konfigurowalny okres przechowywania dopasowuje czas przechowywania do twoich wymogów regulacyjnych.
  • Rezydencja danych utrzymuje przetwarzanie danych w wymaganej jurysdykcji.
  • Prywatne wdrożenia (VPC) izolują środowisko dla zadań o wysokiej wrażliwości.
  • Szyfrowanie chroni dane podczas przesyłania i przechowywania.

Zabezpieczenia na poziomie platformy i zewnętrzna walidacja

Wszystko powyższe opiera się na naszych szerszych zabezpieczeniach na poziomie platformy, czyli kompleksowym programie obejmującym pochodzenie treści, wykrywanie nadużyć, egzekwowanie zakazów użycia i red-teaming modeli. W ramach naszego Programu Partnerstwa na rzecz Bezpieczeństwa współpracujemy też z firmami stojącymi na czele bezpieczeństwa AI, wspierając ich produkty i rozwijające się standardy branżowe.

Nasze podejście poddajemy też niezależnej ocenie, w tym pod kątem ogólnych standardów bezpieczeństwa i prywatności, takich jak SOC 2 Type II, ISO 27001 i RODO, oraz certyfikatów dla konkretnych branż i zastosowań, takich jak PCI DSS Level 1 dla przetwarzania płatności i HIPAA dla amerykańskiej ochrony zdrowia. Więcej informacji znajdziesz w naszym centrum zaufania.

Spełniamy też nowsze standardy stworzone z myślą o AI, takie jak ISO 42001 dotyczący systemów zarządzania AI oraz AIUC-1, który wymaga, by agenci AI przechodzili kwartalne symulacje adversarialne prowadzone przez niezależnych ewaluatorów. Te same możliwości, które stoją za AIUC-1, zapewniają też dostęp do jednych z pierwszych w branży polis ubezpieczeniowych dla agentów.

Przy dużych lub złożonych wdrożeniach nasi Forward Deployed Engineers współpracują z twoim zespołem przy projektowaniu i wdrażaniu strategii dla agentów, w tym konfiguracji, zabezpieczeń, testowania, monitorowania i strategii wdrożenia. 

Podsumowanie

Nasze podejście do bezpieczeństwa w ElevenAgents jest wielowarstwowe, a każdy element wzmacnia pozostałe:

  • Konfiguracja agenta: Prompty systemowe, workflow i procedury, które kształtują zachowanie, a najbardziej wrażliwe działania wymagają wywołań narzędzi.
  • Zabezpieczenia: Niezależne kontrole na każdym etapie: wykrywanie manipulacji na wejściu, Focus na etapie decyzji oraz walidatory treści i niestandardowe na wyjściu, z konfigurowalnymi strategiami wyjścia.
  • Testowanie: Symulacje adversarialne, wielokrotne uruchomienia, testy dla konkretnych kanałów i red-teaming przed wdrożeniem.
  • Monitorowanie: Etapowe wdrożenie, a następnie ciągła ocena, przeszukiwalne logi i transkrypcje oraz pętla informacji zwrotnej po wdrożeniu.
  • Ochrona danych: Redakcja, Zero Retention Mode, konfigurowalny okres przechowywania, rezydencja danych, prywatne wdrożenia (VPC) i szyfrowanie.
  • Zewnętrzna walidacja: Certyfikaty, niezależne testy adversarialne AIUC-1, ubezpieczenie agentów, red-teaming i wsparcie ekspertów.

Wdrażaj agentów z zabezpieczeniami klasy korporacyjnej

Szukasz czegoś innego? Zajrzyj do Centrum pomocy

Podobne artykuły

Twórz z najwyższej jakości audio AI