Hoppa till innehållet

Vårt lagerbaserade säkerhetsramverk för AI-agenter

Publicerad
Senast uppdaterad

LyssnaLyssna på den här artikeln

När AI-agenter tar sig an uppgifter med höga insatser behöver team kunna lita på att deras agenter agerar säkert och förutsägbart. 

I ElevenAgents använder vi en säkerhetsarkitektur i flera lager, med skyddsräcken i varje steg av en konversation, adversarial testning före lansering, övervakning i produktion, dataskydd och oberoende validering. 

Inget icke-deterministiskt system kan skydda mot alla risker, men med detta omfattande säkerhetsramverk kan ledande företag och myndigheter som bygger med ElevenAgents skapa agenter som sällan misslyckas, återhämtar sig smidigt och uppfyller höga säkerhetskrav.

Skydd i varje steg av konversationen

Du kan enkelt aktivera och konfigurera kontroller som skyddar de tre stegen i varje interaktion. Det är grunden för Guardrails 2.0 i ElevenAgents.

Indata – Kontroller i realtid av det användaren skickar.

  • Skyddsräcken mot manipulation analyserar användarindata separat och kan avsluta konversationer som visar tecken på prompt injection.

Beslut – Hur agenten styrs och hålls på rätt spår när den avgör vad den ska göra.

  • Systemprompter bör innehålla tydliga instruktioner för agenten, till exempel att undvika olämpliga ämnen, definiera hur agenten presenterar sig och begränsa dess omfattning.
  • Workflows och procedurer kan begränsa de mest känsliga åtgärderna till verktygsanrop, till exempel att verifiera en uppringares identitet innan några kontouppgifter delas.
  • Skyddsräcket Focus förstärker de befintliga systeminstruktionerna och motverkar avvikelser, vilket är särskilt viktigt i långa eller komplexa interaktioner.

Utdata – Oberoende validerare körs parallellt med svarsgenereringen och tillför minimal fördröjning. De kan aktiveras för att blockera svar som innehåller känsligt innehåll eller bryter mot dina policyer.

  • Innehållsskyddsräcken granskar känsliga kategorier med tröskelvärden per kategori.
  • Anpassade skyddsräcken tillämpar domänspecifika regler skrivna på vanligt språk, där varje regel utvärderas av en lättviktig modell.
  • Avslutsstrategier låter dig definiera vad som händer när ett skyddsräcke aktiveras, till exempel att avsluta samtalet, koppla vidare till en människa eller försöka igen med korrigerande instruktioner.

Robusta tester före lansering

ElevenAgents erbjuder robusta testfunktioner så att de som bygger på plattformen kan hitta och åtgärda problem innan en agent eller konfigurationsändring tas i bruk.

Simuleringar låter dig köra en komplett konversation med flera turer med en simulerad användare före en verklig interaktion. Du definierar scenariot och simulatorn driver konversationen till en lösning, inklusive verkliga eller simulerade verktygsanrop. Eftersom du styr den simulerade användaren kan du göra den fientlig eller manipulativ, så att samma mekanism som validerar vanliga flöden även testar adversariala scenarier.

Flera funktioner utökar denna täckning:

  • Upprepade körningar kör ett test många gånger, där fel grupperas efter orsak för att synliggöra felmönster och gränsfall.
  • Tester av nästa svar och verktygsanrop kontrollerar enskilda svar och kritiska åtgärder.
  • Kanalspecifika tester verifierar att en agent fungerar som förväntat i varje kanal där den används, eftersom agentens svar kan anpassas efter kanal – till exempel kortfattat i ett samtal men utförligt via e-post.
  • Red-teaming via API. Tester kan även köras via API:et med SDK:er för red-teaming.

Utvärdera och förbättra agenter efter lansering

När du driftsätter dina agenter körs utvärderingar kontinuerligt på aktiva konversationer. Med en metod där en LLM fungerar som bedömare kan varje samtal automatiskt utvärderas mot de kriterier du anger. Du kan granska konversationsresultat i instrumentpaneler och spåra problem med detaljerade konversationsloggar som innehåller sökbara transkriptioner, källor, verktygsanrop och aktiverade skyddsräcken.

Problem som upptäcks i produktion kan enkelt återföras till testsviten. När en ändring föreslås kan du använda Experiments för att styra en del av den aktiva trafiken till en variant och mäta verkliga resultat innan den används brett.

Vi rekommenderar att du driftsätter i etapper. Styr en begränsad del av trafiken till din agent, utvärdera dessa konversationer och utöka sedan till fler användningsfall, kanaler eller regioner när du har verifierat att agenten fungerar som förväntat.

Skydda känsliga data

Agenter kan hantera betalningsuppgifter, hälsoinformation och personliga identifierare. Därför är det viktigt att tänka på vilka data som lagras, var de lagras och hur länge. 

Vi erbjuder flera olika mekanismer som hjälper kunder att skydda data:

  • Zero Retention Mode kan aktiveras för kvalificerade tjänster för att säkerställa att vissa typer av data inte lagras. Funktionen är utformad för krävande regelmiljöer.
  • Maskering av konversationshistorik tar bort känsliga entiteter efter ett samtal och ersätter dem med platshållare i text och pipljud i ljud, ned till enskilda entitetstyper.
  • Konfigurerbar lagringstid anpassar lagringsperioder efter dina regulatoriska krav.
  • Datalokalisering håller databehandlingen inom den jurisdiktion som krävs.
  • Privata driftsättningar (VPC) isolerar miljön för arbetsbelastningar med mycket känsliga data.
  • Kryptering skyddar data under överföring och lagring.

Skyddsåtgärder på plattformsnivå och extern validering

Allt ovanstående bygger på våra bredare skyddsåtgärder på plattformsnivå, ett omfattande program som omfattar innehållsursprung, upptäckt av missbruk, efterlevnad av förbud mot användning och red-teaming av modeller. Genom vårt Safety Partnership Program samarbetar vi också med företag i framkant inom AI-säkerhet och bidrar till deras produkter och nya branschstandarder.

Vi låter också oberoende granska vårt arbetssätt utifrån allmänna standarder för säkerhet och integritet, som SOC 2 Type II, ISO 27001 och GDPR, samt bransch- och användningsfallsspecifika certifieringar som PCI DSS Level 1 för betalningshantering och HIPAA för amerikansk hälso- och sjukvård. Läs mer i vårt trust center.

Vi uppfyller också nyare, AI-anpassade standarder som ISO 42001, som reglerar ledningssystem för AI, och AIUC-1, som kräver att AI-agenter klarar kvartalsvisa adversariala simuleringar från oberoende utvärderare. Samma funktioner bakom AIUC-1 ger också tillgång till några av branschens första försäkringar för agenter.

Vid stora eller komplexa utrullningar arbetar våra Forward Deployed Engineers tillsammans med ditt team för att utforma och genomföra er agentstrategi, inklusive konfiguration, skyddsräcken, testning, övervakning och utrullningsstrategi. 

Slutsats

Vår metod för säkerhet i ElevenAgents består av flera lager, där varje del förstärker de andra:

  • Agentkonfiguration: Systemprompter, workflows och procedurer som formar beteendet, där de mest känsliga åtgärderna begränsas till verktygsanrop.
  • Skyddsräcken: Oberoende kontroller i varje steg: identifiering av manipulation i indata, Focus i beslutsfattandet samt innehålls- och anpassade validerare i utdata, med konfigurerbara avslutsstrategier.
  • Testning: Adversariala simuleringar, upprepade körningar, kanalspecifika tester och red-teaming före lansering.
  • Övervakning: Stegvis utrullning, följt av kontinuerlig utvärdering, sökbara loggar och transkriptioner samt en återkopplingsloop efter lansering.
  • Dataskydd: Maskering, Zero Retention Mode, konfigurerbar lagringstid, datalokalisering, privata driftsättningar (VPC) och kryptering.
  • Extern validering: Certifieringar, AIUC-1:s oberoende adversariala testning, agentförsäkringar, red-teaming och expertstöd.

Liknande artiklar

Skapa med AI-ljud av högsta kvalitet