Il nostro framework di sicurezza a livelli per agenti IA
- Scritto da
- Louise Meyer-Schoenherr
- Pubblicato
- Ultimo aggiornamento
AscoltaAscolta questo articolo
Man mano che gli agenti IA svolgono attività ad alto impatto, i team devono poter contare sul fatto che si comportino in modo sicuro e prevedibile.
In ElevenAgents utilizziamo un'architettura di sicurezza a più livelli, che comprende guardrail in ogni fase della conversazione, test avversariali prima del lancio, monitoraggio in produzione, protezione dei dati e convalida indipendente.
Sebbene nessun sistema non deterministico possa proteggere da ogni rischio, questo framework di sicurezza completo consente alle principali aziende e istituzioni pubbliche che sviluppano con ElevenAgents di progettare agenti che raramente falliscono, si riprendono in modo efficace e rispettano standard di sicurezza elevati.
Protezione in ogni fase della conversazione
Puoi attivare e configurare facilmente i controlli che proteggono le tre fasi di ogni interazione. È la base di Guardrails 2.0 in ElevenAgents.
Input - Controlli in tempo reale su ciò che invia l'utente.
- Guardrail contro la manipolazione analizzano in modo indipendente l'input dell'utente e possono terminare le conversazioni che mostrano segnali di prompt injection.
Decisione - Come l'agente viene guidato e mantenuto sulla giusta rotta mentre decide cosa fare.
- System prompt dovrebbero includere istruzioni esplicite per l'agente, ad esempio evitare argomenti inappropriati, definire come si presenta e limitarne l'ambito di azione.
- Workflow e procedure possono subordinare le azioni più sensibili a tool call, ad esempio verificando l'identità di chi chiama prima di condividere qualsiasi dettaglio dell'account.
- Il guardrail Focus rafforza le istruzioni di sistema esistenti e attenua le deviazioni, un aspetto particolarmente importante nelle interazioni lunghe o complesse.
Output - I validatori indipendenti vengono eseguiti in parallelo alla generazione della risposta, aggiungendo una latenza minima. Puoi attivarli per bloccare le risposte che includono contenuti sensibili o violano le tue policy.
- Guardrail dei contenuti esaminano le categorie sensibili con soglie per ciascuna categoria.
- Guardrail personalizzati applicano regole specifiche per il dominio, scritte in linguaggio naturale e valutate singolarmente da un modello leggero.
- Strategie di uscita ti permettono di definire cosa accade quando si attiva un guardrail, ad esempio terminare la chiamata, trasferirla a una persona o riprovare la risposta con istruzioni correttive.
Test approfonditi prima del lancio
ElevenAgents offre solide funzionalità di test, così chi sviluppa sulla piattaforma può individuare e risolvere i problemi prima che un agente o una modifica della configurazione venga rilasciata.
Simulazioni ti consentono di eseguire una conversazione completa su più turni con un utente simulato prima di qualsiasi interazione reale. Definisci lo scenario e il simulatore porta la conversazione a una conclusione, incluse tool call reali o simulate. Poiché controlli l'utente simulato, puoi renderlo ostile o manipolativo: lo stesso meccanismo che convalida i percorsi abituali testa quindi anche quelli avversariali.
Diverse funzionalità ampliano questa copertura:
- Esecuzioni ripetute eseguono un test più volte, raggruppando gli errori per causa per evidenziare pattern di errore e casi limite.
- Test della risposta successiva e dell'invocazione dei tool verificano singole risposte e azioni critiche.
- Test specifici per canale verificano che un agente si comporti come previsto su ogni canale su cui viene distribuito, poiché i suoi output possono essere adattati al canale, ad esempio concisi al telefono ma approfonditi via email.
- Red teaming tramite API. Puoi eseguire i test anche tramite API con SDK di red teaming.
Valutare e migliorare gli agenti dopo il lancio
Quando distribuisci i tuoi agenti, le valutazioni vengono eseguite continuamente sulle conversazioni in tempo reale. Con un approccio LLM-as-a-judge, ogni chiamata può essere valutata automaticamente in base ai criteri che definisci. Puoi esaminare gli esiti delle conversazioni nelle dashboard e risalire ai problemi con log dettagliati che includono trascrizioni ricercabili, fonti, tool call e attivazioni dei guardrail.
Puoi reinserire facilmente nella suite di test gli eventuali problemi rilevati in produzione. Quando viene proposta una modifica, puoi usare Experiments per indirizzare una parte del traffico reale verso una variante e misurarne i risultati effettivi prima di applicarla su larga scala.
Ti consigliamo di distribuire gli agenti per fasi. Indirizza una quota limitata di traffico al tuo agente, valuta queste conversazioni e, dopo aver verificato che funzioni come previsto, estendi l'utilizzo ad altri casi d'uso, canali o regioni.
Protezione dei dati sensibili
Gli agenti possono gestire dati di pagamento, informazioni sanitarie e identificatori personali, quindi è importante considerare quali dati vengono archiviati, dove e per quanto tempo.
Offriamo diversi meccanismi per aiutare i clienti a proteggere i dati:
- Zero Retention Mode può essere attivata per i servizi idonei, per garantire che determinati tipi di dati non vengano conservati, ed è progettata per contesti normativi rigorosi.
- Redazione della cronologia delle conversazioni rimuove le entità sensibili dopo una chiamata, sostituendole con segnaposto nel testo e segnali acustici nell'audio, fino al livello dei singoli tipi di entità.
- Conservazione configurabile adatta i periodi di archiviazione ai tuoi requisiti normativi.
- Residenza dei dati mantiene l'elaborazione all'interno della giurisdizione richiesta.
- Distribuzioni private (VPC) isolano l'ambiente per workload ad alta sensibilità.
- Crittografia protegge i dati in transito e a riposo.
Misure di protezione della piattaforma e convalida esterna
Tutto quanto descritto si basa sulle nostre più ampie misure di protezione della piattaforma, un programma completo che comprende provenienza dei contenuti, rilevamento degli abusi, applicazione delle restrizioni d'uso e red teaming dei modelli. Attraverso il nostro Safety Partnership Program, collaboriamo anche con aziende all'avanguardia nella sicurezza dell'IA, contribuendo ai loro prodotti e agli standard di settore emergenti.
Sottoponiamo inoltre il nostro approccio a valutazioni indipendenti, comprese norme generali di sicurezza e privacy come SOC 2 Type II, ISO 27001 e GDPR, oltre a certificazioni specifiche per settore e caso d'uso come PCI DSS Level 1 per l'elaborazione dei pagamenti e HIPAA per il settore sanitario statunitense. Consulta il nostro trust center per maggiori informazioni.
Rispettiamo anche standard più recenti e nativi dell'IA, come ISO 42001, che disciplina i sistemi di gestione dell'IA, e AIUC-1 che richiede agli agenti IA di superare simulazioni avversariali trimestrali condotte da valutatori indipendenti. Le stesse funzionalità alla base di AIUC-1 consentono inoltre di accedere ad alcune delle prime polizze assicurative per agenti.
Per rollout di grandi dimensioni o complessi, i nostri Forward Deployed Engineers collaborano con il tuo team per progettare e implementare la strategia per i tuoi agenti, inclusi configurazione, guardrail, test, monitoraggio e strategia di rollout.
Conclusione
Il nostro approccio alla sicurezza in ElevenAgents è a più livelli, e ogni elemento rafforza gli altri:
- Configurazione dell'agente: system prompt, workflow e procedure che ne definiscono il comportamento, con le azioni più sensibili subordinate a tool call.
- Guardrail: controlli indipendenti in ogni fase: rilevamento della manipolazione nell'input, Focus nella decisione e validatori dei contenuti e personalizzati nell'output, con strategie di uscita configurabili.
- Test: simulazioni avversariali, esecuzioni ripetute, test specifici per canale e red teaming prima del lancio.
- Monitoraggio: rollout graduale, quindi valutazione continua, log e trascrizioni ricercabili e un ciclo di feedback dopo il lancio.
- Protezione dei dati: redazione, Zero Retention Mode, conservazione configurabile, residenza dei dati, distribuzioni private (VPC) e crittografia.
- Convalida esterna: certificazioni, test avversariali indipendenti previsti da AIUC-1, assicurazione per agenti, red teaming e supporto di esperti.

.webp&w=3840&q=80)


