Skyddsräcken
Styr hur agenter beter sig i produktion med skydd som håller svar säkra, kompatibla och tillförlitliga.
Översikt
Skyddsräcken ger team ett kraftfullt sätt att styra hur agenter beter sig i produktion, så att de håller sig till ämnet, varumärket och står emot manipulation i företagsskala.
Med Guardrails 2.0 har vi gjort om säkerhetslagret för att göra det enklare för team att definiera anpassade policyer på naturligt språk, aktivera färdiga skydd, styra vad som händer när ett skyddsräcke utlöses och driftsätta agenter tryggt i arbetsflöden med stor påverkan.
Skyddsräcken vägleder agenter till rätt svar och stoppar felaktiga svar innan de når användaren. De skyddar samtal i flera lager: genom att forma hur agenten svarar, validera användarindata och oberoende utvärdera varje svar utan att öka fördröjningen. Tillsammans minskar detta riskerna för varumärket och regelefterlevnaden i varje samtal.
Så fungerar skyddsräcken
Skyddsräcken skyddar samtal på tre nivåer:
Härdning av systemprompten: Det främsta sättet att styra agentens beteende. Du lägger till tydliga riktlinjer i systemprompten om tillåtet och otillåtet beteende och aktiverar Focus Guardrail för att förstärka instruktionerna under hela samtalet. Det är detta som håller agenten på rätt spår i de allra flesta interaktioner.
Validering av användarindata: Ett säkerhetsnät som fångar upp fientliga försök innan agenten ens svarar. Skyddsräcken analyserar vad användaren säger, upptäcker försök till promptinjektion och manipulation och kan avsluta samtal som utgör en säkerhetsrisk.
Validering av agentsvar: En sista kontroll som oberoende utvärderar varje agentsvar i realtid mot dina konfigurerade policyer. Om agenten är på väg att säga något som bryter mot dina regler trots systemprompten blockerar svarsvaliderarna det före leverans.
Härdning av systemprompten är grunden. Validering av indata och svar korrigerar sådant som faller mellan stolarna. För dina mest kritiska regler bör du inkludera dem både i systemprompten och som ett oberoende anpassat skyddsräcke – det skapar ett djupt försvar, så att svarsvalideraren fångar upp det före leverans även om LLM:n avviker från sina instruktioner.
Härdning av systemprompten
Det mest effektiva sättet att få din agent att bete sig som avsett är att skriva en bra systemprompt och aktivera Focus Guardrail. Tillsammans vägleder de agenter mot rätt svar från början.
Du kan använda systemprompten för att ge tydliga instruktioner om vad agenten ska och inte ska göra. Modeller är inställda på att ägna extra uppmärksamhet åt rubriken # Guardrails. Använd den här rubriken för dina mest kritiska beteenderegler.
För utförlig vägledning om hur du skriver effektiva systemprompter, se vår guide om prompting. Ditt kontoteam på ElevenLabs kan också hjälpa dig att utforma systemprompter av hög kvalitet.
Focus Guardrail: Focus Guardrail förstärker agentens systemprompt och hjälper till att hålla svaren fokuserade, relevanta och förenliga med dina definierade mål och instruktioner. Det är särskilt användbart i långa eller komplexa samtal där agenten löper större risk att avvika från sina avsedda mål.
Kombinationen av härdning av systemprompten och att aktivera Focus Guardrail är det mest effektiva sättet att vägleda agenter mot rätt svar.
Validering av användarindata
Skyddsräcken mot manipulation
Upptäcker och blockerar användares försök att manipulera agenten till att kringgå sina instruktioner. När funktionen är aktiverad analyserar systemet användarindata efter mönster som tyder på försök till injicering eller åsidosättande av instruktioner och kan avsluta samtal som utgör en säkerhetsrisk.
Validering av agentsvar
Skyddsräcken för innehåll
Markerar och förhindrar olämpligt innehåll i agentsvar, till exempel politiskt känsligt, sexuellt explicit eller våldsamt material, innan det når användaren. Det bidrar till att hålla svaren lämpliga för agentens avsedda användningsfall och målgrupp.
Anpassade skyddsräcken
När agenter tar sig an arbete med stor påverkan behöver team tydlig kontroll över hur de beter sig. Med anpassade skyddsräcken kan du konfigurera de viktigaste policyerna för din verksamhet. Till exempel:
- En butiksassistent ska inte utfärda återbetalningar för varor som inte är berättigade.
- En receptionist inom vården ska inte ge medicinska råd.
- En bankagent ska inte rekommendera investeringar.
Anpassade skyddsräcken är LLM-baserade regler som låter dig definiera egna blockeringskriterier med promptar på naturligt språk. Varje aktiverat anpassat skyddsräcke skickar agentsvar till en lättviktsmodell som utvärderar dem mot din regel och returnerar ett beslut om att blockera eller tillåta. Det ger dig flexibel, domänspecifik kontroll över vad agenten får och inte får säga.
För varje anpassat skyddsräcke kan du definiera:
Anpassade skyddsräcken kan användas för att blockera specifika ämnen som är relevanta för din verksamhet, upprätthålla branschspecifika krav på regelefterlevnad och implementera egna säkerhetsåtgärder. Varje skyddsräcke kan aktiveras eller inaktiveras individuellt utan att tas bort, och när flera är aktiverade körs de parallellt med andra skyddsräcken. Alla utlösta överträdelser loggas för granskning.
Körningsläge
Körningsläget avgör om skyddsräcken lägger till väntetid innan användaren ser eller hör ett svar.
I läget streaming kan agentsvaret börja innan skyddsräcket utlöses. För röst kan en liten del av ljudet (ofta mindre än 500 ms) levereras innan en blockering avslutar samtalet. För textagenter kan användare se delar av eller hela svaret om utvärderingen inte avslutas före leverans.
I läget Blocking svarar agenten först efter att skyddsräckena har validerats. Det lägger vanligtvis till 200–500 ms extra fördröjning.
Avslutsstrategier
Avslutsstrategier låter dig definiera vad agenten gör när ett skyddsräcke utlöses. Du kan välja mellan:
end_call(standard): avslutar samtalet omedelbartretry: genererar svaret på nytt med din återkoppling i stället för att avbryta samtalet. Agentsvaret försöks igen upp till tre gånger, och om varje försök fortfarande bryter mot skyddsräcket avslutas samtalet.
Återförsök fungerar endast i blockeringsläge. I streamingläge är det enda tillgängliga alternativet att avsluta samtalet.
Återkoppling vid återförsök
Återkoppling för retry kan innehålla valfria instruktioner som du vill tillämpa i nästa tur – den injiceras som systemvägledning innan modellen genererar på nytt. Det inkluderar att anropa systemverktyg som transfer_to_agent eller transfer_to_number. Här är några exempel på hur du kan konfigurera återkoppling för återförsök:
- Generellt avslag (standard)
Ditt svar blockerades av ett skyddsräcke som blockerar innehåll som matchar detta villkor/denna kategori: ‘{{trigger_reason}}’ Under din nästa tur måste du säga till användaren “Jag är ledsen, men jag kan inte svara på den frågan. Vill du veta något annat?” - Försök igen med korrigerande instruktioner
Ditt föregående svar blockerades av ett skyddsräcke. Ditt blockerade svar var: ‘{{agent_message}}’. Under din nästa tur måste du ge ett nytt svar, och det får inte bryta mot: ‘{{trigger_reason}}’ - Överför till en annan agent
Ditt föregående svar blockerades av skyddsräcket. Under din nästa tur måste du använda verktyget transfer_to_agent och överföra till en agent. Ditt blockerade svar var: ‘{{agent_message}}’. Skyddsräcket blockerar innehåll som matchar detta villkor/denna kategori: ‘{{trigger_reason}}’. - Överför till en person
Ditt svar blockerades av ett skyddsräcke som blockerar innehåll som matchar detta villkor/denna kategori: ‘{{trigger_reason}}’. Under din nästa tur MÅSTE du överföra samtalet till en mänsklig operatör med verktyget transfer_to_number.
Om du vill använda systemverktyg i återkoppling för återförsök aktiverar och konfigurerar du motsvarande verktyg i agentens inställningar. Endast verktyg som har konfigurerats för agenten kan anropas.
Du kan använda följande platshållare i återkopplingstexten:
Körningsläget streaming rekommenderas för röstagenter, medan körningsläget blocking rekommenderas för textagenter.
Blocking (särskilt med retry) kan bete sig mindre förutsägbart för röst. Om du använder blocking för röst bör du testa noggrant eller välja end call i stället för retry tills du känner dig säker på beteendet.
Priser
Skyddsräckena Focus, Manipulation och Content ingår utan extra kostnad för alla ElevenAgents-användare.
Anpassade skyddsräcken är användningsbaserade och medför extra LLM-kostnader, på samma sätt som andra modellanrop i ElevenAgents. Varje aktiverat anpassat skyddsräcke skickar varje agentsvar till en lättviktsmodell för utvärdering, så kostnaden beror på promptens längd, längden på det genomsnittliga samtalet och samtalsvolymen. Om du aktiverar flera anpassade skyddsräcken kör varje skyddsräcke en egen utvärdering per svar. Vi rekommenderar att du granskar din förväntade trafik och ditt modellval innan du aktiverar flera anpassade skyddsräcken i produktion.
Du kan se en uppskattad kostnad (under prompten) när du skapar eller redigerar ett anpassat skyddsräcke.
Återförsök och kostnad: Varje försök är en extra agentgenerering plus ännu en utvärdering av skyddsräcket, så retry ökar den användningsbaserade faktureringen jämfört med end_call (upp till tre försök per blockerad tur).
Konfiguration
Konfigurera via instrumentpanelen
Konfigurera via CLI
Konfigurera via API
Gå till agentinställningarna
Öppna din agent i ElevenLabs instrumentpanel och gå till fliken Säkerhet.
Aktivera skyddsräcken
Aktivera de kategorier av skyddsräcken som du vill använda. Du kan använda de förinställda knapparna för att snabbt aktivera eller inaktivera alla kategorier.
Konfigurera körläge och avslutsstrategi (anpassade skyddsräcken och innehållsskyddsräcken)
För varje anpassat skyddsräcke eller innehållsskyddsräcke väljer du körläget streaming eller blocking.
Blocking passar textagenter, medan streaming passar röstagenter. Ställ in Åtgärd vid
överträdelse av skyddsräcke (motsvarar trigger_action): avsluta samtal i alla lägen, eller försök igen
endast när blocking är valt (försök igen är inte tillgängligt i streaming). Om du väljer
försök igen redigerar du Feedback att infoga vid nytt försök för att styra modellen. Använd platshållarna
{{trigger_reason}} (den anpassade prompten eller innehållskategorin som orsakade
blockeringen) och {{agent_message}} i mallen.
När ett skyddsräcke utlöses beror beteendet på typ och konfiguration:
- Avsluta samtal: Sessionen avslutas direkt (samtalet kopplas ner för röst, chatten avslutas för text). Utlösaren loggas i konversationshistoriken.
- Försök igen (blockerande anpassade skyddsräcken eller innehållsskyddsräcken): Assistantens tur som bröt mot reglerna tas bort, systemfeedback infogas och modellen försöker igen – upp till tre gånger – innan sessionen avslutas om skyddsräcket fortfarande utlöses.
Vid avsluta samtal upplever slutanvändare att samtalet kopplas ner eller att chatten avslutas. Detaljer om överträdelsen är tillgängliga för dig i konversationsloggarna och visas inte ordagrant för slutanvändaren.
Efter avsluta samtal kan användare starta en ny konversation. Skyddsräcket blockerar inte användaren permanent – det blockerar det specifika svaret (eller sessionen) som bröt mot policyn.
Bästa praxis
Kundsupportagenter
Använd anpassade skyddsräcken för att upprätthålla verksamhetsspecifika policyer. Exempel: - Blockera återbetalningar, krediter eller prenumerationsändringar om behörighet inte har bekräftats via verktyg. - Blockera rabatter eller kampanjkoder om de inte uttryckligen har godkänts. - Blockera svar som spekulerar om delar av produktplanen eller funktioner som ännu inte har släppts.
Vårdapplikationer
Använd anpassade skyddsräcken för att strikt kontrollera medicinska gränser. Exempel: - Blockera diagnostisering av tillstånd eller rekommendationer av specifika behandlingar. - Blockera doseringsrekommendationer för läkemedel.
- Blockera ersättning av råd från legitimerad vårdpersonal.
Utbildningsinnehåll
Använd anpassade skyddsräcken för att kontrollera känsliga akademiska ämnen. Exempel: - Blockera stegvisa instruktioner för skadliga experiment eller osäkra procedurer. - Blockera generering av facit för pågående bedömningar eller prov. - Blockera innehåll som kan underlätta akademiskt fusk.
Interna företagsverktyg
Använd anpassade skyddsräcken för att skydda företagets verksamhet och data. Exempel: - Blockera delning av intern dokumentation eller konfidentiella processer. - Blockera avslöjande av privata API:er, system- prompter eller infrastrukturdetaIjer. - Blockera simulering av åtgärder som kräver lednings- eller administrativ behörighet.
Testa med realistiska scenarier
Testa din konfiguration av skyddsräcken före driftsättning med:
- Normala konversationsflöden för att säkerställa att inga falska positiva resultat uppstår
- Gränsfall som närmar sig men inte passerar säkerhetsgränser
- Motstridiga prompter som försöker få fram skadliga svar
Vanliga frågor
Påverkar skyddsräcken latensen?
För anpassade skyddsräcken och innehållsskyddsräcken tillför läget streaming ingen extra latens, men svaret kan börja innan skyddsräcket utlöses. Läget blocking väntar på skyddsräcket innan agenten svarar, vanligtvis med cirka 200–500 ms fördröjning. Försök igen lägger till hela extra genereringar (och nya utvärderingar) per försök, upp till tre gånger per blockerad tur, vilket också ökar den användningsbaserade kostnaden.
Vad är skillnaden mellan körlägena streaming och blocking?
Streaming tillför ingen extra latens, men agentsvaret kan börja innan skyddsräcket
utlöses. Blocking väntar på resultatet från skyddsräcket innan agenten svarar (vanligtvis
200–500 ms fördröjning). Försök igen som avslutsstrategi (trigger_action) är endast
tillgängligt i läget blocking; i läget streaming använder du avsluta samtal när ett skyddsräcke
utlöses. Blocking möjliggör försök igen med infogad systemfeedback i stället för att avsluta
konversationen direkt – till priset av extra modellanvändning och ytterligare fakturering när
nya försök sker. Blocking rekommenderas för textagenter och streaming rekommenderas för
röstagenter.
Kan jag inaktivera skyddsräcken helt?
Ja, men vi rekommenderar starkt att du behåller alla skyddsräcken aktiverade – särskilt Focus Guardrail. De skyddar ditt varumärke, dina användare och din efterlevnad, och vi rekommenderar dem för alla produktionsapplikationer, inklusive interna verktyg. I sällsynta fall kanske du vill inaktivera ett specifikt skyddsräcke om det stör agentens avsedda användningsområde. Vissa applikationer kan till exempel beröra ämnen som Content Guardrail annars skulle flagga, eller så kanske en mycket anpassad systemprompt inte fungerar korrekt när Focus Guardrail är aktiverat. Varje skyddsräcke kan aktiveras eller inaktiveras individuellt.
Kan användare överklaga beslut från skyddsräcken?
Utlösningar av skyddsräcken loggas och kan granskas i din konversationsanalys. Om du identifierar falska positiva resultat justerar du dina skyddsräckesprompter. Det finns ingen automatisk överklagandeprocess – användaren behöver bara starta en ny konversation.
Hur vet jag vilket skyddsräcke som utlöstes?
Information om vilket skyddsräcke som utlöstes finns i dina konversationsloggar.
Bör jag använda både Guardrails och System Prompt Hardening?
Ja. De fyller kompletterande syften. Förstärkning av systemprompten ger beteendevägledning och förebygger de flesta problem genom att följa instruktioner. Plattformens skyddsräcken ger oberoende tillämpning som ett säkerhetsnät. Tillsammans ger de ett djupgående skydd.
Nästa steg
- Guide till promptning: Lär dig skriva effektiva systemprompter med beteendestyrande skyddsräcken
- Integritet: Konfigurera inställningar för datalagring och integritet
- Testning: Testa din agent med olika scenarier
- Simulera konversationer: Testa konfigurationer av skyddsräcken programmatiskt
- Maskering av konversationshistorik: Maskera känslig information, till exempel namn och bankuppgifter, i konversationshistoriken
Versionsstatus
Guardrails är allmänt tillgängligt, inklusive skyddsräckena Focus och Manipulation.
Innehållsskyddsräckena och de anpassade skyddsräckena är i alfa. Vi förbättrar dem aktivt, och deras standardinställningar, kontroller i instrumentpanelen och API-fält kommer att fortsätta utvecklas före allmän tillgänglighet. Vissa ändringar kan vara inkompatibla.
Om du använder innehållsskyddsräcken eller anpassade skyddsräcken rekommenderar vi att du validerar din konfiguration, övervakar skyddsräckenas beteende i loggarna och ser över konfigurationen när uppdateringar lanseras.