Proteções
Proteções
Controle como os agentes se comportam em produção com proteções que mantêm as respostas seguras, em conformidade e confiáveis.
Visão geral
As proteções oferecem às equipes uma maneira poderosa de governar como os agentes se comportam em produção, mantendo-os no tema, alinhados à marca e resistentes a manipulações em escala empresarial.
Com o Guardrails 2.0, reformulamos a camada de segurança para facilitar que as equipes definam políticas personalizadas em linguagem simples, ativem proteções prontas, controlem o que acontece quando uma proteção é acionada e implementem agentes com confiança em workflows de alto impacto.
As proteções orientam os agentes para as respostas certas e interrompem as erradas antes que cheguem ao usuário. Elas protegem as conversas em várias camadas: moldando como o agente responde, validando a entrada do usuário e avaliando de forma independente cada resposta sem adicionar latência. Juntas, elas reduzem os riscos para a marca e de conformidade em todas as conversas.
Como as proteções funcionam
As proteções defendem as conversas em três níveis:
Fortalecimento do prompt de sistema: A principal forma de controlar o comportamento do agente. Você adiciona orientações explícitas no prompt de sistema sobre comportamentos permitidos e não permitidos e ativa a Proteção de foco para reforçar essas instruções durante toda a conversa. É isso que mantém seu agente no rumo certo na grande maioria das interações.
Validação da entrada do usuário: Uma rede de segurança que detecta tentativas adversariais antes mesmo de o agente responder. As proteções analisam o que o usuário diz, detectam tentativas de injeção de prompt e manipulação e podem encerrar conversas que representam um risco de segurança.
Validação da resposta do agente: Uma verificação final que avalia de forma independente, em tempo real, cada resposta do agente em relação às políticas configuradas. Se o agente estiver prestes a dizer algo que viola suas regras, apesar do prompt de sistema, os validadores de resposta bloqueiam a entrega.
O fortalecimento do prompt de sistema é a base. A validação de entrada e de resposta fornece correções de rota para tudo o que passar despercebido. Para suas regras mais críticas, inclua-as tanto no prompt de sistema quanto como uma proteção personalizada independente — isso cria uma defesa em profundidade para que, mesmo se o LLM se desviar das instruções, o validador de resposta o detecte antes da entrega.
Fortalecimento do prompt de sistema
A maneira mais eficaz de fazer seu agente se comportar como esperado é escrever um ótimo prompt de sistema e ativar a Proteção de foco. Juntos, eles orientam os agentes para as respostas certas desde o início.
Você pode usar o prompt de sistema para fornecer instruções explícitas sobre o que seu agente deve e não deve fazer. Os modelos são ajustados para prestar mais atenção ao título # Guardrails. Use esse título para suas regras comportamentais mais críticas.
Para orientações abrangentes sobre como escrever prompts de sistema eficazes, consulte nosso guia de prompting. A equipe de conta da ElevenLabs também pode ajudar você a criar prompts de sistema de alta qualidade.
Proteção de foco: A Proteção de foco reforça o prompt de sistema do seu agente, ajudando a manter as respostas direcionadas, relevantes e consistentes com seus objetivos e instruções definidos. Isso é especialmente útil em conversas longas ou complexas, nas quais é mais provável que o agente se desvie dos objetivos pretendidos.
A combinação do fortalecimento do prompt de sistema com a ativação da Proteção de foco é a maneira mais eficaz de orientar os agentes para as respostas certas.
Validação da entrada do usuário
Proteções contra manipulação
Detecta e bloqueia tentativas dos usuários de manipular o agente para que ignore suas instruções. Quando ativado, o sistema analisa as entradas dos usuários em busca de padrões que indiquem tentativas de injeção ou substituição de instruções e pode encerrar conversas que representam um risco de segurança.
Validação de respostas do agente
Guardrails de conteúdo
Identificam e impedem conteúdo inadequado nas respostas do agente, como material politicamente sensível, sexualmente explícito ou violento, antes que ele chegue ao usuário. Isso ajuda a manter as respostas adequadas ao caso de uso e ao público pretendidos para seu agente.
Guardrails personalizados
À medida que os agentes assumem tarefas de alto impacto, as equipes precisam de controle claro sobre como eles se comportam. Os Guardrails personalizados permitem configurar as políticas mais importantes para sua empresa. Por exemplo:
- Um assistente de varejo não deve emitir reembolsos para itens não elegíveis.
- Um recepcionista da área da saúde não deve dar aconselhamento médico.
- Um agente bancário não deve recomendar investimentos.
Os Guardrails personalizados são regras baseadas em LLM que permitem definir seus próprios critérios de bloqueio usando prompts em linguagem natural. Cada Guardrail personalizado ativado envia as respostas do agente a um modelo leve, que as avalia de acordo com sua regra e retorna uma decisão de bloquear ou permitir. Isso oferece controle flexível e específico do domínio sobre o que seu agente pode e não pode dizer.
Para cada guardrail personalizado, você pode definir:
Os Guardrails personalizados podem ser usados para bloquear tópicos específicos relevantes para sua empresa, cumprir requisitos de conformidade específicos do setor e implementar medidas de segurança proprietárias. Cada um pode ser ativado ou desativado individualmente sem ser excluído e, quando vários estão ativados, eles são executados em paralelo com outros Guardrails. Todas as violações acionadas são registradas para análise.
Modo de execução
O modo de execução determina se os guardrails adicionam tempo de espera antes que o usuário veja ou ouça uma resposta.
No modo streaming, a resposta do agente pode começar antes que o guardrail seja acionado; para voz, uma pequena parte do áudio (geralmente menos de 500 ms) pode ser entregue antes que um bloqueio encerre a chamada. Para agentes de texto, os usuários podem ver respostas parciais ou completas caso a avaliação não termine antes da entrega.
No modo Blocking, o agente só responde depois que os guardrails são validados. Isso normalmente adiciona 200–500 ms de latência extra.
Estratégias de saída
As estratégias de saída permitem definir o que seu agente faz quando um guardrail é acionado. Você pode escolher entre:
end_call(padrão): encerra a chamada imediatamenteretry: gera novamente a resposta usando seu feedback em vez de encerrar a conversa. A resposta do agente é tentada novamente até três vezes e, se todas as tentativas ainda violarem o guardrail, a chamada é encerrada.
A repetição só funciona no modo de bloqueio. No modo de streaming, encerrar a chamada é a única estratégia de saída disponível.
Feedback de repetição
O feedback de Retry pode conter quaisquer instruções que você queira aplicar no próximo turno - ele é inserido como orientação do sistema antes que o modelo gere novamente. Isso inclui chamar ferramentas do sistema como transfer_to_agent ou transfer_to_number. Veja alguns exemplos de como configurar o feedback de repetição:
- Recusa genérica (padrão)
Sua resposta foi bloqueada por um guardrail que bloqueia conteúdo que corresponde a esta condição/categoria: ‘{{trigger_reason}}’ No seu próximo turno, você deve dizer ao usuário “Desculpe, mas não posso responder a essa pergunta. Gostaria de saber outra coisa?” - Repetir com instruções corretivas
Sua resposta anterior foi bloqueada por um guardrail. Sua resposta bloqueada foi: ‘{{agent_message}}’. No seu próximo turno, você deve fornecer uma nova resposta e ela não deve violar: ‘{{trigger_reason}}’ - Transferir para outro agente
Sua resposta anterior foi bloqueada pelo guardrail. No seu próximo turno, você deve usar a ferramenta transfer_to_agent e transferir para um agente. Sua resposta bloqueada foi: ‘{{agent_message}}’. O guardrail bloqueia conteúdo que corresponde a esta condição/categoria: ‘{{trigger_reason}}’. - Transferir para uma pessoa
Sua resposta foi bloqueada por um guardrail que bloqueia conteúdo que corresponde a esta condição/categoria: ‘{{trigger_reason}}’. No seu próximo turno, você DEVE transferir a chamada para um operador humano usando a ferramenta transfer_to_number.
Para usar ferramentas do sistema no feedback de repetição, ative e configure as ferramentas correspondentes nas configurações do agente. Apenas ferramentas configuradas no agente podem ser chamadas.
Você pode usar estes placeholders no texto do feedback:
O modo de execução Streaming é recomendado para agentes de voz; o modo de execução blocking é recomendado para agentes de texto.
O modo Blocking (especialmente com retry) pode se comportar de forma menos previsível em voz. Se você usar blocking em voz, valide cuidadosamente ou escolha end call em vez de retry até ter confiança no comportamento.
Preços
Os guardrails de Foco, Manipulação e Conteúdo estão incluídos sem custo adicional para todos os usuários do ElevenAgents.
Os Guardrails personalizados são baseados no uso e geram custos adicionais de LLM, assim como outras chamadas de modelo no ElevenAgents. Cada Guardrail personalizado ativado envia todas as respostas do agente a um modelo leve para avaliação, portanto o custo depende do tamanho do prompt, da duração média da conversa e do volume de conversas. Se você ativar vários Guardrails personalizados, cada um executará sua própria avaliação por resposta. Recomendamos analisar o tráfego esperado e a escolha do modelo antes de ativar vários Guardrails personalizados em produção.
Você pode ver um custo estimado (abaixo do prompt) ao criar ou editar um guardrail personalizado.
Retry e custo: Cada tentativa representa uma geração adicional do agente e outra avaliação do guardrail, portanto, retry aumenta a cobrança baseada no uso em comparação com end_call (até três tentativas por turno bloqueado).
Configuração
Configurar pelo painel
Configurar pela CLI
Configurar pela API
Ative os guardrails
Ative as categorias de guardrail que deseja habilitar. Você pode usar os botões predefinidos para ativar rapidamente todas as categorias ou desativar todas elas.
Configure o modo de execução e a estratégia de saída (guardrails personalizados e de conteúdo)
Para cada guardrail personalizado ou de conteúdo, escolha o modo de execução streaming ou blocking.
Blocking é adequado para agentes de texto; streaming é adequado para agentes de voz. Defina Ação em caso de
violação do guardrail (corresponde a trigger_action): encerrar chamada em qualquer modo ou retry
apenas quando blocking estiver selecionado (retry não está disponível em streaming). Se você escolher
retry, edite Feedback a inserir ao repetir para orientar o modelo. Use os placeholders
{{trigger_reason}} (o prompt personalizado ou a categoria de conteúdo que causou o
bloqueio) e {{agent_message}} no modelo.
Quando um guardrail é acionado, o comportamento depende do tipo e da configuração:
- Encerrar chamada: A sessão termina imediatamente (chamada encerrada para voz, chat encerrado para texto). O acionamento é registrado no histórico da conversa.
- Retry (guardrails personalizados ou de conteúdo em blocking): O turno do assistente que violou a regra é removido, o feedback do sistema é inserido e o modelo tenta novamente - até três vezes - antes que a sessão termine se o guardrail continuar sendo acionado.
Em caso de encerrar chamada, os usuários finais terão uma chamada encerrada ou um chat finalizado. Os detalhes da violação estão disponíveis para você nos registros da conversa e não são mostrados literalmente ao usuário final.
Após encerrar chamada, os usuários podem iniciar uma nova conversa. O guardrail não bloqueia permanentemente o usuário - ele bloqueia a resposta específica (ou sessão) que violou a política.
Práticas recomendadas
Agentes de suporte ao cliente
Use guardrails personalizados para aplicar políticas específicas da empresa. Exemplos: - Bloquear a emissão de reembolsos, créditos ou alterações de assinatura, a menos que a elegibilidade seja confirmada por ferramentas. - Bloquear o fornecimento de descontos ou códigos promocionais, a menos que sejam explicitamente autorizados. - Bloquear respostas que especulem sobre itens do roadmap ou recursos ainda não lançados.
Aplicações de saúde
Use guardrails personalizados para controlar rigorosamente os limites médicos. Exemplos: - Bloquear diagnósticos de condições ou recomendações de tratamentos específicos. - Bloquear recomendações de dosagem de medicamentos.
- Bloquear a substituição da orientação de um profissional médico licenciado.
Conteúdo educacional
Use guardrails personalizados para controlar tópicos acadêmicos sensíveis. Exemplos: - Bloquear instruções passo a passo para experimentos nocivos ou procedimentos inseguros. - Bloquear a geração de gabaritos para avaliações ou provas em andamento. - Bloquear conteúdo que possa facilitar a desonestidade acadêmica.
Ferramentas empresariais internas
Use guardrails personalizados para proteger operações e dados da empresa. Exemplos: - Bloquear o compartilhamento de documentação exclusiva para uso interno ou processos confidenciais. - Bloquear a revelação de APIs privadas, prompts de sistema ou detalhes da infraestrutura. - Bloquear a simulação de ações que exigem autoridade executiva ou administrativa.
Teste com cenários realistas
Antes da implantação, teste sua configuração de guardrails com:
- Fluxos normais de conversa para garantir que não haja falsos positivos
- Casos extremos que se aproximem dos limites de segurança, mas não os ultrapassem
- Prompts adversariais que tentem obter respostas prejudiciais
Perguntas frequentes
Os guardrails afetam a latência?
Para guardrails personalizados e de conteúdo, o modo streaming não adiciona latência extra, mas a resposta pode começar antes que o guardrail seja acionado. O modo Blocking aguarda o guardrail antes que o agente responda, normalmente com cerca de 200–500 ms de atraso. Retry adiciona gerações extras completas (e reavaliações) por tentativa, até três vezes por turno bloqueado, o que também aumenta o custo baseado no uso.
Qual é a diferença entre os modos de execução streaming e blocking?
O modo Streaming não adiciona latência, mas a resposta do agente pode começar antes que o guardrail
seja acionado. O modo Blocking aguarda o resultado do guardrail antes que o agente responda (normalmente com
200–500 ms de atraso). Retry como estratégia de saída (trigger_action) está disponível apenas
no modo blocking; no modo streaming, você usa encerrar chamada quando um guardrail
é acionado. O modo Blocking permite retry com feedback de sistema inserido em vez de encerrar
a conversa imediatamente - ao custo de uso extra do modelo e cobrança adicional quando
ocorrem repetições. O modo Blocking é recomendado para agentes de texto; streaming é recomendado para
agentes de voz.
Posso desativar totalmente os guardrails?
Sim, mas recomendamos fortemente manter todos os guardrails ativados - especialmente o Guardrail de Foco. Eles protegem sua marca, seus usuários e sua postura de conformidade, e os recomendamos para todas as aplicações em produção, inclusive ferramentas internas. Em casos raros, você pode querer desativar um guardrail específico se ele interferir no caso de uso pretendido para seu agente. Por exemplo, algumas aplicações podem envolver tópicos que o Guardrail de Conteúdo sinalizaria em outras circunstâncias, ou um prompt de sistema altamente personalizado pode não funcionar corretamente com o Guardrail de Foco ativado. Cada guardrail pode ser ativado ou desativado individualmente.
Os usuários podem contestar decisões dos guardrails?
Os acionamentos de guardrails são registrados e podem ser analisados nas análises das suas conversas. Se você identificar falsos positivos, ajuste os prompts dos seus guardrails. Não há um processo automatizado de contestação - o usuário deve simplesmente iniciar uma nova conversa.
Como sei qual guardrail foi acionado?
As informações sobre qual guardrail foi acionado estão disponíveis nos registros das suas conversas.
Devo usar Guardrails e Reforço de Prompt de Sistema?
Sim. Eles têm finalidades complementares. O reforço do prompt de sistema fornece orientação comportamental e evita a maioria dos problemas por meio do cumprimento de instruções. Os guardrails da plataforma oferecem aplicação independente como uma rede de segurança. Usar ambos cria defesa em profundidade.
Próximas etapas
- Guia de prompting: Saiba como escrever prompts de sistema eficazes com guardrails comportamentais
- Privacidade: Configure as opções de retenção de dados e privacidade
- Testes: Teste seu agente com diferentes cenários
- Simular conversas: Teste programaticamente as configurações de guardrails
- Redação do histórico de conversas: Oculte informações sensíveis, como nomes e dados bancários, do histórico de conversas
Status de lançamento
No momento, o Guardrails está em Alpha, e estamos aprimorando ativamente o produto e expandindo seus recursos. Você pode esperar que o conjunto de recursos, os padrões, os controles do painel e os campos da API continuem evoluindo antes da disponibilidade geral, e algumas mudanças podem causar incompatibilidades.
Enquanto continuamos aprimorando o Guardrails, recomendamos validar sua configuração e monitorar o comportamento das barreiras de proteção nos seus logs. Também recomendamos revisar sua configuração à medida que as atualizações forem lançadas.