Proteções

Controle como os agentes se comportam em produção com proteções que mantêm as respostas seguras, em conformidade e confiáveis.

As proteções estão atualmente em Alfa. Veja os detalhes em Status de lançamento.

Visão geral

As proteções oferecem às equipes uma maneira poderosa de governar como os agentes se comportam em produção, mantendo-os no tema, alinhados à marca e resistentes a manipulações em escala empresarial.

Com o Guardrails 2.0, reformulamos a camada de segurança para facilitar que as equipes definam políticas personalizadas em linguagem simples, ativem proteções prontas, controlem o que acontece quando uma proteção é acionada e implementem agentes com confiança em workflows de alto impacto.

As proteções orientam os agentes para as respostas certas e interrompem as erradas antes que cheguem ao usuário. Elas protegem as conversas em várias camadas: moldando como o agente responde, validando a entrada do usuário e avaliando de forma independente cada resposta sem adicionar latência. Juntas, elas reduzem os riscos para a marca e de conformidade em todas as conversas.

Como as proteções funcionam

As proteções defendem as conversas em três níveis:

Fortalecimento do prompt de sistema: A principal forma de controlar o comportamento do agente. Você adiciona orientações explícitas no prompt de sistema sobre comportamentos permitidos e não permitidos e ativa a Proteção de foco para reforçar essas instruções durante toda a conversa. É isso que mantém seu agente no rumo certo na grande maioria das interações.

Validação da entrada do usuário: Uma rede de segurança que detecta tentativas adversariais antes mesmo de o agente responder. As proteções analisam o que o usuário diz, detectam tentativas de injeção de prompt e manipulação e podem encerrar conversas que representam um risco de segurança.

Validação da resposta do agente: Uma verificação final que avalia de forma independente, em tempo real, cada resposta do agente em relação às políticas configuradas. Se o agente estiver prestes a dizer algo que viola suas regras, apesar do prompt de sistema, os validadores de resposta bloqueiam a entrega.

O fortalecimento do prompt de sistema é a base. A validação de entrada e de resposta fornece correções de rota para tudo o que passar despercebido. Para suas regras mais críticas, inclua-as tanto no prompt de sistema quanto como uma proteção personalizada independente — isso cria uma defesa em profundidade para que, mesmo se o LLM se desviar das instruções, o validador de resposta o detecte antes da entrega.

ProteçãoO que fazProteçãoImpacto na latênciaCustoEstratégia de saída
FocoMantém os agentes no tema e alinhados ao prompt de sistemaFortalecimento do prompt de sistemaMínimoIncluídoN/A
ManipulaçãoDetecta e bloqueia injeção de promptValidação da entrada do usuárioSem efeitoIncluídoEncerra a conversa
ConteúdoSinaliza e impede conteúdo inadequadoValidação da resposta do agenteDepende do modo de execuçãoIncluídoConfigurável
PersonalizadaAplica políticas específicas da sua empresaValidação da resposta do agenteDepende do modo de execuçãoBaseado no usoConfigurável

Fortalecimento do prompt de sistema

A maneira mais eficaz de fazer seu agente se comportar como esperado é escrever um ótimo prompt de sistema e ativar a Proteção de foco. Juntos, eles orientam os agentes para as respostas certas desde o início.

Você pode usar o prompt de sistema para fornecer instruções explícitas sobre o que seu agente deve e não deve fazer. Os modelos são ajustados para prestar mais atenção ao título # Guardrails. Use esse título para suas regras comportamentais mais críticas.

Exemplo: fortalecimento do prompt de sistema
# Guardrails
- Only provide information that is publicly documented about ElevenLabs products, pricing, and features.
- Do not speculate about unreleased features, internal roadmaps, or future pricing changes.
- If you cannot resolve an issue with available documentation or tools, clearly explain the limitation and offer to escalate to a human support representative.

Para orientações abrangentes sobre como escrever prompts de sistema eficazes, consulte nosso guia de prompting. A equipe de conta da ElevenLabs também pode ajudar você a criar prompts de sistema de alta qualidade.

Proteção de foco: A Proteção de foco reforça o prompt de sistema do seu agente, ajudando a manter as respostas direcionadas, relevantes e consistentes com seus objetivos e instruções definidos. Isso é especialmente útil em conversas longas ou complexas, nas quais é mais provável que o agente se desvie dos objetivos pretendidos.

A combinação do fortalecimento do prompt de sistema com a ativação da Proteção de foco é a maneira mais eficaz de orientar os agentes para as respostas certas.

Validação da entrada do usuário

Proteções contra manipulação

Detecta e bloqueia tentativas dos usuários de manipular o agente para que ignore suas instruções. Quando ativado, o sistema analisa as entradas dos usuários em busca de padrões que indiquem tentativas de injeção ou substituição de instruções e pode encerrar conversas que representam um risco de segurança.

Validação de respostas do agente

Guardrails de conteúdo

Identificam e impedem conteúdo inadequado nas respostas do agente, como material politicamente sensível, sexualmente explícito ou violento, antes que ele chegue ao usuário. Isso ajuda a manter as respostas adequadas ao caso de uso e ao público pretendidos para seu agente.

Guardrails personalizados

À medida que os agentes assumem tarefas de alto impacto, as equipes precisam de controle claro sobre como eles se comportam. Os Guardrails personalizados permitem configurar as políticas mais importantes para sua empresa. Por exemplo:

  • Um assistente de varejo não deve emitir reembolsos para itens não elegíveis.
  • Um recepcionista da área da saúde não deve dar aconselhamento médico.
  • Um agente bancário não deve recomendar investimentos.

Os Guardrails personalizados são regras baseadas em LLM que permitem definir seus próprios critérios de bloqueio usando prompts em linguagem natural. Cada Guardrail personalizado ativado envia as respostas do agente a um modelo leve, que as avalia de acordo com sua regra e retorna uma decisão de bloquear ou permitir. Isso oferece controle flexível e específico do domínio sobre o que seu agente pode e não pode dizer.

Para cada guardrail personalizado, você pode definir:

CampoDescrição
NomeUm rótulo descritivo para o guardrail (por exemplo, “Sem aconselhamento financeiro”).
PromptUma instrução em linguagem natural que descreve o que bloquear (por exemplo, “Bloqueie qualquer conteúdo que forneça aconselhamento financeiro específico, recomendações de investimento ou orientação tributária”).
Modo de execuçãostreaming (padrão) ou blocking. Consulte Modo de execução.
Ação de acionamento (Estratégia de saída)end_call (padrão) ou retry. Consulte Estratégias de saída.

Os Guardrails personalizados podem ser usados para bloquear tópicos específicos relevantes para sua empresa, cumprir requisitos de conformidade específicos do setor e implementar medidas de segurança proprietárias. Cada um pode ser ativado ou desativado individualmente sem ser excluído e, quando vários estão ativados, eles são executados em paralelo com outros Guardrails. Todas as violações acionadas são registradas para análise.

Modo de execução

O modo de execução determina se os guardrails adicionam tempo de espera antes que o usuário veja ou ouça uma resposta.

No modo streaming, a resposta do agente pode começar antes que o guardrail seja acionado; para voz, uma pequena parte do áudio (geralmente menos de 500 ms) pode ser entregue antes que um bloqueio encerre a chamada. Para agentes de texto, os usuários podem ver respostas parciais ou completas caso a avaliação não termine antes da entrega.

No modo Blocking, o agente só responde depois que os guardrails são validados. Isso normalmente adiciona 200–500 ms de latência extra.

Estratégias de saída

As estratégias de saída permitem definir o que seu agente faz quando um guardrail é acionado. Você pode escolher entre:

  • end_call (padrão): encerra a chamada imediatamente
  • retry: gera novamente a resposta usando seu feedback em vez de encerrar a conversa. A resposta do agente é tentada novamente até três vezes e, se todas as tentativas ainda violarem o guardrail, a chamada é encerrada.

A repetição só funciona no modo de bloqueio. No modo de streaming, encerrar a chamada é a única estratégia de saída disponível.

Feedback de repetição

O feedback de Retry pode conter quaisquer instruções que você queira aplicar no próximo turno - ele é inserido como orientação do sistema antes que o modelo gere novamente. Isso inclui chamar ferramentas do sistema como transfer_to_agent ou transfer_to_number. Veja alguns exemplos de como configurar o feedback de repetição:

  • Recusa genérica (padrão)
    Sua resposta foi bloqueada por um guardrail que bloqueia conteúdo que corresponde a esta condição/categoria: ‘{{trigger_reason}}’ No seu próximo turno, você deve dizer ao usuário “Desculpe, mas não posso responder a essa pergunta. Gostaria de saber outra coisa?”
  • Repetir com instruções corretivas
    Sua resposta anterior foi bloqueada por um guardrail. Sua resposta bloqueada foi: ‘{{agent_message}}’. No seu próximo turno, você deve fornecer uma nova resposta e ela não deve violar: ‘{{trigger_reason}}’
  • Transferir para outro agente
    Sua resposta anterior foi bloqueada pelo guardrail. No seu próximo turno, você deve usar a ferramenta transfer_to_agent e transferir para um agente. Sua resposta bloqueada foi: ‘{{agent_message}}’. O guardrail bloqueia conteúdo que corresponde a esta condição/categoria: ‘{{trigger_reason}}’.
  • Transferir para uma pessoa
    Sua resposta foi bloqueada por um guardrail que bloqueia conteúdo que corresponde a esta condição/categoria: ‘{{trigger_reason}}’. No seu próximo turno, você DEVE transferir a chamada para um operador humano usando a ferramenta transfer_to_number.

Para usar ferramentas do sistema no feedback de repetição, ative e configure as ferramentas correspondentes nas configurações do agente. Apenas ferramentas configuradas no agente podem ser chamadas.

Você pode usar estes placeholders no texto do feedback:

PlaceholderSubstituído por
{{trigger_reason}}O prompt do guardrail quando definido em guardrails personalizados. A categoria acionada quando definida em guardrails de conteúdo.
{{agent_message}}A saída do agente que foi bloqueada (útil para orientar a repetição).

O modo de execução Streaming é recomendado para agentes de voz; o modo de execução blocking é recomendado para agentes de texto.

O modo Blocking (especialmente com retry) pode se comportar de forma menos previsível em voz. Se você usar blocking em voz, valide cuidadosamente ou escolha end call em vez de retry até ter confiança no comportamento.

Preços

Os guardrails de Foco, Manipulação e Conteúdo estão incluídos sem custo adicional para todos os usuários do ElevenAgents.

Os Guardrails personalizados são baseados no uso e geram custos adicionais de LLM, assim como outras chamadas de modelo no ElevenAgents. Cada Guardrail personalizado ativado envia todas as respostas do agente a um modelo leve para avaliação, portanto o custo depende do tamanho do prompt, da duração média da conversa e do volume de conversas. Se você ativar vários Guardrails personalizados, cada um executará sua própria avaliação por resposta. Recomendamos analisar o tráfego esperado e a escolha do modelo antes de ativar vários Guardrails personalizados em produção.

Você pode ver um custo estimado (abaixo do prompt) ao criar ou editar um guardrail personalizado.

Estimativa de custo do guardrail personalizado

Retry e custo: Cada tentativa representa uma geração adicional do agente e outra avaliação do guardrail, portanto, retry aumenta a cobrança baseada no uso em comparação com end_call (até três tentativas por turno bloqueado).

Configuração

1

Acesse as configurações do agente

Abra seu agente no painel da ElevenLabs e acesse a aba Segurança.

2

Ative os guardrails

Ative as categorias de guardrail que deseja habilitar. Você pode usar os botões predefinidos para ativar rapidamente todas as categorias ou desativar todas elas.

3

Configure o modo de execução e a estratégia de saída (guardrails personalizados e de conteúdo)

Para cada guardrail personalizado ou de conteúdo, escolha o modo de execução streaming ou blocking. Blocking é adequado para agentes de texto; streaming é adequado para agentes de voz. Defina Ação em caso de violação do guardrail (corresponde a trigger_action): encerrar chamada em qualquer modo ou retry apenas quando blocking estiver selecionado (retry não está disponível em streaming). Se você escolher retry, edite Feedback a inserir ao repetir para orientar o modelo. Use os placeholders {{trigger_reason}} (o prompt personalizado ou a categoria de conteúdo que causou o bloqueio) e {{agent_message}} no modelo.

4

Salve a configuração

Salve a configuração do agente. As alterações entram em vigor imediatamente para novas conversas.

Quando um guardrail é acionado, o comportamento depende do tipo e da configuração:

  • Encerrar chamada: A sessão termina imediatamente (chamada encerrada para voz, chat encerrado para texto). O acionamento é registrado no histórico da conversa.
  • Retry (guardrails personalizados ou de conteúdo em blocking): O turno do assistente que violou a regra é removido, o feedback do sistema é inserido e o modelo tenta novamente - até três vezes - antes que a sessão termine se o guardrail continuar sendo acionado.

Em caso de encerrar chamada, os usuários finais terão uma chamada encerrada ou um chat finalizado. Os detalhes da violação estão disponíveis para você nos registros da conversa e não são mostrados literalmente ao usuário final.

Após encerrar chamada, os usuários podem iniciar uma nova conversa. O guardrail não bloqueia permanentemente o usuário - ele bloqueia a resposta específica (ou sessão) que violou a política.

Práticas recomendadas

Use guardrails personalizados para aplicar políticas específicas da empresa. Exemplos: - Bloquear a emissão de reembolsos, créditos ou alterações de assinatura, a menos que a elegibilidade seja confirmada por ferramentas. - Bloquear o fornecimento de descontos ou códigos promocionais, a menos que sejam explicitamente autorizados. - Bloquear respostas que especulem sobre itens do roadmap ou recursos ainda não lançados.

Use guardrails personalizados para controlar rigorosamente os limites médicos. Exemplos: - Bloquear diagnósticos de condições ou recomendações de tratamentos específicos. - Bloquear recomendações de dosagem de medicamentos.

  • Bloquear a substituição da orientação de um profissional médico licenciado.

Use guardrails personalizados para controlar tópicos acadêmicos sensíveis. Exemplos: - Bloquear instruções passo a passo para experimentos nocivos ou procedimentos inseguros. - Bloquear a geração de gabaritos para avaliações ou provas em andamento. - Bloquear conteúdo que possa facilitar a desonestidade acadêmica.

Use guardrails personalizados para proteger operações e dados da empresa. Exemplos: - Bloquear o compartilhamento de documentação exclusiva para uso interno ou processos confidenciais. - Bloquear a revelação de APIs privadas, prompts de sistema ou detalhes da infraestrutura. - Bloquear a simulação de ações que exigem autoridade executiva ou administrativa.

Teste com cenários realistas

Antes da implantação, teste sua configuração de guardrails com:

  • Fluxos normais de conversa para garantir que não haja falsos positivos
  • Casos extremos que se aproximem dos limites de segurança, mas não os ultrapassem
  • Prompts adversariais que tentem obter respostas prejudiciais

Perguntas frequentes

Para guardrails personalizados e de conteúdo, o modo streaming não adiciona latência extra, mas a resposta pode começar antes que o guardrail seja acionado. O modo Blocking aguarda o guardrail antes que o agente responda, normalmente com cerca de 200–500 ms de atraso. Retry adiciona gerações extras completas (e reavaliações) por tentativa, até três vezes por turno bloqueado, o que também aumenta o custo baseado no uso.

O modo Streaming não adiciona latência, mas a resposta do agente pode começar antes que o guardrail seja acionado. O modo Blocking aguarda o resultado do guardrail antes que o agente responda (normalmente com 200–500 ms de atraso). Retry como estratégia de saída (trigger_action) está disponível apenas no modo blocking; no modo streaming, você usa encerrar chamada quando um guardrail é acionado. O modo Blocking permite retry com feedback de sistema inserido em vez de encerrar a conversa imediatamente - ao custo de uso extra do modelo e cobrança adicional quando ocorrem repetições. O modo Blocking é recomendado para agentes de texto; streaming é recomendado para agentes de voz.

Sim, mas recomendamos fortemente manter todos os guardrails ativados - especialmente o Guardrail de Foco. Eles protegem sua marca, seus usuários e sua postura de conformidade, e os recomendamos para todas as aplicações em produção, inclusive ferramentas internas. Em casos raros, você pode querer desativar um guardrail específico se ele interferir no caso de uso pretendido para seu agente. Por exemplo, algumas aplicações podem envolver tópicos que o Guardrail de Conteúdo sinalizaria em outras circunstâncias, ou um prompt de sistema altamente personalizado pode não funcionar corretamente com o Guardrail de Foco ativado. Cada guardrail pode ser ativado ou desativado individualmente.

Os acionamentos de guardrails são registrados e podem ser analisados nas análises das suas conversas. Se você identificar falsos positivos, ajuste os prompts dos seus guardrails. Não há um processo automatizado de contestação - o usuário deve simplesmente iniciar uma nova conversa.

As informações sobre qual guardrail foi acionado estão disponíveis nos registros das suas conversas.

Sim. Eles têm finalidades complementares. O reforço do prompt de sistema fornece orientação comportamental e evita a maioria dos problemas por meio do cumprimento de instruções. Os guardrails da plataforma oferecem aplicação independente como uma rede de segurança. Usar ambos cria defesa em profundidade.

Próximas etapas

Status de lançamento

No momento, o Guardrails está em Alpha, e estamos aprimorando ativamente o produto e expandindo seus recursos. Você pode esperar que o conjunto de recursos, os padrões, os controles do painel e os campos da API continuem evoluindo antes da disponibilidade geral, e algumas mudanças podem causar incompatibilidades.

Enquanto continuamos aprimorando o Guardrails, recomendamos validar sua configuração e monitorar o comportamento das barreiras de proteção nos seus logs. Também recomendamos revisar sua configuração à medida que as atualizações forem lançadas.