Pular para o conteúdo

Guardrails 2.0: Uma nova camada de controle no ElevenAgents

Publicado
Última atualização

OuvirOuça este artigo

À medida que os agentes de voz assumem trabalhos de alto impacto em suporte, vendas, marketing, workflows internos e muito mais, as equipes precisam ter a confiança de que eles permanecerão seguros, alinhados à marca e em conformidade em escala empresarial.

O Guardrails 2.0 no ElevenAgents é uma camada de controle redesenhada que ajuda a orientar os agentes para as respostas certas e a impedir as erradas antes que cheguem ao usuário final.

Guardrails Cover

Proteções em camadas em tempo real

Um prompt de sistema bem elaborado resulta em comportamentos previsíveis na maioria das interações. Porém, como os agentes são sistemas não determinísticos, eles podem se desviar em conversas longas, os usuários podem encontrar formas criativas de ultrapassar limites e até políticas bem definidas nem sempre se sustentam quando o modelo está sob pressão.

Por isso, as equipes que implantam agentes em produção precisam de defesas em camadas: um prompt de sistema robusto como base, além de verificações independentes do que os usuários dizem e de como os agentes respondem.

O Guardrails 2.0 protege as conversas em três níveis, que se reforçam mutuamente:

O que faz
Fortalecimento do prompt de sistema
Defina comportamentos permitidos e proibidos no prompt de sistema. O Focus Guardrail reforça essas instruções durante toda a conversa.
Validação da entrada do usuário
Uma rede de segurança que detecta tentativas de injeção de prompt e manipulação, encerrando conversas que representam um risco de segurança.
Validação da resposta do agente
Avalia cada resposta em relação às suas políticas em tempo real. Se uma resposta violar suas regras, ela poderá ser bloqueada antes do envio.
Guardrails
Fortalecimento do prompt de sistema
Focus
Validação da entrada do usuário
Manipulation
Validação da resposta do agente
Content, Custom Guardrails

Proteções integradas

As proteções integradas abrangem as áreas de risco mais comuns.

O Focus Guardrail reforça o prompt de sistema do seu agente, ajudando a manter as respostas objetivas, relevantes e alinhadas às metas e instruções que você definiu. Isso é especialmente útil em conversas longas ou complexas, nas quais é mais provável que o agente se desvie dos objetivos pretendidos.

Manipulation Guardrails detectam e bloqueiam tentativas de usuários de ignorar as instruções do sistema. Quando ativados, analisam as entradas do usuário em busca de padrões que indiquem tentativas de injeção de prompt ou substituição de instruções e podem encerrar conversas que representem um risco de segurança.

Content Guardrails ajudam a garantir respostas adequadas dos agentes ao analisar diversas categorias de conteúdo potencialmente sensível ou inseguro, cada uma com limites ajustáveis para um controle preciso.

Custom Guardrails: suas regras, aplicadas automaticamente

Os Custom Guardrails permitem definir políticas específicas do seu domínio em linguagem natural e aplicá-las automaticamente em todas as chamadas. Isso ajuda a reduzir incidentes, escalonamentos e ciclos de revisão de conformidade que podem atrasar a implantação.

Custom Guardrail Configuration Example

Um modelo leve avalia cada resposta do agente com base nas suas regras e decide se ela deve ser bloqueada ou permitida, funcionando de forma independente e paralela à geração da resposta.

Controle total sobre a execução dos guardrails

Você pode controlar como as violações de política são detectadas e o que acontece em seguida.

Modos de execução. Configure o equilíbrio entre velocidade e rigor — algo essencial para voz, em que a latência é o mais importante. Você pode executar os guardrails junto com a resposta, com atraso quase zero, embora uma fração de segundo de áudio possa ser reproduzida antes da interceptação. Ou pode reter as respostas até que sejam totalmente aprovadas — é um pouco mais lento, mas nada chega ao usuário sem verificação.

Estratégias de saída. Quando um guardrail é acionado, você define o que acontece em seguida: encerrar a conversa, transferir para outro agente, escalar para uma pessoa ou tentar novamente a resposta com instruções corretivas.

Níveis de sensibilidade do conteúdo. Ajuste a sensibilidade de cada categoria de conteúdo, reforçando a aplicação em casos de uso de maior risco e flexibilizando-a quando bloqueios excessivos prejudicariam a experiência do usuário.

Configuração granular. Cada guardrail pode ser ativado ou desativado individualmente, e diferentes agentes podem executar configurações diferentes.

Visibilidade completa. Cada acionamento é registrado nas análises das suas conversas, incluindo qual guardrail foi acionado e qual ação foi tomada. Isso fornece às equipes os dados necessários para aprimorar seus prompts de sistema e guardrails ao longo do tempo.

Redação do histórico de conversas

Depois que uma chamada termina, você pode redigir automaticamente informações sensíveis de transcrições, gravações e payloads de webhook. Mantenha tudo de que precisa para análises, controle de qualidade e treinamento, removendo o que não precisa.

As entidades detectadas são substituídas por placeholders no texto e bipes no áudio. Você controla o nível de detalhe por tipo de entidade: pode redigir todos os nomes ou apenas sobrenomes, todos os identificadores financeiros ou apenas números de cartão de pagamento.

Esse recurso complementa controles de dados mais abrangentes, como o Modo de retenção zero, que pode ser usado em implantações com requisitos de conformidade mais rigorosos.

Conversation History Redaction Example

A redação do histórico de conversas e o Modo de retenção zero estão disponíveis para clientes empresariais. Fale com vendas para obter acesso.

Parte de uma base mais ampla de confiança e segurança

O Guardrails 2.0 e os recursos de privacidade de dados oferecem suporte a implantações empresariais do ElevenAgents, junto com ferramentas de segurança para cada etapa do ciclo de vida do agente:

Desenvolvimento de agentes

  • Criação de prompts de sistema, configuração de guardrails, red teaming e simulações para testar o comportamento sob pressão antes de os agentes entrarem em operação

Todas as conversas

  • Durante: Guardrails 2.0 (Focus, Manipulation, Content e Custom Guardrails), registros e Modo de retenção zero opcional
  • Depois: Critérios de avaliação, monitoramento e redação do histórico de conversas opcional

Juntos, esses recursos oferecem às equipes os controles necessários para passar do piloto à produção com menos incidentes, ciclos de aprovação mais rápidos e comportamento mais consistente dos agentes. Essas bases da plataforma também apoiam a elegibilidade para a certificação AIUC-1 e o acesso às primeiras apólices de seguro para agentes do setor.

Comece a usar o Guardrails hoje

Lançamos recursos nos últimos meses, e a suíte completa do Guardrails 2.0 agora está disponível em alfa no ElevenAgents.

Ative-os na aba Segurança das configurações do seu agente, ou configure-os pela API. Para mais informações sobre implantações empresariais, fale com nossa equipe de vendas.

Para orientações de configuração e boas práticas, consulte:

Artigos relacionados

Crie com o áudio de IA da mais alta qualidade