Apresentamos o Eleven v4Conheça o Eleven v4, nosso modelo mais expressivo até agora. Com 3x mais créditos incluídos no Creator+ até 12 de outubro

Pular para o conteúdo

Guardrails 2.0: Uma nova camada de controle no ElevenAgents

Publicado
Última atualização

OuvirOuça este artigo

À medida que agentes de voz assumem tarefas de alto impacto em suporte, vendas, marketing, fluxos de trabalho internos e muito mais, as equipes precisam ter confiança de que eles permanecerão seguros, alinhados à marca e em conformidade em escala empresarial.

O Guardrails 2.0 no ElevenAgents é uma camada de controle redesenhada que ajuda a orientar os agentes para as respostas certas e evitar as erradas antes que cheguem ao usuário final.

Guardrails Cover

Proteções em camadas em tempo real

Um prompt de sistema bem elaborado leva a um comportamento previsível na maioria das interações. No entanto, como os agentes são sistemas não determinísticos, eles podem se desviar em conversas longas, os usuários podem encontrar formas criativas de ultrapassar limites e até políticas bem definidas nem sempre se sustentam quando o modelo está sob pressão.

Por isso, as equipes que implementam agentes em produção precisam de defesas em camadas: um prompt de sistema robusto como base, além de verificações independentes sobre o que os usuários dizem e como os agentes respondem.

O Guardrails 2.0 protege as conversas em três níveis, cada um reforçando os demais:

O que faz
Reforço do prompt de sistema
Defina comportamentos permitidos e proibidos no prompt de sistema. O Focus Guardrail reforça essas instruções durante toda a conversa.
Validação da entrada do usuário
Uma rede de segurança que identifica tentativas de injeção e manipulação de prompts, encerrando conversas que apresentam risco à segurança.
Validação da resposta do agente
Avalia cada resposta em relação às suas políticas em tempo real. Se uma resposta violar suas regras, ela poderá ser bloqueada antes do envio.
Guardrails
Reforço do prompt de sistema
Foco
Validação da entrada do usuário
Manipulação
Validação da resposta do agente
Conteúdo, Guardrails personalizados

Proteções pré-configuradas

As proteções pré-configuradas abrangem as áreas de risco mais comuns.

O Focus Guardrail reforça o prompt de sistema do seu agente, ajudando a manter as respostas direcionadas, relevantes e consistentes com seus objetivos e instruções definidos. Isso é especialmente útil em conversas longas ou complexas, nas quais o agente tem mais probabilidade de se desviar dos objetivos pretendidos.

Guardrails de Manipulação detectam e bloqueiam tentativas de usuários de contornar as instruções do sistema. Quando ativados, o sistema analisa as entradas dos usuários em busca de padrões que indiquem tentativas de injeção de prompt ou de substituir instruções e pode encerrar conversas que apresentem risco à segurança.

Guardrails de Conteúdo ajudam a garantir respostas apropriadas dos agentes ao analisar diversas categorias de conteúdo potencialmente sensível ou inseguro, cada uma com limites ajustáveis para um controle preciso.

Guardrails personalizados: suas regras, aplicadas automaticamente

Os Guardrails personalizados permitem definir políticas específicas do seu domínio em linguagem natural e aplicá-las automaticamente em todas as chamadas. Isso ajuda a reduzir incidentes, escalonamentos e ciclos de revisão de conformidade que podem atrasar a implementação.

Custom Guardrail Configuration Example

Um modelo leve avalia cada resposta do agente em relação às suas regras e retorna uma decisão de bloquear ou permitir, funcionando de forma independente e em paralelo à geração da resposta.

Controle total sobre a execução dos guardrails

Você pode controlar como as violações de política são detectadas e o que acontece em seguida.

Modos de execução. Configure o equilíbrio entre velocidade e rigor — essencial para voz, em que a latência é ainda mais importante. Você pode executar os guardrails junto com a resposta para um atraso quase nulo, embora uma fração de segundo de áudio possa ser reproduzida antes da interceptação. Ou reter as respostas até que sejam totalmente liberadas — um pouco mais lento, mas nada chega ao usuário sem verificação.

Estratégias de saída. Quando um guardrail é acionado, você define o que acontece em seguida: encerrar a conversa, transferir para outro agente, escalar para uma pessoa ou tentar novamente a resposta com instruções corretivas.

Níveis de sensibilidade de conteúdo. Ajuste a sensibilidade entre categorias individuais de conteúdo, aumentando o rigor para casos de uso de maior risco e reduzindo-o onde bloqueios excessivos prejudicariam a experiência do usuário.

Configuração granular. Cada guardrail pode ser ativado ou desativado individualmente, e diferentes agentes podem executar configurações diferentes.

Visibilidade completa. Cada acionamento é registrado nas suas análises de conversa, incluindo qual guardrail foi acionado e qual ação foi tomada. Isso fornece às equipes os dados necessários para aprimorar seus prompts de sistema e guardrails ao longo do tempo.

Redação do histórico de conversas

Após o término de uma chamada, você pode ocultar automaticamente informações sensíveis de transcrições, gravações e cargas úteis de webhooks. Mantenha tudo de que precisa para análises, controle de qualidade e treinamento, removendo o que não precisa.

As entidades detectadas são substituídas por marcadores no texto e bipes no áudio. Você controla a granularidade até o nível dos tipos individuais de entidade: oculte todos os nomes ou apenas sobrenomes, todos os identificadores financeiros ou apenas números de cartões de pagamento.

Isso complementa controles de dados mais amplos, como o Modo de Retenção Zero, que pode ser usado em implementações com requisitos de conformidade mais rigorosos.

Conversation History Redaction Example

A redação do histórico de conversas e o Modo de Retenção Zero estão disponíveis para clientes empresariais. Fale com vendas para ter acesso.

Parte de uma base mais ampla de confiança e segurança

O Guardrails 2.0 e os recursos de privacidade de dados oferecem suporte a implementações empresariais do ElevenAgents, junto a ferramentas de segurança para todas as etapas do ciclo de vida do agente:

Desenvolvimento de agentes

  • Design de prompt de sistema, configuração de guardrails, red teaming e simulações para testar o comportamento sob pressão antes de colocar os agentes em operação

Todas as conversas

  • Durante: Guardrails 2.0 (Foco, Manipulação, Conteúdo e Guardrails personalizados), registros, Modo de Retenção Zero opcional
  • Depois: Critérios de avaliação, monitoramento, redação do histórico de conversas opcional

Juntos, eles oferecem às equipes os controles de que precisam para passar do piloto à produção com menos incidentes, ciclos de aprovação mais rápidos e comportamento mais consistente dos agentes. Essas bases da plataforma também dão suporte à elegibilidade para a certificação AIUC-1 e ao acesso às primeiras apólices de seguro para agentes do setor.

Comece a usar o Guardrails hoje

Lançamos recursos nos últimos meses, e a suíte completa do Guardrails 2.0 agora está disponível em alfa no ElevenAgents.

Ative-os na aba Segurança das configurações do agente, ou configure-os pela API. Para saber mais sobre implementações empresariais, fale com nossa equipe de vendas.

Para orientações de configuração e práticas recomendadas, consulte:

Tenha acesso a controles de dados empresariais

Precisa de outra coisa? Acesse nossa Central de ajuda

Artigos relacionados

Crie com o áudio de IA da mais alta qualidade