Resumo do Webinar: Como Criar Agentes de IA Seguros para Empresas
- Publicado
- Última atualização
OuvirOuça este artigo
Resumo do webinar: como criar agentes de IA seguros para implantação empresarial
Fazer um agente de IA lidar com conversas é a parte fácil. Fazer com que sua equipe de segurança, jurídica e seus clientes confiem nele é onde a maioria das implantações empresariais trava.
Este post resume nosso workshop ao vivo, Criando agentes de IA seguros para implantação empresarial, no qual apresentamos as ferramentas, os frameworks e as práticas de implantação que permitem que agentes empresariais funcionem em escala.
Como criar uma abordagem de segurança em camadas
Mais de quatro milhões de agentes foram implantados na plataforma ElevenAgents. Os que apresentam desempenho confiável em ambientes empresariais têm uma característica em comum: a segurança foi incorporada desde o início, não adicionada após o primeiro incidente.
Nossa sessão ao vivo abordou os frameworks, controles e práticas de implantação que diferenciam os agentes aprovados na análise de segurança daqueles que não são.
Agentes diferentes exigem limites fundamentalmente diferentes.
- Um personagem de vídeo game pode precisar usar linguagem explicitamente violenta como parte da experiência, mas nunca deve sair do personagem ou revelar que é uma IA.
- Uma recepcionista da área da saúde precisa falar sobre lesões e contextos médicos, mas nunca deve dar orientação médica.
- Um agente de suporte de cartão de crédito não deve lidar com conteúdo explícito e não deve compartilhar detalhes da conta com pessoas não verificadas.
Como os agentes não são determinísticos, nenhuma proteção isolada consegue cobrir completamente todos os riscos potenciais. Por isso, as equipes empresariais precisam de uma abordagem em camadas: vários controles trabalhando juntos para tornar falhas de segurança uma rara exceção.
Esse princípio orientou as quatro perguntas em torno das quais organizamos a sessão:
- Como posso controlar o que meu agente diz e faz?
- Como posso verificar se ele funciona?
- Como posso proteger os dados para cumprir requisitos de segurança e conformidade?
- Como posso criar processos para implantar com segurança
Como pensar no controle do comportamento de agentes
Em qualquer conversa com um agente, há três momentos em que a segurança precisa ser considerada.
Entrada
O usuário diz algo. Usuários adversariais podem tentar coisas como "ignore todas as instruções anteriores" ou "finja que você é um assistente diferente". Você precisa detectar e lidar com tentativas de manipulação antes que elas cheguem ao modelo. Isso evita custos desnecessários e impede que pessoas mal-intencionadas extraiam informações às quais não deveriam ter acesso.
Tomada de decisão
O LLM decide o que dizer ou fazer. É nesse ponto que seu prompt de sistema é seu principal mecanismo de controle, mas, em conversas longas ou complexas, os LLMs podem se desviar de suas instruções. Você precisa de mecanismos que reforcem o comportamento durante toda a conversa, e não apenas no início. Também deve definir caminhos de escalonamento: há situações em que o agente deve transferir o atendimento para uma pessoa ou para um agente mais especializado? Em quais condições?
Saída
Mesmo com orientações robustas, algo pode passar despercebido, especialmente em conversas longas. Você precisa de uma última camada de proteção. Pense nela como um miniagente que verifica o trabalho do seu agente principal: ele avalia a resposta antes de ela chegar ao usuário e decide se deve entregá-la, tentar novamente ou escalar o caso. Ele também é executado em paralelo com a geração da resposta, adicionando latência mínima.
Nos três casos, você precisa definir antecipadamente suas estratégias de saída: uma violação encerra a conversa, aciona uma nova tentativa com orientação corretiva ou transfere para uma pessoa? Essa decisão molda a experiência do usuário quando algo dá errado.
Demonstração 1: configurando guardrails no ElevenAgents
Cenário: Um agente de vendas e suporte para sites é configurado com várias camadas de controles de segurança para evitar manipulação, respostas fora do tema e violações de política.
O que foi mostrado:
- Guardrail de manipulação (entrada) - localizado na aba Segurança, este controle detecta padrões de injeção de prompt — tentativas de substituir instruções do sistema — e encerra a conversa antes que o agente responda. Recomendado para todos os agentes em produção.
- Prompt de sistema e guardrail Focus (tomada de decisão) - o prompt de sistema é fundamental. Todas as regras importantes devem constar nele de forma explícita. Na demonstração, uma instrução foi adicionada durante a sessão: "Não ofereça nenhum desconto". O guardrail Focus, ativado separadamente, reforça automaticamente o prompt de sistema durante toda a conversa, resolvendo o problema de desvio que ocorre em interações mais longas. A combinação de um prompt de sistema robusto com o Focus ativado é a dupla mais eficaz para manter um agente no rumo certo.
- Guardrail de conteúdo (saída) - categorias pré-configuradas que abrangem palavrões, orientação jurídica e opiniões políticas. Cada uma tem um limite de confiança ajustável — médio é o ponto de partida recomendado. Esta é a camada de contingência: se o agente estiver prestes a produzir algo que não deveria, ela intercepta antes da entrega.
- Guardrail personalizado (saída) - verificações definidas pelo usuário e escritas em linguagem natural para qualquer caso não abrangido pelas predefinições. Na demonstração, foi configurado um guardrail de "sem descontos": "Bloqueie qualquer resposta que mencione descontos, promoções ou preços especiais que o agente não está autorizado a oferecer." Os guardrails personalizados usam uma avaliação adicional de LLM — portanto, há um custo baseado no uso e uma questão de latência a considerar. Escreva instruções objetivas e separe verificações distintas em guardrails diferentes, em vez de combiná-las
- Ação em caso de violação - duas opções: encerrar a chamada ou tentar novamente. Ao tentar novamente, você pode fornecer instruções adicionais para orientar a próxima tentativa do agente — por exemplo, escalando para uma pessoa ou enviando uma mensagem padrão de redirecionamento.
Por que isso importa: Esses controles não servem para todos os casos da mesma forma. Eles podem ser configurados individualmente para cada guardrail. Essa granularidade é o que diferencia um agente teoricamente seguro de um agente operacionalmente seguro em diversos contextos empresariais.
Demonstração 2: testes de simulação antes do lançamento
Cenário: Um agente de suporte é testado em dois cenários de conversa relacionados a descontos para confirmar que ele redireciona os usuários para a página de preços sem oferecer descontos.
O que foi mostrado:
- Dois testes de simulação definidos na aba Testes, cada um com um cenário de usuário simulado, um número definido de interações na conversa e critérios explícitos de sucesso
- Um teste falhou inicialmente porque o prompt de sistema não incluía instruções específicas para casos extremos
- As instruções ausentes foram adicionadas à seção de guardrails do prompt de sistema
- O agente foi publicado novamente e ambos os testes foram executados outra vez — os dois passaram
- O histórico detalhado de execução mostra exatamente qual parte de uma conversa falhou, incluindo chamadas de ferramentas e ações do agente
Por que isso importa: Os testes de simulação permitem que as equipes validem o comportamento do agente em um ambiente controlado antes que qualquer usuário real interaja com ele. Eles abrangem tanto cenários rotineiros quanto adversariais. Também são executados considerando todo o fluxo da conversa, não apenas respostas individuais. À medida que são feitas alterações, os testes podem ser executados novamente de imediato para confirmar que a correção funcionou.
Demonstração 3: mascaramento de PII para implantações sensíveis
Cenário: Um agente empresarial é configurado para mascarar informações de identificação pessoal nos registros de conversas.
O que foi mostrado:
- Controle de mascaramento do histórico de conversas localizado na aba Avançado, nas configurações de Privacidade
- Uma lista de entidades de dados específicas que podem ser selecionadas individualmente para mascaramento, incluindo data de nascimento, idade e outros campos sensíveis
- Opção de selecionar todas as entidades ou apenas aquelas relevantes para o caso de uso específico do agente
Por que isso importa: O mascaramento de PII não substitui o modo de retenção zero em ambientes com alta exigência de conformidade, como os sujeitos à HIPAA. O que ele faz é reduzir a exposição de dados em registros de conversas usados para revisão interna ou controle de qualidade. As equipes podem manter os registros de que precisam e remover os dados de que não precisam. Atualmente, esse recurso está disponível para clientes empresariais.
Práticas recomendadas para a implantação segura de agentes empresariais
- Use uma abordagem em camadas. Nenhum controle isolado garante um comportamento seguro. Guardrails de entrada, validação de saída, fortalecimento de prompts e testes precisam trabalhar juntos. Cada camada reforça as demais e, juntas, reduzem significativamente o risco de problemas de segurança.
- Adapte os guardrails ao contexto. Um agente da área da saúde e um agente de suporte ao varejo precisam de regras diferentes. Defina limites específicos para o seu caso de uso, e não um modelo genérico.
- Comece com um caso de uso relevante. As implantações empresariais mais bem-sucedidas não começam com um piloto descartável. Elas escolhem algo real, como suporte ao cliente, agendamento, e investem para fazer isso da forma certa.
- Teste antes do lançamento e continue testando. Use testes de simulação e ferramentas externas de red teaming. Teste cenários rotineiros e adversariais. Adicione à sua suíte de testes novos casos extremos identificados em produção.
- Implante em etapas. Comece com tráfego limitado. Monitore conversas reais. Identifique com o que o agente tem dificuldade. Faça ajustes, teste novamente e então expanda.
- Escolha o modo de execução de forma intencional. Use o modo de bloqueio para agentes de texto, quando a validação rigorosa é mais importante que a velocidade. Use o modo de streaming para agentes de voz quando a latência for a prioridade.
- Defina ações claras para violações de guardrails. Decida antecipadamente se uma violação deve encerrar a chamada, acionar uma nova tentativa ou escalar para uma pessoa.
- Mantenha as instruções dos guardrails personalizados concisas. Os guardrails são executados em paralelo. Um guardrail personalizado longo e complexo aumenta a latência. Escreva instruções objetivas e separe verificações distintas em guardrails diferentes.
- Entenda o que as certificações realmente cobrem. SOC 2 Type 2 e ISO 27001 são requisitos básicos. Normas específicas de domínio, como HIPAA e PCI DSS, abrangem setores regulamentados. Certificações mais recentes e específicas para IA, como ISO 42001 e AIUC-1 abordam viés, transparência e resiliência contra ataques adversariais — e a certificação AIUC-1 pode viabilizar seguros específicos para IA.
- Desenvolva processos robustos desde cedo. A primeira implantação leva mais tempo. Equipes que investem em testes e no processo de implantação conseguem iterar muito mais rápido em cada agente posterior.
Assista à sessão completa
Assista ao webinar completo aqui.

.webp&w=3840&q=80)
.webp&w=3840&q=80)


