Testes de Agentes
Tenha confiança no comportamento do seu agente com testes automatizados
Os testes de agentes permitem verificar respostas conversacionais, uso de ferramentas e resultados completos com múltiplos turnos antes da implantação. Crie testes do zero ou a partir de conversas existentes e execute-os pelo painel, CLI ou API.
Guia em Vídeo
Visão geral
O framework inclui três tipos de teste complementares:
- Teste de Simulação — Executa conversas completas com múltiplos turnos e um usuário simulado
- Teste de Próxima Resposta (Cenário) — Valida a próxima resposta do agente com base em critérios de sucesso
- Teste de Chamada de Ferramenta — Garante que o agente chame a ferramenta certa com os parâmetros corretos
Quando usar cada teste
Como criar testes a partir de conversas
Transforme conversas reais em casos de teste ao identificar uma interação em que o agente teve um desempenho abaixo do esperado.

- Abra a conversa no histórico de chamadas
- Clique em Criar teste a partir desta conversa
- Revise o contexto preenchido automaticamente e defina o comportamento esperado
- Adicione o teste à sua suíte para detectar falhas semelhantes depois
Teste de Simulação
O teste de simulação avalia seu agente ao longo de uma conversa completa com múltiplos turnos e um usuário de IA simulado. Diferentemente dos testes de Próxima Resposta, esse tipo verifica se a interação completa alcança o resultado definido.
Como criar um Teste de Simulação

Defina o cenário
Descreva o contexto, a intenção e o comportamento do usuário em linguagem natural. O simulador usa esse cenário para conduzir a conversa.
Exemplo de cenário:
“Um turista que não fala inglês fluentemente está tentando fazer um pedido em um restaurante.”
Defina a condição de sucesso
Defina o resultado que deve ser considerado uma aprovação. Esse prompt é usado para avaliar se a conversa completa foi bem-sucedida.
Exemplo de condição de sucesso:
“O agente confirmou os detalhes do pedido, lidou com perguntas de esclarecimento e concluiu o pedido sem mal-entendidos.”
Configuração opcional
Você pode refinar o comportamento da simulação no painel de configuração do teste:
- Ambiente: Selecione o ambiente a ser testado quando seu agente tiver vários ambientes configurados. Se apenas um ambiente estiver disponível, esse seletor ficará oculto.
- Histórico de chat: Comece com uma conversa parcial em vez de um estado em branco. Isso é útil para testar conversas em andamento e comportamentos de recuperação.
- Variáveis dinâmicas: Insira valores específicos do teste nas variáveis do seu agente (por exemplo, nomes de usuários ou IDs de pedidos) sem alterar a configuração base do agente.
Simulação de ferramentas
Os testes de simulação aceitam simulação de ferramentas para que seu agente possa receber respostas controladas durante uma execução, em vez de chamar sistemas ativos.
Estratégia de simulação
- Não simular nenhuma: Nenhuma ferramenta é simulada.
- Simular todas as ferramentas: Todas as ferramentas que podem ser simuladas retornam uma resposta simulada.
- Simular ferramentas selecionadas: Apenas as ferramentas que você escolher explicitamente são simuladas.
Ferramentas de sistema e ferramentas de workflow nunca são simuladas.
Comportamento de fallback
Se uma ferramenta simulada for chamada e nenhuma resposta simulada correspondente for encontrada, escolha um destes comportamentos:
- Chamar ferramenta real: Executa a chamada da ferramenta real.
- Finalizar com erro: Retorna uma resposta de erro da ferramenta em vez de chamar a ferramenta real.
A configuração de fallback aparece apenas quando pelo menos uma ferramenta é simulada.
Teste de Próxima Resposta (Cenário)
O teste de Próxima Resposta (Cenário) avalia apenas a próxima mensagem do agente, não um resultado completo com múltiplos turnos. Forneça o histórico da conversa que antecede a resposta que você quer avaliar e, depois, avalie essa resposta com base em critérios de sucesso.
Para resultados completos com múltiplos turnos, use o Teste de Simulação.
Como criar um Teste de Próxima Resposta

Defina o histórico de chat
Forneça o histórico da conversa que antecede a resposta que você quer avaliar. Pode ser uma única mensagem do usuário ou vários turnos de contexto.
Exemplo de histórico de chat:
Defina os critérios de sucesso
Descreva em linguagem simples o que a resposta do agente deve alcançar. Seja específico sobre o comportamento, tom e ações esperados.
Exemplo de critérios de sucesso:
- O agente deve reconhecer a frustração do cliente com empatia
- O agente deve se oferecer para investigar a cobrança duplicada
- O agente deve fornecer próximos passos claros para cancelamento ou resolução
- O agente deve manter um tom profissional e prestativo
Forneça exemplos
Apresente exemplos de sucesso e de falha para ajudar o avaliador a entender as nuances dos seus critérios.
Exemplo de sucesso:
“Entendo como cobranças duplicadas podem ser frustrantes. Vou verificar isso para você imediatamente. Vejo que houve realmente duas cobranças neste mês — vou processar o reembolso da cobrança duplicada agora. Você ainda gostaria de prosseguir com o cancelamento ou prefere continuar após a resolução disso?”
Exemplo de falha:
“Você precisa entrar em contato com o departamento de cobrança para questões de reembolso. Sua assinatura será cancelada.”
Teste de Chamada de Ferramenta
O teste de chamada de ferramenta verifica se seu agente usa as ferramentas corretamente e passa os parâmetros certos em situações específicas. Isso é fundamental para ações como transferências de chamadas, consultas de dados ou integrações externas.
Como criar um Teste de Chamada de Ferramenta

Selecione a ferramenta
Escolha qual ferramenta você espera que o agente chame no cenário informado (por exemplo,
transfer_to_number, end_call, lookup_order).
Defina os parâmetros esperados
Especifique quais dados o agente deve passar para a ferramenta. Você tem três métodos de validação:
Métodos de validação
Correspondência exata
O parâmetro deve corresponder exatamente ao valor especificado.
Padrão Regex O parâmetro deve corresponder a um padrão específico.
Avaliação por LLM Uma LLM avalia se o parâmetro está semanticamente correto com base no contexto.
Casos de uso críticos
O teste de chamada de ferramenta é essencial para cenários de alto risco:
- Transferências de emergência: Garanta que emergências médicas sejam sempre encaminhadas para o número correto
- Segurança de dados: Verifique se informações confidenciais nunca são enviadas para ferramentas não autorizadas
- Lógica de negócio: Confirme que consultas de pedidos usam formatos e autenticação válidos
Execução de testes
Escreva testes para comportamentos novos ou falhas conhecidas, execute-os enquanto ajusta prompts e configurações e, depois, salve-os quando forem aprovados.
Executar pelo painel
Executar pela CLI
Executar pela API
Acesse a aba Tests na interface do seu agente. Nela, você pode executar testes individuais, selecionar vários testes da sua biblioteca como um lote ou executar toda a sua suíte com Run All Tests.

Testes probabilísticos
As respostas do agente podem variar entre execuções. Uma única aprovação mostra que o agente pode ter sucesso; os testes probabilísticos mostram com que frequência ele terá sucesso ao executar o mesmo teste várias vezes e informar uma taxa de aprovação.
Executar um teste várias vezes

Ao acionar um teste pelo painel, use o controle de execuções múltiplas no botão de execução para escolher quantas vezes executá-lo (por exemplo, 3×, 5× ou 15×). Cada execução é independente: o agente recebe o mesmo histórico de chat, as mesmas variáveis dinâmicas e outras entradas, mas sua resposta é gerada novamente a cada vez.
A execução múltipla funciona para testes individuais, pastas e para a execução de toda a suíte de testes vinculada a um agente. Ela é compatível com os três tipos de teste — Simulação, Próxima Resposta (Cenário) e Chamada de Ferramenta — e costuma ser mais útil para testes de Simulação, em que a maior abrangência de uma conversa com múltiplos turnos torna a variação de respostas mais provável.
Taxas de aprovação e agrupamento de resultados

Após a conclusão de uma execução múltipla, os resultados são resumidos como uma taxa de aprovação (por exemplo, 4/5 aprovados) com um selo colorido:
- Verde — 100% aprovados
- Âmbar — pelo menos 80% aprovados
- Vermelho — menos de 80%
As execuções individuais são agrupadas por motivo de falha para que você possa ver como o agente falha, e não apenas que ele falha. Em vez de percorrer cinco transcrições separadas para identificar o que mudou, você vê grupos como “Encaminhou corretamente para cobrança (4 execuções)” e “Inventou um número de suporte (1 execução)”, cada um expansível para acessar as transcrições e a justificativa da avaliação.
Quando usar
- Antes de lançar uma alteração — Execute novamente os testes vinculados de forma probabilística para confirmar que a confiabilidade não caiu (por exemplo, de 95% para 60%).
- Diagnóstico de comportamento instável — Uma única falha pode ser ruído; uma falha em 1 de 5 execuções, com uma categoria de falha claramente identificada, é um problema reproduzível a ser corrigido.
- Ajuste de prompts e ferramentas — Faça ajustes na configuração e compare taxas de aprovação lado a lado, em vez de depender de execuções isoladas.
Execução probabilística pela API ou SDK
Passe repeat_count (entre 2 e 20) na solicitação run-tests para executar cada teste essa quantidade de vezes. Definir repeat_count ativa automaticamente o agrupamento de falhas na resposta, portanto, a invocação retornada inclui o agrupamento por categoria e a taxa de aprovação que você veria no painel.
Boas práticas
Próximas etapas
- Consulte a documentação da CLI para configurar testes automatizados
- Explore a configuração de ferramentas para entender as ferramentas disponíveis
- Leia o guia de prompting para escrever prompts testáveis