Experimentos

Execute testes A/B controlados no tráfego de produção para otimizar o desempenho dos agentes com dados, não intuição

Os experimentos permitem executar testes A/B controlados em qualquer aspecto da configuração do agente — estrutura do prompt, lógica do workflow, voz, personalidade, ferramentas, base de conhecimento — direcionando uma parcela definida do tráfego para uma variante, medindo o impacto nos principais resultados e promovendo as vencedoras para produção.

Os experimentos são desenvolvidos sobre o versionamento de agentes. O versionamento precisa estar ativado no seu agente antes que você possa executar experimentos.

Por que experimentar

Sem experimentação estruturada, a otimização depende da intuição. Um ajuste no prompt “parece” melhor. Um ajuste no workflow “deve” melhorar a taxa de resolução. Um novo caminho de escalonamento “parece” mais eficiente.

Os experimentos substituem suposições por evidências. Você testa mudanças com tráfego real, mede resultados reais e promove o que funciona.

Como funciona

Os experimentos seguem um workflow de quatro etapas:

1

Criar uma variante

Comece com a configuração atual do seu agente e crie uma nova branch. Modifique qualquer elemento — prompt de sistema, workflow, voz, ferramentas, base de conhecimento, proteções ou critérios de avaliação. Cada mudança é monitorada como uma configuração versionada.

Acesse a aba Branches nas configurações do seu agente e clique em Create branch.

2

Direcionar tráfego

Defina qual porcentagem das conversas ao vivo deve ir para sua variante. Comece com uma parcela pequena (5 a 10%) para limitar riscos e aumente conforme sua confiança crescer.

Clique em Edit traffic split e defina as porcentagens para cada branch. As porcentagens devem somar exatamente 100%.

Configurando a divisão de tráfego entre branches

3

Medir o impacto

Compare o desempenho da variante com sua referência usando o dashboard de analytics. Clique em See analytics no painel de branches para acessar diretamente uma visualização filtrada por branch.

Painel de branches mostrando as branches principal e variante, com divisão de tráfego e opções de mesclagem

As equipes podem medir resultados como:

  • CSAT
  • Taxa de resolução
  • Conversão
  • Tempo médio de atendimento
  • Latência mediana de resposta do agente
  • Custo por resolução do agente
4

Promover a vencedora

Quando uma variante demonstrar uma melhoria mensurável, aumente sua parcela de tráfego ou mescle-a à branch principal para torná-la o novo padrão. Todo o histórico de versões é preservado, permitindo reversões quando necessário.

Roteamento de tráfego

O tráfego é dividido entre branches por porcentagem. O roteamento é determinístico com base no ID da conversa, para que o mesmo usuário acesse sempre a mesma branch em todas as sessões.

Por padrão, o tráfego é distribuído aleatoriamente entre a base de usuários. Se você usar a API para iniciar conversas, poderá direcionar coortes específicas para branches específicas controlando quais conversas são iniciadas com cada configuração de branch.

Todas as porcentagens de tráfego devem somar exatamente 100%. Uma implantação falhará se não somarem.

Casos de uso

Os experimentos permitem a otimização contínua de workflows voltados ao cliente e operacionais.

Experiência do cliente

Teste se um fluxo de escalonamento revisado melhora o CSAT sem aumentar o tempo de atendimento. Compare diferentes estilos de saudação, níveis de empatia ou estratégias de resolução.

Receita

Teste se um tom mais direto ou uma lógica de qualificação diferente aumenta a conversão. Experimente abordagens para objeções, apresentação de preços ou momento do acompanhamento.

Operações

Meça se mudanças na lógica das ferramentas reduzem o tempo médio de atendimento ou o custo de infraestrutura. Teste diferentes configurações de base de conhecimento ou estruturas de workflow.

Cada experimento está vinculado a uma versão específica do agente, para que toda mudança de desempenho possa ser atribuída a uma alteração de configuração definida.

O que você pode testar

Qualquer aspecto da configuração do agente pode variar entre branches:

CategoriaExemplos
Prompt de sistemaTom, instruções, personalidade, proteções
WorkflowEstrutura de nós, lógica de ramificação, caminhos de escalonamento
VozSeleção de voz, modelo TTS, configurações de velocidade
FerramentasConfiguração de ferramentas, lógica de ferramentas de webhook, servidores MCP
Base de conhecimentoDocumentos diferentes, configurações de RAG
LLMSeleção de modelo, temperatura, máximo de tokens
Critérios de avaliaçãoMétricas de sucesso diferentes por branch
IdiomaConfigurações de idioma, configurações multilíngues

Boas práticas

Defina o que você espera melhorar e como vai medir isso antes de criar uma variante. Por exemplo: “Alterar o prompt de escalonamento para incluir um resumo do problema melhorará nosso critério de avaliação da taxa de resolução em 10%.”

Isolar uma única variável deixa claro o que causou qualquer diferença de desempenho. Se você mudar o prompt, a voz e o workflow ao mesmo tempo, não saberá qual mudança gerou o resultado.

Configure critérios de avaliação de sucesso antes de executar experimentos. Eles fornecem as métricas estruturadas de que você precisa para comparar variantes objetivamente.

Comece com 5 a 10% do tráfego na variante. Isso limita a exposição caso algo dê errado, enquanto ainda gera dados relevantes.

Permita que conversas suficientes se acumulem antes de tirar conclusões. Tamanhos de amostra pequenos levam a resultados pouco confiáveis. Monitore o dashboard de analytics e espere as tendências se estabilizarem.

Mescle ou descarte os experimentos rapidamente. Branches de longa duração se tornam mais difíceis de mesclar e podem se distanciar da configuração principal.

Próximas etapas