Experimentos
Execute testes A/B controlados no tráfego de produção para otimizar o desempenho dos agentes com dados, não intuição
Os experimentos permitem executar testes A/B controlados em qualquer aspecto da configuração do agente — estrutura do prompt, lógica do workflow, voz, personalidade, ferramentas, base de conhecimento — direcionando uma parcela definida do tráfego para uma variante, medindo o impacto nos principais resultados e promovendo as vencedoras para produção.
Os experimentos são desenvolvidos sobre o versionamento de agentes. O versionamento precisa estar ativado no seu agente antes que você possa executar experimentos.
Por que experimentar
Sem experimentação estruturada, a otimização depende da intuição. Um ajuste no prompt “parece” melhor. Um ajuste no workflow “deve” melhorar a taxa de resolução. Um novo caminho de escalonamento “parece” mais eficiente.
Os experimentos substituem suposições por evidências. Você testa mudanças com tráfego real, mede resultados reais e promove o que funciona.
Como funciona
Os experimentos seguem um workflow de quatro etapas:
Criar uma variante
Comece com a configuração atual do seu agente e crie uma nova branch. Modifique qualquer elemento — prompt de sistema, workflow, voz, ferramentas, base de conhecimento, proteções ou critérios de avaliação. Cada mudança é monitorada como uma configuração versionada.
Acesse a aba Branches nas configurações do seu agente e clique em Create branch.
Direcionar tráfego
Defina qual porcentagem das conversas ao vivo deve ir para sua variante. Comece com uma parcela pequena (5 a 10%) para limitar riscos e aumente conforme sua confiança crescer.
Clique em Edit traffic split e defina as porcentagens para cada branch. As porcentagens devem somar exatamente 100%.

Medir o impacto
Compare o desempenho da variante com sua referência usando o dashboard de analytics. Clique em See analytics no painel de branches para acessar diretamente uma visualização filtrada por branch.

As equipes podem medir resultados como:
- CSAT
- Taxa de resolução
- Conversão
- Tempo médio de atendimento
- Latência mediana de resposta do agente
- Custo por resolução do agente
Roteamento de tráfego
O tráfego é dividido entre branches por porcentagem. O roteamento é determinístico com base no ID da conversa, para que o mesmo usuário acesse sempre a mesma branch em todas as sessões.
Por padrão, o tráfego é distribuído aleatoriamente entre a base de usuários. Se você usar a API para iniciar conversas, poderá direcionar coortes específicas para branches específicas controlando quais conversas são iniciadas com cada configuração de branch.
Todas as porcentagens de tráfego devem somar exatamente 100%. Uma implantação falhará se não somarem.
Casos de uso
Os experimentos permitem a otimização contínua de workflows voltados ao cliente e operacionais.
Cada experimento está vinculado a uma versão específica do agente, para que toda mudança de desempenho possa ser atribuída a uma alteração de configuração definida.
O que você pode testar
Qualquer aspecto da configuração do agente pode variar entre branches:
Boas práticas
Comece com uma hipótese
Defina o que você espera melhorar e como vai medir isso antes de criar uma variante. Por exemplo: “Alterar o prompt de escalonamento para incluir um resumo do problema melhorará nosso critério de avaliação da taxa de resolução em 10%.”
Mude uma coisa de cada vez
Isolar uma única variável deixa claro o que causou qualquer diferença de desempenho. Se você mudar o prompt, a voz e o workflow ao mesmo tempo, não saberá qual mudança gerou o resultado.
Configure primeiro os critérios de avaliação
Configure critérios de avaliação de sucesso antes de executar experimentos. Eles fornecem as métricas estruturadas de que você precisa para comparar variantes objetivamente.
Comece com pequenas porcentagens de tráfego
Comece com 5 a 10% do tráfego na variante. Isso limita a exposição caso algo dê errado, enquanto ainda gera dados relevantes.
Dê tempo suficiente aos experimentos
Permita que conversas suficientes se acumulem antes de tirar conclusões. Tamanhos de amostra pequenos levam a resultados pouco confiáveis. Monitore o dashboard de analytics e espere as tendências se estabilizarem.
Mantenha os experimentos de curta duração
Mescle ou descarte os experimentos rapidamente. Branches de longa duração se tornam mais difíceis de mesclar e podem se distanciar da configuração principal.