Framework de avaliação de agentes de voz: 6 pilares explicados
- Escrito por
- Jack Limebear
- Publicado
- Última atualização
OuvirOuça este artigo
Os agentes de voz precisam orquestrar uma sinfonia de ferramentas quase simultâneas. É uma dança delicada de registrar os comentários de um cliente com Speech to Text (STT) em tempo real, assimilar o contexto e produzir uma resposta com um modelo de linguagem de grande porte (LLM) e, em seguida, gerar um arquivo de áudio com um software de Text to Speech (TTS).
Com tantas partes em movimento, como avaliar com precisão o desempenho de um agente de voz?
Neste artigo, apresentamos um framework de avaliação de agentes de voz com seis pilares, que descreve exatamente o que medir ao avaliar o sucesso de um agente. Também veremos por que diferentes setores devem atribuir pesos distintos a esses pilares e quais erros comuns evitar durante a avaliação.
Resumo
- Os seis principais pilares para avaliar agentes de voz são: qualidade da voz TTS, qualidade da conversa, uso de ferramentas e conclusão de tarefas, inteligência, conformidade e segurança, e confiabilidade.
- As metas de produção mais importantes são um MOS de 4,3, uma TSR acima de 85% e um tempo até o primeiro áudio inferior a 500 ms.
- Diferentes setores atribuem pesos distintos a cada pilar, e determinadas implementações priorizam um em relação aos demais.
- Erros comuns em testes incluem avaliar apenas áudios limpos e ignorar picos de latência no P99.
- A ElevenLabs lidera nas métricas mais importantes: o Scribe v2 alcança a menor WER do mercado, de 2,2% (Artificial Analysis, junho de 2026); Flash v2.5 e Turbo v2.5 estão entre os principais modelos em velocidade (Artificial Analysis, junho de 2026); e o ElevenAgents oferece latência de inferência de modelo de cerca de 75 ms.
O que é um framework de avaliação de agentes de voz?
Um framework de avaliação de agentes de voz com IA é um sistema estruturado que permite testar o desempenho em várias dimensões. Um framework abrangente inclui métricas para avaliar desde a fidelidade do áudio e o fluxo da conversa até a conformidade regulatória.
Ao contrário de um chatbot de texto, um agente de voz direciona cada interação por pelo menos três tecnologias integradas: reconhecimento automático de fala (ASR), que converte as palavras de um usuário em texto; um LLM que monta uma resposta; e um sistema TTS que converte essa resposta novamente em áudio. Se qualquer um desses sistemas falhar, toda a experiência é prejudicada.
Essa complexidade é justamente o motivo pelo qual as empresas precisam avaliar agentes de voz antes de escolher um provedor e fazer a implementação. Qualquer latência adicional ou resposta imprecisa pode trazer consequências reais, como perda de clientes ou, no pior caso, multas regulatórias e danos à reputação.
Um framework para avaliar agentes de voz usa benchmarks e dados mensuráveis para definir se um agente é adequado ou não para determinados casos de uso. Do ponto de vista empresarial, poder avaliar diferentes modelos de voz permite escolher o melhor para seus clientes.
Os seis pilares que você deve avaliar em agentes de voz
Embora criar e implementar um agente de IA nunca tenha sido tão simples, os processos ativos nos bastidores são bastante complexos. Vários componentes atuam em conjunto para ouvir um usuário, entender o que ele deseja, enviar essas informações a um LLM e produzir uma resposta em áudio, com muitas ações acontecendo quase ao mesmo tempo.
Para trabalhar com o melhor agente de voz possível, as empresas precisam de um framework rigoroso para usar como referência.
Se você tem mais interesse nos resultados dos testes, a Artificial Analysis oferece diversas comparações de agentes com base em diferentes componentes. Abaixo, você confere os resultados da comparação de velocidade entre modelos, em que o Turbo v2.5 da ElevenLabs e o Flash v2.5 lideram com ampla vantagem em caracteres processados por segundo.

Para desenvolvedores ou empresas que desejam realizar seus próprios experimentos, estes são os seis pilares de um framework de avaliação de agentes de IA que você deve usar:
- Qualidade da voz TTS: o quão natural, clara e expressiva a fala sintetizada soa para os usuários finais. Os melhores modelos do mercado, como o Eleven v3, oferecem uma entrega emotiva e semelhante à humana em mais de 70 idiomas.
- Qualidade da conversa: um modelo entende a fala humana, interpreta o significado e responde rapidamente dentro do contexto ao longo de várias trocas?
- Uso de ferramentas: até que ponto um agente de IA conclui tarefas usando os recursos disponíveis, sem precisar de intervenção humana.
- Inteligência: quão bem um modelo raciocina, lida com entradas inéditas e evita produzir respostas imprecisas ou alucinações.
- Conformidade e segurança: além de todas as capacidades, os agentes de voz com IA precisam cumprir todos os requisitos regulatórios e de conformidade, incluindo proteções ativas.
- Confiabilidade: componentes como disponibilidade total e desempenho consistente sob carga determinam se um agente de IA conversacional consegue escalar conforme a demanda.
Embora cada um desses pilares seja independente, eles se conectam para proporcionar uma experiência final de alta qualidade ao usuário. Por exemplo, se um modelo melhorasse a qualidade da voz, mas ainda tivesse alta latência, o cliente enfrentaria esperas desconfortáveis antes de ouvir a fala do modelo.
Vamos explorar cada um desses pilares de avaliação de voz IA com mais profundidade.
Qualidade da voz TTS
Começamos pela qualidade da voz, pois provavelmente é a primeira coisa que uma pessoa percebe ao interagir com um agente de IA conversacional. Se ele soar robótico ou estranho, a experiência subjetiva com o agente será consideravelmente pior.
Uma das métricas de avaliação originais, definida pelo Setor de Padronização de Telecomunicações da União Internacional de Telecomunicações (ITU-T), é o Mean Opinion Score (MOS). O MOS funciona em uma escala de 1 a 5, em que 1 é inutilizável e 5 é excelente. Como é uma medição subjetiva, ela usa ouvintes humanos e coleta feedback após uma chamada.
Qualquer resultado abaixo de MOS 3,5 nessa escala é pouco expressivo, especialmente para os padrões atuais, e provavelmente afetará a satisfação dos clientes.
Embora o MOS seja uma métrica centrada em pessoas, vários requisitos técnicos contribuem para esse resultado:
- Consistência de pitch e jitter: pitch e jitter são dois elementos linguísticos que as pessoas naturalmente percebem ao ouvir. “Pitch” se refere à mudança de entonação durante a fala, como quando você eleva naturalmente a voz ao fazer uma pergunta. Jitter ocorre quando a interpretação de pitch de um modelo de voz varia, impedindo-o de manter uma prosódia coerente ao longo de uma frase. A referência do setor para jitter é de 30 ms.
- Expressividade emocional: uma voz clara e precisa ainda soa errada se o tom não corresponder ao registro emocional pretendido em uma frase. Sem sinais tonais precisos, os ouvintes humanos terão menos conexão com agentes de IA conversacional e os avaliarão pior. O ElevenAgents oferece expressividade quase humana para associar cada resposta a uma intenção emocional clara.
- Ruído de fundo: o ruído de fundo em agentes de voz tem duas dimensões distintas que vale a pena avaliar. Na saída, um ruído ambiente é adicionado sutilmente às respostas para que os agentes soem mais naturais. Na entrada, a filtragem de ruído de fundo na camada de STT é uma opção que melhora a precisão. Ao avaliar um agente, teste ambas: verifique se o ruído ambiente soa natural e avalie a precisão do STT com o filtro de ruído ativado e desativado.
Ao calcular o MOS, sua meta deve ser de 4,3 a 4,5, o que demonstra notas altas em todas essas categorias perceptivas. Para prever o MOS em escala sem precisar de painéis humanos, você pode usar ferramentas como UTMOS e NISQA.
Qualidade da conversa
A qualidade da conversa é um pilar composto, situado entre a qualidade da voz e a conclusão de tarefas. Ela busca medir com que eficácia um agente de voz entende as necessidades de um usuário, o interrompe no contexto certo e conduz a conversa em vários turnos até a conclusão.
A principal métrica aqui é a precisão na classificação de intenções, que geralmente fica entre 85% e 92%, enquanto os melhores resultados ultrapassam 96%. Embora 85% possa parecer alto, isso ainda representa 15% de todo o tráfego recebido sendo categorizado incorretamente e encaminhado aos recursos errados.
Os elementos técnicos que contribuem para uma alta precisão na classificação de intenções são:
- Alternância de turnos: determina quão bem um agente de voz gerencia o fluxo natural da conversa. Avalia se ele sabe quando ouvir, responder ou esperar mais informações. Também inclui o tratamento de interrupções, em que o modelo descarta uma resposta em andamento e gera outra com base na nova entrada. A ElevenLabs usa um websocket multicontexto para lidar sem interrupções com essas interrupções naturais.
- Latência: Latência descreve o atraso de ponta a ponta entre o momento em que um usuário termina sua frase e o início da resposta em áudio do agente. Agentes de voz prontos para produção devem buscar um tempo até o primeiro áudio inferior a 500 ms, sendo menos de 300 ms ainda melhor. Os modelos Flash da ElevenLabs oferecem um tempo de inferência líder do setor, de cerca de 75 ms, preparando você para ter sucesso nessa categoria.
- Taxa de fallback: é uma medida de quantas vezes um agente de IA não consegue entender um usuário e pede um esclarecimento ou repetição. Em grande parte, é uma consequência da precisão do STT: se a camada de reconhecimento de fala entender mal ou representar incorretamente o que um cliente disse, o LLM recebe uma entrada corrompida. A taxa de fallback é um cálculo direto que usa a fórmula: Taxa de fallback (%) = (Número de fallbacks / Número total de interações) * 100.
O ElevenLabs Scribe V2 tem a menor WER, de 2,2%, na avaliação de modelos Speech to Text da Artificial Analysis

Avaliação de modelos Speech to Text da Artificial Analysis
Uma forma de medir a qualidade da conversa é analisar os padrões de benchmark do setor para diferentes componentes. Como você pode ver, o Scribe v2 da ElevenLabs tem a menor taxa de erro de palavras, de 2,2%, em junho de 2026, o que significa menos erros de compreensão, menos fallbacks e uma classificação de intenções mais precisa.
As empresas podem descobrir que a qualidade da conversa também depende do workflow em que o agente de voz opera. Por exemplo, no atendimento ao cliente, outro ponto a considerar seria a qualidade da transferência para escalonamento ou a resolução de perguntas frequentes.
Uso de ferramentas e conclusão de tarefas
Enquanto a qualidade mede como uma conversa foi percebida, a conclusão de tarefas mede se ela levou a um resultado bem-sucedido. As empresas devem prestar muita atenção a esta parte do framework de avaliação de agentes de voz, pois ela está diretamente ligada aos resultados do negócio.
Uma medida de uso de ferramentas é a precisão no preenchimento de campos, que determina quão bem agentes de IA conseguem concluir tarefas relativamente rotineiras, como preencher um formulário com informações do cliente. Uma alta precisão no preenchimento de campos demonstra que o agente consegue passar da conversa à ação sem perder informações no caminho.
A Taxa de Sucesso da Tarefa (TSR) é uma medida percentual das tarefas de ponta a ponta que foram concluídas com sucesso por um agente. Nesse caso, a conclusão depende da capacidade do agente de entender uma solicitação e usar as ferramentas conectadas certas (APIs, bancos de dados, Retrieval-Augmented Generation [RAG] e bases de conhecimento internas) para obter suporte.
A fórmula da TSR é:
TSR = (Tarefas totalmente concluídas / Total de tarefas tentadas) x 100
Agentes de voz prontos para produção devem buscar uma TSR acima de 85%, monitorando a precisão e a confiabilidade das chamadas de ferramentas. Para evitar quedas na TSR, faça testes de regressão após qualquer alteração no prompt ou modelo conectado. Mesmo um pequeno desvio pode ter consequências significativas para sua TSR.
Inteligência
A inteligência abrange o raciocínio e as capacidades mais avançadas de um agente de voz. É esse pilar que diferencia claramente uma URA (Resposta Audível Interativa) conduzida por voz de um agente de voz com IA.
As principais dimensões a avaliar incluem:
- Risco de alucinação: alucinações, em que um agente produz informações imprecisas ou inconsistentes com documentos da empresa, são especialmente prejudiciais em voz IA, pois podem ser transmitidas com confiança. Estudos recentes sugerem que alucinações comuns prejudicam significativamente a satisfação dos clientes com agentes de voz.
- Tratamento de solicitações fora do escopo: agentes inteligentes entendem quando uma pergunta está fora de seu domínio contextual e conseguem responder adequadamente. Em vez de inventar uma resposta, eles recusam ou redirecionam a conversa para um território contextualmente mapeado.
- Retenção de contexto: ao longo de vários turnos, um agente consegue acompanhar entidades e compromissos feitos anteriormente? Sem essa capacidade, os clientes podem precisar se repetir ou receber respostas contraditórias.
- Raciocínio e lógica em múltiplas etapas: o agente consegue lidar corretamente com lógica condicional ou encadear inferências ao longo de vários turnos? Especialmente em casos de uso mais técnicos, como serviços financeiros, a capacidade de raciocinar dentro de um contexto predefinido é essencial para o sucesso.
Existem vários benchmarks de terceiros para essas dimensões e componentes. Por exemplo, o benchmark Holistic Evaluation of Language Models (HELM), de Stanford, avalia o desempenho de LLMs em diferentes categorias. Para alucinações, o TruthfulQA oferece uma análise robusta de com que frequência respostas falsas aparecem nas respostas.
Uma vantagem do ElevenAgents é que, ao contrário de algumas plataformas de voz que limitam você a um único modelo subjacente, é possível trocar completamente a camada de LLM. Na prática, isso significa que você pode conectar o modelo que lidera os benchmarks de raciocínio para seu caso de uso específico.
Conformidade e segurança
As empresas precisam implementar proteções ativas para impedir respostas prejudiciais ou que violem políticas. Ao contrário de instruções de prompt no nível do sistema, que podem ser contornadas ou substituídas, as verificações independentes de proteção funcionam como uma camada separada, fora do próprio modelo. Elas avaliam as respostas antes que cheguem ao usuário e interrompem a conversa se ela entrar em território perigoso.
A auditabilidade é um requisito relacionado: agentes de produção precisam manter registros detalhados de decisões e respostas em um formato que permita revisão posterior. Principalmente em setores altamente regulados, demonstrar conformidade depois do ocorrido é tão importante quanto alcançá-la desde o início.
As regulamentações exatas que sua empresa precisa cumprir variam conforme o setor. Alguns dos frameworks mais comuns são:
- HIPAA: para dados de saúde protegidos em contextos de saúde nos EUA.
- PCI-DSS: para qualquer agente que lide com dados de cartões de pagamento.
- LGPD / Lei Geral de Proteção de Dados: obrigações de privacidade de dados para a UE e empresas com clientes na UE.
Para empresas que avaliam sua postura de conformidade, a ElevenLabs possui conformidade com AICPA SOC Tipo II e GDPR, além de ter obtido a certificação AIUC-1. O AIUC-1 é um padrão de segurança desenvolvido especificamente para agentes de IA.
Confiabilidade
A confiabilidade é o último pilar do nosso framework de avaliação de agentes de voz e abrange se um agente consegue entregar resultados de forma consistente em tempo real.
Ao avaliar um agente de voz, procure as seguintes características:
- Disponibilidade: qualquer implementação voltada ao cliente exige 99,9% de disponibilidade para evitar interrupções. Especialmente em casos de uso contínuo, como suporte de entrada, uma disponibilidade confiável é um fator essencial.
- Degradação controlada: devido à complexidade subjacente dos agentes de voz, se um componente começar a falhar, o agente deve lidar bem com essa degradação. Na prática, isso significa encaminhar para uma pessoa, em vez de continuar funcionando sob maior pressão ou retornando erros.
- Desempenho sob carga: os testes de carga devem simular pelo menos o dobro do pico de concorrência esperado antes do lançamento. Testar sob forte pressão pode identificar aumentos de latência ou queda de desempenho que só aparecem em escala.
Mesmo um modelo de alta qualidade que atenda a todos os demais requisitos pode ser inutilizável se não escalar conforme a demanda dos seus clientes. O ElevenAgents conta com a confiança de 1.000.000 de criadores e empresas líderes, demonstrando a capacidade da plataforma de oferecer implementações em escala empresarial sem comprometer os benchmarks de desempenho.
Como medir o MOS para agentes de voz (passo a passo)
Se sua empresa quiser medir o MOS manualmente, será necessário um grande grupo de ouvintes humanos e uma seleção de trechos de áudio de conversas reais. É um processo estruturado que envolve coletar feedback, calcular médias e interpretar os dados.
Veja como medir o MOS para agentes de voz na prática:
- Prepare seu conjunto de testes: selecione uma amostra representativa de saídas de áudio do seu agente, abrangendo pelo menos 100 trechos de diferentes conversas.
- Realize a sessão de avaliação: peça aos ouvintes humanos que avaliem cada trecho em uma escala de 1 a 5 com base na qualidade da experiência de comunicação.
- Agrupe as avaliações e calcule as pontuações: calcule a média das avaliações de cada trecho e, depois, a média de todos os trechos da amostra para obter um MOS geral. Um MOS de 4,3 ou mais indica que seu agente de voz está pronto para produção.
Embora exija bastante trabalho manual, esse processo fornece um MOS confiável para o agente de voz escolhido. Se quiser realizar o teste em escala, você pode substituir os ouvintes humanos por ferramentas automatizadas como o NISQA, que prevê pontuações MOS programaticamente. Também é possível integrar esses sistemas aos seus pipelines ativos para monitorar continuamente o MOS ao longo do tempo.
Benchmarks de testes: IA vs. humanos — FCR, AHT e CSAT
Embora calcular o MOS repetidamente ao longo do tempo seja uma forma de observar melhorias ou regressões no modelo, você pode adicionar contexto comparando-o ao desempenho humano. Ver o que as pessoas realmente alcançam em funções semelhantes mostrará se seu agente de voz está próximo de um nível ideal de desempenho.
Estas são algumas métricas a considerar em benchmarks de testes entre IA e humanos.
Os agentes de IA devem ser capazes de igualar o FCR e o CSAT humanos, ao mesmo tempo que melhoram significativamente o AHT. Essa melhoria ocorre porque agentes de IA geralmente lidam com conversas mais gerais do que os agentes humanos. Muitas empresas implementam um workflow em que agentes de IA fazem o primeiro atendimento e só transferem as chamadas para agentes humanos quando elas são complexas demais para serem tratadas de forma autônoma.
Dados de 2025 da Poe, uma agregadora de comparações de IA, revelam que a ElevenLabs manteve a maior capacidade geral de atender solicitações, concluindo 74,4% de todas as solicitações recebidas. Esse sucesso se traduziu em um uso que cresce rapidamente, com o Eleven v3 e o v2.5-Turbo representando mais de 60% das mensagens enviadas a modelos de IA ao longo do tempo.
Mensagens enviadas a modelos de IA ao longo do tempo, com a ElevenLabs liderando o framework de avaliação de agentes de voz da Poe

Mensagens enviadas a modelos de IA ao longo do tempo, conforme benchmark da Poe
Erros comuns em testes de agentes de voz
Ao seguir um framework de avaliação de agentes de voz, é tentador testar cenários ideais. Na realidade, a experiência cotidiana de clientes que interagem com seus sistemas de voz IA não acontece em condições ideais.
Confira três erros comuns em testes de agentes de voz e como corrigi-los:
- Testar o caminho mais fácil: principalmente ao selecionar trechos de áudio para o MOS, inclua casos de uso extremos. Trechos com ruído de fundo ou fala com sotaque são muito comuns na vida real, então testar apenas arquivos de áudio “limpos” levará a uma calibração incorreta do MOS.
- Priorizar retenção em vez de resolução: otimizar seus modelos para manter usuários dentro do sistema do agente aumenta as taxas de retenção sem melhorar os resultados. Se seu FCR estiver baixo apesar de uma alta taxa de retenção, o agente está mantendo os usuários em um ciclo frustrante. Tenha processos que permitam aos usuários falar com agentes humanos caso desejem.
- Ignorar percentis de latência: os SLAs geralmente definem latência pelo nível P95. Embora essa métrica seja importante para oferecer uma experiência consistente à maioria dos clientes, não se esqueça de que os 5% finais também são clientes reais. Em escala, 5% de um sistema que atende 10.000 chamadas diárias ainda são 500 pessoas vivenciando uma conversa lenta. Use o P99 como meta principal de SLA, e não apenas a mediana ou o P95.
Ao considerar esses pontos, você consegue estabelecer referências justas e representativas, em vez de se basear em médias idealizadas.
Por que fazer avaliações específicas para cada caso de uso
Embora os seis pilares descritos neste framework orientem as áreas que você deve explorar, o peso de cada pilar dependerá do seu setor. Por exemplo, uma empresa de serviços financeiros pode priorizar conformidade e uso de ferramentas, enquanto uma marca de consumo pode ter a qualidade da voz TTS como princípio orientador.
Veja dois exemplos de avaliações específicas para casos de uso e como elas podem alterar o equilíbrio entre os pilares.
Suporte ao cliente
Em determinados setores, como call centers, outras métricas de conclusão de tarefas, como a Resolução no Primeiro Contato (FCR), são uma parte importante da avaliação. Conseguir atender uma chamada recebida com sucesso sem intervenção humana reduz significativamente a demanda sobre os agentes humanos de atendimento ao cliente. A McKinsey estima que call centers que usam agentes de voz podem reduzir o volume de interações em até 50%.
Embora não seja tão importante quanto a taxa de sucesso de tarefas, outra dimensão a considerar é a taxa de retenção. Ela é uma métrica que analisa a duração total de uma chamada. Se sua taxa de retenção for muito alta, mas o FCR for baixo, seus agentes estarão mantendo as pessoas na linha sem oferecer uma solução ao cliente. Na prática, isso pode resultar em uma experiência frustrante, em que o cliente fica andando em círculos.
Outras métricas a acompanhar são o AHT, com agentes de IA buscando resolver rapidamente problemas rotineiros. Por isso, a área de suporte ao cliente priorizaria a qualidade da conversa — especialmente a alternância de turnos e a taxa de fallback — em relação a outras áreas.
Saúde
Saúde é uma área altamente regulamentada, com requisitos rigorosos de conformidade que tornam a operação de agentes de voz extremamente delicada. A conformidade é uma preocupação central, elevando significativamente o peso do pilar de segurança e da inteligência acima de todos os demais.
Chatbots de saúde precisam lidar com agendamento de consultas, caminhos de acesso à telemedicina, triagem de sintomas e dúvidas sobre seguros. Tudo isso exige alto nível de inteligência e uso de ferramentas, refletindo novamente que as demandas específicas de cada setor ou função influenciam qual pilar é mais importante.
Independentemente da área em que sua empresa atua, entender os pilares centrais da avaliação de agentes de voz e aplicá-los de forma equilibrada ajudará você a encontrar os melhores agentes.
Crie com o ElevenAgents para alto desempenho e baixa latência
A plataforma que você escolhe para desenvolver influencia diretamente o desempenho dos seus agentes de voz em workflows reais. Especialmente ao interagir com seus clientes, você precisa ter confiança de que seu agente terá um desempenho excelente em todas as categorias.
O ElevenAgents foi criado para implementações de voz em produção e combina TTS líder do setor por meio do Eleven v3, STT em tempo real com o Scribe v2 e uma camada de orquestração de agentes projetada para escala empresarial. Todos os componentes são desenvolvidos para atender aos benchmarks definidos neste framework, permitindo oferecer experiências de alta qualidade aos seus clientes.
Quer você esteja avaliando suas opções ou pronto para começar a criar, a ElevenLabs tem um caminho para você. Explore a plataforma ElevenAgents para ver como ela se aplica ao seu caso de uso ou crie sua conta e comece a criar hoje.

