Framework de avaliação de agentes de voz: 6 pilares explicados
- Escrito por
- Jack Limebear
- Publicado
- Última atualização
OuvirOuça este artigo
Os agentes de voz precisam orquestrar uma sinfonia de ferramentas que operam quase ao mesmo tempo. É uma dança delicada: registrar os comentários de um cliente com Speech to Text (STT) em tempo real, assimilar o contexto e produzir uma resposta com um modelo de linguagem grande (LLM) e, então, gerar um arquivo de áudio com um software de Text to Speech (TTS).
Com tantas partes em movimento, como avaliar com precisão o desempenho de um agente de voz?
Neste artigo, propomos um framework de avaliação de agentes de voz com seis pilares, que descreve exatamente o que medir ao avaliar o sucesso de um agente. Também veremos por que diferentes setores devem atribuir pesos distintos a esses pilares e quais são os erros comuns a evitar durante a avaliação.
Resumo
- Os seis principais pilares para avaliar agentes de voz são qualidade de voz do TTS, qualidade da conversa, uso de ferramentas e conclusão de tarefas, inteligência, conformidade e segurança, e confiabilidade.
- As metas de produção mais importantes são um MOS de 4,3, um TSR acima de 85% e um tempo até o primeiro áudio inferior a 500 ms.
- Setores diferentes atribuem pesos distintos a cada pilar, e determinadas implementações favorecem alguns deles em relação a outros.
- Erros comuns em testes incluem avaliar apenas áudios limpos e ignorar picos de latência no P99.
- A ElevenLabs lidera nas métricas que mais importam: o Scribe v2 alcança a menor WER do setor, de 2,2% (Artificial Analysis, junho de 2026), Flash v2.5 e Turbo v2.5 estão entre os melhores modelos em velocidade (Artificial Analysis, junho de 2026), e o ElevenAgents oferece latência de inferência de modelo de ~75 ms.
O que é um framework de avaliação de agentes de voz?
Um framework de avaliação de agentes de voz com IA é um sistema estruturado que permite testar o desempenho em diversas dimensões. Um framework abrangente inclui métricas para avaliar desde a fidelidade do áudio até o fluxo da conversa e até mesmo a conformidade regulatória.
Ao contrário de um chatbot de texto, um agente de voz direciona cada interação por pelo menos três tecnologias integradas: reconhecimento automático de fala (ASR), que converte as palavras de um usuário em texto; um LLM que formula uma resposta; e um sistema de TTS que converte essa resposta de volta em áudio. Se qualquer um desses sistemas falhar, toda a experiência é prejudicada.
Essa complexidade é exatamente o motivo pelo qual as empresas precisam avaliar agentes de voz antes de escolher um fornecedor e implementar a solução. Qualquer latência adicional ou resposta imprecisa pode ter consequências reais, como perda de clientes ou, no pior cenário, multas regulatórias e danos à reputação.
Um framework para avaliar agentes de voz usa benchmarks e dados mensuráveis para definir se um agente é adequado ou não para determinados casos de uso. Do ponto de vista empresarial, poder avaliar diferentes modelos de voz permite escolher o melhor para seus clientes.
Os seis pilares que você deve avaliar em agentes de voz
Embora criar e implementar um agente de IA nunca tenha sido tão simples, os processos que acontecem nos bastidores são bastante complexos. Vários componentes atuam em conjunto para ouvir um usuário, entender o que ele quer, enviar essas informações a um LLM e, então, produzir uma resposta em áudio — muitas ações ocorrem quase simultaneamente.
Ao buscar parceria com o melhor agente de voz possível, as empresas precisam de um framework rigoroso para usar como referência.
Se você tem mais interesse em ver os resultados dos testes, a Artificial Analysis oferece diversas comparações de agentes com base em diferentes componentes. Abaixo, você pode ver os resultados da comparação de velocidade entre modelos, com o ElevenLabs Turbo v2.5 e o Flash v2.5 liderando com ampla vantagem em caracteres processados por segundo.

Para desenvolvedores ou empresas que querem conduzir seus próprios experimentos, estes são os seis pilares de um framework de avaliação de agentes de IA que você deve usar:
- Qualidade de voz do TTS: O quão natural, clara e expressiva a fala sintetizada soa para os usuários finais. Os principais modelos do setor, como o Eleven v3, oferecem uma entrega emotiva semelhante à humana em mais de 70 idiomas.
- Qualidade da conversa: Um modelo entende a fala humana, interpreta seu significado e responde prontamente no contexto ao longo de vários turnos?
- Uso de ferramentas: O grau em que um agente de IA conclui tarefas usando os recursos disponíveis, sem precisar de intervenção humana.
- Inteligência: O quão bem um modelo raciocina, lida com entradas inéditas e evita produzir respostas imprecisas ou alucinadas.
- Conformidade e segurança: Além de todas as capacidades, os agentes de voz com IA precisam cumprir todos os requisitos regulatórios e de conformidade, incluindo proteções ativas.
- Confiabilidade: Componentes como disponibilidade total e desempenho consistente sob carga, para determinar se um agente de IA conversacional consegue escalar conforme a demanda.
Embora cada um desses pilares seja independente, eles se interligam para proporcionar uma experiência final de alta qualidade ao usuário. Por exemplo, se um modelo melhorasse sua qualidade de voz, mas ainda tivesse alta latência, o cliente enfrentaria esperas desconfortáveis antes de o modelo fornecer a fala.
Vamos explorar cada um desses pilares de avaliação de voz com IA em mais detalhes.
Qualidade de voz do TTS
Começamos pela qualidade de voz, pois provavelmente é a primeira coisa que uma pessoa percebe ao interagir com um agente conversacional de IA. Se ele soar robótico ou estranho, a experiência subjetiva com o agente será consideravelmente pior.
Uma das métricas de avaliação originais, definida pelo Setor de Padronização das Telecomunicações da União Internacional de Telecomunicações (ITU-T), é o Mean Opinion Score (MOS). O MOS funciona em uma escala de 1 a 5, em que 1 é inutilizável e 5 é excelente. Como é uma medição subjetiva, ele usa ouvintes humanos e coleta feedback após uma chamada.
Qualquer resultado abaixo de MOS 3,5 nessa escala é pouco impressionante, especialmente pelos padrões atuais, e provavelmente afetará a satisfação do cliente.
Embora o MOS seja uma métrica centrada em pessoas, diversos requisitos técnicos contribuem para esse número:
- Consistência de tom e jitter: Tom e jitter são dois elementos linguísticos que as pessoas naturalmente percebem enquanto ouvem. “Tom” refere-se à mudança de entonação durante a fala, como quando você naturalmente eleva a voz ao fazer uma pergunta. Jitter ocorre quando a compreensão de tom de um modelo de voz varia, impedindo-o de manter uma prosódia coerente ao longo de uma frase. A referência do setor para jitter é 30 ms.
- Expressividade emocional: Uma voz clara e precisa ainda soa inadequada se o tom não corresponder ao registro emocional pretendido na frase. Sem sinais tonais precisos, ouvintes humanos terão menos conexão com agentes conversacionais de IA e os avaliarão pior. O ElevenAgents oferece expressividade quase humana para combinar cada resposta a uma intenção emocional clara.
- Ruído de fundo: O ruído de fundo em agentes de voz tem duas dimensões distintas que vale avaliar. No lado da saída, um ruído ambiente é adicionado sutilmente às respostas para fazer os agentes soarem mais naturais. No lado da entrada, a filtragem de ruído de fundo na camada de STT é uma opção que melhora a precisão. Ao avaliar um agente, teste ambos: ouça se o ruído ambiente soa natural e avalie a precisão do STT com o filtro de ruído ativado e desativado.
Ao calcular o MOS, procure atingir de 4,3 a 4,5, o que demonstra pontuações altas em todas essas categorias perceptivas. Para prever o MOS em escala sem precisar de painéis humanos, você pode usar ferramentas como UTMOS e NISQA.
Qualidade da conversa
A qualidade da conversa é um pilar composto entre a qualidade de voz e a conclusão de tarefas. Ela busca medir quão efetivamente um agente de voz entende as necessidades de um usuário, o interrompe no contexto e conduz isso até a conclusão em um diálogo de vários turnos.
A principal métrica aqui é a precisão da classificação de intenções, que normalmente fica entre 85% e 92%, enquanto os melhores resultados chegam a mais de 96%. Embora 85% possa parecer alto, isso ainda representa 15% de todo o tráfego de entrada categorizado incorretamente e direcionado aos recursos errados.
Os elementos técnicos que contribuem para uma alta precisão na classificação de intenções são:
- Alternância de turnos: A alternância de turnos determina o quão bem um agente de voz gerencia o fluxo natural da conversa. Ela busca avaliar quando o agente sabe ouvir, responder ou esperar mais informações. Também abrange o tratamento de interrupções, quando um modelo descarta uma resposta em andamento e gera outra com base na nova entrada. A ElevenLabs usa um websocket de múltiplos contextos para lidar sem atrito com essas interrupções.
- Latência: Latência descreve o atraso de ponta a ponta entre o usuário terminar sua frase e o agente iniciar sua resposta em áudio. Agentes de voz prontos para produção devem buscar um tempo até o primeiro áudio inferior a 500 ms; abaixo de 300 ms é ainda melhor. Os modelos Flash da ElevenLabs oferecem um tempo de inferência de modelo líder do setor, de ~75 ms, preparando você para ter sucesso nessa categoria.
- Taxa de fallback: A taxa de fallback mede a frequência com que um agente de IA não entende um usuário e pede esclarecimento ou repetição. Em grande parte, ela é consequência da precisão do STT: se a camada de reconhecimento de fala ouve errado ou representa incorretamente o que o cliente disse, o LLM recebe uma entrada corrompida. A taxa de fallback é calculada pela fórmula: Taxa de fallback (%) = (Número de fallbacks / Número total de interações) * 100.
O ElevenLabs Scribe V2 tem a menor WER, de 2,2%, na avaliação de modelos de Speech to Text da Artificial Analysis

Avaliação de modelos de Speech to Text da Artificial Analysis
Uma forma de medir a qualidade da conversa é analisar padrões de benchmark do setor para diferentes componentes. Como você pode ver, o Scribe v2 da ElevenLabs tem a menor Taxa de Erro de Palavras, de 2,2% em junho de 2026, o que significa menos erros de compreensão, menos fallbacks e uma classificação de intenções mais precisa.
As empresas podem descobrir que a qualidade conversacional também depende do workflow em que o agente de voz opera. Por exemplo, no atendimento ao cliente, outro aspecto a considerar seria a qualidade da transferência em escalonamentos ou a resolução de FAQs.
Uso de ferramentas e conclusão de tarefas
Enquanto a qualidade mede como uma conversa foi percebida, a conclusão de tarefas mede se ela levou a um resultado bem-sucedido. As empresas devem dar muita atenção a essa parte do framework de avaliação de agentes de voz, pois ela está diretamente ligada aos resultados do negócio.
Uma medida do uso de ferramentas é a precisão no preenchimento de campos, que determina o quão bem os agentes de IA podem concluir tarefas relativamente rotineiras, como preencher um formulário com informações de clientes. Uma alta precisão no preenchimento de campos demonstra que o agente consegue passar da conversa à ação sem perder informações no caminho.
A Taxa de Sucesso de Tarefas (TSR) é uma medida percentual das tarefas de ponta a ponta concluídas com sucesso por um agente. A conclusão depende da capacidade do agente de entender uma solicitação e usar as ferramentas conectadas certas (APIs, bancos de dados, Retrieval-Augmented Generation (RAG) e bases de conhecimento internas) para obter suporte.
A fórmula do TSR é:
TSR = (Tarefas totalmente concluídas / Total de tarefas tentadas) x 100
Agentes de voz prontos para produção devem buscar um TSR acima de 85%, monitorando a precisão e a confiabilidade das chamadas de ferramentas. Para evitar quedas no TSR, faça testes de regressão em qualquer alteração de prompt ou de modelo conectado. Mesmo um pequeno desvio pode ter consequências significativas para o TSR.
Inteligência
A inteligência abrange o raciocínio e as capacidades mais avançadas de um agente de voz. É esse pilar que diferencia claramente uma URA (Unidade de Resposta Audível) guiada por voz de um agente de voz com IA.
As principais dimensões a avaliar aqui incluem:
- Risco de alucinação: Alucinações, em que um agente produz informações imprecisas ou inconsistentes com documentos da empresa, são especialmente prejudiciais na voz com IA, pois podem ser apresentadas com confiança. Estudos recentes sugerem que alucinações frequentes prejudicam significativamente a satisfação dos clientes com agentes de voz.
- Tratamento de solicitações fora do escopo: Agentes inteligentes entendem quando uma pergunta está fora de seu domínio contextual e conseguem responder adequadamente. Em vez de alucinar uma resposta, eles recusam ou redirecionam a conversa para um território mapeado contextualmente.
- Retenção de contexto: Ao longo de vários turnos, o agente consegue acompanhar entidades e compromissos feitos anteriormente? Sem essa capacidade, os clientes podem ter de se repetir ou receber respostas contraditórias.
- Raciocínio e lógica em várias etapas: O agente consegue lidar corretamente com lógica condicional ou encadear inferências ao longo de vários turnos? Especialmente em casos de uso mais técnicos, como serviços financeiros, a capacidade de raciocinar dentro de um contexto predefinido é essencial para o sucesso.
Existem diversos benchmarks de terceiros para essas dimensões e componentes. Por exemplo, o Holistic Evaluation of Language Models (HELM), de Stanford, avalia o desempenho de LLMs em diferentes categorias. Para alucinações, o TruthfulQA oferece uma análise robusta da frequência com que respostas falsas aparecem nas respostas.
Uma vantagem do ElevenAgents é que, diferentemente de algumas plataformas de voz que prendem você a um único modelo subjacente, é possível trocar completamente a camada de LLM. Na prática, isso significa que você pode conectar o modelo que lidera os benchmarks de raciocínio para seu caso de uso específico.
Conformidade e segurança
As empresas precisam implementar proteções ativas para evitar resultados prejudiciais ou que violem políticas. Diferentemente das instruções de prompt no nível do sistema, que podem ser contornadas ou substituídas, verificações independentes de proteção funcionam como uma camada separada, externa ao próprio modelo. Elas avaliam as respostas antes de chegarem ao usuário e interrompem a conversa caso ela entre em território perigoso.
A auditabilidade é um requisito relacionado: agentes em produção precisam manter logs detalhados de decisões e resultados em um formato que permita revisão posterior. Especialmente em setores altamente regulamentados, demonstrar conformidade depois do ocorrido é tão importante quanto alcançá-la desde o início.
As regulamentações exatas que sua empresa deve cumprir variam conforme o setor. Alguns dos frameworks mais aplicáveis são:
- HIPAA: Para dados de saúde protegidos em contextos de saúde nos EUA.
- PCI-DSS: Para qualquer agente que manipule dados de cartões de pagamento.
- LGPD: Obrigações de privacidade de dados para a UE e empresas com clientes na UE.
Para empresas que avaliam sua postura de conformidade, a ElevenLabs possui conformidade com AICPA SOC Tipo II e LGPD, além de obter a certificação AIUC-1. A AIUC-1 é um padrão de segurança projetado especificamente para agentes de IA.
Confiabilidade
A confiabilidade é o último pilar do nosso framework de avaliação de agentes de voz e abrange se um agente consegue entregar resultados de forma consistente em tempo real.
Ao avaliar um agente de voz, procure as seguintes características:
- Disponibilidade: Qualquer implementação voltada ao cliente exige 99,9% de disponibilidade para evitar interrupções. Especialmente em casos de uso sempre ativos, como suporte de entrada, uma disponibilidade confiável é um fator importante.
- Degradação gradual: Devido à complexidade inerente dos agentes de voz, se um componente começar a falhar, o agente deve lidar com essa degradação de modo controlado. Na prática, isso significa encaminhar para uma pessoa, em vez de continuar funcionando sob pressão maior ou retornando erros.
- Desempenho sob carga: Testes de carga devem buscar simular pelo menos 2x o pico de simultaneidade esperado antes do lançamento. Testar sob forte pressão pode identificar aumentos de latência ou quedas de desempenho que só aparecem em escala.
Mesmo um modelo de alta qualidade que atende a todos os outros requisitos pode ser inutilizável se não escalar conforme a demanda dos clientes. O ElevenAgents conta com a confiança de 1.000.000 de grandes criadores e empresas, demonstrando a capacidade da plataforma de oferecer implementações em escala empresarial sem comprometer os benchmarks de desempenho.
Como medir o MOS para agentes de voz (passo a passo)
Se sua empresa quiser medir o MOS manualmente, será necessário um grande grupo de ouvintes humanos e uma seleção de clipes de áudio de conversas reais. É um processo estruturado que envolve coletar feedback, calcular médias e interpretar os dados.
Veja como medir o MOS para agentes de voz na prática:
- Prepare seu conjunto de testes: Selecione uma amostra representativa das saídas de áudio do seu agente, cobrindo pelo menos 100 clipes de diferentes conversas.
- Realize a sessão de avaliação: Peça aos ouvintes humanos que avaliem cada clipe em uma escala de 1 a 5, com base na qualidade da experiência de comunicação.
- Agrupe as avaliações e calcule as pontuações: Calcule a média das avaliações de cada clipe e, depois, a média de todos os clipes da amostra para obter o MOS geral. Um MOS de 4,3 ou mais indica que seu agente de voz está pronto para produção.
Embora exija muito trabalho manual, esse processo fornecerá um MOS confiável para o agente de voz escolhido. Se quiser realizar o teste em escala, você pode substituir os ouvintes humanos por ferramentas automatizadas, como o NISQA, que preveem pontuações MOS de forma programática. É possível integrar esses sistemas aos seus pipelines ativos para monitorar continuamente o MOS ao longo do tempo.
Benchmarks de testes: IA vs. humanos — FCR, AHT e CSAT
Embora calcular o MOS repetidamente ao longo do tempo seja uma forma de observar a melhoria ou regressão do modelo, você pode obter mais contexto ao compará-lo com o desempenho humano. Ver o que pessoas realmente alcançam em funções semelhantes demonstrará se seu agente de voz está próximo de um nível ideal de desempenho.
Estas são algumas métricas a considerar em benchmarks de testes entre IA e humanos.
Os agentes de IA devem conseguir igualar o FCR e o CSAT humanos, ao mesmo tempo que melhoram significativamente o AHT. Essa melhoria ocorre porque os agentes de IA normalmente lidam com conversas mais gerais do que os agentes humanos. Muitas empresas implementam um workflow em que os agentes de IA são o primeiro ponto de contato e só transferem as chamadas para agentes humanos quando são complexas demais para serem resolvidas de forma autônoma.
Dados de 2025 do Poe, um agregador de comparação de IA, revelam que a ElevenLabs manteve a maior capacidade geral de atender solicitações, concluindo 74,4% de todas as solicitações recebidas. Esse sucesso se traduziu em um crescimento rápido de uso, com o Eleven v3 e o v2.5-Turbo respondendo por mais de 60% das mensagens enviadas a modelos de IA ao longo do tempo.
Mensagens enviadas a modelos de IA ao longo do tempo, com a ElevenLabs liderando o framework de avaliação de agentes de voz do Poe

Mensagens enviadas a modelos de IA ao longo do tempo, segundo benchmark do Poe
Erros comuns em testes de agentes de voz
Ao seguir um framework de avaliação de agentes de voz, é tentador testar os melhores cenários possíveis. Na realidade, a experiência diária dos clientes que interagem com seus sistemas de voz com IA não ocorrerá em condições ideais.
Estes são três erros comuns em testes de agentes de voz e como corrigi-los:
- Testar o caminho mais fácil: Especialmente ao selecionar clipes de áudio para o MOS, inclua casos de uso extremos. Clipes com ruído de fundo ou fala com sotaque são extremamente comuns na vida real; portanto, testar apenas arquivos de áudio “limpos” levará a uma calibração incorreta do MOS.
- Priorizar contenção em vez de resolução: Otimizar seus modelos para manter os usuários no sistema do agente infla as taxas de contenção sem melhorar os resultados. Se seu FCR estiver baixo apesar de uma alta taxa de contenção, o agente estará prendendo os usuários em um ciclo frustrante. Adote práticas que permitam aos usuários falar com agentes humanos se desejarem.
- Ignorar percentis de latência: Os SLAs frequentemente definem a latência pelo nível P95. Embora essa métrica seja importante para oferecer uma experiência consistente à maioria dos clientes, não se esqueça de que os 5% finais também são clientes reais. Em escala, 5% de um sistema que atende 10.000 chamadas diárias ainda representam 500 pessoas enfrentando uma conversa lenta. Use o P99 como a principal meta de SLA, e não apenas a mediana ou o P95.
Ao considerar esses pontos, você conseguirá estabelecer referências justas e representativas, em vez de trabalhar com médias idealizadas.
Por que fazer avaliações específicas para cada caso de uso
Embora os seis pilares mapeados neste framework orientem as áreas que você deve explorar, o peso de cada pilar dependerá do seu setor. Por exemplo, uma empresa do setor de serviços financeiros pode priorizar conformidade e uso de ferramentas, enquanto uma marca de consumo pode adotar a qualidade de voz do TTS como princípio orientador.
Veja dois exemplos de avaliações específicas para casos de uso e como elas podem alterar o equilíbrio entre os pilares.
Atendimento ao cliente
Em determinados setores, como centrais de atendimento, outras métricas de conclusão de tarefas, como Resolução no Primeiro Contato (FCR), são uma parte importante da análise. Conseguir atender uma chamada recebida com sucesso sem intervenção humana reduz significativamente a demanda sobre agentes humanos de atendimento ao cliente. A McKinsey estima que centrais de atendimento que usam agentes de voz podem reduzir o volume de interações em até 50%.
Embora não seja tão importante quanto a taxa de sucesso de tarefas, outra dimensão a considerar é a taxa de contenção. A taxa de contenção é uma métrica que analisa a duração total de uma chamada. Se sua taxa de contenção for muito alta, mas o FCR for baixo, seus agentes estarão mantendo as pessoas na linha sem oferecer uma resolução ao cliente. Na prática, isso pode se traduzir em uma experiência frustrante, em que o cliente fica andando em círculos.
Outras métricas a acompanhar são o AHT, com agentes de IA buscando resolver rapidamente problemas rotineiros. Por isso, o setor de atendimento ao cliente priorizaria a qualidade da conversa, especialmente a alternância de turnos e a taxa de fallback, em relação a outras áreas.
Saúde
Saúde é um setor altamente regulamentado, com requisitos rigorosos de conformidade que tornam a operação de agentes de voz extremamente delicada. A conformidade é uma preocupação central, deslocando significativamente o peso do pilar de segurança do framework para esse aspecto e para a inteligência, acima de tudo.
Chatbots para saúde precisam lidar com agendamento de consultas, caminhos de acesso à telemedicina, triagem de sintomas e perguntas sobre seguros. Tudo isso exige um alto nível de inteligência e uso de ferramentas, refletindo mais uma vez que as demandas específicas de cada setor ou função influenciam qual pilar é mais importante.
Independentemente do setor em que sua empresa atua, entender os pilares centrais da avaliação de agentes de voz e aplicá-los de maneira equilibrada ajudará a encontrar os melhores agentes para você.
Crie com o ElevenAgents para alto desempenho e baixa latência
A plataforma que você escolhe para desenvolver influencia diretamente o desempenho dos seus agentes de voz em workflows reais. Especialmente ao interagir com seus clientes, você precisa ter confiança de que seu agente terá desempenho superior em todas as categorias.
O ElevenAgents foi criado para implementações de voz em produção, combinando TTS líder do setor com o Eleven v3, STT em tempo real por meio do Scribe v2 e uma camada de orquestração de agentes projetada para escala empresarial. Cada componente foi desenvolvido para atender aos benchmarks apresentados neste framework, permitindo que você ofereça experiências de alta qualidade aos seus clientes.
Esteja você avaliando suas opções ou pronto para começar a criar, a ElevenLabs tem um caminho para você. Explore a plataforma ElevenAgents para ver como ela se aplica ao seu caso de uso ou cadastre-se e comece a criar hoje mesmo.


