Taxa de erro de palavras (WER): conceitos-chave, fórmula e usos
- Escrito por
- Jack Limebear
- Publicado
OuvirOuça este artigo
Na teoria, a taxa de erro de palavras (WER) é uma métrica para determinar a precisão de uma ferramenta de reconhecimento automático de voz (ASR). Um WER baixo significa que sua transcrição final está mais precisa, enquanto uma taxa de erro mais alta indica informações transcritas incorretamente.
Na prática, o WER pode ser a diferença entre um software de transcrição médica que escreve que um paciente precisa de 'quinze miligramas' ou 'cinquenta miligramas' de um medicamento. É a diferença entre uma ferramenta de suporte que transcreve corretamente as necessidades do cliente e outra que deixa o usuário frustrado.
Neste artigo, vamos explicar o que é WER, como calcular e como usar para comparar seu próprio fornecedor de ASR.
Resumo
- A taxa de erro de palavras conta três tipos de erro: substituições, deleções e inserções, divididos pelo número de palavras na transcrição de referência.
- A fórmula do WER é WER = (S + D + I) / N.
- Pontuações mais baixas de WER indicam que o resultado final é mais preciso.
- Um WER abaixo de 5% é um bom parâmetro, embora transcrições jurídicas ou médicas possam exigir uma taxa ainda menor.
- O WER trata todos os erros como iguais, ou seja, não é uma métrica perfeita para leitura contextual. Novas métricas, como a Taxa de Erro Semântico de Palavras (SWER), tentam resolver isso medindo se o significado da fala foi mantido.
O que é taxa de erro de palavras?
A taxa de erro de palavras (WER) é a métrica padrão para medir a precisão do reconhecimento de voz em modelos de Speech to Text. Ela representa de 0 a 1 (0,8 representa 80% de erro) o quanto um sistema STT erra ao transcrever, considerando substituições, deleções e inserções.
Uma substituição é quando uma palavra é trocada por outra errada. Deleção é quando uma palavra foi totalmente omitida. Por fim, inserção é quando a transcrição tem uma palavra a mais que não foi falada. O WER usa esses três componentes e divide pelo número de palavras na transcrição correta, gerando um número que você pode comparar com outros fornecedores.
Veja a fórmula do WER escrita:
WER = (S + D + I) / N
Onde:
- S: Substituições (palavra errada)
- D: Deleções (palavra ausente)
- I: Inserções (palavra adicional presente)
- N: Total de palavras na transcrição de referência
Você pode expressar o WER como decimal ou porcentagem. Quanto menor o WER, melhor foi o resultado, pois o modelo cometeu menos erros na transcrição.
Na prática, um WER de 10% significa que, em média, 1 a cada 10 palavras da transcrição da reunião precisa ser revisada.
Por que a taxa de erro de palavras é importante em sistemas de reconhecimento de voz?
A taxa de erro de palavras oferece uma métrica objetiva que equipes podem usar para comparar diferentes fornecedores. Ela elimina promessas de marketing e mostra claramente o quão preciso é um modelo de reconhecimento de voz. Com dados concretos, qualquer empresa pode avaliar suas opções e ver quais modelos são líderes no mercado.

Fonte:Artificial Analysis acesso em 10 de julho de 2026.
Em julho de 2026, uma pesquisa independente da Artificial Analysis classificou o Scribe v2 da ElevenLabs como tendo o menor WER do setor no conjunto de dados AA-AgentTalk para modelos de transcrição não streaming, com WER de 1,5%.
Além da avaliação de fornecedores, o WER tem impacto real no produto. Um software de transcrição médica com WER de 12% pode gerar erros críticos no prontuário do paciente. Erros em uma ligação de suporte ao cliente podem causar problemas como análise de sentimento incorreta ou categorização errada.
Além desses problemas específicos de uso, quando sistemas ASR falham, quem mais sofre são as pessoas para quem a transcrição é a única forma de acessar o conteúdo falado.World Wide Web Consortium oferece documentação detalhada sobre os padrões mínimos esperados por iniciativas de acessibilidade para mais contexto.
Como calcular a taxa de erro de palavras: fórmula e exemplo
Calcular a taxa de erro de palavras é simples quando você conhece os passos. Como vimos acima, a fórmula é WER = (S + D + I) / N. Todos os termos estão descritos acima, mas para referência rápida: substituições, deleções, inserções e N para o total de palavras na transcrição.
Veja como calcular o WER:
- Crie uma transcrição de referência: Use transcrição humana e verificação para produzir uma transcrição precisa de um trecho de áudio.
- Use sua ferramenta STT: Use uma plataforma ASR para transcrever o áudio, gerando uma transcrição com IA que será usada como teste.
- Alinhe as duas versões: Use programação dinâmica (especificamente o algoritmo de Levenshtein) para encontrar o número mínimo de edições. Vamos detalhar esse algoritmo em uma seção mais adiante.
- Aplique a fórmula:Conte o total de erros na versão gerada por IA em relação à cópia verificada por humanos e depois use WER = (S + D + I) / N para calcular o WER exato.
Isso parece técnico na teoria, mas na prática é bem mais simples. Veja um exemplo para ilustrar:
Transcrição de referência:Mrs. Dalloway disse que ela mesma compraria as flores.
Saída do ASR:Miss Dalloway disse que compraria flores ela mesma.
Se calcularmos o total de erros, temos 1 S e 1 D em 9 palavras.
Usando a fórmula, temos: WER = 2 / 9 = 0,222 = 22,2%.
Calculando a taxa de erro de palavras com Python
Embora o método manual funcione bem, você pode economizar tempo calculando o WER com python. Abiblioteca jiwer faz todo esse processo automaticamente.
Usando a documentação do jiwer, você pode instalar o pacote, que foi criado especificamente para avaliar sistemas ASR e gerar métricas como o WER. Depois de instalar, use o código abaixo para calcular rapidamente o WER com python:
Veja como, neste exemplo, a saída do ASR difere da referência original em dois pontos. A palavra ‘jumps’ foi transcrita incorretamente como ‘leaps’ (substituição) e ‘last’ foi inserida antes de ‘lazy’ (inserção). Com dois erros em nove palavras da transcrição de referência, isso resulta em um WER de 0,222 ou 22,2%.
Comparando WER e outras métricas de reconhecimento
Embora o WER seja a métrica padrão para calcular precisão em ASR, existem outras ferramentas que você pode usar. Por exemplo:
- Taxa de Erro de Caracteres (CER): Assim como o WER, mede a precisão da transcrição, mas no nível de caracteres em vez de palavras. É melhor para idiomas sem separação clara de palavras (scriptio continua) ou tarefas sensíveis à ortografia.
- Taxa de Erro de Correspondência (MER): Mede a proporção de erros de transcrição, tratando substituições, inserções e deleções de forma um pouco diferente do WER. Foca na proporção de erros em uma frase.
- Informação de Palavra Perdida (WIL): Uma estimativa de quanto da informação original foi perdida durante a transcrição, fornecendo uma medida de inteligibilidade em vez da contagem direta de erros do WER.
- Taxa de Erro de Embedding (EmbER): Oferece uma análise semântica entre as transcrições. Vai além do WER para mostrar a distância semântica entre a palavra correta e a transcrição incorreta.
Cada uma dessas métricas é melhor para um cenário diferente. Veja uma tabela para referência:
Exemplos de distância de Levenshtein: a matemática por trás do WER
A taxa de erro de palavras é, na verdade, uma medida da distância entre o original e a saída hipotética. Para entender essa diferença matematicamente, usamos a distância de Levenshtein.
A distância de Levenshtein conta o número mínimo de edições de unidade única necessárias para transformar uma sequência em outra. No WER, isso significa especificamente as edições de substituições, inserções e deleções. Por exemplo, para transformar Cat em Mat, basta trocar o ‘C’ por ‘M’, dando uma distância de Levenshtein de 1.
Embora você veja mais isso em cálculos de CER, o WER usa a distância de Levenshtein no nível de palavras. Cada unidade é uma palavra inteira em vez de um caractere, e a distância real mostra quantas edições de palavras seriam necessárias para transformar a saída do ASR no original correto.
Construímos uma matriz onde cada célula representa a distância total entre a transcrição original e a transcrição do ASR. A distância de Levenshtein preenche a matriz do canto superior esquerdo ao inferior direito, e a célula final mostra o número total de edições no nível de palavras. Dividindo esse número por N, você tem o WER.
Embora essa matriz normalmente seja calculada com caracteres individuais, aqui está uma versão ampliada do exemplo anterior para simplificar.

Erros comuns e equívocos sobre a taxa de erro de palavras
Especialmente à medida queAPIs de STT ficam mais acessíveis e softwares ASR se tornam parte comum de stacks de agentes, vamos ver muitas comparações entre diferentes ferramentas.
Antes de calcular seu próprio WER, existem alguns problemas e equívocos comuns que você deve conhecer.
- Todos os erros são iguais: O WER trata todo erro como igualmente importante. Em muitos contextos isso pode ser suficiente, mas em alguns casos não é aceitável. Por exemplo, em um hospital, um erro de 5% — considerado um bom WER — pode ser incompreensível, já que um ou dois erros podem colocar um paciente em risco. Essa limitação levou ao desenvolvimento de métricas como a Taxa de Erro Semântico de Palavras (SWER), que tenta medir se o significado da frase foi mantido, e não apenas se todas as palavras coincidem.
- WER pode passar de 100%: Embora tenhamos dito que o WER vai de 0 a 1, é possível encontrar WER acima de 100%. Isso acontece porque o erro de inserção pode criar mais palavras do que o total da transcrição original. Um exemplo comum é transcrever ‘I’m’ como ‘I am’, onde uma palavra vira duas.
- WER mais baixo nem sempre é melhor: Um WER de 5% é, na teoria, melhor que um de 10%. Mas, se os erros que geraram os 5% mudaram significativamente o contexto da frase, enquanto os de 10% não, a história não está completa. O contexto ainda importa muito, e métricas como SWER foram criadas justamente para captar esse impacto semântico.
Em 2024, a Apple publicou um estudo interessante sobre esse último ponto. Quando humanos avaliaram um WER de 9,4% olhando se o ASR era legível, deram para o mesmo trecho umWER de apenas 2,2%. No exemplo testado, humanos consideraram muitos ‘erros’ insignificantes, resultando em um WER humano mais de 4x mais tolerante que o das máquinas.
Referências de mercado para WER
O WER ideal depende muito do setor ou do caso de uso da tecnologia ASR. Embora <5% seja referência no mercado, áreas como transcrição médica ou jurídica exigem taxas ainda menores.
No estudo daArtificial Analysis de julho de 2026, o Scribe v2 da ElevenLabs atingiu WER de 1,5%. Mas é importante lembrar que esses dados geralmente consideram o inglês como idioma principal. A tecnologia STT em outros idiomas pode não ser tão eficaz.
A documentação da ElevenLabs detalha osintervalos gerais de WER em todos os idiomas suportados pelo Scribe v1 e Scribe v2.
Comece com o ElevenAPI para aumentar a precisão do reconhecimento
Quando você está criando um app ou produto onde a qualidade da transcrição importa, a diferença entre uma API ASR bem escolhida e uma mediana aparece primeiro no seu WER e depois na experiência dos seus usuários.
O ElevenLabs Scribe é a camada deSpeech to Text acessível peloElevenAPI. Além de suportar mais de 90 idiomas e ter WER líder do setor, oferece recursos como diarização de falantes, marcação de tempo por palavra, prompts de termos-chave e detecção de entidades.
Explore adocumentação da ElevenLabs para saber mais sobre o ElevenAPI ou comece agora mesmocriando sua conta.
.webp&w=3840&q=80)

.webp&w=3840&q=80)
.webp&w=3840&q=80)
