Ir al contenido

Tasa de error de palabras (WER): conceptos clave, fórmula y usos

Escrito por
Jack Limebear
Publicado
Última actualización

EscucharEscucha este artículo

En teoría, la tasa de error por palabra (WER) es una métrica para determinar la precisión de una herramienta de Reconocimiento Automático del Habla (ASR). Un WER bajo significa que tu transcripción final es más precisa, mientras que una tasa de error alta indica información mal transcrita. 

En la práctica, el WER puede marcar la diferencia entre un software de transcripción médica que indica que un paciente necesita «quince miligramos» y «cincuenta miligramos» de un medicamento. Es la diferencia entre una herramienta de soporte que transcribe correctamente las necesidades de un cliente y otra que deja a tu usuario frustrado.

En este artículo, explicaremos qué es el WER, cómo calcularlo y cómo usarlo para comparar tu proveedor de ASR.

Resumen

  • La tasa de error por palabra contabiliza tres tipos de errores: sustituciones, eliminaciones e inserciones, y los divide entre el número de palabras de la transcripción de referencia.
  • La fórmula del WER es WER = (S + D + I) / N. 
  • Cuanto menor sea la puntuación WER, más preciso será el resultado final.
  • Un WER inferior al 5 % es una buena referencia, aunque las transcripciones jurídicas o médicas pueden requerir una tasa de error por palabra aún menor.
  • El WER considera todos los errores iguales, por lo que no es una métrica perfecta para interpretar el contexto. Métricas emergentes, como la tasa de error por palabra semántica (SWER), intentan resolverlo midiendo si se ha conservado el significado de un enunciado.

¿Qué es la tasa de error por palabra?

La tasa de error por palabra (WER) es la métrica estándar para medir la precisión del reconocimiento de voz en modelos de Voz a Texto. Representa, en una escala de 0 a 1 (0,8 representaría una tasa de error del 80 %), lo que un sistema STT transcribe incorrectamente, teniendo en cuenta sus sustituciones, eliminaciones e inserciones.

Una sustitución ocurre cuando una palabra se reemplaza por otra incorrecta. Una eliminación ocurre cuando se omite una palabra por completo. Por último, una inserción ocurre cuando la transcripción incluye una palabra que nunca se pronunció. El WER utiliza estos tres componentes y los divide entre el número de palabras de la transcripción correcta, lo que da una cifra que puedes comparar con la de otros proveedores.

Esta es la fórmula del WER:

WER = (S + D + I) / N

Donde:

  • S: Sustituciones (la palabra es incorrecta)
  • D: Eliminaciones (falta la palabra)
  • I: Inserciones (hay una palabra adicional)
  • N: Total de palabras de la transcripción de referencia

Puedes expresar el WER como decimal o porcentaje. Cuanto menor sea el WER, mejor será tu puntuación, ya que el modelo habrá cometido menos errores al transcribir. 

En la práctica, un WER del 10 % significa que aproximadamente 1 de cada 10 palabras de la transcripción de tu reunión necesita una segunda revisión. 

¿Por qué es importante la tasa de error por palabra en los sistemas de reconocimiento de voz?

La tasa de error por palabra ofrece una métrica objetiva que los equipos pueden usar para comparar distintos proveedores. Va más allá de las afirmaciones de marketing y muestra claramente la precisión de un modelo de reconocimiento de voz. Al basarse en datos, cualquier empresa que evalúe sus opciones puede ver con claridad qué modelos lideran actualmente este ámbito.

AA-WER chart: Scribo v2 and ElevenLabs have the lowest error rates, outperforming other models.

Fuente: Artificial Analysis consultado el 10 de julio de 2026.

En julio de 2026, una investigación independiente de Artificial Analysis sitúa a Scribe v2 de ElevenLabs como el modelo con el WER más bajo del sector en el conjunto de datos AA-AgentTalk para modelos de transcripción no streaming, con un WER del 1,5 %.

Más allá de la evaluación de proveedores, el WER tiene un impacto real en el producto. Un software de transcripción médica con un WER del 12 % podría introducir errores críticos en los historiales de pacientes. Las transcripciones incorrectas en una llamada de atención al cliente podrían provocar problemas posteriores, como un análisis de sentimiento impreciso o una mala categorización.

Más allá de estos problemas específicos de cada caso de uso, cuando fallan los sistemas ASR, las personas más afectadas suelen ser aquellas para quienes la transcripción es la única forma de acceder al contenido hablado. El World Wide Web Consortium ofrece amplia documentación sobre los estándares mínimos que esperan las iniciativas de accesibilidad.

Cómo calcular la tasa de error por palabra: fórmula y ejemplo

Calcular la tasa de error por palabra es sencillo una vez conoces los pasos. Como hemos visto, la fórmula es WER = (S + D + I) / N. Todos los términos se describen arriba, pero como referencia rápida son sustituciones, eliminaciones, inserciones y N para el total de palabras de la transcripción.

Así puedes calcular el WER:

  1. Crea una transcripción de referencia: utiliza transcripción y verificación humanas para elaborar una transcripción precisa de un clip de audio. 
  2. Usa tu herramienta STT: usa una plataforma ASR para transcribir el clip de audio y generar una transcripción con IA que utilizarás para la prueba.
  3. Alinea las dos versiones: usa programación dinámica —concretamente el algoritmo de Levenshtein— para encontrar el número mínimo de ediciones. Profundizaremos en ese algoritmo en una sección posterior.
  4. Aplica la fórmula: cuenta el número total de errores de la versión generada por IA frente a la copia verificada por una persona y usa WER = (S + D + I) / N para calcular el WER exacto.

Sobre el papel parece bastante técnico, pero en la práctica es mucho más sencillo. Este ejemplo te mostrará a qué nos referimos.

Transcripción de referencia: La señora Dalloway dijo que compraría ella misma las flores.

Resultado del ASR: La señorita Dalloway dijo que compraría flores ella misma.

Word
Reference
ASR output
Error type
1
Mrs.
Miss
Substitution
2
Dalloway
Dalloway
Correct
3
said
said
Correct
4
she
she
Correct
5
would
would
Correct
6
buy
buy
Correct
7
the
Deletion
8
flowers
flowers
Correct
9
herself
herself
Correct

Si calculamos el total de errores, tenemos 1 S y 1 D de un total de 9 palabras. 

Con la fórmula obtenemos: WER = 2 / 9 = 0,222 = 22,2 %. 

Cómo calcular la tasa de error por palabra con Python

Aunque el método manual funciona muy bien, puedes ahorrar tiempo calculando el WER con Python. La biblioteca jiwer se encarga de todo automáticamente.

Con la documentación de jiwer, puedes instalar el paquete, creado específicamente para evaluar sistemas ASR y generar métricas clave como el WER. Una vez descargado, puedes usar el siguiente código para calcular rápidamente el WER con Python:

from jiwer import wer

reference = "the quick brown fox jumps over the lazy dog"
asr = "the quick brown fox leaps over the last lazy dog"

print(wer(reference, asr))  # 0.222

Fíjate en que, en este ejemplo, el resultado del ASR difiere de la referencia original en dos puntos. La palabra «jumps» se transcribió incorrectamente como «leaps» (una sustitución) y se insertó «last» antes de «lazy» (una inserción). Con dos errores entre las nueve palabras de la transcripción de referencia, el resultado es una tasa de error por palabra (WER) de 0,222 o 22,2 %.

Comparación de la tasa de error por palabra con otras métricas de reconocimiento

Aunque el WER es la métrica estándar para calcular la precisión de un ASR, puedes usar otras herramientas. Por ejemplo:

  • Tasa de error por carácter (CER): al igual que el WER, mide la precisión de la transcripción a nivel de carácter en lugar de a nivel de palabra. Es mejor para idiomas que no tienen límites claros entre palabras (scriptio continua) o tareas sensibles a la ortografía.
  • Tasa de error de coincidencia (MER): mide la proporción de errores de transcripción, pero trata las sustituciones, inserciones y eliminaciones de forma ligeramente distinta al WER. Se centra en la proporción de errores de una frase.
  • Información de palabras perdida (WIL): una estimación de cuánta información original se perdió durante la transcripción, que proporciona una medida de inteligibilidad en lugar del recuento directo de errores del WER.
  • Tasa de error de incrustación (EmbER): ofrece un análisis semántico entre las transcripciones. Va más allá del WER y permite conocer la distancia semántica entre la palabra correcta y la transcripción incorrecta.

Cada una de estas métricas es más adecuada para un escenario diferente. Aquí tienes una tabla de referencia:

Level of analysis
WER
Word
CER
Character
MER
Word
EmbER
Semantics
Best for
WER
ASR benchmarking and assessment
CER
ASR languages without word boundaries
MER
Error decomposition
EmbER
Semantic-aware evaluation

Ejemplos de distancia de Levenshtein: las matemáticas detrás del WER

La tasa de error por palabra mide realmente la distancia entre el original y la salida de la hipótesis. Para entender esa diferencia matemáticamente, usamos la distancia de Levenshtein.

La distancia de Levenshtein cuenta el número mínimo de ediciones de una sola unidad necesarias para transformar una secuencia en otra. En el caso del WER, se refiere específicamente a las sustituciones, inserciones y eliminaciones. Por ejemplo, si quisiéramos transformar «Cat» en «Mat», tendríamos que cambiar la letra «C» por «M», obteniendo una distancia de Levenshtein de 1.

Aunque esto se ve mucho más en los cálculos de CER, el WER toma la distancia de Levenshtein y la aplica a nivel de palabra. Cada unidad es una palabra completa en lugar de un carácter, y la distancia real mide cuántas ediciones de palabras harían falta para transformar nuestro resultado de ASR en el original correcto. 

Construimos una matriz en la que cada celda representa la distancia total entre la transcripción original y la del ASR. La distancia de Levenshtein rellena entonces la matriz de arriba a la izquierda a abajo a la derecha, y la celda final indica el número total de ediciones a nivel de palabra. Al dividir ese número entre N, obtenemos el WER. 

Aunque esta matriz suele calcularse con caracteres individuales, aquí tienes una versión ampliada de nuestro ejemplo anterior para simplificarlo. 

Levenshtein matrix shows a 22.2% word error rate; 2 edits needed for ASR output correction.

Errores habituales e ideas equivocadas sobre la tasa de error por palabra

Especialmente a medida que las API de STT se vuelven más accesibles y el software ASR pasa a ser una parte habitual de ecosistemas de agentes más amplios, veremos muchas comparaciones entre distintas herramientas. 

Antes de calcular tus propias tasas de error por palabra, hay algunos problemas e ideas equivocadas habituales que debes conocer.

  • Todos los errores son iguales: el WER trata todos los errores como igual de importantes. Aunque en muchos contextos esto puede estar bien, algunos casos de uso hacen que sea inaceptable. Por ejemplo, en un hospital, un error del 5 %, que se consideraría un buen WER, puede seguir siendo inaceptable, ya que incluso uno o dos errores podrían poner en riesgo a un paciente. Esta limitación ha dado lugar al desarrollo de métricas más recientes, como la tasa de error por palabra semántica (SWER), que intenta medir si se ha conservado el significado de una frase, en lugar de si cada palabra coincide exactamente. 
  • El WER puede superar el 100 %: aunque antes indicamos que el WER va de 0 a 1, puedes encontrar un WER superior al 100 %. Esto se debe a que el error de inserción puede generar más palabras que el total de la transcripción original. Un caso habitual es transcribir «I'm» como «I am», donde una palabra se convierte en dos. 
  • Técnicamente, un WER más bajo no siempre es mejor: sobre el papel, un WER del 5 % es mejor que uno del 10 %. Sin embargo, si los errores que contribuyeron a ese 5 % cambiaron significativamente el contexto de una frase y los del 10 % no, no se refleja toda la situación. El contexto sigue siendo muy importante, y métricas como SWER se están desarrollando específicamente para captar este impacto semántico.

En 2024, Apple publicó un interesante estudio que exploraba el último punto anterior. Cuando personas evaluaron un cálculo de WER del 9,4 % atendiendo a si el ASR era legible, asignaron al mismo fragmento un WER de solo el 2,2 %. En el ejemplo que analizaron, las personas consideraron los «errores» insignificantes en muchos casos, lo que produjo un WER humano más de 4 veces más permisivo que el de las máquinas.

Referencias del sector para el WER

El WER ideal depende en gran medida del sector o caso de uso en el que utilices tecnología ASR. Aunque un valor inferior al 5 % es una referencia del sector para el WER, ámbitos concretos como la transcripción médica o jurídica necesitan una tasa mucho menor. 

En el estudio de Artificial Analysis de julio de 2026, Scribe v2 de ElevenLabs obtuvo un WER del 1,5 %. Sin embargo, es importante recordar que estas estadísticas suelen realizarse principalmente en inglés. La tecnología STT puede no ser igual de eficaz en otros idiomas. 

La documentación de ElevenLabs detalla los rangos generales de WER para todos los idiomas compatibles con Scribe v1 y Scribe v2.

Empieza a usar ElevenAPI para mejorar la precisión del reconocimiento

Cuando desarrollas una aplicación o producto en el que la calidad de la transcripción importa, la diferencia entre una API de ASR bien elegida y otra mediocre se nota primero en tu WER y después en la experiencia de tus usuarios. 

Scribe de ElevenLabs es la capa de Voz a Texto accesible a través de ElevenAPI. Además de más de 90 idiomas y un WER líder en el sector, ofrece funciones como diarización de hablantes, marcas de tiempo a nivel de palabra, prompting de términos clave y detección de entidades.

Explora la documentación de ElevenLabs para saber más sobre ElevenAPI o empieza creando una cuenta hoy mismo. 

Preguntas frecuentes sobre la tasa de error por palabra

Artículos relacionados

Crea con el audio IA de la más alta calidad