Marco de evaluación de agentes de voz: los 6 pilares explicados
- Escrito por
- Jack Limebear
- Publicado
- Última actualización
EscucharEscucha este artículo
Los agentes de voz deben orquestar una sinfonía de herramientas casi simultáneas. Es un delicado baile de registrar los comentarios de un cliente con Voz a Texto en Tiempo Real Voz a Texto (STT), asimilar el contexto y generar una respuesta con un modelo de lenguaje de gran tamaño (LLM), para después crear un archivo de audio con software de Texto a Voz (TTS).
Con tantas piezas en movimiento, ¿cómo puedes evaluar con precisión el rendimiento de un agente de voz?
En este artículo, proponemos un marco de evaluación de agentes de voz basado en seis pilares que describe exactamente qué medir al evaluar el éxito de un agente. También veremos por qué los distintos sectores deben ponderar estos pilares de forma diferente y qué errores habituales conviene evitar durante la evaluación.
Resumen
- Los seis pilares principales para evaluar agentes de voz son la calidad de voz TTS, la calidad de la conversación, el uso de herramientas y la finalización de tareas, la inteligencia, el cumplimiento normativo y la seguridad, y la fiabilidad.
- Los objetivos de producción más importantes son un MOS de 4,3, un TSR superior al 85 % y un tiempo hasta el primer audio inferior a 500 ms.
- Los distintos sectores ponderan cada pilar de manera diferente, y algunas implementaciones priorizan uno sobre los demás.
- Entre los errores habituales en las pruebas están evaluar solo audio limpio e ignorar los picos de latencia P99.
- ElevenLabs lidera en las métricas que más importan: Scribe v2 logra la menor WER del sector, del 2,2 % (Artificial Analysis, junio de 2026); Flash v2.5 y Turbo v2.5 son modelos punteros en velocidad (Artificial Analysis, junio de 2026), y ElevenAgents ofrece una latencia de inferencia de modelo de ~75 ms.
¿Qué es un marco de evaluación de agentes de voz?
Un marco de evaluación de agentes de voz con IA es un sistema estructurado que te permite probar el rendimiento en múltiples dimensiones. Un marco exhaustivo incluirá métricas para evaluar desde la fidelidad del audio hasta el flujo de la conversación e incluso el cumplimiento normativo.
A diferencia de un chatbot de texto, un agente de voz canaliza cada interacción a través de al menos tres tecnologías integradas: reconocimiento automático de voz (ASR), que convierte las palabras de un usuario en texto; un LLM que elabora una respuesta; y un sistema TTS que vuelve a convertir esa respuesta en audio. Si alguno de estos sistemas falla, toda la experiencia se deteriora.
Esta complejidad es precisamente la razón por la que las empresas deben evaluar los agentes de voz antes de seleccionar un proveedor e implementarlos. Cualquier latencia adicional o respuesta imprecisa puede tener repercusiones reales, como la pérdida de clientes o, en el peor de los casos, multas regulatorias y daños reputacionales.
Un marco para evaluar agentes de voz utiliza comparativas y datos medibles para definir si un agente es apto para determinados casos de uso. Desde la perspectiva de la empresa, poder evaluar distintos modelos de voz te permite elegir el mejor para tus clientes.
Los seis pilares que debes evaluar en un agente de voz
Aunque crear e implementar un agente de IA nunca ha sido tan sencillo, los procesos activos que tienen lugar entre bastidores son bastante complejos. Varios componentes trabajan a la vez para escuchar a un usuario, entender lo que quiere, enviar esa información a un LLM y generar una respuesta de audio, por lo que se producen muchas acciones casi simultáneas.
Para asociarse con el mejor agente de voz posible, las empresas necesitan un marco riguroso con el que compararlo.
Si te interesa más ver los resultados de las pruebas, Artificial Analysis ofrece varias comparativas de agentes basadas en distintos componentes. A continuación puedes ver los resultados de su comparación de velocidad entre modelos, donde ElevenLabs Turbo v2.5 y Flash v2.5 lideran con un margen significativo en caracteres procesados por segundo.

Para desarrolladores o empresas que quieran realizar sus propios experimentos, estos son los seis pilares de un marco de evaluación de agentes de IA que deberías utilizar:
- Calidad de voz TTS: Qué tan natural, clara y expresiva resulta el habla sintetizada para usuarios finales. Los mejores modelos del sector, como Eleven v3, ofrecen una entonación emotiva y similar a la humana en más de 70 idiomas.
- Calidad de la conversación: ¿Entiende el modelo el habla humana, interpreta su significado y responde con rapidez en contexto a lo largo de varios turnos?
- Uso de herramientas: Hasta qué punto un agente de IA completa tareas usando los recursos disponibles sin necesitar intervención humana.
- Inteligencia: Qué bien razona un modelo, gestiona entradas nuevas y evita generar respuestas inexactas o alucinadas.
- Cumplimiento normativo y seguridad: Además de todas sus capacidades, los agentes de voz con IA deben cumplir todos los requisitos regulatorios y de cumplimiento normativo, incluidas las barreras de seguridad activas.
- Fiabilidad: Componentes como la disponibilidad total y un rendimiento constante bajo carga determinan si un agente de IA conversacional puede escalar según la demanda.
Aunque cada uno de estos pilares es independiente, se interrelacionan para ofrecer al usuario una experiencia final de alta calidad. Por ejemplo, si un modelo mejorara la calidad de voz pero siguiera teniendo una latencia alta, el cliente experimentaría incómodos tiempos de espera antes de que el modelo emitiera voz.
Veamos en más detalle cada uno de estos pilares de evaluación de la voz IA.
Calidad de voz TTS
Empezamos por la calidad de voz, ya que probablemente es lo primero que una persona notará al interactuar con un agente conversacional de IA. Si suena robótico o extraño, la experiencia subjetiva con el agente será considerablemente peor.
Una de las métricas de evaluación originales, definida por el Sector de Normalización de las Telecomunicaciones de la Unión Internacional de Telecomunicaciones (UIT-T), es la puntuación media de opinión (MOS). El MOS funciona en una escala del 1 al 5, donde 1 es inutilizable y 5 es excelente. Al ser una medición subjetiva, utiliza oyentes humanos y recopila comentarios después de una llamada.
Cualquier puntuación inferior a MOS 3,5 en esta escala resulta bastante poco destacable, especialmente según los estándares actuales, y probablemente afectará a la satisfacción del cliente.
Aunque el MOS es una métrica centrada en las personas, varios requisitos técnicos contribuyen a esa cifra:
- Consistencia del tono y jitter: El tono y el jitter son dos elementos lingüísticos que las personas perciben de forma natural al escuchar. El «tono» se refiere a los cambios de entonación durante el habla, como cuando elevas naturalmente la voz al hacer una pregunta. El jitter se produce cuando varía la comprensión del tono por parte de un modelo de voz, lo que le impide mantener una prosodia coherente a lo largo de una frase. La referencia del sector para el jitter es 30 ms.
- Expresividad emocional: Una voz clara y precisa seguirá sonando mal si su tono no coincide con el registro emocional previsto de una frase. Sin señales tonales precisas, los oyentes humanos conectarán menos con los agentes conversacionales de IA y los valorarán peor. ElevenAgents ofrece una expresividad casi humana para dotar cada respuesta de una intención emocional clara.
- Ruido de fondo: El ruido de fondo en los agentes de voz tiene dos dimensiones diferenciadas que conviene evaluar. En la salida, se añade sutilmente ruido ambiental a las respuestas para que los agentes suenen más naturales. En la entrada, el filtrado de ruido de fondo en la capa STT es una opción que mejora la precisión. Al evaluar un agente, prueba ambos: comprueba si el ruido ambiental suena natural y evalúa la precisión del STT con el filtro de ruido activado y desactivado.
Al calcular el MOS, deberías aspirar a un valor de 4,3-4,5, que demuestra puntuaciones altas en todas estas categorías perceptivas. Para predecir el MOS a escala sin necesidad de paneles humanos, puedes utilizar herramientas como UTMOS y NISQA.
Calidad de la conversación
La calidad de la conversación es un pilar compuesto que se sitúa entre la calidad de voz y la finalización de tareas. Su objetivo es medir con qué eficacia un agente de voz entiende las necesidades de un usuario, le interrumpe en contexto y mantiene esa información a lo largo de un diálogo de varios turnos hasta completarlo.
La métrica principal aquí es la precisión de clasificación de intenciones, que suele situarse entre el 85 % y el 92 %, mientras que los mejores resultados superan el 96 %. Aunque el 85 % pueda parecer alto, sigue suponiendo que el 15 % de todo el tráfico entrante se clasifica incorrectamente y se dirige a recursos equivocados.
Los elementos técnicos que contribuyen a una alta precisión en la clasificación de intenciones son:
- Gestión de turnos: La gestión de turnos determina lo bien que un agente de voz administra el flujo natural de una conversación. Evalúa cuándo sabe que debe escuchar, responder o esperar más información. También abarca la gestión de interrupciones, en las que un modelo descarta una respuesta en curso y genera otra nueva basándose en la nueva entrada. ElevenLabs utiliza un websocket multicontexto para gestionar estas interrupciones de forma fluida.
- Latencia: Latencia describe el retraso integral entre que un usuario termina su frase y el agente empieza su respuesta de audio. Los agentes de voz listos para producción deberían aspirar a un tiempo hasta el primer audio inferior a 500 ms; menos de 300 ms es aún mejor. Los modelos Flash de ElevenLabs ofrecen un tiempo de inferencia líder en el sector de ~75 ms, lo que te prepara para tener éxito en esta categoría.
- Tasa de fallback: La tasa de fallback mide con qué frecuencia un agente de IA no entiende a un usuario y pide una aclaración o una repetición. En gran medida es una consecuencia posterior de la precisión del STT: si la capa de reconocimiento de voz oye mal o representa incorrectamente lo que ha dicho un cliente, el LLM recibe datos de entrada corruptos. La tasa de fallback se calcula de forma directa con la fórmula: Tasa de fallback (%) = (Número de fallbacks / Número total de interacciones) * 100.
ElevenLabs Scribe V2 tiene la menor WER, del 2,2 %, en la evaluación de modelos de Voz a Texto de Artificial Analysis

Evaluación de modelos de Voz a Texto de Artificial Analysis
Una forma de medir la calidad de la conversación es consultar los estándares de referencia del sector para los distintos componentes. Como puedes ver, Scribe v2 de ElevenLabs tiene la menor tasa de error de palabras, del 2,2 %, en junio de 2026, lo que implica menos errores de reconocimiento, menos fallbacks y una clasificación de intenciones más precisa.
Las empresas pueden descubrir que la calidad conversacional también depende del workflow en el que opere un agente de voz. Por ejemplo, en atención al cliente, otra consideración sería la calidad de la transferencia durante una escalación o la resolución de preguntas frecuentes.
Uso de herramientas y finalización de tareas
Mientras que la calidad mide cómo se sintió una conversación, la finalización de tareas mide si condujo a un resultado satisfactorio. Las empresas deberían prestar mucha atención a esta parte del marco de evaluación de agentes de voz, ya que está directamente vinculada a los resultados de negocio.
Una medida del uso de herramientas es la precisión de rellenado de campos, que determina lo bien que los agentes de IA pueden completar tareas bastante rutinarias, como rellenar un formulario con información del cliente. Una alta precisión de rellenado de campos demuestra que el agente puede pasar de la conversación a la acción sin perder información por el camino.
La tasa de éxito de tareas (TSR) es una medición porcentual de las tareas integrales que un agente completó con éxito. En este caso, la finalización se basa en la capacidad del agente tanto para entender una solicitud como para usar las herramientas conectadas adecuadas (API, bases de datos, generación aumentada por recuperación [RAG] y bases de conocimiento internas) como ayuda.
La fórmula del TSR es:
TSR = (Tareas completadas íntegramente / Total de tareas intentadas) x 100
Los agentes de voz listos para producción deberían aspirar a un TSR superior al 85 %, monitorizando la precisión y la fiabilidad de las llamadas a herramientas. Para evitar descensos en tu TSR, asegúrate de realizar pruebas de regresión ante cualquier modificación del prompt o del modelo conectado. Incluso una pequeña desviación podría tener consecuencias importantes para tu TSR.
Inteligencia
La inteligencia engloba el razonamiento y las capacidades de orden superior de un agente de voz. Este pilar marca claramente la diferencia entre una IVR (respuesta de voz interactiva) basada en voz y un agente de voz con IA.
Las dimensiones principales que debes evaluar aquí incluyen:
- Riesgo de alucinaciones: Las alucinaciones, en las que un agente genera información inexacta o incoherente con los documentos de la empresa, son especialmente perjudiciales en la voz IA porque pueden transmitirse con seguridad. Estudios recientes sugieren que las alucinaciones frecuentes dañan significativamente la satisfacción del cliente con los agentes de voz.
- Gestión de consultas fuera de alcance: Los agentes inteligentes entienden cuándo una pregunta queda fuera de su ámbito contextual y pueden responder adecuadamente. En lugar de alucinar una respuesta, rechazan la consulta o redirigen la conversación a un terreno contextualizado.
- Retención del contexto: A lo largo de varios turnos, ¿puede un agente rastrear las entidades y compromisos establecidos anteriormente? Sin esta capacidad, los clientes podrían tener que repetirse o recibir respuestas contradictorias.
- Razonamiento y lógica de varios pasos: ¿Puede el agente gestionar correctamente la lógica condicional o encadenar inferencias a lo largo de varios turnos? Especialmente en casos de uso más técnicos, como los servicios financieros, la capacidad de razonar dentro de un contexto predefinido es esencial para tener éxito.
Existen varios benchmarks de terceros para estas dimensiones y componentes. Por ejemplo, el benchmark Holistic Evaluation of Language Models (HELM) de Stanford evalúa el rendimiento de los LLM en distintas categorías. Para las alucinaciones, TruthfulQA ofrece un análisis sólido de la frecuencia con la que las respuestas falsas se infiltran en las respuestas.
Una ventaja de ElevenAgents es que, a diferencia de algunas plataformas de voz que te limitan a un único modelo subyacente, puedes sustituir por completo la capa del LLM. En la práctica, esto significa que puedes incorporar el modelo que lidere los benchmarks de razonamiento para tu caso de uso específico.
Cumplimiento normativo y seguridad
Las empresas deben implementar barreras de seguridad activas para evitar resultados perjudiciales o que incumplan las políticas. A diferencia de las instrucciones de prompt a nivel de sistema, que podrían eludirse o anularse, las comprobaciones independientes de las barreras de seguridad funcionan como una capa separada fuera del propio modelo. Evalúan los resultados antes de que lleguen al usuario y detienen la conversación si se adentra en un terreno peligroso.
La auditabilidad es un requisito relacionado: los agentes en producción deben mantener registros detallados de decisiones y resultados en un formato que permita su revisión posterior. Especialmente en sectores muy regulados, demostrar el cumplimiento normativo a posteriori es tan importante como lograrlo en primer lugar.
La normativa exacta que debe cumplir tu empresa variará según el sector. Estos son algunos de los marcos más habituales:
- HIPAA: Para datos sanitarios protegidos en contextos de atención médica de EE. UU.
- PCI-DSS: Para cualquier agente que gestione datos de tarjetas de pago.
- RGPD: Obligaciones de privacidad de datos para la UE y empresas con clientes en la UE.
Para empresas que evalúan su nivel de cumplimiento normativo, ElevenLabs cumple con AICPA SOC Tipo II y el RGPD, además de haber obtenido la certificación AIUC-1. La AIUC-1 es un estándar de seguridad diseñado específicamente para agentes de IA.
Fiabilidad
La fiabilidad es el pilar final de nuestro marco de evaluación de agentes de voz y abarca si un agente puede rendir de forma constante en tiempo real.
Al evaluar un agente de voz, busca las siguientes características:
- Disponibilidad: Cualquier implementación orientada al cliente requiere un 99,9 % de disponibilidad para evitar interrupciones. Especialmente en casos de uso siempre activos, como la asistencia entrante, una disponibilidad fiable es un factor clave.
- Degradación controlada: Debido a la complejidad subyacente de los agentes de voz, si un componente empieza a fallar, el agente debería gestionar esa degradación de forma controlada. En la práctica, esto significa derivar a una persona, en lugar de seguir funcionando con una carga mayor o devolviendo errores.
- Rendimiento bajo carga:Las pruebas de carga deberían simular al menos el doble de tu pico de concurrencia previsto antes de poner el sistema en producción. Las pruebas bajo mucha presión pueden detectar aumentos de latencia o degradaciones del rendimiento que solo aparecen a escala.
Incluso un modelo de alta calidad que cumpla todos los demás requisitos puede resultar inutilizable si no escala con la demanda de tus clientes. 1.000.000 de creadores y empresas líderes confían en ElevenAgents, lo que demuestra la capacidad de la plataforma para permitir implementaciones a escala empresarial sin comprometer los benchmarks de rendimiento.
Cómo medir el MOS para agentes de voz (paso a paso)
Si tu empresa quiere medir el MOS manualmente, necesitarás un gran grupo de oyentes humanos y una selección de clips de audio de conversaciones reales. Es un proceso estructurado que implica recopilar comentarios, calcular promedios e interpretar los datos.
Así puedes medir el MOS de los agentes de voz en la práctica:
- Prepara tu conjunto de pruebas: Selecciona una muestra representativa de las salidas de audio de tu agente, que cubra al menos 100 clips de una variedad de conversaciones.
- Realiza la sesión de valoración: Pide a tus oyentes humanos que valoren cada uno en una escala del 1 al 5 según la calidad de la experiencia de comunicación.
- Agrupa las valoraciones y calcula las puntuaciones: Calcula la media de las valoraciones de cada clip y, después, la media de todos los clips de la muestra para obtener un MOS global. Un MOS de 4,3 o superior indica que tu agente de voz está listo para producción.
Aunque requiere mucho trabajo manual, este proceso te dará un MOS sólido para el agente de voz que hayas elegido. Si quieres realizar la prueba a escala, puedes sustituir a los oyentes humanos por herramientas automatizadas como NISQA, que predicen las puntuaciones MOS de forma programática. Puedes integrar estos sistemas en tus pipelines activos para monitorizar continuamente el MOS a lo largo del tiempo.
Benchmarks de pruebas de IA frente a humanos: FCR, AHT y CSAT
Aunque calcular el MOS repetidamente a lo largo del tiempo permite observar la mejora o regresión del modelo, puedes añadir más contexto al compararlo con el rendimiento humano. Ver lo que consiguen realmente las personas en funciones similares mostrará si tu agente de voz rinde cerca de un nivel ideal.
Estas son algunas métricas que debes considerar para los benchmarks de pruebas de IA frente a humanos.
Los agentes de IA deberían poder igualar el FCR y el CSAT de los humanos y, al mismo tiempo, mejorar significativamente el AHT. Esta mejora se debe a que los agentes de IA suelen gestionar conversaciones más generales que los agentes humanos. Muchas empresas implementan un workflow en el que los agentes de IA son quienes responden primero y solo transfieren las llamadas a agentes humanos si son demasiado complejas para gestionarlas de forma autónoma.
Los datos de 2025 de Poe, un agregador de comparativas de IA, revelan que ElevenLabs mantuvo la mayor capacidad general para atender solicitudes, completando el 74,4 % de todas las solicitudes entrantes. Su éxito se ha traducido en un uso que crece rápidamente: Eleven v3 y v2.5-Turbo representan más del 60 % de los mensajes enviados a modelos de IA a lo largo del tiempo.
Mensajes enviados a modelos de IA a lo largo del tiempo; ElevenLabs lidera el marco de evaluación de agentes de voz de Poe

Mensajes enviados a modelos de IA a lo largo del tiempo, según el benchmark de Poe
Errores habituales al probar agentes de voz
Al seguir un marco de evaluación de agentes de voz, resulta tentador probar los escenarios ideales. La realidad es que la experiencia diaria de los clientes que interactúan con tus sistemas de voz IA no se dará en condiciones perfectas.
Estos son tres errores habituales al probar agentes de voz y cómo solucionarlos:
- Probar el camino más fácil: Especialmente al seleccionar clips de audio para el MOS, asegúrate de incluir casos de uso límite. Los clips con ruido de fondo o habla con acento son muy habituales en la vida real, por lo que probar solo archivos de audio «limpios» llevará a calibrar incorrectamente el MOS.
- Priorizar la contención sobre la resolución: Optimizar tus modelos para mantener a usuarios dentro de tu sistema de agentes infla las tasas de contención sin mejorar los resultados. Si tu FCR es bajo a pesar de una tasa de contención elevada, el agente está haciendo que usuarios recorran un bucle frustrante. Establece prácticas que permitan a usuarios hablar con agentes humanos si así lo desean.
- Ignorar los percentiles de latencia: Los SLA suelen designar la latencia por el nivel P95. Aunque esta métrica es importante para ofrecer una experiencia coherente a la mayoría de tus clientes, no olvides que el 5 % restante también son clientes reales. A escala, el 5 % de un sistema que gestiona 10.000 llamadas diarias sigue siendo 500 personas experimentando una conversación lenta. Céntrate en P99 como objetivo principal de tu SLA, no solo en la mediana o el P95.
Teniendo esto presente, podrás establecer referencias justas y representativas en lugar de basarte en promedios idealizados.
Por qué necesitas evaluaciones específicas para cada caso de uso
Aunque los seis pilares definidos en este marco te orientan sobre las áreas que debes explorar, la ponderación de cada pilar dependerá de tu sector. Por ejemplo, una empresa del sector de los servicios financieros puede priorizar el cumplimiento normativo y el uso de herramientas, mientras que una marca de consumo consideraría la calidad de voz TTS como su principio rector.
Aquí tienes dos ejemplos de evaluaciones específicas para cada caso de uso y de cómo pueden modificar el equilibrio entre los distintos pilares.
Atención al cliente
En determinados sectores, como los centros de llamadas, otras métricas de finalización de tareas como la resolución en la primera llamada (FCR) son una parte importante de la conversación. Poder gestionar con éxito una llamada entrante sin intervención humana reduce significativamente la demanda sobre los agentes humanos de atención al cliente. McKinsey estima que los centros de llamadas que usan agentes de voz pueden reducir el volumen de interacciones hasta un 50 %.
Aunque no es tan importante como la tasa de éxito de tareas, otra dimensión que debes considerar aquí es la tasa de contención. La tasa de contención es una métrica que analiza la duración total de una llamada. Si tu tasa de contención es muy alta pero tu FCR es bajo, tus agentes mantienen a la gente en línea sin proporcionar una solución al cliente. En la práctica, esto puede traducirse en una frustrante experiencia de dar vueltas en círculo para el cliente.
Otras métricas que debes monitorizar son el AHT, ya que los agentes de IA buscan resolver problemas rutinarios rápidamente. Por eso, el ámbito de atención al cliente priorizaría la calidad de la conversación, especialmente la gestión de turnos y la tasa de fallback, por encima de otras áreas.
Atención sanitaria
Atención sanitaria es un ámbito muy regulado, con requisitos estrictos de cumplimiento normativo que hacen que la operación de agentes de voz sea extremadamente delicada. El cumplimiento normativo es una preocupación central, lo que desplaza considerablemente la ponderación del pilar de seguridad del marco hacia este aspecto y la inteligencia por encima de todo lo demás.
Chatbots de atención sanitaria deben gestionar la programación de citas, las vías de acceso a la telemedicina, el triaje de síntomas y las consultas sobre seguros. Todo ello requiere un alto grado de inteligencia y uso de herramientas, lo que vuelve a reflejar que las demandas específicas de cada sector o función influyen en cuál de los pilares es más importante.
Sea cual sea el sector en el que trabaje tu empresa, comprender los pilares fundamentales de la evaluación de agentes de voz y aplicarlos de forma equilibrada te ayudará a encontrar los mejores agentes para ti.
Crea con ElevenAgents para lograr alto rendimiento y baja latencia
La plataforma que eliges para desarrollar influye directamente en cómo rinden tus agentes de voz en workflows reales. Especialmente al interactuar con tus clientes, debes tener la certeza de que tu agente destacará en todas las categorías.
ElevenAgents está diseñado para implementaciones de voz en producción y combina TTS líder en el sector a través de Eleven v3, STT en tiempo real mediante Scribe v2 y una capa de orquestación de agentes diseñada para la escala empresarial. Cada componente está creado para rendir según los benchmarks establecidos en este marco, lo que te permite ofrecer experiencias de alta calidad a tus clientes.
Tanto si estás valorando opciones como si ya estás listo para empezar a desarrollar, ElevenLabs tiene un camino para ti. Explora la plataforma ElevenAgents para descubrir cómo se adapta a tu caso de uso o regístrate y empieza a crear hoy mismo.


