Ir al contenido

Marco de evaluación de agentes de voz: los 6 pilares explicados

Escrito por
Jack Limebear
Publicado
Última actualización

EscucharEscucha este artículo

Los agentes de voz necesitan coordinar una sinfonía de herramientas casi simultáneas. Es un delicado baile que consiste en registrar los comentarios de un cliente con Voz a Texto (STT) en tiempo real, asimilar el contexto y generar una respuesta con un modelo de lenguaje de gran tamaño (LLM), para después crear un archivo de audio con software de Texto a Voz (TTS).

Con tantas piezas en movimiento, ¿cómo se evalúa con precisión el rendimiento de un agente de voz?

En este artículo proponemos un marco de evaluación de agentes de voz basado en seis pilares que explica exactamente qué medir al valorar el éxito de un agente. También veremos por qué los distintos sectores deben ponderar estos pilares de forma diferente y qué errores habituales debes evitar durante la evaluación.

Resumen

  • Los seis pilares principales para evaluar agentes de voz son la calidad de voz TTS, la calidad de la conversación, el uso de herramientas y la finalización de tareas, la inteligencia, el cumplimiento normativo y la seguridad, y la fiabilidad.
  • Los objetivos de producción más importantes son un MOS de 4,3, un TSR superior al 85 % y un tiempo hasta el primer audio inferior a 500 ms.
  • Cada sector ponderará los pilares de forma distinta, y determinados despliegues darán prioridad a unos sobre otros.
  • Entre los errores de prueba habituales están evaluar solo audio limpio e ignorar los picos de latencia P99.
  • ElevenLabs lidera las métricas más importantes: Scribe v2 logra la WER más baja del sector, del 2,2 % (Artificial Analysis, junio de 2026); Flash v2.5 y Turbo v2.5 son modelos punteros en velocidad (Artificial Analysis, junio de 2026); y ElevenAgents ofrece una latencia de inferencia de modelo de ~75 ms.

¿Qué es un marco de evaluación de agentes de voz?

Un marco de evaluación de agentes de voz con IA es un sistema estructurado que permite probar el rendimiento en múltiples dimensiones. Un marco completo incluirá métricas para evaluar desde la fidelidad del audio hasta el flujo de la conversación e incluso el cumplimiento normativo.

A diferencia de un chatbot de texto, un agente de voz dirige cada interacción a través de al menos tres tecnologías superpuestas: reconocimiento automático del habla (ASR), que convierte las palabras de un usuario en texto; un LLM que elabora una respuesta; y un sistema TTS que convierte esa respuesta de nuevo en audio. Si uno solo de estos sistemas falla, toda la experiencia se resiente.

Esta complejidad es precisamente la razón por la que las empresas deben evaluar los agentes de voz antes de elegir un proveedor y desplegarlos. Cualquier latencia adicional o respuesta imprecisa puede tener repercusiones reales, como perder clientes o, en el peor de los casos, recibir multas regulatorias y sufrir daños reputacionales.

Un marco para evaluar agentes de voz utiliza comparativas y datos medibles para determinar si un agente es adecuado para determinados casos de uso. Desde una perspectiva empresarial, poder evaluar distintos modelos de voz te permite elegir el mejor para tus clientes.

Los seis pilares que debes evaluar en un agente de voz

Aunque crear y desplegar un agente de IA nunca ha sido tan sencillo, los procesos que ocurren entre bastidores son bastante complejos. Varios componentes actúan a la vez para escuchar a un usuario, comprender qué quiere, transmitir esa información a un LLM y producir una respuesta de audio, por lo que se producen muchas acciones casi simultáneas.

Para colaborar con el mejor agente de voz posible, las empresas necesitan un marco riguroso con el que compararlo.

Si te interesa más conocer los resultados de las pruebas, Artificial Analysis ofrece varias comparativas de agentes basadas en distintos componentes. A continuación puedes ver los resultados de su comparación de velocidad entre modelos, donde ElevenLabs Turbo v2.5 y Flash v2.5 lideran con un margen considerable en caracteres procesados por segundo.

Bar chart comparing various AI models for characters per second; ElevenLabs Turbo v2.5 scores highest at 504.8.

Para desarrolladores o empresas que quieran realizar sus propios experimentos, estos son los seis pilares de un marco de evaluación de agentes de IA que deberías usar:

  • Calidad de voz TTS: El grado de naturalidad, claridad y expresividad con que el habla sintetizada suena a usuarios finales. Los mejores modelos del sector, como Eleven v3, ofrecen una entonación emotiva y similar a la humana en más de 70 idiomas.
  • Calidad de la conversación: ¿Comprende el modelo el habla humana, interpreta su significado y responde en contexto con rapidez a lo largo de varios turnos?
  • Uso de herramientas: La capacidad de un agente de IA para completar tareas con los recursos disponibles sin intervención humana.
  • Inteligencia: La capacidad de un modelo para razonar, gestionar entradas nuevas y evitar respuestas inexactas o alucinadas.
  • Cumplimiento normativo y seguridad: Además de todas sus capacidades, los agentes de voz con IA deben cumplir todos los requisitos regulatorios y de cumplimiento normativo, incluidas las barreras de seguridad activas.
  • Fiabilidad: Factores como el tiempo de actividad total y el rendimiento constante bajo carga determinan si un agente de IA conversacional puede escalar según la demanda.

Aunque cada uno de estos pilares es independiente, están interrelacionados y proporcionan una experiencia final de alta calidad al usuario. Por ejemplo, si un modelo mejorase su calidad de voz pero siguiera teniendo una latencia alta, el cliente sufriría esperas incómodas antes de que el modelo emitiera la respuesta.

Veamos cada uno de estos pilares de evaluación de voz con IA más en detalle.

Calidad de voz TTS

Empezamos por la calidad de voz, ya que probablemente sea lo primero que percibe una persona al interactuar con un agente conversacional con IA. Si suena robótico o extraño, la experiencia subjetiva con el agente será considerablemente peor.

Una de las métricas de evaluación originales, definida por el Sector de Normalización de las Telecomunicaciones de la Unión Internacional de Telecomunicaciones (UIT-T), es la Puntuación Media de Opinión (MOS). El MOS funciona en una escala del 1 al 5, donde 1 es inutilizable y 5 es excelente. Como medida subjetiva, utiliza oyentes humanos y recopila sus comentarios después de una llamada.


Cualquier resultado inferior a un MOS de 3,5 en esta escala es poco destacable, especialmente según los estándares actuales, y probablemente afecte a la satisfacción del cliente.

Aunque el MOS es una métrica centrada en las personas, varios requisitos técnicos contribuyen a esta cifra:

  • Consistencia del tono y jitter: El tono y el jitter son dos elementos lingüísticos que las personas perciben de forma natural al escuchar. El «tono» se refiere a los cambios de entonación durante el habla, como cuando elevas la voz al formular una pregunta. El jitter ocurre cuando varía la interpretación del tono por parte de un modelo de voz, lo que le impide mantener una prosodia coherente a lo largo de una frase. La referencia del sector para el jitter es de 30 ms.
  • Expresividad emocional: Una voz clara y precisa seguirá sonando mal si el tono no se ajusta al registro emocional deseado de una frase. Sin señales tonales precisas, los oyentes humanos conectarán menos con los agentes conversacionales con IA y los valorarán peor. ElevenAgents ofrece expresividad casi humana para que cada respuesta transmita una intención emocional clara.
  • Ruido de fondo: El ruido de fondo en los agentes de voz tiene dos dimensiones diferenciadas que merece la pena evaluar. En la salida, se añade sutilmente ruido ambiente a las respuestas para que los agentes suenen más naturales. En la entrada, el filtrado de ruido de fondo en la capa STT es una opción que mejora la precisión. Al evaluar un agente, prueba ambos aspectos: escucha si el ruido ambiente suena natural y evalúa la precisión del STT con el filtro de ruido activado y desactivado.

Al calcular el MOS, deberías aspirar a un valor de 4,3-4,5, que demuestra puntuaciones altas en todas estas categorías perceptivas. Para predecir el MOS a escala sin necesitar paneles humanos, puedes usar herramientas como UTMOS y NISQA.

Calidad de la conversación

La calidad de la conversación es un pilar compuesto situado entre la calidad de voz y la finalización de tareas. Mide hasta qué punto un agente de voz comprende las necesidades de un usuario, sabe interrumpirle en el momento adecuado y lleva esa información hasta completar un diálogo de varios turnos.

La métrica principal es la precisión de clasificación de intenciones, que suele situarse entre el 85 % y el 92 %, mientras que los mejores resultados superan el 96 %. Aunque un 85 % pueda parecer alto, sigue significando que el 15 % de todo el tráfico entrante se clasifica erróneamente y se dirige a recursos equivocados.

Los elementos técnicos que contribuyen a una alta precisión en la clasificación de intenciones son:

  • Gestión de turnos: La gestión de turnos determina hasta qué punto un agente de voz controla el flujo natural de una conversación. Evalúa si sabe cuándo escuchar, responder o esperar más información. También incluye la gestión de interrupciones, cuando un modelo descarta una respuesta en curso y genera otra nueva a partir de la nueva entrada. ElevenLabs utiliza un websocket multicontexto para gestionar estas interrupciones de forma fluida.
  • Latencia: La latencia describe el retraso de extremo a extremo entre el momento en que un usuario termina su frase y el momento en que el agente inicia su respuesta de audio. Los agentes de voz preparados para producción deberían aspirar a un tiempo hasta el primer audio inferior a 500 ms; menos de 300 ms es aún mejor. Los modelos Flash de ElevenLabs ofrecen un tiempo de inferencia líder en el sector de ~75 ms, lo que te sitúa en una buena posición en esta categoría.
  • Tasa de fallback: La tasa de fallback mide la frecuencia con la que un agente de IA no logra entender a un usuario y pide una aclaración o que repita lo dicho. Es en gran medida una consecuencia de la precisión del STT: si la capa de reconocimiento de voz oye mal o representa incorrectamente lo que ha dicho un cliente, el LLM recibe una entrada corrupta. La tasa de fallback se calcula así: Tasa de fallback (%) = (Número de fallbacks / Número total de interacciones) * 100.

ElevenLabs Scribe V2 tiene la WER más baja, del 2,2 %, en la evaluación de modelos de Voz a Texto de Artificial Analysis

ElevenLabs Scribe V2 has the lowest WER at 2.2% on the Artificial Analysis speech to text model evaluation

Evaluación de modelos de Voz a Texto de Artificial Analysis

Una forma de medir la calidad de la conversación es observar los estándares de referencia del sector para los distintos componentes. Como puedes ver, Scribe v2 de ElevenLabs tiene la tasa de error de palabras más baja, del 2,2 % en junio de 2026, lo que supone menos errores de reconocimiento, menos fallbacks y una clasificación de intenciones más precisa.

Las empresas pueden descubrir que la calidad conversacional también depende del workflow en el que opera un agente de voz. Por ejemplo, en atención al cliente, otra consideración sería la calidad de la transferencia en escalaciones o la resolución de preguntas frecuentes.

Uso de herramientas y finalización de tareas

Mientras que la calidad mide cómo se ha sentido una conversación, la finalización de tareas mide si ha llevado a un resultado satisfactorio. Las empresas deben prestar mucha atención a esta parte del marco de evaluación de agentes de voz, pues está directamente vinculada a los resultados de negocio.

Una medida del uso de herramientas es la precisión de rellenado de campos, que determina hasta qué punto los agentes de IA pueden completar tareas rutinarias, como rellenar un formulario con información de clientes. Una alta precisión demuestra que el agente puede pasar de la conversación a la acción sin perder información por el camino.

La tasa de éxito de tareas (TSR) es una medida porcentual de las tareas de extremo a extremo que un agente ha completado correctamente. La finalización depende de que el agente sea capaz tanto de comprender una solicitud como de utilizar las herramientas conectadas adecuadas (API, bases de datos, generación aumentada por recuperación [RAG] y bases de conocimiento internas) para obtener ayuda.

La fórmula del TSR es:


TSR = (Tareas completadas íntegramente / Total de tareas intentadas) x 100

Los agentes de voz preparados para producción deberían aspirar a un TSR superior al 85 %, supervisando la precisión y fiabilidad de las llamadas a herramientas. Para evitar caídas en tu TSR, asegúrate de realizar pruebas de regresión ante cualquier modificación del prompt o del modelo conectado. Incluso una pequeña desviación podría tener consecuencias importantes para tu TSR.

Inteligencia

La inteligencia engloba el razonamiento y las capacidades avanzadas de un agente de voz. Este pilar marca claramente la diferencia entre una IVR (respuesta de voz interactiva) y un agente de voz con IA.

Las dimensiones clave que debes evaluar aquí incluyen:

  • Riesgo de alucinación: Las alucinaciones, en las que un agente genera información inexacta o incoherente con los documentos de la empresa, son especialmente perjudiciales en la voz con IA, ya que pueden comunicarse con seguridad. Estudios recientes indican que las alucinaciones frecuentes dañan significativamente la satisfacción de los clientes con los agentes de voz.
  • Gestión de solicitudes fuera de alcance: Los agentes inteligentes entienden cuándo una pregunta queda fuera de su ámbito contextual y pueden responder adecuadamente. En vez de alucinar una respuesta, rechazan la solicitud o redirigen la conversación a un terreno contextualizado.
  • Retención de contexto: A lo largo de varios turnos, ¿puede un agente seguir las entidades y los compromisos establecidos anteriormente? Sin esta capacidad, los clientes pueden tener que repetirse o recibir respuestas contradictorias.
  • Razonamiento y lógica de varios pasos: ¿Puede el agente manejar correctamente la lógica condicional o encadenar inferencias a lo largo de varios turnos? Especialmente en casos de uso más técnicos, como servicios financieros, la capacidad de razonar dentro de un contexto predefinido es esencial para el éxito.

Existen varias comparativas de terceros para estas dimensiones y componentes. Por ejemplo, la evaluación holística de modelos de lenguaje (HELM) de Stanford compara el rendimiento de los LLM en distintas categorías. Para las alucinaciones, TruthfulQA ofrece un análisis sólido sobre la frecuencia con la que aparecen respuestas falsas.

Una ventaja de ElevenAgents es que, a diferencia de algunas plataformas de voz que te limitan a un único modelo subyacente, puedes cambiar por completo la capa de LLM. En la práctica, esto significa que puedes conectar el modelo que lidere las comparativas de razonamiento para tu caso de uso específico.

Cumplimiento normativo y seguridad

Las empresas deben implementar barreras de seguridad activas para prevenir resultados perjudiciales o que infrinjan políticas. A diferencia de las instrucciones de prompt a nivel de sistema, que pueden eludirse o anularse, las comprobaciones independientes de barreras de seguridad se ejecutan como una capa separada del propio modelo. Evalúan los resultados antes de que lleguen al usuario y detienen la conversación si se desvía hacia un terreno peligroso.

La auditabilidad es un requisito relacionado: los agentes en producción deben mantener registros detallados de decisiones y resultados en un formato que permita su revisión posterior. Especialmente en sectores muy regulados, demostrar el cumplimiento a posteriori es tan importante como conseguirlo desde el principio.

La normativa concreta que debe cumplir tu empresa variará según el sector. Algunos de los marcos más habituales son:

  • HIPAA: Para datos sanitarios protegidos en contextos de atención médica de Estados Unidos.
  • PCI-DSS: Para cualquier agente que gestione datos de tarjetas de pago.
  • RGPD: Obligaciones de privacidad de datos para la UE y las empresas con clientes en la UE.

Para las empresas que evalúan su postura de cumplimiento normativo, ElevenLabs cuenta con cumplimiento AICPA SOC Tipo II y RGPD, además de haber obtenido la certificación AIUC-1. El AIUC-1 es un estándar de seguridad diseñado específicamente para agentes de IA.

Fiabilidad

La fiabilidad es el último pilar de nuestro marco de evaluación de agentes de voz y cubre si un agente puede ofrecer resultados de forma constante en tiempo real.

Al evaluar un agente de voz, busca las siguientes características:

  • Tiempo de actividad: Cualquier despliegue orientado al cliente requiere un 99,9 % de tiempo de actividad para evitar interrupciones. Especialmente en casos de uso siempre activos, como la atención entrante, un tiempo de actividad fiable es un factor fundamental.
  • Degradación controlada: Dada la complejidad subyacente de los agentes de voz, si un componente empieza a fallar, el agente debe gestionar esa degradación de forma controlada. En la práctica, esto significa derivar a una persona, en lugar de seguir funcionando con mayor carga o devolviendo errores.
  • Rendimiento bajo carga:Las pruebas de carga deberían simular al menos el doble de tu pico de concurrencia previsto antes de lanzar el servicio. Las pruebas bajo una carga intensa pueden detectar aumentos de latencia o degradaciones del rendimiento que solo aparecen a escala.

Incluso un modelo de alta calidad que cumpla todos los demás requisitos puede resultar inutilizable si no escala con la demanda de tus clientes. 1.000.000 de creadores y empresas líderes confían en ElevenAgents, lo que demuestra la capacidad de la plataforma para desplegarse a escala empresarial sin comprometer los estándares de rendimiento.

Cómo medir el MOS en agentes de voz paso a paso

Si tu empresa quiere medir el MOS manualmente, necesitarás un grupo amplio de oyentes humanos y una selección de clips de audio de conversaciones reales. Es un proceso estructurado que implica recopilar opiniones, calcular promedios e interpretar los datos.

Así se mide el MOS de agentes de voz en la práctica:

  1. Prepara tu conjunto de pruebas: Selecciona una muestra representativa de salidas de audio de tu agente, que incluya al menos 100 clips de distintos tipos de conversaciones.
  2. Realiza la sesión de valoración: Pide a tus oyentes humanos que valoren cada clip en una escala del 1 al 5 según la calidad de la experiencia de comunicación.
  3. Agrupa las valoraciones y calcula las puntuaciones: Calcula la media de las valoraciones de cada clip y, después, la media de todos los clips de la muestra para obtener un MOS global. Un MOS de 4,3 o superior indica que tu agente de voz está listo para producción.

Aunque requiere bastante trabajo manual, este proceso te proporcionará un MOS sólido para el agente de voz que hayas elegido. Si quieres realizar la prueba a escala, puedes sustituir a los oyentes humanos por herramientas automatizadas como NISQA, que predicen puntuaciones MOS mediante programación. Puedes integrar estos sistemas en tus pipelines activos para supervisar continuamente el MOS a lo largo del tiempo.

Referencias de pruebas de IA frente a humanos: FCR, AHT y CSAT

Aunque calcular el MOS repetidamente a lo largo del tiempo permite detectar mejoras o regresiones del modelo, puedes aportar más contexto comparándolo con el rendimiento humano. Ver lo que consiguen realmente las personas en funciones similares mostrará si tu agente de voz está rindiendo cerca de un nivel ideal.

Estas son algunas métricas que debes tener en cuenta para las referencias de pruebas de IA frente a humanos.

Referencia de agente humano
Resolución en la primera llamada (FCR)
70 %
Tiempo medio de gestión (AHT)
~6 minutos
Puntuación de satisfacción del cliente (CSAT)
70-85 %
Objetivo de IA
Resolución en la primera llamada (FCR)
75 %
Tiempo medio de gestión (AHT)
2-4 minutos
Puntuación de satisfacción del cliente (CSAT)
85 %

Los agentes de IA deberían ser capaces de igualar el FCR y el CSAT de las personas, al tiempo que mejoran significativamente el AHT. Esta mejora se debe a que los agentes de IA suelen gestionar conversaciones más generales que los agentes humanos. Muchas empresas implementan un workflow en el que los agentes de IA son el primer punto de contacto y solo pasan las llamadas a agentes humanos si son demasiado complejas para resolverlas de forma autónoma.

Los datos de 2025 de Poe, un agregador de comparativas de IA, revelan que ElevenLabs mantuvo la mayor capacidad global para completar solicitudes, al completar el 74,4 % de todas las solicitudes entrantes. Su éxito se ha traducido en un uso que crece rápidamente: Eleven v3 y v2.5-Turbo representan más del 60 % de los mensajes enviados a modelos de IA a lo largo del tiempo.

Mensajes enviados a modelos de IA a lo largo del tiempo: ElevenLabs lidera el marco de evaluación de agentes de voz de Poe

Messages sent to AI models over time, ElevenLabs leading the poe voice agent evaluation framework

Mensajes enviados a modelos de IA a lo largo del tiempo, según la comparativa de Poe

Errores habituales al probar agentes de voz

Al seguir un marco de evaluación de agentes de voz, resulta tentador probar los mejores escenarios posibles. Sin embargo, la experiencia cotidiana de los clientes al interactuar con tus sistemas de voz con IA no se dará en condiciones ideales.

Estos son tres errores habituales al probar agentes de voz y cómo solucionarlos:

  • Probar el camino más fácil: Especialmente al seleccionar clips de audio para el MOS, asegúrate de incluir casos de uso límite. Los clips con ruido de fondo o habla con acento son muy habituales en la vida real, por lo que probar solo archivos de audio «limpios» llevará a calibrar mal el MOS.
  • Priorizar la contención frente a la resolución: Optimizar tus modelos para mantener a usuarios dentro del sistema de tu agente aumenta las tasas de contención sin mejorar los resultados. Si tu FCR es bajo a pesar de tener una tasa de contención alta, el agente está atrapando a usuarios en un bucle frustrante. Establece mecanismos para que puedan hablar con agentes humanos si lo desean.
  • Ignorar los percentiles de latencia: Los SLA suelen definir la latencia según el nivel P95. Aunque esta métrica es importante para ofrecer una experiencia consistente a la mayoría de tus clientes, no olvides que el 5 % restante también son clientes reales. A escala, el 5 % de un sistema que gestiona 10.000 llamadas diarias son aún 500 personas que experimentan una conversación lenta. Centra tu objetivo principal de SLA en P99, no solo en la mediana o P95.

Si tienes en cuenta estos aspectos, podrás establecer referencias justas y representativas en vez de basarte en medias idealizadas.

Por qué las evaluaciones deben adaptarse al caso de uso

Aunque los seis pilares de este marco orientan sobre las áreas que deberías explorar, el peso de cada uno dependerá de tu sector. Por ejemplo, una empresa del sector financiero puede priorizar el cumplimiento normativo y el uso de herramientas, mientras que una marca de consumo se guiaría principalmente por la calidad de voz TTS.

Estos son dos ejemplos de evaluaciones específicas por caso de uso y de cómo pueden cambiar el equilibrio entre los pilares.

Atención al cliente

En ciertos sectores, como los centros de llamadas, otras métricas de finalización de tareas, como la resolución en la primera llamada (FCR), son una parte importante de la conversación. Poder gestionar correctamente una llamada entrante sin intervención humana reduce de forma significativa la demanda sobre los agentes humanos de atención al cliente. McKinsey estima que los centros de llamadas que usan agentes de voz pueden reducir el volumen de interacciones hasta un 50 %.

Aunque no es tan importante como la tasa de éxito de tareas, otra dimensión que debes considerar es la tasa de contención. Esta métrica analiza la duración total de una llamada. Si tu tasa de contención es muy alta pero el FCR es bajo, tus agentes mantienen a las personas en línea sin ofrecer una solución al cliente. En la práctica, esto puede traducirse en una experiencia frustrante de dar vueltas en círculo.

Otras métricas que debes seguir son el AHT; los agentes de IA deben resolver rápidamente los problemas rutinarios. Por ello, el sector de atención al cliente priorizaría la calidad de la conversación, especialmente la gestión de turnos y la tasa de fallback, por encima de otras áreas.

Sanidad

Sanidad es un sector muy regulado, con requisitos estrictos de cumplimiento normativo que hacen que la operación de agentes de voz sea extremadamente delicada. El cumplimiento normativo es una preocupación central, lo que desplaza significativamente el peso del pilar de seguridad hacia este aspecto y la inteligencia por encima de todo.

Chatbots sanitarios deben gestionar la programación de citas, vías de acceso a telemedicina, triaje de síntomas y consultas sobre seguros. Todo ello exige un alto grado de inteligencia y uso de herramientas, lo que vuelve a reflejar que las exigencias propias de un sector o función determinan cuál de los pilares es más importante.

Sea cual sea el sector en el que trabaje tu empresa, comprender los pilares principales de la evaluación de agentes de voz y aplicarlos de forma equilibrada te ayudará a encontrar los mejores agentes para ti.

Crea con ElevenAgents para lograr alto rendimiento y baja latencia

La plataforma que elijas para crear influye directamente en el rendimiento de tus agentes de voz en workflows reales. Especialmente al interactuar con tus clientes, necesitas confiar en que tu agente destacará en todas las categorías.

ElevenAgents está diseñado para despliegues de voz en producción y combina TTS líder del sector mediante Eleven v3, STT en tiempo real mediante Scribe v2 y una capa de orquestación de agentes diseñada para la escala empresarial. Cada componente está creado para rendir según las referencias establecidas en este marco, lo que te permite ofrecer experiencias de alta calidad a tus clientes.

Tanto si estás valorando opciones como si ya quieres empezar a crear, ElevenLabs tiene un camino para ti. Explora la plataforma ElevenAgents para ver cómo se adapta a tu caso de uso, o regístrate y empieza a crear hoy mismo.

Preguntas frecuentes sobre la evaluación de agentes de voz

Artículos relacionados

Crea con el audio IA de la más alta calidad