Ir al contenido

¿Qué es la latencia de la IA conversacional y qué factores influyen en ella?

Escrito por
Jack Limebear
Publicado
Última actualización

EscucharEscucha este artículo

Para IA conversacional, la latencia es lo que separa las buenas aplicaciones de las excelentes.

La IA conversacional es, por naturaleza, aspiracional. Busca reproducir la misma sensación que conversar con una persona, reflejando el mismo abanico emocional, tono y cadencia. Si además añades el retraso que parece «natural» entre el momento en que dejas de hablar y aquel en que un agente de IA empieza a responder, obtienes un objetivo de latencia basado en cómo se comunican realmente las personas. 

Empresas que quieren implementar agentes de IA conversacional a gran escala deben reducir esa latencia tanto como sea posible si quieren lograr esa sensación de naturalidad. Este artículo explica qué es la latencia de la IA conversacional, qué provoca retrasos en toda la canalización y ofrece una visión general de cómo reducirlos. 

Resumen

  • La latencia de la IA conversacional es el retraso total de extremo a extremo desde que un usuario deja de hablar hasta que oye la primera palabra del agente.
  • Los agentes con más de 700 ms pueden parecer poco naturales, y los que superan los 1200 ms registran altas tasas de abandono.
  • La latencia se acumula en cada etapa de la canalización de IA conversacional.
  • ElevenAgents gestiona toda la canalización en una única arquitectura unificada, haciendo que la IA conversacional de baja latencia sea accesible para tu empresa.

¿Qué es la latencia de la IA conversacional?

La latencia de la IA conversacional se refiere al tiempo total que tarda un sistema en responder después de que hayas hablado. En los modelos de IA modernos, la latencia se mide en ms. Entre bastidores, la cifra total de latencia se compone en realidad de varios procesos independientes, cada uno de los cuales aporta una parte de la canalización de extremo a extremo. 

Una canalización de IA conversacional típica es la siguiente:

  1. Un usuario habla
  2. Un modelo de Voz a Texto transcribe el audio
  3. La transcripción se envía a un modelo LLM, que genera una respuesta
  4. El texto del LLM se sintetiza después en audio con un modelo de Texto a Voz
  5. El audio se reproduce para el usuario

Todas y cada una de estas etapas añaden latencia a un sistema de IA conversacional. Por eso, al hablar de latencia, conviene aclarar varios acrónimos.

Latencia de inferencia del modelo

La latencia de inferencia del modelo es el tiempo que un modelo dedica a generar resultados, medido internamente y sin incluir factores externos. Es la medida específica del modelo de la rapidez con la que funciona tu motor con entradas habituales. Por ejemplo, Flash v2.5 tiene una latencia de inferencia de aproximadamente 75 ms. Con esta información, puedes comparar la rapidez de los modelos de distintos competidores.

Aun así, recuerda que esta no es la cifra de latencia que experimenta realmente un usuario. Se refiere específicamente al tiempo total que un modelo dedica a generar resultados.

Tiempo hasta el primer token del LLM

El tiempo hasta el primer token (TTFT) de un modelo de lenguaje grande (LLM) es el tiempo total que tarda un modelo de lenguaje grande en procesar un prompt y generar su primer token de salida utilizable.

La generación de TTS comienza cuando llega el primer token de tu LLM, por lo que esta medida indica cuánto tarda el LLM en empezar a activar tu modelo TTS. En la mayoría de los sistemas de IA conversacional de extremo a extremo, el TTFT del LLM representa una parte significativa de la latencia total. 

Tiempo hasta el primer audio de TTS (TTFA)

El tiempo hasta el primer audio de TTS (TTFA) mide el tiempo desde la primera solicitud de TTS hasta que el primer fragmento de audio sale realmente del modelo. Es una forma de describir la latencia de inferencia del modelo, pero específicamente para motores TTS. 

Tiempo de extremo a extremo hasta el primer audio (TTFA)

El TTFA de extremo a extremo es la latencia total de la IA conversacional. Es la suma de todas las partes de la canalización: reconocimiento de voz, TTFT del LLM, TTS, TTFA y todas las transmisiones de red entre los pasos. Al hablar de la latencia de la IA conversacional en su conjunto, esta es la métrica que percibe el usuario.

Cuando habla, tendrá que esperar al TTFA de extremo a extremo antes de oír cualquier respuesta de tu agente. Es una medida integral, lo que significa que mejorar cualquier parte de la canalización la mejorará. 

Por qué importa la latencia de la IA conversacional

Cuando un usuario habla con tu agente de IA, la latencia se convierte en un factor clave en cómo percibe esa experiencia. Una baja latencia reduce el tiempo que el usuario debe esperar para recibir una respuesta, ayuda a que la conversación parezca natural y hace que tu agente parezca competente. 

Los agentes con alta latencia parecen artificiales y menos competentes, aunque la calidad de sus respuestas sea la misma. Para empresas, incluso una diferencia de solo unos cientos de ms puede parecer una eternidad y hacer que tu agente de atención al cliente parezca lento e ineficaz.

Estos escenarios muestran por qué la latencia de la IA conversacional importa en la práctica:

  • Menos de 500 ms: Un agente conversacional parece ágil y eficiente. Puede que los usuarios no perciban el retraso entre dejar de hablar y recibir la primera respuesta, lo que permite que la conversación fluya sin interrupciones.
  • De 500 ms a 1000 ms: El retraso entre que un usuario deja de hablar y recibe una respuesta puede empezar a notarse. Es apenas demasiado largo, por lo que los usuarios pueden intentar anticiparse repitiéndose o haciendo una pausa para comprobar si el agente les ha entendido realmente.
  • Más de 1000 ms: Los retrasos empiezan a parecer lentos, con pausas que hacen que algunos usuarios sientan que el agente de IA no sigue del todo el ritmo de la conversación. Las transcripciones pueden mostrar interrupciones ocasionales o peticiones de hablar con un agente humano. En algunos casos, los usuarios pueden abandonar la llamada.

Cada uno de estos umbrales se traduce en resultados empresariales reales. 

En el extremo inferior del espectro de latencia, tendrás un agente de atención al cliente que puede responder con naturalidad a las preguntas entrantes y ayudar a los usuarios a resolver sus consultas sin ayuda adicional. Esto reduce la carga de tus agentes humanos y mantiene alta la satisfacción del cliente. En el extremo superior del espectro, frustrarás a tus clientes con un agente que parece dudar durante demasiado tiempo. 

Hemos definido los benchmarks de presupuesto de latencia para agentes de voz en otro artículo para mostrar cómo es una buena latencia tanto en los valores P50 como en los P95. 

¿Qué causa la latencia de la IA conversacional?

La latencia de la IA conversacional es un término que resume varios procesos distintos, y cada segmento contribuye al total. Teniendo esto en cuenta, el obstáculo para lograr baja latencia es más un problema de sistema que algo que se resuelva simplemente eligiendo un modelo mejor. Al fin y al cabo, varios modelos interactúan en la canalización.

Para desarrolladores, hemos escrito una guía técnica detallada sobre optimización de la latencia de los agentes de voz que puedes usar para mejorar cada etapa del tiempo de extremo a extremo hasta el primer audio (TTFA).

Además de la canalización principal, otros factores como la telefonía y las llamadas a funciones también añaden latencia, aunque no formen parte de la infraestructura interna de los modelos. 

A continuación tienes una visión general de todos los factores que contribuyen a la latencia de la IA conversacional. 

Reconocimiento automático de voz

La latencia del reconocimiento de voz no es el tiempo que tarda en generar una transcripción. El proceso de transcripción se ejecuta en segundo plano mientras habla el usuario, por lo que, cuando termina de hablar, el texto ya está prácticamente listo. 

Aquí, la latencia es en realidad el intervalo entre el final del habla y el momento en que la transcripción se finaliza y se pasa a la siguiente etapa. Scribe v2 Realtime reduce este intervalo a aproximadamente 150 ms, transmitiendo continuamente para que el resultado esté listo en el momento en que termina el turno.

Conversational AI latency diagram showing ASR system: user input speech and processing latency by ElevenLabs.

Gestión de turnos y detección de final de intervención 

Un detector de actividad de voz (VAD) se sitúa entre el reconocimiento de voz y el modelo de lenguaje. Su función es decidir cuándo el usuario ha terminado realmente de hablar. 

Para evitar errores, el VAD espera un umbral de silencio sostenido antes de declarar terminado el turno, y esa espera añade latencia antes de que el modelo de lenguaje procese una palabra. Esa pequeña latencia adicional añade tiempo, pero también evita que el sistema empiece a responder mientras el usuario sigue hablando. 

Técnicamente, si todos los demás componentes de la IA conversacional tuvieran una latencia cero, la latencia atribuida a la gestión de turnos sería positiva. Las personas hacen una breve pausa antes de responder al habla. Que una máquina haga una pausa similar aporta realismo a la interacción. Sin embargo, dado que otros componentes de la IA conversacional ya añaden latencia, lo ideal es que sea mínima.

Turn taking diagram showing speech processing flow from Input Speech to LLM with latency and data flow paths.

Procesamiento del modelo de lenguaje

Una vez que la transcripción está lista desde el motor de Voz a Texto (STT), el modelo de lenguaje genera una respuesta. La latencia aquí es el tiempo que tarda en empezar a generar tokens, no en generar la respuesta completa. Esos tokens se transmiten directamente a la etapa de TTS a medida que llegan, por lo que lo más importante es el TTFT. 

Además de la elección del modelo, tanto la longitud del prompt como el tamaño de la base de conocimiento afectan a esta etapa. Cuanto más contexto deba considerar el LLM, más tiempo tardará. Al diseñar estos sistemas a escala, debes encontrar el equilibrio adecuado entre una base de conocimiento útil y un prompt conciso para mantener la rapidez.

Diagram showing speech-to-text-to-speech process with latency and data flow.

Síntesis de voz

La latencia de TTS es el tiempo entre la recepción de los primeros tokens del modelo de lenguaje y el inicio del audio. Como los tokens llegan más rápido de lo que se reproduce el habla humana, el modelo de síntesis nunca espera la respuesta completa. La latencia de TTS es estrictamente el tiempo hasta el primer fragmento de audio. 

Esta etapa solía ser la que más contribuía por sí sola a la latencia de la IA conversacional: los modelos antiguos tardaban entre 2 y 3 segundos en empezar a generar voz. Flash v2.5 de ElevenLabs aborda este problema directamente, ofreciendo síntesis de voz con una latencia de ~75 ms y reduciendo ese cuello de botella de segundos a una fracción de segundo.

Conversational AI latency flowchart showing speech processing: input speech to ASR, VAD, and LLM, then TTS for output speech.

Latencia de red

Enviar datos de una ubicación a otra siempre añade latencia, y la distancia geográfica no hace sino agravar la latencia de red de ida y vuelta. 

Dado que varios componentes trabajan juntos para generar una respuesta de extremo a extremo, puede acumularse una latencia considerable a lo largo de varias conexiones de red. 

Audio-processing workflow diagram showing latency and data flow by ElevenLabs.

Llamadas a funciones

Las llamadas a funciones añaden recorridos de ida y vuelta de la API en la etapa del LLM. Una consulta interna rápida añade decenas de milisegundos, mientras que un procesador de pagos o un sistema de inventario puede añadir segundos. La cantidad de latencia depende por completo del servicio al que se llama, lo que convierte esta etapa en la más difícil de optimizar directamente. 

El patrón más eficaz consiste en indicar al LLM que responda antes de que se complete la llamada a la herramienta. Una frase como «Déjame comprobarlo» mantiene al usuario implicado mientras se resuelve la llamada externa, en lugar de dejar silencio. La respuesta de voz comienza mientras la herramienta se ejecuta en paralelo.

Conversational AI latency flowchart showing speech processing from input to output, highlighting ASR, VAD, TTS, and LLM stages.

Cómo reducir la latencia de la IA conversacional

Reducir la latencia de la IA conversacional exige abordar cada etapa de la canalización según su impacto. Aunque las mejoras individuales que realices sí afectan a la latencia, tendrás que trabajar en toda la canalización de forma integral para lograr el mayor cambio.

Estos principios pueden orientarte para reducir la latencia de la IA conversacional a alto nivel:

  • Selección del modelo TTS: Los modelos TTS optimizados para velocidad, como Flash v2.5, utilizan arquitecturas diferentes a los modelos optimizados para calidad, como Eleven v3. Para agentes de voz en tiempo real, la elección adecuada es el modelo de mayor calidad que cumpla tu objetivo de latencia, que casi siempre será uno optimizado para velocidad.
  • Selección del modelo LLM: Los LLM más pequeños y rápidos suelen ofrecer un tiempo hasta el primer token menor que los modelos más grandes. Elegir el LLM más rápido que siga cumpliendo tu nivel de calidad para la tarea importa tanto como la elección del modelo TTS.
  • Streaming: El TTS con streaming devuelve el audio en fragmentos a medida que avanza la síntesis, de modo que el usuario oye la primera palabra mientras el modelo sigue generando el resto. Este concepto también se aplica a la salida del LLM: iniciar la síntesis de TTS con la primera frase mientras el modelo de lenguaje genera las siguientes puede recuperar latencia de la canalización. 
  • Prompt de sistema: Puedes simplificar los prompts de sistema trasladando las instrucciones a procedimientos o workflows, en lugar de mantenerlas como parte de cada paso de decisión. Así reduces la cantidad de contexto sobre la que el modelo debe razonar en cada turno.
  • Medidas de seguridad: Ejecutar las medidas de seguridad en el modelo de streaming permite que la salida empiece a reproducirse antes de que termine la comprobación, en lugar de bloquear la reproducción hasta que finalice.
  • Ubicación conjunta de modelos: Usar modelos ubicados conjuntamente cuando sea posible, como en la pila de ElevenLabs Agents, mantiene los componentes cerca unos de otros para que la latencia no aumente debido a saltos entre modelos alojados por separado.
  • Geografía: La cercanía entre tus servidores y tus usuarios puede reducir significativamente la latencia, ya que recorta directamente la contribución de la red al TTFA de extremo a extremo. 


Además de estos factores, puedes consultar esta guía técnica para optimizar la latencia para obtener más información. 

Empieza a usar IA conversacional de baja latencia con ElevenAgents

La latencia de la IA conversacional es un aspecto fundamental que debes tener en cuenta al crear e implementar agentes. Con ElevenAgents, la optimización de la latencia está integrada en el proceso. Desde técnicas de solapamiento para recuperar tiempo hasta una baja latencia de inferencia en componentes individuales, ElevenAgents crea pilas de IA conversacional de baja latencia para tu empresa. 

Al final, el objetivo es crear realismo. Un usuario debe sentir la facilidad de hablar con una persona mientras obtiene las ventajas de un programa informático. Al optimizar los subprocesos, esto ya es posible.

Descubre más información sobre ElevenAgents o contacta con ventas para empezar hoy.

Preguntas frecuentes sobre la latencia de la IA conversacional

Artículos relacionados

Crea con el audio IA de la más alta calidad