Ir al contenido

¿Qué es RAG? Cómo funciona la generación aumentada por recuperación

Escrito por
Jack Limebear
Publicado
Última actualización

EscucharEscucha este artículo

Los modelos de IA generan respuestas a partir de lo que aprendieron durante el entrenamiento, lo que significa que no conocen automáticamente las políticas, productos u otra información de una empresa creada después de ese entrenamiento. RAG (generación aumentada por recuperación) resuelve esto recuperando información externa relevante y proporcionándosela al modelo antes de que responda.

RAG basa las respuestas que da una IA en los documentos reales de una empresa. Un agente de atención al cliente que utiliza RAG puede consultar la política de devoluciones actual o las especificaciones de un producto antes de responder, lo que reduce el riesgo de alucinaciones.

Esta guía explica qué significa RAG en IA, cómo trabajan juntas la recuperación y la generación, y en qué se diferencia RAG de un LLM por sí solo. También abordaremos las limitaciones de RAG, dónde funciona bien en aplicaciones de IA generativa y cómo RAG facilita la recuperación de conocimiento en agentes de IA.

ElevenLabs Conversational AI demo introducing Retrieval-Augmented Generation (RAG).

Resumen

  • RAG combina un sistema de recuperación con un modelo generativo para que el modelo pueda utilizar información más allá de sus datos de entrenamiento.
  • El conocimiento que recupera RAG está fuera del modelo, por lo que puede actualizarse sin tener que reentrenar nada.
  • ElevenAgents utiliza RAG automáticamente cuando una base de conocimiento es demasiado grande para caber directamente en el contexto del modelo, de modo que las respuestas siguen siendo rápidas sin perder precisión en bases de conocimiento grandes y complejas.

¿Qué es RAG en IA?

RAG es una arquitectura de sistema construida en torno a un LLM para proporcionarle información externa, como directrices de marca, manuales de producto, artículos de la base de conocimiento o bases de datos internas. Esto permite que la IA trabaje con información específica de la empresa, de modo que sus respuestas reflejen políticas actuales, conocimiento privado y detalles de la empresa para los que el modelo nunca fue entrenado.

Un LLM también solo puede considerar una cantidad limitada de información a la vez, lo que se conoce como ventana de contexto. Una base de conocimiento de una organización grande puede superar rápidamente ese límite, por lo que RAG mantiene la información fuera del LLM y recupera solo los fragmentos necesarios para la pregunta actual.

El nombre describe cómo se mueve la información por el sistema:

  • Recuperación: Busca en fuentes conectadas, como documentos de políticas, registros del servicio de asistencia o archivos de inventario, contenido que coincida con la solicitud del usuario.
  • Aumentada: Añade los fragmentos recuperados más relevantes al contexto del prompt.
  • Generación: Utiliza la solicitud del usuario y el contexto recuperado para elaborar la respuesta.

RAG también facilita la fundamentación, la práctica de vincular una respuesta de IA a información específica de las fuentes, proporcionando al LLM material relevante para usar al generar una respuesta. Por ejemplo, si un cliente pregunta por una política de garantía, el sistema RAG recupera las condiciones pertinentes de la documentación de la empresa y se las proporciona al LLM para que responda basándose en ellas.

RAG retrieves relevant sources, augments prompts with context, and generates answers.

¿Cómo funciona la generación aumentada por recuperación?

Un sistema RAG prepara conocimiento externo para su búsqueda, recupera la información más relevante para la pregunta de un usuario y se la proporciona al LLM como contexto antes de generar una respuesta.

Las implementaciones de RAG varían en complejidad. El RAG básico utiliza un proceso directo de recuperación y generación, mientras que los enfoques más avanzados pueden añadir reformulación de consultas, filtrado, reclasificación u otras técnicas de recuperación.

El proceso RAG suele seguir cinco pasos:

  1. Preparar el conocimiento: Los documentos se dividen en fragmentos más pequeños (un proceso llamado «chunking»), se convierten en representaciones matemáticas denominadas embeddings y se almacenan en un índice con capacidad de búsqueda o una base de datos vectorial.

  2. Procesar la consulta: El sistema interpreta la pregunta del usuario y, en sistemas RAG más avanzados, la reescribe o la perfecciona antes de buscar.

  3. Recuperar fragmentos relevantes: El recuperador busca en la base de conocimiento indexada los fragmentos de texto que mejor coinciden con la solicitud.

  4. Añadir contexto a la solicitud del modelo: Los fragmentos seleccionados se envían al LLM junto con la pregunta del usuario, instrucciones relevantes y el historial de conversación.

  5. Generar la respuesta: El LLM genera una respuesta utilizando el material recuperado como parte de su contexto.

Muchos sistemas RAG activan la recuperación de forma selectiva como una herramienta externa. ElevenAgents permite a los equipos activar RAG para una base de conocimiento directamente en los ajustes del agente, y el sistema utiliza la reformulación de consultas para convertir diálogos previos y referencias imprecisas en una consulta de búsqueda precisa y autónoma durante seguimientos conversacionales.

Para garantizar respuestas a tiempo, ElevenLabs también desarrolló una arquitectura de competición de modelos que envía cada consulta a varios modelos de reformulación en paralelo y utiliza la primera respuesta válida. Este enfoque redujo a la mitad la latencia mediana de RAG, de 326 ms a 155 ms, manteniendo la recuperación lo bastante rápida como para conservar un flujo de conversación natural incluso cuando se activa con una base de conocimiento grande.

Five-step RAG workflow; model racing cuts median latency from 326 ms to 155 ms.

¿Cuál es la diferencia entre los LLM y los modelos RAG?

Un LLM es un modelo que entiende y genera lenguaje. RAG es una arquitectura en torno al LLM que recupera información externa cuando la aplicación la necesita.

Esto es lo que cambia cuando un LLM se combina con RAG:

Característica

LLM por sí solo

LLM utilizado con RAG

Conocimiento

Datos de entrenamiento y contexto actual

Datos de entrenamiento, contexto actual e información recuperada de la empresa, como políticas, documentación de producto o contenido de la base de conocimiento

Actualizaciones

La nueva información debe proporcionarse en el contexto o mediante actualizaciones del modelo

El conocimiento externo puede actualizarse por separado del modelo

Información privada

No disponible, salvo que se proporcione

Puede recuperar información de fuentes privadas autorizadas

Recuperación

No forma parte del modelo base

La añade el sistema RAG que lo rodea

«Modelo RAG» se utiliza a veces como abreviatura de un LLM empleado dentro de un sistema RAG. Por ejemplo, una empresa podría decir que utiliza un «modelo RAG» para atención al cliente cuando la configuración real es un LLM que recupera contenido relevante del centro de ayuda o de políticas antes de generar una respuesta.

LLM alone vs. RAG: retrieval adds private company information without changing model weights.

Limitaciones de los modelos RAG en aplicaciones reales

RAG mejora el acceso a conocimiento empresarial relevante almacenado fuera del LLM, pero la recuperación introduce sus propias limitaciones y no garantiza una respuesta correcta. Las principales limitaciones aparecen en lo que recupera el sistema, lo que envía al modelo y cómo responde el modelo:

  • Calidad de la recuperación: Si el sistema no encuentra el fragmento más relevante, el LLM parte de un contexto incompleto o poco sólido. Las consultas mal formuladas, las coincidencias semánticas débiles o una redacción ambigua pueden desviar la recuperación.
  • Calidad de las fuentes: Los documentos desactualizados, contradictorios o incompletos pueden dar lugar a respuestas poco fiables.
  • Selección del contexto: Un chunking deficiente o malas decisiones de recuperación pueden eliminar detalles necesarios o introducir información no relacionada.
  • Latencia añadida: La recuperación y el procesamiento de consultas se producen antes de la generación, lo que puede ralentizar las respuestas en aplicaciones en tiempo real.
  • Errores de generación: El LLM todavía puede interpretar incorrectamente la información recuperada o introducir afirmaciones sin respaldo.

Aunque RAG puede reducir el riesgo de alucinaciones, no lo elimina por completo. Los resultados precisos siguen dependiendo de fuentes bien mantenidas, una recuperación eficaz y controles sobre la respuesta final.

Slide lists five RAG limitations and says it reduces, but does not eliminate, hallucinations.

RAG en IA generativa: casos de uso prácticos y ventajas

RAG resulta especialmente útil cuando una aplicación de IA necesita información que cambia con frecuencia, pertenece a la organización o es demasiado extensa para incluirla en cada solicitud al modelo.

Estos son los ámbitos en los que RAG marca una mayor diferencia:

Mantenerse al día con información que se actualiza con frecuencia

RAG ayuda a los equipos a mantener las respuestas de IA alineadas con los detalles actuales de productos, precios, políticas e inventario. Los equipos pueden actualizar la información de origen de forma independiente, y RAG recupera la versión relevante cuando se formula una pregunta. Por ejemplo, un agente de cualificación de leads puede consultar los precios o detalles de planes más recientes al cualificar a una persona que llama.

Utilizar conocimiento privado o especializado

Parte del conocimiento es privado o especializado, en lugar de público, como las políticas internas, la documentación técnica o el contenido de soporte destinado a un equipo concreto. RAG permite a un agente recuperar información directamente de estas fuentes, en vez de depender solo de lo que está disponible públicamente o integrado en el modelo.

Por ejemplo, un agente interno de asistencia de TI o RR. HH. puede recuperar información de una base de conocimiento específica de RR. HH. para responder preguntas sobre beneficios para empleados, en lugar de buscar documentación pública que no tendría esa información.

Buscar en grandes bases de conocimiento

RAG ayuda cuando una empresa tiene mucha más documentación de la que un LLM puede considerar en una sola solicitud. Recupera solo los fragmentos relevantes para la pregunta actual, en lugar de enviar toda la colección al modelo. En un contexto de ventas, un asistente técnico puede buscar en manuales de producto para encontrar requisitos relevantes durante una llamada.

Empieza con ElevenAgents para disfrutar de soluciones RAG avanzadas

ElevenAgents ofrece a los equipos una forma de crear agentes de voz IA y chat que utilizan RAG con fuentes de conocimiento conectadas, ya sea a través de la plataforma web sin código o de la API para equipos que quieran integrar agentes directamente en sus propios productos.

Para agentes con RAG, los equipos pueden añadir documentos, URL o texto a una base de conocimiento y recuperar solo la información relevante para cada consulta.

ElevenLabs también ha optimizado la recuperación para conversaciones en tiempo real, reduciendo la latencia mediana de RAG de 326 ms a 155 ms en su arquitectura de ElevenAgents. Los equipos que crean con ElevenAgents disponen de estas capacidades de recuperación desde el principio, tanto si configuran un agente desde el panel de control como si desarrollan sobre él mediante API.

Empieza a crear con ElevenAgents o contacta con nuestro equipo para hablar de la configuración adecuada para tu aplicación.

Preguntas frecuentes sobre RAG

Artículos relacionados

Crea con el audio IA de la más alta calidad