Ir al contenido

¿Qué es una ventana de contexto? Lo que todo usuario de un LLM debería saber

Escrito por
Jack Limebear
Publicado
Última actualización

EscucharEscucha este artículo

Una ventana de contexto es la cantidad de información que un modelo de lenguaje extenso (LLM) puede procesar en una sola solicitud. Se mide en tokens y puede incluir tu prompt, el historial de conversación, instrucciones del sistema, documentos recuperados, resultados de herramientas y la respuesta generada por el modelo.

Una ventana de contexto más amplia permite a un modelo trabajar con más información en una sola solicitud. Por ejemplo, un agente de programación que investiga un error podría trabajar al mismo tiempo con archivos de código fuente relevantes, documentación, resultados de pruebas y cambios recientes en el código, en vez de analizar cada elemento por separado y perder contexto útil entre solicitudes.

Sin embargo, una ventana de contexto más amplia no equivale a una memoria perfecta. Los prompts más largos requieren más cálculo, consumen más tokens y pueden dificultar que un modelo identifique qué detalles importan realmente. Investigaciones sobre modelos de contexto largo, incluido el estudio Lost in the Middle y el benchmark RULER de NVIDIA, han constatado repetidamente que los modelos aprovechan menos de la información disponible a medida que crece el contexto, especialmente cuando la información relevante queda oculta entre contenido menos útil.

En este artículo explicamos cómo funcionan las ventanas de contexto, cómo se miden, qué ocurre cuando se llenan y cómo pueden gestionarlas eficazmente desarrolladores.

what is a context window by the numbers

Resumen

  • Una ventana de contexto es el presupuesto total de tokens del que dispone un LLM para una sola solicitud. Incluye el prompt del usuario, el historial de conversación, el contenido recuperado y la salida.
  • Las ventanas de contexto más amplias permiten procesar documentos, bases de código y conversaciones más largos, pero no garantizan que el modelo aproveche bien todas sus partes.
  • Los modelos recuperan información de forma menos fiable en el centro de prompts largos, un patrón documentado en el estudio Lost in the Middle y el benchmark RULER.
  • Una gestión eficaz del contexto (recuperación, resumen y caché) suele ser mejor que limitarse a maximizar la cantidad de tokens enviados.
  • La mejor estrategia de contexto es la que se ajusta a tu carga de trabajo real, no la que utiliza la ventana de contexto anunciada más grande.

¿Qué es una ventana de contexto en un modelo de IA?

Una ventana de contexto es el espacio de trabajo activo de un modelo, donde se reúne todo lo relevante para la solicitud actual antes de que el modelo genere una respuesta.

Imagina un agente de IA que resume una conversación de atención al cliente y recomienda una solución. Para hacerlo bien, el modelo debe procesar:

Todo ello compite por espacio dentro de la misma ventana de contexto, independientemente de su tamaño.

Las ventanas de contexto no incluyen datos de entrenamiento. El entrenamiento incorpora información de forma permanente en los parámetros de un modelo y determina lo que «sabe» en términos generales. Sin embargo, una ventana de contexto solo contiene la información proporcionada para la tarea actual.

Esta distinción importa en la práctica: si una aplicación necesita que un modelo razone sobre una política, un registro de cliente o un documento técnico concretos, esa información no estará disponible solo porque el modelo se haya entrenado con material similar. Por lo general, debe incorporarse directamente al contexto de trabajo del modelo mediante el prompt o un sistema de recuperación o herramientas; de lo contrario, el modelo razonará a partir de conocimientos generales y no del documento real que tiene delante.

Diagram shows six inputs sharing one context window; supplied content isn’t training data.

Tokenización y ventanas de contexto: cómo se procesan los datos

Antes de que un LLM procese texto, un tokenizador lo divide en unidades más pequeñas llamadas tokens. Un token puede representar una palabra completa, parte de una palabra, un signo de puntuación u otro fragmento breve de texto.

Para el inglés, una referencia útil es que un token representa aproximadamente cuatro caracteres o unas tres cuartas partes de una palabra. Según esta estimación, 100 tokens equivalen aproximadamente a 75 palabras. Sin embargo, es solo una aproximación. Considera la frase «Las ventanas de contexto afectan al rendimiento de la aplicación». Un tokenizador no la representa necesariamente como cinco palabras completas; según el tokenizador, una o varias palabras pueden dividirse en varios subtokens.

La tokenización también varía significativamente entre idiomas. Dos frases con significados y longitudes visibles similares pueden consumir cantidades muy diferentes de tokens según el idioma y el tokenizador. La investigación sobre equidad en tokenizadores ha descubierto que algunos pares de idiomas difieren hasta 15 veces en longitud tokenizada para un texto equivalente, incluso con tokenizadores diseñados para ofrecer compatibilidad multilingüe. Desarrolladores que crean aplicaciones multilingües deberían medir el uso de tokens con el tokenizador real de su modelo en lugar de estimarlo a partir del número de palabras.

Una ventana de contexto de 200.000 tokens puede parecer enorme, pero una aplicación que añade continuamente historial de conversación, documentación recuperada, respuestas de herramientas e instrucciones del sistema puede acercarse a ese límite antes de lo esperado. Por este motivo, las aplicaciones en producción suelen supervisar el uso de tokens y emplear técnicas como resúmenes, poda del historial, filtrado de recuperación y compresión de prompts para mantener la información más relevante dentro del contexto activo.

¿Cómo funciona una ventana de contexto en los modelos de lenguaje?

Una ventana de contexto funciona mediante el mecanismo de atención de la arquitectura transformer, que calcula cómo se relaciona cada token de una entrada con todos los demás antes de que el modelo genere una respuesta.

Tomemos la frase «El cliente devolvió el portátil porque dejó de cargar». Para interpretarla correctamente, el modelo debe determinar cómo se relacionan cliente, portátil, devolvió y cargar entre sí. A medida que una secuencia se alarga, el número de estas relaciones crece rápidamente.

En la autoatención estándar, el cálculo necesario crece aproximadamente con el cuadrado de la longitud de la secuencia. Por ejemplo, un prompt de 10.000 tokens requiere unos 100 millones de comparaciones por pares, mientras que uno de 100.000 tokens requiere unos 10.000 millones. Los modelos modernos utilizan diversas optimizaciones arquitectónicas y de infraestructura para reducir este coste en la práctica, pero el problema de escalabilidad subyacente no desaparece.

Las conversaciones largas añaden una segunda limitación: la caché de clave-valor, o KV. Durante la generación, los modelos conservan representaciones intermedias de tokens anteriores en lugar de recalcularlas para cada token nuevo, lo que acelera considerablemente la inferencia. Sin embargo, la propia caché ocupa memoria y crece a medida que la secuencia se alarga.

Context windows face quadratic attention costs, while KV-cache memory grows with sequence length.

Longitud máxima de contexto en modelos de IA y por qué importa

La longitud máxima de contexto de un modelo define cuánta información puede aceptar y procesar en una sola solicitud. Sin embargo, que el modelo aproveche eficazmente una ventana de contexto amplia es otra cuestión.

Las ventanas de contexto más largas permiten casos de uso que eran difíciles o poco prácticos con LLM anteriores. Desarrolladores pueden proporcionar a un modelo un repositorio de código completo, un documento legal extenso, un artículo de investigación, la transcripción de una reunión o un historial de conversación considerable sin tener que reducir primero el material a unos pocos miles de tokens.

Esto importa porque conservar más contexto original puede mejorar la capacidad del modelo para responder preguntas con precisión, identificar relaciones entre fragmentos de información distantes y realizar tareas que dependen del documento en su conjunto. Por ejemplo, un asistente de programación puede necesitar examinar varios archivos para entender cómo se llama a una función, mientras que un asistente de documentos legales puede necesitar comparar definiciones de una sección con obligaciones descritas mucho más adelante en el documento.

Sin embargo, una ventana de contexto más amplia no produce automáticamente mejores resultados. Las entradas muy largas pueden aumentar el coste y la latencia, y los modelos pueden prestar menos atención a la información oculta en el centro de un contexto grande. Por tanto, desarrolladores deberían incluir información relevante de forma selectiva, organizar con claridad las entradas largas y utilizar técnicas como la recuperación, el resumen y la poda del contexto cuando sea apropiado.

Comparación del tamaño de las ventanas de contexto por modelo

Las ventanas de contexto varían enormemente entre las principales familias de modelos actuales, desde unos cientos de miles de tokens hasta 10 millones. Así se comparan los modelos insignia actuales:

Modelo

Ventana de contexto

Notas

Llama 4 Scout

10 millones de tokens

Modelo de Meta con pesos abiertos; la ventana más grande disponible públicamente en el momento de escribir este artículo

GPT-5.6 Sol

1,05 millones de tokens

Modelo insignia actual de OpenAI para programación y razonamiento agéntico

Gemini 3.1 Pro

1 millón de tokens

Modelo actual de Google de nivel Pro para análisis de documentos extensos y múltiples archivos

Claude Sonnet 5

1 millón de tokens

Modelo actual de Anthropic de nivel Sonnet; la ventana se aplica de forma predeterminada en toda la API de Claude

Los límites anunciados cambian rápidamente a medida que los proveedores lanzan nuevos modelos y elevan sus máximos, así que considera cualquier tabla como esta una instantánea y no una clasificación permanente. El tamaño del contexto es solo uno de los factores para elegir un modelo. Por sí solo no dice nada sobre la calidad del razonamiento, los límites de salida, la latencia ni el coste.

Implicaciones de una ventana de contexto pequeña frente a una grande

Una ventana de contexto pequeña obliga a desarrolladores a ser selectivos. Los documentos largos se dividen en fragmentos, el historial de conversación más antiguo se resume y el conocimiento externo se recupera solo cuando realmente se necesita.

Una ventana de contexto grande elimina algunas de esas limitaciones. Puedes proporcionar más ejemplos, conservar más historial de conversación o analizar un conjunto mayor de documentos sin tener que dividirlo todo primero.

Sin embargo, una ventana más amplia introduce un problema distinto: la dilución de la atención. Cuando un prompt contiene mucha información, el modelo puede tener dificultades para identificar qué detalles son más relevantes para la solicitud actual. Las instrucciones o pruebas importantes pueden quedar ocultas entre contenido menos relevante, lo que aumenta el riesgo de respuestas incompletas, incoherentes o menos precisas.

Por qué los modelos se pierden en el medio

Los modelos tienden a recuperar mejor la información cuando está cerca del principio o del final de un prompt largo, y peor cuando queda oculta en el medio. El influyente estudio Lost in the Middle lo probó directamente colocando la respuesta a una pregunta en distintas posiciones dentro de un prompt largo y midiendo con qué frecuencia los modelos la encontraban. La precisión fue siempre mayor al principio y al final del contexto, y menor en el medio.

Esto significa que un modelo puede aceptar técnicamente un documento sin utilizar de forma fiable todas sus partes. Envía a un LLM 100 documentos de soporte porque uno contiene la respuesta a la pregunta de un cliente, y una ventana de contexto más grande puede permitir que quepan los 100. Pero el modelo sigue teniendo que identificar un pasaje relevante entre 99 irrelevantes, y una ventana más larga no garantiza que lo consiga.

Por tanto, conviene distinguir entre la ventana de contexto anunciada de un modelo y su ventana de contexto efectiva para una carga de trabajo determinada. Benchmarks como RULER y LongBench tratan de medir esa diferencia. RULER descubrió que los modelos que obtenían resultados casi perfectos en pruebas de recuperación simples seguían degradándose a medida que aumentaban la longitud del contexto y la complejidad de la tarea. LongBench evalúa tareas más amplias, como preguntas y respuestas sobre documentos, razonamiento sobre múltiples documentos, resumen, aprendizaje few-shot y completado de código.

El contexto largo sigue aportando valor real. La capacidad y la comprensión son propiedades distintas, y ambas importan al elegir un modelo para una tarea concreta.

Retrieval accuracy is high at the prompt’s start and end but drops sharply in the middle.

Gestión de los límites de contexto: buenas prácticas para desarrolladores

Una buena gestión del contexto consiste en controlar qué llega al modelo: proporcionar la información relevante para la tarea cuando es relevante, en lugar de intentar maximizar el número de tokens en cada solicitud. Las siguientes prácticas pueden ayudar a desarrolladores a reducir el contexto innecesario, mejorar la calidad de las respuestas y controlar el coste y la latencia.

1. Recupera información relevante en lugar de cargarlo todo

La generación aumentada por recuperación, o RAG, permite a una aplicación buscar en una base de conocimiento externa e insertar solo los pasajes relevantes en el contexto del modelo. En lugar de incluir un manual completo de 500 páginas en cada solicitud de soporte, la aplicación recupera los pocos pasajes más cercanos a la pregunta real del cliente.

Esto reduce el uso de tokens y ofrece al modelo una señal mucho más clara sobre lo que importa. La calidad de la recuperación sigue siendo importante: los sistemas RAG en producción suelen mejorar los resultados fragmentando cuidadosamente los documentos, recuperando varios pasajes candidatos, reordenándolos y filtrando todo lo irrelevante antes de crear el prompt final. Por ejemplo, ElevenLabs rediseñó su pipeline de RAG para añadir reescritura de consultas y llamadas paralelas al modelo, reduciendo a la mitad la latencia mediana de recuperación.

2. Gestiona deliberadamente el historial de conversación

Las aplicaciones conversacionales acumulan contexto rápidamente. Añadir indefinidamente todos los mensajes anteriores desperdicia tokens y puede incorporar detalles irrelevantes en turnos posteriores.

Las aplicaciones lo gestionan conservando los turnos más recientes, resumiendo intercambios anteriores, extrayendo hechos duraderos a memoria estructurada y recuperando detalles antiguos solo cuando vuelven a ser relevantes. Esto crea una división útil entre el contexto conversacional a corto plazo, que el modelo necesita de inmediato, y la memoria de la aplicación a largo plazo, que puede recuperarse más adelante.

3. Usa caché cuando el contexto se repite

Muchas aplicaciones envían repetidamente las mismas instrucciones extensas o responden a preguntas semánticamente parecidas a otras que ya han gestionado. La caché reduce esa sobrecarga.

El almacenamiento en caché de prompts o contexto permite reutilizar las entradas repetidas de forma más eficiente, y el almacenamiento en caché semántico va un paso más allá al reconocer cuándo una pregunta nueva significa aproximadamente lo mismo que otra que el sistema ya ha respondido. «¿Cuál es vuestra política de devoluciones?» y «¿Cuánto tiempo tengo para devolver un artículo?» son cadenas distintas que una caché semántica puede tratar como la misma pregunta, evitando una llamada de generación completa y reduciendo tanto la latencia como el coste de tokens.

4. Mide el rendimiento con longitudes de contexto realistas

No elijas una estrategia de contexto basándote solo en el límite de tokens anunciado por un proveedor de modelos. Prueba cargas de trabajo representativas de producción y mide la calidad de las respuestas, la precisión de recuperación, la latencia, el uso de tokens, el coste y las tasas de fallo a medida que aumenta la longitud del contexto.

Compara estrategias como proporcionar más contexto, recuperar menos pasajes, resumir el historial de conversación o combinar la recuperación con el resumen. Un modelo con una ventana de contexto de un millón de tokens puede ser compatible técnicamente con tu aplicación, mientras que un prompt más pequeño y cuidadosamente recuperado ofrece resultados más rápidos y precisos a menor coste.

Four ways to manage context limits: retrieve, summarize, cache, and measure; relevance matters.

Empieza con ElevenAgents para crear soluciones lingüísticas escalables

La gestión del contexto importa especialmente en agentes conversacionales, que deben combinar la intervención actual con turnos anteriores, instrucciones de negocio, información de clientes, contenido de bases de conocimiento y resultados de herramientas, mientras responden con la rapidez suficiente para que la conversación resulte natural.

ElevenAgents reúne todos estos elementos en una plataforma para crear e implementar agentes de voz IA. Su motor de orquestación coordina el reconocimiento de voz, un LLM y Texto a Voz, mientras desarrolladores configuran prompts, bases de conocimiento, herramientas, workflows y el modelo de lenguaje subyacente. La entonación expresiva, incluida la forma en que un agente transmite contexto emocional en el habla, depende del mismo contexto que determina lo que dice el agente.

Para la gestión del conocimiento específicamente, ElevenAgents admite tanto documentos de contexto completo como RAG, configurable directamente en la plataforma. Los documentos pequeños se incorporan directamente al prompt de un agente, de modo que su contenido sigue disponible durante toda la conversación. En cambio, las bases de conocimiento más grandes se indexan, y RAG recupera los pasajes relevantes para cada consulta en vez de cargarlo todo de una vez en la ventana de contexto.

Empieza hoy registrándote en ElevenAgents o habla con nuestro equipo para conocer tus opciones de implementación.

Crea con ElevenAgents hoy

¿Buscas otra cosa? Visita nuestro Centro de ayuda

Preguntas frecuentes sobre las ventanas de contexto

Artículos relacionados

Crea con el audio IA de la más alta calidad