Olvido contextual
Olvido contextual en modelos de lenguaje grandes — es un fenómeno multifacético en el cual un modelo de lenguaje grande (LLM) pierde, ignora o utiliza de manera ineficaz información previamente proporcionada dentro de una misma interacción[1]. A diferencia de la memoria humana, los LLM no tienen un almacenamiento de estado a largo plazo y se basan únicamente en la ventana de contexto — un volumen limitado de texto (en tokens) que el modelo puede procesar a la vez. Esta ventana actúa como la memoria a corto plazo o de trabajo del modelo[2].
La manifestación más conocida de esta limitación es el problema de «pérdida en el medio» (Lost in the Middle) — la tendencia de los modelos a procesar mejor la información ubicada al principio y al final de un contexto largo, y peor la que se encuentra en el medio[2]. Este fenómeno no es un fallo, sino una propiedad fundamental que se deriva de la arquitectura Transformer y los principios de su entrenamiento.
Dos tipos de olvido: Contextual y Catastrófico
Es importante distinguir entre dos tipos fundamentalmente diferentes de «olvido» en los LLM: intracontextual y catastrófico.
Olvido intracontextual (Pérdida en el medio)
Este tipo de olvido ocurre durante una única sesión de interacción (inferencia) con un modelo ya entrenado. Está relacionado con las limitaciones de la ventana de contexto. Cuando el volumen del diálogo o del documento excede el tamaño de la ventana, el modelo «olvida» los fragmentos más antiguos para dejar espacio a los nuevos. Incluso dentro de la ventana, la información de la parte central del contexto puede ser utilizada de manera menos eficaz. Esta es una limitación de la memoria de trabajo del modelo[3]. En la divulgación, este fenómeno también se conoce como «síndrome de degradación del contexto» (Context Degradation Syndrome, CDS)[1].
Olvido catastrófico (Deriva del modelo)
Este tipo de olvido, también conocido como «deriva del modelo» (model drift), ocurre durante el proceso de ajuste fino (fine-tuning) del modelo con nuevos datos. Cuando un modelo, preentrenado en un vasto corpus de conocimiento general, se ajusta con un conjunto de datos altamente especializado (por ejemplo, textos médicos), sus pesos cambian. Esto puede llevar a la degradación o al «borrado» de conocimientos y habilidades previamente aprendidos que no están relacionados con la nueva tarea[4].
Causas y mecanismos
El olvido contextual es una consecuencia directa de la arquitectura Transformer y la geometría de los espacios vectoriales.
El efecto de «pérdida en el medio» (Lost in the Middle)
Un estudio de la Universidad de Stanford de 2023 titulado «Lost in the Middle» demostró claramente que el rendimiento de los LLM al extraer información de un contexto largo sigue una curva en forma de U[2]. La precisión de las respuestas es más alta cuando la información relevante se encuentra al principio (efecto de primacía) o al final (efecto de recencia) del contexto, y disminuye significativamente si está «oculta» en el medio. Las causas de este fenómeno son:
- Mecanismo de atención: La arquitectura Transformer, por su naturaleza, presta una atención desproporcionada a los tokens iniciales (conocidos como «anclas de atención» o attention sinks) para mantener la coherencia global, así como al contexto local, lo que lleva a un debilitamiento del «enfoque» en la parte central[5].
- Datos de preentrenamiento: Los modelos suelen entrenarse con textos relativamente cortos, donde la información importante rara vez se encuentra a decenas de miles de tokens del inicio, lo que les impide utilizar eficazmente contextos muy largos[6].
Manifestaciones y consecuencias
- Síndrome de degradación del contexto: Durante diálogos largos, el modelo comienza a «perder el hilo de la conversación», repetir respuestas, contradecir hechos establecidos previamente y dar respuestas cada vez más generales y vagas[1].
- Fallos en tareas de varios pasos: En tareas donde las condiciones se especifican a lo largo de varias interacciones, el modelo puede «aferrarse» a una suposición inicial incorrecta e ignorar aclaraciones posteriores, lo que lleva a una incapacidad total para resolver la tarea[7].
- Falta de fiabilidad en el análisis de documentos: Al analizar informes largos o documentos legales, el LLM puede pasar por alto hechos clave ubicados en las secciones centrales, lo que lo convierte en una herramienta poco fiable para tales tareas.
Estrategias de mitigación y prevención
Los investigadores y desarrolladores aplican varios enfoques para abordar el problema del olvido contextual.
Aumento de la ventana de contexto
El enfoque más directo es aumentar el tamaño de la ventana de contexto. Modelos modernos como Claude 3 (200 mil tokens) y Gemini 1.5 Pro (hasta 2 millones de tokens) han ampliado significativamente este límite[8][9]. Sin embargo, las investigaciones muestran que simplemente aumentar la ventana no garantiza su uso eficaz, y el problema de la «pérdida en el medio» persiste[2].
Ingeniería de prompts avanzada
Una estructuración adecuada de los prompts puede mejorar significativamente el rendimiento. La empresa Anthropic sugiere las siguientes prácticas[10]:
- Colocar los documentos al principio: Poner los textos largos al comienzo del prompt, antes de las instrucciones y la pregunta.
- Uso de etiquetas XML: Envolver los documentos en etiquetas `<document>` para una separación clara.
- Justificar las respuestas con citas: Dar al modelo la instrucción de extraer primero las citas relevantes y luego formular la respuesta basándose en ellas.
Externalización de la memoria: Generación aumentada por recuperación (RAG)
Un enfoque fundamentalmente diferente es no colocar toda la información en la ventana de contexto, sino externalizarla a un sistema externo (una base de datos vectorial) y proporcionarla bajo demanda.
- Recuperación (Retrieve): Cuando se recibe una consulta, el sistema busca información relevante en la base de datos externa.
- Aumento (Augment): Los fragmentos encontrados se añaden a la consulta original.
- Generación (Generate): El LLM genera una respuesta basándose en el contexto proporcionado.
RAG permite trabajar con volúmenes de datos prácticamente ilimitados y proporciona acceso a información actualizada y verificada, lo que reduce el riesgo de alucinaciones y es la solución más fiable hasta la fecha[11].
Enlaces externos
- Lost in the Middle: How Language Models Use Long Contexts — investigación original de la Universidad de Stanford.
- Anuncio de Claude con una ventana de contexto de 100K tokens de Anthropic.
Literatura
- Liu, N. F. et al. (2023). Lost in the Middle: How Language Models Use Long Contexts. arXiv:2307.03172.
- An, C. et al. (2024). Why Does the Effective Context Length of LLMs Fall Short?. arXiv:2410.18745.
- Ding, J. et al. (2023). LongNet: Scaling Transformers to 1,000,000,000 Tokens. arXiv:2307.02486.
- Yang, A. et al. (2024). Context Parallelism for Scalable Million-Token Inference. arXiv:2411.01783.
- Chen, S. et al. (2023). Extending Context Window of Large Language Models via Positional Interpolation. arXiv:2306.15595.
- Ding, Y. et al. (2024). LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens. arXiv:2402.13753.
- Li, S. et al. (2023). Functional Interpolation for Relative Positions Improves Long Context Transformers. arXiv:2310.04418.
- Dong, Z. et al. (2024). Exploring Context Window of Large Language Models via Decomposed Positional Vectors. arXiv:2405.18009.
- Laban, P. et al. (2025). LLMs Get Lost in Multi-Turn Conversation. arXiv:2505.06120.
- Li, R. et al. (2024). Extending Context Window in Large Language Models with Segmented Base Adjustment for Rotary Position Embeddings. Applied Sciences, 14(7), 3076. DOI:10.3390/app14073076.
- Yang, A. & Reizenstein, J. (2024). Exploring Context Window of LLMs via Decomposed Positional Vectors (NeurIPS Poster). NeurIPS 2024.
Referencias
- ↑ 1.0 1.1 1.2 Howard, James. «Context Degradation Syndrome: When Large Language Models Lose the Plot». jameshoward.us. [1]
- ↑ 2.0 2.1 2.2 2.3 Liu, Nelson F.; et al. «Lost in the Middle: How Language Models Use Long Contexts». arXiv. [2]
- ↑ Liu, Nelson F.; et al. «Lost in the Middle: How Language Models Use Long Contexts». ACL Anthology. [3]
- ↑ Greyling, Cobus. «Catastrophic Forgetting In LLMs». Medium. [4]
- ↑ «Exploring Context Window of Large Language Models via Decomposed Positional Vectors». NeurIPS Proceedings. [5]
- ↑ An, Chenxin; et al. «Why Does the Effective Context Length of LLMs Fall Short?». arXiv. [6]
- ↑ «LLMs Get Lost In Multi-Turn Conversation». arXiv. [7]
- ↑ «Introducing the next generation of Claude». Anthropic. [8]
- ↑ «Google's Gemini 1.5 Pro - Revolutionizing AI with a 1M Token Context Window». Medium. [9]
- ↑ «Long context prompting tips». Anthropic Documentation. [10]
- ↑ «What is Retrieval-Augmented Generation (RAG)?». Google Cloud. [11]