---
title: "Esquecimento Contextual"
source: "https://systems-analysis.info/int/Esquecimento_Contextual"
wiki: "systems-analysis.info/int"
article: "Esquecimento_Contextual"
language: "pt"
categories:
  - "Category:Large language models"
  - "Category:Machine learning"
  - "Category:Portuguese"
revision_id: 2034
wiki_created_at: 2026-09-06T22:57:39Z
wiki_modified_at: 2026-09-06T22:57:39Z
downloaded_at: 2026-09-07T22:49:01Z
---

# Esquecimento Contextual

**Esquecimento contextual em modelos de linguagem grandes** — é um fenômeno multifacetado no qual um modelo de linguagem grande (LLM) perde, ignora ou utiliza de forma ineficaz informações fornecidas anteriormente no âmbito de uma única interação<sup>[\[1\]](https://systems-analysis.info/int/Esquecimento_Contextual#cite_note-howard-cds-1)</sup>. Diferentemente da memória humana, os LLMs não possuem um armazenamento de estado de longo prazo e dependem apenas da **janela de contexto** — um volume limitado de texto (em tokens) que o modelo pode processar de uma só vez. Essa janela atua como a memória de curto prazo ou de trabalho do modelo<sup>[\[2\]](https://systems-analysis.info/int/Esquecimento_Contextual#cite_note-liu2023-lost-in-middle-2)</sup>.

A manifestação mais conhecida dessa limitação é o problema de **"perda no meio" (Lost in the Middle)** — a tendência dos modelos de processar melhor as informações localizadas no início e no final de um contexto longo, e pior as que estão no meio<sup>[\[2\]](https://systems-analysis.info/int/Esquecimento_Contextual#cite_note-liu2023-lost-in-middle-2)</sup>. Esse fenômeno não é uma falha, mas uma propriedade fundamental decorrente da arquitetura dos transformadores e dos princípios de seu treinamento.

## Dois tipos de esquecimento: Contextual e Catastrófico

É importante distinguir dois tipos fundamentalmente diferentes de "esquecimento" em LLMs: intracontexto e catastrófico.

### Esquecimento intracontexto (Perda no meio)

Este tipo de esquecimento ocorre **durante uma única sessão de interação** (inferência) com um modelo já treinado. Está relacionado às limitações da **janela de contexto**. Quando o volume do diálogo ou do documento excede o tamanho da janela, o modelo "esquece" os fragmentos mais antigos para dar lugar aos novos. Mesmo dentro da janela, as informações do meio do contexto podem ser usadas de forma menos eficaz. Essa é uma limitação da memória de trabalho do modelo<sup>[\[3\]](https://systems-analysis.info/int/Esquecimento_Contextual#cite_note-aclanthology-lost-in-middle-3)</sup>. Na literatura não especializada, esse fenômeno também é chamado de **"síndrome de degradação de contexto"** (Context Degradation Syndrome, CDS)<sup>[\[1\]](https://systems-analysis.info/int/Esquecimento_Contextual#cite_note-howard-cds-1)</sup>.

### Esquecimento catastrófico (Desvio do modelo)

Este tipo de esquecimento, também conhecido como "desvio do modelo" (*model drift*), ocorre **durante o processo de ajuste fino (fine-tuning)** do modelo em novos dados. Quando um modelo, pré-treinado em um vasto corpus de conhecimento geral, é ajustado em um conjunto de dados altamente especializado (por exemplo, textos médicos), seus pesos são alterados. Isso pode levar à degradação ou "apagamento" de conhecimentos e habilidades previamente aprendidos que não estão relacionados à nova tarefa<sup>[\[4\]](https://systems-analysis.info/int/Esquecimento_Contextual#cite_note-greyling-catastrophic-4)</sup>.

## Causas e mecanismos

O esquecimento contextual é uma consequência direta da arquitetura dos transformadores e da geometria dos espaços vetoriais.

### Efeito de "Perda no Meio" (Lost in the Middle)

Uma pesquisa da Universidade de Stanford de 2023, intitulada "Lost in the Middle", demonstrou claramente que o desempenho dos LLMs na extração de informações de um contexto longo segue uma **curva em forma de U**<sup>[\[2\]](https://systems-analysis.info/int/Esquecimento_Contextual#cite_note-liu2023-lost-in-middle-2)</sup>. A precisão das respostas é mais alta quando a informação relevante está no início (**efeito de primazia**) ou no final (**efeito de recência**) do contexto, e diminui significativamente se estiver "escondida" no meio. As causas desse fenômeno são:

- **Mecanismo de atenção**: A arquitetura Transformer, por sua natureza, dedica uma atenção desproporcional aos tokens iniciais (as chamadas "âncoras de atenção" ou *attention sinks*) para manter a coerência global, bem como ao contexto local, o que leva a um enfraquecimento do "foco" no meio<sup>[\[5\]](https://systems-analysis.info/int/Esquecimento_Contextual#cite_note-neurips-poster-vectors-5)</sup>.
- **Dados de pré-treinamento**: Os modelos são mais frequentemente treinados em textos relativamente curtos, onde informações importantes raramente estão a dezenas de milhares de tokens do início, o que os impede de utilizar contextos muito longos de forma eficaz<sup>[\[6\]](https://systems-analysis.info/int/Esquecimento_Contextual#cite_note-an2024-context-fall-short-6)</sup>.

## Manifestações e consequências

- **Síndrome de degradação de contexto**: Durante diálogos longos, o modelo começa a "perder o fio da conversa", repetir respostas, contradizer fatos estabelecidos anteriormente e fornecer respostas cada vez mais genéricas e vagas<sup>[\[1\]](https://systems-analysis.info/int/Esquecimento_Contextual#cite_note-howard-cds-1)</sup>.
- **Falhas em tarefas multifásicas**: Em tarefas onde as condições são refinadas ao longo de várias interações, o modelo pode "se prender" a uma suposição inicial incorreta e ignorar os refinamentos subsequentes, resultando na incapacidade total de resolver a tarefa<sup>[\[7\]](https://systems-analysis.info/int/Esquecimento_Contextual#cite_note-arxiv-multi-turn-lost-7)</sup>.
- **Análise de documentos não confiável**: Ao analisar relatórios longos ou documentos jurídicos, um LLM pode omitir fatos cruciais localizados nas seções centrais, tornando-o uma ferramenta não confiável para tais tarefas.

## Estratégias de mitigação e prevenção

Pesquisadores e desenvolvedores aplicam várias abordagens para resolver o problema do esquecimento contextual.

### Aumento da janela de contexto

A abordagem mais direta é aumentar o tamanho da janela de contexto. Modelos modernos, como o **Claude 3** (200 mil tokens) e o **Gemini 1.5 Pro** (até 2 milhões de tokens), expandiram significativamente esse limite<sup>[\[8\]](https://systems-analysis.info/int/Esquecimento_Contextual#cite_note-anthropic-claude3-family-8)[\[9\]](https://systems-analysis.info/int/Esquecimento_Contextual#cite_note-google-gemini1-5-pro-9)</sup>. No entanto, pesquisas mostram que simplesmente aumentar a janela não garante seu uso eficaz, e o problema da "perda no meio" persiste<sup>[\[2\]](https://systems-analysis.info/int/Esquecimento_Contextual#cite_note-liu2023-lost-in-middle-2)</sup>.

### Engenharia de prompts avançada

A estruturação adequada dos prompts pode melhorar significativamente o desempenho. A empresa Anthropic sugere as seguintes práticas<sup>[\[10\]](https://systems-analysis.info/int/Esquecimento_Contextual#cite_note-anthropic-long-context-tips-10)</sup>:

- **Posicionar documentos no início**: Colocar textos longos no início do prompt, antes das instruções e da pergunta.
- **Uso de tags XML**: Envolver os documentos em tags \`\<document\>\` para uma separação clara.
- **Justificar respostas com citações**: Instruir o modelo a primeiro extrair citações relevantes e, em seguida, formular a resposta com base nelas.

### Externalização da memória: Geração Aumentada por Recuperação (RAG)

Uma abordagem fundamentalmente diferente é não colocar todas as informações na janela de contexto, mas externalizá-las para um sistema externo (um banco de dados vetorial) e fornecê-las sob demanda.

1.  **Recuperação (Retrieve)**: Quando uma consulta é recebida, o sistema busca informações relevantes no banco de dados externo.
2.  **Aumento (Augment)**: Os fragmentos encontrados são adicionados à consulta original.
3.  **Geração (Generate)**: O LLM gera uma resposta com base no contexto fornecido.

**RAG** permite trabalhar com volumes de dados praticamente ilimitados e garante o acesso a informações atualizadas e verificadas, o que reduz o risco de alucinações e é a solução mais confiável atualmente<sup>[\[11\]](https://systems-analysis.info/int/Esquecimento_Contextual#cite_note-google-cloud-rag-11)</sup>.

## Ligações externas

- <a href="https://cs.stanford.edu/~nfliu/papers/lost-in-the-middle.arxiv2023.pdf" class="external text" rel="nofollow">Lost in the Middle: How Language Models Use Long Contexts</a> — a pesquisa original da Universidade de Stanford.
- <a href="https://www.anthropic.com/news/100k-context-windows" class="external text" rel="nofollow">Anúncio do Claude com uma janela de contexto de 100K tokens</a> da Anthropic.

## Literatura

- Liu, N. F. et al. (2023). *Lost in the Middle: How Language Models Use Long Contexts*. <a href="https://arxiv.org/abs/2307.03172" class="external text" rel="nofollow">arXiv:2307.03172</a>.
- An, C. et al. (2024). *Why Does the Effective Context Length of LLMs Fall Short?*. <a href="https://arxiv.org/abs/2410.18745" class="external text" rel="nofollow">arXiv:2410.18745</a>.
- Ding, J. et al. (2023). *LongNet: Scaling Transformers to 1,000,000,000 Tokens*. <a href="https://arxiv.org/abs/2307.02486" class="external text" rel="nofollow">arXiv:2307.02486</a>.
- Yang, A. et al. (2024). *Context Parallelism for Scalable Million-Token Inference*. <a href="https://arxiv.org/abs/2411.01783" class="external text" rel="nofollow">arXiv:2411.01783</a>.
- Chen, S. et al. (2023). *Extending Context Window of Large Language Models via Positional Interpolation*. <a href="https://arxiv.org/abs/2306.15595" class="external text" rel="nofollow">arXiv:2306.15595</a>.
- Ding, Y. et al. (2024). *LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens*. <a href="https://arxiv.org/abs/2402.13753" class="external text" rel="nofollow">arXiv:2402.13753</a>.
- Li, S. et al. (2023). *Functional Interpolation for Relative Positions Improves Long Context Transformers*. <a href="https://arxiv.org/abs/2310.04418" class="external text" rel="nofollow">arXiv:2310.04418</a>.
- Dong, Z. et al. (2024). *Exploring Context Window of Large Language Models via Decomposed Positional Vectors*. <a href="https://arxiv.org/abs/2405.18009" class="external text" rel="nofollow">arXiv:2405.18009</a>.
- Laban, P. et al. (2025). *LLMs Get Lost in Multi-Turn Conversation*. <a href="https://arxiv.org/abs/2505.06120" class="external text" rel="nofollow">arXiv:2505.06120</a>.
- Li, R. et al. (2024). *Extending Context Window in Large Language Models with Segmented Base Adjustment for Rotary Position Embeddings*. *Applied Sciences*, 14(7), 3076. <a href="https://www.mdpi.com/2076-3417/14/7/3076" class="external text" rel="nofollow">DOI:10.3390/app14073076</a>.
- Yang, A. & Reizenstein, J. (2024). *Exploring Context Window of LLMs via Decomposed Positional Vectors* (NeurIPS Poster). <a href="https://neurips.cc/virtual/2024/poster/92943" class="external text" rel="nofollow">NeurIPS 2024</a>.

## Notas

1.  <span id="cite_note-howard-cds-1">↑ <sup>[1.0](https://systems-analysis.info/int/Esquecimento_Contextual#cite_ref-howard-cds_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Esquecimento_Contextual#cite_ref-howard-cds_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/Esquecimento_Contextual#cite_ref-howard-cds_1-2)</sup> Howard, James. «Context Degradation Syndrome: When Large Language Models Lose the Plot». *jameshoward.us*. <a href="https://jameshoward.us/2024/11/26/context-degradation-syndrome-when-large-language-models-lose-the-plot/" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-liu2023-lost-in-middle-2">↑ <sup>[2.0](https://systems-analysis.info/int/Esquecimento_Contextual#cite_ref-liu2023-lost-in-middle_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/Esquecimento_Contextual#cite_ref-liu2023-lost-in-middle_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/Esquecimento_Contextual#cite_ref-liu2023-lost-in-middle_2-2)</sup> <sup>[2.3](https://systems-analysis.info/int/Esquecimento_Contextual#cite_ref-liu2023-lost-in-middle_2-3)</sup> Liu, Nelson F.; et al. «Lost in the Middle: How Language Models Use Long Contexts». *arXiv*. <a href="https://cs.stanford.edu/~nfliu/papers/lost-in-the-middle.arxiv2023.pdf" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-aclanthology-lost-in-middle-3">[↑](https://systems-analysis.info/int/Esquecimento_Contextual#cite_ref-aclanthology-lost-in-middle_3-0) Liu, Nelson F.; et al. «Lost in the Middle: How Language Models Use Long Contexts». *ACL Anthology*. <a href="https://aclanthology.org/2024.tacl-1.9/" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-greyling-catastrophic-4">[↑](https://systems-analysis.info/int/Esquecimento_Contextual#cite_ref-greyling-catastrophic_4-0) Greyling, Cobus. «Catastrophic Forgetting In LLMs». *Medium*. <a href="https://cobusgreyling.medium.com/catastrophic-forgetting-in-llms-bf345760e6e2" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-neurips-poster-vectors-5">[↑](https://systems-analysis.info/int/Esquecimento_Contextual#cite_ref-neurips-poster-vectors_5-0) «Exploring Context Window of Large Language Models via Decomposed Positional Vectors». *NeurIPS Proceedings*. <a href="https://neurips.cc/virtual/2024/poster/92943" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-an2024-context-fall-short-6">[↑](https://systems-analysis.info/int/Esquecimento_Contextual#cite_ref-an2024-context-fall-short_6-0) An, Chenxin; et al. «Why Does the Effective Context Length of LLMs Fall Short?». *arXiv*. <a href="https://arxiv.org/html/2410.18745v1" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-arxiv-multi-turn-lost-7">[↑](https://systems-analysis.info/int/Esquecimento_Contextual#cite_ref-arxiv-multi-turn-lost_7-0) «LLMs Get Lost In Multi-Turn Conversation». *arXiv*. <a href="https://arxiv.org/html/2505.06120v1" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-anthropic-claude3-family-8">[↑](https://systems-analysis.info/int/Esquecimento_Contextual#cite_ref-anthropic-claude3-family_8-0) «Introducing the next generation of Claude». *Anthropic*. <a href="https://www.anthropic.com/news/claude-3-family" class="external autonumber" rel="nofollow">[8]</a></span>
9.  <span id="cite_note-google-gemini1-5-pro-9">[↑](https://systems-analysis.info/int/Esquecimento_Contextual#cite_ref-google-gemini1-5-pro_9-0) «Google's Gemini 1.5 Pro - Revolutionizing AI with a 1M Token Context Window». *Medium*. <a href="https://medium.com/google-cloud/googles-gemini-1-5-pro-revolutionizing-ai-with-a-1m-token-context-window-bfea5adfd35f" class="external autonumber" rel="nofollow">[9]</a></span>
10. <span id="cite_note-anthropic-long-context-tips-10">[↑](https://systems-analysis.info/int/Esquecimento_Contextual#cite_ref-anthropic-long-context-tips_10-0) «Long context prompting tips». *Anthropic Documentation*. <a href="https://docs.anthropic.com/en/docs/build-with-claude/prompt-engineering/long-context-tips" class="external autonumber" rel="nofollow">[10]</a></span>
11. <span id="cite_note-google-cloud-rag-11">[↑](https://systems-analysis.info/int/Esquecimento_Contextual#cite_ref-google-cloud-rag_11-0) «What is Retrieval-Augmented Generation (RAG)?». *Google Cloud*. <a href="https://cloud.google.com/use-cases/retrieval-augmented-generation" class="external autonumber" rel="nofollow">[11]</a></span>
