---
title: "Kontextuális felejtés"
source: "https://systems-analysis.info/int/Kontextu%C3%A1lis_felejt%C3%A9s"
wiki: "systems-analysis.info/int"
article: "Kontextuális_felejtés"
language: "hu"
categories:
  - "Category:Hungarian"
  - "Category:Large language models"
  - "Category:Machine learning"
revision_id: 3485
wiki_created_at: 2026-09-06T23:21:31Z
wiki_modified_at: 2026-09-06T23:21:31Z
downloaded_at: 2026-09-07T22:57:14Z
---

# Kontextuális felejtés

**A kontextuális felejtés a nagy nyelvi modellekben** egy sokrétű jelenség, amelynek során egy nagy nyelvi modell (LLM) elveszíti, figyelmen kívül hagyja vagy nem hatékonyan használja fel az egyetlen interakción belül korábban számára megadott információt<sup>[\[1\]](https://systems-analysis.info/int/Kontextu%C3%A1lis_felejt%C3%A9s#cite_note-howard-cds-1)</sup>. Az emberi memóriával ellentétben az LLM-eknek nincs hosszú távú állapottárolójuk, és kizárólag a **kontextuális ablakra** támaszkodnak — arra a korlátozott szövegmennyiségre (tokenekben mérve), amelyet a modell egyszerre képes feldolgozni. Ez az ablak a modell rövid távú vagy munkamemóriájaként funkcionál<sup>[\[2\]](https://systems-analysis.info/int/Kontextu%C3%A1lis_felejt%C3%A9s#cite_note-liu2023-lost-in-middle-2)</sup>.

Ennek a korlátnak a legismertebb megnyilvánulása a **„Középre veszés" (Lost in the Middle)** probléma — a modellek azon hajlama, hogy a hosszú kontextus elején és végén elhelyezkedő információt jobban dolgozzák fel, míg a közepén lévőt kevésbé hatékonyan<sup>[\[2\]](https://systems-analysis.info/int/Kontextu%C3%A1lis_felejt%C3%A9s#cite_note-liu2023-lost-in-middle-2)</sup>. Ez a jelenség nem hiba, hanem a transformer architektúrából és a tanítási elvekből fakadó alapvető tulajdonság.

## A felejtés két típusa: Kontextuális és Katasztrofális

Fontos különbséget tenni az LLM-ekben megfigyelhető két alapvetően eltérő „felejtés"-típus között: a kontextuson belüli és a katasztrofális felejtés között.

### Kontextuson belüli felejtés (Középre veszés)

Ez a felejtéstípus **egyetlen interakciós munkamenet során** (inferencia közben) következik be egy már betanított modellnél. A **kontextuális ablak** korlátaihoz kapcsolódik. Amikor a párbeszéd vagy dokumentum terjedelme meghaladja az ablak méretét, a modell „elfelejti" a legrégebbi részleteket, hogy helyet adjon az újaknak. Még az ablakon belül is előfordulhat, hogy a kontextus közepéről származó információt kevésbé hatékonyan hasznosítja a modell. Ez a modell munkamemóriájának korlátozottsága<sup>[\[3\]](https://systems-analysis.info/int/Kontextu%C3%A1lis_felejt%C3%A9s#cite_note-aclanthology-lost-in-middle-3)</sup>. A publicisztikában ezt a jelenséget **„kontextusdegradációs szindrómának"** (Context Degradation Syndrome, CDS) is nevezik<sup>[\[1\]](https://systems-analysis.info/int/Kontextu%C3%A1lis_felejt%C3%A9s#cite_note-howard-cds-1)</sup>.

### Katasztrofális felejtés (Modelldrift)

Ez a felejtéstípus, amelyet „modelldriftnek" (*model drift*) is hívnak, a modell **finomhangolása (fine-tuning) során** következik be új adatokon. Amikor egy hatalmas általános tudáskorpuszon előre betanított modellt szűk szakterületű adatkészleten (például orvosi szövegeken) finomhangolnak, a modell súlyai megváltoznak. Ez az új feladathoz nem kapcsolódó, korábban elsajátított tudás és készségek degradálódásához vagy „törlésé"-hez vezethet<sup>[\[4\]](https://systems-analysis.info/int/Kontextu%C3%A1lis_felejt%C3%A9s#cite_note-greyling-catastrophic-4)</sup>.

## Okok és mechanizmusok

A kontextuális felejtés közvetlenül a transformer architektúrából és a vektortér geometriájából következik.

### A „Középre veszés" (Lost in the Middle) hatás

A Stanford Egyetem 2023-as, „Lost in the Middle" (Középre veszve) című kutatása szemléletesen megmutatta, hogy az LLM-ek teljesítménye a hosszú kontextusból való információkinyerés során **U-alakú görbét** követ<sup>[\[2\]](https://systems-analysis.info/int/Kontextu%C3%A1lis_felejt%C3%A9s#cite_note-liu2023-lost-in-middle-2)</sup>. A válaszok pontossága akkor a legmagasabb, ha a releváns információ a kontextus legelején (**elsőbbségi hatás**) vagy legvégén (**frissességi hatás**) helyezkedik el, és jelentősen csökken, ha az információ a „közepébe van rejtve". Ennek a jelenségnek az okai:

- **Figyelmi mechanizmus**: A transformer architektúra természetéből adódóan aránytalanul sok figyelmet fordít a kezdeti tokenekre (ezeket „figyelmi horgonyoknak", *attention sinks*-nek is nevezik) a globális koherencia fenntartása érdekében, valamint a helyi kontextusra, ami a középső részre irányuló „fókusz" gyengüléséhez vezet<sup>[\[5\]](https://systems-analysis.info/int/Kontextu%C3%A1lis_felejt%C3%A9s#cite_note-neurips-poster-vectors-5)</sup>.
- **Előtanítási adatok**: A modelleket leggyakrabban viszonylag rövid szövegeken tanítják, ahol a fontos információ ritkán van tízezer tokennyire a kezdettől, ami gátolja őket a nagyon hosszú kontextusok hatékony kezelésében<sup>[\[6\]](https://systems-analysis.info/int/Kontextu%C3%A1lis_felejt%C3%A9s#cite_note-an2024-context-fall-short-6)</sup>.

## Megnyilvánulások és következmények

- **Kontextusdegradációs szindróma**: Hosszú párbeszédek során a modell „elveszíti a fonalat", megismétli a válaszokat, ellentmond a korábban megállapított tényeknek, és egyre általánosabb, homályosabb válaszokat ad<sup>[\[1\]](https://systems-analysis.info/int/Kontextu%C3%A1lis_felejt%C3%A9s#cite_note-howard-cds-1)</sup>.
- **Hibák többlépéses feladatokban**: Olyan feladatoknál, ahol a feltételek több megszólalás során pontosítódnak, a modell „beleakadhat" egy hibás kezdeti feltételezésbe, és figyelmen kívül hagyhatja a későbbi pontosításokat, ami a feladat teljes megoldhatatlanságához vezet<sup>[\[7\]](https://systems-analysis.info/int/Kontextu%C3%A1lis_felejt%C3%A9s#cite_note-arxiv-multi-turn-lost-7)</sup>.
- **A dokumentumelemzés megbízhatatlanná válása**: Hosszú jelentések vagy jogi dokumentumok elemzésekor az LLM kihagyhatja a középső szakaszokban található kulcsfontosságú tényeket, ami megbízhatatlan eszközzé teszi az ilyen feladatokhoz.

## Enyhítési és megelőzési stratégiák

A kutatók és fejlesztők több megközelítést alkalmaznak a kontextuális felejtés problémájának kezelésére.

### A kontextusablak növelése

A legkézenfekvőbb megközelítés a kontextusablak méretének növelése. Az olyan modern modellek, mint a **Claude 3** (200 ezer token) és a **Gemini 1.5 Pro** (akár 2 millió token), jelentősen kiterjesztették ezt a határt<sup>[\[8\]](https://systems-analysis.info/int/Kontextu%C3%A1lis_felejt%C3%A9s#cite_note-anthropic-claude3-family-8)[\[9\]](https://systems-analysis.info/int/Kontextu%C3%A1lis_felejt%C3%A9s#cite_note-google-gemini1-5-pro-9)</sup>. A kutatások azonban azt mutatják, hogy az ablak egyszerű növelése nem garantálja annak hatékony kihasználását, és a „középre veszés" problémája megmarad<sup>[\[2\]](https://systems-analysis.info/int/Kontextu%C3%A1lis_felejt%C3%A9s#cite_note-liu2023-lost-in-middle-2)</sup>.

### Fejlett prompt-tervezés

A promptok szakszerű strukturálása jelentősen javíthatja a teljesítményt. Az Anthropic a következő gyakorlatokat javasolja<sup>[\[10\]](https://systems-analysis.info/int/Kontextu%C3%A1lis_felejt%C3%A9s#cite_note-anthropic-long-context-tips-10)</sup>:

- **Dokumentumok elhelyezése az elejére**: A hosszú szövegeket a prompt legelejére kell helyezni, az utasítások és a kérdés elé.
- **XML-tagek használata**: A dokumentumokat \`\<document\>\` tagekbe kell csomagolni az egyértelmű elkülönítés érdekében.
- **Válaszok alátámasztása idézetekkel**: Utasítani a modellt, hogy először nyerje ki a releváns idézeteket, majd ezek alapján fogalmazza meg a választ.

### A memória externalizálása: Retrieval-Augmented Generation (RAG)

Alapvetően eltérő megközelítés: nem az összes információt helyezi a kontextusablakba, hanem egy külső rendszerbe (vektoros adatbázisba) viszi ki, és igény szerint bocsátja rendelkezésre.

1.  **Visszakeresés (Retrieve)**: Amikor kérés érkezik, a rendszer releváns információt keres a külső adatbázisban.
2.  **Kiegészítés (Augment)**: A megtalált részleteket hozzáadja az eredeti kéréshez.
3.  **Generálás (Generate)**: Az LLM a megadott kontextus alapján generál választ.

A **RAG** lehetővé teszi a gyakorlatilag korlátlan adatmennyiséggel való munkát, és hozzáférést biztosít friss és ellenőrzött információkhoz, ami csökkenti a hallucinációk kockázatát, és ma ez a legmegbízhatóbb megoldás<sup>[\[11\]](https://systems-analysis.info/int/Kontextu%C3%A1lis_felejt%C3%A9s#cite_note-google-cloud-rag-11)</sup>.

## Hivatkozások

- Lost in the Middle: How Language Models Use Long Contexts — a Stanford Egyetem eredeti kutatása.
- Az Anthropic bejelentése a 100 ezer tokenes kontextusablakkal rendelkező Claude-ról.

## Irodalom

- Liu, N. F. et al. (2023). *Lost in the Middle: How Language Models Use Long Contexts*. arXiv:2307.03172.
- An, C. et al. (2024). *Why Does the Effective Context Length of LLMs Fall Short?*. arXiv:2410.18745.
- Ding, J. et al. (2023). *LongNet: Scaling Transformers to 1,000,000,000 Tokens*. arXiv:2307.02486.
- Yang, A. et al. (2024). *Context Parallelism for Scalable Million-Token Inference*. arXiv:2411.01783.
- Chen, S. et al. (2023). *Extending Context Window of Large Language Models via Positional Interpolation*. arXiv:2306.15595.
- Ding, Y. et al. (2024). *LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens*. arXiv:2402.13753.
- Li, S. et al. (2023). *Functional Interpolation for Relative Positions Improves Long Context Transformers*. arXiv:2310.04418.
- Dong, Z. et al. (2024). *Exploring Context Window of Large Language Models via Decomposed Positional Vectors*. arXiv:2405.18009.
- Laban, P. et al. (2025). *LLMs Get Lost in Multi-Turn Conversation*. arXiv:2505.06120.
- Li, R. et al. (2024). *Extending Context Window in Large Language Models with Segmented Base Adjustment for Rotary Position Embeddings*. *Applied Sciences*, 14(7), 3076. DOI:10.3390/app14073076.
- Yang, A. & Reizenstein, J. (2024). *Exploring Context Window of LLMs via Decomposed Positional Vectors* (NeurIPS Poster). NeurIPS 2024.

## Jegyzetek

1.  <span id="cite_note-howard-cds-1">↑ <sup>[1.0](https://systems-analysis.info/int/Kontextu%C3%A1lis_felejt%C3%A9s#cite_ref-howard-cds_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Kontextu%C3%A1lis_felejt%C3%A9s#cite_ref-howard-cds_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/Kontextu%C3%A1lis_felejt%C3%A9s#cite_ref-howard-cds_1-2)</sup> Howard, James. «Context Degradation Syndrome: When Large Language Models Lose the Plot». *jameshoward.us*. <a href="https://jameshoward.us/2024/11/26/context-degradation-syndrome-when-large-language-models-lose-the-plot/" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-liu2023-lost-in-middle-2">↑ <sup>[2.0](https://systems-analysis.info/int/Kontextu%C3%A1lis_felejt%C3%A9s#cite_ref-liu2023-lost-in-middle_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/Kontextu%C3%A1lis_felejt%C3%A9s#cite_ref-liu2023-lost-in-middle_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/Kontextu%C3%A1lis_felejt%C3%A9s#cite_ref-liu2023-lost-in-middle_2-2)</sup> <sup>[2.3](https://systems-analysis.info/int/Kontextu%C3%A1lis_felejt%C3%A9s#cite_ref-liu2023-lost-in-middle_2-3)</sup> Liu, Nelson F.; et al. «Lost in the Middle: How Language Models Use Long Contexts». *arXiv*. <a href="https://cs.stanford.edu/~nfliu/papers/lost-in-the-middle.arxiv2023.pdf" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-aclanthology-lost-in-middle-3">[↑](https://systems-analysis.info/int/Kontextu%C3%A1lis_felejt%C3%A9s#cite_ref-aclanthology-lost-in-middle_3-0) Liu, Nelson F.; et al. «Lost in the Middle: How Language Models Use Long Contexts». *ACL Anthology*. <a href="https://aclanthology.org/2024.tacl-1.9/" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-greyling-catastrophic-4">[↑](https://systems-analysis.info/int/Kontextu%C3%A1lis_felejt%C3%A9s#cite_ref-greyling-catastrophic_4-0) Greyling, Cobus. «Catastrophic Forgetting In LLMs». *Medium*. <a href="https://cobusgreyling.medium.com/catastrophic-forgetting-in-llms-bf345760e6e2" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-neurips-poster-vectors-5">[↑](https://systems-analysis.info/int/Kontextu%C3%A1lis_felejt%C3%A9s#cite_ref-neurips-poster-vectors_5-0) «Exploring Context Window of Large Language Models via Decomposed Positional Vectors». *NeurIPS Proceedings*. <a href="https://neurips.cc/virtual/2024/poster/92943" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-an2024-context-fall-short-6">[↑](https://systems-analysis.info/int/Kontextu%C3%A1lis_felejt%C3%A9s#cite_ref-an2024-context-fall-short_6-0) An, Chenxin; et al. «Why Does the Effective Context Length of LLMs Fall Short?». *arXiv*. <a href="https://arxiv.org/html/2410.18745v1" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-arxiv-multi-turn-lost-7">[↑](https://systems-analysis.info/int/Kontextu%C3%A1lis_felejt%C3%A9s#cite_ref-arxiv-multi-turn-lost_7-0) «LLMs Get Lost In Multi-Turn Conversation». *arXiv*. <a href="https://arxiv.org/html/2505.06120v1" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-anthropic-claude3-family-8">[↑](https://systems-analysis.info/int/Kontextu%C3%A1lis_felejt%C3%A9s#cite_ref-anthropic-claude3-family_8-0) «Introducing the next generation of Claude». *Anthropic*. <a href="https://www.anthropic.com/news/claude-3-family" class="external autonumber" rel="nofollow">[8]</a></span>
9.  <span id="cite_note-google-gemini1-5-pro-9">[↑](https://systems-analysis.info/int/Kontextu%C3%A1lis_felejt%C3%A9s#cite_ref-google-gemini1-5-pro_9-0) «Google's Gemini 1.5 Pro - Revolutionizing AI with a 1M Token Context Window». *Medium*. <a href="https://medium.com/google-cloud/googles-gemini-1-5-pro-revolutionizing-ai-with-a-1m-token-context-window-bfea5adfd35f" class="external autonumber" rel="nofollow">[9]</a></span>
10. <span id="cite_note-anthropic-long-context-tips-10">[↑](https://systems-analysis.info/int/Kontextu%C3%A1lis_felejt%C3%A9s#cite_ref-anthropic-long-context-tips_10-0) «Long context prompting tips». *Anthropic Documentation*. <a href="https://docs.anthropic.com/en/docs/build-with-claude/prompt-engineering/long-context-tips" class="external autonumber" rel="nofollow">[10]</a></span>
11. <span id="cite_note-google-cloud-rag-11">[↑](https://systems-analysis.info/int/Kontextu%C3%A1lis_felejt%C3%A9s#cite_ref-google-cloud-rag_11-0) «What is Retrieval-Augmented Generation (RAG)?». *Google Cloud*. <a href="https://cloud.google.com/use-cases/retrieval-augmented-generation" class="external autonumber" rel="nofollow">[11]</a></span>
