---
title: "Prompt tömörítés"
source: "https://systems-analysis.info/int/Prompt_t%C3%B6m%C3%B6r%C3%ADt%C3%A9s"
wiki: "systems-analysis.info/int"
article: "Prompt_tömörítés"
language: "hu"
categories:
  - "Category:Hungarian"
  - "Category:Large language models"
  - "Category:Machine learning"
  - "Category:Prompt engineering"
revision_id: 6022
wiki_created_at: 2026-09-06T23:57:16Z
wiki_modified_at: 2026-09-06T23:57:16Z
downloaded_at: 2026-09-07T23:11:35Z
---

# Prompt tömörítés

**Prompt tömörítés** (angol *prompt compression*) — a prompt-mérnökség azon módszereinek összessége, amelyek célja a nagy nyelvi modellek (LLM) bemeneti szövegének (promptjának) hosszát csökkenteni a kulcsinformációk megőrzése mellett<sup>[\[1\]](https://systems-analysis.info/int/Prompt_t%C3%B6m%C3%B6r%C3%ADt%C3%A9s#cite_note-jha2024-1)</sup>. Ahogy az LLM-ek kontextusablaka millió tokenre bővült (például a Google Gemini esetében), lehetővé vált nagyon hosszú szövegek feldolgozása, ám ez új problémákat hozott: magas hívási költségeket, megnövekedett késleltetést és a „lost in the middle" (elveszés a közepén) jelenség miatti romló következtetési minőséget<sup>[\[2\]](https://systems-analysis.info/int/Prompt_t%C3%B6m%C3%B6r%C3%ADt%C3%A9s#cite_note-survey2024-2)</sup>.

A prompt tömörítés ezeket a problémákat oldja meg azáltal, hogy a rövidített bemenetbe a leglényegesebb adatokat sűríti, a feleslegeseket pedig elveti. Ez csökkenti a kontextuskorlát túllépésének kockázatát, gyorsítja a generálást és mérsékeli a költségeket, miközben megőrzi a válaszok pontosságát<sup>[\[3\]](https://systems-analysis.info/int/Prompt_t%C3%B6m%C3%B6r%C3%ADt%C3%A9s#cite_note-datacamp-guide-3)</sup>.

## A prompt tömörítés módszerei

A prompt tömörítés módszerei néhány fő osztályba sorolhatók.

### Token-eltávolítás (szűrés)

Ez a megközelítés a legkevésbé informatív tokenek, kifejezések vagy mondatok eltávolításából áll az eredeti szövegből, az megmaradó részek módosítása nélkül. A tokenek fontosságát heurisztikusan határozzák meg.

- **LLMLingua**: A Microsoft által kifejlesztett módszer, amely kiszámítja az egyes tokenek perplexitását, és eltávolítja azokat, amelyek kevéssé befolyásolják a szöveg előrejelzhetőségét. A **LongLLMLingua** verzióban ezt a megközelítést hosszú dokumentumokhoz adaptálták, figyelembe véve a szövegrészletek relevanciáját az adott felhasználói kéréshez képest<sup>[\[4\]](https://systems-analysis.info/int/Prompt_t%C3%B6m%C3%B6r%C3%ADt%C3%A9s#cite_note-jiang2023_llmlingua-4)</sup>.
- **Selective-Context**: Egy kis nyelvi modellt használ az egyes tokenek *self-information* értékének becslésére, és elveti a legkevésbé informatív tokeneket<sup>[\[5\]](https://systems-analysis.info/int/Prompt_t%C3%B6m%C3%B6r%C3%ADt%C3%A9s#cite_note-li2023_selective-5)</sup>.
- **PCRL** (Prompt Compression via Reinforcement Learning): Megerősítéses tanulással (Reinforcement Learning) tanít egy ágenst, amely minden tokenre döntést hoz — „megtart" vagy „töröl" —, azzal a céllal, hogy maximalizálja a végső válasz minőségi mutatóját (például ROUGE)<sup>[\[6\]](https://systems-analysis.info/int/Prompt_t%C3%B6m%C3%B6r%C3%ADt%C3%A9s#cite_note-jung2023_pcrl-6)</sup>.

### Absztraktív tömörítés (összefoglalás)

Ennél a megközelítésnél egy tömörítő modell (általában kisebb méretű) rövid, absztrakt összefoglalót készít az eredeti szövegből, amelyet aztán az elsődleges LLM-nek továbbít.

- **RECOMP** (Retrieval-Compression-Prompting): A tudásbázis minden dokumentumához előre rövid összefoglaló (*summary*) készül, amely figyelembe veszi a lehetséges felhasználói kéréseket (*query-aware summary*). Ez lehetővé teszi az információk nemcsak tömörítését, hanem előzetes feldolgozását is<sup>[\[7\]](https://systems-analysis.info/int/Prompt_t%C3%B6m%C3%B6r%C3%ADt%C3%A9s#cite_note-xu2024_recomp-7)</sup>.
- **PRCA** (Prompt Compression with Reinforced Context Aggregation): Kombinálja az összefoglaló modell tanítását a megerősítéses tanulással, hogy olyan összefoglalókat generáljon, amelyek a lehető legnagyobb mértékben javítják az elsődleges LLM válaszainak minőségét<sup>[\[8\]](https://systems-analysis.info/int/Prompt_t%C3%B6m%C3%B6r%C3%ADt%C3%A9s#cite_note-yang2023_prca-8)</sup>.
- **Prompt-SAW** (Semantic Aware Winnowing): Az összefoglalás előtt tudásgráfot (entitásokat és relációkat) nyer ki a szövegből, kiválasztja a gráf releváns csomópontjait, és ezek alapján tömörített szöveget generál<sup>[\[9\]](https://systems-analysis.info/int/Prompt_t%C3%B6m%C3%B6r%C3%ADt%C3%A9s#cite_note-ali2024_promptsaw-9)</sup>.

### Extraktív tömörítés

Ez a módszer kulcsfontosságú részleteket (mondatokat, bekezdéseket) von ki az eredeti szövegből átfogalmazás nélkül.

- **Reranker-LLMs**: Egy rangsoroló modellt (*reranker*) használ, amely értékeli az egyes bekezdések vagy dokumentumok fontosságát az aktuális kérés szempontjából, és csak a legrelevánsabbakat választja ki<sup>[\[10\]](https://systems-analysis.info/int/Prompt_t%C3%B6m%C3%B6r%C3%ADt%C3%A9s#cite_note-pradeep2023_reranker-10)</sup>.
- **CompAct**: Iteratív extrakciós-összefoglalási folyamatot mutat be. A modell szekvenciálisan veszi a hosszú szöveg szegmenseit, tömöríti azokat, majd ellenőrzi, elegendő-e az információ a válaszhoz. Ha nem, hozzáadja a következő szegmenst, és újra tömörít, így jelentős tömörítést ér el a minőség megőrzése mellett<sup>[\[11\]](https://systems-analysis.info/int/Prompt_t%C3%B6m%C3%B6r%C3%ADt%C3%A9s#cite_note-yoon2024_compact-11)</sup>.

### Desztilláció és „memóriatokenek"

Módszerek egy új osztálya, ahol a modell szöveg helyett speciálisan betanított helyettesítő tokeneket vagy embeddingeket kap, amelyek tömörített információt tartalmaznak.

- **Gist Tokens**: Az LLM modellt arra tanítják, hogy hosszú utasításokat egy kis számú speciális *gist-token*-né „göngyöljön össze" (például 20–30 token néhány ezer helyett). Ezeket a tokeneket ezután az eredeti prompt helyett használják, akár 26-szoros tömörítést biztosítva minimális minőségveszteség mellett<sup>[\[12\]](https://systems-analysis.info/int/Prompt_t%C3%B6m%C3%B6r%C3%ADt%C3%A9s#cite_note-mu2023_gist-12)</sup>.
- **Soft Prompt Tuning**: Szöveges prompt helyett tanítható „virtuális tokeneket" (embeddingeket) alkalmaznak, amelyeket egy adott feladat megoldására hangolnak be.
- **SelfCP**: Azt javasolja, hogy magát a befagyasztott LLM-et használják tömörítőként. A modellnek szövegszegmenseket adva speciális jelölőkkel, a modell sűrű reprezentációt (*memory tokens*) generál, amelyet aztán saját maga felhasználva válaszol<sup>[\[13\]](https://systems-analysis.info/int/Prompt_t%C3%B6m%C3%B6r%C3%ADt%C3%A9s#cite_note-gao2024_selfcp-13)</sup>.

## Hatékonyság és kompromisszumok

- **Gyorsítás és költségcsökkentés**: Mivel a transformer összetettsége négyzetesen (\$O(n^2)\$) nő a sorozat hosszával, a prompt néhányszorosára való csökkentése jelentős megtakarítást eredményez. Például a *gist tokens* 26-szoros tömörítésnél akár 40%-os FLOPs-megtakarítást mutat<sup>[\[12\]](https://systems-analysis.info/int/Prompt_t%C3%B6m%C3%B6r%C3%ADt%C3%A9s#cite_note-mu2023_gist-12)</sup>.
- **Minőségjavítás**: Bizonyos esetekben a prompt tömörítés még javíthatja is a válaszok minőségét, ha az eredeti szöveg zajt vagy elterelő részleteket tartalmazott. A nem releváns kontextus eltávolítása segít a modellnek jobban összpontosítani a feladat fontos aspektusaira.
- **Minőségi kompromisszum (faithfulness)**: A túlzottan agresszív tömörítés fontos részletek (dátumok, nevek, tagadások) elvesztéséhez vezethet, ami rontja a válasz minőségét. Az absztraktív módszerek különösen hajlamosak a hallucinációk kockázatára. A tömörített prompt teljességének és pontosságának (*faithfulness*) ellenőrzése kulcsfontosságú feladat.

## Kapcsolat más területekkel

- **Retrieval-Augmented Generation (RAG)**: A RAG és a prompt tömörítés szorosan összefügg. A RAG tekinthető egyfajta külső tömörítési lépésnek: az egész adatbázis feldolgozása helyett releváns dokumentumokat keresnek és válogatnak ki. A prompt tömörítés kiegészíti a RAG-ot azzal, hogy a már kiválogatott dokumentumok terjedelmét csökkenti, mielőtt azokat az LLM-be táplálják.
- **In-Context Learning**: A kontextusban szereplő példák (demonstrációk) jelentősen növelik a prompt hosszát. Ezeknek a demonstrációknak a tömörítése (például *Instruction Distillation* segítségével, ahol sok példát egyetlen rövid utasítás vált fel) aktív kutatási terület.

## Irodalom

- Ali, M. et al. (2024). *Prompt-SAW: Semantic-Aware Winnowing for Prompt Compression*. arXiv:2403.00000.
- Gao, J.; Cao, Z.; Li, W. (2024). *SelfCP: Compressing Over-Limit Prompt via the Frozen Large Language Model Itself*. arXiv:2405.17052.
- Jiang, H. et al. (2023). *LLMLingua: Compressing Prompts for Accelerated Inference of Large Language Models*. arXiv:2310.05736.
- Jiang, H. et al. (2023). *LongLLMLingua: Accelerating and Enhancing LLMs in Long-Context Scenarios via Prompt Compression*. arXiv:2310.06839.
- Jung, H.; Kim, K. (2023). *PCRL: Discrete Prompt Compression with Reinforcement Learning*. arXiv:2308.08758.
- Li, M. et al. (2023). *Selective-Context: Compressing Context to Summarise and Answer Questions*. arXiv:2307.00000.
- Mu, J. et al. (2023). *Learning to Compress Prompts with Gist Tokens*. NeurIPS 2023.
- Xu, F.; Shi, W.; Choi, E. (2023). *RECOMP: Improving Retrieval-Augmented LMs with Compression and Selective Augmentation*. arXiv:2310.04408.
- Yang, C. et al. (2023). *PRCA: Prompt Compression with Reinforced Context Aggregation*. arXiv:2311.00000.
- Yoon, J. et al. (2024). *CompAct: Interactive Prompt Compression for Long-Document QA*. arXiv:2402.00000.
- Zhang, S. et al. (2024). *Efficient Prompting Methods for Large Language Models: A Survey*. arXiv:2404.01077.
- Jha, S. et al. (2024). *Characterizing Prompt Compression Methods for Long Context Inference*. arXiv:2407.08892.

## Megjegyzés

1.  <span id="cite_note-jha2024-1">[↑](https://systems-analysis.info/int/Prompt_t%C3%B6m%C3%B6r%C3%ADt%C3%A9s#cite_ref-jha2024_1-0) Jha, S., et al. (2024). «Characterizing Prompt Compression Methods for Long Context Inference». *arXiv*. <a href="https://arxiv.org/html/2407.08892v1" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-survey2024-2">[↑](https://systems-analysis.info/int/Prompt_t%C3%B6m%C3%B6r%C3%ADt%C3%A9s#cite_ref-survey2024_2-0) «Efficient Prompting Methods for Large Language Models: A Survey». *arXiv*. <a href="https://arxiv.org/html/2404.01077v2" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-datacamp-guide-3">[↑](https://systems-analysis.info/int/Prompt_t%C3%B6m%C3%B6r%C3%ADt%C3%A9s#cite_ref-datacamp-guide_3-0) «Prompt Compression: A Guide With Python Examples». *DataCamp*. <a href="https://www.datacamp.com/tutorial/prompt-compression" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-jiang2023_llmlingua-4">[↑](https://systems-analysis.info/int/Prompt_t%C3%B6m%C3%B6r%C3%ADt%C3%A9s#cite_ref-jiang2023_llmlingua_4-0) Jiang, H., et al. (2023). «LLMLingua: Compressing Prompts for Accelerated Inference of Large Language Models». *arXiv*.</span>
5.  <span id="cite_note-li2023_selective-5">[↑](https://systems-analysis.info/int/Prompt_t%C3%B6m%C3%B6r%C3%ADt%C3%A9s#cite_ref-li2023_selective_5-0) Li, M. (2023). «Compressing context to summarize and answer questions». *arXiv*.</span>
6.  <span id="cite_note-jung2023_pcrl-6">[↑](https://systems-analysis.info/int/Prompt_t%C3%B6m%C3%B6r%C3%ADt%C3%A9s#cite_ref-jung2023_pcrl_6-0) Jung, H., & Kim, K. (2023). «Learning to Compress Prompts with Reinforcement Learning». *arXiv*.</span>
7.  <span id="cite_note-xu2024_recomp-7">[↑](https://systems-analysis.info/int/Prompt_t%C3%B6m%C3%B6r%C3%ADt%C3%A9s#cite_ref-xu2024_recomp_7-0) Xu, F., et al. (2024). «RECOMP: Improving Retrieval-Augmented LMs with Compression and Selective Augmentation». *arXiv*.</span>
8.  <span id="cite_note-yang2023_prca-8">[↑](https://systems-analysis.info/int/Prompt_t%C3%B6m%C3%B6r%C3%ADt%C3%A9s#cite_ref-yang2023_prca_8-0) Yang, C., et al. (2023). «PRCA: A new framework for prompt compression». *arXiv*.</span>
9.  <span id="cite_note-ali2024_promptsaw-9">[↑](https://systems-analysis.info/int/Prompt_t%C3%B6m%C3%B6r%C3%ADt%C3%A9s#cite_ref-ali2024_promptsaw_9-0) Ali, M., et al. (2024). «Prompt-SAW: A new method for prompt compression». *arXiv*.</span>
10. <span id="cite_note-pradeep2023_reranker-10">[↑](https://systems-analysis.info/int/Prompt_t%C3%B6m%C3%B6r%C3%ADt%C3%A9s#cite_ref-pradeep2023_reranker_10-0) Pradeep, R., et al. (2023). «How to select the best passages for RAG?». *arXiv*.</span>
11. <span id="cite_note-yoon2024_compact-11">[↑](https://systems-analysis.info/int/Prompt_t%C3%B6m%C3%B6r%C3%ADt%C3%A9s#cite_ref-yoon2024_compact_11-0) Yoon, J., et al. (2024). «CompAct: A new framework for interactive prompt compression». *arXiv*.</span>
12. <span id="cite_note-mu2023_gist-12">↑ <sup>[12.0](https://systems-analysis.info/int/Prompt_t%C3%B6m%C3%B6r%C3%ADt%C3%A9s#cite_ref-mu2023_gist_12-0)</sup> <sup>[12.1](https://systems-analysis.info/int/Prompt_t%C3%B6m%C3%B6r%C3%ADt%C3%A9s#cite_ref-mu2023_gist_12-1)</sup> Mu, J., et al. (2023). «Learning to Compress Prompts with Gist Tokens». *OpenReview*. <a href="https://openreview.net/forum?id=2DtxPCL3T5" class="external autonumber" rel="nofollow">[4]</a></span>
13. <span id="cite_note-gao2024_selfcp-13">[↑](https://systems-analysis.info/int/Prompt_t%C3%B6m%C3%B6r%C3%ADt%C3%A9s#cite_ref-gao2024_selfcp_13-0) Gao, C., et al. (2024). «SelfCP: Compressing Over-Limit Prompt via the Frozen Large Language Model Itself». *arXiv*. <a href="https://arxiv.org/html/2405.17052v2" class="external autonumber" rel="nofollow">[5]</a></span>
