---
title: "Prompt compression — پرامپٹ کمپریشن"
source: "https://systems-analysis.info/int/Prompt_compression_%E2%80%94_%D9%BE%D8%B1%D8%A7%D9%85%D9%BE%D9%B9_%DA%A9%D9%85%D9%BE%D8%B1%DB%8C%D8%B4%D9%86"
wiki: "systems-analysis.info/int"
article: "Prompt_compression_—_پرامپٹ_کمپریشن"
language: "ur"
categories:
  - "Category:Large language models"
  - "Category:Machine learning"
  - "Category:Prompt engineering"
  - "Category:Urdu"
revision_id: 6003
wiki_created_at: 2026-09-06T23:57:01Z
wiki_modified_at: 2026-09-06T23:57:01Z
downloaded_at: 2026-09-07T23:11:29Z
---

# Prompt compression — پرامپٹ کمپریشن

**پرامپٹ کمپریشن** (انگریزی: *prompt compression*) — یہ پرامپٹ انجینیئرنگ میں طریقوں کا ایک مجموعہ ہے جو بڑے لسانی ماڈلز (LLM) کے لیے داخلی متن (پرامپٹ) کی لمبائی کو کم کرنے کے ساتھ ساتھ کلیدی معلومات کو محفوظ رکھنے پر مرکوز ہے<sup>[\[1\]](https://systems-analysis.info/int/Prompt_compression_%E2%80%94_%D9%BE%D8%B1%D8%A7%D9%85%D9%BE%D9%B9_%DA%A9%D9%85%D9%BE%D8%B1%DB%8C%D8%B4%D9%86#cite_note-jha2024-1)</sup>۔ LLM کی context window کے لاکھوں token تک بڑھنے (مثلاً Google Gemini میں) سے بہت لمبے متون کی پروسیسنگ ممکن ہوئی، لیکن اس نے نئے مسائل پیدا کیے: زیادہ لاگت، تاخیر میں اضافہ، اور *lost in the middle* کے اثر کی وجہ سے استدلال کے معیار میں کمی<sup>[\[2\]](https://systems-analysis.info/int/Prompt_compression_%E2%80%94_%D9%BE%D8%B1%D8%A7%D9%85%D9%BE%D9%B9_%DA%A9%D9%85%D9%BE%D8%B1%DB%8C%D8%B4%D9%86#cite_note-survey2024-2)</sup>۔

پرامپٹ کمپریشن ان مسائل کو حل کرتی ہے، مختصر شدہ ان پٹ میں سب سے اہم ڈیٹا کو مرتکز کرکے اور غیر ضروری حصوں کو ہٹا کر۔ اس سے context کی حد سے تجاوز کا خطرہ کم ہوتا ہے، نتائج کی تیاری تیز ہوتی ہے، اور لاگت کم ہوتی ہے، جبکہ جوابات کی درستگی برقرار رہتی ہے<sup>[\[3\]](https://systems-analysis.info/int/Prompt_compression_%E2%80%94_%D9%BE%D8%B1%D8%A7%D9%85%D9%BE%D9%B9_%DA%A9%D9%85%D9%BE%D8%B1%DB%8C%D8%B4%D9%86#cite_note-datacamp-guide-3)</sup>۔

## پرامپٹ کمپریشن کے طریقے

پرامپٹ کمپریشن کے طریقوں کو چند بنیادی اقسام میں تقسیم کیا جا سکتا ہے۔

### Token کا اخراج (فلٹریشن)

اس طریقے میں اصل متن سے کم از کم معلوماتی token، جملے یا عبارتیں حذف کی جاتی ہیں، باقی حصوں کو تبدیل کیے بغیر۔ Token کی اہمیت کا تعین اکتشافی طور پر کیا جاتا ہے۔

- **LLMLingua**: Microsoft کا تیار کردہ طریقہ جو ہر token کی perplexity حساب کرتا ہے اور ان کو ہٹاتا ہے جن کا متن کی قابلِ پیشین گوئی پر کم اثر ہو۔ **LongLLMLingua** کے ورژن میں یہ طریقہ لمبے دستاویزات کے لیے موافق بنایا گیا ہے، صارف کی مخصوص درخواست کے تناظر میں حصوں کی مطابقت کو مدِ نظر رکھتے ہوئے<sup>[\[4\]](https://systems-analysis.info/int/Prompt_compression_%E2%80%94_%D9%BE%D8%B1%D8%A7%D9%85%D9%BE%D9%B9_%DA%A9%D9%85%D9%BE%D8%B1%DB%8C%D8%B4%D9%86#cite_note-jiang2023_llmlingua-4)</sup>۔
- **Selective-Context**: ہر token کی *self-information* کا اندازہ لگانے کے لیے ایک چھوٹے لسانی ماڈل کا استعمال کرتا ہے اور کم سے کم معلوماتی token کو ہٹا دیتا ہے<sup>[\[5\]](https://systems-analysis.info/int/Prompt_compression_%E2%80%94_%D9%BE%D8%B1%D8%A7%D9%85%D9%BE%D9%B9_%DA%A9%D9%85%D9%BE%D8%B1%DB%8C%D8%B4%D9%86#cite_note-li2023_selective-5)</sup>۔
- **PCRL** (Prompt Compression via Reinforcement Learning): Reinforcement Learning کے ذریعے ایک agent کو تربیت دیتا ہے کہ وہ ہر token کے لیے فیصلہ کرے — *رکھنا* یا *ہٹانا* — حتمی جواب کے معیار کی پیمائش (مثلاً ROUGE) کو زیادہ سے زیادہ کرنے کے مقصد سے<sup>[\[6\]](https://systems-analysis.info/int/Prompt_compression_%E2%80%94_%D9%BE%D8%B1%D8%A7%D9%85%D9%BE%D9%B9_%DA%A9%D9%85%D9%BE%D8%B1%DB%8C%D8%B4%D9%86#cite_note-jung2023_pcrl-6)</sup>۔

### تجریدی کمپریشن (خلاصہ سازی)

اس طریقے میں ایک چھوٹا compressor ماڈل اصل متن کا مختصر تجریدی خلاصہ تیار کرتا ہے، جو پھر بنیادی LLM کو بھیجا جاتا ہے۔

- **RECOMP** (Retrieval-Compression-Prompting): علمی بنیاد میں ہر دستاویز کے لیے پہلے سے ایک مختصر خلاصہ (*summary*) تیار کیا جاتا ہے جو صارف کی ممکنہ درخواستوں (*query-aware summary*) کو مدِ نظر رکھتا ہے۔ اس سے نہ صرف کمپریشن بلکہ معلومات کی پیشگی پروسیسنگ بھی ممکن ہوتی ہے<sup>[\[7\]](https://systems-analysis.info/int/Prompt_compression_%E2%80%94_%D9%BE%D8%B1%D8%A7%D9%85%D9%BE%D9%B9_%DA%A9%D9%85%D9%BE%D8%B1%DB%8C%D8%B4%D9%86#cite_note-xu2024_recomp-7)</sup>۔
- **PRCA** (Prompt Compression with Reinforced Context Aggregation): summarizer ماڈل کی تربیت کو Reinforcement Learning کے ساتھ ملاتا ہے تاکہ ایسے خلاصے تیار کیے جا سکیں جو بنیادی LLM کے جوابات کے معیار کو زیادہ سے زیادہ بہتر بنائیں<sup>[\[8\]](https://systems-analysis.info/int/Prompt_compression_%E2%80%94_%D9%BE%D8%B1%D8%A7%D9%85%D9%BE%D9%B9_%DA%A9%D9%85%D9%BE%D8%B1%DB%8C%D8%B4%D9%86#cite_note-yang2023_prca-8)</sup>۔
- **Prompt-SAW** (Semantic Aware Winnowing): خلاصہ سازی سے پہلے متن سے علمی گراف (entities اور روابط) نکالتا ہے، گراف کے متعلقہ nodes کا انتخاب کرتا ہے اور ان کی بنیاد پر مختصر متن تیار کرتا ہے<sup>[\[9\]](https://systems-analysis.info/int/Prompt_compression_%E2%80%94_%D9%BE%D8%B1%D8%A7%D9%85%D9%BE%D9%B9_%DA%A9%D9%85%D9%BE%D8%B1%DB%8C%D8%B4%D9%86#cite_note-ali2024_promptsaw-9)</sup>۔

### اخراجی کمپریشن

یہ طریقہ اصل متن سے کلیدی حصوں (جملوں، پیراگرافوں) کو دوبارہ جملہ بندی کیے بغیر نکالتا ہے۔

- **Reranker-LLMs**: ایک reranker ماڈل استعمال کرتا ہے جو موجودہ درخواست کے لیے ہر پیراگراف یا دستاویز کی اہمیت کا اندازہ لگاتا ہے اور صرف سب سے زیادہ متعلقہ کو منتخب کرتا ہے<sup>[\[10\]](https://systems-analysis.info/int/Prompt_compression_%E2%80%94_%D9%BE%D8%B1%D8%A7%D9%85%D9%BE%D9%B9_%DA%A9%D9%85%D9%BE%D8%B1%DB%8C%D8%B4%D9%86#cite_note-pradeep2023_reranker-10)</sup>۔
- **CompAct**: تکراری اخراج-خلاصہ سازی کا مظاہرہ کرتا ہے۔ ماڈل لمبے متن کے حصوں کو یکے بعد دیگرے لیتا ہے، انہیں مختصر کرتا ہے اور جانچتا ہے کہ آیا جواب کے لیے کافی معلومات موجود ہیں۔ اگر نہیں، تو اگلا حصہ شامل کرتا ہے اور دوبارہ مختصر کرتا ہے، معیار برقرار رکھتے ہوئے نمایاں کمپریشن حاصل کرتا ہے<sup>[\[11\]](https://systems-analysis.info/int/Prompt_compression_%E2%80%94_%D9%BE%D8%B1%D8%A7%D9%85%D9%BE%D9%B9_%DA%A9%D9%85%D9%BE%D8%B1%DB%8C%D8%B4%D9%86#cite_note-yoon2024_compact-11)</sup>۔

### Distillation اور *Memory Tokens*

طریقوں کا ایک نیا طبقہ، جہاں متن کی بجائے ماڈل کو خصوصی تربیت یافتہ متبادل token یا embedding ملتے ہیں جن میں مختصر شدہ معلومات ہوتی ہیں۔

- **Gist Tokens**: LLM ماڈل کو *fine-tune* کیا جاتا ہے کہ وہ لمبی ہدایات کو چند خصوصی *gist tokens* (مثلاً چند ہزار کی بجائے ۲۰-۳۰ token) میں *سمیٹ* دے۔ یہ token پھر اصل پرامپٹ کی جگہ استعمال ہوتے ہیں، معیار کی کم سے کم خرابی کے ساتھ ۲۶ گنا تک کمپریشن فراہم کرتے ہیں<sup>[\[12\]](https://systems-analysis.info/int/Prompt_compression_%E2%80%94_%D9%BE%D8%B1%D8%A7%D9%85%D9%BE%D9%B9_%DA%A9%D9%85%D9%BE%D8%B1%DB%8C%D8%B4%D9%86#cite_note-mu2023_gist-12)</sup>۔
- **Soft Prompt Tuning**: متنی پرامپٹ کی بجائے قابلِ تربیت *مجازی token* (embedding) استعمال کیے جاتے ہیں جو کسی مخصوص کام کے لیے ترتیب دیے جاتے ہیں۔
- **SelfCP**: جمی ہوئی LLM کو خود compressor کے طور پر استعمال کرنے کی تجویز دیتا ہے۔ متن کا ایک حصہ خاص نشانات کے ساتھ ماڈل کو دے کر، ماڈل ایک گھنا representation (*memory tokens*) تیار کرتا ہے جسے وہ جواب دینے کے لیے استعمال کرتا ہے<sup>[\[13\]](https://systems-analysis.info/int/Prompt_compression_%E2%80%94_%D9%BE%D8%B1%D8%A7%D9%85%D9%BE%D9%B9_%DA%A9%D9%85%D9%BE%D8%B1%DB%8C%D8%B4%D9%86#cite_note-gao2024_selfcp-13)</sup>۔

## کارکردگی اور سمجھوتے

- **رفتار میں اضافہ اور لاگت میں کمی**: چونکہ transformer کی پیچیدگی sequence کی لمبائی کے ساتھ مربع (\$O(n^2)\$) طور پر بڑھتی ہے، پرامپٹ کو کئی گنا کم کرنے سے نمایاں بچت ہوتی ہے۔ مثلاً، *gist tokens* ۲۶ گنا کمپریشن پر FLOPs میں ۴۰٪ تک کی بچت ظاہر کرتے ہیں<sup>[\[12\]](https://systems-analysis.info/int/Prompt_compression_%E2%80%94_%D9%BE%D8%B1%D8%A7%D9%85%D9%BE%D9%B9_%DA%A9%D9%85%D9%BE%D8%B1%DB%8C%D8%B4%D9%86#cite_note-mu2023_gist-12)</sup>۔
- **معیار میں بہتری**: بعض اوقات پرامپٹ کمپریشن جوابات کے معیار کو بہتر بھی کر سکتی ہے، اگر اصل متن میں شور یا گمراہ کن تفصیلات موجود ہوں۔ غیر متعلقہ سیاق و سباق کو ہٹانا ماڈل کو کام کے اہم پہلوؤں پر بہتر توجہ مرکوز کرنے میں مدد دیتا ہے۔
- **معیار کا سمجھوتہ (faithfulness)**: بہت زیادہ جارحانہ کمپریشن اہم تفصیلات (تاریخوں، ناموں، نفیوں) کے ضیاع کا باعث بن سکتی ہے، جو جواب کے معیار کو خراب کر دے گا۔ تجریدی طریقے خاص طور پر hallucination کے خطرے سے دوچار ہیں۔ مختصر شدہ پرامپٹ کی مکمل اور درست (*faithfulness*) نگرانی ایک کلیدی مسئلہ ہے۔

## دیگر شعبوں سے تعلق

- **Retrieval-Augmented Generation (RAG)**: RAG اور پرامپٹ کمپریشن گہرے طور پر جڑے ہوئے ہیں۔ RAG کو کمپریشن کے ایک بیرونی مرحلے کے طور پر دیکھا جا سکتا ہے: پورے ڈیٹا بیس کی پروسیسنگ کی بجائے متعلقہ دستاویزات کی تلاش اور انتخاب کیا جاتا ہے۔ پرامپٹ کمپریشن RAG کو مکمل کرتی ہے، LLM میں داخل کرنے سے پہلے پہلے سے منتخب شدہ دستاویزات کے حجم کو مزید کم کرکے۔
- **In-Context Learning**: سیاق و سباق میں مثالیں (مظاہرے) پرامپٹ کی لمبائی کو نمایاں طور پر بڑھاتی ہیں۔ ان مظاہروں کا کمپریشن (مثلاً *Instruction Distillation* کی مدد سے، جہاں بہت سی مثالوں کو ایک مختصر ہدایت سے بدلا جاتا ہے) تحقیق کا ایک فعال شعبہ ہے۔

## ادبیات

- Ali, M. et al. (2024). *Prompt-SAW: Semantic-Aware Winnowing for Prompt Compression*. arXiv:2403.00000.
- Gao, J.; Cao, Z.; Li, W. (2024). *SelfCP: Compressing Over-Limit Prompt via the Frozen Large Language Model Itself*. arXiv:2405.17052.
- Jiang, H. et al. (2023). *LLMLingua: Compressing Prompts for Accelerated Inference of Large Language Models*. arXiv:2310.05736.
- Jiang, H. et al. (2023). *LongLLMLingua: Accelerating and Enhancing LLMs in Long-Context Scenarios via Prompt Compression*. arXiv:2310.06839.
- Jung, H.; Kim, K. (2023). *PCRL: Discrete Prompt Compression with Reinforcement Learning*. arXiv:2308.08758.
- Li, M. et al. (2023). *Selective-Context: Compressing Context to Summarise and Answer Questions*. arXiv:2307.00000.
- Mu, J. et al. (2023). *Learning to Compress Prompts with Gist Tokens*. NeurIPS 2023.
- Xu, F.; Shi, W.; Choi, E. (2023). *RECOMP: Improving Retrieval-Augmented LMs with Compression and Selective Augmentation*. arXiv:2310.04408.
- Yang, C. et al. (2023). *PRCA: Prompt Compression with Reinforced Context Aggregation*. arXiv:2311.00000.
- Yoon, J. et al. (2024). *CompAct: Interactive Prompt Compression for Long-Document QA*. arXiv:2402.00000.
- Zhang, S. et al. (2024). *Efficient Prompting Methods for Large Language Models: A Survey*. arXiv:2404.01077.
- Jha, S. et al. (2024). *Characterizing Prompt Compression Methods for Long Context Inference*. arXiv:2407.08892.

## نوٹ

1.  <span id="cite_note-jha2024-1">[↑](https://systems-analysis.info/int/Prompt_compression_%E2%80%94_%D9%BE%D8%B1%D8%A7%D9%85%D9%BE%D9%B9_%DA%A9%D9%85%D9%BE%D8%B1%DB%8C%D8%B4%D9%86#cite_ref-jha2024_1-0) Jha, S., et al. (2024). «Characterizing Prompt Compression Methods for Long Context Inference». *arXiv*. <a href="https://arxiv.org/html/2407.08892v1" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-survey2024-2">[↑](https://systems-analysis.info/int/Prompt_compression_%E2%80%94_%D9%BE%D8%B1%D8%A7%D9%85%D9%BE%D9%B9_%DA%A9%D9%85%D9%BE%D8%B1%DB%8C%D8%B4%D9%86#cite_ref-survey2024_2-0) «Efficient Prompting Methods for Large Language Models: A Survey». *arXiv*. <a href="https://arxiv.org/html/2404.01077v2" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-datacamp-guide-3">[↑](https://systems-analysis.info/int/Prompt_compression_%E2%80%94_%D9%BE%D8%B1%D8%A7%D9%85%D9%BE%D9%B9_%DA%A9%D9%85%D9%BE%D8%B1%DB%8C%D8%B4%D9%86#cite_ref-datacamp-guide_3-0) «Prompt Compression: A Guide With Python Examples». *DataCamp*. <a href="https://www.datacamp.com/tutorial/prompt-compression" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-jiang2023_llmlingua-4">[↑](https://systems-analysis.info/int/Prompt_compression_%E2%80%94_%D9%BE%D8%B1%D8%A7%D9%85%D9%BE%D9%B9_%DA%A9%D9%85%D9%BE%D8%B1%DB%8C%D8%B4%D9%86#cite_ref-jiang2023_llmlingua_4-0) Jiang, H., et al. (2023). «LLMLingua: Compressing Prompts for Accelerated Inference of Large Language Models». *arXiv*.</span>
5.  <span id="cite_note-li2023_selective-5">[↑](https://systems-analysis.info/int/Prompt_compression_%E2%80%94_%D9%BE%D8%B1%D8%A7%D9%85%D9%BE%D9%B9_%DA%A9%D9%85%D9%BE%D8%B1%DB%8C%D8%B4%D9%86#cite_ref-li2023_selective_5-0) Li, M. (2023). «Compressing context to summarize and answer questions». *arXiv*.</span>
6.  <span id="cite_note-jung2023_pcrl-6">[↑](https://systems-analysis.info/int/Prompt_compression_%E2%80%94_%D9%BE%D8%B1%D8%A7%D9%85%D9%BE%D9%B9_%DA%A9%D9%85%D9%BE%D8%B1%DB%8C%D8%B4%D9%86#cite_ref-jung2023_pcrl_6-0) Jung, H., & Kim, K. (2023). «Learning to Compress Prompts with Reinforcement Learning». *arXiv*.</span>
7.  <span id="cite_note-xu2024_recomp-7">[↑](https://systems-analysis.info/int/Prompt_compression_%E2%80%94_%D9%BE%D8%B1%D8%A7%D9%85%D9%BE%D9%B9_%DA%A9%D9%85%D9%BE%D8%B1%DB%8C%D8%B4%D9%86#cite_ref-xu2024_recomp_7-0) Xu, F., et al. (2024). «RECOMP: Improving Retrieval-Augmented LMs with Compression and Selective Augmentation». *arXiv*.</span>
8.  <span id="cite_note-yang2023_prca-8">[↑](https://systems-analysis.info/int/Prompt_compression_%E2%80%94_%D9%BE%D8%B1%D8%A7%D9%85%D9%BE%D9%B9_%DA%A9%D9%85%D9%BE%D8%B1%DB%8C%D8%B4%D9%86#cite_ref-yang2023_prca_8-0) Yang, C., et al. (2023). «PRCA: A new framework for prompt compression». *arXiv*.</span>
9.  <span id="cite_note-ali2024_promptsaw-9">[↑](https://systems-analysis.info/int/Prompt_compression_%E2%80%94_%D9%BE%D8%B1%D8%A7%D9%85%D9%BE%D9%B9_%DA%A9%D9%85%D9%BE%D8%B1%DB%8C%D8%B4%D9%86#cite_ref-ali2024_promptsaw_9-0) Ali, M., et al. (2024). «Prompt-SAW: A new method for prompt compression». *arXiv*.</span>
10. <span id="cite_note-pradeep2023_reranker-10">[↑](https://systems-analysis.info/int/Prompt_compression_%E2%80%94_%D9%BE%D8%B1%D8%A7%D9%85%D9%BE%D9%B9_%DA%A9%D9%85%D9%BE%D8%B1%DB%8C%D8%B4%D9%86#cite_ref-pradeep2023_reranker_10-0) Pradeep, R., et al. (2023). «How to select the best passages for RAG?». *arXiv*.</span>
11. <span id="cite_note-yoon2024_compact-11">[↑](https://systems-analysis.info/int/Prompt_compression_%E2%80%94_%D9%BE%D8%B1%D8%A7%D9%85%D9%BE%D9%B9_%DA%A9%D9%85%D9%BE%D8%B1%DB%8C%D8%B4%D9%86#cite_ref-yoon2024_compact_11-0) Yoon, J., et al. (2024). «CompAct: A new framework for interactive prompt compression». *arXiv*.</span>
12. <span id="cite_note-mu2023_gist-12">↑ <sup>[12.0](https://systems-analysis.info/int/Prompt_compression_%E2%80%94_%D9%BE%D8%B1%D8%A7%D9%85%D9%BE%D9%B9_%DA%A9%D9%85%D9%BE%D8%B1%DB%8C%D8%B4%D9%86#cite_ref-mu2023_gist_12-0)</sup> <sup>[12.1](https://systems-analysis.info/int/Prompt_compression_%E2%80%94_%D9%BE%D8%B1%D8%A7%D9%85%D9%BE%D9%B9_%DA%A9%D9%85%D9%BE%D8%B1%DB%8C%D8%B4%D9%86#cite_ref-mu2023_gist_12-1)</sup> Mu, J., et al. (2023). «Learning to Compress Prompts with Gist Tokens». *OpenReview*. <a href="https://openreview.net/forum?id=2DtxPCL3T5" class="external autonumber" rel="nofollow">[4]</a></span>
13. <span id="cite_note-gao2024_selfcp-13">[↑](https://systems-analysis.info/int/Prompt_compression_%E2%80%94_%D9%BE%D8%B1%D8%A7%D9%85%D9%BE%D9%B9_%DA%A9%D9%85%D9%BE%D8%B1%DB%8C%D8%B4%D9%86#cite_ref-gao2024_selfcp_13-0) Gao, C., et al. (2024). «SelfCP: Compressing Over-Limit Prompt via the Frozen Large Language Model Itself». *arXiv*. <a href="https://arxiv.org/html/2405.17052v2" class="external autonumber" rel="nofollow">[5]</a></span>
