---
title: "Prompt compression — فشرده‌سازی پرامپت"
source: "https://systems-analysis.info/int/Prompt_compression_%E2%80%94_%D9%81%D8%B4%D8%B1%D8%AF%D9%87%E2%80%8C%D8%B3%D8%A7%D8%B2%DB%8C_%D9%BE%D8%B1%D8%A7%D9%85%D9%BE%D8%AA"
wiki: "systems-analysis.info/int"
article: "Prompt_compression_—_فشرده‌سازی_پرامپت"
language: "fa"
categories:
  - "Category:Large language models"
  - "Category:Machine learning"
  - "Category:Persian"
  - "Category:Prompt engineering"
revision_id: 6002
wiki_created_at: 2026-09-06T23:57:00Z
wiki_modified_at: 2026-09-06T23:57:00Z
downloaded_at: 2026-09-07T23:11:29Z
---

# Prompt compression — فشرده‌سازی پرامپت

**فشرده‌سازی پرامپت** (به انگلیسی: *prompt compression*) — مجموعه‌ای از روش‌ها در prompt engineering است که با هدف کاهش طول متن ورودی (پرامپت) برای مدل‌های زبانی بزرگ (LLM) با حفظ اطلاعات کلیدی به‌کار می‌رود<sup>[\[1\]](https://systems-analysis.info/int/Prompt_compression_%E2%80%94_%D9%81%D8%B4%D8%B1%D8%AF%D9%87%E2%80%8C%D8%B3%D8%A7%D8%B2%DB%8C_%D9%BE%D8%B1%D8%A7%D9%85%D9%BE%D8%AA#cite_note-jha2024-1)</sup>. با افزایش پنجره بافت LLM تا میلیون‌ها token (برای مثال در Google Gemini)، امکان پردازش متون بسیار طولانی فراهم شد، اما این امر مشکلات جدیدی ایجاد کرد: هزینه بالای فراخوانی‌ها، افزایش تأخیر و کاهش کیفیت استدلال به دلیل پدیده «گم شدن در میانه»<sup>[\[2\]](https://systems-analysis.info/int/Prompt_compression_%E2%80%94_%D9%81%D8%B4%D8%B1%D8%AF%D9%87%E2%80%8C%D8%B3%D8%A7%D8%B2%DB%8C_%D9%BE%D8%B1%D8%A7%D9%85%D9%BE%D8%AA#cite_note-survey2024-2)</sup>.

فشرده‌سازی پرامپت این مشکلات را با تمرکز مهم‌ترین داده‌ها در ورودی کوتاه‌شده و حذف اطلاعات اضافه حل می‌کند. این کار خطر تجاوز از محدودیت بافت را کاهش می‌دهد، تولید متن را تسریع می‌کند و هزینه را کم می‌کند، در حالی که دقت پاسخ‌ها حفظ می‌شود<sup>[\[3\]](https://systems-analysis.info/int/Prompt_compression_%E2%80%94_%D9%81%D8%B4%D8%B1%D8%AF%D9%87%E2%80%8C%D8%B3%D8%A7%D8%B2%DB%8C_%D9%BE%D8%B1%D8%A7%D9%85%D9%BE%D8%AA#cite_note-datacamp-guide-3)</sup>.

## روش‌های فشرده‌سازی پرامپت

روش‌های فشرده‌سازی پرامپت را می‌توان به چند دسته اصلی تقسیم کرد.

### حذف token (فیلترگذاری)

این رویکرد شامل حذف کم‌اطلاع‌ترین token‌ها، عبارات یا جملات از متن اصلی بدون تغییر بخش‌های باقی‌مانده است. اهمیت token‌ها به‌صورت휴ریستیکی تعیین می‌شود.

- **LLMLingua**: روشی که توسط Microsoft توسعه یافته و perplexity هر token را محاسبه می‌کند و token‌هایی را که تأثیر کمی بر قابلیت پیش‌بینی متن دارند حذف می‌کند. در نسخه **LongLLMLingua** این رویکرد برای اسناد طولانی تطبیق داده شده و ارتباط بخش‌ها با درخواست خاص کاربر را در نظر می‌گیرد<sup>[\[4\]](https://systems-analysis.info/int/Prompt_compression_%E2%80%94_%D9%81%D8%B4%D8%B1%D8%AF%D9%87%E2%80%8C%D8%B3%D8%A7%D8%B2%DB%8C_%D9%BE%D8%B1%D8%A7%D9%85%D9%BE%D8%AA#cite_note-jiang2023_llmlingua-4)</sup>.
- **Selective-Context**: از یک مدل زبانی کوچک برای ارزیابی *self-information* هر token استفاده می‌کند و token‌هایی با کمترین اطلاعات را حذف می‌کند<sup>[\[5\]](https://systems-analysis.info/int/Prompt_compression_%E2%80%94_%D9%81%D8%B4%D8%B1%D8%AF%D9%87%E2%80%8C%D8%B3%D8%A7%D8%B2%DB%8C_%D9%BE%D8%B1%D8%A7%D9%85%D9%BE%D8%AA#cite_note-li2023_selective-5)</sup>.
- **PCRL** (Prompt Compression via Reinforcement Learning): با استفاده از Reinforcement Learning یک عامل را آموزش می‌دهد تا برای هر token تصمیم بگیرد — «نگه داشتن» یا «حذف» — با هدف بیشینه کردن معیار کیفیت (مثلاً ROUGE) پاسخ نهایی<sup>[\[6\]](https://systems-analysis.info/int/Prompt_compression_%E2%80%94_%D9%81%D8%B4%D8%B1%D8%AF%D9%87%E2%80%8C%D8%B3%D8%A7%D8%B2%DB%8C_%D9%BE%D8%B1%D8%A7%D9%85%D9%BE%D8%AA#cite_note-jung2023_pcrl-6)</sup>.

### فشرده‌سازی انتزاعی (خلاصه‌سازی)

در این رویکرد، مدل فشرده‌ساز (معمولاً با اندازه کوچک‌تر) یک خلاصه انتزاعی کوتاه از متن اصلی تولید می‌کند که سپس به LLM اصلی منتقل می‌شود.

- **RECOMP** (Retrieval-Compression-Prompting): برای هر سند در پایگاه دانش از پیش یک خلاصه کوتاه (*summary*) با در نظر گرفتن درخواست‌های احتمالی کاربر (*query-aware summary*) تولید می‌شود. این امر نه تنها فشرده‌سازی بلکه پیش‌پردازش اطلاعات را نیز ممکن می‌سازد<sup>[\[7\]](https://systems-analysis.info/int/Prompt_compression_%E2%80%94_%D9%81%D8%B4%D8%B1%D8%AF%D9%87%E2%80%8C%D8%B3%D8%A7%D8%B2%DB%8C_%D9%BE%D8%B1%D8%A7%D9%85%D9%BE%D8%AA#cite_note-xu2024_recomp-7)</sup>.
- **PRCA** (Prompt Compression with Reinforced Context Aggregation): آموزش مدل خلاصه‌ساز را با Reinforcement Learning ترکیب می‌کند تا خلاصه‌هایی تولید شود که کیفیت پاسخ‌های LLM اصلی را به حداکثر برساند<sup>[\[8\]](https://systems-analysis.info/int/Prompt_compression_%E2%80%94_%D9%81%D8%B4%D8%B1%D8%AF%D9%87%E2%80%8C%D8%B3%D8%A7%D8%B2%DB%8C_%D9%BE%D8%B1%D8%A7%D9%85%D9%BE%D8%AA#cite_note-yang2023_prca-8)</sup>.
- **Prompt-SAW** (Semantic Aware Winnowing): پیش از خلاصه‌سازی، یک گراف دانش (موجودیت‌ها و روابط) از متن استخراج می‌کند، گره‌های مرتبط گراف را انتخاب کرده و بر اساس آن‌ها متن فشرده‌شده تولید می‌کند<sup>[\[9\]](https://systems-analysis.info/int/Prompt_compression_%E2%80%94_%D9%81%D8%B4%D8%B1%D8%AF%D9%87%E2%80%8C%D8%B3%D8%A7%D8%B2%DB%8C_%D9%BE%D8%B1%D8%A7%D9%85%D9%BE%D8%AA#cite_note-ali2024_promptsaw-9)</sup>.

### فشرده‌سازی استخراجی

این روش بخش‌های کلیدی (جملات، پاراگراف‌ها) را از متن اصلی بدون بازنویسی آن‌ها استخراج می‌کند.

- **Reranker-LLMs**: از یک مدل رتبه‌بندی (*reranker*) استفاده می‌کند که اهمیت هر پاراگراف یا سند را برای درخواست جاری ارزیابی کرده و فقط مرتبط‌ترین‌ها را انتخاب می‌کند<sup>[\[10\]](https://systems-analysis.info/int/Prompt_compression_%E2%80%94_%D9%81%D8%B4%D8%B1%D8%AF%D9%87%E2%80%8C%D8%B3%D8%A7%D8%B2%DB%8C_%D9%BE%D8%B1%D8%A7%D9%85%D9%BE%D8%AA#cite_note-pradeep2023_reranker-10)</sup>.
- **CompAct**: استخراج-خلاصه‌سازی تکراری را نشان می‌دهد. مدل به‌صورت متوالی بخش‌هایی از متن طولانی را می‌گیرد، آن‌ها را فشرده می‌کند و بررسی می‌کند که آیا اطلاعات کافی برای پاسخ وجود دارد. اگر نه، بخش بعدی را اضافه کرده و دوباره فشرده می‌کند و به فشرده‌سازی قابل توجهی با حفظ کیفیت دست می‌یابد<sup>[\[11\]](https://systems-analysis.info/int/Prompt_compression_%E2%80%94_%D9%81%D8%B4%D8%B1%D8%AF%D9%87%E2%80%8C%D8%B3%D8%A7%D8%B2%DB%8C_%D9%BE%D8%B1%D8%A7%D9%85%D9%BE%D8%AA#cite_note-yoon2024_compact-11)</sup>.

### تقطیر و «token‌های حافظه»

دسته جدیدی از روش‌ها که در آن به جای متن، مدل token‌های جایگزین یا embedding‌های آموزش‌دیده‌ای دریافت می‌کند که اطلاعات فشرده‌شده را در خود دارند.

- **Gist Tokens**: مدل LLM برای «جمع‌آوری» دستورالعمل‌های طولانی در مجموعه‌ای کوچک از *gist-token*‌های ویژه (مثلاً ۲۰ تا ۳۰ token به جای چند هزار token) fine-tuning می‌شود. این token‌ها سپس به جای پرامپت اصلی استفاده می‌شوند و تا ۲۶ برابر فشرده‌سازی با حداقل افت کیفیت فراهم می‌کنند<sup>[\[12\]](https://systems-analysis.info/int/Prompt_compression_%E2%80%94_%D9%81%D8%B4%D8%B1%D8%AF%D9%87%E2%80%8C%D8%B3%D8%A7%D8%B2%DB%8C_%D9%BE%D8%B1%D8%A7%D9%85%D9%BE%D8%AA#cite_note-mu2023_gist-12)</sup>.
- **Soft Prompt Tuning**: به جای پرامپت متنی از «token‌های مجازی» قابل آموزش (embedding‌ها) استفاده می‌شود که برای حل وظیفه خاص تنظیم می‌شوند.
- **SelfCP**: پیشنهاد می‌کند از خود LLM منجمد به عنوان فشرده‌ساز استفاده شود. با ارائه بخشی از متن با نشانگرهای ویژه، مدل یک بازنمایی متراکم (*memory tokens*) تولید می‌کند که سپس برای پاسخ‌دادن توسط همان مدل استفاده می‌شود<sup>[\[13\]](https://systems-analysis.info/int/Prompt_compression_%E2%80%94_%D9%81%D8%B4%D8%B1%D8%AF%D9%87%E2%80%8C%D8%B3%D8%A7%D8%B2%DB%8C_%D9%BE%D8%B1%D8%A7%D9%85%D9%BE%D8%AA#cite_note-gao2024_selfcp-13)</sup>.

## کارایی و مصالحه‌ها

- **تسریع و کاهش هزینه**: از آنجا که پیچیدگی transformer به‌صورت درجه دوم (\$O(n^2)\$) با طول دنباله رشد می‌کند، کاهش چند برابری پرامپت صرفه‌جویی قابل توجهی به همراه دارد. برای مثال، *gist tokens* با فشرده‌سازی ۲۶ برابری تا ۴۰٪ صرفه‌جویی در FLOPs نشان می‌دهند<sup>[\[12\]](https://systems-analysis.info/int/Prompt_compression_%E2%80%94_%D9%81%D8%B4%D8%B1%D8%AF%D9%87%E2%80%8C%D8%B3%D8%A7%D8%B2%DB%8C_%D9%BE%D8%B1%D8%A7%D9%85%D9%BE%D8%AA#cite_note-mu2023_gist-12)</sup>.
- **بهبود کیفیت**: گاهی فشرده‌سازی پرامپت می‌تواند کیفیت پاسخ‌ها را نیز بهبود بخشد، اگر متن اصلی حاوی نویز یا جزئیات حواس‌پرت‌کن بوده باشد. حذف بافت نامرتبط به مدل کمک می‌کند تا بهتر بر جنبه‌های مهم وظیفه تمرکز کند.
- **مصالحه کیفیت (faithfulness)**: فشرده‌سازی بیش از حد تهاجمی می‌تواند به از دست رفتن جزئیات مهم (تاریخ‌ها، اسامی، نفی‌ها) منجر شود و کیفیت پاسخ را کاهش دهد. روش‌های انتزاعی به‌ویژه در معرض خطر توهم هستند. کنترل کامل بودن و دقت (*faithfulness*) پرامپت فشرده‌شده وظیفه‌ای کلیدی است.

## ارتباط با سایر حوزه‌ها

- **Retrieval-Augmented Generation (RAG)**: RAG و فشرده‌سازی پرامپت ارتباط نزدیکی دارند. RAG را می‌توان به عنوان مرحله‌ای خارجی از فشرده‌سازی در نظر گرفت: به جای پردازش کل پایگاه داده، اسناد مرتبط جستجو و انتخاب می‌شوند. فشرده‌سازی پرامپت RAG را تکمیل می‌کند و حجم اسناد از پیش انتخاب‌شده را پیش از ارسال به LLM کاهش می‌دهد.
- **In-Context Learning**: نمونه‌های موجود در بافت (نمایش‌ها) طول پرامپت را به‌طور قابل توجهی افزایش می‌دهند. فشرده‌سازی این نمایش‌ها (برای مثال با استفاده از *Instruction Distillation*، که در آن مجموعه‌ای از نمونه‌ها با یک دستورالعمل کوتاه جایگزین می‌شوند) حوزه‌ای فعال از تحقیقات است.

## منابع

- Ali, M. et al. (2024). *Prompt-SAW: Semantic-Aware Winnowing for Prompt Compression*. arXiv:2403.00000.
- Gao, J.; Cao, Z.; Li, W. (2024). *SelfCP: Compressing Over-Limit Prompt via the Frozen Large Language Model Itself*. arXiv:2405.17052.
- Jiang, H. et al. (2023). *LLMLingua: Compressing Prompts for Accelerated Inference of Large Language Models*. arXiv:2310.05736.
- Jiang, H. et al. (2023). *LongLLMLingua: Accelerating and Enhancing LLMs in Long-Context Scenarios via Prompt Compression*. arXiv:2310.06839.
- Jung, H.; Kim, K. (2023). *PCRL: Discrete Prompt Compression with Reinforcement Learning*. arXiv:2308.08758.
- Li, M. et al. (2023). *Selective-Context: Compressing Context to Summarise and Answer Questions*. arXiv:2307.00000.
- Mu, J. et al. (2023). *Learning to Compress Prompts with Gist Tokens*. NeurIPS 2023.
- Xu, F.; Shi, W.; Choi, E. (2023). *RECOMP: Improving Retrieval-Augmented LMs with Compression and Selective Augmentation*. arXiv:2310.04408.
- Yang, C. et al. (2023). *PRCA: Prompt Compression with Reinforced Context Aggregation*. arXiv:2311.00000.
- Yoon, J. et al. (2024). *CompAct: Interactive Prompt Compression for Long-Document QA*. arXiv:2402.00000.
- Zhang, S. et al. (2024). *Efficient Prompting Methods for Large Language Models: A Survey*. arXiv:2404.01077.
- Jha, S. et al. (2024). *Characterizing Prompt Compression Methods for Long Context Inference*. arXiv:2407.08892.

## یادداشت‌ها

1.  <span id="cite_note-jha2024-1">[↑](https://systems-analysis.info/int/Prompt_compression_%E2%80%94_%D9%81%D8%B4%D8%B1%D8%AF%D9%87%E2%80%8C%D8%B3%D8%A7%D8%B2%DB%8C_%D9%BE%D8%B1%D8%A7%D9%85%D9%BE%D8%AA#cite_ref-jha2024_1-0) Jha, S., et al. (2024). «Characterizing Prompt Compression Methods for Long Context Inference». *arXiv*. <a href="https://arxiv.org/html/2407.08892v1" class="external autonumber" rel="nofollow">[۱]</a></span>
2.  <span id="cite_note-survey2024-2">[↑](https://systems-analysis.info/int/Prompt_compression_%E2%80%94_%D9%81%D8%B4%D8%B1%D8%AF%D9%87%E2%80%8C%D8%B3%D8%A7%D8%B2%DB%8C_%D9%BE%D8%B1%D8%A7%D9%85%D9%BE%D8%AA#cite_ref-survey2024_2-0) «Efficient Prompting Methods for Large Language Models: A Survey». *arXiv*. <a href="https://arxiv.org/html/2404.01077v2" class="external autonumber" rel="nofollow">[۲]</a></span>
3.  <span id="cite_note-datacamp-guide-3">[↑](https://systems-analysis.info/int/Prompt_compression_%E2%80%94_%D9%81%D8%B4%D8%B1%D8%AF%D9%87%E2%80%8C%D8%B3%D8%A7%D8%B2%DB%8C_%D9%BE%D8%B1%D8%A7%D9%85%D9%BE%D8%AA#cite_ref-datacamp-guide_3-0) «Prompt Compression: A Guide With Python Examples». *DataCamp*. <a href="https://www.datacamp.com/tutorial/prompt-compression" class="external autonumber" rel="nofollow">[۳]</a></span>
4.  <span id="cite_note-jiang2023_llmlingua-4">[↑](https://systems-analysis.info/int/Prompt_compression_%E2%80%94_%D9%81%D8%B4%D8%B1%D8%AF%D9%87%E2%80%8C%D8%B3%D8%A7%D8%B2%DB%8C_%D9%BE%D8%B1%D8%A7%D9%85%D9%BE%D8%AA#cite_ref-jiang2023_llmlingua_4-0) Jiang, H., et al. (2023). «LLMLingua: Compressing Prompts for Accelerated Inference of Large Language Models». *arXiv*.</span>
5.  <span id="cite_note-li2023_selective-5">[↑](https://systems-analysis.info/int/Prompt_compression_%E2%80%94_%D9%81%D8%B4%D8%B1%D8%AF%D9%87%E2%80%8C%D8%B3%D8%A7%D8%B2%DB%8C_%D9%BE%D8%B1%D8%A7%D9%85%D9%BE%D8%AA#cite_ref-li2023_selective_5-0) Li, M. (2023). «Compressing context to summarize and answer questions». *arXiv*.</span>
6.  <span id="cite_note-jung2023_pcrl-6">[↑](https://systems-analysis.info/int/Prompt_compression_%E2%80%94_%D9%81%D8%B4%D8%B1%D8%AF%D9%87%E2%80%8C%D8%B3%D8%A7%D8%B2%DB%8C_%D9%BE%D8%B1%D8%A7%D9%85%D9%BE%D8%AA#cite_ref-jung2023_pcrl_6-0) Jung, H., & Kim, K. (2023). «Learning to Compress Prompts with Reinforcement Learning». *arXiv*.</span>
7.  <span id="cite_note-xu2024_recomp-7">[↑](https://systems-analysis.info/int/Prompt_compression_%E2%80%94_%D9%81%D8%B4%D8%B1%D8%AF%D9%87%E2%80%8C%D8%B3%D8%A7%D8%B2%DB%8C_%D9%BE%D8%B1%D8%A7%D9%85%D9%BE%D8%AA#cite_ref-xu2024_recomp_7-0) Xu, F., et al. (2024). «RECOMP: Improving Retrieval-Augmented LMs with Compression and Selective Augmentation». *arXiv*.</span>
8.  <span id="cite_note-yang2023_prca-8">[↑](https://systems-analysis.info/int/Prompt_compression_%E2%80%94_%D9%81%D8%B4%D8%B1%D8%AF%D9%87%E2%80%8C%D8%B3%D8%A7%D8%B2%DB%8C_%D9%BE%D8%B1%D8%A7%D9%85%D9%BE%D8%AA#cite_ref-yang2023_prca_8-0) Yang, C., et al. (2023). «PRCA: A new framework for prompt compression». *arXiv*.</span>
9.  <span id="cite_note-ali2024_promptsaw-9">[↑](https://systems-analysis.info/int/Prompt_compression_%E2%80%94_%D9%81%D8%B4%D8%B1%D8%AF%D9%87%E2%80%8C%D8%B3%D8%A7%D8%B2%DB%8C_%D9%BE%D8%B1%D8%A7%D9%85%D9%BE%D8%AA#cite_ref-ali2024_promptsaw_9-0) Ali, M., et al. (2024). «Prompt-SAW: A new method for prompt compression». *arXiv*.</span>
10. <span id="cite_note-pradeep2023_reranker-10">[↑](https://systems-analysis.info/int/Prompt_compression_%E2%80%94_%D9%81%D8%B4%D8%B1%D8%AF%D9%87%E2%80%8C%D8%B3%D8%A7%D8%B2%DB%8C_%D9%BE%D8%B1%D8%A7%D9%85%D9%BE%D8%AA#cite_ref-pradeep2023_reranker_10-0) Pradeep, R., et al. (2023). «How to select the best passages for RAG?». *arXiv*.</span>
11. <span id="cite_note-yoon2024_compact-11">[↑](https://systems-analysis.info/int/Prompt_compression_%E2%80%94_%D9%81%D8%B4%D8%B1%D8%AF%D9%87%E2%80%8C%D8%B3%D8%A7%D8%B2%DB%8C_%D9%BE%D8%B1%D8%A7%D9%85%D9%BE%D8%AA#cite_ref-yoon2024_compact_11-0) Yoon, J., et al. (2024). «CompAct: A new framework for interactive prompt compression». *arXiv*.</span>
12. <span id="cite_note-mu2023_gist-12">↑ <sup>[12.0](https://systems-analysis.info/int/Prompt_compression_%E2%80%94_%D9%81%D8%B4%D8%B1%D8%AF%D9%87%E2%80%8C%D8%B3%D8%A7%D8%B2%DB%8C_%D9%BE%D8%B1%D8%A7%D9%85%D9%BE%D8%AA#cite_ref-mu2023_gist_12-0)</sup> <sup>[12.1](https://systems-analysis.info/int/Prompt_compression_%E2%80%94_%D9%81%D8%B4%D8%B1%D8%AF%D9%87%E2%80%8C%D8%B3%D8%A7%D8%B2%DB%8C_%D9%BE%D8%B1%D8%A7%D9%85%D9%BE%D8%AA#cite_ref-mu2023_gist_12-1)</sup> Mu, J., et al. (2023). «Learning to Compress Prompts with Gist Tokens». *OpenReview*. <a href="https://openreview.net/forum?id=2DtxPCL3T5" class="external autonumber" rel="nofollow">[۴]</a></span>
13. <span id="cite_note-gao2024_selfcp-13">[↑](https://systems-analysis.info/int/Prompt_compression_%E2%80%94_%D9%81%D8%B4%D8%B1%D8%AF%D9%87%E2%80%8C%D8%B3%D8%A7%D8%B2%DB%8C_%D9%BE%D8%B1%D8%A7%D9%85%D9%BE%D8%AA#cite_ref-gao2024_selfcp_13-0) Gao, C., et al. (2024). «SelfCP: Compressing Over-Limit Prompt via the Frozen Large Language Model Itself». *arXiv*. <a href="https://arxiv.org/html/2405.17052v2" class="external autonumber" rel="nofollow">[۵]</a></span>
