---
title: "Compressione del prompt"
source: "https://systems-analysis.info/int/Compressione_del_prompt"
wiki: "systems-analysis.info/int"
article: "Compressione_del_prompt"
language: "it"
categories:
  - "Category:Italian"
  - "Category:Large language models"
  - "Category:Machine learning"
  - "Category:Prompt engineering"
revision_id: 1106
wiki_created_at: 2026-09-06T22:43:29Z
wiki_modified_at: 2026-09-06T22:43:29Z
downloaded_at: 2026-09-07T22:44:08Z
---

# Compressione del prompt

**Compressione del prompt** (in inglese *prompt compression*) — è un insieme di metodi nel prompt engineering volti a ridurre la lunghezza del testo di input (prompt) per i grandi modelli linguistici (LLM) preservando le informazioni chiave<sup>[\[1\]](https://systems-analysis.info/int/Compressione_del_prompt#cite_note-jha2024-1)</sup>. Con l'aumento della finestra di contesto degli LLM fino a milioni di token (ad esempio, in Google Gemini) è diventato possibile elaborare testi molto lunghi, ma ciò ha creato nuovi problemi: l'elevato costo delle chiamate, l'aumento della latenza e il calo della qualità del ragionamento a causa dell'effetto «lost in the middle»<sup>[\[2\]](https://systems-analysis.info/int/Compressione_del_prompt#cite_note-survey2024-2)</sup>.

La compressione del prompt risolve questi problemi concentrando nell'input ridotto i dati più rilevanti ed eliminando quelli ridondanti. Ciò riduce il rischio di superare il limite di contesto, accelera la generazione e abbassa i costi, mantenendo al contempo la precisione delle risposte<sup>[\[3\]](https://systems-analysis.info/int/Compressione_del_prompt#cite_note-datacamp-guide-3)</sup>.

## Metodi di compressione del prompt

I metodi di compressione del prompt possono essere suddivisi in alcune classi principali.

### Rimozione di token (filtraggio)

Questo approccio consiste nell'eliminare i token, le frasi o le proposizioni meno informativi dal testo originale senza modificare le parti rimanenti. L'importanza dei token viene determinata in modo euristico.

- **LLMLingua**: Metodo sviluppato da Microsoft che calcola la perplexity di ciascun token ed elimina quelli che hanno scarsa influenza sulla prevedibilità del testo. Nella versione **LongLLMLingua** questo approccio è adattato per documenti lunghi, tenendo conto della rilevanza dei frammenti rispetto alla specifica richiesta dell'utente<sup>[\[4\]](https://systems-analysis.info/int/Compressione_del_prompt#cite_note-jiang2023_llmlingua-4)</sup>.
- **Selective-Context**: Utilizza un modello linguistico di piccole dimensioni per valutare la *self-information* di ciascun token ed elimina i token con la minore informatività<sup>[\[5\]](https://systems-analysis.info/int/Compressione_del_prompt#cite_note-li2023_selective-5)</sup>.
- **PCRL** (Prompt Compression via Reinforcement Learning): Addestra un agente tramite Reinforcement Learning a prendere una decisione per ciascun token — «mantenere» o «eliminare» — con l'obiettivo di massimizzare la metrica di qualità (ad esempio, ROUGE) della risposta finale<sup>[\[6\]](https://systems-analysis.info/int/Compressione_del_prompt#cite_note-jung2023_pcrl-6)</sup>.

### Compressione astrattiva (riassunto)

In questo approccio un modello compressore (solitamente di dimensioni minori) genera un breve riassunto astratto del testo originale, che viene poi fornito all'LLM principale.

- **RECOMP** (Retrieval-Compression-Prompting): Per ciascun documento nella base di conoscenza viene generato in anticipo un breve riassunto (*summary*) che tiene conto delle possibili richieste dell'utente (*query-aware summary*). Ciò consente non solo di comprimere, ma anche di pre-elaborare le informazioni<sup>[\[7\]](https://systems-analysis.info/int/Compressione_del_prompt#cite_note-xu2024_recomp-7)</sup>.
- **PRCA** (Prompt Compression with Reinforced Context Aggregation): Combina l'addestramento del modello di riassunto con il Reinforcement Learning per generare riassunti che migliorano al massimo la qualità delle risposte dell'LLM principale<sup>[\[8\]](https://systems-analysis.info/int/Compressione_del_prompt#cite_note-yang2023_prca-8)</sup>.
- **Prompt-SAW** (Semantic Aware Winnowing): Prima del riassunto estrae dal testo un grafo della conoscenza (entità e relazioni), seleziona i nodi rilevanti del grafo e su questa base genera il testo compresso<sup>[\[9\]](https://systems-analysis.info/int/Compressione_del_prompt#cite_note-ali2024_promptsaw-9)</sup>.

### Compressione estrattiva

Questo metodo estrae i frammenti chiave (frasi, paragrafi) dal testo originale senza riformularli.

- **Reranker-LLMs**: Utilizza un modello di ranking (*reranker*) che valuta l'importanza di ciascun paragrafo o documento rispetto alla richiesta corrente e seleziona solo i più rilevanti<sup>[\[10\]](https://systems-analysis.info/int/Compressione_del_prompt#cite_note-pradeep2023_reranker-10)</sup>.
- **CompAct**: Dimostra un'estrazione-riassunto iterativa. Il modello prende sequenzialmente segmenti di un testo lungo, li comprime e verifica se le informazioni siano sufficienti per rispondere. In caso contrario, aggiunge il segmento successivo e comprime nuovamente, raggiungendo una compressione significativa mantenendo la qualità<sup>[\[11\]](https://systems-analysis.info/int/Compressione_del_prompt#cite_note-yoon2024_compact-11)</sup>.

### Distillazione e «token di memoria»

Una nuova classe di metodi in cui, al posto del testo, il modello riceve token sostitutivi appositamente addestrati o embedding contenenti informazioni compresse.

- **Gist Tokens**: Il modello LLM viene fine-tuned per «condensare» istruzioni lunghe in un piccolo insieme di speciali *gist token* (ad esempio, 20-30 token al posto di alcune migliaia). Questi token vengono poi utilizzati al posto del prompt originale, garantendo fino a 26 volte la compressione con una perdita di qualità minima<sup>[\[12\]](https://systems-analysis.info/int/Compressione_del_prompt#cite_note-mu2023_gist-12)</sup>.
- **Soft Prompt Tuning**: Al posto di un prompt testuale vengono utilizzati «token virtuali» addestrabili (embedding), configurati per risolvere un compito specifico.
- **SelfCP**: Propone di utilizzare lo stesso LLM congelato come compressore. Fornendogli un segmento di testo con marcatori speciali, il modello genera una rappresentazione densa (*memory tokens*), che viene poi utilizzata dallo stesso modello per rispondere<sup>[\[13\]](https://systems-analysis.info/int/Compressione_del_prompt#cite_note-gao2024_selfcp-13)</sup>.

## Efficienza e compromessi

- **Accelerazione e riduzione dei costi**: Poiché la complessità del transformer cresce quadraticamente (\$O(n^2)\$) in funzione della lunghezza della sequenza, ridurre il prompt di più volte porta a un risparmio sostanziale. Ad esempio, i *gist token* con una compressione 26 volte superiore mostrano fino al 40% di risparmio in FLOPs<sup>[\[12\]](https://systems-analysis.info/int/Compressione_del_prompt#cite_note-mu2023_gist-12)</sup>.
- **Miglioramento della qualità**: A volte la compressione del prompt può persino migliorare la qualità delle risposte, se il testo originale conteneva rumore o dettagli fuorvianti. L'eliminazione del contesto non rilevante aiuta il modello a concentrarsi meglio sugli aspetti importanti del compito.
- **Compromesso di qualità (faithfulness)**: Una compressione eccessivamente aggressiva può portare alla perdita di dettagli importanti (date, nomi, negazioni), il che peggiorerà la qualità della risposta. I metodi astrattivi sono particolarmente esposti al rischio di allucinazioni. Il controllo della completezza e della precisione (*faithfulness*) del prompt compresso è un compito fondamentale.

## Relazione con altri ambiti

- **Retrieval-Augmented Generation (RAG)**: RAG e compressione del prompt sono strettamente correlati. Il RAG può essere visto come una fase esterna di compressione: invece di elaborare l'intera base di dati, vengono cercati e selezionati i documenti rilevanti. La compressione del prompt integra il RAG riducendo il volume dei documenti già selezionati prima di fornirli all'LLM.
- **In-Context Learning**: Gli esempi nel contesto (dimostrazioni) aumentano significativamente la lunghezza del prompt. La compressione di queste dimostrazioni (ad esempio tramite *Instruction Distillation*, in cui un insieme di esempi viene sostituito da una breve istruzione) è un'area di ricerca attiva.

## Bibliografia

- Ali, M. et al. (2024). *Prompt-SAW: Semantic-Aware Winnowing for Prompt Compression*. arXiv:2403.00000.
- Gao, J.; Cao, Z.; Li, W. (2024). *SelfCP: Compressing Over-Limit Prompt via the Frozen Large Language Model Itself*. arXiv:2405.17052.
- Jiang, H. et al. (2023). *LLMLingua: Compressing Prompts for Accelerated Inference of Large Language Models*. arXiv:2310.05736.
- Jiang, H. et al. (2023). *LongLLMLingua: Accelerating and Enhancing LLMs in Long-Context Scenarios via Prompt Compression*. arXiv:2310.06839.
- Jung, H.; Kim, K. (2023). *PCRL: Discrete Prompt Compression with Reinforcement Learning*. arXiv:2308.08758.
- Li, M. et al. (2023). *Selective-Context: Compressing Context to Summarise and Answer Questions*. arXiv:2307.00000.
- Mu, J. et al. (2023). *Learning to Compress Prompts with Gist Tokens*. NeurIPS 2023.
- Xu, F.; Shi, W.; Choi, E. (2023). *RECOMP: Improving Retrieval-Augmented LMs with Compression and Selective Augmentation*. arXiv:2310.04408.
- Yang, C. et al. (2023). *PRCA: Prompt Compression with Reinforced Context Aggregation*. arXiv:2311.00000.
- Yoon, J. et al. (2024). *CompAct: Interactive Prompt Compression for Long-Document QA*. arXiv:2402.00000.
- Zhang, S. et al. (2024). *Efficient Prompting Methods for Large Language Models: A Survey*. arXiv:2404.01077.
- Jha, S. et al. (2024). *Characterizing Prompt Compression Methods for Long Context Inference*. arXiv:2407.08892.

## Note

1.  <span id="cite_note-jha2024-1">[↑](https://systems-analysis.info/int/Compressione_del_prompt#cite_ref-jha2024_1-0) Jha, S., et al. (2024). «Characterizing Prompt Compression Methods for Long Context Inference». *arXiv*. <a href="https://arxiv.org/html/2407.08892v1" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-survey2024-2">[↑](https://systems-analysis.info/int/Compressione_del_prompt#cite_ref-survey2024_2-0) «Efficient Prompting Methods for Large Language Models: A Survey». *arXiv*. <a href="https://arxiv.org/html/2404.01077v2" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-datacamp-guide-3">[↑](https://systems-analysis.info/int/Compressione_del_prompt#cite_ref-datacamp-guide_3-0) «Prompt Compression: A Guide With Python Examples». *DataCamp*. <a href="https://www.datacamp.com/tutorial/prompt-compression" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-jiang2023_llmlingua-4">[↑](https://systems-analysis.info/int/Compressione_del_prompt#cite_ref-jiang2023_llmlingua_4-0) Jiang, H., et al. (2023). «LLMLingua: Compressing Prompts for Accelerated Inference of Large Language Models». *arXiv*.</span>
5.  <span id="cite_note-li2023_selective-5">[↑](https://systems-analysis.info/int/Compressione_del_prompt#cite_ref-li2023_selective_5-0) Li, M. (2023). «Compressing context to summarize and answer questions». *arXiv*.</span>
6.  <span id="cite_note-jung2023_pcrl-6">[↑](https://systems-analysis.info/int/Compressione_del_prompt#cite_ref-jung2023_pcrl_6-0) Jung, H., & Kim, K. (2023). «Learning to Compress Prompts with Reinforcement Learning». *arXiv*.</span>
7.  <span id="cite_note-xu2024_recomp-7">[↑](https://systems-analysis.info/int/Compressione_del_prompt#cite_ref-xu2024_recomp_7-0) Xu, F., et al. (2024). «RECOMP: Improving Retrieval-Augmented LMs with Compression and Selective Augmentation». *arXiv*.</span>
8.  <span id="cite_note-yang2023_prca-8">[↑](https://systems-analysis.info/int/Compressione_del_prompt#cite_ref-yang2023_prca_8-0) Yang, C., et al. (2023). «PRCA: A new framework for prompt compression». *arXiv*.</span>
9.  <span id="cite_note-ali2024_promptsaw-9">[↑](https://systems-analysis.info/int/Compressione_del_prompt#cite_ref-ali2024_promptsaw_9-0) Ali, M., et al. (2024). «Prompt-SAW: A new method for prompt compression». *arXiv*.</span>
10. <span id="cite_note-pradeep2023_reranker-10">[↑](https://systems-analysis.info/int/Compressione_del_prompt#cite_ref-pradeep2023_reranker_10-0) Pradeep, R., et al. (2023). «How to select the best passages for RAG?». *arXiv*.</span>
11. <span id="cite_note-yoon2024_compact-11">[↑](https://systems-analysis.info/int/Compressione_del_prompt#cite_ref-yoon2024_compact_11-0) Yoon, J., et al. (2024). «CompAct: A new framework for interactive prompt compression». *arXiv*.</span>
12. <span id="cite_note-mu2023_gist-12">↑ <sup>[12.0](https://systems-analysis.info/int/Compressione_del_prompt#cite_ref-mu2023_gist_12-0)</sup> <sup>[12.1](https://systems-analysis.info/int/Compressione_del_prompt#cite_ref-mu2023_gist_12-1)</sup> Mu, J., et al. (2023). «Learning to Compress Prompts with Gist Tokens». *OpenReview*. <a href="https://openreview.net/forum?id=2DtxPCL3T5" class="external autonumber" rel="nofollow">[4]</a></span>
13. <span id="cite_note-gao2024_selfcp-13">[↑](https://systems-analysis.info/int/Compressione_del_prompt#cite_ref-gao2024_selfcp_13-0) Gao, C., et al. (2024). «SelfCP: Compressing Over-Limit Prompt via the Frozen Large Language Model Itself». *arXiv*. <a href="https://arxiv.org/html/2405.17052v2" class="external autonumber" rel="nofollow">[5]</a></span>
