---
title: "Prompt-Kompression"
source: "https://systems-analysis.info/int/Prompt-Kompression"
wiki: "systems-analysis.info/int"
article: "Prompt-Kompression"
language: "de"
categories:
  - "Category:German"
  - "Category:Large language models"
  - "Category:Machine learning"
  - "Category:Prompt engineering"
revision_id: 5930
wiki_created_at: 2026-09-06T23:56:00Z
wiki_modified_at: 2026-09-06T23:56:00Z
downloaded_at: 2026-09-07T23:11:04Z
---

# Prompt-Kompression

**Prompt-Kompression** (engl. *prompt compression*) ist eine Sammlung von Methoden im Prompt-Engineering, die darauf abzielen, die Länge des Eingabetextes (Prompts) für große Sprachmodelle (LLM) zu reduzieren, während die wesentlichen Informationen erhalten bleiben<sup>[\[1\]](https://systems-analysis.info/int/Prompt-Kompression#cite_note-jha2024-1)</sup>. Mit dem Anwachsen des [Kontextfensters](https://systems-analysis.info/int/Kontextfenster "Kontextfenster") von LLMs auf Millionen von Tokens (z. B. bei Google Gemini) entstand die Möglichkeit, sehr lange Texte zu verarbeiten. Dies brachte jedoch neue Herausforderungen mit sich: hohe Kosten für API-Aufrufe, erhöhte Latenz und eine Abnahme der Schlussfolgerungsqualität aufgrund des „Lost-in-the-Middle“-Effekts<sup>[\[2\]](https://systems-analysis.info/int/Prompt-Kompression#cite_note-survey2024-2)</sup>.

Die Prompt-Kompression löst diese Probleme, indem sie die wesentlichsten Daten in einer verkürzten Eingabe konzentriert und redundante Informationen entfernt. Dies verringert das Risiko, das Kontextlimit zu überschreiten, beschleunigt die Generierung, senkt die Kosten und bewahrt gleichzeitig die Genauigkeit der Antworten<sup>[\[3\]](https://systems-analysis.info/int/Prompt-Kompression#cite_note-datacamp-guide-3)</sup>.

## Methoden der Prompt-Kompression

Die Methoden der Prompt-Kompression lassen sich in mehrere Hauptkategorien einteilen.

### Token-Entfernung (Filterung)

Dieser Ansatz besteht darin, die am wenigsten informativen Tokens, Phrasen oder Sätze aus dem Originaltext zu entfernen, ohne die verbleibenden Teile zu verändern. Die Wichtigkeit der Tokens wird heuristisch bestimmt.

- **LLMLingua**: Eine von Microsoft entwickelte Methode, die die Perplexität jedes Tokens berechnet und diejenigen entfernt, die die Vorhersagbarkeit des Textes nur geringfügig beeinflussen. In der Version **LongLLMLingua** wird dieser Ansatz für lange Dokumente angepasst, wobei die Relevanz von Textabschnitten in Bezug auf eine spezifische Benutzeranfrage berücksichtigt wird<sup>[\[4\]](https://systems-analysis.info/int/Prompt-Kompression#cite_note-jiang2023_llmlingua-4)</sup>.
- **Selective-Context**: Verwendet ein kleines Sprachmodell, um die *Self-Information* jedes Tokens zu bewerten und die Tokens mit der geringsten Informativität zu verwerfen<sup>[\[5\]](https://systems-analysis.info/int/Prompt-Kompression#cite_note-li2023_selective-5)</sup>.
- **PCRL** (Prompt Compression via Reinforcement Learning): Trainiert einen Agenten mittels Reinforcement Learning, um für jedes Token die Entscheidung „behalten“ oder „entfernen“ zu treffen, mit dem Ziel, eine Qualitätsmetrik (z. B. ROUGE) der finalen Antwort zu maximieren<sup>[\[6\]](https://systems-analysis.info/int/Prompt-Kompression#cite_note-jung2023_pcrl-6)</sup>.

### Abstraktive Kompression (Zusammenfassung)

Bei diesem Ansatz generiert ein Kompressor-Modell (normalerweise kleiner) eine kurze, abstrakte Zusammenfassung des Originaltextes, die dann an das Haupt-LLM übergeben wird.

- **RECOMP** (Retrieval-Compression-Prompting): Für jedes Dokument in der Wissensdatenbank wird vorab eine kurze Zusammenfassung (*summary*) generiert, die mögliche Benutzeranfragen berücksichtigt (*query-aware summary*). Dies ermöglicht nicht nur die Kompression, sondern auch die Vorverarbeitung von Informationen<sup>[\[7\]](https://systems-analysis.info/int/Prompt-Kompression#cite_note-xu2024_recomp-7)</sup>.
- **PRCA** (Prompt Compression with Reinforced Context Aggregation): Kombiniert das Training eines Summarizer-Modells mit Reinforcement Learning, um Zusammenfassungen zu generieren, die die Antwortqualität des Haupt-LLM maximieren<sup>[\[8\]](https://systems-analysis.info/int/Prompt-Kompression#cite_note-yang2023_prca-8)</sup>.
- **Prompt-SAW** (Semantic Aware Winnowing): Extrahiert vor der Zusammenfassung einen Wissensgraphen (Entitäten und Beziehungen) aus dem Text, wählt relevante Knoten des Graphen aus und generiert auf deren Grundlage den komprimierten Text<sup>[\[9\]](https://systems-analysis.info/int/Prompt-Kompression#cite_note-ali2024_promptsaw-9)</sup>.

### Extraktive Kompression

Diese Methode extrahiert Schlüsselfragmente (Sätze, Absätze) aus dem Originaltext, ohne sie umzuformulieren.

- **Reranker-LLMs**: Verwendet ein Reranker-Modell (*reranker*), das die Wichtigkeit jedes Absatzes oder Dokuments für die aktuelle Anfrage bewertet und nur die relevantesten auswählt<sup>[\[10\]](https://systems-analysis.info/int/Prompt-Kompression#cite_note-pradeep2023_reranker-10)</sup>.
- **CompAct**: Demonstriert eine iterative Extraktions-Zusammenfassungs-Methode. Das Modell nimmt sequenziell Segmente eines langen Textes, komprimiert sie und prüft, ob die Informationen für eine Antwort ausreichen. Falls nicht, wird das nächste Segment hinzugefügt und erneut komprimiert, wodurch eine erhebliche Kompression bei gleichbleibender Qualität erreicht wird<sup>[\[11\]](https://systems-analysis.info/int/Prompt-Kompression#cite_note-yoon2024_compact-11)</sup>.

### Destillation und „Memory Tokens“

Eine neue Klasse von Methoden, bei der das Modell anstelle von Text speziell trainierte Platzhalter-Tokens oder Embeddings erhält, die komprimierte Informationen enthalten.

- **Gist Tokens**: Das LLM wird darauf trainiert, lange Anweisungen in einen kleinen Satz spezieller *Gist-Tokens* zu „falten“ (z. B. 20–30 Tokens anstelle von mehreren Tausend). Diese Tokens werden dann anstelle des ursprünglichen Prompts verwendet und ermöglichen eine bis zu 26-fache Kompression bei minimalem Qualitätsverlust<sup>[\[12\]](https://systems-analysis.info/int/Prompt-Kompression#cite_note-mu2023_gist-12)</sup>.
- **Soft Prompt Tuning**: Anstelle eines textbasierten Prompts werden trainierbare „virtuelle Tokens“ (Embeddings) verwendet, die für die Lösung einer bestimmten Aufgabe optimiert werden.
- **SelfCP**: Schlägt vor, das eingefrorene LLM (frozen LLM) selbst als Kompressor zu verwenden. Indem dem Modell ein Textsegment mit speziellen Markierungen zugeführt wird, generiert es eine dichte Repräsentation (*memory tokens*), die es anschließend selbst für die Antwort verwendet<sup>[\[13\]](https://systems-analysis.info/int/Prompt-Kompression#cite_note-gao2024_selfcp-13)</sup>.

## Effektivität und Kompromisse

- **Beschleunigung und Kostenreduktion**: Da die Komplexität eines Transformers quadratisch (\$O(n^2)\$) mit der Sequenzlänge wächst, führt eine mehrfache Verkürzung des Prompts zu erheblichen Einsparungen. Beispielsweise zeigen *Gist Tokens* bei einer 26-fachen Kompression eine Einsparung von bis zu 40 % an FLOPs<sup>[\[12\]](https://systems-analysis.info/int/Prompt-Kompression#cite_note-mu2023_gist-12)</sup>.
- **Qualitätssteigerung**: Manchmal kann die Prompt-Kompression sogar die Qualität der Antworten verbessern, wenn der Originaltext Rauschen oder ablenkende Details enthielt. Das Entfernen von irrelevantem Kontext hilft dem Modell, sich besser auf die wichtigen Aspekte der Aufgabe zu konzentrieren.
- **Qualitätskompromiss (Faithfulness)**: Eine zu aggressive Kompression kann zum Verlust wichtiger Details (Daten, Namen, Negationen) führen, was die Antwortqualität beeinträchtigt. Abstraktive Methoden sind besonders anfällig für das Risiko von Halluzinationen. Die Kontrolle der Vollständigkeit und Genauigkeit (*faithfulness*) des komprimierten Prompts ist eine zentrale Herausforderung.

## Bezug zu anderen Bereichen

- **Retrieval-Augmented Generation (RAG)**: RAG und Prompt-Kompression sind eng miteinander verbunden. RAG kann als externer Kompressionsschritt betrachtet werden: Anstatt die gesamte Datenbank zu verarbeiten, werden relevante Dokumente gesucht und ausgewählt. Die Prompt-Kompression ergänzt RAG, indem sie das Volumen der bereits ausgewählten Dokumente reduziert, bevor sie dem LLM zugeführt werden.
- **In-Context Learning**: In-Kontext-Beispiele (Demonstrationen) erhöhen die Länge des Prompts erheblich. Die Kompression dieser Demonstrationen (z. B. durch *Instruction Distillation*, bei der viele Beispiele durch eine einzige kurze Anweisung ersetzt werden) ist ein aktives Forschungsfeld.

## Literatur

- Ali, M. et al. (2024). *Prompt-SAW: Semantic-Aware Winnowing for Prompt Compression*. <a href="https://arxiv.org/abs/2403.00000" class="external text" rel="nofollow">arXiv:2403.00000</a>.
- Gao, C. et al. (2024). *SelfCP: Compressing Over-Limit Prompt via the Frozen Large Language Model Itself*. <a href="https://arxiv.org/abs/2405.17052" class="external text" rel="nofollow">arXiv:2405.17052</a>.
- Jiang, H. et al. (2023). *LLMLingua: Compressing Prompts for Accelerated Inference of Large Language Models*. <a href="https://arxiv.org/abs/2310.05736" class="external text" rel="nofollow">arXiv:2310.05736</a>.
- Jiang, H. et al. (2023). *LongLLMLingua: Accelerating and Enhancing LLMs in Long-Context Scenarios via Prompt Compression*. <a href="https://arxiv.org/abs/2310.06839" class="external text" rel="nofollow">arXiv:2310.06839</a>.
- Jung, H.; Kim, K. (2023). *PCRL: Discrete Prompt Compression with Reinforcement Learning*. <a href="https://arxiv.org/abs/2308.08758" class="external text" rel="nofollow">arXiv:2308.08758</a>.
- Li, M. et al. (2023). *Selective-Context: Compressing Context to Summarise and Answer Questions*. <a href="https://arxiv.org/abs/2307.00000" class="external text" rel="nofollow">arXiv:2307.00000</a>.
- Mu, J. et al. (2023). *Learning to Compress Prompts with Gist Tokens*. <a href="https://papers.nips.cc/paper_files/paper/2023/hash/3d77c6dcc7f143aa2154e7f4d5e22d68-Abstract-Conference.html" class="external text" rel="nofollow">NeurIPS 2023</a>.
- Xu, F.; Shi, W.; Choi, E. (2023). *RECOMP: Improving Retrieval-Augmented LMs with Compression and Selective Augmentation*. <a href="https://arxiv.org/abs/2310.04408" class="external text" rel="nofollow">arXiv:2310.04408</a>.
- Yang, C. et al. (2023). *PRCA: Prompt Compression with Reinforced Context Aggregation*. <a href="https://arxiv.org/abs/2311.00000" class="external text" rel="nofollow">arXiv:2311.00000</a>.
- Yoon, J. et al. (2024). *CompAct: Interactive Prompt Compression for Long-Document QA*. <a href="https://arxiv.org/abs/2402.00000" class="external text" rel="nofollow">arXiv:2402.00000</a>.
- Zhang, S. et al. (2024). *Efficient Prompting Methods for Large Language Models: A Survey*. <a href="https://arxiv.org/abs/2404.01077" class="external text" rel="nofollow">arXiv:2404.01077</a>.
- Jha, S. et al. (2024). *Characterizing Prompt Compression Methods for Long Context Inference*. <a href="https://arxiv.org/abs/2407.08892" class="external text" rel="nofollow">arXiv:2407.08892</a>.

## Einzelnachweise

1.  <span id="cite_note-jha2024-1">[↑](https://systems-analysis.info/int/Prompt-Kompression#cite_ref-jha2024_1-0) Jha, S., et al. (2024). „Characterizing Prompt Compression Methods for Long Context Inference“. *arXiv*. <a href="https://arxiv.org/html/2407.08892v1" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-survey2024-2">[↑](https://systems-analysis.info/int/Prompt-Kompression#cite_ref-survey2024_2-0) „Efficient Prompting Methods for Large Language Models: A Survey“. *arXiv*. <a href="https://arxiv.org/html/2404.01077v2" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-datacamp-guide-3">[↑](https://systems-analysis.info/int/Prompt-Kompression#cite_ref-datacamp-guide_3-0) „Prompt Compression: A Guide With Python Examples“. *DataCamp*. <a href="https://www.datacamp.com/tutorial/prompt-compression" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-jiang2023_llmlingua-4">[↑](https://systems-analysis.info/int/Prompt-Kompression#cite_ref-jiang2023_llmlingua_4-0) Jiang, H., et al. (2023). „LLMLingua: Compressing Prompts for Accelerated Inference of Large Language Models“. *arXiv*.</span>
5.  <span id="cite_note-li2023_selective-5">[↑](https://systems-analysis.info/int/Prompt-Kompression#cite_ref-li2023_selective_5-0) Li, M. (2023). „Compressing context to summarize and answer questions“. *arXiv*.</span>
6.  <span id="cite_note-jung2023_pcrl-6">[↑](https://systems-analysis.info/int/Prompt-Kompression#cite_ref-jung2023_pcrl_6-0) Jung, H., & Kim, K. (2023). „Learning to Compress Prompts with Reinforcement Learning“. *arXiv*.</span>
7.  <span id="cite_note-xu2024_recomp-7">[↑](https://systems-analysis.info/int/Prompt-Kompression#cite_ref-xu2024_recomp_7-0) Xu, F., et al. (2024). „RECOMP: Improving Retrieval-Augmented LMs with Compression and Selective Augmentation“. *arXiv*.</span>
8.  <span id="cite_note-yang2023_prca-8">[↑](https://systems-analysis.info/int/Prompt-Kompression#cite_ref-yang2023_prca_8-0) Yang, C., et al. (2023). „PRCA: A new framework for prompt compression“. *arXiv*.</span>
9.  <span id="cite_note-ali2024_promptsaw-9">[↑](https://systems-analysis.info/int/Prompt-Kompression#cite_ref-ali2024_promptsaw_9-0) Ali, M., et al. (2024). „Prompt-SAW: A new method for prompt compression“. *arXiv*.</span>
10. <span id="cite_note-pradeep2023_reranker-10">[↑](https://systems-analysis.info/int/Prompt-Kompression#cite_ref-pradeep2023_reranker_10-0) Pradeep, R., et al. (2023). „How to select the best passages for RAG?“. *arXiv*.</span>
11. <span id="cite_note-yoon2024_compact-11">[↑](https://systems-analysis.info/int/Prompt-Kompression#cite_ref-yoon2024_compact_11-0) Yoon, J., et al. (2024). „CompAct: A new framework for interactive prompt compression“. *arXiv*.</span>
12. <span id="cite_note-mu2023_gist-12">↑ <sup>[12.0](https://systems-analysis.info/int/Prompt-Kompression#cite_ref-mu2023_gist_12-0)</sup> <sup>[12.1](https://systems-analysis.info/int/Prompt-Kompression#cite_ref-mu2023_gist_12-1)</sup> Mu, J., et al. (2023). „Learning to Compress Prompts with Gist Tokens“. *OpenReview*. <a href="https://openreview.net/forum?id=2DtxPCL3T5" class="external autonumber" rel="nofollow">[4]</a></span>
13. <span id="cite_note-gao2024_selfcp-13">[↑](https://systems-analysis.info/int/Prompt-Kompression#cite_ref-gao2024_selfcp_13-0) Gao, C., et al. (2024). „SelfCP: Compressing Over-Limit Prompt via the Frozen Large Language Model Itself“. *arXiv*. <a href="https://arxiv.org/html/2405.17052v2" class="external autonumber" rel="nofollow">[5]</a></span>
