---
title: "Packaging & Context Handling (DE)"
source: "https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)"
wiki: "systems-analysis.info/int"
article: "Packaging_&_Context_Handling_(DE)"
language: "de"
categories:
  - "Category:German"
  - "Category:Large language models"
  - "Category:Prompt engineering"
revision_id: 5389
wiki_created_at: 2026-09-06T23:48:35Z
wiki_modified_at: 2026-09-06T23:48:35Z
downloaded_at: 2026-09-07T23:08:12Z
---

# Packaging & Context Handling (DE)

**Packaging & Context Handling** ist eine Sammlung von Techniken zur Auswahl, Komprimierung, Anordnung und Bereitstellung von extrahierten Wissensfragmenten im Kontext von [LLMs](https://systems-analysis.info/int/Gro%C3%9Fe_Sprachmodelle "Große Sprachmodelle") im Rahmen der Retrieval‑Augmented Generation (RAG). Das Ziel ist es, den Nutzen eines begrenzten Token-Budgets zu maximieren, die Genauigkeit und Stabilität der Antworten zu erhöhen und eine nachverfolgbare Zitierung der Quellen zu gewährleisten. Unter „Packaging“ versteht man nicht nur die Erstellung einer Liste von Fragmenten, sondern auch deren Komprimierung, Reihenfolge, Gruppierung und die an das Modell gerichteten Anweisungen, einschließlich der Strategien *stuff*, *map‑reduce*, *refine* und *tree‑of‑chunks*.<sup>[\[1\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_note-lewis2020-1)[\[2\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_note-langchain-sum-2)</sup>

## Definition und Motivation

In RAG-Systemen wird die Qualität der endgültigen Antwort nicht nur durch das Retrieval bestimmt, sondern auch dadurch, *wie* die ausgewählten Fragmente in den Prompt gelangen. Kontextbeschränkungen und Token-Kosten erfordern einen Ausgleich zwischen Vollständigkeit und Genauigkeit: Zusätzliche Fragmente erhöhen das Risiko des „Lost-in-the-Middle“-Phänomens (*lost‑in‑the‑middle*) und verlängern die Latenz, während eine aggressive Filterung/Komprimierung wichtige Belege entfernen kann.<sup>[\[3\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_note-lostmiddle-3)</sup> Im klassischen RAG dienen die Quellen als externer „nicht-parametrischer Speicher“, der Aktualität und Zitierfähigkeit gewährleistet, sofern das Packaging es der LLM ermöglicht, zuverlässig mit Fakten und Referenzen zu arbeiten.<sup>[\[1\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_note-lewis2020-1)</sup>

## Chunking und Inhalts-Extraktion

Die Segmentierungsstrategie (*chunking*) bestimmt die Größe und Überlappung der Chunks, die Normalisierung und die Granularität (*document*→*passage*→*sentence*). Typische Ansätze sind:

- **Feste Größe** (nach Zeichen/Tokens) mit Überlappung, um die Kohärenz zwischen den Chunks zu wahren;<sup>[\[4\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_note-lc-splitters-4)[\[5\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_note-llama-splitters-5)</sup>
- **Semantisches Chunking** (Grenzen basierend auf der Ähnlichkeit von Embeddings), das „semantische Brüche“ reduziert.<sup>[\[6\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_note-llama-sem-6)</sup>
- **Sentence‑window retrieval** — Zunächst werden Sätze indiziert; beim Retrieval werden relevante Sätze zusammen mit einem *Fenster* benachbarter Sätze (davor und danach) extrahiert, um den lokalen Kontext wiederherzustellen.<sup>[\[7\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_note-haystack-sentwin-7)</sup>
- **Indexierung auf Passage-Ebene** — Die Aufteilung der Wikipedia in Passagen von etwa 100 Wörtern wurde zum Standard im Open-Domain QA (DPR), was den Nutzen einer feinen Granularität in den frühen Phasen unterstreicht.<sup>[\[8\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_note-dpr-8)</sup>
- **Normalisierung und Bereinigung** (Entfernen von überflüssigen Inhalten, Kopf-/Fußzeilen, Vereinheitlichung von Leerzeichen), Nachverfolgung von Quellen/Seiten/Offsets auf Metadatenebene zur Rückverfolgbarkeit.<sup>[\[9\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_note-haystack-pre-9)</sup>
- **Deduplizierung** von Kandidaten-Chunks (exakte und *near-duplicate*): Shingles + MinHash/LSH zur Reduzierung von Wiederholungen.<sup>[\[10\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_note-broder1997-10)</sup>

## Diversifizierung und Auswahl (MMR u. a.)

Bei der Zusammenstellung des Kontextes sind hohe Relevanz und geringe Redundanz erforderlich. Die klassische Funktion der Maximal Marginal Relevance wählt das nächste Fragment unter Berücksichtigung seiner Nähe zur Anfrage und der *maximalen* Ähnlichkeit mit den bereits ausgewählten Fragmenten aus (Abzug für Duplikate):

${MMR}(d_{i}) = \arg\max\limits_{d_{i} \in D \smallsetminus S}\left\lbrack \lambda \cdot {sim}(q,d_{i}) - (1 - \lambda) \cdot \max\limits_{d_{j} \in S}{sim}(d_{i},d_{j}) \right\rbrack,\ \lambda \in \lbrack 0,1\rbrack$.<sup>[\[11\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_note-mmr-11)</sup>

Kombination von Signalen: Hybrides Retrieval (BM25 + Dense) → Fusion (z. B. Reciprocal Rank Fusion, RRF) → Reranking mit Cross-Encoder/ColBERT:

- **RRF**: Ein einfaches und effektives, unüberwachtes Verfahren zur Fusion von Ranglisten aus heterogenen Retrievern.<sup>[\[12\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_note-rrf-12)</sup>
- **Cross-Encoder-Reranker** (BERT/MonoT5/moderne kommerzielle APIs) verbessern die Top-k-Präzision erheblich, erhöhen jedoch die Latenz.<sup>[\[13\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_note-nogueira2019-13)[\[14\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_note-cohere-rerank-14)</sup>
- **Multivektor-Retriever** ColBERT (*late interaction*) dient oft als effektiver Reranker oder First-Level-Retriever für große Korpora.<sup>[\[15\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_note-colbert-15)</sup>
- **Hybride Suche** (BM25F + Vektor) ist in industriellen Suchmaschinen und Bibliotheken mit konfigurierbaren Gewichtungen/Fusion-Methoden (Alpha, RRF usw.) implementiert.<sup>[\[16\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_note-weav-hybrid-16)[\[17\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_note-pine-hybrid-17)</sup>

## Kontextkomprimierung

Die Reduzierung des Kontextvolumens ohne Verlust von Fakten ist entscheidend für Kosten und Latenz:

- **Extraktive Kompression** (Extraktion von Schlüsselsätzen/-phrasen); **abstraktive Zusammenfassung** (Paraphrasierung/Verdichtung). Die klassische Perspektive wird von Nenkova & McKeown dargelegt.<sup>[\[18\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_note-nenkova2011-18)</sup>
- **Query-guided / instruction-guided** Kompression: Zusammenfassung basierend auf der Anfrage/Aufgabe (Hervorhebung von Belegen und Entfernung irrelevanter Informationen).
- **Prompt/Context Compression** mittels LLM-basierter Filterung/Token-Pruning (z. B. LLMLingua/LLMLingua-2) reduziert das Token-Budget bei geringem Qualitätsverlust, erfordert jedoch eine sorgfältige Validierung der *Faithfulness* (Fakten-Treue).<sup>[\[19\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_note-llmlingua-19)</sup>
- Kompression ist ein Kompromiss zwischen *Qualität↔Kosten↔Latenz*: Eine aggressive Verdichtung erhöht das Risiko, Nuancen oder Voraussetzungen zu übersehen, und verschlechtert die Zuordnung von Fakten zu ihren Quellen.<sup>[\[20\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_note-ji2023-20)</sup>

## Packaging-Strategien (stuff/map‑reduce/refine/tree)

Im Folgenden werden vier grundlegende Schemata zur Anordnung von Quellen im Prompt und typische Anwendungsszenarien vorgestellt (siehe auch die Vergleichstabelle).

**Stuff** (Direkte Eingabe)  
Die ausgewählten Fragmente (nach möglicher Komprimierung) werden zusammengefügt und als Ganzes übergeben. Diese Methode ist einfach und schnell, aber durch die Kontextlänge begrenzt und anfällig für das *lost‑in‑the‑middle*-Problem bei langen Eingaben.<sup>[\[2\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_note-langchain-sum-2)</sup>

**Map‑Reduce**  
In der *map*-Phase wird für jedes Fragment/Dokument lokal eine Antwort generiert oder eine Zusammenfassung erstellt. In der *reduce*-Phase werden diese Ergebnisse aggregiert (Vergleich, Abstimmung, Zusammenführung). Diese Methode skaliert gut mit der Anzahl der Quellen und reduziert die Last auf einen einzelnen Prompt, birgt aber bei naiver Aggregation das Risiko, die Zusammenhänge zwischen den Quellen zu verlieren.<sup>[\[2\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_note-langchain-sum-2)[\[21\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_note-fid-21)</sup>

**Refine**  
Sequentielle Verbesserung: Eine erste Antwort wird auf Basis des ersten Fragments generiert und dann iterativ unter Berücksichtigung der nachfolgenden Fragmente verfeinert (*refine*) (Hinzufügen/Korrigieren). Dies ist nützlich, wenn die Reihenfolge der Quellen wichtig ist; es besteht jedoch das Risiko, bei frühen Fehlern „stecken zu bleiben“ und Verzerrungen anzuhäufen.<sup>[\[22\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_note-llama-refine-22)</sup>

**Tree‑of‑chunks**  
Hierarchische Komprimierung/Zusammenfassung: Lokale Zusammenfassungen auf Chunk-Ebene → Zusammenfassungen auf Abschnittsebene → endgültige Gesamtzusammenfassung. Nützlich für lange Dokumente; erfordert eine sorgfältige Weitergabe von Quellen-IDs zwischen den Ebenen für eine korrekte Zuordnung.<sup>[\[23\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_note-llama-tree-23)</sup>

| Strategie          | Idee                                  | Kosten/Latenz                   | Risiko des Kontextverlusts                                            | Anwendungsfälle                                      | Quellen                                                                                                                                                                                                                  |
|--------------------|---------------------------------------|---------------------------------|-----------------------------------------------------------------------|------------------------------------------------------|--------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------|
| **Stuff**          | Alle Fragmente direkt in einem Prompt | Niedrig (bis zum Kontextlimit)  | Hoch bei langen Eingaben (*lost‑in‑the‑middle*)                       | Geringes Volumen, einfache Fragen                    | <sup>[\[2\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_note-langchain-sum-2)[\[3\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_note-lostmiddle-3)</sup> |
| **Map‑Reduce**     | Lokale Antworten → Aggregation        | Mittel/Hoch (viele API-Aufrufe) | Mittel (abhängig von der Qualität der Reduce-Phase)                   | Viele Quellen, Skalierbarkeit erforderlich           | <sup>[\[2\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_note-langchain-sum-2)[\[21\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_note-fid-21)</sup>      |
| **Refine**         | Sequentielle Verbesserung der Antwort | Mittel                          | Abhängigkeit von der Reihenfolge, Risiko der Verfestigung von Fehlern | Wenn Reihenfolge/Entwicklung der Antwort wichtig ist | <sup>[\[22\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_note-llama-refine-22)</sup>                                                                                                     |
| **Tree‑of‑chunks** | Hierarchische Zusammenfassungen       | Mittel/Hoch                     | Detailverlust auf höheren Ebenen                                      | Lange Dokumente/Sammlungen                           | <sup>[\[23\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_note-llama-tree-23)</sup>                                                                                                       |

Vergleich der Packaging-Strategien

## Reihenfolge und Positionierung der Quellen

LLMs nutzen Informationen aus der Mitte eines langen Kontexts weniger effektiv; nützliche Fakten sollten daher am Anfang oder Ende platziert, nach Themen/Quellen gruppiert und mit Überschriften und IDs gekennzeichnet werden. Ein Reranking, das die *query-aware* Wichtigkeit und Diversifizierung berücksichtigt, hilft dabei, die wichtigsten Fragmente an den Anfang zu verschieben.<sup>[\[3\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_note-lostmiddle-3)[\[13\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_note-nogueira2019-13)</sup>

## Integration in die RAG-Pipeline (fusion → rerank → packaging)

Eine typische mehrstufige Pipeline sieht wie folgt aus: **hybrid retrieval** (BM25 + dense) → **fusion** (RRF/gewichtete Mischung) → **rerank** (Cross‑Encoder/ColBERT) → **packaging** (eine der Strategien) → **Generierung** + **Zitierung**. Die hybride Suche und RRF sind robust gegenüber inkompatiblen Scores verschiedener Retriever; ein Cross-Encoder erhöht die Präzision der an die LLM übergebenen Eingaben und spart dadurch Tokens.<sup>[\[16\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_note-weav-hybrid-16)[\[12\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_note-rrf-12)[\[14\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_note-cohere-rerank-14)[\[15\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_note-colbert-15)</sup>

## Evaluierung und Ablationsstudien

Die Evaluierung erfolgt auf den Ebenen Retrieval, Packaging und Generierung:

- **Retrieval**: Recall@k, nDCG@k, MRR – Standardmetriken des Information Retrieval.<sup>[\[24\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_note-manning2008-24)</sup>
- **Faithfulness/Groundedness**: Der Anteil der Aussagen, die durch Zitate gestützt werden; automatische Frameworks (RAGAS, TruLens) + manuelle Validierung der Zuordnung.<sup>[\[25\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_note-ragas-25)[\[26\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_note-trulens-26)[\[27\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_note-rashkin2023-27)</sup>
- **End‑to‑end QA**: EM/F1/ROUGE, abhängig von der Aufgabe/dem Datensatz (NQ/HotpotQA usw.).<sup>[\[1\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_note-lewis2020-1)</sup>
- **Effizienz**: Latenz p50/p95, Anzahl der Tokens, \$-Kosten; Vergleich von Packaging-Strategien und Kompressionsstufen nach dem Kriterium *Qualität↔Kosten*.
- **Ablationsstudien**: Deaktivierung von MMR/Deduplizierung/Kompression/Änderung der Reihenfolge, um den Beitrag jeder Komponente zu messen (Stand 2025-09-10 empfiehlt die Forschungspraxis im Bereich RAG, k, λ, Chunk-Größen und Token-Limits klar zu dokumentieren).<sup>[\[28\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_note-rag-survey-28)</sup>

## Praktische Empfehlungen und Checkliste

- **k und Diversifizierung**: Beginnen Sie mit k=20–40 Kandidaten aus dem hybriden Retrieval; wenden Sie MMR mit λ≈0.5–0.8 an; bestrafen Sie Duplikate basierend auf URL/ID/Text-Hash streng.<sup>[\[11\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_note-mmr-11)[\[16\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_note-weav-hybrid-16)</sup>
- **Chunking**: 200–400 Tokens mit 10–20 % Überlappung bei fester Chunk-Größe; für juristische und technische Dokumente ist oft das Sentence/Window-Schema hilfreicher.<sup>[\[4\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_note-lc-splitters-4)[\[7\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_note-haystack-sentwin-7)</sup>
- **Kompression**: Verwenden Sie anfragebasierte extraktive Filterung und vorsichtige Abstraktion; passen Sie LLMLingua-ähnliche Methoden basierend auf der *Faithfulness* Ihrer Daten an (A/B-Validierung ist unerlässlich).<sup>[\[19\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_note-llmlingua-19)[\[27\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_note-rashkin2023-27)</sup>
- **Reihenfolge**: Wichtige/hoch bewertete Fragmente an den Anfang des Prompts stellen; nach Quellen/Themen gruppieren, IDs und Überschriften explizit kennzeichnen; den *lost‑in‑the‑middle*-Effekt berücksichtigen (die Wiederholung einer Schlüsselaussage am Anfang und Ende kann helfen).<sup>[\[3\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_note-lostmiddle-3)</sup>
- **Rerank**: Wenn es das Budget erlaubt, fügen Sie vor dem Packaging einen Cross-Encoder/ColBERT für die Top-k (k≈50–200) hinzu – dies spart Generierungs-Tokens und erhöht die Genauigkeit.<sup>[\[13\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_note-nogueira2019-13)[\[15\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_note-colbert-15)</sup>
- **Fallback-Strategien**: (1) Mangel an Fakten → Anforderung zusätzlicher Quellen; (2) Überschreitung des Token-Limits → Umschalten von *stuff* auf *refine* oder Aktivierung der Kompression; (3) Geringe Konfidenz/Widersprüche → Verweigerung der Antwort mit einer expliziten Liste der fehlenden IDs (siehe Vorlage unten).

### Pseudocode für die Packaging-Pipeline

    # Eingabe: Anfrage q
    cands = retrieve(q, K_sparse, K_dense)          # Suche mit BM25, DPR usw.
    cands = diversify_MMR(cands, lambda=0.7)        # Diversifizierung (MMR)
    snips = compress(query=q, items=cands, mode="extractive|abstractive", budget=tokens)
    pkg   = package(snips, strategy="stuff|map_reduce|refine|tree")
    resp  = generate(prompt=build_prompt(q, pkg), citations=True)  # LLM mit Zitaten

### Skelett einer Prompt-Vorlage (Ausschnitt)

    [BENUTZERANFRAGE]
    {q}

    [QUELLEN]
    {# Jedes Fragment mit ID, Titel und Link #}
    - [{id}] {title} — {url}
    {content_snippet}

    [ANFORDERUNGEN]
    1) Verwende nur Fakten aus den Quellen und verweise auf die [ID].
    2) Wenn die Daten nicht ausreichen, weise darauf hin und bitte um Klärung/zusätzliche Quellen.
    3) Behalte die Antwortstruktur bei und gib eine Liste der verwendeten [IDs] an.

## Einschränkungen und offene Fragen

- **Halluzinationen und Aggregation** bei Map-Reduce/Refine: Abstraktive Zusammenfassungen können neue Fakten einführen; klare Anweisungen zur Quellenangabe und Mechanismen zur Überprüfung von Zitaten sind entscheidend.<sup>[\[20\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_note-ji2023-20)[\[27\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_note-rashkin2023-27)</sup>
- **Detailverlust** bei aggressiver oder hierarchischer Kompression; es ist wichtig, Rückverweise zur Originalquelle/Seite/Offset zu speichern.
- **Domänenübertragbarkeit** von Retrievern, Rerankern und Kompressoren; eine Anpassung/Feinabstimmung auf domänenspezifischen Korpora ist erforderlich.<sup>[\[28\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_note-rag-survey-28)</sup>
- **Datenschutz/PII** und Memorisierung durch LLMs: Bei der Generierung ohne striktes *Grounding* können private Informationen preisgegeben werden; setzen Sie Filter, private Speicher und eine Verweigerungsrichtlinie ein.<sup>[\[29\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_note-carlini-29)[\[30\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_note-shokri-30)</sup>
- **Trainierbare „Packer“**, adaptive Anordnung/Layouts, RLHF/Feedback-Schleifen zur Verbesserung der *Faithfulness*, mehrsprachiger und extrem langer Kontext – dies sind aktive Forschungsbereiche.<sup>[\[28\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_note-rag-survey-28)[\[3\]](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_note-lostmiddle-3)</sup>

## Weblinks

- LangChain: *Summarization* (stuff/map_reduce/refine). <a href="https://python.langchain.com/docs/tutorials/summarization/" class="external autonumber" rel="nofollow">[29]</a>
- LangChain: *Text splitters*. <a href="https://python.langchain.com/docs/concepts/text_splitters/" class="external autonumber" rel="nofollow">[30]</a>
- LlamaIndex: *Response Synthesizers (refine/tree)*. <a href="https://docs.llamaindex.ai/en/stable/module_guides/deploying/response_synthesizers/" class="external autonumber" rel="nofollow">[31]</a>
- LlamaIndex: *Node Parsers / SentenceSplitter / SemanticSplitter*. <a href="https://docs.llamaindex.ai/en/stable/module_guides/loading/node_parsers/modules/" class="external autonumber" rel="nofollow">[32]</a>
- Haystack: *SentenceWindowRetriever*. <a href="https://docs.haystack.deepset.ai/docs/sentencewindowretrieval" class="external autonumber" rel="nofollow">[33]</a>
- Haystack: *PreProcessors / DocumentSplitter*. <a href="https://docs.haystack.deepset.ai/docs/preprocessors" class="external autonumber" rel="nofollow">[34]</a>
- Weaviate: *Hybrid search*. <a href="https://docs.weaviate.io/weaviate/concepts/search/hybrid-search" class="external autonumber" rel="nofollow">[35]</a>
- Pinecone: *Hybrid search*. <a href="https://docs.pinecone.io/docs/hybrid-search" class="external autonumber" rel="nofollow">[36]</a>
- Cohere: *Rerank API*. <a href="https://docs.cohere.com/docs/rerank-overview" class="external autonumber" rel="nofollow">[37]</a>
- RAGAS (repo/docs). <a href="https://arxiv.org/abs/2309.15217" class="external autonumber" rel="nofollow">[38]</a> <a href="https://github.com/explodinggradients/ragas" class="external autonumber" rel="nofollow">[39]</a>
- TruLens (docs). <a href="https://www.trulens.org/trulens_eval/getting_started/evaluation/" class="external autonumber" rel="nofollow">[40]</a>

## Literatur

- Manning, C. D., Raghavan, P., Schütze, H. (2008). *Introduction to Information Retrieval*. Cambridge University Press. ISBN 978‑0521865715.
- Nenkova, A., McKeown, K. (2011). *Automatic Summarization*. FnT IR, 5(2–3), 103–233. DOI:10.1561/1500000015.
- Lewis, P., et al. (2020). *Retrieval‑Augmented Generation for Knowledge‑Intensive NLP Tasks*. NeurIPS. arXiv:2005.11401.
- Khattab, O., Zaharia, M. (2020). *ColBERT*. SIGIR’20. DOI:10.1145/3397271.3401075.
- Izacard, G., Grave, E. (2021). *Fusion‑in‑Decoder*. EACL. arXiv:2007.01282.
- Ji, Z., et al. (2023). *Survey of Hallucination in NLG*. ACM CS. DOI:10.1145/3571730.
- Gao, S., et al. (2024). *RAG for LLM: A Survey*. arXiv:2312.10997.

## Einzelnachweise

1.  <span id="cite_note-lewis2020-1">↑ <sup>[1.0](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_ref-lewis2020_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_ref-lewis2020_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_ref-lewis2020_1-2)</sup> Lewis, P., Perez, E., Piktus, A., Petroni, F., Karpukhin, V., et al. (2020). *Retrieval‑Augmented Generation for Knowledge‑Intensive NLP Tasks*. NeurIPS. arXiv:2005.11401. <a href="https://arxiv.org/abs/2005.11401" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-langchain-sum-2">↑ <sup>[2.0](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_ref-langchain-sum_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_ref-langchain-sum_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_ref-langchain-sum_2-2)</sup> <sup>[2.3](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_ref-langchain-sum_2-3)</sup> <sup>[2.4](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_ref-langchain-sum_2-4)</sup> LangChain Docs. *Summarization* (stuff/map_reduce/refine/map_rerank). (abgerufen am 2025‑09‑10). <a href="https://python.langchain.com/docs/tutorials/summarization/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-lostmiddle-3">↑ <sup>[3.0](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_ref-lostmiddle_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_ref-lostmiddle_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_ref-lostmiddle_3-2)</sup> <sup>[3.3](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_ref-lostmiddle_3-3)</sup> <sup>[3.4](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_ref-lostmiddle_3-4)</sup> Liu, N. F., Lin, K., Hewitt, J., Paranjape, A., Bevilacqua, M., Petroni, F., Liang, P. (2024). *Lost in the Middle: How Language Models Use Long Contexts*. TACL. arXiv:2307.03172. <a href="https://arxiv.org/abs/2307.03172" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-lc-splitters-4">↑ <sup>[4.0](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_ref-lc-splitters_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_ref-lc-splitters_4-1)</sup> LangChain Docs. *Text splitters* (RecursiveCharacter/TokenTextSplitter). (abgerufen am 2025‑09‑10). <a href="https://python.langchain.com/docs/concepts/text_splitters/" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-llama-splitters-5">[↑](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_ref-llama-splitters_5-0) LlamaIndex Docs. *SentenceSplitter / TokenTextSplitter / SemanticSplitter*. (abgerufen am 2025‑09‑10). <a href="https://docs.llamaindex.ai/en/stable/api_reference/node_parsers/sentence_splitter/" class="external autonumber" rel="nofollow">[5]</a> <a href="https://docs.llamaindex.ai/en/stable/api_reference/node_parsers/token_text_splitter/" class="external autonumber" rel="nofollow">[6]</a> <a href="https://docs.llamaindex.ai/en/stable/api_reference/node_parsers/semantic_splitter/" class="external autonumber" rel="nofollow">[7]</a></span>
6.  <span id="cite_note-llama-sem-6">[↑](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_ref-llama-sem_6-0) LlamaIndex Docs. *SemanticSplitterNodeParser*. (abgerufen am 2025‑09‑10). <a href="https://docs.llamaindex.ai/en/stable/api_reference/node_parsers/semantic_splitter/" class="external autonumber" rel="nofollow">[8]</a></span>
7.  <span id="cite_note-haystack-sentwin-7">↑ <sup>[7.0](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_ref-haystack-sentwin_7-0)</sup> <sup>[7.1](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_ref-haystack-sentwin_7-1)</sup> Haystack Docs. *SentenceWindowRetriever*. (abgerufen am 2025‑09‑10). <a href="https://docs.haystack.deepset.ai/docs/sentencewindowretrieval" class="external autonumber" rel="nofollow">[9]</a></span>
8.  <span id="cite_note-dpr-8">[↑](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_ref-dpr_8-0) Karpukhin, V., Oguz, B., Min, S., Lewis, P., Wu, L., Edunov, S., Chen, D., Yih, W.‑T. (2020). *Dense Passage Retrieval for Open‑Domain Question Answering*. EMNLP. arXiv:2004.04906. <a href="https://arxiv.org/abs/2004.04906" class="external autonumber" rel="nofollow">[10]</a></span>
9.  <span id="cite_note-haystack-pre-9">[↑](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_ref-haystack-pre_9-0) Haystack Docs. *PreProcessors / DocumentSplitter*. (abgerufen am 2025‑09‑10). <a href="https://docs.haystack.deepset.ai/docs/preprocessors" class="external autonumber" rel="nofollow">[11]</a> <a href="https://docs.haystack.deepset.ai/docs/documentsplitter" class="external autonumber" rel="nofollow">[12]</a></span>
10. <span id="cite_note-broder1997-10">[↑](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_ref-broder1997_10-0) Broder, A. Z. (1997). *On the Resemblance and Containment of Documents*. Compression and Complexity of Sequences. <a href="https://www.cs.princeton.edu/courses/archive/spring13/cos598C/broder97resemblance.pdf" class="external autonumber" rel="nofollow">[13]</a></span>
11. <span id="cite_note-mmr-11">↑ <sup>[11.0](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_ref-mmr_11-0)</sup> <sup>[11.1](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_ref-mmr_11-1)</sup> Carbonell, J., Goldstein, J. (1998). *The Use of MMR, Diversity‑Based Reranking for Reordering Documents and Producing Summaries*. SIGIR’98, pp. 335–336. DOI:10.1145/290941.291025.</span>
12. <span id="cite_note-rrf-12">↑ <sup>[12.0](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_ref-rrf_12-0)</sup> <sup>[12.1](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_ref-rrf_12-1)</sup> Cormack, G. V., Clarke, C. L. A., Büttcher, S. (2009). *Reciprocal Rank Fusion outperforms Condorcet and Individual Rank Learning Methods*. SIGIR’09, pp. 758–759. DOI:10.1145/1571941.1572114. <a href="https://cormack.uwaterloo.ca/cormacksigir09-rrf.pdf" class="external autonumber" rel="nofollow">[14]</a></span>
13. <span id="cite_note-nogueira2019-13">↑ <sup>[13.0](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_ref-nogueira2019_13-0)</sup> <sup>[13.1](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_ref-nogueira2019_13-1)</sup> <sup>[13.2](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_ref-nogueira2019_13-2)</sup> Nogueira, R., Cho, K. (2019). *Passage Re‑ranking with BERT*. arXiv:1901.04085. <a href="https://arxiv.org/abs/1901.04085" class="external autonumber" rel="nofollow">[15]</a></span>
14. <span id="cite_note-cohere-rerank-14">↑ <sup>[14.0](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_ref-cohere-rerank_14-0)</sup> <sup>[14.1](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_ref-cohere-rerank_14-1)</sup> Cohere Docs. *Rerank API overview*. (abgerufen am 2025‑09‑10). <a href="https://docs.cohere.com/docs/rerank-overview" class="external autonumber" rel="nofollow">[16]</a></span>
15. <span id="cite_note-colbert-15">↑ <sup>[15.0](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_ref-colbert_15-0)</sup> <sup>[15.1](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_ref-colbert_15-1)</sup> <sup>[15.2](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_ref-colbert_15-2)</sup> Khattab, O., Zaharia, M. (2020). *ColBERT: Efficient and Effective Passage Search via Contextualized Late Interaction over BERT*. SIGIR’20, pp. 39–48. DOI:10.1145/3397271.3401075. arXiv:2004.12832.</span>
16. <span id="cite_note-weav-hybrid-16">↑ <sup>[16.0](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_ref-weav-hybrid_16-0)</sup> <sup>[16.1](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_ref-weav-hybrid_16-1)</sup> <sup>[16.2](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_ref-weav-hybrid_16-2)</sup> Weaviate Docs. *Hybrid search (BM25F + vector)*. (abgerufen am 2025‑09‑10). <a href="https://docs.weaviate.io/weaviate/concepts/search/hybrid-search" class="external autonumber" rel="nofollow">[17]</a></span>
17. <span id="cite_note-pine-hybrid-17">[↑](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_ref-pine-hybrid_17-0) Pinecone Docs. *Hybrid search*. (abgerufen am 2025‑09‑10). <a href="https://docs.pinecone.io/docs/hybrid-search" class="external autonumber" rel="nofollow">[18]</a></span>
18. <span id="cite_note-nenkova2011-18">[↑](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_ref-nenkova2011_18-0) Nenkova, A., McKeown, K. (2011). *Automatic Summarization*. Foundations and Trends in Information Retrieval, 5(2–3), 103–233. DOI:10.1561/1500000015.</span>
19. <span id="cite_note-llmlingua-19">↑ <sup>[19.0](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_ref-llmlingua_19-0)</sup> <sup>[19.1](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_ref-llmlingua_19-1)</sup> Zhu, Y., Shao, Z., Li, M., et al. (2023). *LLMLingua: Compressing Prompts for Accelerating LLM Inference*. arXiv:2310.05736. <a href="https://arxiv.org/abs/2310.05736" class="external autonumber" rel="nofollow">[19]</a></span>
20. <span id="cite_note-ji2023-20">↑ <sup>[20.0](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_ref-ji2023_20-0)</sup> <sup>[20.1](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_ref-ji2023_20-1)</sup> Ji, Z., Lee, N., Frieske, R., et al. (2023). *Survey of Hallucination in Natural Language Generation*. ACM Computing Surveys, 55(12), Art.248. DOI:10.1145/3571730.</span>
21. <span id="cite_note-fid-21">↑ <sup>[21.0](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_ref-fid_21-0)</sup> <sup>[21.1](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_ref-fid_21-1)</sup> Izacard, G., Grave, E. (2021). *Leveraging Passage Retrieval with Generative Models for Open‑Domain QA (Fusion‑in‑Decoder)*. EACL. arXiv:2007.01282. <a href="https://arxiv.org/abs/2007.01282" class="external autonumber" rel="nofollow">[20]</a></span>
22. <span id="cite_note-llama-refine-22">↑ <sup>[22.0](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_ref-llama-refine_22-0)</sup> <sup>[22.1](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_ref-llama-refine_22-1)</sup> LlamaIndex Docs. *Response Synthesizers: refine*. (abgerufen am 2025‑09‑10). <a href="https://docs.llamaindex.ai/en/stable/module_guides/deploying/response_synthesizers/#refine" class="external autonumber" rel="nofollow">[21]</a></span>
23. <span id="cite_note-llama-tree-23">↑ <sup>[23.0](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_ref-llama-tree_23-0)</sup> <sup>[23.1](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_ref-llama-tree_23-1)</sup> LlamaIndex Docs. *Tree Summarize*. (abgerufen am 2025‑09‑10). <a href="https://docs.llamaindex.ai/en/stable/module_guides/deploying/response_synthesizers/#tree-summarize" class="external autonumber" rel="nofollow">[22]</a></span>
24. <span id="cite_note-manning2008-24">[↑](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_ref-manning2008_24-0) Manning, C. D., Raghavan, P., Schütze, H. (2008). *Introduction to Information Retrieval*. Cambridge Univ. Press. (siehe Kapitel über nDCG/MRR). <a href="https://nlp.stanford.edu/IR-book/" class="external autonumber" rel="nofollow">[23]</a></span>
25. <span id="cite_note-ragas-25">[↑](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_ref-ragas_25-0) Es, S., et al. (2023). *RAGAS: Automated Evaluation of Retrieval‑Augmented Generation*. arXiv:2309.15217. <a href="https://arxiv.org/abs/2309.15217" class="external autonumber" rel="nofollow">[24]</a></span>
26. <span id="cite_note-trulens-26">[↑](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_ref-trulens_26-0) TruLens Docs. *Evaluating RAG (groundedness, relevance)*. (abgerufen am 2025‑09‑10). <a href="https://www.trulens.org/trulens_eval/getting_started/evaluation/" class="external autonumber" rel="nofollow">[25]</a></span>
27. <span id="cite_note-rashkin2023-27">↑ <sup>[27.0](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_ref-rashkin2023_27-0)</sup> <sup>[27.1](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_ref-rashkin2023_27-1)</sup> <sup>[27.2](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_ref-rashkin2023_27-2)</sup> Rashkin, H., Nakov, P., et al. (2023). *Measuring Attribution in Natural Language Generation*. Computational Linguistics, 49(4), 1207–1261. DOI:10.1162/coli_a_00486.</span>
28. <span id="cite_note-rag-survey-28">↑ <sup>[28.0](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_ref-rag-survey_28-0)</sup> <sup>[28.1](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_ref-rag-survey_28-1)</sup> <sup>[28.2](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_ref-rag-survey_28-2)</sup> Gao, S., et al. (2024). *Retrieval‑Augmented Generation for Large Language Models: A Survey*. arXiv:2312.10997. <a href="https://arxiv.org/abs/2312.10997" class="external autonumber" rel="nofollow">[26]</a></span>
29. <span id="cite_note-carlini-29">[↑](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_ref-carlini_29-0) Carlini, N., Tramèr, F., et al. (2021). *Extracting Training Data from Large Language Models*. USENIX Security. <a href="https://www.usenix.org/system/files/sec21-carlini-extracting.pdf" class="external autonumber" rel="nofollow">[27]</a></span>
30. <span id="cite_note-shokri-30">[↑](https://systems-analysis.info/int/Packaging_%26_Context_Handling_(DE)#cite_ref-shokri_30-0) Shokri, R., Stronati, M., Song, C., Shmatikov, V. (2017). *Membership Inference Attacks Against ML Models*. IEEE S&P. <a href="https://www.cs.cornell.edu/~shmat/shmat_oak17.pdf" class="external autonumber" rel="nofollow">[28]</a></span>
