---
title: "In-Context Learning (DE)"
source: "https://systems-analysis.info/int/In-Context_Learning_(DE)"
wiki: "systems-analysis.info/int"
article: "In-Context_Learning_(DE)"
language: "de"
categories:
  - "Category:German"
  - "Category:Large language models"
  - "Category:Machine learning"
revision_id: 3198
wiki_created_at: 2026-09-06T23:17:10Z
wiki_modified_at: 2026-09-06T23:17:10Z
downloaded_at: 2026-09-07T22:55:42Z
---

# In-Context Learning (DE)

**In-Context Learning** (**ICL**) ist die fundamentale Fähigkeit von [großen Sprachmodellen (LLMs)](https://systems-analysis.info/int/Gro%C3%9Fe_Sprachmodelle "Große Sprachmodelle"), neue Aufgaben „on the fly“ zu erlernen, indem sie ausschließlich Beispiele (Demonstrationen) verwenden, die im Kontext (Prompt) einer Anfrage bereitgestellt werden. Das Schlüsselmerkmal dabei ist, dass dieser Anpassungsprozess ohne Aktualisierung der Modellgewichte (Parameter) stattfindet, also ohne traditionelles Fine-Tuning.<sup>[\[1\]](https://systems-analysis.info/int/In-Context_Learning_(DE)#cite_note-lakera-1)[\[2\]](https://systems-analysis.info/int/In-Context_Learning_(DE)#cite_note-hopsworks-2)</sup>

Dieser Mechanismus ermöglicht es den Modellen, eine erstaunliche Flexibilität zu zeigen und Aufgaben zu lösen, für die sie nicht speziell trainiert wurden. ICL ist zu einem der entscheidenden Durchbrüche geworden, der große Sprachmodelle so leistungsstark und vielseitig gemacht hat.<sup>[\[3\]](https://systems-analysis.info/int/In-Context_Learning_(DE)#cite_note-gradient_pub-3)</sup>

## Funktionsweise

Das genaue Verständnis der Funktionsweise von ICL bleibt ein aktives Forschungsgebiet, jedoch gibt es mehrere führende Theorien, die dieses Phänomen erklären.

### Transformer als Meta-Optimierer

Eine populäre Theorie besagt, dass die Transformer-Architektur während des Vortrainings lernt, Lernalgorithmen in ihren Forward-Passes (Vorwärtsdurchläufen) zu implementieren. Wenn das Modell einen Prompt mit Beispielen erhält, führt es implizit eine Art Optimierung durch, um die dargestellte Aufgabe zu lösen, indem es seine internen Zustände (Aktivierungen) anpasst, nicht aber die Gewichte.<sup>[\[4\]](https://systems-analysis.info/int/In-Context_Learning_(DE)#cite_note-arxiv_grad-4)</sup>

### Bayessche Inferenz

Eine andere Theorie betrachtet ICL als eine Form der bayesschen Inferenz. Ein Modell, das auf riesigen Datenmengen vortrainiert wurde, verfügt über ein A-priori-Wissen über eine Vielzahl von Konzepten. Die Beispiele im Kontext dienen als Evidenz, die es dem Modell ermöglicht, seine A-posteriori-Wahrscheinlichkeitsverteilung über verborgene Konzepte zu verfeinern. Mit anderen Worten, die Beispiele helfen dem Modell zu „verstehen“, welche der Tausenden ihm bekannten Aufgaben gerade gelöst werden muss.<sup>[\[5\]](https://systems-analysis.info/int/In-Context_Learning_(DE)#cite_note-stanford-5)</sup>

## Arten des In-Context Learning

Abhängig von der Anzahl der bereitgestellten Beispiele wird ICL in drei Haupttypen unterteilt.

- **Few-Shot Learning (Lernen mit wenigen Beispielen)**: Dies ist der gebräuchlichste und ausgewogenste Ansatz. Dem Modell werden einige (normalerweise 2 bis 10) Demonstrationsbeispiele zur Verfügung gestellt.

*Beispiel (Sentiment-Klassifikation):*

    Text: "Was für ein wunderschöner Tag!"
    Sentiment: Positiv

    Text: "Ich hasse es, im Stau zu stehen."
    Sentiment: Negativ

    Text: "Dieser Film war ziemlich durchschnittlich."
    Sentiment:

**Erwartete Antwort:**

    Neutral

- **One-Shot Learning (Lernen mit einem Beispiel)**: Dem Modell wird nur ein einziges Beispiel gegeben. Dies reicht oft aus, um das Antwortformat festzulegen und die Leistung im Vergleich zum Zero-Shot-Ansatz erheblich zu verbessern.

<!-- -->

- **Zero-Shot Learning (Lernen ohne Beispiele)**: Dem Modell werden keine Beispiele, sondern nur eine Anweisung oder eine Beschreibung der Aufgabe gegeben. In diesem Fall verlässt sich das Modell vollständig auf das Wissen, das es während des Vortrainings erworben hat.

## Praktische Anwendung

Die richtige Anwendung von ICL ermöglicht die Lösung einer breiten Palette von Aufgaben ohne kostspielige Entwicklung und Feinabstimmung.

- **Für kreative und stilistische Aufgaben** (Generierung von Code in einem bestimmten Stil, Verfassen von Texten im Stil eines bestimmten Autors):
  - Empfohlen wird **Few-Shot Learning**.
  - Beispiele helfen dem Modell, den gewünschten Stil, das Format und die Struktur der Ausgabe zu erfassen.

<!-- -->

- **Für einfache Aufgaben mit klaren Anweisungen** (Übersetzung, Zusammenfassung, Beantwortung einfacher Fragen):
  - Oft ist **Zero-Shot Learning** ausreichend.
  - Moderne Modelle bewältigen solche Aufgaben recht gut, wenn sie Teil ihres Vortrainings waren.

<!-- -->

- **Für Aufgaben, bei denen das Ausgabeformat wichtig ist** (Generierung von JSON, Entitätsextraktion):
  - Empfohlen wird **One-Shot** oder **Few-Shot Learning**.
  - Schon ein einziges Beispiel kann die erforderliche Antwortstruktur klar vorgeben und Formatierungsfehler verhindern.

## Vor- und Nachteile

<table class="wikitable">
<caption>Vergleich der Vor- und Nachteile von ICL</caption>
<colgroup>
<col style="width: 50%" />
<col style="width: 50%" />
</colgroup>
<thead>
<tr class="header">
<th>Vorteile</th>
<th>Nachteile</th>
</tr>
</thead>
<tbody>
<tr class="odd">
<td><ul>
<li><strong>Flexibilität und Geschwindigkeit:</strong> Sofortige Anpassung an neue Aufgaben ohne Notwendigkeit eines erneuten Trainings.</li>
<li><strong>Ressourceneinsparung:</strong> Erfordert keine Datensammlung, Annotation oder Rechenleistung für das Fine-Tuning.</li>
<li><strong>Zugänglichkeit:</strong> Ermöglicht es Nutzern ohne ML-Expertise, Modelle mithilfe einfacher Textbeispiele anzupassen.</li>
</ul></td>
<td><ul>
<li><strong>Begrenzung des Kontextfensters:</strong> Die Anzahl der Beispiele ist durch die maximale Kontextlänge des Modells limitiert.</li>
<li><strong>Sensitivität gegenüber Beispielen:</strong> Das Ergebnis hängt stark von der Qualität, Reihenfolge und dem Format der bereitgestellten Demonstrationen ab.</li>
<li><strong>Hohe Kosten bei der Inferenz:</strong> Lange Prompts mit vielen Beispielen erhöhen die Kosten und die Generierungszeit.</li>
<li><strong>Sicherheitsrisiken:</strong> Die Übermittlung vertraulicher Informationen als Beispiele kann unsicher sein.</li>
</ul></td>
</tr>
</tbody>
</table>

Vergleich der Vor- und Nachteile von ICL

## Vergleich mit anderen Paradigmen

### ICL vs. Fine-Tuning

Fine-Tuning (Feinabstimmung) verändert die Gewichte des Modells und „prägt“ ihm neues Wissen ein. Dies macht das Modell zu einem Experten auf einem engen Gebiet, verringert aber seine allgemeine Flexibilität. ICL hingegen verändert die Gewichte nicht und ist flexibler, kann aber bei hochspezialisierten Aufgaben, die tiefes Domänenwissen erfordern, leistungsschwächer sein.

### ICL vs. RAG (Retrieval-Augmented Generation)

Beide Methoden erweitern den Kontext des Modells, jedoch für unterschiedliche Zwecke:

- **ICL** verwendet Beispiele, um dem Modell zu **lehren**, *wie* es eine Aufgabe ausführen soll (Demonstration einer Fähigkeit).
- **RAG** verwendet abgerufene Informationen, um dem Modell die für die Antwort notwendigen Fakten **mitzuteilen** (Bereitstellung von Wissen).

In der Praxis werden ICL und RAG oft kombiniert, um die besten Ergebnisse zu erzielen.

## Literatur

- Brown, T. B. et al. (2020). *Language Models are Few-Shot Learners*. <a href="https://arxiv.org/abs/2005.14165" class="external text" rel="nofollow">arXiv:2005.14165</a>.
- Dai, D. et al. (2022). *Why Can GPT Learn In-Context? Language Models Implicitly Perform Gradient Descent as Meta-Optimizers*. <a href="https://arxiv.org/abs/2212.10559" class="external text" rel="nofollow">arXiv:2212.10559</a>.
- Panwar, M.; Ahuja, K.; Goyal, N. (2024). *In-Context Learning through the Bayesian Prism*. <a href="https://arxiv.org/abs/2306.04891" class="external text" rel="nofollow">arXiv:2306.04891</a>.
- Müller, S. et al. (2021). *Transformers Can Do Bayesian Inference*. <a href="https://arxiv.org/abs/2112.10510" class="external text" rel="nofollow">arXiv:2112.10510</a>.
- Garg, S. et al. (2022). *What Can Transformers Learn In-Context? A Case Study of Simple Function Classes*. <a href="https://arxiv.org/abs/2208.01066" class="external text" rel="nofollow">arXiv:2208.01066</a>.
- Min, S. et al. (2022). *Rethinking the Role of Demonstrations: What Makes In-Context Learning Work?*. <a href="https://arxiv.org/abs/2202.12837" class="external text" rel="nofollow">arXiv:2202.12837</a>.
- Wang, X. et al. (2023). *Explaining and Finding Good Demonstrations for In-Context Learning*. <a href="https://arxiv.org/abs/2302.13971" class="external text" rel="nofollow">arXiv:2302.13971</a>.
- Xie, S. et al. (2024). *A Survey on In-Context Learning*. <a href="https://arxiv.org/abs/2301.00234" class="external text" rel="nofollow">arXiv:2301.00234</a>.
- Yu, Z.; Ananiadou, S. (2024). *How Do Large Language Models Learn In-Context? Query and Key Matrices of In-Context Heads Are Two Towers for Metric Learning*. <a href="https://arxiv.org/abs/2402.02872" class="external text" rel="nofollow">arXiv:2402.02872</a>.
- Wibisono, K. C.; Wang, Y. (2024). *From Unstructured Data to In-Context Learning: Exploring What Tasks Can Be Learned and When*. <a href="https://arxiv.org/abs/2406.00131" class="external text" rel="nofollow">arXiv:2406.00131</a>.
- Chan, J. K. et al. (2022). *Data Distributional Properties Drive Emergent In-Context Learning in Transformers*. <a href="https://arxiv.org/abs/2205.05055" class="external text" rel="nofollow">arXiv:2205.05055</a>.
- Hahn, M.; Goyal, N. (2023). *A Theory of Emergent In-Context Learning as Implicit Structure Induction*. <a href="https://arxiv.org/abs/2303.07971" class="external text" rel="nofollow">arXiv:2303.07971</a>.

## Einzelnachweise

1.  <span id="cite_note-lakera-1">[↑](https://systems-analysis.info/int/In-Context_Learning_(DE)#cite_ref-lakera_1-0) <a href="https://www.lakera.ai/blog/what-is-in-context-learning" class="external text" rel="nofollow">What is In-Context Learning (ICL)?</a> // Lakera.ai</span>
2.  <span id="cite_note-hopsworks-2">[↑](https://systems-analysis.info/int/In-Context_Learning_(DE)#cite_ref-hopsworks_2-0) <a href="https://www.hopsworks.ai/dictionary/in-context-learning-icl" class="external text" rel="nofollow">In-Context Learning (ICL)</a> // Hopsworks.ai</span>
3.  <span id="cite_note-gradient_pub-3">[↑](https://systems-analysis.info/int/In-Context_Learning_(DE)#cite_ref-gradient_pub_3-0) <a href="https://thegradient.pub/in-context-learning-in-context/" class="external text" rel="nofollow">In-Context Learning, In Context</a> // The Gradient</span>
4.  <span id="cite_note-arxiv_grad-4">[↑](https://systems-analysis.info/int/In-Context_Learning_(DE)#cite_ref-arxiv_grad_4-0) <a href="https://arxiv.org/abs/2212.10559" class="external text" rel="nofollow">Why Can GPT Learn In-Context? Language Models Secretly Perform Gradient Descent as Meta-Optimizers</a> // arXiv, 2022.</span>
5.  <span id="cite_note-stanford-5">[↑](https://systems-analysis.info/int/In-Context_Learning_(DE)#cite_ref-stanford_5-0) <a href="https://ai.stanford.edu/blog/understanding-incontext/" class="external text" rel="nofollow">Understanding In-Context Learning</a> // Stanford Human-Centered AI, 2023.</span>
