---
title: "Temperatur (LLM)"
source: "https://systems-analysis.info/int/Temperatur_(LLM)"
wiki: "systems-analysis.info/int"
article: "Temperatur_(LLM)"
language: "de"
categories:
  - "Category:German"
  - "Category:Large language models"
  - "Category:LLM core concepts"
  - "Category:Machine learning"
revision_id: 7840
wiki_created_at: 2026-09-07T01:07:46Z
wiki_modified_at: 2026-09-07T01:07:46Z
downloaded_at: 2026-09-07T23:21:06Z
---

# Temperatur (LLM)

**Temperatur** (engl. *Temperature*) im Kontext von [großen Sprachmodellen](https://systems-analysis.info/int/Gro%C3%9Fe_Sprachmodelle "Große Sprachmodelle") (LLM) ist ein Hyperparameter, der das Maß an Zufälligkeit und „Kreativität“ bei der Textgenerierung steuert. Er reguliert die „Schärfe“ oder umgekehrt die „Glättung“ der Wahrscheinlichkeitsverteilung des nächsten Tokens bei jedem Dekodierungsschritt. Durch die Manipulation der Temperatur kann die Balance zwischen Vorhersagbarkeit (Kohärenz) und Vielfalt (Kreativität) des generierten Textes gesteuert werden.

## Theoretische Definition und Mathematik

Mathematisch wird die Temperatur ($T$) als Divisor in die **Softmax**-Funktion eingeführt, die die Logits ($u_{i}$) des Modells in eine Wahrscheinlichkeitsverteilung ($P_{i}$) umwandelt. Die Formel lautet:

$P_{i}^{(T)} = \frac{e^{u_{i}/T}}{\sum\limits_{j}e^{u_{j}/T}}$

Wobei:

- $P_{i}^{(T)}$ die resultierende Wahrscheinlichkeit des $i$-ten Tokens bei einer Temperatur $T$ ist.
- $u_{i}$ der vom Modell ausgegebene Logit (eine nicht normalisierte Bewertung) für das $i < / - teTokenist. \ast < math > T$ der Temperaturparameter ist.

### Einfluss des Temperaturwertes

- **$T = 1$ (Standardwert):** Die Wahrscheinlichkeitsverteilung bleibt unverändert. Dies ist die Standard-Softmax-Funktion, die die ursprünglichen Vorhersagen des Modells widerspiegelt.
- **$T < 1$ (niedrige Temperatur, z. B. $0.2$ – $0.7$):** Die Verteilung wird **spitzer** oder **pointierter**. Die Wahrscheinlichkeiten der wahrscheinlichsten Tokens steigen, während die der unwahrscheinlichen sinken. Dies macht die Generierung deterministischer und vorhersagbarer. Das Modell wählt häufiger offensichtliche, hochfrequente Wörter, was die Kohärenz und grammatikalische Korrektheit des Textes erhöht, aber seine Vielfalt verringert.
- **$T > 1$ (hohe Temperatur, z. B. $1.0$ – $1.5$):** Die Verteilung wird **glatter** oder **gleichmäßiger**. Der Unterschied zwischen den Wahrscheinlichkeiten der Tokens wird ausgeglichen, was die Chance erhöht, weniger wahrscheinliche (und „unerwartetere“) Tokens zu wählen. Dies macht den Text kreativer, vielfältiger und unvorhersehbarer, erhöht aber das Risiko, inkohärente oder grammatikalisch falsche Sätze zu generieren.

### Grenzfälle

- **$T \rightarrow 0$:** Im Grenzwert, wenn die Temperatur gegen Null strebt, wird die Softmax-Funktion zu einer Argmax-Funktion. Das Modell wählt immer das Token mit dem höchsten Logit. Dieser Modus entspricht dem **Greedy Decoding** und ist vollständig deterministisch. Er führt oft zu sich wiederholendem und schablonenhaftem Text.
- **$T \rightarrow \infty$:** Wenn die Temperatur gegen unendlich strebt, wird die Wahrscheinlichkeitsverteilung **gleichmäßig** (uniform). Alle Tokens im Vokabular werden gleich wahrscheinlich, und das Modell generiert einen zufälligen „Bewusstseinsstrom“, der jegliche Kohärenz verliert.

## Praktische Anwendung und Empfehlungen

Die richtige Wahl der Temperatur ist entscheidend und hängt von der jeweiligen Aufgabe ab.

- **Für kreative Aufgaben** (Schreiben von Geschichten, Gedichten, Marketing-Slogans):
  - Eine **höhere Temperatur ($T \approx 0.7 - 1.2$)** wird empfohlen.
  - Dies regt das Modell an, unerwartetere und kreativere Ideen zu generieren, ein vielfältiges Vokabular zu verwenden und schablonenhafte Phrasen zu vermeiden.

<!-- -->

- **Für Aufgaben, die Genauigkeit und Faktizität erfordern** (Beantwortung von Fragen, Zusammenfassungen, Codegenerierung):
  - Eine **niedrige Temperatur ($T \approx 0.0 - 0.4$)** wird empfohlen.
  - Dies minimiert „Halluzinationen“ und veranlasst das Modell, sich an die wahrscheinlichsten und in der Regel genaueren und relevanteren Textfortsetzungen zu halten. In der OpenAI-API wird für Aufgaben, die eine hohe Genauigkeit erfordern, oft empfohlen, $T = 0$ einzustellen.

<!-- -->

- **Für Dialogsysteme und Chatbots:**
  - Eine **moderate Temperatur ($T \approx 0.5 - 0.8$)** wird empfohlen.
  - Dies ermöglicht es, eine Balance zu finden: Die Antworten bleiben kohärent und themenbezogen, werden aber nicht zu trocken und eintönig. Beispielsweise wird in ChatGPT für gewöhnliche Unterhaltungen eine Temperatur von etwa 0.7 verwendet.

## Vergleich mit Top-k und Top-p

Die Temperatur funktioniert im Gegensatz zu Cut-off-Methoden wie **Top-k** und **Top-p (Nucleus Sampling)** anders:

- Die **Temperatur** **verteilt** die Wahrscheinlichkeiten über alle Tokens im Vokabular **neu**, **schneidet** aber keines davon **ab**. Selbst bei einer sehr niedrigen Temperatur haben unwahrscheinliche Tokens eine winzige, aber von Null verschiedene Chance, ausgewählt zu werden.
- **Top-k** und **Top-p** führen einen **harten Cut-off** ein, indem sie Tokens, die nicht in den Kern der Auswahl (nucleus) fallen, vollständig ausschließen. Dies ist eine zuverlässigere Methode, um die Generierung völlig unpassender Wörter zu verhindern.

In der Praxis werden diese Parameter oft kombiniert. Man kann beispielsweise eine moderate Temperatur (z. B. $T = 0.8$) für den allgemeinen Stil festlegen und Top-p (z. B. $p = 0.9$) hinzufügen, um den „Schwanz“ der Verteilung abzuschneiden und grobe Fehler zu vermeiden.

## Siehe auch

- [Große Sprachmodelle](https://systems-analysis.info/int/Gro%C3%9Fe_Sprachmodelle "Große Sprachmodelle")

## Literatur

- Holtzman, A. et al. (2020). *The Curious Case of Neural Text Degeneration*. <a href="https://arxiv.org/abs/1904.09751" class="external text" rel="nofollow">arXiv:1904.09751</a>.
- Caccia, M. et al. (2018). *Language GANs Falling Short*. <a href="https://arxiv.org/abs/1811.02549" class="external text" rel="nofollow">arXiv:1811.02549</a>.
- Fan, A. et al. (2018). *Hierarchical Neural Story Generation*. <a href="https://arxiv.org/abs/1805.04833" class="external text" rel="nofollow">arXiv:1805.04833</a>.
- Meister, C. et al. (2023). *Locally Typical Sampling*. <a href="https://arxiv.org/abs/2202.00666" class="external text" rel="nofollow">arXiv:2202.00666</a>.
- Su, Y.; Collier, N. (2022). *Contrastive Search Is What You Need for Neural Text Generation*. <a href="https://arxiv.org/abs/2210.14140" class="external text" rel="nofollow">arXiv:2210.14140</a>.
- O’Brien, S.; Lewis, M. (2023). *Contrastive Decoding Improves Reasoning in Large Language Models*. <a href="https://arxiv.org/abs/2309.09117" class="external text" rel="nofollow">arXiv:2309.09117</a>.
- Finlayson, M. et al. (2024). *Basis-Aware Truncation Sampling for Neural Text Generation*. <a href="https://arxiv.org/abs/2412.14352" class="external text" rel="nofollow">arXiv:2412.14352</a>.
- Tan, Q. et al. (2024). *A Thorough Examination of Decoding Methods in the Era of Large Language Models*. <a href="https://arxiv.org/abs/2402.06925" class="external text" rel="nofollow">arXiv:2402.06925</a>.
- Ravfogel, S. et al. (2023). *Conformal Nucleus Sampling*. <a href="https://arxiv.org/abs/2305.02633" class="external text" rel="nofollow">arXiv:2305.02633</a>.
- Sen, J. et al. (2025). *Advancing Decoding Strategies: Enhancements in Locally Typical Sampling for LLMs*. <a href="https://arxiv.org/abs/2506.05387" class="external text" rel="nofollow">arXiv:2506.05387</a>.
