---
title: "Temperature (LLM) (NL)"
source: "https://systems-analysis.info/int/Temperature_(LLM)_(NL)"
wiki: "systems-analysis.info/int"
article: "Temperature_(LLM)_(NL)"
language: "nl"
categories:
  - "Category:Core LLM concepts"
  - "Category:Dutch"
  - "Category:Large language models"
  - "Category:LLM core concepts"
  - "Category:Machine learning"
revision_id: 7855
wiki_created_at: 2026-09-07T01:07:58Z
wiki_modified_at: 2026-09-07T01:07:58Z
downloaded_at: 2026-09-07T23:21:11Z
---

# Temperature (LLM) (NL)

**Temperatuur** (Engels: Temperature) is in de context van grote taalmodellen (LLM) een hyperparameter die het niveau van willekeur en 'creativiteit' bij het genereren van tekst regelt. Hij bepaalt de 'scherpte' of juist de 'vloeiendheid' van de kansenverdeling van het volgende token bij elke decodeersstap. Door de temperatuur aan te passen kan men de balans sturen tussen voorspelbaarheid (coherentie) en diversiteit (creativiteit) van de gegenereerde tekst.

## Eenvoudige uitleg

**Temperatuur** is een parameter die aangeeft **hoe voorzichtig of juist hoe vrij het model het volgende woord kiest**. Een groot taalmodel heeft vrijwel nooit slechts één mogelijke voortzetting: op elke stap zijn er doorgaans meerdere geschikte opties, elk met een eigen kans. De temperatuur beïnvloedt niet de kennis van het model zelf — niet 'wat het weet' — maar **hoe het precies kiest** tussen deze opties tijdens het genereren.

Bij een **lage temperatuur** gedraagt het model zich conservatiever. Het 'vertrouwt' sterk op de meest waarschijnlijke woorden en wijkt zelden af van de meest verwachte voortzetting. De tekst die dit oplevert is doorgaans egaler, voorspelbaarder, formeel correct en samenhangend. Dit is nuttig in situaties waar nauwkeurigheid van formulering, stabiliteit van antwoorden, reproduceerbaarheid en minimale variatie belangrijk zijn. Echter heeft deze aanpak ook een keerzijde: de tekst kan te sjabloonmatig, droog, eentonig en soms overdreven 'voorzichtig' worden. Bij een extreem lage temperatuur kan het model zelfs dezelfde constructies eindeloos gaan herhalen (in een lus terechtkomen) en 'vastlopen' op de meest waarschijnlijke maar niet altijd passende voortzettingen.

Bij een **hoge temperatuur** gedraagt het model zich vrijmoediger. Het kiest vaker niet alleen de meest waarschijnlijke, maar ook minder voor de hand liggende woorden. Hierdoor worden antwoorden diverser, levendiger, origineeler en soms creatiever. Dit kan nuttig zijn bij creatieve taken, brainstormen, het genereren van ideeën, literaire teksten of het zoeken naar meerdere verschillende formuleringen. Maar samen met de toename van diversiteit neemt ook het risico toe: de tekst kan minder samenhangend en minder nauwkeurig worden, en in extreme gevallen vreemd, onlogisch of willekeurig.

Een handig intuïtief beeld: de temperatuur is **geen regelaar voor kennis, maar een regelaar voor het risico bij woordkeuze**. Een lage temperatuur dwingt het model om bijna altijd de 'veiligste' optie te kiezen. Een hoge temperatuur laat het vaker 'risico nemen' en minder voor de hand liggende voortzettingen proberen.

Nog een bruikbare analogie: temperatuur is vergelijkbaar met de manier waarop een mens een vraag beantwoordt. Als een officieel, nauwkeurig en zorgvuldig antwoord vereist is, kiest men doorgaans voor de meest neutrale en verwachte formuleringen — vergelijkbaar met een lage temperatuur. Als de taak is om een ongewoon idee, een metafoor, een plotwending of meerdere niet-standaard opties te bedenken, worden de formuleringen vrijer en gedurfder — vergelijkbaar met een hoge temperatuur.

Zo bepaalt de temperatuur de balans tussen twee eigenschappen van de generatie:

- **voorspelbaarheid en stabiliteit** van het antwoord;
- **diversiteit en verrassendheid** van de formuleringen.

Hoe lager de temperatuur, des te dichter het model bij de meest waarschijnlijke en standaard voortzetting blijft. Hoe hoger de temperatuur, des te groter de ruimte voor variatie, maar des te minder controle over de striktheid en samenhang van het resultaat.

## Theoretische definitie

Mathematisch wordt de temperatuur ($T$) ingevoerd als deler in de **softmax**-functie, die de uitvoerlogits van het model ($u_{i}$) omzet in een kansverdeling ($P_{i}$). De formule ziet er als volgt uit:

$P_{i}^{(T)} = \frac{e^{u_{i}/T}}{\sum\limits_{j}e^{u_{j}/T}}$

Waarin:

- $P_{i}^{(T)}$ — de resulterende kans van het $i$-de token bij temperatuur $T$.
- $u_{i}$ — de logit (niet-genormaliseerde score) voor het $i$-de token, zoals geproduceerd door het model.
- $T$ — de temperatuurparameter (strikt positief getal). Bijvoorbeeld, in de OpenAI API is voor de meeste modellen het toegestane bereik 0 tot 2.0, waarbij 0 een speciaal geval is van greedy decoding (zie hieronder). In andere bibliotheken (Hugging Face Transformers, llama.cpp) kan de temperatuur elke positieve waarde aannemen.

**Belangrijk:** de temperatuur beïnvloedt de uitvoer **alleen in sampling-modi**. In modi zonder sampling (greedy decoding, klassieke beam search) heeft de temperatuurparameter geen effect. In Hugging Face Transformers moet bijvoorbeeld `do_sample=True` worden ingeschakeld om de temperatuur te laten werken.

### Invloed van de temperatuurwaarde

- **$T = 1$ (standaardwaarde):** De kansverdeling blijft ongewijzigd. Dit is de standaard softmax, die de oorspronkelijke voorspellingen van het model weerspiegelt.
- **$T < 1$ (lage temperatuur, bijvoorbeeld $0.2$ – $0.7$):** De verdeling wordt **scherper** of **piekiger**. De kansen van de meest waarschijnlijke tokens nemen toe en van de minst waarschijnlijke af. Dit maakt de generatie deterministischer en voorspelbaarder. Het model kiest vaker voor vanzelfsprekende, hoogfrequente woorden, wat de coherentie en grammaticale correctheid van de tekst vergroot, maar de diversiteit ervan vermindert.
- **$T > 1$ (hoge temperatuur, bijvoorbeeld $1.1$ – $1.5$):** De verdeling wordt **vloeiender** of **uniformer**. Het verschil tussen de kansen van tokens wordt kleiner, waardoor de kans op het kiezen van minder waarschijnlijke (en meer 'verrassende') tokens toeneemt. Dit maakt de tekst creatiever, diverser en onvoorspelbaarder, maar vergroot het risico op het genereren van onsamenhangend of grammaticaal onjuiste zinnen.

### Grensgevallen

- **$T \rightarrow 0$:** In de limiet, wanneer de temperatuur naar nul nadert, verandert de softmax-functie in een argmax. Het model kiest altijd het token met de hoogste logit. Deze modus is gelijk aan **greedy decoding** en is volledig deterministisch. Dit leidt vaak tot repetitieve en sjabloonmatige tekst. **Opmerking:** de waarde $T = 0$ kan niet rechtstreeks in de formule worden ingevuld (deling door nul); in veel implementaties wordt het behandeld als een speciale modus van maximaal conservatieve keuze, dicht bij greedy decoding. Bovendien garanderen niet alle hosted API's volledige determinisme bij $T = 0$ — zo kunnen resultaten in de Anthropic API zelfs bij nultemperatuur licht variëren.
- **$T \rightarrow \infty$:** Wanneer de temperatuur naar oneindig nadert, wordt de kansverdeling **uniform**. Alle tokens in het vocabulaire worden even waarschijnlijk en het model genereert een willekeurige 'stroom van bewustzijn', waarbij het alle coherentie verliest. In de praktijk is oneindig niet nodig: al bij $T > 2.0$ wordt de verdeling vrijwel uniform en verandert de tekst in een onsamenhangend geheel van tokens.

## Praktische toepassing en aanbevelingen

De juiste keuze van temperatuur is cruciaal en hangt af van de specifieke taak. De onderstaande bereiken zijn **ruwe heuristieken** — optimale waarden kunnen aanzienlijk verschillen afhankelijk van het specifieke model, domein en de taak.

- **Voor creatieve taken** (schrijven van verhalen, gedichten, marketingslogan):
  - Aanbevolen wordt een **hogere temperatuur ($T \approx 0.7 - 1.2$)**.
  - Dit stimuleert het model om meer onverwachte en creatieve ideeën te genereren, gevarieerder vocabulaire te gebruiken en sjabloonzinnen te vermijden.

<!-- -->

- **Voor taken die nauwkeurigheid en feitelijkheid vereisen** (het beantwoorden van vragen, samenvatten, coderen):
  - Aanbevolen wordt een **lage temperatuur ($T \approx 0.0 - 0.4$)**.
  - Dit vermindert de variabiliteit en vergroot de reproduceerbaarheid van het resultaat, waardoor het model zich houdt aan de meest waarschijnlijke tekstvoortzettingen. Bij $T = 0$ wordt de generatie deterministisch (bij een vaste seed en afwezigheid van andere bronnen van willekeur), wat nuttig is voor testen en debuggen, maar problemen kan maskeren die alleen bij sampling optreden. Een lage temperatuur **garandeert op zichzelf echter geen feitelijke nauwkeurigheid** — als het model de benodigde kennis niet heeft, kan het vol vertrouwen een onjuist antwoord genereren. Voor maximale feitelijkheid wordt aanbevolen een lage temperatuur te combineren met kennisbank-zoekmethoden (RAG) en verbeterd prompting. In de OpenAI-documentatie wordt voor taken waarbij gegevens worden geëxtraheerd en feitelijke antwoorden worden gegeven $T = 0$ aanbevolen.

<!-- -->

- **Voor reasoning-taken, wiskunde en het genereren van code:**
  - Doorgaans worden **lagere temperaturen** gebruikt, maar de optimale waarde hangt sterk af van het specifieke model en de taak.
  - **Opmerking:** in sommige reasoning-modellen (bijvoorbeeld de OpenAI o1/o3-familie) kunnen de sampling-parameters **beperkt of vastgesteld** zijn aan de kant van de provider. De interne chain-of-thought vereist een stabiele verdeling, waardoor providers het wijzigen van de temperatuur volledig kunnen blokkeren of gebruikerswaarden slechts binnen een smal bereik accepteren.

<!-- -->

- **Voor dialoogsystemen en chatbots:**
  - Aanbevolen wordt een **gematigde temperatuur ($T \approx 0.5 - 0.8$)**.
  - Dit maakt een evenwicht mogelijk: antwoorden blijven samenhangend en on-topic, maar worden niet te droog en eentonig.

**Opmerking:** in de OpenAI API-documentatie wordt aanbevolen **ofwel** temperature **ofwel** top_p te wijzigen, maar **niet beide parameters tegelijkertijd** — anders wordt het gedrag moeilijk voorspelbaar. In de referentievoorbeelden van de OpenAI API wordt $T = 1.0$ doorgaans als standaardwaarde vermeld.

## Vergelijking met Top-k en Top-p

Temperatuur werkt anders dan afkappingsmethoden zoals **Top-k** en **Top-p (nucleus sampling)**:

- **Temperatuur** **herverdeelt** de kansen over alle tokens in het vocabulaire, maar **knipt** er geen af. Zelfs bij een zeer lage temperatuur houden weinig-waarschijnlijke tokens een miniem maar niet-nul kans om geselecteerd te worden.
- **Top-k** en **Top-p** introduceren een **harde afkapping**, waardoor tokens die niet in de steekproefkern vallen volledig worden uitgesloten. Zo'n afkapping vermindert het risico van het selecteren van staart-tokens, maar is op zichzelf een ruwe heuristiek en kan geloofwaardige voortzettingen weggooien met een niet-nul 'echte' kans.

In de praktijk worden deze parameters vaak gecombineerd gebruikt. Men kan bijvoorbeeld een gematigde temperatuur instellen (zoals $T = 0.8$) voor de algemene stijl en Top-p toevoegen (zoals $p = 0.9$) om de 'staart' van de verdeling af te snijden en het risico op grove fouten te verkleinen. Bij een zeer lage temperatuur ($T \rightarrow 0$) verliest Top-p feitelijk zijn betekenis, omdat de verdeling al slechts één significante piek heeft.

## Interactie van temperatuur met andere decodeerparameters

Temperatuur wordt vrijwel nooit geïsoleerd gebruikt. In de praktijk wordt het gecombineerd met andere hyperparameters om de balans 'creativiteit ↔ betrouwbaarheid' nauwkeurig af te stellen.

### Typische volgorde van parametertoepassingen

In gangbare sampling-implementaties (met name Hugging Face Transformers) worden parameters doorgaans in de volgende volgorde toegepast:

1.  Het model produceert **ruwe logits** ($u_{i}$).
2.  **Herhalingsstraffen** worden toegepast (repetition / frequency / presence penalty) — aanpassing van de logits op basis van reeds gegenereerde tokens.
3.  **Temperatuur** schaalt de logits: $u_{i}/T$.
4.  **Softmax** wordt toegepast → er ontstaat een nieuwe kansverdeling.
5.  **Afkapping (truncation):** eerst Top-k (indien ingesteld), vervolgens Top-p of Min-p.
6.  Uit de resterende 'kern' vindt **willekeurige steekproef** (sampling) plaats.

In dit typische schema verandert de temperatuur de vorm van de verdeling **nadat** herhalingsstraffen zijn toegepast, maar **vóór** softmax en filtering. Daarom levert dezelfde $top\_ p = 0.9$ bij $T = 0.2$ en bij $T = 1.5$ een volkomen andere kerngrootte op. Straffen en temperatuur werken niet-lineair op elkaar in — dit is belangrijk om rekening mee te houden bij het instellen van parameters. De interne volgorde van toepassing in hosted API's (OpenAI, Anthropic) is niet publiekelijk gedocumenteerd op dit detailniveau.

### Top-p (nucleus sampling) en Min-p

**Min-p** (minimum probability sampling) is een relatief nieuwe afkappingsmethode die een ondergrens voor kans instelt ten opzichte van het meest waarschijnlijke token (doorgaans 0.05–0.1). In tegenstelling tot Top-p knipt het tokens af op basis van een relatieve drempel (gekoppeld aan de kans van het beste token, niet aan een vaste cumulatieve massa), wat bijzonder effectief is bij hoge temperaturen (\>0.8): het voorkomt de selectie van geheel ongeschikte tokens zonder significant verlies van diversiteit. Min-p wordt ondersteund door diverse populaire open-source inference-stacks, waaronder vLLM en llama.cpp.

### Repetition / Frequency / Presence penalty

Frequency_penalty en presence_penalty (OpenAI API) verlagen de kans op herhaling van reeds voorgekomen tokens. Ze kunnen een van de nadelen van een lage temperatuur compenseren — de neiging tot sjabloonmatigheid en lussen.

### Typical sampling en Mirostat

Typical sampling (Meister et al., 2023) selecteert tokens waarvan de kans dicht bij de 'verwachte' entropie van de context ligt. Mirostat (v2) past de afkappingsparameters dynamisch aan zodat de doelperplexity constant blijft — dit is nuttig voor lange teksten waarbij stabiliteit van stijl cruciaal is.

### Illustratieve voorbeelden van instellingen

Hieronder staan **bij benadering** opgegeven configuraties voor verschillende typen taken. Deze waarden zijn geen algemene aanbevelingen — optimale parameters hangen af van het specifieke model, de taak en de inference-stack.

| Taak                               | Temperatuur | Mogelijke combinatie              | Logica                                        |
|------------------------------------|-------------|-----------------------------------|-----------------------------------------------|
| Factual Q&A, samenvatten           | 0.0–0.3     | T + top_p=0.9                     | Minimalisering van willekeurige variabiliteit |
| Coderen, wiskunde                  | 0.1–0.4     | T + repetition_penalty            | Stabiliteit + voorkomen van lussen            |
| Dialogen / chatbots                | 0.6–0.85    | T + top_p=0.92 of min_p=0.1       | Balans tussen natuurlijkheid en samenhang     |
| Creativiteit (verhalen, marketing) | 0.75–1.1    | T + min_p=0.07–0.1                | Diversiteit met filtering van de staart       |
| Long-form / agenten                | 0.5–0.8     | Mirostat of T + frequency_penalty | Controle over lengte en samenhang             |

**Algemeen advies:** verander temperature en top_p niet sterk tegelijkertijd. Doorgaans is het handiger om een van de truncation-parameters vast te zetten en creativiteit via de temperatuur te sturen — dit maakt het gedrag van het model voorspelbaarder.

**Bijzonderheid van moderne aligned-modellen:** in sterk uitgelijnde modellen (die RLHF / Constitutional AI / RLAIF hebben ondergaan) is het effect van een hoge temperatuur afgezwakt ten opzichte van basismodellen — het model genereert zelfs bij $T = 1.2$ minder snel onsamenhangend tekst. De specifieke optimale waarden kunnen veranderen met de komst van nieuwe modelgeneraties; de bovenstaande aanbevelingen zijn actueel per 2025–2026.

## Literatuur

- Holtzman, A. et al. (2020). *The Curious Case of Neural Text Degeneration*. arXiv:1904.09751.
- Caccia, M. et al. (2018). *Language GANs Falling Short*. arXiv:1811.02549.
- Fan, A. et al. (2018). *Hierarchical Neural Story Generation*. arXiv:1805.04833.
- Meister, C. et al. (2023). *Locally Typical Sampling*. arXiv:2202.00666.
- Hewitt, J.; Manning, C.; Liang, P. (2022). *Truncation Sampling as Language Model Desmoothing*. arXiv:2210.15191.
- Su, Y.; Collier, N. (2022). *Contrastive Search Is What You Need for Neural Text Generation*. arXiv:2210.14140.
- O'Brien, S.; Lewis, M. (2023). *Contrastive Decoding Improves Reasoning in Large Language Models*. arXiv:2309.09117.
- Finlayson, M. et al. (2023). *Closing the Curious Case of Neural Text Degeneration*. arXiv:2310.01693.
- Shi, C. et al. (2024). *A Thorough Examination of Decoding Methods in the Era of Large Language Models*. arXiv:2402.06925.
- Ravfogel, S. et al. (2023). *Conformal Nucleus Sampling*. arXiv:2305.02633.
- Sen, J. et al. (2025). *Advancing Decoding Strategies: Enhancements in Locally Typical Sampling for LLMs*. arXiv:2506.05387.
- Basu, S. et al. (2021). *Mirostat: A Perplexity-Controlled Neural Text Decoding Algorithm*. arXiv:2007.14966.
- Nguyen, M. N. et al. (2025). *Turning Up the Heat: Min-p Sampling for Diverse and High-Quality Text Generation*. arXiv:2407.01082.
- Renze, M.; Guven, E. (2024). *The Effect of Sampling Temperature on Problem Solving in Large Language Models*. arXiv:2402.05201.
- Zhang, S. et al. (2024). *EDT: Improving Large Language Models' Generation by Entropy-based Dynamic Temperature Sampling*. arXiv:2403.14541.
- Li, L. et al. (2025). *Exploring the Impact of Temperature on Large Language Models: Hot or Cold?*. arXiv:2506.07295.

## Zie ook

- Grote taalmodellen
