---
title: "Temperature (LLM) (FR)"
source: "https://systems-analysis.info/int/Temperature_(LLM)_(FR)"
wiki: "systems-analysis.info/int"
article: "Temperature_(LLM)_(FR)"
language: "fr"
categories:
  - "Category:French"
  - "Category:Large language models"
  - "Category:LLM core concepts"
  - "Category:Machine learning"
revision_id: 7848
wiki_created_at: 2026-09-07T01:07:52Z
wiki_modified_at: 2026-09-07T01:07:52Z
downloaded_at: 2026-09-07T23:21:09Z
---

# Temperature (LLM) (FR)

**Température** (en anglais, *Temperature*) dans le contexte des grands modèles de langage (LLM) est un hyperparamètre qui contrôle le niveau de caractère aléatoire et de « créativité » lors de la génération de texte. Il ajuste la « netteté » ou, au contraire, le « lissage » de la distribution de probabilité du token suivant à chaque étape du décodage. En manipulant la température, on peut gérer l'équilibre entre la prévisibilité (cohérence) et la diversité (créativité) du texte généré.

## Définition théorique et mathématique

Mathématiquement, la température ($T$) est introduite comme un diviseur dans la fonction **softmax**, qui transforme les logits de sortie du modèle ($u_{i}$) en une distribution de probabilité ($P_{i}$). La formule est la suivante :

$P_{i}^{(T)} = \frac{e^{u_{i}/T}}{\sum\limits_{j}e^{u_{j}/T}}$

Où :

- $P_{i}^{(T)}$ — la probabilité finale du $i$-ème token à une température $T$.
- $u_{i}$ — le logit (score non normalisé) pour le $i$-ème token, produit par le modèle.
- $T$ — le paramètre de température.

### Influence de la valeur de la température

- **$T = 1$ (valeur par défaut) :** La distribution de probabilité reste inchangée. C'est le softmax standard, qui reflète les prédictions initiales du modèle.
- **$T < 1$ (basse température, par exemple $0.2$ – $0.7$) :** La distribution devient plus **nette** ou **pointue**. Les probabilités des tokens les plus probables augmentent, tandis que celles des tokens moins probables diminuent. Cela rend la génération plus déterministe et prévisible. Le modèle choisit plus souvent des mots évidents et à haute fréquence, ce qui améliore la cohérence et la correction grammaticale du texte, mais réduit sa diversité.
- **$T > 1$ (haute température, par exemple $1.0$ – $1.5$) :** La distribution devient plus **lisse** ou **uniforme**. La différence entre les probabilités des tokens est atténuée, ce qui augmente les chances de sélectionner des tokens moins probables (et plus « inattendus »). Cela rend le texte plus créatif, diversifié et imprévisible, mais augmente le risque de générer des phrases incohérentes ou grammaticalement incorrectes.

### Cas limites

- **$T \rightarrow 0$ :** À la limite, lorsque la température tend vers zéro, la fonction softmax se transforme en argmax. Le modèle choisira toujours le token avec le logit le plus élevé. Ce mode est équivalent au **décodage glouton (greedy decoding)** et est entièrement déterministe. Il conduit souvent à un texte répétitif et stéréotypé.
- **$T \rightarrow \infty$ :** Lorsque la température tend vers l'infini, la distribution de probabilité devient **uniforme**. Tous les tokens du vocabulaire deviennent équiprobables, et le modèle génère un « flux de conscience » aléatoire, perdant toute cohérence.

## Application pratique et recommandations

Le choix correct de la température est crucial et dépend de la tâche spécifique.

- **Pour les tâches créatives** (rédaction de récits, de poèmes, de slogans marketing) :
  - Une **température plus élevée ($T \approx 0.7 - 1.2$)** est recommandée.
  - Cela stimule le modèle à générer des idées plus inattendues et créatives, à utiliser un vocabulaire varié et à éviter les phrases stéréotypées.

<!-- -->

- **Pour les tâches nécessitant précision et factualité** (réponses à des questions, résumé, génération de code) :
  - Une **basse température ($T \approx 0.0 - 0.4$)** est recommandée.
  - Cela minimise les « hallucinations » et contraint le modèle à s'en tenir aux suites de texte les plus probables et, en général, plus précises et pertinentes. Dans l'API d'OpenAI, pour les tâches exigeant une grande précision, il est souvent recommandé de régler $T = 0$.

<!-- -->

- **Pour les systèmes de dialogue et les chatbots :**
  - Une **température modérée ($T \approx 0.5 - 0.8$)** est recommandée.
  - Cela permet de trouver un équilibre : les réponses restent cohérentes et pertinentes, tout en n'étant pas trop sèches et monotones. Par exemple, dans ChatGPT, une température d'environ 0.7 est utilisée pour les conversations courantes.

## Comparaison avec Top-k et Top-p

La température, contrairement aux méthodes de troncature telles que **Top-k** et **Top-p (nucleus sampling)**, fonctionne différemment :

- **La température** **redistribue** les probabilités entre tous les tokens du vocabulaire, mais n'en **écarte** aucun. Même à une température très basse, les tokens peu probables conservent une chance infime, mais non nulle, d'être sélectionnés.
- **Top-k** et **Top-p** introduisent une **troncature stricte**, excluant complètement les tokens qui ne font pas partie du noyau d'échantillonnage. C'est une méthode plus fiable pour empêcher la génération de mots totalement inappropriés.

En pratique, ces paramètres sont souvent utilisés conjointement. Par exemple, on peut définir une température modérée (par exemple, $T = 0.8$) pour le style général et ajouter un Top-p (par exemple, $p = 0.9$) pour couper la « queue » de la distribution et éviter les erreurs grossières.

## Voir aussi

- Grands modèles de langage

## Bibliographie

- Holtzman, A. et al. (2020). *The Curious Case of Neural Text Degeneration*. <a href="https://arxiv.org/abs/1904.09751" class="external text" rel="nofollow">arXiv:1904.09751</a>.
- Caccia, M. et al. (2018). *Language GANs Falling Short*. <a href="https://arxiv.org/abs/1811.02549" class="external text" rel="nofollow">arXiv:1811.02549</a>.
- Fan, A. et al. (2018). *Hierarchical Neural Story Generation*. <a href="https://arxiv.org/abs/1805.04833" class="external text" rel="nofollow">arXiv:1805.04833</a>.
- Meister, C. et al. (2023). *Locally Typical Sampling*. <a href="https://arxiv.org/abs/2202.00666" class="external text" rel="nofollow">arXiv:2202.00666</a>.
- Su, Y.; Collier, N. (2022). *Contrastive Search Is What You Need for Neural Text Generation*. <a href="https://arxiv.org/abs/2210.14140" class="external text" rel="nofollow">arXiv:2210.14140</a>.
- O’Brien, S.; Lewis, M. (2023). *Contrastive Decoding Improves Reasoning in Large Language Models*. <a href="https://arxiv.org/abs/2309.09117" class="external text" rel="nofollow">arXiv:2309.09117</a>.
- Finlayson, M. et al. (2024). *Basis-Aware Truncation Sampling for Neural Text Generation*. <a href="https://arxiv.org/abs/2412.14352" class="external text" rel="nofollow">arXiv:2412.14352</a>.
- Tan, Q. et al. (2024). *A Thorough Examination of Decoding Methods in the Era of Large Language Models*. <a href="https://arxiv.org/abs/2402.06925" class="external text" rel="nofollow">arXiv:2402.06925</a>.
- Ravfogel, S. et al. (2023). *Conformal Nucleus Sampling*. <a href="https://arxiv.org/abs/2305.02633" class="external text" rel="nofollow">arXiv:2305.02633</a>.
- Sen, J. et al. (2025). *Advancing Decoding Strategies: Enhancements in Locally Typical Sampling for LLMs*. <a href="https://arxiv.org/abs/2506.05387" class="external text" rel="nofollow">arXiv:2506.05387</a>.
