Temperature (LLM) (FR)
Température (en anglais, Temperature) dans le contexte des grands modèles de langage (LLM) est un hyperparamètre qui contrôle le niveau de caractère aléatoire et de « créativité » lors de la génération de texte. Il ajuste la « netteté » ou, au contraire, le « lissage » de la distribution de probabilité du token suivant à chaque étape du décodage. En manipulant la température, on peut gérer l'équilibre entre la prévisibilité (cohérence) et la diversité (créativité) du texte généré.
Définition théorique et mathématique
Mathématiquement, la température () est introduite comme un diviseur dans la fonction softmax, qui transforme les logits de sortie du modèle () en une distribution de probabilité (). La formule est la suivante :
Où :
- — la probabilité finale du -ème token à une température .
- — le logit (score non normalisé) pour le -ème token, produit par le modèle.
- — le paramètre de température.
Influence de la valeur de la température
- (valeur par défaut) : La distribution de probabilité reste inchangée. C'est le softmax standard, qui reflète les prédictions initiales du modèle.
- (basse température, par exemple – ) : La distribution devient plus nette ou pointue. Les probabilités des tokens les plus probables augmentent, tandis que celles des tokens moins probables diminuent. Cela rend la génération plus déterministe et prévisible. Le modèle choisit plus souvent des mots évidents et à haute fréquence, ce qui améliore la cohérence et la correction grammaticale du texte, mais réduit sa diversité.
- (haute température, par exemple – ) : La distribution devient plus lisse ou uniforme. La différence entre les probabilités des tokens est atténuée, ce qui augmente les chances de sélectionner des tokens moins probables (et plus « inattendus »). Cela rend le texte plus créatif, diversifié et imprévisible, mais augmente le risque de générer des phrases incohérentes ou grammaticalement incorrectes.
Cas limites
- : À la limite, lorsque la température tend vers zéro, la fonction softmax se transforme en argmax. Le modèle choisira toujours le token avec le logit le plus élevé. Ce mode est équivalent au décodage glouton (greedy decoding) et est entièrement déterministe. Il conduit souvent à un texte répétitif et stéréotypé.
- : Lorsque la température tend vers l'infini, la distribution de probabilité devient uniforme. Tous les tokens du vocabulaire deviennent équiprobables, et le modèle génère un « flux de conscience » aléatoire, perdant toute cohérence.
Application pratique et recommandations
Le choix correct de la température est crucial et dépend de la tâche spécifique.
- Pour les tâches créatives (rédaction de récits, de poèmes, de slogans marketing) :
- Une température plus élevée () est recommandée.
- Cela stimule le modèle à générer des idées plus inattendues et créatives, à utiliser un vocabulaire varié et à éviter les phrases stéréotypées.
- Pour les tâches nécessitant précision et factualité (réponses à des questions, résumé, génération de code) :
- Une basse température () est recommandée.
- Cela minimise les « hallucinations » et contraint le modèle à s'en tenir aux suites de texte les plus probables et, en général, plus précises et pertinentes. Dans l'API d'OpenAI, pour les tâches exigeant une grande précision, il est souvent recommandé de régler .
- Pour les systèmes de dialogue et les chatbots :
- Une température modérée () est recommandée.
- Cela permet de trouver un équilibre : les réponses restent cohérentes et pertinentes, tout en n'étant pas trop sèches et monotones. Par exemple, dans ChatGPT, une température d'environ 0.7 est utilisée pour les conversations courantes.
Comparaison avec Top-k et Top-p
La température, contrairement aux méthodes de troncature telles que Top-k et Top-p (nucleus sampling), fonctionne différemment :
- La température redistribue les probabilités entre tous les tokens du vocabulaire, mais n'en écarte aucun. Même à une température très basse, les tokens peu probables conservent une chance infime, mais non nulle, d'être sélectionnés.
- Top-k et Top-p introduisent une troncature stricte, excluant complètement les tokens qui ne font pas partie du noyau d'échantillonnage. C'est une méthode plus fiable pour empêcher la génération de mots totalement inappropriés.
En pratique, ces paramètres sont souvent utilisés conjointement. Par exemple, on peut définir une température modérée (par exemple, ) pour le style général et ajouter un Top-p (par exemple, ) pour couper la « queue » de la distribution et éviter les erreurs grossières.
Voir aussi
- Grands modèles de langage
Bibliographie
- Holtzman, A. et al. (2020). The Curious Case of Neural Text Degeneration. arXiv:1904.09751.
- Caccia, M. et al. (2018). Language GANs Falling Short. arXiv:1811.02549.
- Fan, A. et al. (2018). Hierarchical Neural Story Generation. arXiv:1805.04833.
- Meister, C. et al. (2023). Locally Typical Sampling. arXiv:2202.00666.
- Su, Y.; Collier, N. (2022). Contrastive Search Is What You Need for Neural Text Generation. arXiv:2210.14140.
- O’Brien, S.; Lewis, M. (2023). Contrastive Decoding Improves Reasoning in Large Language Models. arXiv:2309.09117.
- Finlayson, M. et al. (2024). Basis-Aware Truncation Sampling for Neural Text Generation. arXiv:2412.14352.
- Tan, Q. et al. (2024). A Thorough Examination of Decoding Methods in the Era of Large Language Models. arXiv:2402.06925.
- Ravfogel, S. et al. (2023). Conformal Nucleus Sampling. arXiv:2305.02633.
- Sen, J. et al. (2025). Advancing Decoding Strategies: Enhancements in Locally Typical Sampling for LLMs. arXiv:2506.05387.