---
title: "GSM8K (Grade School Math 8K) (FR)"
source: "https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(FR)"
wiki: "systems-analysis.info/int"
article: "GSM8K_(Grade_School_Math_8K)_(FR)"
language: "fr"
categories:
  - "Category:French"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 2495
wiki_created_at: 2026-09-06T23:05:05Z
wiki_modified_at: 2026-09-06T23:05:05Z
downloaded_at: 2026-09-07T22:51:42Z
---

# GSM8K (Grade School Math 8K) (FR)

**GSM8K** (**Grade School Math 8K**) est un jeu de données de référence contenant environ 8 500 problèmes mathématiques de niveau scolaire. Il a été créé en 2021 par des chercheurs d' **OpenAI** pour évaluer et développer les capacités de raisonnement mathématique en plusieurs étapes des [grands modèles de langage](https://systems-analysis.info/int/Grands_mod%C3%A8les_de_langage "Grands modèles de langage") (LLM)<sup>[\[1\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(FR)#cite_note-openai2021-1)</sup>. GSM8K est devenu l'un des principaux benchmarks pour mesurer les progrès dans le domaine du raisonnement mathématique de l'intelligence artificielle.

Chaque problème du jeu de données se présente sous la forme d'une courte histoire textuelle, dont la solution nécessite l'exécution de 2 à 8 opérations arithmétiques séquentielles (addition, soustraction, multiplication, division). Malgré leur apparente simplicité, ces problèmes exigent une compréhension approfondie du texte et un raisonnement logique, ce qui les rend difficiles pour de nombreux LLM<sup>[\[2\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(FR)#cite_note-pwc-2)</sup>.

## Caractéristiques principales

### Volume et structure

Le jeu de données GSM8K contient environ **8 500 problèmes**, répartis en deux ensembles :

- **Ensemble d'entraînement** : ~7 500 problèmes destinés au réajustement fin (*fine-tuning*) des modèles. Chaque problème est accompagné d'une solution détaillée étape par étape.
- **Ensemble de test** : ~1 000 problèmes utilisés pour l'évaluation indépendante des performances des modèles<sup>[\[1\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(FR)#cite_note-openai2021-1)</sup>.

### Complexité et contenu

Les problèmes sont intentionnellement conçus pour pouvoir être résolus par un bon élève du collège, tout en exigeant un **raisonnement en plusieurs étapes**. Cela permet de tester non pas tant les connaissances mathématiques du modèle que sa capacité à décomposer un problème et à exécuter des opérations logiques de manière séquentielle.

### Diversité linguistique

Les énoncés des problèmes dans GSM8K présentent une grande variété de styles et de constructions linguistiques. L'objectif est de vérifier la capacité des modèles à comprendre les conditions des problèmes exprimées de différentes manières et à éviter la « mémorisation » de modèles spécifiques<sup>[\[3\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(FR)#cite_note-klu_benchmark-3)</sup>.

## Histoire et évolution de l'évaluation des modèles

### Premiers modèles et résultats de base

Dans leur publication originale de 2021, les auteurs ont montré que même les grands modèles de l'époque, comme **GPT-3** (175 milliards de paramètres), rencontraient des difficultés considérables avec ce jeu de données. Après un réajustement fin et l'utilisation d'un modèle de vérification auxiliaire, la précision de la résolution n'atteignait qu'environ **55 %**<sup>[\[1\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(FR)#cite_note-openai2021-1)</sup>. Ce résultat a démontré qu'une seule petite erreur dans la chaîne de raisonnement pouvait conduire à une réponse entièrement incorrecte.

### Méthodes révolutionnaires : Chain-of-Thought

Une avancée majeure dans la résolution des problèmes GSM8K a été l'approche de la **chaîne de pensée (Chain-of-Thought, CoT)**. En 2022, des chercheurs de Google ont montré que si l'on incite le modèle à détailler explicitement les étapes de la solution avant de donner la réponse, la précision augmente considérablement. Le modèle **PaLM** (540 milliards de paramètres), en utilisant le CoT, a atteint une précision de **58 %**<sup>[\[4\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(FR)#cite_note-google_cot-4)</sup>. L'application d'une technique plus complexe, la **self-consistency** (génération de plusieurs variantes de solution et sélection de la réponse la plus fréquente), a permis d'élever cette précision à **74 %**<sup>[\[4\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(FR)#cite_note-google_cot-4)</sup>.

### Dépassement du niveau humain

À partir de 2023, les modèles génératifs les plus récents ont dépassé le niveau de performance humain sur ce benchmark.

- **GPT-4** d'OpenAI, en mode *few-shot CoT* (où quelques exemples de problèmes résolus sont fournis dans le prompt), a atteint une précision d'environ **92 %**<sup>[\[5\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(FR)#cite_note-gpt4_92-5)</sup>, et jusqu'à **97 %** avec des stratégies supplémentaires<sup>[\[6\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(FR)#cite_note-gpt4_97-6)</sup>.
- **Claude 2** d'Anthropic a obtenu un résultat de **88 %**, tandis que la version plus récente, **Claude 3**, a atteint environ **95 %**<sup>[\[3\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(FR)#cite_note-klu_benchmark-3)</sup>.

Ces performances élevées témoignent des progrès significatifs dans les capacités de raisonnement des LLM, mais indiquent également que GSM8K devient « presque résolu » pour les modèles de pointe. Cela stimule le développement de benchmarks plus complexes, tels que **MATH** et **MMLU**.

## Rôle dans l'entraînement et le développement des modèles

En plus de l'évaluation, GSM8K est activement utilisé pour l' **entraînement et l'amélioration** des modèles.

- **Fine-tuning (réajustement fin)** : L'ensemble d'entraînement, avec ses solutions détaillées, constitue une ressource précieuse pour entraîner les modèles à la logique mathématique.
- **Entraînement de vérificateurs** : Dans la publication originale d'OpenAI, une partie des données de GSM8K a été utilisée pour entraîner un modèle distinct, le **vérificateur**, qui évaluait l'exactitude des solutions générées. Cette approche, consistant à entraîner séparément un générateur et un critique, a prouvé son efficacité<sup>[\[1\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(FR)#cite_note-openai2021-1)</sup>.
- **Prompt Engineering** : La disponibilité d'un grand nombre d'exemples a permis aux chercheurs de développer et d'affiner des techniques de prompting, telles que **Chain-of-Thought** et **Tree-of-Thought**, qui apprennent au modèle à raisonner sans modifier ses poids.

## Liens externes

- <a href="https://paperswithcode.com/dataset/gsm8k" class="external text" rel="nofollow">Page du jeu de données sur Papers With Code</a>
- <a href="https://github.com/openai/grade-school-math" class="external text" rel="nofollow">Dépôt officiel sur GitHub</a>

## Bibliographie

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. <a href="https://arxiv.org/abs/2211.09110" class="external text" rel="nofollow">arXiv:2211.09110</a>.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. <a href="https://arxiv.org/abs/2307.03109" class="external text" rel="nofollow">arXiv:2307.03109</a>.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. <a href="https://arxiv.org/abs/2508.15361" class="external text" rel="nofollow">arXiv:2508.15361</a>.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. <a href="https://arxiv.org/abs/2405.14782" class="external text" rel="nofollow">arXiv:2405.14782</a>.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. <a href="https://arxiv.org/abs/2104.14337" class="external text" rel="nofollow">arXiv:2104.14337</a>.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. <a href="https://arxiv.org/abs/2106.06052" class="external text" rel="nofollow">arXiv:2106.06052</a>.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. <a href="https://arxiv.org/abs/2101.04840" class="external text" rel="nofollow">arXiv:2101.04840</a>.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. <a href="https://arxiv.org/abs/2406.04244" class="external text" rel="nofollow">arXiv:2406.04244</a>.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. <a href="https://arxiv.org/abs/2506.11094" class="external text" rel="nofollow">arXiv:2506.11094</a>.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. <a href="https://arxiv.org/abs/2403.04132" class="external text" rel="nofollow">arXiv:2403.04132</a>.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. <a href="https://arxiv.org/abs/2311.17295" class="external text" rel="nofollow">arXiv:2311.17295</a>.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. <a href="https://arxiv.org/abs/2311.05232" class="external text" rel="nofollow">arXiv:2311.05232</a>.

## Références

1.  <span id="cite_note-openai2021-1">↑ <sup>[1.0](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(FR)#cite_ref-openai2021_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(FR)#cite_ref-openai2021_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(FR)#cite_ref-openai2021_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(FR)#cite_ref-openai2021_1-3)</sup> Cobbe, Karl et al. «Training Verifiers to Solve Math Word Problems». *arXiv:2110.14168*. <a href="https://arxiv.org/abs/2110.14168" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-pwc-2">[↑](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(FR)#cite_ref-pwc_2-0) «GSM8K Dataset». *Papers With Code*. <a href="https://paperswithcode.com/dataset/gsm8k" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-klu_benchmark-3">↑ <sup>[3.0](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(FR)#cite_ref-klu_benchmark_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(FR)#cite_ref-klu_benchmark_3-1)</sup> «GSM8K Benchmark». *Klu.ai*. <a href="https://klu.ai/glossary/GSM8K-eval" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-google_cot-4">↑ <sup>[4.0](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(FR)#cite_ref-google_cot_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(FR)#cite_ref-google_cot_4-1)</sup> Wei, Jason et al. «Language Models Perform Reasoning via Chain of Thought». *Google Research Blog*. <a href="https://research.google/blog/language-models-perform-reasoning-via-chain-of-thought/" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-gpt4_92-5">[↑](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(FR)#cite_ref-gpt4_92_5-0) Yu, L., et al. «Solving Challenging Math Word Problems Using GPT-4». *EMNLP 2023*. <a href="https://aclanthology.org/2023.emnlp-main.927.pdf" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-gpt4_97-6">[↑](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(FR)#cite_ref-gpt4_97_6-0) «Achieving \>97% on GSM8K». *arXiv:2404.14963*. <a href="https://arxiv.org/html/2404.14963v4" class="external autonumber" rel="nofollow">[6]</a></span>
