GSM8K (Grade School Math 8K) (FR)
GSM8K (Grade School Math 8K) est un jeu de données de référence contenant environ 8 500 problèmes mathématiques de niveau scolaire. Il a été créé en 2021 par des chercheurs d' OpenAI pour évaluer et développer les capacités de raisonnement mathématique en plusieurs étapes des grands modèles de langage (LLM)[1]. GSM8K est devenu l'un des principaux benchmarks pour mesurer les progrès dans le domaine du raisonnement mathématique de l'intelligence artificielle.
Chaque problème du jeu de données se présente sous la forme d'une courte histoire textuelle, dont la solution nécessite l'exécution de 2 à 8 opérations arithmétiques séquentielles (addition, soustraction, multiplication, division). Malgré leur apparente simplicité, ces problèmes exigent une compréhension approfondie du texte et un raisonnement logique, ce qui les rend difficiles pour de nombreux LLM[2].
Caractéristiques principales
Volume et structure
Le jeu de données GSM8K contient environ 8 500 problèmes, répartis en deux ensembles :
- Ensemble d'entraînement : ~7 500 problèmes destinés au réajustement fin (fine-tuning) des modèles. Chaque problème est accompagné d'une solution détaillée étape par étape.
- Ensemble de test : ~1 000 problèmes utilisés pour l'évaluation indépendante des performances des modèles[1].
Complexité et contenu
Les problèmes sont intentionnellement conçus pour pouvoir être résolus par un bon élève du collège, tout en exigeant un raisonnement en plusieurs étapes. Cela permet de tester non pas tant les connaissances mathématiques du modèle que sa capacité à décomposer un problème et à exécuter des opérations logiques de manière séquentielle.
Diversité linguistique
Les énoncés des problèmes dans GSM8K présentent une grande variété de styles et de constructions linguistiques. L'objectif est de vérifier la capacité des modèles à comprendre les conditions des problèmes exprimées de différentes manières et à éviter la « mémorisation » de modèles spécifiques[3].
Histoire et évolution de l'évaluation des modèles
Premiers modèles et résultats de base
Dans leur publication originale de 2021, les auteurs ont montré que même les grands modèles de l'époque, comme GPT-3 (175 milliards de paramètres), rencontraient des difficultés considérables avec ce jeu de données. Après un réajustement fin et l'utilisation d'un modèle de vérification auxiliaire, la précision de la résolution n'atteignait qu'environ 55 %[1]. Ce résultat a démontré qu'une seule petite erreur dans la chaîne de raisonnement pouvait conduire à une réponse entièrement incorrecte.
Méthodes révolutionnaires : Chain-of-Thought
Une avancée majeure dans la résolution des problèmes GSM8K a été l'approche de la chaîne de pensée (Chain-of-Thought, CoT). En 2022, des chercheurs de Google ont montré que si l'on incite le modèle à détailler explicitement les étapes de la solution avant de donner la réponse, la précision augmente considérablement. Le modèle PaLM (540 milliards de paramètres), en utilisant le CoT, a atteint une précision de 58 %[4]. L'application d'une technique plus complexe, la self-consistency (génération de plusieurs variantes de solution et sélection de la réponse la plus fréquente), a permis d'élever cette précision à 74 %[4].
Dépassement du niveau humain
À partir de 2023, les modèles génératifs les plus récents ont dépassé le niveau de performance humain sur ce benchmark.
- GPT-4 d'OpenAI, en mode few-shot CoT (où quelques exemples de problèmes résolus sont fournis dans le prompt), a atteint une précision d'environ 92 %[5], et jusqu'à 97 % avec des stratégies supplémentaires[6].
- Claude 2 d'Anthropic a obtenu un résultat de 88 %, tandis que la version plus récente, Claude 3, a atteint environ 95 %[3].
Ces performances élevées témoignent des progrès significatifs dans les capacités de raisonnement des LLM, mais indiquent également que GSM8K devient « presque résolu » pour les modèles de pointe. Cela stimule le développement de benchmarks plus complexes, tels que MATH et MMLU.
Rôle dans l'entraînement et le développement des modèles
En plus de l'évaluation, GSM8K est activement utilisé pour l' entraînement et l'amélioration des modèles.
- Fine-tuning (réajustement fin) : L'ensemble d'entraînement, avec ses solutions détaillées, constitue une ressource précieuse pour entraîner les modèles à la logique mathématique.
- Entraînement de vérificateurs : Dans la publication originale d'OpenAI, une partie des données de GSM8K a été utilisée pour entraîner un modèle distinct, le vérificateur, qui évaluait l'exactitude des solutions générées. Cette approche, consistant à entraîner séparément un générateur et un critique, a prouvé son efficacité[1].
- Prompt Engineering : La disponibilité d'un grand nombre d'exemples a permis aux chercheurs de développer et d'affiner des techniques de prompting, telles que Chain-of-Thought et Tree-of-Thought, qui apprennent au modèle à raisonner sans modifier ses poids.
Liens externes
Bibliographie
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
Références
- ↑ 1.0 1.1 1.2 1.3 Cobbe, Karl et al. «Training Verifiers to Solve Math Word Problems». arXiv:2110.14168. [1]
- ↑ «GSM8K Dataset». Papers With Code. [2]
- ↑ 3.0 3.1 «GSM8K Benchmark». Klu.ai. [3]
- ↑ 4.0 4.1 Wei, Jason et al. «Language Models Perform Reasoning via Chain of Thought». Google Research Blog. [4]
- ↑ Yu, L., et al. «Solving Challenging Math Word Problems Using GPT-4». EMNLP 2023. [5]
- ↑ «Achieving >97% on GSM8K». arXiv:2404.14963. [6]