---
title: "MATH Benchmark (FR)"
source: "https://systems-analysis.info/int/MATH_Benchmark_(FR)"
wiki: "systems-analysis.info/int"
article: "MATH_Benchmark_(FR)"
language: "fr"
categories:
  - "Category:French"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 3967
wiki_created_at: 2026-09-06T23:28:37Z
wiki_modified_at: 2026-09-06T23:28:37Z
downloaded_at: 2026-09-07T22:59:55Z
---

# MATH Benchmark (FR)

**MATH** (acronyme de l'anglais **Mathematics Aptitude Test of Heuristics**) est un grand jeu de données et benchmark pour évaluer les capacités mathématiques et les compétences en résolution de problèmes des grands modèles de langage (LLM). Le jeu de données a été présenté en 2021 par un groupe de chercheurs dirigé par **Dan Hendrycks** et contient **12 500 problèmes** issus de compétitions mathématiques américaines pour lycéens, telles que l'AMC 10, l'AMC 12 et l'AIME<sup>[\[1\]](https://systems-analysis.info/int/MATH_Benchmark_(FR)#cite_note-hendrycks2021-1)</sup>.

Les problèmes couvrent un large éventail de domaines (algèbre, géométrie, théorie des nombres, combinatoire, etc.) et sont classés par niveau de difficulté. Contrairement aux problèmes scolaires standards, ils exigent souvent une approche créative et des méthodes heuristiques, plutôt qu'une application directe de formules. Chaque problème est accompagné d'une solution complète, étape par étape, et de la réponse finale, ce qui fait de MATH une ressource précieuse tant pour l'entraînement que pour l'évaluation des modèles<sup>[\[2\]](https://systems-analysis.info/int/MATH_Benchmark_(FR)#cite_note-llm_eval_datasets-2)</sup>.

## Structure et caractéristiques du jeu de données

Le benchmark MATH possède plusieurs caractéristiques clés qui en font un outil d'évaluation exigeant et fiable.

### Format des problèmes

Tous les problèmes et leurs solutions sont présentés au format LaTeX, et le langage **Asymptote** est utilisé pour décrire les figures géométriques. Cela permet de représenter toutes les conditions, y compris les images, sous forme textuelle, accessible pour un traitement par un modèle de langage. Chaque problème est étiqueté selon sept domaines des mathématiques et cinq niveaux de difficulté<sup>[\[1\]](https://systems-analysis.info/int/MATH_Benchmark_(FR)#cite_note-hendrycks2021-1)</sup>.

### Évaluation automatique

Les réponses finales dans le jeu de données sont encadrées par le format spécial \`\boxed{...}\` et sont standardisées de manière stricte (par exemple, les fractions sont sous forme irréductible). Cela permet une évaluation automatique des modèles selon la métrique de **correspondance exacte** (*exact match*), ce qui élimine la subjectivité et l'ambiguïté lors de la vérification des résultats. Le modèle doit fournir une réponse strictement correcte pour que le problème soit considéré comme résolu<sup>[\[1\]](https://systems-analysis.info/int/MATH_Benchmark_(FR)#cite_note-hendrycks2021-1)</sup>.

## Difficulté des problèmes et performance humaine

MATH est l'un des tests mathématiques les plus difficiles pour l'IA. Les problèmes sont difficiles même pour des personnes ayant une solide formation en mathématiques.

- Lors de l'étude du jeu de données, un groupe d'**étudiants universitaires** a été testé, obtenant des scores allant de **~40 %** à **~90 %** pour les lauréats d'olympiades.
- Même un triple médaillé d'or des Olympiades internationales de mathématiques n'a pas réussi à résoudre tous les problèmes sans erreur<sup>[\[1\]](https://systems-analysis.info/int/MATH_Benchmark_(FR)#cite_note-hendrycks2021-1)</sup>.

Cela montre que pour réussir les problèmes de MATH, il ne suffit pas d'avoir des connaissances, mais il faut aussi une grande précision et une intuition mathématique.

## Résultats des modèles et progrès dans la résolution

### Premiers résultats (2021)

Lors du lancement du benchmark en 2021, même les plus grands modèles affichaient des résultats extrêmement faibles.

- Le modèle **GPT-3** (175 milliards de paramètres) n'a réussi à résoudre correctement qu'environ **5 %** des problèmes.
- Les versions affinées de **GPT-2** atteignaient une précision de 6 à 7 %<sup>[\[1\]](https://systems-analysis.info/int/MATH_Benchmark_(FR)#cite_note-hendrycks2021-1)</sup>.

Les auteurs ont conclu que la simple augmentation de l'échelle des modèles n'avait que peu d'effet sur la performance et que de nouvelles approches algorithmiques étaient nécessaires pour progresser<sup>[\[3\]](https://systems-analysis.info/int/MATH_Benchmark_(FR)#cite_note-lang_models_surprised-3)</sup>.

### La percée de Minerva et GPT-4 (2022–2023)

La percée a eu lieu avec l'émergence de modèles spécifiquement entraînés sur des textes scientifiques et de nouvelles méthodes de résolution.

- En 2022, le modèle **Minerva de Google** a atteint une précision d'environ **50 %**, démontrant que la combinaison de l'échelle et d'un entraînement spécialisé pouvait considérablement améliorer la qualité de la résolution<sup>[\[3\]](https://systems-analysis.info/int/MATH_Benchmark_(FR)#cite_note-lang_models_surprised-3)</sup>.
- En 2023, **GPT-4** d'OpenAI a réalisé une nouvelle avancée. En utilisant des outils, le modèle a pu améliorer considérablement ses résultats :
  - Avec le **Code Interpreter** (exécution de code pour vérifier les calculs), la précision a atteint près de **70 %**.
  - Avec la méthode de *code-based self-verification* (auto-vérification et correction des erreurs à l'aide de code), un record de **84,3 %** de problèmes résolus a été établi<sup>[\[4\]](https://systems-analysis.info/int/MATH_Benchmark_(FR)#cite_note-decoder_gpt4-4)</sup>.

Ce résultat est comparable au niveau des meilleurs compétiteurs humains et se rapproche du seuil d'expertise.

## Importance et impact

Le benchmark MATH a joué un rôle clé dans le développement des capacités mathématiques des LLM. Il a clairement démontré que pour résoudre des problèmes complexes, la simple mise à l'échelle ne suffit pas et que de nouvelles approches sont nécessaires, telles que :

- L'entraînement sur des solutions complètes, étape par étape.
- Un entraînement spécialisé sur des données scientifiques.
- L'utilisation d'outils externes pour les calculs et la vérification.

Malgré des progrès significatifs, MATH reste un défi important et exigeant. Il continue de servir d'indicateur du niveau de raisonnement mathématique des LLM et stimule la recherche dans le domaine de la résolution fiable de problèmes nécessitant un raisonnement en plusieurs étapes<sup>[\[1\]](https://systems-analysis.info/int/MATH_Benchmark_(FR)#cite_note-hendrycks2021-1)</sup>.

## Liens externes

- <a href="https://github.com/hendrycks/math" class="external text" rel="nofollow">Dépôt officiel du jeu de données MATH sur GitHub</a>
- <a href="https://paperswithcode.com/dataset/math" class="external text" rel="nofollow">Page du jeu de données sur Papers With Code</a>

## Bibliographie

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. <a href="https://arxiv.org/abs/2211.09110" class="external text" rel="nofollow">arXiv:2211.09110</a>.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. <a href="https://arxiv.org/abs/2307.03109" class="external text" rel="nofollow">arXiv:2307.03109</a>.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. <a href="https://arxiv.org/abs/2508.15361" class="external text" rel="nofollow">arXiv:2508.15361</a>.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. <a href="https://arxiv.org/abs/2405.14782" class="external text" rel="nofollow">arXiv:2405.14782</a>.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. <a href="https://arxiv.org/abs/2104.14337" class="external text" rel="nofollow">arXiv:2104.14337</a>.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. <a href="https://arxiv.org/abs/2106.06052" class="external text" rel="nofollow">arXiv:2106.06052</a>.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. <a href="https://arxiv.org/abs/2101.04840" class="external text" rel="nofollow">arXiv:2101.04840</a>.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. <a href="https://arxiv.org/abs/2406.04244" class="external text" rel="nofollow">arXiv:2406.04244</a>.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. <a href="https://arxiv.org/abs/2506.11094" class="external text" rel="nofollow">arXiv:2506.11094</a>.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. <a href="https://arxiv.org/abs/2403.04132" class="external text" rel="nofollow">arXiv:2403.04132</a>.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. <a href="https://arxiv.org/abs/2311.17295" class="external text" rel="nofollow">arXiv:2311.17295</a>.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. <a href="https://arxiv.org/abs/2311.05232" class="external text" rel="nofollow">arXiv:2311.05232</a>.

## Références

1.  <span id="cite_note-hendrycks2021-1">↑ <sup>[1.0](https://systems-analysis.info/int/MATH_Benchmark_(FR)#cite_ref-hendrycks2021_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/MATH_Benchmark_(FR)#cite_ref-hendrycks2021_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/MATH_Benchmark_(FR)#cite_ref-hendrycks2021_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/MATH_Benchmark_(FR)#cite_ref-hendrycks2021_1-3)</sup> <sup>[1.4](https://systems-analysis.info/int/MATH_Benchmark_(FR)#cite_ref-hendrycks2021_1-4)</sup> <sup>[1.5](https://systems-analysis.info/int/MATH_Benchmark_(FR)#cite_ref-hendrycks2021_1-5)</sup> Hendrycks, D., et al. «Measuring Mathematical Problem Solving With the MATH Dataset». *arXiv:2103.03874*. <a href="https://arxiv.org/abs/2103.03874" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-llm_eval_datasets-2">[↑](https://systems-analysis.info/int/MATH_Benchmark_(FR)#cite_ref-llm_eval_datasets_2-0) «AI Benchmarks and Datasets for LLM Evaluation». *arXiv:2412.01020*. <a href="https://arxiv.org/html/2412.01020v1" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-lang_models_surprised-3">↑ <sup>[3.0](https://systems-analysis.info/int/MATH_Benchmark_(FR)#cite_ref-lang_models_surprised_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/MATH_Benchmark_(FR)#cite_ref-lang_models_surprised_3-1)</sup> «Language models surprised us». *Planned-Obsolescence.org*. <a href="https://www.planned-obsolescence.org/language-models-surprised-us/" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-decoder_gpt4-4">[↑](https://systems-analysis.info/int/MATH_Benchmark_(FR)#cite_ref-decoder_gpt4_4-0) «GPT-4 Code Interpreter smashes maths benchmarks, hits new SOTA». *The Decoder*. <a href="https://the-decoder.com/gpt-4-code-interpreter-smashes-maths-benchmarks-hits-new-sota/" class="external autonumber" rel="nofollow">[4]</a></span>
