MMLU Benchmark (FR)
MMLU (acronyme de Measuring Massive Multitask Language Understanding) est un ensemble de tâches de référence (benchmark) conçu pour évaluer les capacités des grands modèles de langage (LLM) dans un large éventail de domaines. Le benchmark a été développé en 2020 par une équipe de chercheurs dirigée par Dan Hendrycks de l'UC Berkeley et publié lors de la conférence ICLR en 2021[1].
L'objectif de MMLU est de vérifier dans quelle mesure un modèle a assimilé les connaissances et les compétences diverses acquises lors de sa phase de pré-entraînement, en le testant en mode zero-shot ou few-shot sans affinage supplémentaire. MMLU a été créé comme une alternative plus complexe aux tests existants (tels que GLUE et SuperGLUE), sur lesquels de nombreux modèles avaient déjà atteint des performances humaines en 2020[2].
Description et contenu
MMLU se compose de 15 908 questions à choix multiples couvrant 57 disciplines différentes. Les thèmes des questions incluent :
- Les matières STEM (mathématiques, physique, biologie, informatique).
- Les sciences humaines et sociales (histoire, littérature, droit, gestion).
- Les domaines appliqués et professionnels (médecine, jurisprudence, commerce)[1].
La difficulté varie du niveau de l'école primaire au niveau professionnel avancé. Les questions sont basées sur des supports d'examens réels pour les écoles, les universités et les tests professionnels, tels que le GRE et l'USMLE[1]. Le format des tâches est de quatre options de réponse pour chaque question, ce qui signifie qu'un choix aléatoire a une précision de 25 %. Pour obtenir un score élevé, un modèle doit posséder de vastes connaissances encyclopédiques et une capacité de raisonnement.
Résultats et évolution
Lors de sa publication en 2020, la plupart des LLM n'obtenaient des résultats que légèrement supérieurs au hasard. Le meilleur résultat a été obtenu par le modèle GPT-3 (175 milliards de paramètres), avec un score d'environ 43,9 % de réponses correctes. À titre de comparaison, un expert humain atteignait en moyenne environ 90 %[1]. Cet écart a confirmé la complexité et le niveau d'exigence élevé du nouveau benchmark.
Avec le temps, MMLU est devenu l'un des tests les plus populaires pour les LLM, acquérant le statut d'« étalon-or » dans les rapports des principales entreprises d'IA[3]. Entre 2023 et 2024, les modèles les plus récents, tels que GPT-4, le Gemini Ultra de Google et le Claude 3.5 d'Anthropic, se sont approchés du niveau humain, atteignant une précision d'environ 85 à 90 %[2][3].
Les progrès rapides ont conduit à une « saturation » progressive du benchmark : les modèles de pointe ont commencé à atteindre des scores proches du maximum, ce qui a réduit la capacité de MMLU à distinguer leurs capacités intellectuelles. Cela a encouragé la communauté à développer de nouveaux tests plus difficiles[3].
Limites et critiques
Malgré sa large adoption, MMLU présente plusieurs limites importantes.
Qualité et exactitude des données
En juin 2024, des chercheurs ont mené une analyse manuelle d'un échantillon de 5 700 questions de MMLU et ont découvert un nombre significatif d'erreurs[4].
- Environ 6,5 % de toutes les questions de MMLU contiennent des erreurs d'annotation ou de formulation.
- Dans certaines catégories, la proportion de questions incorrectes est très élevée. Par exemple, dans la section « Virologie », 57 % des questions contenaient des erreurs (plusieurs réponses correctes, des formulations incorrectes ou une réponse de référence erronée).
Cela signifie que même un modèle parfait ne peut pas obtenir un score de 100 % sur l'ensemble de données original, et qu'une partie de l'amélioration des métriques pourrait être due à la mémorisation par le modèle des erreurs systématiques de l'ensemble[4].
Méthodologie d'évaluation et fuite de données
- Absence de protocole de test standardisé. Différents développeurs peuvent utiliser des prompts et des modes few-shot variés, ce qui rend difficile la comparaison directe des résultats des modèles.
- Fuite de données (data contamination). Il existe un risque que les questions et réponses des benchmarks publics se retrouvent dans les ensembles de données d'entraînement des LLM. Dans un tel cas, le modèle « connaît » en fait les bonnes réponses, ce qui rend l'évaluation inéquitable[3].
Versions dérivées et extensions
Pour résoudre les problèmes du MMLU original, plusieurs variantes ont été créées.
- MMLU-Redux. Une version corrigée et affinée de l'ensemble de données, présentée en juin 2024. Elle comprend 3 000 questions ré-annotées issues de 30 catégories et vise à fournir une évaluation plus fiable des modèles, sans les distorsions causées par les erreurs dans les données[4].
- MMLU-Pro. Une version étendue et plus complexe du test, présentée fin 2024. Elle contient plus de 12 000 questions, chacune avec 10 options de réponse au lieu de quatre. Cela réduit la probabilité de deviner au hasard à 10 %. Les questions ont été validées par des experts et incluent de nouvelles tâches provenant de sources plus difficiles[5].
- MMMLU (Multilingual MMLU). Une version multilingue publiée par OpenAI en 2023. L'ensemble du MMLU a été traduit par des traducteurs professionnels en 14 langues, incluant des langues à ressources élevées (comme l'espagnol, le chinois, le russe) et des langues à faibles ressources (comme le yoruba). Cela permet d'évaluer et de comparer les capacités des modèles dans différentes langues[6].
Liens externes
Bibliographie
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
Références
- ↑ 1.0 1.1 1.2 1.3 Hendrycks, D. et al. « Measuring Massive Multitask Language Understanding ». arXiv:2009.03300, 2021. [1]
- ↑ 2.0 2.1 « MMLU ». In Wikipedia. [2]
- ↑ 3.0 3.1 3.2 3.3 « NEW SAVANNA: The AI industry lacks useful ways of measuring performance ». New Savanna Blog, 2024. [3]
- ↑ 4.0 4.1 4.2 Gema, A. P. et al. « Are We Done with MMLU? ». arXiv:2406.04127, 2024. [4]
- ↑ « MMLU Pro ». Vals.ai, 2025. [5]
- ↑ « openai/MMMLU ». Hugging Face Datasets. [6]