MMLU Benchmark (NL)
MMLU (afkorting van Measuring Massive Multitask Language Understanding) — dit is een referentieverzameling van taken (benchmark), bedoeld om de vaardigheden van grote taalmodellen (LLM) over een breed scala aan vakgebieden te evalueren. De benchmark werd in 2020 ontwikkeld door een team van onderzoekers onder leiding van Dan Hendrycks uit UC Berkeley en gepubliceerd op de conferentie ICLR in 2021[1].
Het doel van MMLU is te toetsen in hoeverre een model diverse kennis en vaardigheden heeft opgedaan tijdens de voortrainingsfase, door te testen in de modus van zero-shot of few-shot zonder aanvullende fine-tuning. MMLU werd gecreëerd als een complexer alternatief voor eerder bestaande tests (zoals GLUE en SuperGLUE), waarbij veel modellen tegen 2020 al het niveau van een mens hadden bereikt[2].
Beschrijving en inhoud
MMILU bestaat uit 15 908 meerkeuzevragen die 57 verschillende disciplines bestrijken. De onderwerpen van de taken omvatten:
- STEM-vakken (wiskunde, natuurkunde, biologie, informatica).
- Geesteswetenschappen en sociale wetenschappen (geschiedenis, literatuur, recht, bestuurskunde).
- Toegepaste en professionele gebieden (geneeskunde, rechten, bedrijfskunde)[1].
Het moeilijkheidsniveau varieert van basisschoolniveau tot gevorderd professioneel niveau. De vragen zijn gebaseerd op echte examenmateriaal voor scholen, universiteiten en professionele tests, zoals GRE en USMLE[1]. Het formaat van de taken is vier antwoordopties per vraag, wat betekent dat bij willekeurige keuze de nauwkeurigheid 25% bedraagt. Om een hoog resultaat te behalen, moet het model beschikken over uitgebreide encyclopedische kennis en redeneervaardigheden.
Resultaten en ontwikkeling
Bij de release van MMLU in 2020 behaalden de meeste LLM's resultaten die slechts iets boven willekeurig raden lagen. Het beste resultaat werd behaald door het model GPT-3 (175 miljard parameters), met ~43,9% correcte antwoorden. Ter vergelijking: een menselijke expert behaalde gemiddeld ~90%[1]. Dit verschil bevestigde de moeilijkheidsgraad en de hoge lat van de nieuwe benchmark.
Met de tijd werd MMLU een van de meest populaire tests voor LLM's en verwierf het de status van "gouden standaard" in rapporten van toonaangevende AI-bedrijven[3]. Tegen 2023-2024 benaderden de nieuwste modellen, zoals GPT-4, Gemini Ultra van Google en Claude 3.5 van Anthropic, het menselijke niveau en bereikten zij een nauwkeurigheid van ~85-90%[2][3].
De snelle vooruitgang leidde tot geleidelijke "verzadiging" van de benchmark: toonaangevende modellen begonnen scores te behalen die dicht bij het maximum lagen, waardoor het vermogen van MMLU om hun intellectuele capaciteiten te onderscheiden afnam. Dit stimuleerde de gemeenschap tot de ontwikkeling van nieuwe, moeilijkere tests[3].
Beperkingen en kritiek
Ondanks de wijdverspreide toepassing heeft MMLU een aantal wezenlijke beperkingen.
Kwaliteit en correctheid van de data
In juni 2024 voerden onderzoekers een handmatige analyse uit van een steekproef van 5700 MMLU-vragen en ontdekten daarin een aanzienlijk aantal fouten[4].
- Ongeveer 6,5% van alle MMLU-vragen bevat fouten in de annotatie of formulering.
- In bepaalde categorieën is het aandeel onjuiste taken erg hoog. Zo bevatte de sectie "Virologie" in 57% van de taken fouten (meerdere correcte antwoorden, onjuiste formuleringen of een verkeerd aangegeven referentieantwoord).
Dit betekent dat zelfs een perfect model geen 100% kan behalen op de originele dataset, en dat een deel van de verbeteringen in de metrieken mogelijk verband houdt met het onthouden van systematische fouten in de verzameling door het model[4].
Evaluatiemethode en data-contaminatie
- Gebrek aan een teststandaard. Verschillende ontwikkelaars kunnen verschillende prompts en few-shot-modi gebruiken, wat directe vergelijking van modelresultaten bemoeilijkt.
- Data contamination. Er bestaat een risico dat vragen en antwoorden uit publieke benchmarks terechtkomen in de trainingssets van LLM's. In dat geval "kent" het model de juiste antwoorden feitelijk al, waardoor de evaluatie oneerlijk wordt[3].
Afgeleide versies en uitbreidingen
Om de problemen van de originele MMLU aan te pakken, zijn er meerdere varianten van gemaakt.
- MMLU-Redux. Een gecorrigeerde en verfijnde versie van de verzameling, gepresenteerd in juni 2024. Deze omvat 3000 opnieuw geannoteerde vragen uit 30 categorieën en is bedoeld voor een betrouwbaardere evaluatie van modellen zonder vertekeningen als gevolg van fouten in de data[4].
- MMLU-Pro. Een uitgebreide en moeilijkere variant van de test, gepresenteerd eind 2024. Deze bevat meer dan 12 000 vragen, waarbij voor elke vraag 10 antwoordopties worden gegeven in plaats van vier. Dit verlaagt de kans op willekeurig raden tot 10%. De vragen zijn gecontroleerd door experts en omvatten nieuwe taken uit moeilijkere bronnen[5].
- MMMLU (Multilingual MMLU). Een meertalige versie, uitgebracht door OpenAI in 2023. De volledige MMLU-verzameling werd door professionele vertalers vertaald in 14 talen, waaronder zowel veelgebruikte (Spaans, Chinees, Russisch) als laag-resource talen (bijvoorbeeld Yoruba). Dit maakt het mogelijk om de capaciteiten van modellen in verschillende talen te evalueren en te vergelijken[6].
Verwijzingen
- Officiële MMLU-repository op GitHub
- MMLU-pagina op Papers with Code met modelresultaten
Literatuur
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
Noten
- ↑ 1.0 1.1 1.2 1.3 Hendrycks, D. et al. «Measuring Massive Multitask Language Understanding». arXiv:2009.03300, 2021. [1]
- ↑ 2.0 2.1 «MMLU». In Wikipedia. [2]
- ↑ 3.0 3.1 3.2 3.3 «NEW SAVANNA: The AI industry lacks useful ways of measuring performance». New Savanna Blog, 2024. [3]
- ↑ 4.0 4.1 4.2 Gema, A. P. et al. «Are We Done with MMLU?». arXiv:2406.04127, 2024. [4]
- ↑ «MMLU Pro». Vals.ai, 2025. [5]
- ↑ «openai/MMMLU». Hugging Face Datasets. [6]