MMLU Benchmark (SV)
MMLU (förkortning för Measuring Massive Multitask Language Understanding) är ett referenstestset (benchmark) som är utformat för att utvärdera stora språkmodellers (LLM) förmågor inom ett brett spektrum av ämnesområden. Benchmark-testet utvecklades år 2020 av ett forskarteam under ledning av Dan Hendrycks från UC Berkeley och publicerades vid konferensen ICLR år 2021[1].
Syftet med MMLU är att testa i vilken utsträckning en modell tillägnar sig varierande kunskaper och färdigheter förvärvade under förträningsfasen, genom testning i zero-shot- eller few-shot-läge utan ytterligare fine-tuning. MMLU skapades som ett svårare alternativ till tidigare existerande tester (såsom GLUE och SuperGLUE), på vilka många modeller redan år 2020 hade nått mänsklig nivå[2].
Beskrivning och innehåll
MMLU består av 15 908 flervalsfrågor som täcker 57 olika discipliner. Uppgifternas tematik innefattar:
- STEM-ämnen (matematik, fysik, biologi, datavetenskap).
- Humaniora och samhällsvetenskap (historia, litteratur, juridik, förvaltning).
- Tillämpade och yrkesmässiga områden (medicin, juridik, affärsverksamhet)[1].
Svårighetsgraden varierar från grundskolenivå till avancerad professionell nivå. Frågorna är baserade på verkliga examinationsmaterial för skolor, högskolor och professionella tester såsom GRE och USMLE[1]. Uppgiftsformatet innebär fyra svarsalternativ per fråga, vilket betyder att träffsäkerheten vid slumpmässigt val är 25%. För att uppnå ett högt resultat måste modellen besitta omfattande encyklopediska kunskaper och förmåga till resonemang.
Resultat och utveckling
När MMLU lanserades år 2020 uppvisade de flesta LLM resultat bara marginellt över slumpmässig gissning. Det bästa resultatet demonstrerades av modellen GPT-3 (175 miljarder parametrar), som uppnådde ~43,9% korrekta svar. Till jämförelse nådde en mänsklig expert i genomsnitt ~90%[1]. Detta gap bekräftade svårighetsgraden och den höga ribban för det nya benchmark-testet.
Med tiden blev MMLU ett av de mest populära testerna för LLM och fick status som "guldstandard" i rapporter från ledande AI-företag[3]. År 2023–2024 närmade sig de senaste modellerna, såsom GPT-4, Gemini Ultra från Google och Claude 3.5 från Anthropic, den mänskliga nivån och uppnådde ~85–90% träffsäkerhet[2][3].
Den snabba framgången ledde till en gradvis "mättnad" av benchmark-testet: ledande modeller började uppnå resultat nära maximala poäng, vilket minskade MMLU:s förmåga att skilja på deras intellektuella kapacitet. Detta stimulerade forskarsamhället att utveckla nya, svårare tester[3].
Begränsningar och kritik
Trots den breda spridningen har MMLU ett antal väsentliga begränsningar.
Datakvalitet och korrekthet
I juni 2024 genomförde forskare en manuell analys av ett urval på 5 700 frågor från MMLU och fann ett betydande antal fel[4].
- Cirka 6,5% av alla frågor i MMLU innehåller fel i annotering eller formulering.
- I vissa kategorier är andelen felaktiga uppgifter mycket hög. Exempelvis innehöll 57% av uppgifterna i avsnittet "Virologi" fel (flera korrekta svar, felaktiga formuleringar eller felaktigt angivet referenssvar).
Detta innebär att inte ens en perfekt modell kan uppnå 100% på det ursprungliga datasetet, och en del av förbättringarna i mätvärden kan bero på att modellen memorerar systematiska fel i datamängden[4].
Utvärderingsmetodik och dataläckage
- Avsaknad av teststandard. Olika utvecklare kan använda olika prompt-formuleringar och few-shot-lägen, vilket försvårar direkta jämförelser av modellernas resultat.
- Dataläckage (data contamination). Det finns en risk att frågor och svar från publika benchmark-tester hamnar i LLM:ers träningsdata. I sådana fall "känner" modellen i praktiken till de korrekta svaren, vilket gör utvärderingen otillförlitlig[3].
Härledda versioner och utvidgningar
För att lösa problemen med det ursprungliga MMLU har flera varianter skapats.
- MMLU-Redux. En korrigerad och förfinad version av datamängden, presenterad i juni 2024. Den innehåller 3 000 omannoterade frågor från 30 kategorier och är avsedd för en mer tillförlitlig utvärdering av modeller utan snedvridningar orsakade av fel i data[4].
- MMLU-Pro. En utökad och förbättrad variant av testet, presenterad i slutet av 2024. Den innehåller mer än 12 000 frågor, där varje fråga erbjuder 10 svarsalternativ i stället för fyra. Detta minskar sannolikheten för slumpmässig gissning till 10%. Frågorna har granskats av experter och inkluderar nya uppgifter från mer avancerade källor[5].
- MMMLU (Multilingual MMLU). En flerspråkig version, utgiven av OpenAI år 2023. Hela MMLU-datamängden översattes av professionella översättare till 14 språk, inklusive såväl vanliga (spanska, kinesiska, ryska) som lågresursspråk (till exempel yoruba). Detta gör det möjligt att utvärdera och jämföra modellers kapacitet på olika språk[6].
Externa länkar
- Officiellt MMLU-förråd på GitHub
- MMLU:s sida på Papers with Code med modellresultat
Litteratur
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
Noter
- ↑ 1.0 1.1 1.2 1.3 Hendrycks, D. et al. «Measuring Massive Multitask Language Understanding». arXiv:2009.03300, 2021. [1]
- ↑ 2.0 2.1 «MMLU». In Wikipedia. [2]
- ↑ 3.0 3.1 3.2 3.3 «NEW SAVANNA: The AI industry lacks useful ways of measuring performance». New Savanna Blog, 2024. [3]
- ↑ 4.0 4.1 4.2 Gema, A. P. et al. «Are We Done with MMLU?». arXiv:2406.04127, 2024. [4]
- ↑ «MMLU Pro». Vals.ai, 2025. [5]
- ↑ «openai/MMMLU». Hugging Face Datasets. [6]