MMLU Benchmark (CS)
MMLU (zkratka pro Measuring Massive Multitask Language Understanding) — je referenční sada úloh (benchmark) určená k hodnocení schopností velkých jazykových modelů (LLM) v širokém okruhu předmětových oblastí. Benchmark byl vyvinut v roce 2020 týmem výzkumníků pod vedením Dana Hendryckse (Dan Hendrycks) z UC Berkeley a publikován na konferenci ICLR v roce 2021[1].
Cílem MMLU je ověřit, do jaké míry model vstřebává různorodé znalosti a dovednosti získané ve fázi předtrénování, a to testováním v režimu nulového nebo několika příkladů (zero/few-shot) bez dodatečného dolaďování. MMLU byl vytvořen jako náročnější alternativa k dříve existujícím testům (jako jsou GLUE a SuperGLUE), na nichž mnoho modelů do roku 2020 již dosáhlo úrovně člověka[2].
Popis a obsah
MMLU se skládá z 15 908 otázek s výběrem odpovědí, pokrývajících 57 různých disciplín. Tematika úloh zahrnuje:
- Předměty STEM směru (matematika, fyzika, biologie, informatika).
- Humanitní a společenské vědy (historie, literatura, právo, řízení).
- Aplikované a profesní oblasti (medicína, právo, obchod)[1].
Rozsah obtížnosti se pohybuje od úrovně základní školy až po pokročilou profesionální úroveň. Otázky vycházejí ze skutečných zkušebních materiálů pro školy, vysoké školy a profesní testy, jako jsou GRE a USMLE[1]. Formát úloh — čtyři varianty odpovědí na každou otázku — znamená, že při náhodném výběru je přesnost 25 %. K dosažení vysokého výsledku musí model disponovat rozsáhlými encyklopedickými znalostmi a schopností logického uvažování.
Výsledky a vývoj
Při vydání MMLU v roce 2020 vykazovala většina LLM výsledky jen nepatrně vyšší, než by odpovídalo náhodnému hádání. Nejlepší výsledek vykázal model GPT-3 (175 miliard parametrů) se skóre ~43,9 % správných odpovědí. Pro srovnání, lidský odborník dosahoval v průměru ~90 %[1]. Tento rozdíl potvrdil náročnost a vysokou laťku nového benchmarku.
V průběhu času se MMLU stal jedním z nejpopulárnějších testů pro LLM a získal status „zlatého standardu" ve zprávách předních AI společností[3]. Do let 2023–2024 se nejnovější modely, jako GPT-4, Gemini Ultra od Google a Claude 3.5 od Anthropic, přiblížily lidské úrovni a dosáhly přesnosti ~85–90 %[2][3].
Rychlý pokrok vedl k postupnému „nasycení" benchmarku: přední modely začaly dosahovat hodnot blízkých maximálnímu skóre, což snížilo schopnost MMLU rozlišovat jejich intelektuální možnosti. To podnítilo komunitu k vývoji nových, náročnějších testů[3].
Omezení a kritika
Navzdory širokému rozšíření má MMLU řadu podstatných omezení.
Kvalita a správnost dat
V červnu 2024 provedli výzkumníci ruční analýzu vzorku 5 700 otázek MMLU a odhalili značné množství chyb[4].
- Přibližně 6,5 % všech otázek MMLU obsahuje chyby v anotaci nebo formulacích.
- V některých kategoriích je podíl nesprávných úloh velmi vysoký. Například v sekci „Virologie" obsahovalo 57 % úloh chyby (více správných odpovědí, nesprávné formulace nebo nesprávně uvedená referenční odpověď).
To znamená, že ani dokonalý model nemůže dosáhnout 100 % na původním datasetu a část zlepšení v metrikách může souviset s tím, že si model zapamatoval systematické chyby sady[4].
Metodika hodnocení a únik dat
- Absence standardu testování. Různí vývojáři mohou používat různé prompty a režimy few-shot, což ztěžuje přímé srovnání výsledků modelů.
- Únik dat (data contamination). Existuje riziko, že se otázky a odpovědi z veřejných benchmarků dostanou do trénovacích sad LLM. V takovém případě model fakticky „zná" správné odpovědi, což činí hodnocení neobjektivním[3].
Odvozené verze a rozšíření
K řešení problémů původního MMLU bylo vytvořeno několik jeho variant.
- MMLU-Redux. Opravená a upřesněná verze sady, představená v červnu 2024. Obsahuje 3 000 přeanotovaných otázek ze 30 kategorií a je určena pro spolehlivější hodnocení modelů bez zkreslení způsobených chybami v datech[4].
- MMLU-Pro. Rozšířená a obtížnější varianta testu, představená koncem roku 2024. Obsahuje více než 12 000 otázek, ke každé z nichž je nabízeno 10 variant odpovědí místo čtyř. To snižuje pravděpodobnost náhodného uhádnutí na 10 %. Otázky prošly kontrolou odborníků a zahrnují nové úlohy z náročnějších zdrojů[5].
- MMMLU (Multilingual MMLU). Vícejazyčná verze vydaná společností OpenAI v roce 2023. Celá sada MMLU byla přeložena profesionálními překladateli do 14 jazyků, včetně jak rozšířených (španělština, čínština, ruština), tak nízkozdrojových (např. joruba). To umožňuje hodnotit a srovnávat schopnosti modelů v různých jazycích[6].
Odkazy
- Oficiální repozitář MMLU na GitHub
- Stránka MMLU na Papers with Code s výsledky modelů
Literatura
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
Poznámky
- ↑ 1.0 1.1 1.2 1.3 Hendrycks, D. et al. «Measuring Massive Multitask Language Understanding». arXiv:2009.03300, 2021. [1]
- ↑ 2.0 2.1 «MMLU». In Wikipedia. [2]
- ↑ 3.0 3.1 3.2 3.3 «NEW SAVANNA: The AI industry lacks useful ways of measuring performance». New Savanna Blog, 2024. [3]
- ↑ 4.0 4.1 4.2 Gema, A. P. et al. «Are We Done with MMLU?». arXiv:2406.04127, 2024. [4]
- ↑ «MMLU Pro». Vals.ai, 2025. [5]
- ↑ «openai/MMMLU». Hugging Face Datasets. [6]