MMLU Benchmark (CS)

From Systems analysis Wiki
Jump to navigation Jump to search

MMLU (zkratka pro Measuring Massive Multitask Language Understanding) — je referenční sada úloh (benchmark) určená k hodnocení schopností velkých jazykových modelů (LLM) v širokém okruhu předmětových oblastí. Benchmark byl vyvinut v roce 2020 týmem výzkumníků pod vedením Dana Hendryckse (Dan Hendrycks) z UC Berkeley a publikován na konferenci ICLR v roce 2021[1].

Cílem MMLU je ověřit, do jaké míry model vstřebává různorodé znalosti a dovednosti získané ve fázi předtrénování, a to testováním v režimu nulového nebo několika příkladů (zero/few-shot) bez dodatečného dolaďování. MMLU byl vytvořen jako náročnější alternativa k dříve existujícím testům (jako jsou GLUE a SuperGLUE), na nichž mnoho modelů do roku 2020 již dosáhlo úrovně člověka[2].

Popis a obsah

MMLU se skládá z 15 908 otázek s výběrem odpovědí, pokrývajících 57 různých disciplín. Tematika úloh zahrnuje:

  • Předměty STEM směru (matematika, fyzika, biologie, informatika).
  • Humanitní a společenské vědy (historie, literatura, právo, řízení).
  • Aplikované a profesní oblasti (medicína, právo, obchod)[1].

Rozsah obtížnosti se pohybuje od úrovně základní školy až po pokročilou profesionální úroveň. Otázky vycházejí ze skutečných zkušebních materiálů pro školy, vysoké školy a profesní testy, jako jsou GRE a USMLE[1]. Formát úloh — čtyři varianty odpovědí na každou otázku — znamená, že při náhodném výběru je přesnost 25 %. K dosažení vysokého výsledku musí model disponovat rozsáhlými encyklopedickými znalostmi a schopností logického uvažování.

Výsledky a vývoj

Při vydání MMLU v roce 2020 vykazovala většina LLM výsledky jen nepatrně vyšší, než by odpovídalo náhodnému hádání. Nejlepší výsledek vykázal model GPT-3 (175 miliard parametrů) se skóre ~43,9 % správných odpovědí. Pro srovnání, lidský odborník dosahoval v průměru ~90 %[1]. Tento rozdíl potvrdil náročnost a vysokou laťku nového benchmarku.

V průběhu času se MMLU stal jedním z nejpopulárnějších testů pro LLM a získal status „zlatého standardu" ve zprávách předních AI společností[3]. Do let 2023–2024 se nejnovější modely, jako GPT-4, Gemini Ultra od Google a Claude 3.5 od Anthropic, přiblížily lidské úrovni a dosáhly přesnosti ~85–90 %[2][3].

Rychlý pokrok vedl k postupnému „nasycení" benchmarku: přední modely začaly dosahovat hodnot blízkých maximálnímu skóre, což snížilo schopnost MMLU rozlišovat jejich intelektuální možnosti. To podnítilo komunitu k vývoji nových, náročnějších testů[3].

Omezení a kritika

Navzdory širokému rozšíření má MMLU řadu podstatných omezení.

Kvalita a správnost dat

V červnu 2024 provedli výzkumníci ruční analýzu vzorku 5 700 otázek MMLU a odhalili značné množství chyb[4].

  • Přibližně 6,5 % všech otázek MMLU obsahuje chyby v anotaci nebo formulacích.
  • V některých kategoriích je podíl nesprávných úloh velmi vysoký. Například v sekci „Virologie" obsahovalo 57 % úloh chyby (více správných odpovědí, nesprávné formulace nebo nesprávně uvedená referenční odpověď).

To znamená, že ani dokonalý model nemůže dosáhnout 100 % na původním datasetu a část zlepšení v metrikách může souviset s tím, že si model zapamatoval systematické chyby sady[4].

Metodika hodnocení a únik dat

  • Absence standardu testování. Různí vývojáři mohou používat různé prompty a režimy few-shot, což ztěžuje přímé srovnání výsledků modelů.
  • Únik dat (data contamination). Existuje riziko, že se otázky a odpovědi z veřejných benchmarků dostanou do trénovacích sad LLM. V takovém případě model fakticky „zná" správné odpovědi, což činí hodnocení neobjektivním[3].

Odvozené verze a rozšíření

K řešení problémů původního MMLU bylo vytvořeno několik jeho variant.

  • MMLU-Redux. Opravená a upřesněná verze sady, představená v červnu 2024. Obsahuje 3 000 přeanotovaných otázek ze 30 kategorií a je určena pro spolehlivější hodnocení modelů bez zkreslení způsobených chybami v datech[4].
  • MMLU-Pro. Rozšířená a obtížnější varianta testu, představená koncem roku 2024. Obsahuje více než 12 000 otázek, ke každé z nichž je nabízeno 10 variant odpovědí místo čtyř. To snižuje pravděpodobnost náhodného uhádnutí na 10 %. Otázky prošly kontrolou odborníků a zahrnují nové úlohy z náročnějších zdrojů[5].
  • MMMLU (Multilingual MMLU). Vícejazyčná verze vydaná společností OpenAI v roce 2023. Celá sada MMLU byla přeložena profesionálními překladateli do 14 jazyků, včetně jak rozšířených (španělština, čínština, ruština), tak nízkozdrojových (např. joruba). To umožňuje hodnotit a srovnávat schopnosti modelů v různých jazycích[6].

Odkazy

  • Oficiální repozitář MMLU na GitHub
  • Stránka MMLU na Papers with Code s výsledky modelů

Literatura

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.


Poznámky

  1. 1.0 1.1 1.2 1.3 Hendrycks, D. et al. «Measuring Massive Multitask Language Understanding». arXiv:2009.03300, 2021. [1]
  2. 2.0 2.1 «MMLU». In Wikipedia. [2]
  3. 3.0 3.1 3.2 3.3 «NEW SAVANNA: The AI industry lacks useful ways of measuring performance». New Savanna Blog, 2024. [3]
  4. 4.0 4.1 4.2 Gema, A. P. et al. «Are We Done with MMLU?». arXiv:2406.04127, 2024. [4]
  5. «MMLU Pro». Vals.ai, 2025. [5]
  6. «openai/MMMLU». Hugging Face Datasets. [6]