---
title: "MMLU Benchmark (CS)"
source: "https://systems-analysis.info/int/MMLU_Benchmark_(CS)"
wiki: "systems-analysis.info/int"
article: "MMLU_Benchmark_(CS)"
language: "cs"
categories:
  - "Category:Czech"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 4071
wiki_created_at: 2026-09-06T23:30:07Z
wiki_modified_at: 2026-09-06T23:30:07Z
downloaded_at: 2026-09-07T23:00:43Z
---

# MMLU Benchmark (CS)

**MMLU** (zkratka pro **Measuring Massive Multitask Language Understanding**) — je referenční sada úloh (benchmark) určená k hodnocení schopností velkých jazykových modelů (LLM) v širokém okruhu předmětových oblastí. Benchmark byl vyvinut v roce 2020 týmem výzkumníků pod vedením **Dana Hendryckse** (*Dan Hendrycks*) z UC Berkeley a publikován na konferenci ICLR v roce 2021<sup>[\[1\]](https://systems-analysis.info/int/MMLU_Benchmark_(CS)#cite_note-mmlu_paper-1)</sup>.

Cílem MMLU je ověřit, do jaké míry model vstřebává různorodé znalosti a dovednosti získané ve fázi předtrénování, a to testováním v režimu *nulového* nebo *několika příkladů* (*zero/few-shot*) bez dodatečného dolaďování. MMLU byl vytvořen jako náročnější alternativa k dříve existujícím testům (jako jsou GLUE a SuperGLUE), na nichž mnoho modelů do roku 2020 již dosáhlo úrovně člověka<sup>[\[2\]](https://systems-analysis.info/int/MMLU_Benchmark_(CS)#cite_note-mmlu_wiki-2)</sup>.

## Popis a obsah

MMLU se skládá z **15 908 otázek** s výběrem odpovědí, pokrývajících **57 různých disciplín**. Tematika úloh zahrnuje:

- Předměty STEM směru (matematika, fyzika, biologie, informatika).
- Humanitní a společenské vědy (historie, literatura, právo, řízení).
- Aplikované a profesní oblasti (medicína, právo, obchod)<sup>[\[1\]](https://systems-analysis.info/int/MMLU_Benchmark_(CS)#cite_note-mmlu_paper-1)</sup>.

Rozsah obtížnosti se pohybuje od úrovně základní školy až po pokročilou profesionální úroveň. Otázky vycházejí ze skutečných zkušebních materiálů pro školy, vysoké školy a profesní testy, jako jsou GRE a USMLE<sup>[\[1\]](https://systems-analysis.info/int/MMLU_Benchmark_(CS)#cite_note-mmlu_paper-1)</sup>. Formát úloh — čtyři varianty odpovědí na každou otázku — znamená, že při náhodném výběru je přesnost 25 %. K dosažení vysokého výsledku musí model disponovat rozsáhlými encyklopedickými znalostmi a schopností logického uvažování.

## Výsledky a vývoj

Při vydání MMLU v roce 2020 vykazovala většina LLM výsledky jen nepatrně vyšší, než by odpovídalo náhodnému hádání. Nejlepší výsledek vykázal model GPT-3 (175 miliard parametrů) se skóre **~43,9 %** správných odpovědí. Pro srovnání, lidský odborník dosahoval v průměru **~90 %**<sup>[\[1\]](https://systems-analysis.info/int/MMLU_Benchmark_(CS)#cite_note-mmlu_paper-1)</sup>. Tento rozdíl potvrdil náročnost a vysokou laťku nového benchmarku.

V průběhu času se MMLU stal jedním z nejpopulárnějších testů pro LLM a získal status „zlatého standardu" ve zprávách předních AI společností<sup>[\[3\]](https://systems-analysis.info/int/MMLU_Benchmark_(CS)#cite_note-new_savanna_2024-3)</sup>. Do let 2023–2024 se nejnovější modely, jako GPT-4, **Gemini Ultra** od Google a **Claude 3.5** od Anthropic, přiblížily lidské úrovni a dosáhly přesnosti **~85–90 %**<sup>[\[2\]](https://systems-analysis.info/int/MMLU_Benchmark_(CS)#cite_note-mmlu_wiki-2)[\[3\]](https://systems-analysis.info/int/MMLU_Benchmark_(CS)#cite_note-new_savanna_2024-3)</sup>.

Rychlý pokrok vedl k postupnému „nasycení" benchmarku: přední modely začaly dosahovat hodnot blízkých maximálnímu skóre, což snížilo schopnost MMLU rozlišovat jejich intelektuální možnosti. To podnítilo komunitu k vývoji nových, náročnějších testů<sup>[\[3\]](https://systems-analysis.info/int/MMLU_Benchmark_(CS)#cite_note-new_savanna_2024-3)</sup>.

## Omezení a kritika

Navzdory širokému rozšíření má MMLU řadu podstatných omezení.

### Kvalita a správnost dat

V červnu 2024 provedli výzkumníci ruční analýzu vzorku 5 700 otázek MMLU a odhalili značné množství chyb<sup>[\[4\]](https://systems-analysis.info/int/MMLU_Benchmark_(CS)#cite_note-done_with_mmlu_2024-4)</sup>.

- Přibližně **6,5 %** všech otázek MMLU obsahuje chyby v anotaci nebo formulacích.
- V některých kategoriích je podíl nesprávných úloh velmi vysoký. Například v sekci „Virologie" obsahovalo **57 %** úloh chyby (více správných odpovědí, nesprávné formulace nebo nesprávně uvedená referenční odpověď).

To znamená, že ani dokonalý model nemůže dosáhnout 100 % na původním datasetu a část zlepšení v metrikách může souviset s tím, že si model zapamatoval systematické chyby sady<sup>[\[4\]](https://systems-analysis.info/int/MMLU_Benchmark_(CS)#cite_note-done_with_mmlu_2024-4)</sup>.

### Metodika hodnocení a únik dat

- **Absence standardu testování**. Různí vývojáři mohou používat různé prompty a režimy few-shot, což ztěžuje přímé srovnání výsledků modelů.
- **Únik dat** (*data contamination*). Existuje riziko, že se otázky a odpovědi z veřejných benchmarků dostanou do trénovacích sad LLM. V takovém případě model fakticky „zná" správné odpovědi, což činí hodnocení neobjektivním<sup>[\[3\]](https://systems-analysis.info/int/MMLU_Benchmark_(CS)#cite_note-new_savanna_2024-3)</sup>.

## Odvozené verze a rozšíření

K řešení problémů původního MMLU bylo vytvořeno několik jeho variant.

- **MMLU-Redux**. Opravená a upřesněná verze sady, představená v červnu 2024. Obsahuje 3 000 přeanotovaných otázek ze 30 kategorií a je určena pro spolehlivější hodnocení modelů bez zkreslení způsobených chybami v datech<sup>[\[4\]](https://systems-analysis.info/int/MMLU_Benchmark_(CS)#cite_note-done_with_mmlu_2024-4)</sup>.
- **MMLU-Pro**. Rozšířená a obtížnější varianta testu, představená koncem roku 2024. Obsahuje více než 12 000 otázek, ke každé z nichž je nabízeno **10 variant odpovědí** místo čtyř. To snižuje pravděpodobnost náhodného uhádnutí na 10 %. Otázky prošly kontrolou odborníků a zahrnují nové úlohy z náročnějších zdrojů<sup>[\[5\]](https://systems-analysis.info/int/MMLU_Benchmark_(CS)#cite_note-mmlu_pro_vals_ai-5)</sup>.
- **MMMLU** (*Multilingual MMLU*). Vícejazyčná verze vydaná společností OpenAI v roce 2023. Celá sada MMLU byla přeložena profesionálními překladateli do 14 jazyků, včetně jak rozšířených (španělština, čínština, ruština), tak nízkozdrojových (např. joruba). To umožňuje hodnotit a srovnávat schopnosti modelů v různých jazycích<sup>[\[6\]](https://systems-analysis.info/int/MMLU_Benchmark_(CS)#cite_note-mmmlu_hf-6)</sup>.

## Odkazy

- Oficiální repozitář MMLU na GitHub
- Stránka MMLU na Papers with Code s výsledky modelů

## Literatura

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

  

## Poznámky

1.  <span id="cite_note-mmlu_paper-1">↑ <sup>[1.0](https://systems-analysis.info/int/MMLU_Benchmark_(CS)#cite_ref-mmlu_paper_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/MMLU_Benchmark_(CS)#cite_ref-mmlu_paper_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/MMLU_Benchmark_(CS)#cite_ref-mmlu_paper_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/MMLU_Benchmark_(CS)#cite_ref-mmlu_paper_1-3)</sup> Hendrycks, D. et al. «Measuring Massive Multitask Language Understanding». *arXiv:2009.03300*, 2021. <a href="https://ar5iv.labs.arxiv.org/html/2009.03300" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-mmlu_wiki-2">↑ <sup>[2.0](https://systems-analysis.info/int/MMLU_Benchmark_(CS)#cite_ref-mmlu_wiki_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/MMLU_Benchmark_(CS)#cite_ref-mmlu_wiki_2-1)</sup> «MMLU». In *Wikipedia*. <a href="https://en.wikipedia.org/wiki/MMLU" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-new_savanna_2024-3">↑ <sup>[3.0](https://systems-analysis.info/int/MMLU_Benchmark_(CS)#cite_ref-new_savanna_2024_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/MMLU_Benchmark_(CS)#cite_ref-new_savanna_2024_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/MMLU_Benchmark_(CS)#cite_ref-new_savanna_2024_3-2)</sup> <sup>[3.3](https://systems-analysis.info/int/MMLU_Benchmark_(CS)#cite_ref-new_savanna_2024_3-3)</sup> «NEW SAVANNA: The AI industry lacks useful ways of measuring performance». *New Savanna Blog*, 2024. <a href="https://new-savanna.blogspot.com/2024/04/the-ai-industry-lacks-useful-ways-of.html" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-done_with_mmlu_2024-4">↑ <sup>[4.0](https://systems-analysis.info/int/MMLU_Benchmark_(CS)#cite_ref-done_with_mmlu_2024_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/MMLU_Benchmark_(CS)#cite_ref-done_with_mmlu_2024_4-1)</sup> <sup>[4.2](https://systems-analysis.info/int/MMLU_Benchmark_(CS)#cite_ref-done_with_mmlu_2024_4-2)</sup> Gema, A. P. et al. «Are We Done with MMLU?». *arXiv:2406.04127*, 2024. <a href="https://ar5iv.labs.arxiv.org/html/2406.04127" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-mmlu_pro_vals_ai-5">[↑](https://systems-analysis.info/int/MMLU_Benchmark_(CS)#cite_ref-mmlu_pro_vals_ai_5-0) «MMLU Pro». *Vals.ai*, 2025. <a href="https://www.vals.ai/benchmarks/mmlu_pro-04-15-2025" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-mmmlu_hf-6">[↑](https://systems-analysis.info/int/MMLU_Benchmark_(CS)#cite_ref-mmmlu_hf_6-0) «openai/MMMLU». *Hugging Face Datasets*. <a href="https://huggingface.co/datasets/openai/MMMLU" class="external autonumber" rel="nofollow">[6]</a></span>
