---
title: "MMLU Benchmark (PL)"
source: "https://systems-analysis.info/int/MMLU_Benchmark_(PL)"
wiki: "systems-analysis.info/int"
article: "MMLU_Benchmark_(PL)"
language: "pl"
categories:
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
  - "Category:Polish"
revision_id: 4083
wiki_created_at: 2026-09-06T23:30:18Z
wiki_modified_at: 2026-09-06T23:30:18Z
downloaded_at: 2026-09-07T23:00:48Z
---

# MMLU Benchmark (PL)

**MMLU** (skrót od **Measuring Massive Multitask Language Understanding**) — to wzorcowy zestaw zadań (benchmark) przeznaczony do oceny zdolności dużych modeli językowych (LLM) w szerokim zakresie dziedzin przedmiotowych. Benchmark został opracowany w 2020 roku przez zespół badaczy pod kierownictwem **Dana Hendrycksa** (*Dan Hendrycks*) z UC Berkeley i opublikowany na konferencji ICLR w 2021 roku<sup>[\[1\]](https://systems-analysis.info/int/MMLU_Benchmark_(PL)#cite_note-mmlu_paper-1)</sup>.

Celem MMLU jest sprawdzenie, w jakim stopniu model przyswaja różnorodną wiedzę i umiejętności zdobyte na etapie wstępnego uczenia, poprzez testowanie w trybie *zero-shot* lub *few-shot* bez dodatkowego fine-tuningu. MMLU został stworzony jako trudniejsza alternatywa dla wcześniej istniejących testów (takich jak GLUE i SuperGLUE), na których wiele modeli do 2020 roku osiągnęło już poziom człowieka<sup>[\[2\]](https://systems-analysis.info/int/MMLU_Benchmark_(PL)#cite_note-mmlu_wiki-2)</sup>.

## Opis i zawartość

MMLL składa się z **15 908 pytań** wielokrotnego wyboru, obejmujących **57 różnych dyscyplin**. Tematyka zadań obejmuje:

- Przedmioty kierunku STEM (matematyka, fizyka, biologia, informatyka).
- Nauki humanistyczne i społeczne (historia, literatura, prawo, zarządzanie).
- Dziedziny stosowane i zawodowe (medycyna, prawo, biznes)<sup>[\[1\]](https://systems-analysis.info/int/MMLU_Benchmark_(PL)#cite_note-mmlu_paper-1)</sup>.

Zakres trudności waha się od poziomu szkoły podstawowej do zaawansowanego poziomu zawodowego. Pytania oparte są na rzeczywistych materiałach egzaminacyjnych dla szkół, uczelni wyższych oraz profesjonalnych testów, takich jak GRE i USMLE<sup>[\[1\]](https://systems-analysis.info/int/MMLU_Benchmark_(PL)#cite_note-mmlu_paper-1)</sup>. Format zadań to cztery warianty odpowiedzi na każde pytanie, co oznacza, że przy losowym wyborze dokładność wynosi 25%. Aby osiągnąć wysoki wynik, model musi dysponować rozległą wiedzą encyklopedyczną oraz zdolnością do rozumowania.

## Wyniki i rozwój

W momencie wydania MMLU w 2020 roku większość LLM osiągała wyniki jedynie nieznacznie wyższe od losowego zgadywania. Najlepszy wynik uzyskał model GPT-3 (175 mld parametrów), osiągając **~43,9%** poprawnych odpowiedzi. Dla porównania, ekspert-człowiek osiągał średnio **~90%**<sup>[\[1\]](https://systems-analysis.info/int/MMLU_Benchmark_(PL)#cite_note-mmlu_paper-1)</sup>. Ta różnica potwierdziła trudność i wysoką poprzeczkę nowego benchmarku.

Z czasem MMLU stał się jednym z najpopularniejszych testów dla LLM, uzyskując status „złotego standardu" w raportach czołowych firm z branży AI<sup>[\[3\]](https://systems-analysis.info/int/MMLU_Benchmark_(PL)#cite_note-new_savanna_2024-3)</sup>. Do lat 2023–2024 najnowsze modele, takie jak GPT-4, **Gemini Ultra** od Google i **Claude 3.5** od Anthropic, zbliżyły się do poziomu człowieka, osiągając **~85–90%** dokładności<sup>[\[2\]](https://systems-analysis.info/int/MMLU_Benchmark_(PL)#cite_note-mmlu_wiki-2)[\[3\]](https://systems-analysis.info/int/MMLU_Benchmark_(PL)#cite_note-new_savanna_2024-3)</sup>.

Szybki postęp doprowadził do stopniowego „nasycenia" benchmarku: czołowe modele zaczęły osiągać wyniki bliskie maksymalnym, co obniżyło zdolność MMLU do różnicowania ich możliwości intelektualnych. To skłoniło środowisko do opracowania nowych, trudniejszych testów<sup>[\[3\]](https://systems-analysis.info/int/MMLU_Benchmark_(PL)#cite_note-new_savanna_2024-3)</sup>.

## Ograniczenia i krytyka

Pomimo szerokiego rozpowszechnienia MMLU ma szereg istotnych ograniczeń.

### Jakość i poprawność danych

W czerwcu 2024 roku badacze przeprowadzili ręczną analizę próby 5700 pytań MMLU i odkryli znaczną liczbę błędów<sup>[\[4\]](https://systems-analysis.info/int/MMLU_Benchmark_(PL)#cite_note-done_with_mmlu_2024-4)</sup>.

- Około **6,5%** wszystkich pytań MMLU zawiera błędy w adnotacjach lub sformułowaniach.
- W poszczególnych kategoriach odsetek niepoprawnych zadań jest bardzo wysoki. Na przykład w sekcji „Wirusologia\\ **57%** zadań zawierało błędy (kilka poprawnych odpowiedzi, nieprawidłowe sformułowania lub błędnie wskazana odpowiedź wzorcowa).

Oznacza to, że nawet doskonały model nie może uzyskać 100% na oryginalnym datasecie, a część poprawy wyników może być związana z zapamiętywaniem przez model systematycznych błędów zbioru<sup>[\[4\]](https://systems-analysis.info/int/MMLU_Benchmark_(PL)#cite_note-done_with_mmlu_2024-4)</sup>.

### Metodyka oceny i wyciek danych

- **Brak standardu testowania**. Różni twórcy mogą stosować różne prompty i tryby few-shot, co utrudnia bezpośrednie porównywanie wyników modeli.
- **Wyciek danych** (*data contamination*). Istnieje ryzyko przedostania się pytań i odpowiedzi z publicznych benchmarków do zbiorów treningowych LLM. W takim przypadku model faktycznie „zna" poprawne odpowiedzi, co sprawia, że ocena staje się nierzetelna<sup>[\[3\]](https://systems-analysis.info/int/MMLU_Benchmark_(PL)#cite_note-new_savanna_2024-3)</sup>.

## Pochodne wersje i rozszerzenia

Aby rozwiązać problemy oryginalnego MMLU, powstało kilka jego wariantów.

- **MMLU-Redux**. Poprawiona i doprecyzowana wersja zestawu, przedstawiona w czerwcu 2024 roku. Zawiera 3000 ponownie opatrzonych adnotacjami pytań z 30 kategorii i jest przeznaczona do bardziej wiarygodnej oceny modeli bez zniekształceń wywołanych błędami w danych<sup>[\[4\]](https://systems-analysis.info/int/MMLU_Benchmark_(PL)#cite_note-done_with_mmlu_2024-4)</sup>.
- **MMLU-Pro**. Rozbudowany i trudniejszy wariant testu, przedstawiony pod koniec 2024 roku. Zawiera ponad 12 000 pytań, na każde z nich podawanych jest **10 wariantów odpowiedzi** zamiast czterech. Obniża to prawdopodobieństwo losowego zgadywania do 10%. Pytania zostały zweryfikowane przez ekspertów i obejmują nowe zadania z trudniejszych źródeł<sup>[\[5\]](https://systems-analysis.info/int/MMLU_Benchmark_(PL)#cite_note-mmlu_pro_vals_ai-5)</sup>.
- **MMMLU** (*Multilingual MMLU*). Wielojęzyczna wersja wydana przez OpenAI w 2023 roku. Cały zestaw MMLU został przetłumaczony przez profesjonalnych tłumaczy na 14 języków, w tym zarówno powszechne (hiszpański, chiński, rosyjski), jak i niskozasobowe (na przykład joruba). Pozwala to oceniać i porównywać możliwości modeli w różnych językach<sup>[\[6\]](https://systems-analysis.info/int/MMLU_Benchmark_(PL)#cite_note-mmmlu_hf-6)</sup>.

## Odnośniki

- Oficjalne repozytorium MMLU na GitHub
- Strona MMLU na Papers with Code z wynikami modeli

## Literatura

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

  

## Przypisy

1.  <span id="cite_note-mmlu_paper-1">↑ <sup>[1.0](https://systems-analysis.info/int/MMLU_Benchmark_(PL)#cite_ref-mmlu_paper_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/MMLU_Benchmark_(PL)#cite_ref-mmlu_paper_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/MMLU_Benchmark_(PL)#cite_ref-mmlu_paper_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/MMLU_Benchmark_(PL)#cite_ref-mmlu_paper_1-3)</sup> Hendrycks, D. et al. «Measuring Massive Multitask Language Understanding». *arXiv:2009.03300*, 2021. <a href="https://ar5iv.labs.arxiv.org/html/2009.03300" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-mmlu_wiki-2">↑ <sup>[2.0](https://systems-analysis.info/int/MMLU_Benchmark_(PL)#cite_ref-mmlu_wiki_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/MMLU_Benchmark_(PL)#cite_ref-mmlu_wiki_2-1)</sup> «MMLU». In *Wikipedia*. <a href="https://en.wikipedia.org/wiki/MMLU" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-new_savanna_2024-3">↑ <sup>[3.0](https://systems-analysis.info/int/MMLU_Benchmark_(PL)#cite_ref-new_savanna_2024_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/MMLU_Benchmark_(PL)#cite_ref-new_savanna_2024_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/MMLU_Benchmark_(PL)#cite_ref-new_savanna_2024_3-2)</sup> <sup>[3.3](https://systems-analysis.info/int/MMLU_Benchmark_(PL)#cite_ref-new_savanna_2024_3-3)</sup> «NEW SAVANNA: The AI industry lacks useful ways of measuring performance». *New Savanna Blog*, 2024. <a href="https://new-savanna.blogspot.com/2024/04/the-ai-industry-lacks-useful-ways-of.html" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-done_with_mmlu_2024-4">↑ <sup>[4.0](https://systems-analysis.info/int/MMLU_Benchmark_(PL)#cite_ref-done_with_mmlu_2024_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/MMLU_Benchmark_(PL)#cite_ref-done_with_mmlu_2024_4-1)</sup> <sup>[4.2](https://systems-analysis.info/int/MMLU_Benchmark_(PL)#cite_ref-done_with_mmlu_2024_4-2)</sup> Gema, A. P. et al. «Are We Done with MMLU?». *arXiv:2406.04127*, 2024. <a href="https://ar5iv.labs.arxiv.org/html/2406.04127" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-mmlu_pro_vals_ai-5">[↑](https://systems-analysis.info/int/MMLU_Benchmark_(PL)#cite_ref-mmlu_pro_vals_ai_5-0) «MMLU Pro». *Vals.ai*, 2025. <a href="https://www.vals.ai/benchmarks/mmlu_pro-04-15-2025" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-mmmlu_hf-6">[↑](https://systems-analysis.info/int/MMLU_Benchmark_(PL)#cite_ref-mmmlu_hf_6-0) «openai/MMMLU». *Hugging Face Datasets*. <a href="https://huggingface.co/datasets/openai/MMMLU" class="external autonumber" rel="nofollow">[6]</a></span>
