---
title: "MMLU Benchmark (BG)"
source: "https://systems-analysis.info/int/MMLU_Benchmark_(BG)"
wiki: "systems-analysis.info/int"
article: "MMLU_Benchmark_(BG)"
language: "bg"
categories:
  - "Category:Bulgarian"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 4069
wiki_created_at: 2026-09-06T23:30:05Z
wiki_modified_at: 2026-09-06T23:30:05Z
downloaded_at: 2026-09-07T23:00:43Z
---

# MMLU Benchmark (BG)

**MMLU** (съкращение от **Measuring Massive Multitask Language Understanding**) — това е еталонен набор от задачи (benchmark), предназначен за оценка на способностите на големите езикови модели (LLM) в широк кръг от предметни области. Бенчмаркът е разработен през 2020 година от екип изследователи под ръководството на **Дан Хендрикс** (*Dan Hendrycks*) от UC Berkeley и публикуван на конференцията ICLR през 2021 година<sup>[\[1\]](https://systems-analysis.info/int/MMLU_Benchmark_(BG)#cite_note-mmlu_paper-1)</sup>.

Целта на MMLU е да провери доколко моделът усвоява разнообразни знания и умения, придобити на етапа на предобучение, чрез тестване в режим на *нулеви* или *няколко примера* (*zero/few-shot*) без допълнително финно настройване. MMLU е създаден като по-сложна алтернатива на съществувалите преди това тестове (като GLUE и SuperGLUE), при които много модели до 2020 година вече бяха достигнали човешкото ниво<sup>[\[2\]](https://systems-analysis.info/int/MMLU_Benchmark_(BG)#cite_note-mmlu_wiki-2)</sup>.

## Описание и съдържание

MMLL се състои от **15 908 въпроса** с множествен избор на отговор, обхващащи **57 различни дисциплини**. Тематиката на задачите включва:

- Предмети от направление STEM (математика, физика, биология, информатика).
- Хуманитарни и социални науки (история, литература, право, управление).
- Приложни и професионални области (медицина, юриспруденция, бизнес)<sup>[\[1\]](https://systems-analysis.info/int/MMLU_Benchmark_(BG)#cite_note-mmlu_paper-1)</sup>.

Диапазонът на сложност варира от ниво на начално училище до напреднало професионално ниво. Въпросите се основават на реални изпитни материали за училища, университети и професионални тестове, като GRE и USMLE<sup>[\[1\]](https://systems-analysis.info/int/MMLU_Benchmark_(BG)#cite_note-mmlu_paper-1)</sup>. Форматът на задачите е четири варианта на отговор за всеки въпрос, което означава, че при случаен избор точността е 25%. За постигане на висок резултат моделът трябва да притежава обширни енциклопедични знания и способност за разсъждение.

## Резултати и развитие

При публикуването на MMLU през 2020 година повечето LLM показваха резултати едва малко над случайното познаване. Най-добър резултат демонстрира моделът GPT-3 (175 млрд. параметри), постигайки **~43,9%** верни отговори. За сравнение, човек-експерт средно достигаше **~90%**<sup>[\[1\]](https://systems-analysis.info/int/MMLU_Benchmark_(BG)#cite_note-mmlu_paper-1)</sup>. Тази разлика потвърди сложността и високата планка на новия бенчмарк.

С течение на времето MMLU се превърна в един от най-популярните тестове за LLM, придобивайки статут на „златен стандарт" в отчетите на водещите AI компании<sup>[\[3\]](https://systems-analysis.info/int/MMLU_Benchmark_(BG)#cite_note-new_savanna_2024-3)</sup>. До 2023–2024 година най-новите модели, като GPT-4, **Gemini Ultra** от Google и **Claude 3.5** от Anthropic, се приближиха до човешкото ниво, достигайки **~85–90%** точност<sup>[\[2\]](https://systems-analysis.info/int/MMLU_Benchmark_(BG)#cite_note-mmlu_wiki-2)[\[3\]](https://systems-analysis.info/int/MMLU_Benchmark_(BG)#cite_note-new_savanna_2024-3)</sup>.

Бързият напредък доведе до постепенно „насищане" на бенчмарка: водещите модели започнаха да постигат оценки близки до максималните, което намали способността на MMLU да разграничава техните интелектуални възможности. Това стимулира общността към разработване на нови, по-трудни тестове<sup>[\[3\]](https://systems-analysis.info/int/MMLU_Benchmark_(BG)#cite_note-new_savanna_2024-3)</sup>.

## Ограничения и критика

Въпреки широкото си разпространение, MMLU има редица съществени ограничения.

### Качество и коректност на данните

През юни 2024 година изследователи извършиха ръчен анализ на извадка от 5700 въпроса от MMLU и установиха значителен брой грешки<sup>[\[4\]](https://systems-analysis.info/int/MMLU_Benchmark_(BG)#cite_note-done_with_mmlu_2024-4)</sup>.

- Около **6,5%** от всички въпроси в MMLU съдържат грешки в анотацията или формулировките.
- В отделни категории делът на некоректните задачи е много висок. Например, в раздела „Вирусология\\ **57%** от задачите съдържаха грешки (няколко верни отговора, некоректни формулировки или неправилно посочен еталонен отговор).

Това означава, че дори идеален модел не може да постигне 100% на оригиналния dataset, а част от подобренията в метриките може да е свързана с запомнянето от модела на систематичните грешки в набора<sup>[\[4\]](https://systems-analysis.info/int/MMLU_Benchmark_(BG)#cite_note-done_with_mmlu_2024-4)</sup>.

### Методика на оценяване и изтичане на данни

- **Липса на стандарт за тестване**. Различни разработчици могат да използват различни prompt-ове и режими few-shot, което затруднява прякото сравнение на резултатите на моделите.
- **Изтичане на данни** (*data contamination*). Съществува риск въпросите и отговорите от публичните бенчмаркове да попаднат в обучителните извадки на LLM. В такъв случай моделът фактически „знае\\ верните отговори, което прави оценяването нечестно<sup>[\[3\]](https://systems-analysis.info/int/MMLU_Benchmark_(BG)#cite_note-new_savanna_2024-3)</sup>.

## Производни версии и разширения

За решаване на проблемите на оригиналния MMLU бяха създадени няколко негови варианта.

- **MMLU-Redux**. Поправена и прецизирана версия на набора, представена през юни 2024 година. Тя включва 3000 преанотирани въпроса от 30 категории и е предназначена за по-надеждно оценяване на моделите без изкривявания, причинени от грешки в данните<sup>[\[4\]](https://systems-analysis.info/int/MMLU_Benchmark_(BG)#cite_note-done_with_mmlu_2024-4)</sup>.
- **MMLU-Pro**. Разширен и усложнен вариант на теста, представен в края на 2024 година. Той съдържа над 12 000 въпроса, за всеки от които се предлагат **10 варианта на отговор** вместо четири. Това намалява вероятността за случайно познаване до 10%. Въпросите са преминали проверка от експерти и включват нови задачи от по-сложни източници<sup>[\[5\]](https://systems-analysis.info/int/MMLU_Benchmark_(BG)#cite_note-mmlu_pro_vals_ai-5)</sup>.
- **MMMLU** (*Multilingual MMLU*). Многоезична версия, издадена от OpenAI през 2023 година. Целият набор MMLU е преведен от професионални преводачи на 14 езика, включително широко разпространени (испански, китайски, руски), така и нискоресурсни (например йоруба). Това позволява да се оценяват и сравняват възможностите на моделите на различни езици<sup>[\[6\]](https://systems-analysis.info/int/MMLU_Benchmark_(BG)#cite_note-mmmlu_hf-6)</sup>.

## Препратки

- Официално хранилище на MMLU в GitHub
- Страница на MMLU в Papers with Code с резултатите на моделите

## Литература

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

  

## Бележки

1.  <span id="cite_note-mmlu_paper-1">↑ <sup>[1.0](https://systems-analysis.info/int/MMLU_Benchmark_(BG)#cite_ref-mmlu_paper_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/MMLU_Benchmark_(BG)#cite_ref-mmlu_paper_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/MMLU_Benchmark_(BG)#cite_ref-mmlu_paper_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/MMLU_Benchmark_(BG)#cite_ref-mmlu_paper_1-3)</sup> Hendrycks, D. et al. «Measuring Massive Multitask Language Understanding». *arXiv:2009.03300*, 2021. <a href="https://ar5iv.labs.arxiv.org/html/2009.03300" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-mmlu_wiki-2">↑ <sup>[2.0](https://systems-analysis.info/int/MMLU_Benchmark_(BG)#cite_ref-mmlu_wiki_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/MMLU_Benchmark_(BG)#cite_ref-mmlu_wiki_2-1)</sup> «MMLU». In *Wikipedia*. <a href="https://en.wikipedia.org/wiki/MMLU" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-new_savanna_2024-3">↑ <sup>[3.0](https://systems-analysis.info/int/MMLU_Benchmark_(BG)#cite_ref-new_savanna_2024_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/MMLU_Benchmark_(BG)#cite_ref-new_savanna_2024_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/MMLU_Benchmark_(BG)#cite_ref-new_savanna_2024_3-2)</sup> <sup>[3.3](https://systems-analysis.info/int/MMLU_Benchmark_(BG)#cite_ref-new_savanna_2024_3-3)</sup> «NEW SAVANNA: The AI industry lacks useful ways of measuring performance». *New Savanna Blog*, 2024. <a href="https://new-savanna.blogspot.com/2024/04/the-ai-industry-lacks-useful-ways-of.html" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-done_with_mmlu_2024-4">↑ <sup>[4.0](https://systems-analysis.info/int/MMLU_Benchmark_(BG)#cite_ref-done_with_mmlu_2024_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/MMLU_Benchmark_(BG)#cite_ref-done_with_mmlu_2024_4-1)</sup> <sup>[4.2](https://systems-analysis.info/int/MMLU_Benchmark_(BG)#cite_ref-done_with_mmlu_2024_4-2)</sup> Gema, A. P. et al. «Are We Done with MMLU?». *arXiv:2406.04127*, 2024. <a href="https://ar5iv.labs.arxiv.org/html/2406.04127" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-mmlu_pro_vals_ai-5">[↑](https://systems-analysis.info/int/MMLU_Benchmark_(BG)#cite_ref-mmlu_pro_vals_ai_5-0) «MMLU Pro». *Vals.ai*, 2025. <a href="https://www.vals.ai/benchmarks/mmlu_pro-04-15-2025" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-mmmlu_hf-6">[↑](https://systems-analysis.info/int/MMLU_Benchmark_(BG)#cite_ref-mmmlu_hf_6-0) «openai/MMMLU». *Hugging Face Datasets*. <a href="https://huggingface.co/datasets/openai/MMMLU" class="external autonumber" rel="nofollow">[6]</a></span>
