MMLU Benchmark (TL)
MMLU (abbreviation mula sa Measuring Massive Multitask Language Understanding) — ito ay isang etalon na hanay ng mga gawain (benchmark), na nilikha para sa pagtatasa ng kakayahan ng malalaking language model (LLM) sa malawak na hanay ng mga paksa at larangan. Ang benchmark ay binuo noong 2020 ng isang pangkat ng mga mananaliksik sa ilalim ng pamumuno ni Dan Hendrycks mula sa UC Berkeley at inilathala sa kumperensyang ICLR noong 2021[1].
Ang layunin ng MMLU — suriin kung gaano kahusay na natatamo ng modelo ang iba't ibang kaalaman at kasanayan na nakuha sa yugto ng pre-training, sa pamamagitan ng pagsubok sa mode ng zero-shot o few-shot nang walang karagdagang fine-tuning. Ang MMLU ay nilikha bilang isang mas mahirap na alternatibo sa mga naunang pagsubok (tulad ng GLUE at SuperGLUE), kung saan maraming modelo noong 2020 ay nakarating na sa antas ng tao[2].
Paglalarawan at Nilalaman
Ang MMLU ay binubuo ng 15,908 na tanong na may maramihang pagpipilian ng sagot, na sumasaklaw sa 57 iba't ibang disiplina. Ang mga paksa ng mga gawain ay kinabibilangan ng:
- Mga paksa ng direksyong STEM (matematika, pisika, biyolohiya, informatika).
- Humanidades at agham panlipunan (kasaysayan, panitikan, batas, pamamahala).
- Mga inilapat at propesyonal na larangan (medisina, hurisprudensya, negosyo)[1].
Ang antas ng kahirapan ay nag-iiba mula sa antas ng paaralang elementarya hanggang sa advanced na antas ng propesyonal. Ang mga tanong ay batay sa totoong materyales ng pagsusulit para sa mga paaralan, unibersidad, at propesyonal na pagsubok, tulad ng GRE at USMLE[1]. Ang format ng mga gawain — apat na pagpipilian ng sagot para sa bawat tanong, na nangangahulugang sa random na pagpili ang katumpakan ay 25%. Upang makamit ang mataas na resulta, ang modelo ay kailangang magtaglay ng malawak na ensiklopedikong kaalaman at kakayahang mag-isip nang maayos.
Mga Resulta at Pag-unlad
Sa paglulunsad ng MMLU noong 2020, karamihan sa mga LLM ay nagpakita ng mga resulta na bahagyang mas mataas lamang kaysa sa random na paghula. Ang pinakamahusay na resulta ay ipinakita ng modelo ng GPT-3 (175 bilyong parameter), na nakakuha ng ~43.9% tamang sagot. Para sa paghahambing, ang isang dalubhasang tao ay karaniwang nakakamit ng ~90%[1]. Ang pagkakaibang ito ay nagpatunay ng kahirapan at mataas na pamantayan ng bagong benchmark.
Sa paglipas ng panahon, ang MMLU ay naging isa sa pinaka-sikat na pagsubok para sa mga LLM, na nakakuha ng katayuang "gintong pamantayan" sa mga ulat ng mga nangungunang kumpanya ng AI[3]. Sa mga taong 2023–2024, ang pinakabagong mga modelo, tulad ng GPT-4, Gemini Ultra mula sa Google at Claude 3.5 mula sa Anthropic, ay nakarating na malapit sa antas ng tao, na nakamit ang ~85–90% na katumpakan[2][3].
Ang mabilis na pag-unlad ay humantong sa unti-unting "pagkabusog" ng benchmark: ang mga nangungunang modelo ay nagsimulang makamit ang mga marka na malapit na sa pinakamataas, na nagpababa ng kakayahan ng MMLU na makilala ang kanilang mga intelektwal na kakayahan. Ito ay nag-udyok sa komunidad na bumuo ng mga bago, mas mahirap na pagsubok[3].
Mga Limitasyon at Kritisismo
Sa kabila ng malawak na paggamit, ang MMLU ay may ilang mahahalagang limitasyon.
Kalidad at Kawastuan ng Datos
Noong Hunyo 2024, ang mga mananaliksik ay nagsagawa ng manu-manong pagsusuri ng isang sample na 5,700 na tanong mula sa MMLU at natuklasan ang malaking bilang ng mga pagkakamali[4].
- Humigit-kumulang 6.5% ng lahat ng tanong sa MMLU ay naglalaman ng mga pagkakamali sa pagtatatanda o sa pagbabalangkas.
- Sa ilang partikular na kategorya, ang bahagi ng mga maling gawain ay napakataas. Halimbawa, sa seksyong "Virolohiya" 57% ng mga gawain ay naglalaman ng mga pagkakamali (ilang tamang sagot, maling pagbabalangkas, o maling tinukoy na etalon na sagot).
Ito ay nangangahulugang kahit ang isang perpektong modelo ay hindi makakakuha ng 100% sa orihinal na dataset, at ang bahagi ng mga pagpapabuti sa mga sukatan ay maaaring kaugnay ng pagsasaulo ng modelo ng mga sistematikong pagkakamali ng hanay[4].
Pamamaraan ng Pagtatasa at Pagtagas ng Datos
- Kawalan ng pamantayan sa pagsubok. Ang iba't ibang mga developer ay maaaring gumamit ng iba't ibang prompt at few-shot na mode, na nagpapahirap sa direktang paghahambing ng mga resulta ng mga modelo.
- Pagtagas ng datos (data contamination). May panganib na mapasama ang mga tanong at sagot mula sa mga pampublikong benchmark sa mga hanay ng pagsasanay ng mga LLM. Sa kasong ito, ang modelo ay halos "alam" na ang mga tamang sagot, na nagpapahirap ng pagtatasa[3].
Mga Hinangong Bersyon at Pagpapalawak
Upang matugunan ang mga problema ng orihinal na MMLU, ilang mga variant ang nilikhang.
- MMLU-Redux. Isang naitama at na-refine na bersyon ng hanay, na ipinakita noong Hunyo 2024. Kasama nito ang 3,000 muling natatak na tanong mula sa 30 kategorya at nilikha para sa mas maaasahang pagtatasa ng mga modelo nang walang mga pagbabaluktot na dulot ng mga pagkakamali sa datos[4].
- MMLU-Pro. Isang pinalawak at pinagpalaong variant ng pagsubok, na ipinakita sa katapusan ng 2024. Naglalaman ito ng higit sa 12,000 tanong, bawat isa ay may 10 pagpipilian ng sagot sa halip na apat. Ito ay nagpapababa ng posibilidad ng random na paghula hanggang 10%. Ang mga tanong ay nasuri ng mga dalubhasa at kinabibilangan ng mga bagong gawain mula sa mas kumplikadong mga pinagkukunan[5].
- MMMLU (Multilingual MMLU). Isang maraming-wika na bersyon, na inilabas ng OpenAI noong 2023. Ang buong hanay ng MMLU ay isinalin ng mga propesyonal na tagasalin sa 14 na wika, kasama ang mga karaniwang wika (Espanyol, Intsik, Ruso) at mga wika na may mababang mapagkukunan (halimbawa, Yoruba). Pinapayagan nito ang pagtatasa at paghahambing ng mga kakayahan ng mga modelo sa iba't ibang wika[6].
Mga Sanggunian
- Opisyal na repositoryo ng MMLU sa GitHub
- Pahina ng MMLU sa Papers with Code na may mga resulta ng modelo
Panitikan
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
Mga Tala
- ↑ 1.0 1.1 1.2 1.3 Hendrycks, D. et al. «Measuring Massive Multitask Language Understanding». arXiv:2009.03300, 2021. [1]
- ↑ 2.0 2.1 «MMLU». In Wikipedia. [2]
- ↑ 3.0 3.1 3.2 3.3 «NEW SAVANNA: The AI industry lacks useful ways of measuring performance». New Savanna Blog, 2024. [3]
- ↑ 4.0 4.1 4.2 Gema, A. P. et al. «Are We Done with MMLU?». arXiv:2406.04127, 2024. [4]
- ↑ «MMLU Pro». Vals.ai, 2025. [5]
- ↑ «openai/MMMLU». Hugging Face Datasets. [6]