---
title: "MMLU Benchmark (TH)"
source: "https://systems-analysis.info/int/MMLU_Benchmark_(TH)"
wiki: "systems-analysis.info/int"
article: "MMLU_Benchmark_(TH)"
language: "th"
categories:
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
  - "Category:Thai"
revision_id: 4087
wiki_created_at: 2026-09-06T23:30:21Z
wiki_modified_at: 2026-09-06T23:30:21Z
downloaded_at: 2026-09-07T23:00:49Z
---

# MMLU Benchmark (TH)

**MMLU** (ตัวย่อของ **Measuring Massive Multitask Language Understanding**) — คือชุดงานอ้างอิง (benchmark) ที่ออกแบบมาเพื่อประเมินความสามารถของโมเดลภาษาขนาดใหญ่ (LLM) ในหลากหลายสาขาวิชา benchmark นี้ได้รับการพัฒนาในปี 2020 โดยทีมนักวิจัยภายใต้การนำของ **Dan Hendrycks** จาก UC Berkeley และเผยแพร่ในงานประชุม ICLR ในปี 2021<sup>[\[1\]](https://systems-analysis.info/int/MMLU_Benchmark_(TH)#cite_note-mmlu_paper-1)</sup>

จุดมุ่งหมายของ MMLU คือการทดสอบว่าโมเดลซึมซับความรู้และทักษะที่หลากหลายที่ได้มาในขั้นตอน pre-training ได้มากเพียงใด โดยทดสอบในโหมด *zero-shot* หรือ *few-shot* โดยไม่ต้องมีการ fine-tuning เพิ่มเติม MMLU ถูกสร้างขึ้นเป็นทางเลือกที่ยากกว่าการทดสอบที่มีอยู่ก่อนหน้านี้ (เช่น GLUE และ SuperGLUE) ซึ่งหลายโมเดลทำได้ถึงระดับมนุษย์ภายในปี 2020 แล้ว<sup>[\[2\]](https://systems-analysis.info/int/MMLU_Benchmark_(TH)#cite_note-mmlu_wiki-2)</sup>

## คำอธิบายและเนื้อหา

MMUL ประกอบด้วย **คำถาม 15,908 ข้อ** แบบปรนัย ครอบคลุม **57 สาขาวิชาที่แตกต่างกัน** หัวข้อของแบบทดสอบได้แก่:

- วิชาในกลุ่ม STEM (คณิตศาสตร์ ฟิสิกส์ ชีววิทยา วิทยาการคอมพิวเตอร์)
- มนุษยศาสตร์และสังคมศาสตร์ (ประวัติศาสตร์ วรรณกรรม กฎหมาย การบริหาร)
- สาขาประยุกต์และวิชาชีพ (การแพทย์ นิติศาสตร์ ธุรกิจ)<sup>[\[1\]](https://systems-analysis.info/int/MMLU_Benchmark_(TH)#cite_note-mmlu_paper-1)</sup>

ระดับความยากครอบคลุมตั้งแต่ระดับประถมศึกษาไปจนถึงระดับวิชาชีพขั้นสูง คำถามอ้างอิงจากข้อสอบจริงสำหรับโรงเรียน มหาวิทยาลัย และการสอบวิชาชีพ เช่น GRE และ USMLE<sup>[\[1\]](https://systems-analysis.info/int/MMLU_Benchmark_(TH)#cite_note-mmlu_paper-1)</sup> รูปแบบของแบบทดสอบคือคำตอบสี่ตัวเลือกสำหรับแต่ละคำถาม ซึ่งหมายความว่าหากเลือกแบบสุ่มจะมีความแม่นยำที่ 25% เพื่อให้ได้คะแนนสูง โมเดลจะต้องมีความรู้รอบด้านอย่างกว้างขวางและความสามารถในการใช้เหตุผล

## ผลลัพธ์และพัฒนาการ

เมื่อเปิดตัว MMLU ในปี 2020 LLM ส่วนใหญ่ให้ผลลัพธ์สูงกว่าการเดาแบบสุ่มเพียงเล็กน้อย โมเดลที่ทำคะแนนได้ดีที่สุดคือ GPT-3 (175 พันล้านพารามิเตอร์) ซึ่งตอบถูก **~43.9%** เพื่อเปรียบเทียบ ผู้เชี่ยวชาญที่เป็นมนุษย์โดยเฉลี่ยทำได้ **~90%**<sup>[\[1\]](https://systems-analysis.info/int/MMLU_Benchmark_(TH)#cite_note-mmlu_paper-1)</sup> ช่องว่างนี้ยืนยันถึงความยากและมาตรฐานสูงของ benchmark ใหม่

เมื่อเวลาผ่านไป MMLU กลายเป็นหนึ่งในการทดสอบที่ได้รับความนิยมมากที่สุดสำหรับ LLM และได้รับสถานะ "มาตรฐานทอง" ในรายงานของบริษัท AI ชั้นนำ<sup>[\[3\]](https://systems-analysis.info/int/MMLU_Benchmark_(TH)#cite_note-new_savanna_2024-3)</sup> ภายในปี 2023-2024 โมเดลล่าสุด เช่น GPT-4, **Gemini Ultra** จาก Google และ **Claude 3.5** จาก Anthropic เข้าใกล้ระดับมนุษย์ โดยทำความแม่นยำได้ **~85-90%**<sup>[\[2\]](https://systems-analysis.info/int/MMLU_Benchmark_(TH)#cite_note-mmlu_wiki-2)[\[3\]](https://systems-analysis.info/int/MMLU_Benchmark_(TH)#cite_note-new_savanna_2024-3)</sup>

ความก้าวหน้าอย่างรวดเร็วนำไปสู่การ "อิ่มตัว" ของ benchmark อย่างค่อยเป็นค่อยไป โดยโมเดลชั้นนำเริ่มได้คะแนนใกล้เคียงกับสูงสุด ซึ่งลดความสามารถของ MMLU ในการแยกแยะความสามารถเชิงปัญญาของโมเดลต่าง ๆ สิ่งนี้กระตุ้นให้ชุมชนพัฒนาการทดสอบใหม่ที่ยากยิ่งขึ้น<sup>[\[3\]](https://systems-analysis.info/int/MMLU_Benchmark_(TH)#cite_note-new_savanna_2024-3)</sup>

## ข้อจำกัดและการวิจารณ์

แม้จะได้รับการยอมรับอย่างแพร่หลาย MMLU มีข้อจำกัดที่สำคัญหลายประการ

### คุณภาพและความถูกต้องของข้อมูล

ในเดือนมิถุนายน 2024 นักวิจัยได้ทำการวิเคราะห์ด้วยมือจากตัวอย่างคำถาม MMLU จำนวน 5,700 ข้อ และพบข้อผิดพลาดจำนวนมาก<sup>[\[4\]](https://systems-analysis.info/int/MMLU_Benchmark_(TH)#cite_note-done_with_mmlu_2024-4)</sup>

- ประมาณ **6.5%** ของคำถาม MMLU ทั้งหมดมีข้อผิดพลาดในการระบุป้ายกำกับหรือการกำหนดสูตร
- ในบางหมวดหมู่ สัดส่วนของแบบทดสอบที่ไม่ถูกต้องสูงมาก ตัวอย่างเช่น ในส่วน "ไวรัสวิทยา" **57%** ของแบบทดสอบมีข้อผิดพลาด (คำตอบที่ถูกต้องหลายข้อ การกำหนดสูตรที่ไม่ถูกต้อง หรือคำตอบอ้างอิงที่ระบุผิด)

ซึ่งหมายความว่าแม้แต่โมเดลที่สมบูรณ์แบบก็ไม่สามารถทำคะแนนได้ 100% บน dataset ต้นฉบับ และการปรับปรุงในตัวชี้วัดบางส่วนอาจเกี่ยวข้องกับการที่โมเดลจำข้อผิดพลาดเชิงระบบของชุดข้อมูลได้<sup>[\[4\]](https://systems-analysis.info/int/MMLU_Benchmark_(TH)#cite_note-done_with_mmlu_2024-4)</sup>

### วิธีการประเมินและการรั่วไหลของข้อมูล

- **การขาดมาตรฐานการทดสอบ** นักพัฒนาต่าง ๆ อาจใช้ prompt และโหมด few-shot ที่แตกต่างกัน ซึ่งทำให้การเปรียบเทียบผลลัพธ์ของโมเดลโดยตรงเป็นเรื่องยาก
- **การรั่วไหลของข้อมูล** (*data contamination*) มีความเสี่ยงที่คำถามและคำตอบจาก benchmark สาธารณะจะถูกรวมอยู่ใน dataset การฝึก LLM ในกรณีเช่นนั้น โมเดล "รู้" คำตอบที่ถูกต้องอยู่แล้ว ทำให้การประเมินไม่ยุติธรรม<sup>[\[3\]](https://systems-analysis.info/int/MMLU_Benchmark_(TH)#cite_note-new_savanna_2024-3)</sup>

## เวอร์ชันดัดแปลงและส่วนขยาย

เพื่อแก้ไขปัญหาของ MMLU ต้นฉบับ จึงได้มีการสร้างรูปแบบต่าง ๆ ขึ้นมาหลายแบบ

- **MMLU-Redux** เวอร์ชันที่ได้รับการแก้ไขและปรับปรุงของชุดข้อมูล เปิดตัวในเดือนมิถุนายน 2024 ประกอบด้วยคำถาม 3,000 ข้อที่ระบุป้ายกำกับใหม่จาก 30 หมวดหมู่ และออกแบบมาเพื่อการประเมินโมเดลที่เชื่อถือได้มากขึ้นโดยไม่มีความบิดเบือนที่เกิดจากข้อผิดพลาดในข้อมูล<sup>[\[4\]](https://systems-analysis.info/int/MMLU_Benchmark_(TH)#cite_note-done_with_mmlu_2024-4)</sup>
- **MMLU-Pro** เวอร์ชันขยายและยากขึ้นของการทดสอบ เปิดตัวในช่วงปลายปี 2024 มีคำถามมากกว่า 12,000 ข้อ โดยแต่ละข้อมี **10 ตัวเลือกคำตอบ** แทนที่จะเป็นสี่ ซึ่งลดความน่าจะเป็นของการเดาแบบสุ่มลงเหลือ 10% คำถามผ่านการตรวจสอบโดยผู้เชี่ยวชาญและรวมแบบทดสอบใหม่จากแหล่งที่มายากกว่า<sup>[\[5\]](https://systems-analysis.info/int/MMLU_Benchmark_(TH)#cite_note-mmlu_pro_vals_ai-5)</sup>
- **MMMLU** (*Multilingual MMLU*) เวอร์ชันหลายภาษา เปิดตัวโดย OpenAI ในปี 2023 ชุด MMLU ทั้งหมดได้รับการแปลโดยนักแปลมืออาชีพเป็น 14 ภาษา รวมถึงภาษาที่แพร่หลาย (สเปน จีน รัสเซีย) และภาษาที่มีทรัพยากรน้อย (เช่น ยอรูบา) ซึ่งช่วยให้สามารถประเมินและเปรียบเทียบความสามารถของโมเดลในภาษาต่าง ๆ ได้<sup>[\[6\]](https://systems-analysis.info/int/MMLU_Benchmark_(TH)#cite_note-mmmlu_hf-6)</sup>

## ลิงก์

- คลังข้อมูลอย่างเป็นทางการของ MMLU บน GitHub
- หน้า MMLU บน Papers with Code พร้อมผลลัพธ์ของโมเดล

## เอกสารอ้างอิง

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

  

## หมายเหตุ

1.  <span id="cite_note-mmlu_paper-1">↑ <sup>[1.0](https://systems-analysis.info/int/MMLU_Benchmark_(TH)#cite_ref-mmlu_paper_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/MMLU_Benchmark_(TH)#cite_ref-mmlu_paper_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/MMLU_Benchmark_(TH)#cite_ref-mmlu_paper_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/MMLU_Benchmark_(TH)#cite_ref-mmlu_paper_1-3)</sup> Hendrycks, D. et al. «Measuring Massive Multitask Language Understanding». *arXiv:2009.03300*, 2021. <a href="https://ar5iv.labs.arxiv.org/html/2009.03300" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-mmlu_wiki-2">↑ <sup>[2.0](https://systems-analysis.info/int/MMLU_Benchmark_(TH)#cite_ref-mmlu_wiki_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/MMLU_Benchmark_(TH)#cite_ref-mmlu_wiki_2-1)</sup> «MMLU». In *Wikipedia*. <a href="https://en.wikipedia.org/wiki/MMLU" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-new_savanna_2024-3">↑ <sup>[3.0](https://systems-analysis.info/int/MMLU_Benchmark_(TH)#cite_ref-new_savanna_2024_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/MMLU_Benchmark_(TH)#cite_ref-new_savanna_2024_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/MMLU_Benchmark_(TH)#cite_ref-new_savanna_2024_3-2)</sup> <sup>[3.3](https://systems-analysis.info/int/MMLU_Benchmark_(TH)#cite_ref-new_savanna_2024_3-3)</sup> «NEW SAVANNA: The AI industry lacks useful ways of measuring performance». *New Savanna Blog*, 2024. <a href="https://new-savanna.blogspot.com/2024/04/the-ai-industry-lacks-useful-ways-of.html" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-done_with_mmlu_2024-4">↑ <sup>[4.0](https://systems-analysis.info/int/MMLU_Benchmark_(TH)#cite_ref-done_with_mmlu_2024_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/MMLU_Benchmark_(TH)#cite_ref-done_with_mmlu_2024_4-1)</sup> <sup>[4.2](https://systems-analysis.info/int/MMLU_Benchmark_(TH)#cite_ref-done_with_mmlu_2024_4-2)</sup> Gema, A. P. et al. «Are We Done with MMLU?». *arXiv:2406.04127*, 2024. <a href="https://ar5iv.labs.arxiv.org/html/2406.04127" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-mmlu_pro_vals_ai-5">[↑](https://systems-analysis.info/int/MMLU_Benchmark_(TH)#cite_ref-mmlu_pro_vals_ai_5-0) «MMLU Pro». *Vals.ai*, 2025. <a href="https://www.vals.ai/benchmarks/mmlu_pro-04-15-2025" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-mmmlu_hf-6">[↑](https://systems-analysis.info/int/MMLU_Benchmark_(TH)#cite_ref-mmmlu_hf_6-0) «openai/MMMLU». *Hugging Face Datasets*. <a href="https://huggingface.co/datasets/openai/MMMLU" class="external autonumber" rel="nofollow">[6]</a></span>
