MMLU Benchmark (TH)
MMLU (ตัวย่อของ Measuring Massive Multitask Language Understanding) — คือชุดงานอ้างอิง (benchmark) ที่ออกแบบมาเพื่อประเมินความสามารถของโมเดลภาษาขนาดใหญ่ (LLM) ในหลากหลายสาขาวิชา benchmark นี้ได้รับการพัฒนาในปี 2020 โดยทีมนักวิจัยภายใต้การนำของ Dan Hendrycks จาก UC Berkeley และเผยแพร่ในงานประชุม ICLR ในปี 2021[1]
จุดมุ่งหมายของ MMLU คือการทดสอบว่าโมเดลซึมซับความรู้และทักษะที่หลากหลายที่ได้มาในขั้นตอน pre-training ได้มากเพียงใด โดยทดสอบในโหมด zero-shot หรือ few-shot โดยไม่ต้องมีการ fine-tuning เพิ่มเติม MMLU ถูกสร้างขึ้นเป็นทางเลือกที่ยากกว่าการทดสอบที่มีอยู่ก่อนหน้านี้ (เช่น GLUE และ SuperGLUE) ซึ่งหลายโมเดลทำได้ถึงระดับมนุษย์ภายในปี 2020 แล้ว[2]
คำอธิบายและเนื้อหา
MMUL ประกอบด้วย คำถาม 15,908 ข้อ แบบปรนัย ครอบคลุม 57 สาขาวิชาที่แตกต่างกัน หัวข้อของแบบทดสอบได้แก่:
- วิชาในกลุ่ม STEM (คณิตศาสตร์ ฟิสิกส์ ชีววิทยา วิทยาการคอมพิวเตอร์)
- มนุษยศาสตร์และสังคมศาสตร์ (ประวัติศาสตร์ วรรณกรรม กฎหมาย การบริหาร)
- สาขาประยุกต์และวิชาชีพ (การแพทย์ นิติศาสตร์ ธุรกิจ)[1]
ระดับความยากครอบคลุมตั้งแต่ระดับประถมศึกษาไปจนถึงระดับวิชาชีพขั้นสูง คำถามอ้างอิงจากข้อสอบจริงสำหรับโรงเรียน มหาวิทยาลัย และการสอบวิชาชีพ เช่น GRE และ USMLE[1] รูปแบบของแบบทดสอบคือคำตอบสี่ตัวเลือกสำหรับแต่ละคำถาม ซึ่งหมายความว่าหากเลือกแบบสุ่มจะมีความแม่นยำที่ 25% เพื่อให้ได้คะแนนสูง โมเดลจะต้องมีความรู้รอบด้านอย่างกว้างขวางและความสามารถในการใช้เหตุผล
ผลลัพธ์และพัฒนาการ
เมื่อเปิดตัว MMLU ในปี 2020 LLM ส่วนใหญ่ให้ผลลัพธ์สูงกว่าการเดาแบบสุ่มเพียงเล็กน้อย โมเดลที่ทำคะแนนได้ดีที่สุดคือ GPT-3 (175 พันล้านพารามิเตอร์) ซึ่งตอบถูก ~43.9% เพื่อเปรียบเทียบ ผู้เชี่ยวชาญที่เป็นมนุษย์โดยเฉลี่ยทำได้ ~90%[1] ช่องว่างนี้ยืนยันถึงความยากและมาตรฐานสูงของ benchmark ใหม่
เมื่อเวลาผ่านไป MMLU กลายเป็นหนึ่งในการทดสอบที่ได้รับความนิยมมากที่สุดสำหรับ LLM และได้รับสถานะ "มาตรฐานทอง" ในรายงานของบริษัท AI ชั้นนำ[3] ภายในปี 2023-2024 โมเดลล่าสุด เช่น GPT-4, Gemini Ultra จาก Google และ Claude 3.5 จาก Anthropic เข้าใกล้ระดับมนุษย์ โดยทำความแม่นยำได้ ~85-90%[2][3]
ความก้าวหน้าอย่างรวดเร็วนำไปสู่การ "อิ่มตัว" ของ benchmark อย่างค่อยเป็นค่อยไป โดยโมเดลชั้นนำเริ่มได้คะแนนใกล้เคียงกับสูงสุด ซึ่งลดความสามารถของ MMLU ในการแยกแยะความสามารถเชิงปัญญาของโมเดลต่าง ๆ สิ่งนี้กระตุ้นให้ชุมชนพัฒนาการทดสอบใหม่ที่ยากยิ่งขึ้น[3]
ข้อจำกัดและการวิจารณ์
แม้จะได้รับการยอมรับอย่างแพร่หลาย MMLU มีข้อจำกัดที่สำคัญหลายประการ
คุณภาพและความถูกต้องของข้อมูล
ในเดือนมิถุนายน 2024 นักวิจัยได้ทำการวิเคราะห์ด้วยมือจากตัวอย่างคำถาม MMLU จำนวน 5,700 ข้อ และพบข้อผิดพลาดจำนวนมาก[4]
- ประมาณ 6.5% ของคำถาม MMLU ทั้งหมดมีข้อผิดพลาดในการระบุป้ายกำกับหรือการกำหนดสูตร
- ในบางหมวดหมู่ สัดส่วนของแบบทดสอบที่ไม่ถูกต้องสูงมาก ตัวอย่างเช่น ในส่วน "ไวรัสวิทยา" 57% ของแบบทดสอบมีข้อผิดพลาด (คำตอบที่ถูกต้องหลายข้อ การกำหนดสูตรที่ไม่ถูกต้อง หรือคำตอบอ้างอิงที่ระบุผิด)
ซึ่งหมายความว่าแม้แต่โมเดลที่สมบูรณ์แบบก็ไม่สามารถทำคะแนนได้ 100% บน dataset ต้นฉบับ และการปรับปรุงในตัวชี้วัดบางส่วนอาจเกี่ยวข้องกับการที่โมเดลจำข้อผิดพลาดเชิงระบบของชุดข้อมูลได้[4]
วิธีการประเมินและการรั่วไหลของข้อมูล
- การขาดมาตรฐานการทดสอบ นักพัฒนาต่าง ๆ อาจใช้ prompt และโหมด few-shot ที่แตกต่างกัน ซึ่งทำให้การเปรียบเทียบผลลัพธ์ของโมเดลโดยตรงเป็นเรื่องยาก
- การรั่วไหลของข้อมูล (data contamination) มีความเสี่ยงที่คำถามและคำตอบจาก benchmark สาธารณะจะถูกรวมอยู่ใน dataset การฝึก LLM ในกรณีเช่นนั้น โมเดล "รู้" คำตอบที่ถูกต้องอยู่แล้ว ทำให้การประเมินไม่ยุติธรรม[3]
เวอร์ชันดัดแปลงและส่วนขยาย
เพื่อแก้ไขปัญหาของ MMLU ต้นฉบับ จึงได้มีการสร้างรูปแบบต่าง ๆ ขึ้นมาหลายแบบ
- MMLU-Redux เวอร์ชันที่ได้รับการแก้ไขและปรับปรุงของชุดข้อมูล เปิดตัวในเดือนมิถุนายน 2024 ประกอบด้วยคำถาม 3,000 ข้อที่ระบุป้ายกำกับใหม่จาก 30 หมวดหมู่ และออกแบบมาเพื่อการประเมินโมเดลที่เชื่อถือได้มากขึ้นโดยไม่มีความบิดเบือนที่เกิดจากข้อผิดพลาดในข้อมูล[4]
- MMLU-Pro เวอร์ชันขยายและยากขึ้นของการทดสอบ เปิดตัวในช่วงปลายปี 2024 มีคำถามมากกว่า 12,000 ข้อ โดยแต่ละข้อมี 10 ตัวเลือกคำตอบ แทนที่จะเป็นสี่ ซึ่งลดความน่าจะเป็นของการเดาแบบสุ่มลงเหลือ 10% คำถามผ่านการตรวจสอบโดยผู้เชี่ยวชาญและรวมแบบทดสอบใหม่จากแหล่งที่มายากกว่า[5]
- MMMLU (Multilingual MMLU) เวอร์ชันหลายภาษา เปิดตัวโดย OpenAI ในปี 2023 ชุด MMLU ทั้งหมดได้รับการแปลโดยนักแปลมืออาชีพเป็น 14 ภาษา รวมถึงภาษาที่แพร่หลาย (สเปน จีน รัสเซีย) และภาษาที่มีทรัพยากรน้อย (เช่น ยอรูบา) ซึ่งช่วยให้สามารถประเมินและเปรียบเทียบความสามารถของโมเดลในภาษาต่าง ๆ ได้[6]
ลิงก์
- คลังข้อมูลอย่างเป็นทางการของ MMLU บน GitHub
- หน้า MMLU บน Papers with Code พร้อมผลลัพธ์ของโมเดล
เอกสารอ้างอิง
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
หมายเหตุ
- ↑ 1.0 1.1 1.2 1.3 Hendrycks, D. et al. «Measuring Massive Multitask Language Understanding». arXiv:2009.03300, 2021. [1]
- ↑ 2.0 2.1 «MMLU». In Wikipedia. [2]
- ↑ 3.0 3.1 3.2 3.3 «NEW SAVANNA: The AI industry lacks useful ways of measuring performance». New Savanna Blog, 2024. [3]
- ↑ 4.0 4.1 4.2 Gema, A. P. et al. «Are We Done with MMLU?». arXiv:2406.04127, 2024. [4]
- ↑ «MMLU Pro». Vals.ai, 2025. [5]
- ↑ «openai/MMMLU». Hugging Face Datasets. [6]