MMLU Benchmark (TH)

From Systems analysis Wiki
Jump to navigation Jump to search

MMLU (ตัวย่อของ Measuring Massive Multitask Language Understanding) — คือชุดงานอ้างอิง (benchmark) ที่ออกแบบมาเพื่อประเมินความสามารถของโมเดลภาษาขนาดใหญ่ (LLM) ในหลากหลายสาขาวิชา benchmark นี้ได้รับการพัฒนาในปี 2020 โดยทีมนักวิจัยภายใต้การนำของ Dan Hendrycks จาก UC Berkeley และเผยแพร่ในงานประชุม ICLR ในปี 2021[1]

จุดมุ่งหมายของ MMLU คือการทดสอบว่าโมเดลซึมซับความรู้และทักษะที่หลากหลายที่ได้มาในขั้นตอน pre-training ได้มากเพียงใด โดยทดสอบในโหมด zero-shot หรือ few-shot โดยไม่ต้องมีการ fine-tuning เพิ่มเติม MMLU ถูกสร้างขึ้นเป็นทางเลือกที่ยากกว่าการทดสอบที่มีอยู่ก่อนหน้านี้ (เช่น GLUE และ SuperGLUE) ซึ่งหลายโมเดลทำได้ถึงระดับมนุษย์ภายในปี 2020 แล้ว[2]

คำอธิบายและเนื้อหา

MMUL ประกอบด้วย คำถาม 15,908 ข้อ แบบปรนัย ครอบคลุม 57 สาขาวิชาที่แตกต่างกัน หัวข้อของแบบทดสอบได้แก่:

  • วิชาในกลุ่ม STEM (คณิตศาสตร์ ฟิสิกส์ ชีววิทยา วิทยาการคอมพิวเตอร์)
  • มนุษยศาสตร์และสังคมศาสตร์ (ประวัติศาสตร์ วรรณกรรม กฎหมาย การบริหาร)
  • สาขาประยุกต์และวิชาชีพ (การแพทย์ นิติศาสตร์ ธุรกิจ)[1]

ระดับความยากครอบคลุมตั้งแต่ระดับประถมศึกษาไปจนถึงระดับวิชาชีพขั้นสูง คำถามอ้างอิงจากข้อสอบจริงสำหรับโรงเรียน มหาวิทยาลัย และการสอบวิชาชีพ เช่น GRE และ USMLE[1] รูปแบบของแบบทดสอบคือคำตอบสี่ตัวเลือกสำหรับแต่ละคำถาม ซึ่งหมายความว่าหากเลือกแบบสุ่มจะมีความแม่นยำที่ 25% เพื่อให้ได้คะแนนสูง โมเดลจะต้องมีความรู้รอบด้านอย่างกว้างขวางและความสามารถในการใช้เหตุผล

ผลลัพธ์และพัฒนาการ

เมื่อเปิดตัว MMLU ในปี 2020 LLM ส่วนใหญ่ให้ผลลัพธ์สูงกว่าการเดาแบบสุ่มเพียงเล็กน้อย โมเดลที่ทำคะแนนได้ดีที่สุดคือ GPT-3 (175 พันล้านพารามิเตอร์) ซึ่งตอบถูก ~43.9% เพื่อเปรียบเทียบ ผู้เชี่ยวชาญที่เป็นมนุษย์โดยเฉลี่ยทำได้ ~90%[1] ช่องว่างนี้ยืนยันถึงความยากและมาตรฐานสูงของ benchmark ใหม่

เมื่อเวลาผ่านไป MMLU กลายเป็นหนึ่งในการทดสอบที่ได้รับความนิยมมากที่สุดสำหรับ LLM และได้รับสถานะ "มาตรฐานทอง" ในรายงานของบริษัท AI ชั้นนำ[3] ภายในปี 2023-2024 โมเดลล่าสุด เช่น GPT-4, Gemini Ultra จาก Google และ Claude 3.5 จาก Anthropic เข้าใกล้ระดับมนุษย์ โดยทำความแม่นยำได้ ~85-90%[2][3]

ความก้าวหน้าอย่างรวดเร็วนำไปสู่การ "อิ่มตัว" ของ benchmark อย่างค่อยเป็นค่อยไป โดยโมเดลชั้นนำเริ่มได้คะแนนใกล้เคียงกับสูงสุด ซึ่งลดความสามารถของ MMLU ในการแยกแยะความสามารถเชิงปัญญาของโมเดลต่าง ๆ สิ่งนี้กระตุ้นให้ชุมชนพัฒนาการทดสอบใหม่ที่ยากยิ่งขึ้น[3]

ข้อจำกัดและการวิจารณ์

แม้จะได้รับการยอมรับอย่างแพร่หลาย MMLU มีข้อจำกัดที่สำคัญหลายประการ

คุณภาพและความถูกต้องของข้อมูล

ในเดือนมิถุนายน 2024 นักวิจัยได้ทำการวิเคราะห์ด้วยมือจากตัวอย่างคำถาม MMLU จำนวน 5,700 ข้อ และพบข้อผิดพลาดจำนวนมาก[4]

  • ประมาณ 6.5% ของคำถาม MMLU ทั้งหมดมีข้อผิดพลาดในการระบุป้ายกำกับหรือการกำหนดสูตร
  • ในบางหมวดหมู่ สัดส่วนของแบบทดสอบที่ไม่ถูกต้องสูงมาก ตัวอย่างเช่น ในส่วน "ไวรัสวิทยา" 57% ของแบบทดสอบมีข้อผิดพลาด (คำตอบที่ถูกต้องหลายข้อ การกำหนดสูตรที่ไม่ถูกต้อง หรือคำตอบอ้างอิงที่ระบุผิด)

ซึ่งหมายความว่าแม้แต่โมเดลที่สมบูรณ์แบบก็ไม่สามารถทำคะแนนได้ 100% บน dataset ต้นฉบับ และการปรับปรุงในตัวชี้วัดบางส่วนอาจเกี่ยวข้องกับการที่โมเดลจำข้อผิดพลาดเชิงระบบของชุดข้อมูลได้[4]

วิธีการประเมินและการรั่วไหลของข้อมูล

  • การขาดมาตรฐานการทดสอบ นักพัฒนาต่าง ๆ อาจใช้ prompt และโหมด few-shot ที่แตกต่างกัน ซึ่งทำให้การเปรียบเทียบผลลัพธ์ของโมเดลโดยตรงเป็นเรื่องยาก
  • การรั่วไหลของข้อมูล (data contamination) มีความเสี่ยงที่คำถามและคำตอบจาก benchmark สาธารณะจะถูกรวมอยู่ใน dataset การฝึก LLM ในกรณีเช่นนั้น โมเดล "รู้" คำตอบที่ถูกต้องอยู่แล้ว ทำให้การประเมินไม่ยุติธรรม[3]

เวอร์ชันดัดแปลงและส่วนขยาย

เพื่อแก้ไขปัญหาของ MMLU ต้นฉบับ จึงได้มีการสร้างรูปแบบต่าง ๆ ขึ้นมาหลายแบบ

  • MMLU-Redux เวอร์ชันที่ได้รับการแก้ไขและปรับปรุงของชุดข้อมูล เปิดตัวในเดือนมิถุนายน 2024 ประกอบด้วยคำถาม 3,000 ข้อที่ระบุป้ายกำกับใหม่จาก 30 หมวดหมู่ และออกแบบมาเพื่อการประเมินโมเดลที่เชื่อถือได้มากขึ้นโดยไม่มีความบิดเบือนที่เกิดจากข้อผิดพลาดในข้อมูล[4]
  • MMLU-Pro เวอร์ชันขยายและยากขึ้นของการทดสอบ เปิดตัวในช่วงปลายปี 2024 มีคำถามมากกว่า 12,000 ข้อ โดยแต่ละข้อมี 10 ตัวเลือกคำตอบ แทนที่จะเป็นสี่ ซึ่งลดความน่าจะเป็นของการเดาแบบสุ่มลงเหลือ 10% คำถามผ่านการตรวจสอบโดยผู้เชี่ยวชาญและรวมแบบทดสอบใหม่จากแหล่งที่มายากกว่า[5]
  • MMMLU (Multilingual MMLU) เวอร์ชันหลายภาษา เปิดตัวโดย OpenAI ในปี 2023 ชุด MMLU ทั้งหมดได้รับการแปลโดยนักแปลมืออาชีพเป็น 14 ภาษา รวมถึงภาษาที่แพร่หลาย (สเปน จีน รัสเซีย) และภาษาที่มีทรัพยากรน้อย (เช่น ยอรูบา) ซึ่งช่วยให้สามารถประเมินและเปรียบเทียบความสามารถของโมเดลในภาษาต่าง ๆ ได้[6]

ลิงก์

  • คลังข้อมูลอย่างเป็นทางการของ MMLU บน GitHub
  • หน้า MMLU บน Papers with Code พร้อมผลลัพธ์ของโมเดล

เอกสารอ้างอิง

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.


หมายเหตุ

  1. 1.0 1.1 1.2 1.3 Hendrycks, D. et al. «Measuring Massive Multitask Language Understanding». arXiv:2009.03300, 2021. [1]
  2. 2.0 2.1 «MMLU». In Wikipedia. [2]
  3. 3.0 3.1 3.2 3.3 «NEW SAVANNA: The AI industry lacks useful ways of measuring performance». New Savanna Blog, 2024. [3]
  4. 4.0 4.1 4.2 Gema, A. P. et al. «Are We Done with MMLU?». arXiv:2406.04127, 2024. [4]
  5. «MMLU Pro». Vals.ai, 2025. [5]
  6. «openai/MMMLU». Hugging Face Datasets. [6]