MMLU Benchmark (TR)

From Systems analysis Wiki
Jump to navigation Jump to search

MMLU (Measuring Massive Multitask Language Understanding kısaltması) — büyük dil modellerinin (LLM) geniş bir konu yelpazesindeki yeteneklerini değerlendirmek amacıyla tasarlanmış bir etalon görev kümesidir (benchmark). Benchmark, 2020 yılında UC Berkeley'den Dan Hendrycks liderliğindeki bir araştırmacı ekibi tarafından geliştirilmiş ve 2021 yılında ICLR konferansında yayımlanmıştır[1].

MMLU'nun amacı, bir modelin ön eğitim aşamasında edindiği çeşitli bilgi ve becerileri ek ince ayar yapmaksızın sıfır örnek ya da birkaç örnek (zero/few-shot) test moduyla ne ölçüde özümsediğini sınamaktır. MMLU, pek çok modelin 2020 yılına kadar insan düzeyine ulaştığı önceki testlere (GLUE ve SuperGLUE gibi) kıyasla daha zorlu bir alternatif olarak oluşturulmuştur[2].

Açıklama ve İçerik

MMLU, 57 farklı disiplini kapsayan 15 908 çoktan seçmeli sorudan oluşmaktadır. Görevlerin konuları şunlardır:

  • STEM alanları (matematik, fizik, biyoloji, bilgisayar bilimi).
  • Beşeri ve sosyal bilimler (tarih, edebiyat, hukuk, yönetim).
  • Uygulamalı ve mesleki alanlar (tıp, hukuk, iş dünyası)[1].

Zorluk düzeyi ilkokul seviyesinden ileri profesyonel seviyeye kadar uzanmaktadır. Sorular; GRE ve USMLE gibi okullar, üniversiteler ve mesleki sınavlar için kullanılan gerçek sınav materyallerine dayanmaktadır[1]. Görev formatı, her soru için dört yanıt seçeneği sunmaktadır; bu da rastgele seçim yapıldığında doğruluk oranının %25 olduğu anlamına gelmektedir. Yüksek puan elde etmek için modelin geniş ansiklopedik bilgiye ve akıl yürütme becerisine sahip olması gerekmektedir.

Sonuçlar ve Gelişim

MMLU'nun 2020 yılında yayımlanması sırasında çoğu LLM, sonuçlarda yalnızca rastgele tahmin düzeyinin biraz üzerinde performans gösteriyordu. En iyi sonucu GPT-3 modeli (175 milyar parametre) ~%43,9 doğruluk oranıyla elde etti. Karşılaştırma yapmak gerekirse, uzman bir insan ortalama ~%90 oranına ulaşıyordu[1]. Bu fark, yeni benchmark'ın zorluğunu ve yüksek standardını doğruladı.

Zamanla MMLU, LLM'ler için en popüler testlerden biri hâline geldi ve önde gelen AI şirketlerinin raporlarında "altın standart" statüsü kazandı[3]. 2023-2024 yıllarına gelindiğinde GPT-4, Google'ın Gemini Ultra ve Anthropic'in Claude 3.5 gibi en yeni modeller, ~%85-90 doğruluk oranına ulaşarak insan düzeyine yaklaştı[2][3].

Hızlı ilerleme, benchmark'ın kademeli olarak "doymasına" yol açtı: önde gelen modeller maksimuma yakın puanlar almaya başladı; bu durum MMLU'nun modeller arasındaki entelektüel kapasiteyi ayırt etme gücünü azalttı. Bu gelişme, topluluğu daha yeni ve daha zorlu testler geliştirmeye yöneltti[3].

Sınırlılıklar ve Eleştiriler

Yaygın kullanımına karşın MMLU'nun bir dizi önemli sınırlılığı bulunmaktadır.

Veri Kalitesi ve Doğruluğu

Haziran 2024'te araştırmacılar, MMLU'nun 5700 sorusundan oluşan bir örneklem üzerinde elle analiz gerçekleştirdi ve önemli miktarda hata tespit etti[4].

  • MMLU sorularının yaklaşık %6,5'i etiketleme veya ifade bakımından hata içermektedir.
  • Belirli kategorilerde hatalı görevlerin oranı oldukça yüksektir. Örneğin "Viroloji" bölümündeki soruların %57'si hata içermektedir (birden fazla doğru yanıt, hatalı ifadeler veya yanlış gösterilmiş referans yanıt).

Bu durum, mükemmel bir modelin bile orijinal dataset üzerinde %100 puan alamayacağı ve metrik iyileştirmelerinin bir bölümünün modelin kümedeki sistematik hataları ezberlemesiyle ilgili olabileceği anlamına gelmektedir[4].

Değerlendirme Yöntemi ve Veri Sızıntısı

  • Test standardının yokluğu. Farklı geliştiriciler farklı prompt'lar ve few-shot modları kullanabilmekte; bu durum model sonuçlarının doğrudan karşılaştırılmasını güçleştirmektedir.
  • Veri sızıntısı (data contamination). Kamuya açık benchmark'lardaki soru ve yanıtların LLM'lerin eğitim kümelerine karışma riski mevcuttur. Böyle bir durumda model aslında doğru yanıtları "biliyor" olmakta; bu da değerlendirmeyi güvenilmez kılmaktadır[3].

Türev Sürümler ve Genişletmeler

Orijinal MMLU'nun sorunlarını gidermek amacıyla çeşitli varyantları oluşturulmuştur.

  • MMLU-Redux. Haziran 2024'te sunulan düzeltilmiş ve iyileştirilmiş küme sürümüdür. 30 kategoriden 3000 yeniden etiketlenmiş soruyu kapsamakta ve veri hatalarının neden olduğu çarpıklıklar olmaksızın modellerin daha güvenilir biçimde değerlendirilmesi için tasarlanmıştır[4].
  • MMLU-Pro. 2024'ün sonunda sunulan genişletilmiş ve zorlaştırılmış test varyantıdır. Dörtten fazla 10 yanıt seçeneği içeren 12 000'den fazla sorudan oluşmaktadır. Bu, rastgele tahmin olasılığını %10'a düşürmektedir. Sorular uzmanlar tarafından doğrulanmış olup daha zorlu kaynaklardan alınan yeni görevleri kapsamaktadır[5].
  • MMMLU (Multilingual MMLU). OpenAI tarafından 2023 yılında yayımlanan çok dilli sürümdür. Tüm MMLU kümesi, yaygın diller (İspanyolca, Çince, Rusça) ile düşük kaynaklı diller (örneğin Yoruba) dahil olmak üzere 14 dile profesyonel çevirmenler tarafından çevrilmiştir. Bu sayede modellerin farklı dillerdeki yeteneklerini değerlendirmek ve karşılaştırmak mümkün olmaktadır[6].

Dış bağlantılar

  • GitHub'daki resmi MMLU deposu
  • Papers with Code'daki model sonuçlarını içeren MMLU sayfası

Kaynakça

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

Notlar

  1. 1.0 1.1 1.2 1.3 Hendrycks, D. et al. «Measuring Massive Multitask Language Understanding». arXiv:2009.03300, 2021. [1]
  2. 2.0 2.1 «MMLU». In Wikipedia. [2]
  3. 3.0 3.1 3.2 3.3 «NEW SAVANNA: The AI industry lacks useful ways of measuring performance». New Savanna Blog, 2024. [3]
  4. 4.0 4.1 4.2 Gema, A. P. et al. «Are We Done with MMLU?». arXiv:2406.04127, 2024. [4]
  5. «MMLU Pro». Vals.ai, 2025. [5]
  6. «openai/MMMLU». Hugging Face Datasets. [6]