MMLU Benchmark (EL)

From Systems analysis Wiki
Jump to navigation Jump to search

MMLU (αρκτικόλεξο από το Measuring Massive Multitask Language Understanding) — είναι ένα εталонный σύνολο εργασιών (benchmark), σχεδιασμένο για την αξιολόγηση των ικανοτήτων μεγάλων γλωσσικών μοντέλων (LLM) σε ένα ευρύ φάσμα θεματικών περιοχών. Το benchmark αναπτύχθηκε το 2020 από μια ομάδα ερευνητών υπό την καθοδήγηση του Ντάν Χέντρικς (Dan Hendrycks) από το UC Berkeley και δημοσιεύθηκε στο συνέδριο ICLR το 2021[1].

Σκοπός του MMLU είναι να ελέγξει σε ποιον βαθμό το μοντέλο αφομοιώνει ποικίλες γνώσεις και δεξιότητες που αποκτήθηκαν κατά τη φάση της προεκπαίδευσης, μέσω δοκιμών σε λειτουργία zero-shot ή few-shot χωρίς πρόσθετο fine-tuning. Το MMLU δημιουργήθηκε ως μια πιο απαιτητική εναλλακτική λύση σε προγενέστερα τεστ (όπως τα GLUE και SuperGLUE), στα οποία πολλά μοντέλα είχαν ήδη φτάσει στο ανθρώπινο επίπεδο μέχρι το 2020[2].

Περιγραφή και περιεχόμενο

Το MMLU αποτελείται από 15.908 ερωτήσεις πολλαπλής επιλογής, που καλύπτουν 57 διαφορετικές επιστημονικές κλάδους. Η θεματολογία των ερωτήσεων περιλαμβάνει:

  • Μαθήματα STEM (μαθηματικά, φυσική, βιολογία, πληροφορική).
  • Ανθρωπιστικές και κοινωνικές επιστήμες (ιστορία, λογοτεχνία, δίκαιο, διοίκηση).
  • Εφαρμοσμένες και επαγγελματικές περιοχές (ιατρική, νομική, επιχειρήσεις)[1].

Το εύρος δυσκολίας κυμαίνεται από επίπεδο δημοτικού σχολείου έως προχωρημένο επαγγελματικό επίπεδο. Οι ερωτήσεις βασίζονται σε πραγματικό εξεταστικό υλικό για σχολεία, πανεπιστήμια και επαγγελματικές εξετάσεις, όπως οι GRE και USMLE[1]. Η μορφή των ερωτήσεων — τέσσερις επιλογές απάντησης για κάθε ερώτηση — σημαίνει ότι η τυχαία επιλογή αποδίδει ακρίβεια 25%. Για να επιτύχει υψηλό αποτέλεσμα, το μοντέλο πρέπει να διαθέτει εκτεταμένες εγκυκλοπαιδικές γνώσεις και ικανότητα συλλογισμού.

Αποτελέσματα και εξέλιξη

Κατά την κυκλοφορία του MMLU το 2020, τα περισσότερα LLM επιτύγχαναν αποτελέσματα μόλις ελαφρώς πάνω από την τυχαία εικασία. Το καλύτερο αποτέλεσμα επέδειξε το μοντέλο GPT-3 (175 δισεκατομμύρια παράμετροι), σκοράροντας ~43,9% σωστών απαντήσεων. Για σύγκριση, ένας ανθρώπινος εμπειρογνώμονας έφτανε κατά μέσο όρο το ~90%[1]. Αυτό το χάσμα επιβεβαίωσε τη δυσκολία και τον υψηλό πήχη του νέου benchmark.

Με την πάροδο του χρόνου, το MMLU έγινε ένα από τα πιο δημοφιλή τεστ για LLM, αποκτώντας καθεστώς «χρυσού προτύπου» στις αναφορές κορυφαίων εταιρειών AI[3]. Έως το 2023-2024, τα νεότερα μοντέλα, όπως το GPT-4, το Gemini Ultra της Google και το Claude 3.5 της Anthropic, πλησίασαν το ανθρώπινο επίπεδο, επιτυγχάνοντας ~85-90% ακρίβεια[2][3].

Η ταχεία πρόοδος οδήγησε σε σταδιακό «κορεσμό» του benchmark: τα κορυφαία μοντέλα άρχισαν να επιτυγχάνουν βαθμολογίες κοντά στο μέγιστο, γεγονός που μείωσε την ικανότητα του MMLU να διαχωρίζει τις διανοητικές δυνατότητές τους. Αυτό ώθησε την κοινότητα στην ανάπτυξη νέων, πιο δύσκολων τεστ[3].

Περιορισμοί και κριτική

Παρά την ευρεία διάδοσή του, το MMLU έχει ορισμένους ουσιαστικούς περιορισμούς.

Ποιότητα και ορθότητα των δεδομένων

Τον Ιούνιο του 2024, ερευνητές πραγματοποίησαν χειροκίνητη ανάλυση ενός δείγματος 5.700 ερωτήσεων του MMLU και εντόπισαν σημαντικό αριθμό σφαλμάτων[4].

  • Περίπου 6,5% όλων των ερωτήσεων του MMLU περιέχουν σφάλματα στην επισήμανση ή στη διατύπωση.
  • Σε ορισμένες κατηγορίες, το ποσοστό εσφαλμένων ερωτήσεων είναι πολύ υψηλό. Για παράδειγμα, στην ενότητα «Ιολογία» το 57% των ερωτήσεων περιείχε σφάλματα (πολλαπλές σωστές απαντήσεις, εσφαλμένες διατυπώσεις ή λανθασμένα καταγεγραμμένη απάντηση αναφοράς).

Αυτό σημαίνει ότι ακόμη και ένα τέλειο μοντέλο δεν μπορεί να σκοράρει 100% στο αρχικό dataset, ενώ μέρος των βελτιώσεων στις μετρικές μπορεί να οφείλεται στην απομνημόνευση συστηματικών σφαλμάτων του συνόλου από το μοντέλο[4].

Μεθοδολογία αξιολόγησης και διαρροή δεδομένων

  • Απουσία προτύπου δοκιμής. Διαφορετικοί προγραμματιστές μπορούν να χρησιμοποιούν διαφορετικά prompts και λειτουργίες few-shot, γεγονός που δυσχεραίνει την άμεση σύγκριση αποτελεσμάτων μοντέλων.
  • Διαρροή δεδομένων (data contamination). Υπάρχει κίνδυνος να συμπεριληφθούν ερωτήσεις και απαντήσεις από δημόσια benchmarks στα σύνολα εκπαίδευσης LLM. Στην περίπτωση αυτή, το μοντέλο ουσιαστικά «γνωρίζει» τις σωστές απαντήσεις, καθιστώντας την αξιολόγηση αναξιόπιστη[3].

Παράγωγες εκδόσεις και επεκτάσεις

Για την αντιμετώπιση των προβλημάτων του αρχικού MMLU δημιουργήθηκαν αρκετές παραλλαγές του.

  • MMLU-Redux. Διορθωμένη και βελτιωμένη έκδοση του συνόλου, που παρουσιάστηκε τον Ιούνιο του 2024. Περιλαμβάνει 3.000 επαναλαβελαρισμένες ερωτήσεις από 30 κατηγορίες και προορίζεται για πιο αξιόπιστη αξιολόγηση μοντέλων χωρίς στρεβλώσεις που προκαλούνται από σφάλματα στα δεδομένα[4].
  • MMLU-Pro. Διευρυμένη και εντατικοποιημένη παραλλαγή του τεστ, που παρουσιάστηκε στα τέλη του 2024. Περιέχει πάνω από 12.000 ερωτήσεις, με 10 επιλογές απάντησης για κάθε ερώτηση αντί για τέσσερις. Αυτό μειώνει την πιθανότητα τυχαίας εικασίας στο 10%. Οι ερωτήσεις έχουν ελεγχθεί από εμπειρογνώμονες και περιλαμβάνουν νέες ερωτήσεις από πιο σύνθετες πηγές[5].
  • MMMLU (Multilingual MMLU). Πολύγλωσση έκδοση, που κυκλοφόρησε από την OpenAI το 2023. Ολόκληρο το σύνολο MMLU μεταφράστηκε από επαγγελματίες μεταφραστές σε 14 γλώσσες, συμπεριλαμβανομένων τόσο διαδεδομένων (ισπανικά, κινεζικά, ρωσικά) όσο και γλωσσών χαμηλών πόρων (π.χ. Yoruba). Αυτό επιτρέπει την αξιολόγηση και τη σύγκριση των δυνατοτήτων των μοντέλων σε διαφορετικές γλώσσες[6].

Σύνδεσμοι

  • Επίσημο αποθετήριο MMLU στο GitHub
  • Σελίδα MMLU στο Papers with Code με αποτελέσματα μοντέλων

Βιβλιογραφία

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.


Παραπομπές

  1. 1.0 1.1 1.2 1.3 Hendrycks, D. et al. «Measuring Massive Multitask Language Understanding». arXiv:2009.03300, 2021. [1]
  2. 2.0 2.1 «MMLU». In Wikipedia. [2]
  3. 3.0 3.1 3.2 3.3 «NEW SAVANNA: The AI industry lacks useful ways of measuring performance». New Savanna Blog, 2024. [3]
  4. 4.0 4.1 4.2 Gema, A. P. et al. «Are We Done with MMLU?». arXiv:2406.04127, 2024. [4]
  5. «MMLU Pro». Vals.ai, 2025. [5]
  6. «openai/MMMLU». Hugging Face Datasets. [6]