MATH Benchmark (EL)
MATH (ακρωνύμιο από τα αγγλικά Mathematics Aptitude Test of Heuristics) — είναι ένα μεγάλο dataset και benchmark για την αξιολόγηση των μαθηματικών ικανοτήτων και δεξιοτήτων επίλυσης προβλημάτων σε μεγάλα γλωσσικά μοντέλα (LLM). Το dataset παρουσιάστηκε το 2021 από μια ομάδα ερευνητών υπό την ηγεσία του Ντέιν Χέντρικς (Dan Hendrycks) και περιέχει 12.500 προβλήματα, ληφθέντα από αμερικανικούς μαθηματικούς διαγωνισμούς για μαθητές λυκείου, όπως οι AMC 10, AMC 12 και AIME[1].
Τα προβλήματα καλύπτουν ένα ευρύ φάσμα τομέων (άλγεβρα, γεωμετρία, θεωρία αριθμών, συνδυαστική κ.ά.) και διαθέτουν διαβάθμιση ανά επίπεδο δυσκολίας. Σε αντίθεση με τα τυπικά σχολικά προβλήματα, απαιτούν συχνά δημιουργική προσέγγιση και ευρετικές μεθόδους, και όχι άμεση εφαρμογή τύπων. Κάθε άσκηση συνοδεύεται από πλήρη βήμα-προς-βήμα λύση και τελική απάντηση, γεγονός που καθιστά το MATH πολύτιμο πόρο τόσο για την εκπαίδευση όσο και για τη δοκιμή μοντέλων[2].
Δομή και χαρακτηριστικά του dataset
Το benchmark MATH διαθέτει μια σειρά από βασικά χαρακτηριστικά που το καθιστούν δύσκολο και αξιόπιστο εργαλείο αξιολόγησης.
Μορφή προβλημάτων
Όλες οι ασκήσεις και οι λύσεις παρουσιάζονται σε μορφή LaTeX, ενώ για την περιγραφή γεωμετρικών σχεδίων χρησιμοποιείται η γλώσσα Asymptote. Αυτό επιτρέπει την παρουσίαση όλων των δεδομένων, συμπεριλαμβανομένων των εικόνων, σε κειμενική μορφή προσβάσιμη για επεξεργασία από γλωσσικό μοντέλο. Σε κάθε πρόβλημα έχουν εκχωρηθεί ετικέτες ανά επτά τομείς μαθηματικών και ανά πέντε επίπεδα δυσκολίας[1].
Αυτόματη αξιολόγηση
Οι τελικές απαντήσεις στο dataset περικλείονται σε ειδική μορφή `\boxed{...}` και έχουν αναχθεί σε αυστηρό πρότυπο (π.χ. κλάσματα σε απλούστατη μορφή). Αυτό επιτρέπει την αυτόματη αξιολόγηση μοντέλων με βάση τη μετρική ακριβούς αντιστοίχισης (exact match), γεγονός που αποκλείει την υποκειμενικότητα και την ασάφεια κατά τον έλεγχο των αποτελεσμάτων. Το μοντέλο πρέπει να παράγει αυστηρά σωστή απάντηση για να θεωρείται λυμένο το πρόβλημα[1].
Δυσκολία προβλημάτων και επίπεδο ανθρώπων
Το MATH είναι ένα από τα πιο δύσκολα μαθηματικά τεστ για την ΤΝ. Τα προβλήματα παρουσιάζουν δυσκολία ακόμα και για ανθρώπους με ισχυρή μαθηματική κατάρτιση.
- Κατά τη μελέτη του dataset, μια ομάδα φοιτητών πανεπιστημίου δοκιμάστηκε με αποτελέσματα από ~40% έως ~90% για νικητές ολυμπιάδων.
- Ακόμα και κάτοχος τριών χρυσών μεταλλίων στη Διεθνή Μαθηματική Ολυμπιάδα δεν κατάφερε να λύσει όλες τις ασκήσεις χωρίς λάθη[1].
Αυτό δείχνει ότι για την επιτυχή επίλυση προβλημάτων MATH απαιτείται όχι μόνο γνώση, αλλά και υψηλή ακρίβεια και μαθηματική διαίσθηση.
Αποτελέσματα μοντέλων και πρόοδος στην επίλυση
Αρχικά αποτελέσματα (2021)
Κατά την εκκίνηση του benchmark το 2021, ακόμα και τα μεγαλύτερα μοντέλα έδειχναν εξαιρετικά χαμηλά αποτελέσματα.
- Το μοντέλο GPT-3 (175 δισ. παράμετροι) κατάφερε να λύσει σωστά μόλις περίπου 5% των προβλημάτων.
- Οι fine-tuned εκδόσεις του GPT-2 έδειχναν ακρίβεια 6-7%[1].
Οι συγγραφείς κατέληξαν στο συμπέρασμα ότι η απλή αύξηση της κλίμακας των μοντέλων σχεδόν δεν επηρεάζει την απόδοση και ότι για πρόοδο απαιτούνται νέες αλγοριθμικές προσεγγίσεις[3].
돌破 Minerva και GPT-4 (2022–2023)
Η돌파 έγινε με την εμφάνιση μοντέλων ειδικά εκπαιδευμένων σε επιστημονικά κείμενα και νέων μεθόδων επίλυσης.
- Το 2022 το μοντέλο Google Minerva επέτυχε ακρίβεια περίπου 50%, αποδεικνύοντας ότι ο συνδυασμός κλίμακας και εξειδικευμένης εκπαίδευσης μπορεί να αυξήσει δραματικά την ποιότητα επίλυσης[3].
- Το 2023 το GPT-4 της OpenAI παρουσίασε νέο άλμα. Χρησιμοποιώντας εργαλεία, το μοντέλο κατάφερε να βελτιώσει σημαντικά τα αποτελέσματά του:
- Με Code Interpreter (εκτέλεση κώδικα για έλεγχο υπολογισμών) η ακρίβεια έφτασε σχεδόν 70%.
- Με τη μέθοδο code-based self-verification (αυτο-επαλήθευση και διόρθωση σφαλμάτων με χρήση κώδικα) καταγράφηκε ρεκόρ 84,3% λυμένων προβλημάτων[4].
Αυτό το αποτέλεσμα είναι συγκρίσιμο με το επίπεδο ισχυρών ανθρώπινων συμμετεχόντων και πλησιάζει το κατώφλι εμπειρογνώμονα.
Σημασία και επίδραση
Το benchmark MATH διαδραμάτισε καθοριστικό ρόλο στην ανάπτυξη των μαθηματικών ικανοτήτων των LLM. Απέδειξε με σαφήνεια ότι για την επίλυση σύνθετων προβλημάτων δεν αρκεί η απλή κλιμάκωση, αλλά απαιτούνται νέες προσεγγίσεις, όπως:
- Εκπαίδευση σε πλήρεις βήμα-προς-βήμα λύσεις.
- Εξειδικευμένη εκπαίδευση σε επιστημονικά δεδομένα.
- Χρήση εξωτερικών εργαλείων για υπολογισμούς και επαλήθευση.
Παρά την σημαντική πρόοδο, το MATH παραμένει σημαντική και δύσκολη δοκιμασία. Συνεχίζει να λειτουργεί ως δείκτης του επιπέδου μαθηματικής σκέψης των LLM και να στιμουλάρει την έρευνα στον τομέα της αξιόπιστης επίλυσης προβλημάτων που απαιτούν πολυβηματική συλλογιστική[1].
Σύνδεσμοι
- Επίσημο αποθετήριο του dataset MATH στο GitHub
- Σελίδα του dataset στο Papers With Code
Βιβλιογραφία
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
Παραπομπές
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 Hendrycks, D., et al. «Measuring Mathematical Problem Solving With the MATH Dataset». arXiv:2103.03874. [1]
- ↑ «AI Benchmarks and Datasets for LLM Evaluation». arXiv:2412.01020. [2]
- ↑ 3.0 3.1 «Language models surprised us». Planned-Obsolescence.org. [3]
- ↑ «GPT-4 Code Interpreter smashes maths benchmarks, hits new SOTA». The Decoder. [4]