GSM8K (Grade School Math 8K) (EL)

From Systems analysis Wiki
Jump to navigation Jump to search

GSM8K (Grade School Math 8K) — είναι ένα εταλονικό σύνολο δεδομένων που περιέχει περίπου 8,5 χιλιάδες κειμενικά προβλήματα μαθηματικών σχολικού επιπέδου. Δημιουργήθηκε το 2021 από ερευνητές της OpenAI για την αξιολόγηση και ανάπτυξη των ικανοτήτων μεγάλων γλωσσικών μοντέλων (LLM) σε πολυβηματικές μαθηματικές συλλογιστικές διαδικασίες[1]. Το GSM8K έγινε ένα από τα βασικά benchmark για τη μέτρηση της προόδου στον τομέα της μαθηματικής σκέψης της τεχνητής νοημοσύνης.

Κάθε πρόβλημα στο dataset αποτελεί μια σύντομη κειμενική ιστορία, η επίλυση της οποίας απαιτεί την εκτέλεση 2 έως 8 διαδοχικών αριθμητικών πράξεων (πρόσθεση, αφαίρεση, πολλαπλασιασμός, διαίρεση). Παρά την φαινομενική απλότητά τους, τα προβλήματα απαιτούν βαθιά κατανόηση κειμένου και λογική συλλογιστική, γεγονός που τα καθιστά δύσκολα για πολλά LLM[2].

Βασικά χαρακτηριστικά

Όγκος και δομή

Το dataset GSM8K περιέχει περίπου 8500 προβλήματα, τα οποία χωρίζονται σε δύο μέρη:

  • Σύνολο εκπαίδευσης: ~7500 προβλήματα, προορισμένα για fine-tuning μοντέλων. Κάθε πρόβλημα συνοδεύεται από αναλυτική βηματική λύση.
  • Σύνολο ελέγχου: ~1000 προβλήματα, που χρησιμοποιούνται για ανεξάρτητη αξιολόγηση της απόδοσης των μοντέλων[1].

Δυσκολία και περιεχόμενο

Τα προβλήματα έχουν συνταχθεί σκόπιμα έτσι ώστε να μπορεί να τα λύσει ένας ικανός μαθητής γυμνασίου, αλλά ταυτόχρονα απαιτούν πολυβηματική συλλογιστική. Αυτό επιτρέπει τον έλεγχο όχι τόσο των μαθηματικών γνώσεων του μοντέλου, όσο της ικανότητάς του να αποσυνθέτει το πρόβλημα και να εκτελεί διαδοχικά λογικές πράξεις.

Γλωσσική ποικιλομορφία

Οι διατυπώσεις των προβλημάτων στο GSM8K διακρίνονται για τη μεγάλη ποικιλία στυλ και γλωσσικών κατασκευών. Αυτό γίνεται για να ελεγχθεί η ικανότητα των μοντέλων να κατανοούν τις συνθήκες των προβλημάτων που εκφράζονται με διαφορετικούς τρόπους και να αποφεύγουν την «απομνημόνευση» συγκεκριμένων προτύπων[3].

Ιστορία και εξέλιξη της αξιολόγησης μοντέλων

Πρώιμα μοντέλα και βασικά αποτελέσματα

Στην αρχική εργασία του 2021, οι συγγραφείς έδειξαν ότι ακόμη και τα μεγάλα μοντέλα της εποχής εκείνης, όπως το GPT-3 (175 δισ. παράμετροι), αντιμετώπιζαν σημαντικές δυσκολίες με το dataset. Μετά από fine-tuning και χρήση ενός βοηθητικού μοντέλου-επαληθευτή, η ακρίβεια επίλυσης έφτανε μόλις περίπου 55%[1]. Αυτό το αποτέλεσμα έδειξε ότι ένα μικρό λάθος στην αλυσίδα συλλογισμού μπορεί να οδηγήσει σε εντελώς λανθασμένη απάντηση.

획기적ες μεθοδολογίες: Chain-of-Thought

Η돌파口 στην επίλυση προβλημάτων GSM8K ήρθε με την προσέγγιση «αλυσίδα συλλογισμού» (Chain-of-Thought, CoT). Το 2022, ερευνητές από την Google έδειξαν ότι αν παρακινείται το μοντέλο να αναλύει ρητά τα βήματα της λύσης πριν από την εξαγωγή της απάντησης, η ακρίβεια αυξάνεται σημαντικά. Το μοντέλο PaLM (540 δισ. παράμετροι) με χρήση CoT επίτευξε 58% ακρίβεια[4]. Η εφαρμογή της πιο σύνθετης τεχνικής self-consistency (δημιουργία πολλαπλών παραλλαγών λύσης και επιλογή της πιο συχνής απάντησης) επέτρεψε την αύξηση της ακρίβειας στο 74%[4].

Υπέρβαση του ανθρώπινου επιπέδου

Από το 2023 και μετά, τα νεότερα γενετικά μοντέλα ξεπέρασαν το ανθρώπινο επίπεδο σε αυτό το benchmark.

  • Το GPT-4 της OpenAI σε λειτουργία few-shot CoT (όταν στο prompt παρέχονται μερικά παραδείγματα επιλυμένων προβλημάτων) επίτευξε ακρίβεια περίπου 92%[5], και με πρόσθετες στρατηγικές — έως 97%[6].
  • Το Claude 2 της Anthropic έδειξε αποτέλεσμα 88%, ενώ η νεότερη έκδοση Claude 3 — περίπου 95%[3].

Τέτοιοι υψηλοί δείκτες μαρτυρούν σημαντική πρόοδο στις ικανότητες συλλογισμού των LLM, ωστόσο υποδηλώνουν επίσης ότι το GSM8K καθίσταται «σχεδόν λυμένο» για τα προηγμένα μοντέλα, γεγονός που ενθαρρύνει την ανάπτυξη πιο σύνθετων benchmark, όπως τα MATH και MMLU.

Ρόλος στην εκπαίδευση και ανάπτυξη μοντέλων

Πέρα από την αξιολόγηση, το GSM8K χρησιμοποιείται ενεργά για εκπαίδευση και βελτίωση μοντέλων.

  • Fine-tuning (πρόσθετη εκπαίδευση): Το σύνολο εκπαίδευσης με βηματικές λύσεις αποτελεί πολύτιμο πόρο για το fine-tuning μοντέλων στη μαθηματική λογική.
  • Εκπαίδευση επαληθευτών: Στην αρχική εργασία της OpenAI, μέρος των δεδομένων GSM8K χρησιμοποιήθηκε για την εκπαίδευση ενός ξεχωριστού μοντέλου-επαληθευτή, το οποίο αξιολογούσε την ορθότητα των παραγόμενων λύσεων. Αυτή η προσέγγιση της ξεχωριστής εκπαίδευσης γεννήτορα και κριτικού απέδειξε την αποτελεσματικότητά της[1].
  • Prompt Engineering: Η ύπαρξη μεγάλου αριθμού παραδειγμάτων επέτρεψε στους ερευνητές να αναπτύξουν και να βελτιώσουν τεχνικές prompt, όπως το Chain-of-Thought και το Tree-of-Thought, που εκπαιδεύουν το μοντέλο να συλλογίζεται χωρίς αλλαγή των βαρών του.

Σύνδεσμοι

  • Σελίδα dataset στο Papers With Code
  • Επίσημο αποθετήριο στο GitHub

Βιβλιογραφία

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

Παραπομπές

  1. 1.0 1.1 1.2 1.3 Cobbe, Karl et al. «Training Verifiers to Solve Math Word Problems». arXiv:2110.14168. [1]
  2. «GSM8K Dataset». Papers With Code. [2]
  3. 3.0 3.1 «GSM8K Benchmark». Klu.ai. [3]
  4. 4.0 4.1 Wei, Jason et al. «Language Models Perform Reasoning via Chain of Thought». Google Research Blog. [4]
  5. Yu, L., et al. «Solving Challenging Math Word Problems Using GPT-4». EMNLP 2023. [5]
  6. «Achieving >97% on GSM8K». arXiv:2404.14963. [6]