WinoGrande Benchmark (EL)

From Systems analysis Wiki
Jump to navigation Jump to search

WinoGrande — είναι ένα μεγάλης κλίμακας σύνολο δεδομένων αναφοράς, σχεδιασμένο για την αξιολόγηση της ικανότητας συστημάτων τεχνητής νοημοσύνης να συλλογίζονται με βάση την κοινή λογική. Περιέχει περίπου 44.000 εργασίες βασισμένες στη μορφή του Winograd Schema Challenge (WSC), αλλά σημαντικά διευρυμένες και εμπλουτισμένες με τη μέθοδο «adversarial» φιλτραρίσματος για την εξάλειψη στατιστικών υποδείξεων[1].

Το dataset αναπτύχθηκε το 2019 από μια ομάδα ερευνητών του Allen Institute for AI και του Πανεπιστημίου της Ουάσιγκτον. Κάθε εργασία αποτελείται από μια πρόταση με κενό, το οποίο πρέπει να συμπληρωθεί με έναν από δύο επιλογείς, επιλέγοντας τον σωστό βάσει του πλαισίου και της κατανόησης της κατάστασης. Το WinoGrande έχει καταστεί ένα από τα βασικά benchmarks στον τομέα της επεξεργασίας φυσικής γλώσσας (NLP)[2].

Προϋποθέσεις δημιουργίας: η παρωχημένη WSC

Το αρχικό Winograd Schema Challenge (WSC), που προτάθηκε το 2011, περιείχε μόλις 273 εργασίες και θεωρούνταν για μεγάλο χρονικό διάστημα αξιόπιστη δοκιμασία κοινής λογικής. Οι εργασίες του ήταν κατασκευασμένες έτσι ώστε να απαιτούν κατανόηση του κόσμου και όχι απλή αντιστοίχιση λέξεων[3].

Ωστόσο, γύρω στα 2018–2019, με την εμφάνιση μεγάλων γλωσσικών μοντέλων βασισμένων στην αρχιτεκτονική transformer, όπως το BERT, η κατάσταση άλλαξε. Τα μοντέλα έμαθαν να «σπάνε» τη δοκιμασία, επιτυγχάνοντας ακρίβεια περίπου 90% μέσω εκμετάλλευσης μη εκούσιων στατιστικών προτύπων (artifacts) στα δεδομένα, και όχι μέσω πραγματικής κατανόησης[4]. Το WSC έπαψε να αποτελεί αξιόπιστο δείκτη, γεγονός που οδήγησε στην ανάγκη δημιουργίας ενός νέου, πιο σύνθετου και μεγάλης κλίμακας benchmark — του WinoGrande.

Ανάπτυξη και μέθοδος adversarial filtering

Η δημιουργία του WinoGrande πραγματοποιήθηκε σε δύο βασικά στάδια: μαζική παραγωγή εργασιών και στη συνέχεια φιλτράρισμά τους.

Crowdsourcing

Στο πρώτο στάδιο, μέσω της πλατφόρμας Amazon Mechanical Turk, συγκεντρώθηκε μια μεγάλη βάση με περισσότερες από 47.000 προτάσεις. Οι εργαζόμενοι του crowdsourcing δημιουργούσαν ζεύγη προτάσεων σύμφωνα με το σχήμα Winograd, γεγονός που εξασφάλισε γλωσσική ποικιλομορφία και «θόρυβο» χαρακτηριστικό της φυσικής ομιλίας, σε αντίθεση με εργασίες που συντάσσονταν από μικρή ομάδα ειδικών[1].

Αλγόριθμος AfLite

Η βασική καινοτομία του WinoGrande ήταν ο αλγόριθμος AfLite (Adversarial Filtering Lite). Αυτή η μέθοδος αναπτύχθηκε για την αυτόματη απόρριψη εργασιών που μπορούν να επιλυθούν με απλές στατιστικές υποδείξεις, χωρίς να απαιτείται κοινή λογική. Ο αλγόριθμος χρησιμοποιούσε απλά μοντέλα για τον εντοπισμό και την αφαίρεση εκείνων των παραδειγμάτων όπου η μία από τις απαντήσεις συνδεόταν υπερβολικά προφανώς με άλλες λέξεις της πρότασης. Για παράδειγμα, η εργασία «Τα λιοντάρια έφαγαν τις ζέβρες, επειδή είναι αρπακτικά» θα φιλτραριζόταν, καθώς η λέξη «αρπακτικά» στατιστικά συνδέεται στενά με τα «λιοντάρια».

Ως αποτέλεσμα του φιλτραρίσματος, απορρίφθηκε περίπου το 14% των συλλεγμένων δεδομένων. Η τελική έκδοση του dataset περιλαμβάνει 43.972 εργασίες, γεγονός που το καθιστά σημαντικά πιο αξιόπιστη και σύνθετη δοκιμασία[1].

Αποτελέσματα μοντέλων και πρόοδος

Κατά την κυκλοφορία του WinoGrande, τα καλύτερα μοντέλα εκείνης της εποχής εμφάνισαν αποτελέσματα σημαντικά κατώτερα από τα ανθρώπινα.

  • Το RoBERTa (βελτιωμένη έκδοση του BERT) επέτυχε ακρίβεια ~79%.
  • Ο άνθρωπος επιλύει κατά μέσο όρο τις εργασίες με ακρίβεια ~94%[1].

Αυτή η διαφορά επιβεβαίωσε ότι το φιλτράρισμα AfLite εξάλειψε επιτυχώς πολλές «εύκολες» διαδρομές για τα μοντέλα. Ωστόσο, με την ανάπτυξη των LLM, αυτό το χάσμα άρχισε να μειώνεται.

  • Έως το 2022, το μοντέλο ST-MoE-32B επέτυχε ακρίβεια 96,1%, ξεπερνώντας το ανθρώπινο επίπεδο[5].
  • Το GPT-3 εμφάνισε αποτέλεσμα περίπου 88%[6].
  • Το GPT-4, χωρίς ειδικό fine-tuning, επιλύει τις εργασίες με ακρίβεια ~87,5%[7].

Επίδραση και κριτική

Το WinoGrande έχει καταστεί ένα από τα βασικά benchmarks για την αξιολόγηση της κοινής λογικής και χρησιμοποιείται τακτικά για τη δοκιμή νέων μοντέλων. Τα αποτελέσματά του δημοσιεύονται σε τεχνικές αναφορές κορυφαίων εταιρειών ΤΝ και σε πλατφόρμες σύγκρισης μοντέλων[8].

Ταυτόχρονα, η μεθοδολογία δημιουργίας του dataset έχει γίνει αντικείμενο επιστημονικής συζήτησης. Ορισμένοι ερευνητές επισημαίνουν ότι το μαζικό crowdsourcing ενδέχεται να οδήγησε στην εμφάνιση αφύσικων ή διφορούμενων φράσεων. Επίσης, διατυπώθηκαν αμφιβολίες ως προς το αν το αυτόματο φιλτράρισμα AfLite μπορεί να εξαλείψει πλήρως όλα τα κρυφά artifacts[5]. Ωστόσο, το WinoGrande τόνωσε όχι μόνο την πρόοδο στις μετρικές, αλλά και μια σημαντική συζήτηση για τη δημιουργία πιο ανθεκτικών και αξιόπιστων μεθόδων αξιολόγησης της ΤΝ.

Σύνδεσμοι

  • Επίσημος ιστότοπος WinoGrande
  • Dataset στην πλατφόρμα Hugging Face

Βιβλιογραφία

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

Παραπομπές

  1. 1.0 1.1 1.2 1.3 Sakaguchi, K., Le Bras, R., Bhagavatula, C., Choi, Y. «WinoGrande: An Adversarial Winograd Schema Challenge at Scale». arXiv:1907.10641. [1]
  2. «allenai/winogrande». Hugging Face. [2]
  3. «Winograd schema challenge». In Wikipedia. [3]
  4. Kocijan, V. et al. «The defeat of the Winograd Schema Challenge». Artificial Intelligence. [4]
  5. 5.0 5.1 Lepore, J. «AI Has Been Surprising for Years». Carnegie Endowment for International Peace. [5]
  6. Brown, T. et al. «Language Models are Few-Shot Learners». arXiv:2005.14165. [6]
  7. OpenAI. «GPT-4 Technical Report». arXiv:2303.08774. [7]
  8. «Common Sense Reasoning On Winogrande». HyperAI. [8]