---
title: "HellaSwag Benchmark (EL)"
source: "https://systems-analysis.info/int/HellaSwag_Benchmark_(EL)"
wiki: "systems-analysis.info/int"
article: "HellaSwag_Benchmark_(EL)"
language: "el"
categories:
  - "Category:Greek"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 2835
wiki_created_at: 2026-09-06T23:11:43Z
wiki_modified_at: 2026-09-06T23:11:43Z
downloaded_at: 2026-09-07T22:53:38Z
---

# HellaSwag Benchmark (EL)

**HellaSwag** — είναι ένα σύνολο δεδομένων αναφοράς (benchmark), που παρουσιάστηκε το 2019 για την αξιολόγηση της ικανότητας μοντέλων τεχνητής νοημοσύνης στην κατανόηση καθημερινών καταστάσεων (*commonsense reasoning*) σε φυσική γλώσσα<sup>[\[1\]](https://systems-analysis.info/int/HellaSwag_Benchmark_(EL)#cite_note-hellaswag_paper-1)</sup>. Το benchmark αναπτύχθηκε από ομάδα ερευνητών του Πανεπιστημίου της Ουάσιγκτον και του Ινστιτούτου Τεχνητής Νοημοσύνης Allen.

Η εργασία του HellaSwag συνίσταται στην επιλογή της πιο εύλογης ολοκλήρωσης για ένα δεδομένο κειμενικό πλαίσιο. Το βασικό χαρακτηριστικό του συνόλου δεδομένων είναι ότι είναι τετριμμένο για τον άνθρωπο, αλλά αδυνατίζει ακόμη και τα πιο προηγμένα γλωσσικά μοντέλα που βασίζονται σε επιφανειακές στατιστικές νομοτέλειες<sup>[\[2\]](https://systems-analysis.info/int/HellaSwag_Benchmark_(EL)#cite_note-hellaswag_arxiv-2)</sup>.

## Ιστορία και προϋποθέσεις

Το HellaSwag αποτελεί εξέλιξη των ιδεών του dataset **SWAG** (*Situations With Adversarial Generations*), που προτάθηκε από την ίδια ομάδα συγγραφέων το 2018. Στην εργασία SWAG τα μοντέλα έπρεπε να επιλέξουν την πιο πιθανή συνέχεια για την περιγραφή μιας απλής κατάστασης. Αρχικά το SWAG ήταν δύσκολο για τους αλγορίθμους, αλλά με την εμφάνιση του μοντέλου BERT τα αποτελέσματά του στο SWAG έφτασαν το επίπεδο **~86%**, εξισώνοντας σχεδόν την ανθρώπινη επίδοση<sup>[\[2\]](https://systems-analysis.info/int/HellaSwag_Benchmark_(EL)#cite_note-hellaswag_arxiv-2)</sup>.

Αυτή η επιτυχία γέννησε αμφιβολίες: μήπως το BERT πραγματικά «κατανοεί» το κείμενο, ή απλώς έχει μάθει να αναγνωρίζει στατιστικά αρτεφάκτα και πρότυπα που υπάρχουν στο σύνολο δεδομένων; Οι συγγραφείς του HellaSwag διατύπωσαν την υπόθεση ότι το υψηλό αποτέλεσμα του BERT εξηγείται όχι από πραγματική κατανόηση, αλλά από προσαρμογή στην ιδιαιτερότητα του dataset. Έδειξαν ότι με την παραμικρή αλλαγή στην κατανομή των δεδομένων η ακρίβεια του BERT μειώνεται απότομα. Αυτό σήμαινε ότι για την αντικειμενική αξιολόγηση της προόδου στο NLP χρειαζόταν ένα νέο, πιο σύνθετο και «παγιδευτικό» benchmark<sup>[\[2\]](https://systems-analysis.info/int/HellaSwag_Benchmark_(EL)#cite_note-hellaswag_arxiv-2)</sup>.

## Περιγραφή και στόχοι του dataset

Το HellaSwag δημιουργήθηκε ως δοκιμασία που αποσκοπεί στην ανάδειξη των περιορισμών των σύγχρονων μοντέλων στην κατανόηση αιτιακών σχέσεων και καθημερινών σεναρίων.

### Δομή της εργασίας

Κάθε παράδειγμα στο HellaSwag αποτελείται από δύο μέρη:

1.  **Πλαίσιο**: Μια σύντομη παράγραφος (έως τρεις προτάσεις) που περιγράφει την αρχή μιας κατάστασης.
2.  **Τέσσερις επιλογές ολοκλήρωσης**: Τέσσερις πιθανές συνέχειες της ιστορίας, που αποτελούνται επίσης από αρκετές προτάσεις.

Μόνο μία από αυτές τις ολοκληρώσεις είναι σωστή (πραγματική), ενώ οι υπόλοιπες τρεις είναι ψευδείς, παραγόμενες ειδικά για να μπερδέψουν το μοντέλο.

### Πηγές δεδομένων

Τα παραδείγματα καταστάσεων αντλήθηκαν από δύο πηγές, που καλύπτουν ένα ευρύ φάσμα καθημερινών σεναρίων:

- **ActivityNet Captions**: Περιγραφές δράσεων από βίντεο (π.χ. «ένα άτομο ανοίγει ένα βάζο με αγγούρια»).
- **WikiHow**: Οδηγίες από άρθρα (π.χ. «πώς να αλλάξεις τη ρόδα αυτοκινήτου»).

Ο στόχος του HellaSwag είναι να δημιουργήσει ένα benchmark που επιλύεται εύκολα από τον άνθρωπο (διαισθητικά), αλλά δυσκολεύει στο μέγιστο βαθμό τα μοντέλα που δεν διαθέτουν πλήρη κοινή λογική. Αυτό το αποτέλεσμα οι συγγραφείς το ονόμασαν «εφέ Χρυσομαλλούσας» (*Goldilocks effect*)<sup>[\[1\]](https://systems-analysis.info/int/HellaSwag_Benchmark_(EL)#cite_note-hellaswag_paper-1)</sup>.

## Μεθοδολογία Adversarial Filtering (AF)

Η βασική καινοτομία στη δημιουργία του HellaSwag ήταν η μέθοδος **Adversarial Filtering** (**AF**) — η επαναληπτική επιλογή «παγίδων» που προορίζονται για ένα συγκεκριμένο μοντέλο-«θύμα». Αυτή η μέθοδος επέτρεψε τη δημιουργία ψευδών επιλογών που μοιάζουν παραπλανητικά με τις σωστές από την οπτική γωνία των στατιστικών μοντέλων.

Το σχήμα λειτουργίας του AF έχει ως εξής:

1.  **Παραγωγή**. Βάσει του αρχικού πλαισίου, ένα γλωσσικό μοντέλο-γεννήτρια (π.χ. GPT) παράγει πλήθος πιθανών λανθασμένων τέλους.
2.  **Διάκριση**. Ένα μοντέλο-ταξινομητής (π.χ. BERT), που παίζει τον ρόλο του «θύματος», προσπαθεί να διακρίνει τις παραγόμενες συνέχειες από την πραγματική (σωστή).
3.  **Επιλογή**. Επιλέγονται εκείνες οι ψευδείς επιλογές που ο ταξινομητής θεώρησε πιο εύλογες, δηλαδή εκείνες στις οποίες είναι πιο πιθανό να έκανε λάθος.
4.  **Επανάληψη**. Η διαδικασία επαναλαμβάνεται πολλές φορές, μέχρι οι ψευδείς απαντήσεις να γίνουν όσο το δυνατόν πιο παρόμοιες με τη σωστή για τον αλγόριθμο.
5.  **Επαλήθευση από άνθρωπο**. Στο τελικό στάδιο, τα παραγόμενα σύνολα (πλαίσιο + 1 σωστή κατάληξη + 3 καλύτερες ψευδείς) αξιολογούνται από ανθρώπους. Οι αξιολογητές επιβεβαιώνουν ότι η σωστή επιλογή είναι αναμφίβολα η πιο φυσική, ενώ όλες οι εναλλακτικές περιέχουν κάποια αντίφαση που είναι ορατή στον άνθρωπο<sup>[\[2\]](https://systems-analysis.info/int/HellaSwag_Benchmark_(EL)#cite_note-hellaswag_arxiv-2)</sup>.

Χάρη στο AF, κάθε παράδειγμα στο HellaSwag είναι εξαρχής κατασκευασμένο ώστε να παραπλανεί το μοντέλο, ενώ ταυτόχρονα παραμένει διαφανές για τον άνθρωπο.

## Αποτελέσματα και σημασία

Το HellaSwag αποτέλεσε αυστηρή δοκιμασία για τα μοντέλα κατανόησης κειμένου. Τα αποτελέσματα των δοκιμών ανέδειξαν τεράστιο χάσμα μεταξύ μηχανικής και ανθρώπινης νοημοσύνης:

- **Ο άνθρωπος** επιλύει τις εργασίες HellaSwag σχεδόν αλάνθαστα, με ακρίβεια περίπου **95-96%**<sup>[\[2\]](https://systems-analysis.info/int/HellaSwag_Benchmark_(EL)#cite_note-hellaswag_arxiv-2)</sup>.
- Το καλύτερο μοντέλο κατά τη δημιουργία, **BERT-Large**, πέτυχε μόλις **~47%** ακρίβεια. Απλούστερες μέθοδοι έδειχναν αποτέλεσμα ελάχιστα πάνω από τυχαία εικασία (25%)<sup>[\[2\]](https://systems-analysis.info/int/HellaSwag_Benchmark_(EL)#cite_note-hellaswag_arxiv-2)</sup>.

Το χάσμα άνω των **45 ποσοστιαίων μονάδων** επιβεβαίωσε την υπόθεση ότι τα υψηλά αποτελέσματα σε προηγούμενες δοκιμασίες δεν σήμαιναν πραγματική κατανόηση. Το HellaSwag έδειξε ότι ακόμα και μετά από εκπαίδευση σε τεράστιες ποσότητες δεδομένων, τα μοντέλα δεν μπορούν να αναπτύξουν γενική κοινή λογική για νέες καταστάσεις.

Τα επόμενα χρόνια το HellaSwag συμπεριλήφθηκε στις τυπικές δοκιμασίες για νέα γλωσσικά μοντέλα. Η πρόοδος των συστημάτων AI μπορούσε να παρακολουθείται μέσω των αποτελεσμάτων τους σε αυτό το benchmark.

- Το 2020 το μοντέλο GPT-3 (175 δισεκατομμύρια παράμετροι) έδειξε ακρίβεια **~79%** σε λειτουργία *few-shot*, γεγονός που υπερέβη το επίπεδο πολλών εξειδικευμένων μοντέλων της εποχής, αλλά εξακολουθούσε να υστερεί σημαντικά έναντι του ανθρώπου<sup>[\[3\]](https://systems-analysis.info/int/HellaSwag_Benchmark_(EL)#cite_note-gpt3_paper-3)</sup>.
- Μόλις το 2023 τα μοντέλα νέας γενιάς, όπως το GPT-4, κατάφεραν να φτάσουν στο HellaSwag αποτέλεσμα συγκρίσιμο με το ανθρώπινο (περίπου **95%** ακρίβεια)<sup>[\[4\]](https://systems-analysis.info/int/HellaSwag_Benchmark_(EL)#cite_note-hellaswag_official_site-4)</sup>.

Η δημιουργία του HellaSwag σηματοδότησε μια νέα προσέγγιση στην αξιολόγηση της προόδου στο NLP, βασισμένη στην ιδέα των **εξελισσόμενων benchmark**: καθώς τα μοντέλα βελτιώνονται, είναι απαραίτητο να δημιουργούνται νέες, πιο σύνθετες δοκιμασίες που αναδεικνύουν τις αδυναμίες τους.

## Σύνδεσμοι

- Επίσημος ιστότοπος του έργου HellaSwag
- Επιστημονικό άρθρο «HellaSwag: Can a Machine Really Finish Your Sentence?»

## Βιβλιογραφία

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## Παραπομπές

1.  <span id="cite_note-hellaswag_paper-1">↑ <sup>[1.0](https://systems-analysis.info/int/HellaSwag_Benchmark_(EL)#cite_ref-hellaswag_paper_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/HellaSwag_Benchmark_(EL)#cite_ref-hellaswag_paper_1-1)</sup> Zellers, R. et al. «HellaSwag: Can a Machine Really Finish Your Sentence?». *Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics*. <a href="https://aclanthology.org/P19-1472/" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-hellaswag_arxiv-2">↑ <sup>[2.0](https://systems-analysis.info/int/HellaSwag_Benchmark_(EL)#cite_ref-hellaswag_arxiv_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/HellaSwag_Benchmark_(EL)#cite_ref-hellaswag_arxiv_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/HellaSwag_Benchmark_(EL)#cite_ref-hellaswag_arxiv_2-2)</sup> <sup>[2.3](https://systems-analysis.info/int/HellaSwag_Benchmark_(EL)#cite_ref-hellaswag_arxiv_2-3)</sup> <sup>[2.4](https://systems-analysis.info/int/HellaSwag_Benchmark_(EL)#cite_ref-hellaswag_arxiv_2-4)</sup> <sup>[2.5](https://systems-analysis.info/int/HellaSwag_Benchmark_(EL)#cite_ref-hellaswag_arxiv_2-5)</sup> Zellers, R. et al. «HellaSwag: Can a Machine Really Finish Your Sentence?». *arXiv:1905.07830*, 2019. <a href="https://ar5iv.labs.arxiv.org/html/1905.07830" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-gpt3_paper-3">[↑](https://systems-analysis.info/int/HellaSwag_Benchmark_(EL)#cite_ref-gpt3_paper_3-0) Brown, T. B. et al. «Language Models are Few-Shot Learners». *arXiv:2005.14165*, 2020. <a href="http://arxiv.org/pdf/2005.14165" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-hellaswag_official_site-4">[↑](https://systems-analysis.info/int/HellaSwag_Benchmark_(EL)#cite_ref-hellaswag_official_site_4-0) Zellers, R. et al. «HellaSwag Project Page». <a href="https://rowanzellers.com/hellaswag/" class="external autonumber" rel="nofollow">[4]</a></span>
