---
title: "HellaSwag Benchmark (NL)"
source: "https://systems-analysis.info/int/HellaSwag_Benchmark_(NL)"
wiki: "systems-analysis.info/int"
article: "HellaSwag_Benchmark_(NL)"
language: "nl"
categories:
  - "Category:Dutch"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 2845
wiki_created_at: 2026-09-06T23:11:52Z
wiki_modified_at: 2026-09-06T23:11:52Z
downloaded_at: 2026-09-07T22:53:40Z
---

# HellaSwag Benchmark (NL)

**HellaSwag** — dit is een referentiedataset (benchmark), gepresenteerd in 2019, voor het evalueren van het vermogen van kunstmatige-intelligentiemodellen om alledaagse situaties te begrijpen (*commonsense reasoning*) in natuurlijke taal<sup>[\[1\]](https://systems-analysis.info/int/HellaSwag_Benchmark_(NL)#cite_note-hellaswag_paper-1)</sup>. De benchmark werd ontwikkeld door een groep onderzoekers van de Universiteit van Washington en het Allen Institute for Artificial Intelligence.

De taak van HellaSwag bestaat uit het kiezen van de meest plausibele afronding voor een gegeven tekstcontext. Het belangrijkste kenmerk van de dataset is dat deze triviaal is voor mensen, maar zelfs geavanceerde taalmodellen die steunen op oppervlakkige statistische patronen in verwarring brengt<sup>[\[2\]](https://systems-analysis.info/int/HellaSwag_Benchmark_(NL)#cite_note-hellaswag_arxiv-2)</sup>.

## Geschiedenis en achtergrond

HellaSwag is een verdere ontwikkeling van de ideeën achter de dataset **SWAG** (*Situations With Adversarial Generations*), die in 2018 door dezelfde groep auteurs werd voorgesteld. In de SWAG-taak moesten modellen de meest waarschijnlijke voortzetting kiezen voor de beschrijving van een eenvoudige situatie. Aanvankelijk was SWAG moeilijk voor algoritmen, maar met de komst van het model BERT bereikte de score op SWAG een niveau van **~86%**, vrijwel gelijk aan dat van mensen<sup>[\[2\]](https://systems-analysis.info/int/HellaSwag_Benchmark_(NL)#cite_note-hellaswag_arxiv-2)</sup>.

Dit succes wekte twijfel: begrijpt BERT de tekst werkelijk, of heeft het slechts geleerd statistische artefacten en patronen in de dataset te herkennen? De auteurs van HellaSwag stelden de hypothese dat de hoge score van BERT niet door echt begrip werd verklaard, maar door aanpassing aan de specifieke kenmerken van de dataset. Ze toonden aan dat bij de kleinste wijziging in de gegevensverdeling de nauwkeurigheid van BERT sterk daalt. Dit betekende dat er voor een objectieve beoordeling van de voortgang in NLP een nieuwe, uitdagendere en meer 'verraderlijke' benchmark nodig was<sup>[\[2\]](https://systems-analysis.info/int/HellaSwag_Benchmark_(NL)#cite_note-hellaswag_arxiv-2)</sup>.

## Beschrijving en doelen van de dataset

HellaSwag werd gecreëerd als een test om de beperkingen van hedendaagse modellen in het begrijpen van oorzaak-gevolgrelaties en alledaagse scenario's bloot te leggen.

### Structuur van de taak

Elk voorbeeld in HellaSwag bestaat uit twee delen:

1.  **Context**: Een korte alinea (tot drie zinnen) die het begin van een bepaalde situatie beschrijft.
2.  **Vier keuzemogelijkheden**: Vier mogelijke vervolgingen van het verhaal, eveneens bestaande uit meerdere zinnen.

Slechts één van deze afrondingen is correct (de echte), en de overige drie zijn onjuist — speciaal gegenereerd om het model in verwarring te brengen.

### Bronnen van de data

De situatievoorbeelden zijn afkomstig uit twee bronnen die een breed spectrum aan alledaagse scenario's omvatten:

- **ActivityNet Captions**: Beschrijvingen van handelingen uit video's (bijvoorbeeld: «een persoon opent een pot augurken»).
- **WikiHow**: Instructies uit artikelen (bijvoorbeeld: «hoe wissel je een autoband»).

Het doel van HellaSwag is het creëren van een benchmark die door mensen eenvoudig (intuïtief) op te lossen is, maar de taak maximaal bemoeilijkt voor modellen die niet over volwaardig gezond verstand beschikken. De auteurs noemden dit effect het «Goldilocks-effect» (*Goldilocks effect*)<sup>[\[1\]](https://systems-analysis.info/int/HellaSwag_Benchmark_(NL)#cite_note-hellaswag_paper-1)</sup>.

## Methode Adversarial Filtering (AF)

De belangrijkste innovatie bij het maken van HellaSwag was de methode **Adversarial Filtering** (**AF**) — een iteratieve selectie van 'valkuilen' die specifiek zijn ontworpen voor een bepaald doelmodel. Deze methode maakte het mogelijk om onjuiste keuzemogelijkheden te creëren die statistisch gezien bedrieglijk veel op de juiste lijken.

Het werkingsprincipe van AF ziet er als volgt uit:

1.  **Generatie**. Op basis van de oorspronkelijke context genereert een taalmodel als generator (bijvoorbeeld GPT) een reeks potentieel onjuiste afrondingen.
2.  **Discriminatie**. Een classificatiemodel (bijvoorbeeld BERT), dat fungeert als 'doelwit', probeert de gegenereerde vervolgingen te onderscheiden van de echte (juiste).
3.  **Selectie**. De onjuiste varianten worden geselecteerd die de classifier het meest plausibel achtte, dat wil zeggen die waarbij de kans op een fout het grootst was.
4.  **Iteratie**. Het proces wordt meerdere malen herhaald, totdat de onjuiste antwoorden zo veel mogelijk op het juiste antwoord lijken voor het algoritme.
5.  **Verificatie door mensen**. In de laatste fase worden de verkregen sets (context + 1 juiste afronding + 3 beste onjuiste) door mensen beoordeeld. De beoordelaars bevestigen dat de juiste variant ondubbelzinnig de meest natuurlijke is, en dat alle alternatieven een voor mensen zichtbare onlogica bevatten<sup>[\[2\]](https://systems-analysis.info/int/HellaSwag_Benchmark_(NL)#cite_note-hellaswag_arxiv-2)</sup>.

Dankzij AF is elk voorbeeld in HellaSwag van meet af aan zo samengesteld dat het een model op het verkeerde been zet, maar tegelijkertijd transparant blijft voor mensen.

## Resultaten en betekenis

HellaSwag werd een strenge proef voor tekstbegripmodellen. De testresultaten toonden een enorme kloof tussen machine- en menselijke intelligentie:

- **Mensen** lossen de HellaSwag-taken vrijwel foutloos op, met een nauwkeurigheid van ongeveer **95-96%**<sup>[\[2\]](https://systems-analysis.info/int/HellaSwag_Benchmark_(NL)#cite_note-hellaswag_arxiv-2)</sup>.
- Het beste model op het moment van de creatie, **BERT-Large**, bereikte slechts **~47%** nauwkeurigheid. Eenvoudigere methoden scoorden niet veel beter dan willekeurig raden (25%)<sup>[\[2\]](https://systems-analysis.info/int/HellaSwag_Benchmark_(NL)#cite_note-hellaswag_arxiv-2)</sup>.

Het verschil van meer dan **45 procentpunten** bevestigde de hypothese dat hoge scores op eerdere tests geen echt begrip aantoonden. HellaSwag liet zien dat modellen, zelfs na training op enorme hoeveelheden data, geen algemeen gezond verstand kunnen ontwikkelen voor nieuwe situaties.

In de jaren daarna werd HellaSwag opgenomen in de standaardtests voor nieuwe taalmodellen. De voortgang van AI-systemen kon worden gevolgd aan de hand van hun resultaten op deze benchmark.

- In 2020 behaalde het model GPT-3 (175 miljard parameters) een nauwkeurigheid van **~79%** in de *few-shot*-modus, wat het niveau van veel gespecialiseerde modellen uit die periode overtrof, maar nog steeds aanzienlijk onder dat van mensen bleef<sup>[\[3\]](https://systems-analysis.info/int/HellaSwag_Benchmark_(NL)#cite_note-gpt3_paper-3)</sup>.
- Pas in 2023 slaagden modellen van de nieuwe generatie, zoals GPT-4, erin op HellaSwag een resultaat te behalen dat vergelijkbaar is met dat van mensen (circa **95%** nauwkeurigheid)<sup>[\[4\]](https://systems-analysis.info/int/HellaSwag_Benchmark_(NL)#cite_note-hellaswag_official_site-4)</sup>.

De creatie van HellaSwag markeerde een nieuwe benadering van de evaluatie van voortgang in NLP, gebaseerd op het idee van **evoluerende benchmarks**: naarmate modellen verbeteren, moeten er nieuwe, uitdagendere tests worden ontwikkeld die hun zwakke punten blootleggen.

## Verwijzingen

- Officiële website van het HellaSwag-project
- Wetenschappelijk artikel «HellaSwag: Can a Machine Really Finish Your Sentence?»

## Literatuur

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## Noten

1.  <span id="cite_note-hellaswag_paper-1">↑ <sup>[1.0](https://systems-analysis.info/int/HellaSwag_Benchmark_(NL)#cite_ref-hellaswag_paper_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/HellaSwag_Benchmark_(NL)#cite_ref-hellaswag_paper_1-1)</sup> Zellers, R. et al. «HellaSwag: Can a Machine Really Finish Your Sentence?». *Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics*. <a href="https://aclanthology.org/P19-1472/" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-hellaswag_arxiv-2">↑ <sup>[2.0](https://systems-analysis.info/int/HellaSwag_Benchmark_(NL)#cite_ref-hellaswag_arxiv_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/HellaSwag_Benchmark_(NL)#cite_ref-hellaswag_arxiv_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/HellaSwag_Benchmark_(NL)#cite_ref-hellaswag_arxiv_2-2)</sup> <sup>[2.3](https://systems-analysis.info/int/HellaSwag_Benchmark_(NL)#cite_ref-hellaswag_arxiv_2-3)</sup> <sup>[2.4](https://systems-analysis.info/int/HellaSwag_Benchmark_(NL)#cite_ref-hellaswag_arxiv_2-4)</sup> <sup>[2.5](https://systems-analysis.info/int/HellaSwag_Benchmark_(NL)#cite_ref-hellaswag_arxiv_2-5)</sup> Zellers, R. et al. «HellaSwag: Can a Machine Really Finish Your Sentence?». *arXiv:1905.07830*, 2019. <a href="https://ar5iv.labs.arxiv.org/html/1905.07830" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-gpt3_paper-3">[↑](https://systems-analysis.info/int/HellaSwag_Benchmark_(NL)#cite_ref-gpt3_paper_3-0) Brown, T. B. et al. «Language Models are Few-Shot Learners». *arXiv:2005.14165*, 2020. <a href="http://arxiv.org/pdf/2005.14165" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-hellaswag_official_site-4">[↑](https://systems-analysis.info/int/HellaSwag_Benchmark_(NL)#cite_ref-hellaswag_official_site_4-0) Zellers, R. et al. «HellaSwag Project Page». <a href="https://rowanzellers.com/hellaswag/" class="external autonumber" rel="nofollow">[4]</a></span>
