---
title: "GSM8K (Grade School Math 8K) (NL)"
source: "https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(NL)"
wiki: "systems-analysis.info/int"
article: "GSM8K_(Grade_School_Math_8K)_(NL)"
language: "nl"
categories:
  - "Category:Dutch"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 2502
wiki_created_at: 2026-09-06T23:05:12Z
wiki_modified_at: 2026-09-06T23:05:12Z
downloaded_at: 2026-09-07T22:51:44Z
---

# GSM8K (Grade School Math 8K) (NL)

**GSM8K** (**Grade School Math 8K**) — dit is een referentiedataset met ongeveer 8.500 tekstuele wiskundige opgaven op schoolniveau. Het werd in 2021 gecreëerd door onderzoekers van **OpenAI** om de capaciteiten van grote taalmodellen (LLM) voor meerstappige wiskundige redenering te evalueren en te ontwikkelen<sup>[\[1\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(NL)#cite_note-openai2021-1)</sup>. GSM8K is uitgegroeid tot een van de belangrijkste benchmarks voor het meten van vooruitgang op het gebied van wiskundig redeneren door kunstmatige intelligentie.

Elke opgave in de dataset bestaat uit een korte tekstuele situatieschets waarvan de oplossing het uitvoeren van 2 tot 8 opeenvolgende rekenkundige bewerkingen vereist (optelling, aftrekking, vermenigvuldiging, deling). Ondanks de ogenschijnlijke eenvoud vereisen de opgaven een diep tekstbegrip en logisch redeneren, wat ze voor veel LLM's moeilijk maakt<sup>[\[2\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(NL)#cite_note-pwc-2)</sup>.

## Belangrijkste kenmerken

### Omvang en structuur

De GSM8K-dataset bevat ongeveer **8500 opgaven**, die zijn verdeeld in twee delen:

- **Trainingsset**: ~7500 opgaven, bedoeld voor het fine-tunen (*fine-tuning*) van modellen. Elke opgave is voorzien van een uitgebreide stapsgewijze oplossing.
- **Testset**: ~1000 opgaven, gebruikt voor onafhankelijke evaluatie van modelprestaties<sup>[\[1\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(NL)#cite_note-openai2021-1)</sup>.

### Moeilijkheidsgraad en inhoud

De opgaven zijn bewust zo samengesteld dat een bekwame middelbare scholier ze kan oplossen, maar ze vereisen desondanks **meerstappige redenering**. Hierdoor wordt niet zozeer de wiskundige kennis van het model getest, maar veeleer het vermogen om een probleem te ontleden en logische bewerkingen sequentieel uit te voeren.

### Linguïstische diversiteit

De formuleringen van de opgaven in GSM8K kenmerken zich door een grote verscheidenheid aan stijlen en taalkundige constructies. Dit is gedaan om te testen of modellen in staat zijn opgaven te begrijpen die op verschillende manieren zijn geformuleerd, en om het 'uit het hoofd leren' van specifieke sjablonen te vermijden<sup>[\[3\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(NL)#cite_note-klu_benchmark-3)</sup>.

## Geschiedenis en evolutie van modelevaluatie

### Vroege modellen en basisresultaten

In het originele werk uit 2021 toonden de auteurs aan dat zelfs grote modellen van die tijd, zoals **GPT-3** (175 miljard parameters), aanzienlijke moeite hadden met de dataset. Na fine-tuning en het gebruik van een aanvullend verificatiemodel bereikte de nauwkeurigheid slechts ongeveer **55%**<sup>[\[1\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(NL)#cite_note-openai2021-1)</sup>. Dit resultaat toonde aan dat één kleine fout in de redeneerreeks kan leiden tot een volledig onjuist antwoord.

### Baanbrekende technieken: Chain-of-Thought

Een doorbraak bij het oplossen van GSM8K-opgaven was de aanpak van **«keten van redenering»** (**Chain-of-Thought, CoT**). In 2022 toonden onderzoekers van Google aan dat wanneer een model expliciet wordt aangemoedigd de stappen van de oplossing uit te schrijven voordat het antwoord wordt gegeven, de nauwkeurigheid aanzienlijk toeneemt. Het model **PaLM** (540 miljard parameters) bereikte met CoT een nauwkeurigheid van **58%**<sup>[\[4\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(NL)#cite_note-google_cot-4)</sup>. De toepassing van de complexere techniek **self-consistency** (het genereren van meerdere oplossingen en het kiezen van het meest voorkomende antwoord) maakte het mogelijk de nauwkeurigheid op te trekken tot **74%**<sup>[\[4\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(NL)#cite_note-google_cot-4)</sup>.

### Het overstijgen van het menselijk niveau

Vanaf 2023 hebben de nieuwste generatieve modellen het menselijk niveau op deze benchmark overtroffen.

- **GPT-4** van OpenAI bereikte in de *few-shot CoT*-modus (waarbij de prompt enkele voorbeelden van opgeloste opgaven bevat) een nauwkeurigheid van ongeveer **92%**<sup>[\[5\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(NL)#cite_note-gpt4_92-5)</sup>, en met aanvullende strategieën zelfs tot **97%**<sup>[\[6\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(NL)#cite_note-gpt4_97-6)</sup>.
- **Claude 2** van Anthropic behaalde een resultaat van **88%**, en de recentere versie **Claude 3** circa **95%**<sup>[\[3\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(NL)#cite_note-klu_benchmark-3)</sup>.

Dergelijke hoge scores getuigen van aanzienlijke vooruitgang in de redeneervermogens van LLM's, maar geven ook aan dat GSM8K voor geavanceerde modellen 'vrijwel opgelost' raakt, wat de ontwikkeling van complexere benchmarks zoals **MATH** en **MMLU** stimuleert.

## Rol bij het trainen en ontwikkelen van modellen

Naast evaluatie wordt GSM8K actief gebruikt voor het **trainen en verbeteren** van modellen.

- **Fine-tuning (verfijning)**: De trainingsset met stapsgewijze oplossingen is een waardevolle bron voor het fine-tunen van modellen in wiskundige logica.
- **Training van verificatoren**: In het originele werk van OpenAI werd een deel van de GSM8K-data gebruikt om een afzonderlijk **verificator**-model te trainen dat de juistheid van gegenereerde oplossingen beoordeelde. Deze aanpak van het afzonderlijk trainen van een generator en een criticus heeft zijn effectiviteit bewezen<sup>[\[1\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(NL)#cite_note-openai2021-1)</sup>.
- **Prompt Engineering**: De beschikbaarheid van een groot aantal voorbeelden stelde onderzoekers in staat technieken voor het opstellen van prompts te ontwikkelen en te verfijnen, zoals **Chain-of-Thought** en **Tree-of-Thought**, die het model leren redeneren zonder de gewichten ervan te wijzigen.

## Verwijzingen

- Pagina van de dataset op Papers With Code
- Officiële repository op GitHub

## Literatuur

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## Noten

1.  <span id="cite_note-openai2021-1">↑ <sup>[1.0](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(NL)#cite_ref-openai2021_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(NL)#cite_ref-openai2021_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(NL)#cite_ref-openai2021_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(NL)#cite_ref-openai2021_1-3)</sup> Cobbe, Karl et al. «Training Verifiers to Solve Math Word Problems». *arXiv:2110.14168*. <a href="https://arxiv.org/abs/2110.14168" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-pwc-2">[↑](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(NL)#cite_ref-pwc_2-0) «GSM8K Dataset». *Papers With Code*. <a href="https://paperswithcode.com/dataset/gsm8k" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-klu_benchmark-3">↑ <sup>[3.0](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(NL)#cite_ref-klu_benchmark_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(NL)#cite_ref-klu_benchmark_3-1)</sup> «GSM8K Benchmark». *Klu.ai*. <a href="https://klu.ai/glossary/GSM8K-eval" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-google_cot-4">↑ <sup>[4.0](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(NL)#cite_ref-google_cot_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(NL)#cite_ref-google_cot_4-1)</sup> Wei, Jason et al. «Language Models Perform Reasoning via Chain of Thought». *Google Research Blog*. <a href="https://research.google/blog/language-models-perform-reasoning-via-chain-of-thought/" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-gpt4_92-5">[↑](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(NL)#cite_ref-gpt4_92_5-0) Yu, L., et al. «Solving Challenging Math Word Problems Using GPT-4». *EMNLP 2023*. <a href="https://aclanthology.org/2023.emnlp-main.927.pdf" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-gpt4_97-6">[↑](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(NL)#cite_ref-gpt4_97_6-0) «Achieving \>97% on GSM8K». *arXiv:2404.14963*. <a href="https://arxiv.org/html/2404.14963v4" class="external autonumber" rel="nofollow">[6]</a></span>
