GSM8K (Grade School Math 8K) (NL)

From Systems analysis Wiki
Jump to navigation Jump to search

GSM8K (Grade School Math 8K) — dit is een referentiedataset met ongeveer 8.500 tekstuele wiskundige opgaven op schoolniveau. Het werd in 2021 gecreëerd door onderzoekers van OpenAI om de capaciteiten van grote taalmodellen (LLM) voor meerstappige wiskundige redenering te evalueren en te ontwikkelen[1]. GSM8K is uitgegroeid tot een van de belangrijkste benchmarks voor het meten van vooruitgang op het gebied van wiskundig redeneren door kunstmatige intelligentie.

Elke opgave in de dataset bestaat uit een korte tekstuele situatieschets waarvan de oplossing het uitvoeren van 2 tot 8 opeenvolgende rekenkundige bewerkingen vereist (optelling, aftrekking, vermenigvuldiging, deling). Ondanks de ogenschijnlijke eenvoud vereisen de opgaven een diep tekstbegrip en logisch redeneren, wat ze voor veel LLM's moeilijk maakt[2].

Belangrijkste kenmerken

Omvang en structuur

De GSM8K-dataset bevat ongeveer 8500 opgaven, die zijn verdeeld in twee delen:

  • Trainingsset: ~7500 opgaven, bedoeld voor het fine-tunen (fine-tuning) van modellen. Elke opgave is voorzien van een uitgebreide stapsgewijze oplossing.
  • Testset: ~1000 opgaven, gebruikt voor onafhankelijke evaluatie van modelprestaties[1].

Moeilijkheidsgraad en inhoud

De opgaven zijn bewust zo samengesteld dat een bekwame middelbare scholier ze kan oplossen, maar ze vereisen desondanks meerstappige redenering. Hierdoor wordt niet zozeer de wiskundige kennis van het model getest, maar veeleer het vermogen om een probleem te ontleden en logische bewerkingen sequentieel uit te voeren.

Linguïstische diversiteit

De formuleringen van de opgaven in GSM8K kenmerken zich door een grote verscheidenheid aan stijlen en taalkundige constructies. Dit is gedaan om te testen of modellen in staat zijn opgaven te begrijpen die op verschillende manieren zijn geformuleerd, en om het 'uit het hoofd leren' van specifieke sjablonen te vermijden[3].

Geschiedenis en evolutie van modelevaluatie

Vroege modellen en basisresultaten

In het originele werk uit 2021 toonden de auteurs aan dat zelfs grote modellen van die tijd, zoals GPT-3 (175 miljard parameters), aanzienlijke moeite hadden met de dataset. Na fine-tuning en het gebruik van een aanvullend verificatiemodel bereikte de nauwkeurigheid slechts ongeveer 55%[1]. Dit resultaat toonde aan dat één kleine fout in de redeneerreeks kan leiden tot een volledig onjuist antwoord.

Baanbrekende technieken: Chain-of-Thought

Een doorbraak bij het oplossen van GSM8K-opgaven was de aanpak van «keten van redenering» (Chain-of-Thought, CoT). In 2022 toonden onderzoekers van Google aan dat wanneer een model expliciet wordt aangemoedigd de stappen van de oplossing uit te schrijven voordat het antwoord wordt gegeven, de nauwkeurigheid aanzienlijk toeneemt. Het model PaLM (540 miljard parameters) bereikte met CoT een nauwkeurigheid van 58%[4]. De toepassing van de complexere techniek self-consistency (het genereren van meerdere oplossingen en het kiezen van het meest voorkomende antwoord) maakte het mogelijk de nauwkeurigheid op te trekken tot 74%[4].

Het overstijgen van het menselijk niveau

Vanaf 2023 hebben de nieuwste generatieve modellen het menselijk niveau op deze benchmark overtroffen.

  • GPT-4 van OpenAI bereikte in de few-shot CoT-modus (waarbij de prompt enkele voorbeelden van opgeloste opgaven bevat) een nauwkeurigheid van ongeveer 92%[5], en met aanvullende strategieën zelfs tot 97%[6].
  • Claude 2 van Anthropic behaalde een resultaat van 88%, en de recentere versie Claude 3 circa 95%[3].

Dergelijke hoge scores getuigen van aanzienlijke vooruitgang in de redeneervermogens van LLM's, maar geven ook aan dat GSM8K voor geavanceerde modellen 'vrijwel opgelost' raakt, wat de ontwikkeling van complexere benchmarks zoals MATH en MMLU stimuleert.

Rol bij het trainen en ontwikkelen van modellen

Naast evaluatie wordt GSM8K actief gebruikt voor het trainen en verbeteren van modellen.

  • Fine-tuning (verfijning): De trainingsset met stapsgewijze oplossingen is een waardevolle bron voor het fine-tunen van modellen in wiskundige logica.
  • Training van verificatoren: In het originele werk van OpenAI werd een deel van de GSM8K-data gebruikt om een afzonderlijk verificator-model te trainen dat de juistheid van gegenereerde oplossingen beoordeelde. Deze aanpak van het afzonderlijk trainen van een generator en een criticus heeft zijn effectiviteit bewezen[1].
  • Prompt Engineering: De beschikbaarheid van een groot aantal voorbeelden stelde onderzoekers in staat technieken voor het opstellen van prompts te ontwikkelen en te verfijnen, zoals Chain-of-Thought en Tree-of-Thought, die het model leren redeneren zonder de gewichten ervan te wijzigen.

Verwijzingen

  • Pagina van de dataset op Papers With Code
  • Officiële repository op GitHub

Literatuur

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

Noten

  1. 1.0 1.1 1.2 1.3 Cobbe, Karl et al. «Training Verifiers to Solve Math Word Problems». arXiv:2110.14168. [1]
  2. «GSM8K Dataset». Papers With Code. [2]
  3. 3.0 3.1 «GSM8K Benchmark». Klu.ai. [3]
  4. 4.0 4.1 Wei, Jason et al. «Language Models Perform Reasoning via Chain of Thought». Google Research Blog. [4]
  5. Yu, L., et al. «Solving Challenging Math Word Problems Using GPT-4». EMNLP 2023. [5]
  6. «Achieving >97% on GSM8K». arXiv:2404.14963. [6]