MATH Benchmark (NL)

From Systems analysis Wiki
Jump to navigation Jump to search

MATH (acroniem van het Engels Mathematics Aptitude Test of Heuristics) — dit is een grote dataset en benchmark voor het beoordelen van wiskundige vaardigheden en probleemoplossend vermogen bij grote taalmodellen (LLM). De dataset werd in 2021 gepresenteerd door een groep onderzoekers onder leiding van Dan Hendrycks en bevat 12.500 opgaven, afkomstig uit Amerikaanse wiskundecompetities voor de middelbare school, zoals AMC 10, AMC 12 en AIME[1].

De opgaven bestrijken een breed spectrum aan gebieden (algebra, meetkunde, getaltheorie, combinatoriek, e.a.) en zijn ingedeeld naar moeilijkheidsgraad. In tegenstelling tot standaard schoolopgaven vereisen ze vaak een creatieve aanpak en heuristische methoden, in plaats van directe toepassing van formules. Elke opgave wordt vergezeld door een volledige stapsgewijze oplossing en een eindantwoord, waardoor MATH een waardevol hulpmiddel is voor zowel het trainen als het testen van modellen[2].

Structuur en kenmerken van de dataset

De MATH-benchmark heeft een aantal sleutelkenmerken die haar tot een moeilijk en betrouwbaar evaluatie-instrument maken.

Formaat van de opgaven

Alle opgaven en oplossingen zijn gepresenteerd in LaTeX-formaat, en voor de beschrijving van geometrische tekeningen wordt de taal Asymptote gebruikt. Dit maakt het mogelijk om alle condities, inclusief afbeeldingen, in tekstuele vorm weer te geven die door een taalmodel verwerkt kan worden. Aan elke opgave zijn labels toegekend op basis van zeven wiskundige gebieden en vijf moeilijkheidsniveaus[1].

Automatische beoordeling

De eindantwoorden in de dataset zijn opgenomen in een speciaal formaat `\boxed{...}` en herleid tot een strikte standaard (bijvoorbeeld breuken in onherleidbare vorm). Dit maakt het mogelijk om modellen automatisch te beoordelen op basis van de metriek exacte overeenkomst (exact match), waardoor subjectiviteit en ambiguïteit bij de controle van resultaten worden uitgesloten. Het model moet een strikt correct antwoord geven om de opgave als opgelost te beschouwen[1].

Moeilijkheidsgraad van de opgaven en het menselijk niveau

MATH is een van de moeilijkste wiskundetests voor AI. De opgaven zijn uitdagend zelfs voor mensen met een sterke wiskundige achtergrond.

  • Tijdens het onderzoek naar de dataset werd een groep universiteitsstudenten getest, met resultaten variërend van ~40% tot ~90% bij olympiadekampioenen.
  • Zelfs een drievoudig gouden medaillist van de Internationale Mathematische Olympiade slaagde er niet in alle opgaven foutloos op te lossen[1].

Dit toont aan dat voor het succesvol oplossen van MATH-opgaven niet alleen kennis vereist is, maar ook grote nauwkeurigheid en wiskundige intuïtie.

Resultaten van modellen en voortgang in het oplossen

Eerste resultaten (2021)

Bij de lancering van de benchmark in 2021 behaalden zelfs de grootste modellen uiterst lage resultaten.

  • Het model GPT-3 (175 miljard parameters) loste slechts ongeveer 5% van de opgaven correct op.
  • Gefinetuunde versies van GPT-2 behaalden een nauwkeurigheid van 6-7%[1].

De auteurs concludeerden dat eenvoudige schaalvergroting van modellen nauwelijks effect heeft op de prestaties en dat voor verdere vooruitgang nieuwe algoritmische benaderingen nodig zijn[3].

Doorbraak van Minerva en GPT-4 (2022–2023)

De doorbraak vond plaats met de komst van modellen die speciaal getraind waren op wetenschappelijke teksten en nieuwe oplossingsmethoden.

  • In 2022 behaalde het model Google Minerva een nauwkeurigheid van ongeveer 50%, waarmee het aantoonde dat de combinatie van schaal en gespecialiseerde training de oplossingskwaliteit aanzienlijk kan verhogen[3].
  • In 2023 zette GPT-4 van OpenAI een nieuwe stap vooruit. Met behulp van tools kon het model de resultaten aanzienlijk verbeteren:
    • Met Code Interpreter (het uitvoeren van code voor het controleren van berekeningen) bereikte de nauwkeurigheid bijna 70%.
    • Met de methode code-based self-verification (zelfcontrole en foutcorrectie met behulp van code) werd een record van 84,3% opgeloste opgaven gevestigd[4].

Dit resultaat is vergelijkbaar met het niveau van sterke menselijke deelnemers en benadert de expertdrempel.

Betekenis en invloed

De MATH-benchmark heeft een sleutelrol gespeeld in de ontwikkeling van wiskundige vaardigheden van LLM's. Het heeft duidelijk aangetoond dat eenvoudige schaalvergroting niet volstaat voor het oplossen van complexe opgaven, en dat nieuwe benaderingen noodzakelijk zijn, zoals:

  • Training op volledige stapsgewijze oplossingen.
  • Gespecialiseerde training op wetenschappelijke data.
  • Gebruik van externe tools voor berekeningen en verificatie.

Ondanks de aanzienlijke vooruitgang blijft MATH een belangrijke en uitdagende test. Het fungeert als indicator voor het wiskundig denkvermogen van LLM's en stimuleert onderzoek op het gebied van betrouwbare oplossing van opgaven die meerstaps-redeneren vereisen[1].

Verwijzingen

  • Officiële repository van de MATH-dataset op GitHub
  • Pagina van de dataset op Papers With Code

Literatuur

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

Noten

  1. 1.0 1.1 1.2 1.3 1.4 1.5 Hendrycks, D., et al. «Measuring Mathematical Problem Solving With the MATH Dataset». arXiv:2103.03874. [1]
  2. «AI Benchmarks and Datasets for LLM Evaluation». arXiv:2412.01020. [2]
  3. 3.0 3.1 «Language models surprised us». Planned-Obsolescence.org. [3]
  4. «GPT-4 Code Interpreter smashes maths benchmarks, hits new SOTA». The Decoder. [4]