GSM8K (Grade School Math 8K) (HU)

From Systems analysis Wiki
Jump to navigation Jump to search

GSM8K (Grade School Math 8K) — egy referencia-adathalmaz, amely körülbelül 8500 általános iskolai szintű szöveges matematikai feladatot tartalmaz. 2021-ben az OpenAI kutatói hozták létre azzal a céllal, hogy értékeljék és fejlesszék a nagy nyelvi modellek (LLM) többlépéses matematikai következtetési képességeit[1]. A GSM8K a mesterséges intelligencia matematikai gondolkodásának mérésére szolgáló egyik legfontosabb benchmarkká vált.

Az adathalmaz minden feladata egy rövid szöveges történet, amelynek megoldásához 2–8 egymást követő aritmetikai műveletet (összeadás, kivonás, szorzás, osztás) kell elvégezni. Látszólagos egyszerűségük ellenére a feladatok mélyreható szövegértést és logikai következtetést igényelnek, ami sok LLM számára komoly kihívást jelent[2].

Főbb jellemzők

Terjedelem és szerkezet

A GSM8K adathalmaz körülbelül 8500 feladatot tartalmaz, amelyek két részre oszlanak:

  • Tanítókészlet: ~7500 feladat, amelyek a modellek finomhangolására (fine-tuning) szolgálnak. Minden feladathoz részletes, lépésenkénti megoldás tartozik.
  • Tesztkészlet: ~1000 feladat, amelyeket a modellek teljesítményének független értékelésére használnak[1].

Nehézségi szint és tartalom

A feladatokat szándékosan úgy állították össze, hogy egy tehetséges középiskolás diák meg tudja oldani őket, ugyanakkor többlépéses következtetést igényelnek. Ez lehetővé teszi, hogy ne annyira a modell matematikai tudását teszteljék, hanem azt a képességét, hogy egy problémát részfeladatokra bontson, és logikai műveleteket egymás után hajtson végre.

Nyelvi sokféleség

A GSM8K feladatainak megfogalmazása stílusban és nyelvi szerkezetben rendkívül változatos. Ezt azért tették, hogy teszteljék a modellek képességét arra, hogy különféle módon megfogalmazott feladatfeltételeket megértsenek, és elkerüljék az adott sablonok „bemagolását"[3].

A modellek értékelésének története és fejlődése

Korai modellek és alap-eredmények

Az eredeti, 2021-es munkában a szerzők megmutatták, hogy még az akkori nagy modellek, például a GPT-3 (175 milliárd paraméter) is jelentős nehézségekkel küzdöttek az adathalmazzal. Finomhangolás és egy kiegészítő verifikátor-modell alkalmazása után a megoldások pontossága csupán körülbelül 55%-ot ért el[1]. Ez az eredmény rámutatott arra, hogy egyetlen kis hiba a következtetési láncban teljesen hibás válaszhoz vezethet.

Áttörő módszerek: Chain-of-Thought

A GSM8K feladatok megoldásában áttörést hozott a „gondolatmenet-lánc" (Chain-of-Thought, CoT) megközelítés. 2022-ben a Google kutatói megmutatták, hogy ha a modellt arra ösztönzik, hogy a válasz megadása előtt explicit módon írja le a megoldás lépéseit, a pontosság jelentősen megnő. A PaLM modell (540 milliárd paraméter) CoT alkalmazásával 58%-os pontosságot ért el[4]. A bonyolultabb self-consistency technika alkalmazása (több megoldási változat generálása és a leggyakoribb válasz kiválasztása) a pontosságot 74%-ra emelte[4].

Az emberi szint meghaladása

2023-tól kezdve a legújabb generatív modellek felülmúlták az emberi szintet ezen a benchmarkon.

  • Az OpenAI GPT-4 modellje few-shot CoT módban (amikor az utasítás néhány megoldott feladatpéldát is tartalmaz) körülbelül 92%-os pontosságot ért el[5], további stratégiákkal pedig akár 97%-ot[6].
  • Az Anthropic Claude 2 modellje 88%-os eredményt mutatott, az újabb Claude 3 verzió pedig körülbelül 95%-ot[3].

Az ilyen magas értékek az LLM-ek következtetési képességeinek jelentős fejlődéséről tanúskodnak, ugyanakkor arra is utalnak, hogy a GSM8K a csúcsmodellek számára „majdnem megoldottá" válik, ami ösztönzi a bonyolultabb benchmarkok – például a MATH és az MMLU – kidolgozását.

Szerepe a modellek tanításában és fejlesztésében

Az értékelésen túl a GSM8K aktívan használatos a modellek tanítására és javítására is.

  • Fine-tuning (finomhangolás): A lépésenkénti megoldásokat tartalmazó tanítókészlet értékes erőforrás a modellek matematikai logikán alapuló finomhangolásához.
  • Verifikátorok tanítása: Az OpenAI eredeti munkájában a GSM8K adatok egy részét egy külön verifikátor-modell tanítására használták, amely a generált megoldások helyességét értékelte. Ez a generátor és a kritikus szétválasztott tanításán alapuló megközelítés hatékonyságát bizonyította[1].
  • Prompt Engineering: A nagyszámú példa lehetővé tette a kutatók számára, hogy olyan prompt-technikákat dolgozzanak ki és finomítsanak, mint a Chain-of-Thought és a Tree-of-Thought, amelyek a modellt következtetésre tanítják anélkül, hogy annak súlyait megváltoztatnák.

Hivatkozások

  • Az adathalmaz oldala a Papers With Code-on
  • Hivatalos repozitórium a GitHubon

Irodalom

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

Megjegyzések

  1. 1.0 1.1 1.2 1.3 Cobbe, Karl et al. «Training Verifiers to Solve Math Word Problems». arXiv:2110.14168. [1]
  2. «GSM8K Dataset». Papers With Code. [2]
  3. 3.0 3.1 «GSM8K Benchmark». Klu.ai. [3]
  4. 4.0 4.1 Wei, Jason et al. «Language Models Perform Reasoning via Chain of Thought». Google Research Blog. [4]
  5. Yu, L., et al. «Solving Challenging Math Word Problems Using GPT-4». EMNLP 2023. [5]
  6. «Achieving >97% on GSM8K». arXiv:2404.14963. [6]