GSM8K (Grade School Math 8K) (CS)
GSM8K (Grade School Math 8K) — je referenční dataset obsahující přibližně 8 500 textových matematických úloh na úrovni základní školy. Byl vytvořen v roce 2021 výzkumníky z OpenAI za účelem hodnocení a rozvoje schopností velkých jazykových modelů (LLM) k víceúrovňovým matematickým úvahám[1]. GSM8K se stal jedním z klíčových benchmarků pro měření pokroku v oblasti matematického myšlení umělé inteligence.
Každá úloha v datasetu představuje krátký textový příběh, jehož řešení vyžaduje provedení 2 až 8 po sobě jdoucích aritmetických operací (sčítání, odčítání, násobení, dělení). Navzdory zdánlivé jednoduchosti úlohy vyžadují hluboké porozumění textu a logické uvažování, což je činí náročnými pro mnoho LLM[2].
Klíčové charakteristiky
Rozsah a struktura
Dataset GSM8K obsahuje přibližně 8 500 úloh, které jsou rozděleny do dvou částí:
- Trénovací sada: ~7 500 úloh určených pro doladění (fine-tuning) modelů. Každá úloha je opatřena podrobným postupným řešením.
- Testovací sada: ~1 000 úloh používaných pro nezávislé hodnocení výkonu modelů[1].
Obtížnost a obsah
Úlohy jsou záměrně sestaveny tak, aby je dokázal vyřešit schopný žák základní školy, avšak zároveň vyžadují víceúrovňové uvažování. To umožňuje testovat nikoli tolik matematické znalosti modelu, jako spíše její schopnost dekompozice problému a postupného provádění logických operací.
Jazyková rozmanitost
Formulace úloh v GSM8K se vyznačují velkou rozmanitostí stylů a jazykových konstrukcí. To je provedeno za účelem ověření schopnosti modelů porozumět podmínkám úloh vyjádřeným různými způsoby a vyhnout se \"memorování\" konkrétních šablon[3].
Historie a vývoj hodnocení modelů
Rané modely a základní výsledky
V původní práci z roku 2021 autoři ukázali, že i velké modely tehdejší doby, jako například GPT-3 (175 miliard parametrů), měly s datasetem značné potíže. Po doladění a použití pomocného modelu-verifikátoru dosahovala přesnost řešení pouze přibližně 55 %[1]. Tento výsledek demonstroval, že jediná malá chyba v řetězci úvah může vést k zcela nesprávné odpovědi.
Průlomové metody: Chain-of-Thought
Průlomem v řešení úloh GSM8K se stal přístup „řetězec úvah" (Chain-of-Thought, CoT). V roce 2022 výzkumníci z Google ukázali, že pokud je model podněcován k tomu, aby explicitně rozepsal kroky řešení před výstupem odpovědi, přesnost výrazně roste. Model PaLM (540 miliard parametrů) s použitím CoT dosáhl přesnosti 58 %[4]. Použití složitější techniky self-consistency (generování několika variant řešení a výběr nejčastější odpovědi) umožnilo zvýšit přesnost na 74 %[4].
Překonání lidské úrovně
Od roku 2023 nejnovější generativní modely překonaly lidskou úroveň na tomto benchmarku.
- GPT-4 od OpenAI v režimu few-shot CoT (kdy jsou v nápovědě uvedeny příklady vyřešených úloh) dosáhl přesnosti přibližně 92 %[5], a s dalšími strategiemi — až 97 %[6].
- Claude 2 od Anthropic dosáhl výsledku 88 %, a novější verze Claude 3 — přibližně 95 %[3].
Taková vysoká skóre svědčí o výrazném pokroku ve schopnostech LLM k uvažování, avšak také naznačují, že GSM8K se stává „téměř vyřešeným" pro špičkové modely, což stimuluje vývoj náročnějších benchmarků, jako jsou MATH a MMLU.
Role při trénování a rozvoji modelů
Kromě hodnocení je GSM8K aktivně využíván pro trénování a zdokonalování modelů.
- Fine-tuning (doladění): Trénovací sada s postupnými řešeními je cenným zdrojem pro doladění modelů v oblasti matematické logiky.
- Trénování verifikátorů: V původní práci OpenAI byla část dat GSM8K použita pro trénování samostatného modelu-verifikátoru, který hodnotil správnost vygenerovaných řešení. Tento přístup odděleného trénování generátoru a kritika prokázal svou účinnost[1].
- Prompt Engineering: Existence velkého počtu příkladů umožnila výzkumníkům vyvíjet a zdokonalovat techniky nápověd, jako jsou Chain-of-Thought a Tree-of-Thought, které učí model uvažovat bez změny jeho vah.
Odkazy
- Stránka datasetu na Papers With Code
- Oficiální repozitář na GitHub
Literatura
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
Poznámky
- ↑ 1.0 1.1 1.2 1.3 Cobbe, Karl et al. «Training Verifiers to Solve Math Word Problems». arXiv:2110.14168. [1]
- ↑ «GSM8K Dataset». Papers With Code. [2]
- ↑ 3.0 3.1 «GSM8K Benchmark». Klu.ai. [3]
- ↑ 4.0 4.1 Wei, Jason et al. «Language Models Perform Reasoning via Chain of Thought». Google Research Blog. [4]
- ↑ Yu, L., et al. «Solving Challenging Math Word Problems Using GPT-4». EMNLP 2023. [5]
- ↑ «Achieving >97% on GSM8K». arXiv:2404.14963. [6]