---
title: "GSM8K (Grade School Math 8K) (PL)"
source: "https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(PL)"
wiki: "systems-analysis.info/int"
article: "GSM8K_(Grade_School_Math_8K)_(PL)"
language: "pl"
categories:
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
  - "Category:Polish"
revision_id: 2503
wiki_created_at: 2026-09-06T23:05:13Z
wiki_modified_at: 2026-09-06T23:05:13Z
downloaded_at: 2026-09-07T22:51:45Z
---

# GSM8K (Grade School Math 8K) (PL)

**GSM8K** (**Grade School Math 8K**) — to wzorcowy zbiór danych zawierający około 8500 tekstowych zadań matematycznych na poziomie szkolnym. Został stworzony w 2021 roku przez badaczy z **OpenAI** w celu oceny i rozwijania zdolności dużych modeli językowych (LLM) do wieloetapowego rozumowania matematycznego<sup>[\[1\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(PL)#cite_note-openai2021-1)</sup>. GSM8K stał się jednym z kluczowych benchmarków służących do mierzenia postępu w dziedzinie matematycznego myślenia sztucznej inteligencji.

Każde zadanie w datasecie to krótka historia tekstowa, której rozwiązanie wymaga wykonania od 2 do 8 kolejnych działań arytmetycznych (dodawanie, odejmowanie, mnożenie, dzielenie). Pomimo pozornej prostoty, zadania wymagają głębokiego rozumienia tekstu i logicznego wnioskowania, co czyni je trudnymi dla wielu LLM<sup>[\[2\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(PL)#cite_note-pwc-2)</sup>.

## Kluczowe charakterystyki

### Rozmiar i struktura

Dataset GSM8K zawiera około **8500 zadań**, podzielonych na dwie części:

- **Zbiór treningowy**: ~7500 zadań przeznaczonych do dostrajania (*fine-tuning*) modeli. Każde zadanie jest opatrzone szczegółowym rozwiązaniem krok po kroku.
- **Zbiór testowy**: ~1000 zadań wykorzystywanych do niezależnej oceny wydajności modeli<sup>[\[1\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(PL)#cite_note-openai2021-1)</sup>.

### Trudność i treść

Zadania zostały celowo skonstruowane tak, aby mógł je rozwiązać zdolny uczeń szkoły średniej, lecz jednocześnie wymagają **wieloetapowego rozumowania**. Pozwala to testować nie tyle wiedzę matematyczną modelu, ile jej zdolność do dekompozycji problemu i sekwencyjnego wykonywania operacji logicznych.

### Różnorodność językowa

Formułowania zadań w GSM8K cechują się dużą różnorodnością stylów i konstrukcji językowych. Ma to na celu sprawdzenie zdolności modeli do rozumienia treści zadań wyrażonych na różne sposoby oraz unikania „zapamiętywania" konkretnych szablonów<sup>[\[3\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(PL)#cite_note-klu_benchmark-3)</sup>.

## Historia i ewolucja oceny modeli

### Wczesne modele i wyniki bazowe

W oryginalnej pracy z 2021 roku autorzy wykazali, że nawet duże modele tamtego okresu, takie jak **GPT-3** (175 miliardów parametrów), napotykały znaczne trudności z tym datasetem. Po dostrojeniu i zastosowaniu pomocniczego modelu-weryfikatora dokładność rozwiązywania osiągała jedynie około **55%**<sup>[\[1\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(PL)#cite_note-openai2021-1)</sup>. Wynik ten pokazał, że jeden niewielki błąd w łańcuchu rozumowania może prowadzić do całkowicie błędnej odpowiedzi.

### Przełomowe techniki: Chain-of-Thought

Przełomem w rozwiązywaniu zadań GSM8K stało się podejście **„łańcuch rozumowania"** (**Chain-of-Thought, CoT**). W 2022 roku badacze z Google wykazali, że nakłanianie modelu do jawnego opisywania kroków rozwiązania przed podaniem odpowiedzi znacząco zwiększa dokładność. Model **PaLM** (540 miliardów parametrów) z zastosowaniem CoT osiągnął dokładność **58%**<sup>[\[4\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(PL)#cite_note-google_cot-4)</sup>. Użycie bardziej zaawansowanej techniki **self-consistency** (generowanie kilku wariantów rozwiązania i wybór najczęściej pojawiającej się odpowiedzi) pozwoliło podnieść dokładność do **74%**<sup>[\[4\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(PL)#cite_note-google_cot-4)</sup>.

### Przekroczenie poziomu ludzkiego

Począwszy od 2023 roku, najnowsze modele generatywne przekroczyły poziom ludzki na tym benchmarku.

- **GPT-4** firmy OpenAI w trybie *few-shot CoT* (gdy w podpowiedzi podanych jest kilka przykładów rozwiązanych zadań) osiągnął dokładność około **92%**<sup>[\[5\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(PL)#cite_note-gpt4_92-5)</sup>, a z dodatkowymi strategiami — do **97%**<sup>[\[6\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(PL)#cite_note-gpt4_97-6)</sup>.
- **Claude 2** firmy Anthropic uzyskał wynik **88%**, a nowsza wersja **Claude 3** — około **95%**<sup>[\[3\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(PL)#cite_note-klu_benchmark-3)</sup>.

Tak wysokie wskaźniki świadczą o znacznym postępie w zdolnościach LLM do rozumowania, wskazują jednak również na to, że GSM8K staje się „niemal rozwiązany" dla czołowych modeli, co stymuluje opracowywanie bardziej złożonych benchmarków, takich jak **MATH** i **MMLU**.

## Rola w trenowaniu i rozwijaniu modeli

Pomimo funkcji oceniającej, GSM8K jest aktywnie wykorzystywany do **trenowania i ulepszania** modeli.

- **Fine-tuning (dostrajanie)**: Zbiór treningowy z rozwiązaniami krok po kroku stanowi cenne źródło do dostrajania modeli w zakresie logiki matematycznej.
- **Trenowanie weryfikatorów**: W oryginalnej pracy OpenAI część danych GSM8K została wykorzystana do trenowania oddzielnego modelu-**weryfikatora**, który oceniał poprawność wygenerowanych rozwiązań. To podejście polegające na oddzielnym trenowaniu generatora i krytyka udowodniło swoją skuteczność<sup>[\[1\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(PL)#cite_note-openai2021-1)</sup>.
- **Prompt Engineering**: Duża liczba dostępnych przykładów umożliwiła badaczom opracowywanie i doskonalenie technik podpowiedzi, takich jak **Chain-of-Thought** i **Tree-of-Thought**, które uczą model rozumowania bez zmiany jego wag.

## Odnośniki

- Strona datasetu na Papers With Code
- Oficjalne repozytorium na GitHub

## Literatura

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## Przypisy

1.  <span id="cite_note-openai2021-1">↑ <sup>[1.0](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(PL)#cite_ref-openai2021_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(PL)#cite_ref-openai2021_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(PL)#cite_ref-openai2021_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(PL)#cite_ref-openai2021_1-3)</sup> Cobbe, Karl et al. «Training Verifiers to Solve Math Word Problems». *arXiv:2110.14168*. <a href="https://arxiv.org/abs/2110.14168" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-pwc-2">[↑](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(PL)#cite_ref-pwc_2-0) «GSM8K Dataset». *Papers With Code*. <a href="https://paperswithcode.com/dataset/gsm8k" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-klu_benchmark-3">↑ <sup>[3.0](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(PL)#cite_ref-klu_benchmark_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(PL)#cite_ref-klu_benchmark_3-1)</sup> «GSM8K Benchmark». *Klu.ai*. <a href="https://klu.ai/glossary/GSM8K-eval" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-google_cot-4">↑ <sup>[4.0](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(PL)#cite_ref-google_cot_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(PL)#cite_ref-google_cot_4-1)</sup> Wei, Jason et al. «Language Models Perform Reasoning via Chain of Thought». *Google Research Blog*. <a href="https://research.google/blog/language-models-perform-reasoning-via-chain-of-thought/" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-gpt4_92-5">[↑](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(PL)#cite_ref-gpt4_92_5-0) Yu, L., et al. «Solving Challenging Math Word Problems Using GPT-4». *EMNLP 2023*. <a href="https://aclanthology.org/2023.emnlp-main.927.pdf" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-gpt4_97-6">[↑](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(PL)#cite_ref-gpt4_97_6-0) «Achieving \>97% on GSM8K». *arXiv:2404.14963*. <a href="https://arxiv.org/html/2404.14963v4" class="external autonumber" rel="nofollow">[6]</a></span>
