GSM8K (Grade School Math 8K) (PL)

From Systems analysis Wiki
Jump to navigation Jump to search

GSM8K (Grade School Math 8K) — to wzorcowy zbiór danych zawierający około 8500 tekstowych zadań matematycznych na poziomie szkolnym. Został stworzony w 2021 roku przez badaczy z OpenAI w celu oceny i rozwijania zdolności dużych modeli językowych (LLM) do wieloetapowego rozumowania matematycznego[1]. GSM8K stał się jednym z kluczowych benchmarków służących do mierzenia postępu w dziedzinie matematycznego myślenia sztucznej inteligencji.

Każde zadanie w datasecie to krótka historia tekstowa, której rozwiązanie wymaga wykonania od 2 do 8 kolejnych działań arytmetycznych (dodawanie, odejmowanie, mnożenie, dzielenie). Pomimo pozornej prostoty, zadania wymagają głębokiego rozumienia tekstu i logicznego wnioskowania, co czyni je trudnymi dla wielu LLM[2].

Kluczowe charakterystyki

Rozmiar i struktura

Dataset GSM8K zawiera około 8500 zadań, podzielonych na dwie części:

  • Zbiór treningowy: ~7500 zadań przeznaczonych do dostrajania (fine-tuning) modeli. Każde zadanie jest opatrzone szczegółowym rozwiązaniem krok po kroku.
  • Zbiór testowy: ~1000 zadań wykorzystywanych do niezależnej oceny wydajności modeli[1].

Trudność i treść

Zadania zostały celowo skonstruowane tak, aby mógł je rozwiązać zdolny uczeń szkoły średniej, lecz jednocześnie wymagają wieloetapowego rozumowania. Pozwala to testować nie tyle wiedzę matematyczną modelu, ile jej zdolność do dekompozycji problemu i sekwencyjnego wykonywania operacji logicznych.

Różnorodność językowa

Formułowania zadań w GSM8K cechują się dużą różnorodnością stylów i konstrukcji językowych. Ma to na celu sprawdzenie zdolności modeli do rozumienia treści zadań wyrażonych na różne sposoby oraz unikania „zapamiętywania" konkretnych szablonów[3].

Historia i ewolucja oceny modeli

Wczesne modele i wyniki bazowe

W oryginalnej pracy z 2021 roku autorzy wykazali, że nawet duże modele tamtego okresu, takie jak GPT-3 (175 miliardów parametrów), napotykały znaczne trudności z tym datasetem. Po dostrojeniu i zastosowaniu pomocniczego modelu-weryfikatora dokładność rozwiązywania osiągała jedynie około 55%[1]. Wynik ten pokazał, że jeden niewielki błąd w łańcuchu rozumowania może prowadzić do całkowicie błędnej odpowiedzi.

Przełomowe techniki: Chain-of-Thought

Przełomem w rozwiązywaniu zadań GSM8K stało się podejście „łańcuch rozumowania" (Chain-of-Thought, CoT). W 2022 roku badacze z Google wykazali, że nakłanianie modelu do jawnego opisywania kroków rozwiązania przed podaniem odpowiedzi znacząco zwiększa dokładność. Model PaLM (540 miliardów parametrów) z zastosowaniem CoT osiągnął dokładność 58%[4]. Użycie bardziej zaawansowanej techniki self-consistency (generowanie kilku wariantów rozwiązania i wybór najczęściej pojawiającej się odpowiedzi) pozwoliło podnieść dokładność do 74%[4].

Przekroczenie poziomu ludzkiego

Począwszy od 2023 roku, najnowsze modele generatywne przekroczyły poziom ludzki na tym benchmarku.

  • GPT-4 firmy OpenAI w trybie few-shot CoT (gdy w podpowiedzi podanych jest kilka przykładów rozwiązanych zadań) osiągnął dokładność około 92%[5], a z dodatkowymi strategiami — do 97%[6].
  • Claude 2 firmy Anthropic uzyskał wynik 88%, a nowsza wersja Claude 3 — około 95%[3].

Tak wysokie wskaźniki świadczą o znacznym postępie w zdolnościach LLM do rozumowania, wskazują jednak również na to, że GSM8K staje się „niemal rozwiązany" dla czołowych modeli, co stymuluje opracowywanie bardziej złożonych benchmarków, takich jak MATH i MMLU.

Rola w trenowaniu i rozwijaniu modeli

Pomimo funkcji oceniającej, GSM8K jest aktywnie wykorzystywany do trenowania i ulepszania modeli.

  • Fine-tuning (dostrajanie): Zbiór treningowy z rozwiązaniami krok po kroku stanowi cenne źródło do dostrajania modeli w zakresie logiki matematycznej.
  • Trenowanie weryfikatorów: W oryginalnej pracy OpenAI część danych GSM8K została wykorzystana do trenowania oddzielnego modelu-weryfikatora, który oceniał poprawność wygenerowanych rozwiązań. To podejście polegające na oddzielnym trenowaniu generatora i krytyka udowodniło swoją skuteczność[1].
  • Prompt Engineering: Duża liczba dostępnych przykładów umożliwiła badaczom opracowywanie i doskonalenie technik podpowiedzi, takich jak Chain-of-Thought i Tree-of-Thought, które uczą model rozumowania bez zmiany jego wag.

Odnośniki

  • Strona datasetu na Papers With Code
  • Oficjalne repozytorium na GitHub

Literatura

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

Przypisy

  1. 1.0 1.1 1.2 1.3 Cobbe, Karl et al. «Training Verifiers to Solve Math Word Problems». arXiv:2110.14168. [1]
  2. «GSM8K Dataset». Papers With Code. [2]
  3. 3.0 3.1 «GSM8K Benchmark». Klu.ai. [3]
  4. 4.0 4.1 Wei, Jason et al. «Language Models Perform Reasoning via Chain of Thought». Google Research Blog. [4]
  5. Yu, L., et al. «Solving Challenging Math Word Problems Using GPT-4». EMNLP 2023. [5]
  6. «Achieving >97% on GSM8K». arXiv:2404.14963. [6]