---
title: "GSM8K (Grade School Math 8K) (RO)"
source: "https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(RO)"
wiki: "systems-analysis.info/int"
article: "GSM8K_(Grade_School_Math_8K)_(RO)"
language: "ro"
categories:
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
  - "Category:Romanian"
revision_id: 2505
wiki_created_at: 2026-09-06T23:05:15Z
wiki_modified_at: 2026-09-06T23:05:15Z
downloaded_at: 2026-09-07T22:51:45Z
---

# GSM8K (Grade School Math 8K) (RO)

**GSM8K** (**Grade School Math 8K**) — este un set de date de referință care conține aproximativ 8.500 de probleme textuale de matematică de nivel școlar. A fost creat în 2021 de cercetători de la **OpenAI** pentru evaluarea și dezvoltarea capacităților marilor modele lingvistice (LLM) de raționament matematic în mai mulți pași<sup>[\[1\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(RO)#cite_note-openai2021-1)</sup>. GSM8K a devenit unul dintre principalele benchmark-uri pentru măsurarea progresului în domeniul raționamentului matematic al inteligenței artificiale.

Fiecare problemă din dataset reprezintă o scurtă poveste textuală, a cărei rezolvare necesită efectuarea a 2 până la 8 operații aritmetice consecutive (adunare, scădere, înmulțire, împărțire). În ciuda aparentei simplicități, problemele necesită o înțelegere profundă a textului și raționamente logice, ceea ce le face dificile pentru multe LLM-uri<sup>[\[2\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(RO)#cite_note-pwc-2)</sup>.

## Caracteristici cheie

### Volum și structură

Dataset-ul GSM8K conține aproximativ **8.500 de probleme**, împărțite în două părți:

- **Set de antrenament**: ~7.500 de probleme destinate *fine-tuning*-ului modelelor. Fiecare problemă este însoțită de o soluție detaliată pas cu pas.
- **Set de testare**: ~1.000 de probleme utilizate pentru evaluarea independentă a performanței modelelor<sup>[\[1\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(RO)#cite_note-openai2021-1)</sup>.

### Dificultate și conținut

Problemele sunt concepute intenționat astfel încât să poată fi rezolvate de un elev capabil de gimnaziu, însă necesită **raționamente în mai mulți pași**. Acest lucru permite testarea nu atât a cunoștințelor matematice ale modelului, cât a capacității sale de a descompune problema și de a executa secvențial operații logice.

### Diversitate lingvistică

Formulările problemelor din GSM8K se caracterizează printr-o mare varietate de stiluri și construcții lingvistice. Aceasta este menită să verifice capacitatea modelelor de a înțelege condițiile problemelor exprimate în moduri diferite și de a evita „memorarea" unor șabloane specifice<sup>[\[3\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(RO)#cite_note-klu_benchmark-3)</sup>.

## Istorie și evoluția evaluării modelelor

### Modele timpurii și rezultate de bază

În lucrarea originală din 2021, autorii au demonstrat că inclusiv modelele mari ale acelei perioade, precum **GPT-3** (175 miliarde de parametri), întâmpinau dificultăți semnificative cu dataset-ul. După fine-tuning și utilizarea unui model-verificator auxiliar, acuratețea rezolvării atingea doar aproximativ **55%**<sup>[\[1\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(RO)#cite_note-openai2021-1)</sup>. Acest rezultat a demonstrat că o singură eroare mică în lanțul de raționament poate conduce la un răspuns complet greșit.

### Metode revoluționare: Chain-of-Thought

O descoperire importantă în rezolvarea problemelor GSM8K a fost abordarea **„lanțului de raționament"** (**Chain-of-Thought, CoT**). În 2022, cercetători de la Google au arătat că, dacă modelul este îndemnat să descrie explicit pașii de rezolvare înainte de a furniza răspunsul, acuratețea crește semnificativ. Modelul **PaLM** (540 miliarde de parametri) utilizând CoT a atins o acuratețe de **58%**<sup>[\[4\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(RO)#cite_note-google_cot-4)</sup>. Aplicarea tehnicii mai complexe de **self-consistency** (generarea mai multor variante de soluție și selectarea răspunsului cel mai frecvent) a permis ridicarea acurateței la **74%**<sup>[\[4\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(RO)#cite_note-google_cot-4)</sup>.

### Depășirea nivelului uman

Începând cu 2023, cele mai noi modele generative au depășit nivelul uman la acest benchmark.

- **GPT-4** de la OpenAI în modul *few-shot CoT* (când în prompt sunt furnizate câteva exemple de probleme rezolvate) a atins o acuratețe de aproximativ **92%**<sup>[\[5\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(RO)#cite_note-gpt4_92-5)</sup>, iar cu strategii suplimentare — până la **97%**<sup>[\[6\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(RO)#cite_note-gpt4_97-6)</sup>.
- **Claude 2** de la Anthropic a obținut rezultatul de **88%**, iar versiunea mai nouă **Claude 3** — aproximativ **95%**<sup>[\[3\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(RO)#cite_note-klu_benchmark-3)</sup>.

Acești indicatori ridicați atestă un progres semnificativ în capacitățile de raționament ale LLM-urilor, însă indică totodată că GSM8K devine „aproape rezolvat" pentru modelele de vârf, ceea ce stimulează dezvoltarea unor benchmark-uri mai complexe, precum **MATH** și **MMLU**.

## Rolul în antrenarea și dezvoltarea modelelor

Pe lângă evaluare, GSM8K este utilizat activ pentru **antrenarea și îmbunătățirea** modelelor.

- **Fine-tuning (reantrenare)**: Setul de antrenament cu soluții pas cu pas reprezintă o resursă valoroasă pentru fine-tuning-ul modelelor în logica matematică.
- **Antrenarea verificatoarelor**: În lucrarea originală a OpenAI, o parte din datele GSM8K a fost utilizată pentru antrenarea unui model-**verificator** separat, care evalua corectitudinea soluțiilor generate. Această abordare de antrenare separată a generatorului și a criticului și-a dovedit eficiența<sup>[\[1\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(RO)#cite_note-openai2021-1)</sup>.
- **Prompt Engineering**: Disponibilitatea unui număr mare de exemple le-a permis cercetătorilor să dezvolte și să rafineze tehnici de prompt, precum **Chain-of-Thought** și **Tree-of-Thought**, care învață modelul să raționeze fără a-i modifica ponderile.

## Referințe

- Pagina dataset-ului pe Papers With Code
- Depozitul oficial pe GitHub

## Bibliografie

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## Note

1.  <span id="cite_note-openai2021-1">↑ <sup>[1.0](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(RO)#cite_ref-openai2021_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(RO)#cite_ref-openai2021_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(RO)#cite_ref-openai2021_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(RO)#cite_ref-openai2021_1-3)</sup> Cobbe, Karl et al. «Training Verifiers to Solve Math Word Problems». *arXiv:2110.14168*. <a href="https://arxiv.org/abs/2110.14168" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-pwc-2">[↑](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(RO)#cite_ref-pwc_2-0) «GSM8K Dataset». *Papers With Code*. <a href="https://paperswithcode.com/dataset/gsm8k" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-klu_benchmark-3">↑ <sup>[3.0](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(RO)#cite_ref-klu_benchmark_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(RO)#cite_ref-klu_benchmark_3-1)</sup> «GSM8K Benchmark». *Klu.ai*. <a href="https://klu.ai/glossary/GSM8K-eval" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-google_cot-4">↑ <sup>[4.0](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(RO)#cite_ref-google_cot_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(RO)#cite_ref-google_cot_4-1)</sup> Wei, Jason et al. «Language Models Perform Reasoning via Chain of Thought». *Google Research Blog*. <a href="https://research.google/blog/language-models-perform-reasoning-via-chain-of-thought/" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-gpt4_92-5">[↑](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(RO)#cite_ref-gpt4_92_5-0) Yu, L., et al. «Solving Challenging Math Word Problems Using GPT-4». *EMNLP 2023*. <a href="https://aclanthology.org/2023.emnlp-main.927.pdf" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-gpt4_97-6">[↑](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(RO)#cite_ref-gpt4_97_6-0) «Achieving \>97% on GSM8K». *arXiv:2404.14963*. <a href="https://arxiv.org/html/2404.14963v4" class="external autonumber" rel="nofollow">[6]</a></span>
