---
title: "GSM8K (Grade School Math 8K) (FA)"
source: "https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(FA)"
wiki: "systems-analysis.info/int"
article: "GSM8K_(Grade_School_Math_8K)_(FA)"
language: "fa"
categories:
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
  - "Category:Persian"
revision_id: 2494
wiki_created_at: 2026-09-06T23:05:04Z
wiki_modified_at: 2026-09-06T23:05:04Z
downloaded_at: 2026-09-07T22:51:42Z
---

# GSM8K (Grade School Math 8K) (FA)

**GSM8K** (**Grade School Math 8K**) — یک مجموعه داده مرجع است که حاوی حدود ۸٫۵ هزار مسئله متنی ریاضی در سطح مدرسه می‌باشد. این مجموعه در سال ۲۰۲۱ توسط پژوهشگران **OpenAI** برای ارزیابی و توسعه توانایی‌های مدل‌های زبانی بزرگ (LLM) در استدلال‌های ریاضی چندمرحله‌ای ساخته شد<sup>[\[1\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(FA)#cite_note-openai2021-1)</sup>. GSM8K به یکی از benchmark‌های کلیدی برای اندازه‌گیری پیشرفت در حوزه تفکر ریاضی هوش مصنوعی تبدیل شده است.

هر مسئله در این dataset به صورت یک داستان متنی کوتاه است که حل آن نیازمند انجام ۲ تا ۸ عمل حسابی متوالی (جمع، تفریق، ضرب، تقسیم) می‌باشد. علی‌رغم سادگی ظاهری، این مسائل نیازمند درک عمیق متن و استدلال منطقی هستند که آن‌ها را برای بسیاری از LLM‌ها دشوار می‌سازد<sup>[\[2\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(FA)#cite_note-pwc-2)</sup>.

## ویژگی‌های کلیدی

### حجم و ساختار

دataset GSM8K حاوی حدود **۸۵۰۰ مسئله** است که به دو بخش تقسیم می‌شوند:

- **مجموعه آموزشی**: ~۷۵۰۰ مسئله، که برای *fine-tuning* مدل‌ها در نظر گرفته شده‌اند. هر مسئله دارای یک راه‌حل گام‌به‌گام تفصیلی است.
- **مجموعه آزمایشی**: ~۱۰۰۰ مسئله، که برای ارزیابی مستقل عملکرد مدل‌ها استفاده می‌شوند<sup>[\[1\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(FA)#cite_note-openai2021-1)</sup>.

### دشواری و محتوا

مسائل به گونه‌ای طراحی شده‌اند که یک دانش‌آموز مستعد مقطع متوسطه بتواند آن‌ها را حل کند، اما در عین حال نیازمند **استدلال‌های چندمرحله‌ای** هستند. این امر به جای سنجش دانش ریاضی مدل، توانایی آن در تجزیه مسئله و اجرای متوالی عملیات منطقی را به آزمون می‌گذارد.

### تنوع زبانی

صورت‌بندی مسائل در GSM8K از تنوع زیادی در سبک‌ها و ساختارهای زبانی برخوردار است. این کار برای بررسی توانایی مدل‌ها در درک شرایط مسائل بیان‌شده به روش‌های مختلف و جلوگیری از «حفظ» الگوهای خاص انجام شده است<sup>[\[3\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(FA)#cite_note-klu_benchmark-3)</sup>.

## تاریخچه و تکامل ارزیابی مدل‌ها

### مدل‌های اولیه و نتایج پایه

در مقاله اصلی سال ۲۰۲۱، نویسندگان نشان دادند که حتی مدل‌های بزرگ آن زمان، مانند **GPT-3** (۱۷۵ میلیارد پارامتر)، با این dataset با مشکلات قابل توجهی مواجه بودند. پس از fine-tuning و استفاده از یک مدل تأییدکننده کمکی، دقت حل مسائل تنها به حدود **۵۵٪** رسید<sup>[\[1\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(FA)#cite_note-openai2021-1)</sup>. این نتیجه نشان داد که یک خطای کوچک در زنجیره استدلال می‌تواند به پاسخ کاملاً اشتباه منجر شود.

### روش‌های پیشگام: Chain-of-Thought

رویکرد **«زنجیره استدلال»** (**Chain-of-Thought, CoT**) نقطه عطفی در حل مسائل GSM8K بود. در سال ۲۰۲۲، پژوهشگران Google نشان دادند که اگر مدل را تشویق کنیم تا گام‌های حل را پیش از ارائه پاسخ به صراحت توضیح دهد، دقت به طور قابل توجهی افزایش می‌یابد. مدل **PaLM** (۵۴۰ میلیارد پارامتر) با استفاده از CoT به دقت **۵۸٪** دست یافت<sup>[\[4\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(FA)#cite_note-google_cot-4)</sup>. به‌کارگیری تکنیک پیچیده‌تر **self-consistency** (تولید چندین راه‌حل و انتخاب پاسخ متداول‌تر) دقت را تا **۷۴٪** ارتقا داد<sup>[\[4\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(FA)#cite_note-google_cot-4)</sup>.

### فراتر رفتن از سطح انسانی

از سال ۲۰۲۳ به بعد، جدیدترین مدل‌های مولد از سطح انسانی در این benchmark پیشی گرفتند.

- **GPT-4** از OpenAI در حالت *few-shot CoT* (زمانی که چند نمونه مسئله حل‌شده در prompt ارائه می‌شود) به دقت حدود **۹۲٪** رسید<sup>[\[5\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(FA)#cite_note-gpt4_92-5)</sup>، و با راهبردهای اضافی تا **۹۷٪**<sup>[\[6\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(FA)#cite_note-gpt4_97-6)</sup>.
- **Claude 2** از Anthropic نتیجه **۸۸٪** را نشان داد، و نسخه جدیدتر **Claude 3** — حدود **۹۵٪**<sup>[\[3\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(FA)#cite_note-klu_benchmark-3)</sup>.

چنین امتیازات بالایی نشان‌دهنده پیشرفت قابل توجه در توانایی‌های استدلالی LLM‌ها است، اما همچنین حاکی از آن است که GSM8K برای مدل‌های پیشرفته «تقریباً حل‌شده» می‌شود، که این امر توسعه benchmark‌های پیچیده‌تری مانند **MATH** و **MMLU** را تشویق می‌کند.

## نقش در آموزش و توسعه مدل‌ها

علاوه بر ارزیابی، GSM8K به طور فعال برای **آموزش و بهبود** مدل‌ها استفاده می‌شود.

- **Fine-tuning (دقیق‌سازی)**: مجموعه آموزشی با راه‌حل‌های گام‌به‌گام منبع ارزشمندی برای fine-tuning مدل‌ها در منطق ریاضی است.
- **آموزش تأییدکننده‌ها**: در مقاله اصلی OpenAI، بخشی از داده‌های GSM8K برای آموزش یک مدل **تأییدکننده** جداگانه استفاده شد که صحت راه‌حل‌های تولیدشده را ارزیابی می‌کرد. این رویکرد آموزش جداگانه مولد و منتقد کارایی خود را به اثبات رسانده است<sup>[\[1\]](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(FA)#cite_note-openai2021-1)</sup>.
- **Prompt Engineering**: وجود تعداد زیادی نمونه به پژوهشگران اجازه داده تکنیک‌های prompt را مانند **Chain-of-Thought** و **Tree-of-Thought** توسعه داده و تکمیل کنند، که مدل را بدون تغییر وزن‌هایش به استدلال وا می‌دارند.

## پیوندها

- صفحه dataset در Papers With Code
- مخزن رسمی در GitHub

## منابع

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## یادداشت‌ها

1.  <span id="cite_note-openai2021-1">↑ <sup>[1.0](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(FA)#cite_ref-openai2021_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(FA)#cite_ref-openai2021_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(FA)#cite_ref-openai2021_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(FA)#cite_ref-openai2021_1-3)</sup> Cobbe, Karl et al. «Training Verifiers to Solve Math Word Problems». *arXiv:2110.14168*. <a href="https://arxiv.org/abs/2110.14168" class="external autonumber" rel="nofollow">[۱]</a></span>
2.  <span id="cite_note-pwc-2">[↑](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(FA)#cite_ref-pwc_2-0) «GSM8K Dataset». *Papers With Code*. <a href="https://paperswithcode.com/dataset/gsm8k" class="external autonumber" rel="nofollow">[۲]</a></span>
3.  <span id="cite_note-klu_benchmark-3">↑ <sup>[3.0](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(FA)#cite_ref-klu_benchmark_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(FA)#cite_ref-klu_benchmark_3-1)</sup> «GSM8K Benchmark». *Klu.ai*. <a href="https://klu.ai/glossary/GSM8K-eval" class="external autonumber" rel="nofollow">[۳]</a></span>
4.  <span id="cite_note-google_cot-4">↑ <sup>[4.0](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(FA)#cite_ref-google_cot_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(FA)#cite_ref-google_cot_4-1)</sup> Wei, Jason et al. «Language Models Perform Reasoning via Chain of Thought». *Google Research Blog*. <a href="https://research.google/blog/language-models-perform-reasoning-via-chain-of-thought/" class="external autonumber" rel="nofollow">[۴]</a></span>
5.  <span id="cite_note-gpt4_92-5">[↑](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(FA)#cite_ref-gpt4_92_5-0) Yu, L., et al. «Solving Challenging Math Word Problems Using GPT-4». *EMNLP 2023*. <a href="https://aclanthology.org/2023.emnlp-main.927.pdf" class="external autonumber" rel="nofollow">[۵]</a></span>
6.  <span id="cite_note-gpt4_97-6">[↑](https://systems-analysis.info/int/GSM8K_(Grade_School_Math_8K)_(FA)#cite_ref-gpt4_97_6-0) «Achieving \>97% on GSM8K». *arXiv:2404.14963*. <a href="https://arxiv.org/html/2404.14963v4" class="external autonumber" rel="nofollow">[۶]</a></span>
