GSM8K (Grade School Math 8K) (UR)

From Systems analysis Wiki
Jump to navigation Jump to search

GSM8K (Grade School Math 8K) — یہ ایک معیاری dataset ہے جس میں اسکول کی سطح کے تقریباً 8,500 متنی ریاضی کے مسائل شامل ہیں۔ اسے 2021 میں OpenAI کے محققین نے بڑے لینگویج ماڈلز (LLM) کی کثیر مرحلاتی ریاضیاتی استدلال کی صلاحیتوں کی جانچ اور ترقی کے لیے تیار کیا تھا[1]۔ GSM8K مصنوعی ذہانت کی ریاضیاتی سوچ کے میدان میں پیشرفت کی پیمائش کے لیے ایک اہم benchmark بن گیا ہے۔

dataset میں موجود ہر مسئلہ ایک مختصر متنی کہانی پر مشتمل ہوتا ہے، جس کے حل کے لیے 2 سے 8 مسلسل حسابی عملیات (جمع، تفریق، ضرب، تقسیم) کی ضرورت ہوتی ہے۔ بظاہر سادہ نظر آنے کے باوجود، یہ مسائل متن کی گہری سمجھ اور منطقی استدلال کا تقاضا کرتے ہیں، جو انہیں بہت سے LLM کے لیے مشکل بنا دیتا ہے[2]۔

اہم خصوصیات

حجم اور ساخت

GSM8K dataset میں تقریباً 8500 مسائل ہیں، جو دو حصوں میں تقسیم ہیں:

  • تربیتی مجموعہ: تقریباً 7500 مسائل، جو ماڈلز کے fine-tuning کے لیے مختص ہیں۔ ہر مسئلے کے ساتھ مفصل مرحلہ وار حل موجود ہے۔
  • آزمائشی مجموعہ: تقریباً 1000 مسائل، جو ماڈلز کی کارکردگی کی آزادانہ جانچ کے لیے استعمال ہوتے ہیں[1]۔

دشواری اور مواد

مسائل کو جان بوجھ کر اس طرح مرتب کیا گیا ہے کہ ایک قابل ہائی اسکول طالب علم انہیں حل کر سکے، تاہم ان کے لیے کثیر مرحلاتی استدلال ضروری ہے۔ اس سے ماڈل کی ریاضیاتی معلومات کو نہیں بلکہ مسئلے کو ٹکڑوں میں تقسیم کرنے اور منطقی عملیات کو ترتیب وار انجام دینے کی صلاحیت کو جانچا جاتا ہے۔

لسانی تنوع

GSM8K میں مسائل کی عبارتیں اسلوب اور لسانی ساختوں کے لحاظ سے بڑی متنوع ہیں۔ یہ اس لیے کیا گیا ہے تاکہ ماڈلز کی مختلف طریقوں سے بیان کردہ سوالات کو سمجھنے کی صلاحیت کو جانچا جا سکے اور مخصوص نمونوں کی رٹائی سے بچا جا سکے[3]۔

ماڈلز کی جانچ کی تاریخ اور ارتقاء

ابتدائی ماڈلز اور بنیادی نتائج

2021 کے اصل مقالے میں مصنفین نے دکھایا کہ اس وقت کے بڑے ماڈلز بھی، جیسے GPT-3 (175 ارب پیرامیٹرز)، اس dataset میں نمایاں مشکلات کا سامنا کرتے تھے۔ fine-tuning اور ایک معاون verification ماڈل کے استعمال کے بعد بھی درستگی صرف تقریباً 55% تک پہنچ سکی[1]۔ اس نتیجے نے واضح کیا کہ استدلال کی زنجیر میں ایک معمولی غلطی بھی مکمل طور پر غلط جواب کا باعث بن سکتی ہے۔

اہم پیش رفت: Chain-of-Thought

GSM8K کے مسائل حل کرنے میں ایک اہم پیش رفت «Chain-of-Thought, CoT» (سلسلۂ استدلال) کا طریقہ کار تھا۔ 2022 میں Google کے محققین نے ظاہر کیا کہ اگر ماڈل کو جواب دینے سے پہلے حل کے مراحل واضح طور پر لکھنے پر مجبور کیا جائے تو درستگی نمایاں طور پر بڑھ جاتی ہے۔ CoT کے ساتھ PaLM ماڈل (540 ارب پیرامیٹرز) نے 58% درستگی حاصل کی[4]۔ زیادہ پیچیدہ تکنیک self-consistency (کئی حل کے متبادلات تیار کرنا اور سب سے زیادہ بار آنے والا جواب منتخب کرنا) کے استعمال سے درستگی 74% تک پہنچانا ممکن ہوا[4]۔

انسانی سطح سے تجاوز

2023 سے نئے جنریٹو ماڈلز نے اس benchmark پر انسانی سطح کو پیچھے چھوڑ دیا۔

  • OpenAI کے GPT-4 نے few-shot CoT موڈ میں (جب اشارے میں چند حل شدہ مسائل کی مثالیں دی جاتی ہیں) تقریباً 92% درستگی حاصل کی[5]، اور اضافی حکمت عملیوں کے ساتھ 97% تک پہنچا[6]۔
  • Anthropic کے Claude 2 نے 88% کا نتیجہ دکھایا، اور زیادہ نئے ورژن Claude 3 نے تقریباً 95% حاصل کیا[3]۔

اس قدر بلند اعداد LLM کی استدلال کی صلاحیتوں میں نمایاں پیشرفت کی نشاندہی کرتے ہیں، تاہم یہ اس بات کی طرف بھی اشارہ کرتے ہیں کہ GSM8K جدید ترین ماڈلز کے لیے تقریباً حل شدہ ہوتا جا رہا ہے، جو MATH اور MMLU جیسے زیادہ پیچیدہ benchmarks کی تیاری کی ترغیب دیتا ہے۔

ماڈلز کی تربیت اور ترقی میں کردار

جانچ کے علاوہ، GSM8K کو ماڈلز کی تربیت اور بہتری کے لیے بھی فعال طور پر استعمال کیا جاتا ہے۔

  • Fine-tuning (دوبارہ تربیت): مرحلہ وار حل کے ساتھ تربیتی مجموعہ ماڈلز کو ریاضیاتی منطق سکھانے کے لیے ایک قیمتی وسیلہ ہے۔
  • Verification ماڈل کی تربیت: OpenAI کے اصل مقالے میں GSM8K کا ایک حصہ ایک الگ verification ماڈل کی تربیت کے لیے استعمال کیا گیا، جو تیار کردہ حلوں کی درستگی کا اندازہ لگاتا تھا۔ Generator اور Critic کی علیحدہ تربیت کا یہ طریقہ کارگر ثابت ہوا[1]۔
  • Prompt Engineering: بڑی تعداد میں مثالوں کی موجودگی نے محققین کو Chain-of-Thought اور Tree-of-Thought جیسی اشارہ دینے کی تکنیکیں تیار کرنے اور نکھارنے کا موقع دیا، جو ماڈل کے وزن میں تبدیلی کیے بغیر اسے استدلال سکھاتی ہیں۔

روابط

  • Papers With Code پر dataset کا صفحہ
  • GitHub پر سرکاری ذخیرہ

کتابیات

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

حواشی

  1. 1.0 1.1 1.2 1.3 Cobbe, Karl et al. «Training Verifiers to Solve Math Word Problems». arXiv:2110.14168. [1]
  2. «GSM8K Dataset». Papers With Code. [2]
  3. 3.0 3.1 «GSM8K Benchmark». Klu.ai. [3]
  4. 4.0 4.1 Wei, Jason et al. «Language Models Perform Reasoning via Chain of Thought». Google Research Blog. [4]
  5. Yu, L., et al. «Solving Challenging Math Word Problems Using GPT-4». EMNLP 2023. [5]
  6. «Achieving >97% on GSM8K». arXiv:2404.14963. [6]