GSM8K (Grade School Math 8K) (HI)

From Systems analysis Wiki
Jump to navigation Jump to search

GSM8K (Grade School Math 8K) — यह एक मानक dataset है जिसमें लगभग 8,500 स्कूल स्तर की गणितीय पाठ्य समस्याएँ शामिल हैं। इसे 2021 में OpenAI के शोधकर्ताओं द्वारा बड़े भाषा मॉडलों (LLM) की बहु-चरणीय गणितीय तर्क-क्षमता के मूल्यांकन और विकास के लिए बनाया गया था[1]। GSM8K कृत्रिम बुद्धिमत्ता की गणितीय सोच के क्षेत्र में प्रगति मापने के प्रमुख benchmark में से एक बन गया है।

Dataset में प्रत्येक समस्या एक छोटी पाठ्य कहानी के रूप में होती है, जिसे हल करने के लिए 2 से 8 क्रमिक अंकगणितीय क्रियाओं (जोड़, घटाव, गुणा, भाग) की आवश्यकता होती है।겉보기में सरल लगने के बावजूद, इन समस्याओं को हल करने के लिए पाठ की गहरी समझ और तार्किक तर्क-शक्ति की आवश्यकता होती है, जो इन्हें कई LLM के लिए चुनौतीपूर्ण बनाती है[2]

मुख्य विशेषताएँ

आकार और संरचना

GSM8K dataset में लगभग 8500 समस्याएँ हैं, जो दो भागों में विभाजित हैं:

  • प्रशिक्षण सेट: ~7500 समस्याएँ, जो मॉडलों के fine-tuning के लिए हैं। प्रत्येक समस्या के साथ विस्तृत चरण-दर-चरण समाधान दिया गया है।
  • परीक्षण सेट: ~1000 समस्याएँ, जिनका उपयोग मॉडलों के प्रदर्शन के स्वतंत्र मूल्यांकन के लिए किया जाता है[1]

कठिनाई और विषय-वस्तु

समस्याएँ जानबूझकर इस प्रकार बनाई गई हैं कि उन्हें एक कुशल माध्यमिक विद्यालय का छात्र हल कर सके, लेकिन साथ ही उनके लिए बहु-चरणीय तर्क की आवश्यकता होती है। इससे मॉडल के गणितीय ज्ञान की जाँच के बजाय उसकी समस्या को विभाजित करने और क्रमिक रूप से तार्किक संक्रियाएँ करने की क्षमता का परीक्षण होता है।

भाषाई विविधता

GSM8K में समस्याओं की भाषा-शैली और भाषाई संरचनाएँ अत्यंत विविध हैं। यह इसलिए किया गया है ताकि मॉडलों की विभिन्न तरीकों से व्यक्त समस्याओं को समझने और विशिष्ट शाब्दिक पैटर्न को "रटने" से बचने की क्षमता की जाँच की जा सके[3]

मॉडलों के मूल्यांकन का इतिहास और विकास

प्रारंभिक मॉडल और आधारभूत परिणाम

2021 की मूल शोध में लेखकों ने दिखाया कि उस समय के बड़े मॉडल, जैसे कि GPT-3 (175 अरब पैरामीटर), को भी इस dataset के साथ काफी कठिनाइयाँ आती थीं। fine-tuning और एक सहायक सत्यापनकर्ता मॉडल के उपयोग के बाद भी समाधान की सटीकता केवल लगभग 55% तक पहुँच सकी[1]। इस परिणाम ने दर्शाया कि तर्क-श्रृंखला में एक छोटी सी त्रुटि भी पूरी तरह गलत उत्तर दे सकती है।

क्रांतिकारी पद्धतियाँ: Chain-of-Thought

GSM8K समस्याओं को हल करने में «विचार-श्रृंखला» (Chain-of-Thought, CoT) दृष्टिकोण एक सफलता साबित हुआ। 2022 में Google के शोधकर्ताओं ने दिखाया कि यदि मॉडल को उत्तर देने से पहले समाधान के चरणों को स्पष्ट रूप से लिखने के लिए प्रेरित किया जाए, तो सटीकता में उल्लेखनीय वृद्धि होती है। CoT के साथ PaLM मॉडल (540 अरब पैरामीटर) ने 58% सटीकता प्राप्त की[4]। अधिक जटिल self-consistency तकनीक (कई समाधान विकल्प उत्पन्न करना और सबसे सामान्य उत्तर चुनना) के उपयोग से सटीकता 74% तक बढ़ाई जा सकी[4]

मानव स्तर को पार करना

2023 से, नवीनतम जनरेटिव मॉडलों ने इस benchmark पर मानव स्तर को पार कर लिया।

  • OpenAI का GPT-4 few-shot CoT मोड में (जब prompt में कुछ हल की गई समस्याओं के उदाहरण दिए जाते हैं) लगभग 92% सटीकता तक पहुँचा[5], और अतिरिक्त रणनीतियों के साथ — 97% तक[6]
  • Anthropic का Claude 2 88% परिणाम दिखाया, और नए संस्करण Claude 3 ने लगभग 95% प्राप्त किया[3]

इतने उच्च परिणाम LLM की तर्क-क्षमता में महत्वपूर्ण प्रगति दर्शाते हैं, लेकिन यह भी संकेत देते हैं कि GSM8K अग्रणी मॉडलों के लिए "लगभग हल" हो गया है, जो MATH और MMLU जैसे अधिक जटिल benchmark के विकास को प्रोत्साहित कर रहा है।

मॉडलों के प्रशिक्षण और विकास में भूमिका

मूल्यांकन के अलावा, GSM8K का सक्रिय रूप से मॉडलों के प्रशिक्षण और सुधार के लिए उपयोग किया जाता है।

  • Fine-tuning (पुनः प्रशिक्षण): चरण-दर-चरण समाधान सहित प्रशिक्षण सेट गणितीय तर्क के लिए मॉडलों के fine-tuning हेतु एक मूल्यवान संसाधन है।
  • सत्यापनकर्ताओं का प्रशिक्षण: OpenAI की मूल शोध में GSM8K के कुछ डेटा का उपयोग एक अलग सत्यापनकर्ता मॉडल को प्रशिक्षित करने के लिए किया गया था, जो उत्पन्न समाधानों की सटीकता का मूल्यांकन करता था। जनरेटर और आलोचक के इस अलग प्रशिक्षण दृष्टिकोण ने अपनी प्रभावशीलता सिद्ध की[1]
  • Prompt Engineering: बड़ी संख्या में उदाहरणों की उपलब्धता ने शोधकर्ताओं को Chain-of-Thought और Tree-of-Thought जैसी prompt तकनीकों को विकसित और परिष्कृत करने में सहायता की, जो मॉडल के भार बदले बिना उसे तर्क करना सिखाती हैं।

बाहरी कड़ियाँ

  • Papers With Code पर dataset का पृष्ठ
  • GitHub पर आधिकारिक रिपॉजिटरी

साहित्य

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

टिप्पणियाँ

  1. 1.0 1.1 1.2 1.3 Cobbe, Karl et al. «Training Verifiers to Solve Math Word Problems». arXiv:2110.14168. [१]
  2. «GSM8K Dataset». Papers With Code. [२]
  3. 3.0 3.1 «GSM8K Benchmark». Klu.ai. [३]
  4. 4.0 4.1 Wei, Jason et al. «Language Models Perform Reasoning via Chain of Thought». Google Research Blog. [४]
  5. Yu, L., et al. «Solving Challenging Math Word Problems Using GPT-4». EMNLP 2023. [५]
  6. «Achieving >97% on GSM8K». arXiv:2404.14963. [६]