MATH Benchmark (HI)

From Systems analysis Wiki
Jump to navigation Jump to search

MATH (अंग्रेज़ी Mathematics Aptitude Test of Heuristics का संक्षिप्त रूप) — यह बड़े भाषा मॉडलों (LLM) की गणितीय क्षमताओं और समस्या-समाधान कौशल का मूल्यांकन करने के लिए एक बड़ा dataset और benchmark है। यह dataset 2021 में डैन हेंड्रीक्स (Dan Hendrycks) के नेतृत्व में शोधकर्ताओं के एक समूह द्वारा प्रस्तुत किया गया था और इसमें AMC 10, AMC 12 और AIME जैसी अमेरिकी हाई स्कूल गणित प्रतियोगिताओं से ली गई 12,500 समस्याएँ शामिल हैं[1]

समस्याएँ विषयों की एक विस्तृत श्रृंखला को कवर करती हैं (बीजगणित, ज्यामिति, संख्या सिद्धांत, क्रमचय-संचय आदि) और कठिनाई स्तर के अनुसार वर्गीकृत हैं। मानक पाठ्यपुस्तक समस्याओं के विपरीत, इनमें प्रायः सूत्रों के प्रत्यक्ष प्रयोग के बजाय रचनात्मक दृष्टिकोण और heuristic विधियों की आवश्यकता होती है। प्रत्येक प्रश्न के साथ एक पूर्ण चरण-दर-चरण समाधान और अंतिम उत्तर दिया गया है, जो MATH को मॉडलों के प्रशिक्षण और परीक्षण दोनों के लिए एक मूल्यवान संसाधन बनाता है[2]

Dataset की संरचना और विशेषताएँ

MATH benchmark में कई प्रमुख विशेषताएँ हैं जो इसे एक कठिन और विश्वसनीय मूल्यांकन उपकरण बनाती हैं।

समस्याओं का प्रारूप

सभी प्रश्न और समाधान LaTeX प्रारूप में प्रस्तुत किए गए हैं, और ज्यामितीय चित्रों के वर्णन के लिए Asymptote भाषा का उपयोग किया गया है। यह सभी शर्तों को, चित्रों सहित, टेक्स्ट रूप में प्रस्तुत करना संभव बनाता है जिसे भाषा मॉडल द्वारा संसाधित किया जा सके। प्रत्येक समस्या को गणित के सात क्षेत्रों और पाँच कठिनाई स्तरों के अनुसार लेबल किया गया है[1]

स्वचालित मूल्यांकन

Dataset में अंतिम उत्तर एक विशेष `\boxed{...}` प्रारूप में संलग्न हैं और एक सख्त मानक पर लाए गए हैं (उदाहरण के लिए, भिन्न अपने न्यूनतम रूप में)। यह सटीक मिलान (exact match) मेट्रिक के आधार पर मॉडलों का स्वचालित मूल्यांकन करने की अनुमति देता है, जो परिणामों की जाँच में व्यक्तिपरकता और अस्पष्टता को समाप्त करता है। किसी समस्या को हल माना जाने के लिए मॉडल को सटीक सही उत्तर देना होगा[1]

समस्याओं की कठिनाई और मानव स्तर

MATH AI के लिए सबसे कठिन गणित परीक्षणों में से एक है। समस्याएँ मजबूत गणितीय पृष्ठभूमि वाले लोगों के लिए भी चुनौतीपूर्ण हैं।

  • Dataset के अध्ययन के दौरान विश्वविद्यालय के छात्रों के एक समूह का परीक्षण किया गया, जिनके परिणाम ~40% से लेकर ओलंपियाड विजेताओं के ~90% तक रहे।
  • यहाँ तक कि अंतर्राष्ट्रीय गणित ओलंपियाड के तीन स्वर्ण पदक विजेता भी बिना किसी गलती के सभी प्रश्नों को हल नहीं कर सके[1]

यह दर्शाता है कि MATH समस्याओं को सफलतापूर्वक हल करने के लिए न केवल ज्ञान, बल्कि उच्च सटीकता और गणितीय अंतर्ज्ञान भी आवश्यक है।

मॉडलों के परिणाम और समाधान में प्रगति

प्रारंभिक परिणाम (2021)

2021 में benchmark के लॉन्च के समय, बड़े से बड़े मॉडल भी अत्यंत कम परिणाम दिखा रहे थे।

  • GPT-3 मॉडल (175 अरब parameters) केवल लगभग 5% समस्याओं को सही ढंग से हल कर सका।
  • GPT-2 के fine-tuned संस्करणों ने 6-7% की सटीकता दिखाई[1]

लेखकों ने निष्कर्ष निकाला कि मॉडलों के पैमाने में साधारण वृद्धि का प्रदर्शन पर लगभग कोई प्रभाव नहीं पड़ता और प्रगति के लिए नए एल्गोरिदमिक दृष्टिकोणों की आवश्यकता है[3]

Minerva और GPT-4 की सफलता (2022–2023)

सफलता विज्ञान के पाठों पर विशेष रूप से प्रशिक्षित मॉडलों और नई समाधान विधियों के आगमन के साथ आई।

  • 2022 में Google Minerva मॉडल ने लगभग 50% की सटीकता हासिल की, यह प्रदर्शित करते हुए कि पैमाने और विशेष तैयारी का संयोजन समाधान की गुणवत्ता को तेज़ी से बढ़ा सकता है[3]
  • 2023 में OpenAI के GPT-4 ने एक नई छलाँग दिखाई। उपकरणों का उपयोग करते हुए, मॉडल अपने परिणामों में उल्लेखनीय सुधार करने में सक्षम रहा:
    • Code Interpreter (गणनाओं की जाँच के लिए कोड निष्पादन) के साथ सटीकता लगभग 70% तक पहुँच गई।
    • code-based self-verification विधि (कोड की सहायता से स्व-जाँच और त्रुटि सुधार) के साथ 84.3% हल की गई समस्याओं का रिकॉर्ड स्थापित किया गया[4]

यह परिणाम मजबूत मानव प्रतिभागियों के स्तर के बराबर है और विशेषज्ञ सीमा के करीब पहुँचता है।

महत्व और प्रभाव

MATH benchmark ने LLM की गणितीय क्षमताओं के विकास में एक महत्वपूर्ण भूमिका निभाई है। इसने स्पष्ट रूप से प्रदर्शित किया कि जटिल समस्याओं को हल करने के लिए साधारण स्केलिंग पर्याप्त नहीं है, बल्कि निम्नलिखित जैसे नए दृष्टिकोणों की आवश्यकता है:

  • पूर्ण चरण-दर-चरण समाधानों पर प्रशिक्षण।
  • वैज्ञानिक डेटा पर विशेषीकृत तैयारी।
  • गणनाओं और सत्यापन के लिए बाहरी उपकरणों का उपयोग।

महत्वपूर्ण प्रगति के बावजूद, MATH एक महत्वपूर्ण और कठिन परीक्षण बना हुआ है। यह LLM में गणितीय चिंतन के स्तर के सूचक के रूप में कार्य करता रहता है और बहु-चरणीय तर्क की आवश्यकता वाली समस्याओं के विश्वसनीय समाधान के क्षेत्र में शोध को प्रोत्साहित करता है[1]

सन्दर्भ

  • GitHub पर MATH dataset का आधिकारिक repository
  • Papers With Code पर dataset का पृष्ठ

साहित्य

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

टिप्पणियाँ

  1. 1.0 1.1 1.2 1.3 1.4 1.5 Hendrycks, D., et al. «Measuring Mathematical Problem Solving With the MATH Dataset». arXiv:2103.03874. [१]
  2. «AI Benchmarks and Datasets for LLM Evaluation». arXiv:2412.01020. [२]
  3. 3.0 3.1 «Language models surprised us». Planned-Obsolescence.org. [३]
  4. «GPT-4 Code Interpreter smashes maths benchmarks, hits new SOTA». The Decoder. [४]