WinoGrande Benchmark (HI)

From Systems analysis Wiki
Jump to navigation Jump to search

WinoGrande — यह एक बड़े पैमाने का मानक डेटासेट है, जो कृत्रिम बुद्धिमत्ता प्रणालियों की सामान्य बोध-आधारित तर्क क्षमता का मूल्यांकन करने के लिए बनाया गया है। इसमें लगभग 44,000 कार्य हैं, जो Winograd Schema Challenge (WSC) के प्रारूप पर आधारित हैं, लेकिन सांख्यिकीय संकेतों को दूर करने के लिए «adversarial» फ़िल्टरिंग पद्धति द्वारा इन्हें काफ़ी विस्तारित और जटिल बनाया गया है[1]

यह डेटासेट 2019 में Allen Institute for AI और वाशिंगटन विश्वविद्यालय के शोधकर्ताओं के एक समूह द्वारा विकसित किया गया था। प्रत्येक कार्य में एक रिक्त स्थान वाला वाक्य होता है, जिसे दो विकल्पों में से एक से भरना होता है — सही विकल्प संदर्भ और स्थिति की समझ के आधार पर चुना जाता है। WinoGrande प्राकृतिक भाषा प्रसंस्करण (NLP) के क्षेत्र में प्रमुख बेंचमार्क में से एक बन गया है[2]

WSC का अप्रचलन: निर्माण की पृष्ठभूमि

मूल Winograd Schema Challenge (WSC), जिसे 2011 में प्रस्तावित किया गया था, में केवल 273 कार्य थे और इसे लंबे समय तक सामान्य बोध की एक विश्वसनीय परीक्षा माना जाता था। इसके कार्य इस प्रकार बनाए गए थे कि उनके लिए शब्दों के साधारण मिलान की नहीं, बल्कि दुनिया की समझ की आवश्यकता हो[3]

हालाँकि 2018–2019 तक, BERT जैसे Transformer आर्किटेक्चर पर आधारित बड़े भाषा मॉडलों के आगमन के साथ, स्थिति बदल गई। मॉडलों ने वास्तविक समझ के बजाय डेटा में मौजूद अनजाने सांख्यिकीय पैटर्न (आर्टिफ़ैक्ट) का दोहन करके लगभग 90% की सटीकता प्राप्त करते हुए परीक्षा को «तोड़ना» सीख लिया[4]। WSC एक विश्वसनीय संकेतक नहीं रहा, जिसके कारण एक नए, अधिक जटिल और व्यापक बेंचमार्क — WinoGrande — के निर्माण की आवश्यकता पड़ी।

विकास और adversarial filtering पद्धति

WinoGrande का निर्माण दो मुख्य चरणों में हुआ: कार्यों का सामूहिक सृजन और उसके बाद उनकी फ़िल्टरिंग।

क्राउडसोर्सिंग

पहले चरण में Amazon Mechanical Turk प्लेटफ़ॉर्म की सहायता से 47,000 से अधिक वाक्यों का एक बड़ा आधार तैयार किया गया। क्राउड-कार्यकर्ताओं ने Winograd योजना के अनुसार वाक्य-युगलों का निर्माण किया, जिससे भाषाई विविधता और प्राकृतिक भाषण में पाया जाने वाला «शोर» सुनिश्चित हुआ — विशेषज्ञों के एक छोटे समूह द्वारा लिखे गए कार्यों के विपरीत[1]

AlLite एल्गोरिदम

WinoGrande की प्रमुख नवीनता AfLite (Adversarial Filtering Lite) एल्गोरिदम था। यह पद्धति उन कार्यों को स्वचालित रूप से छाँटने के लिए विकसित की गई थी जिन्हें सामान्य बोध की आवश्यकता के बिना सरल सांख्यिकीय संकेतों से हल किया जा सकता है। एल्गोरिदम ने सरल मॉडलों का उपयोग करके उन उदाहरणों की पहचान की और उन्हें हटाया जहाँ एक उत्तर वाक्य के अन्य शब्दों से बहुत स्पष्ट रूप से जुड़ा हुआ था। उदाहरण के लिए, «शेरों ने ज़ेब्राओं को खाया क्योंकि वे शिकारी हैं» जैसा कार्य फ़िल्टर कर दिया जाता, क्योंकि «शिकारी» शब्द सांख्यिकीय रूप से «शेरों» से घनिष्ठ रूप से जुड़ा है।

फ़िल्टरिंग के परिणामस्वरूप एकत्रित डेटा का लगभग 14% हटा दिया गया। डेटासेट के अंतिम संस्करण में 43,972 कार्य शामिल हैं, जो इसे एक काफ़ी अधिक विश्वसनीय और जटिल परीक्षा बनाते हैं[1]

मॉडलों के परिणाम और प्रगति

WinoGrande के प्रकाशन के समय, तत्कालीन सर्वश्रेष्ठ मॉडलों ने मानवीय प्रदर्शन से काफ़ी कम परिणाम दिखाए।

  • RoBERTa (BERT का उन्नत संस्करण) ने ~79% की सटीकता प्राप्त की।
  • मनुष्य औसतन ~94% की सटीकता के साथ कार्यों को हल करता है[1]

इस अंतर ने पुष्टि की कि AfLite फ़िल्टरिंग ने मॉडलों के लिए कई «आसान» रास्तों को सफलतापूर्वक समाप्त कर दिया। हालाँकि LLM के विकास के साथ यह अंतर कम होने लगा।

  • 2022 तक ST-MoE-32B मॉडल ने 96.1% की सटीकता प्राप्त करते हुए मानवीय स्तर को पार कर लिया[5]
  • GPT-3 ने लगभग 88% का परिणाम दिखाया[6]
  • GPT-4 विशेष fine-tuning के बिना ~87.5% की सटीकता के साथ कार्यों को हल करता है[7]

प्रभाव और आलोचना

WinoGrande सामान्य बोध के मूल्यांकन के लिए प्रमुख बेंचमार्क में से एक बन गया है और नए मॉडलों के परीक्षण के लिए नियमित रूप से उपयोग किया जाता है। इसके परिणाम प्रमुख AI कंपनियों की तकनीकी रिपोर्टों और मॉडल तुलना प्लेटफ़ॉर्मों पर प्रकाशित होते हैं[8]

साथ ही, डेटासेट निर्माण की पद्धति वैज्ञानिक बहस का विषय बनी है। कुछ शोधकर्ताओं का मानना है कि सामूहिक क्राउडसोर्सिंग के कारण अस्वाभाविक या अस्पष्ट वाक्यांश उत्पन्न हो सकते हैं। यह भी संदेह व्यक्त किया गया है कि AfLite की स्वचालित फ़िल्टरिंग सभी छिपे हुए आर्टिफ़ैक्ट को पूरी तरह समाप्त करने में सक्षम है या नहीं[5]। फिर भी, WinoGrande ने न केवल मेट्रिक्स में प्रगति को प्रोत्साहित किया, बल्कि AI मूल्यांकन के अधिक स्थिर और विश्वसनीय तरीकों के निर्माण पर एक महत्वपूर्ण बहस को भी जन्म दिया।

सन्दर्भ

  • WinoGrande की आधिकारिक वेबसाइट
  • Hugging Face प्लेटफ़ॉर्म पर डेटासेट

साहित्य

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

टिप्पणियाँ

  1. 1.0 1.1 1.2 1.3 Sakaguchi, K., Le Bras, R., Bhagavatula, C., Choi, Y. «WinoGrande: An Adversarial Winograd Schema Challenge at Scale». arXiv:1907.10641. [१]
  2. «allenai/winogrande». Hugging Face. [२]
  3. «Winograd schema challenge». In Wikipedia. [३]
  4. Kocijan, V. et al. «The defeat of the Winograd Schema Challenge». Artificial Intelligence. [४]
  5. 5.0 5.1 Lepore, J. «AI Has Been Surprising for Years». Carnegie Endowment for International Peace. [५]
  6. Brown, T. et al. «Language Models are Few-Shot Learners». arXiv:2005.14165. [६]
  7. OpenAI. «GPT-4 Technical Report». arXiv:2303.08774. [७]
  8. «Common Sense Reasoning On Winogrande». HyperAI. [८]