---
title: "GLUE Benchmark (HI)"
source: "https://systems-analysis.info/int/GLUE_Benchmark_(HI)"
wiki: "systems-analysis.info/int"
article: "GLUE_Benchmark_(HI)"
language: "hi"
categories:
  - "Category:Hindi"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 2426
wiki_created_at: 2026-09-06T23:03:50Z
wiki_modified_at: 2026-09-06T23:03:50Z
downloaded_at: 2026-09-07T22:51:07Z
---

# GLUE Benchmark (HI)

**GLUE** (अंग्रेजी **General Language Understanding Evaluation** का संक्षिप्त रूप, «भाषा बोध का सामान्य मूल्यांकन») — यह प्राकृतिक भाषा बोध (NLU) मॉडलों की गुणवत्ता आकलन के लिए एक बहु-कार्य benchmark है। यह benchmark 2018 में न्यूयॉर्क विश्वविद्यालय, वाशिंगटन विश्वविद्यालय और DeepMind के शोधकर्ताओं के एक समूह द्वारा प्रस्तावित किया गया था, जिसमें **एलेक्स वान** और **सैमुअल बोमैन** शामिल थे, और यह शोध समुदाय में व्यापक रूप से प्रचलित हो गया<sup>[\[1\]](https://systems-analysis.info/int/GLUE_Benchmark_(HI)#cite_note-glue_paper-1)</sup>।

GLUE का मुख्य उद्देश्य — किसी एक विशिष्ट क्षेत्र से परे विविध कार्यों के समुच्चय पर NLU-मॉडलों की तुलनात्मक क्षमताओं के मूल्यांकन के लिए एकीकृत, निष्पक्ष और चुनौतीपूर्ण परीक्षण परिसर उपलब्ध कराना है। इस benchmark में **लीडरबोर्ड** (रिकॉर्ड तालिका) सहित एक ऑनलाइन प्लेटफ़ॉर्म शामिल है, जो मॉडलों की निष्पक्ष तुलना सुनिश्चित करता है और परीक्षण डेटा के अनुरूप अनुकूलन को रोकता है, क्योंकि कुछ परीक्षणों के वास्तविक लेबल प्रकाशित नहीं किए जाते और केवल मूल्यांकन सर्वर के माध्यम से उपलब्ध होते हैं। यह माना जाता है कि उच्च परिणाम प्राप्त करने के लिए मॉडल को सार्वभौमिक भाषाई प्रतिनिधित्व निकालने और विभिन्न प्रकार के कार्यों के बीच ज्ञान को प्रभावी ढंग से स्थानांतरित करने में सक्षम होना चाहिए।

## Benchmark की संरचना और कार्य

GLUE benchmark भाषा बोध से संबंधित नौ विभिन्न कार्यों को एकत्रित करता है, जो पहले से मौजूद और AI के लिए चुनौतीपूर्ण dataset पर आधारित हैं। सभी कार्य एकल वाक्य अथवा वाक्य-युगल पर वर्गीकरण या regression के रूप में परिभाषित हैं<sup>[\[1\]](https://systems-analysis.info/int/GLUE_Benchmark_(HI)#cite_note-glue_paper-1)</sup>।

- **CoLA** (*Corpus of Linguistic Acceptability*) — वाक्य की व्याकरणिक स्वीकार्यता निर्धारित करने का कार्य। गुणवत्ता मेट्रिक — Matthews Correlation Coefficient।
- **SST-2** (*Stanford Sentiment Treebank*) — किसी फ़िल्म समीक्षा की भावना (सकारात्मक/नकारात्मक) निर्धारित करने का कार्य। मेट्रिक — accuracy।
- **MRPC** (*Microsoft Research Paraphrase Corpus*) — समाचार स्रोतों के वाक्य-युगल में पुनर्कथन की पहचान करने का कार्य। मेट्रिक — accuracy और F1-score।
- **QQP** (*Quora Question Pairs*) — Quora समुदाय के डुप्लीकेट प्रश्नों की पहचान करने का कार्य। मेट्रिक — accuracy और F1-score।
- **STS-B** (*Semantic Textual Similarity Benchmark*) — दो वाक्यों का अर्थपरक मिलान करने का कार्य। मॉडल को 1 से 5 के पैमाने पर अर्थपरक निकटता की डिग्री का अनुमान लगाना होता है। मेट्रिक — Pearson और Spearman सहसंबंध गुणांक।
- **MNLI** (*Multi-Genre Natural Language Inference*) — विभिन्न शैलियों के स्रोतों (अनुमान, विरोधाभास, तटस्थता) के वाक्य-युगलों के उदाहरण पर पाठ्य अनुमान पहचान का कार्य। परिणामों का मूल्यांकन matched और mismatched उपसमुच्चयों पर अलग-अलग किया जाता है।
- **QNLI** (*Question Natural Language Inference*) — SQuAD dataset के रूपांतरण से प्राप्त कार्य। यह निर्धारित करना आवश्यक है कि अनुच्छेद का कोई वाक्य दिए गए प्रश्न का उत्तर देता है या नहीं।
- **RTE** (*Recognizing Textual Entailment*) — पाठ्य अनुमान पर कई छोटे संग्रहों को एकत्रित करने वाला समग्र dataset। कार्य — वाक्यों के बीच संबंध का द्विआधारी वर्गीकरण करना।
- **WNLI** (*Winograd NLI*) — NLI प्रारूप के अनुकूल रूपांतरित Winograd schema का संशोधित संस्करण। सर्वनाम विश्लेषण का कार्य: प्रणाली को अस्पष्ट सर्वनाम वाला एक वाक्य दिया जाता है और यह इंगित करना होता है कि वह किस दो वस्तुओं में से किस को संदर्भित करता है।

## मूल्यांकन पद्धति

GLUE पर मूल्यांकन के लिए शोधकर्ता अपने मॉडल के अनुमान एक विशेष सर्वर पर भेजते हैं, जिसके बाद प्रत्येक कार्य के लिए मेट्रिक की स्वचालित गणना और एक समग्र स्कोर प्राप्त होता है।

- **GLUE-score** — अंतिम संकेतक, जिसकी गणना सभी नौ मुख्य कार्यों के परिणामों के औसत के रूप में की जाती है।
- **लीडरबोर्ड** — सार्वजनिक तालिका, जो वर्तमान स्थिति को दर्शाती है और यह दिखाती है कि कौन से मॉडल NLU-कार्यों में बेहतर प्रदर्शन करते हैं। छिपे हुए परीक्षण सेटों का उपयोग निष्पक्ष तुलना सुनिश्चित करता है।
- **नैदानिक समुच्चय** — विशेषज्ञों द्वारा सूक्ष्म भाषाई विश्लेषण के लिए हस्त-अनुलिपित 1100 उदाहरणों का एक विशेष समुच्चय। यह रेटिंग को प्रभावित नहीं करता, बल्कि गुणात्मक विश्लेषण के साधन के रूप में कार्य करता है — यह जाँचने के लिए कि मॉडल कौन से भाषाई तथ्यों (शाब्दिक अर्थविज्ञान, तर्क, सामान्य ज्ञान) को पहचान सकता है और किनमें उसे कठिनाई होती है<sup>[\[1\]](https://systems-analysis.info/int/GLUE_Benchmark_(HI)#cite_note-glue_paper-1)</sup>।

## परिणाम और उद्योग पर प्रभाव

2018 में GLUE के प्रारंभ के समय उस दौर के सर्वोत्तम मॉडल (उदाहरण के लिए, ELMo के साथ BiLSTM) लगभग **70 अंक** (0–100 के पैमाने पर) का संयुक्त परिणाम प्राप्त करते थे, जो मानव स्तर (लगभग 87 अंक) से काफी कम था<sup>[\[2\]](https://systems-analysis.info/int/GLUE_Benchmark_(HI)#cite_note-human_vs_muppet-2)</sup>।

GLUE और खुले लीडरबोर्ड के आगमन ने NLP में transfer learning के क्षेत्र में तीव्र प्रगति को प्रेरित किया।

- मई 2019 तक, एक वर्ष से भी कम समय में, transformer पर आधारित मॉडलों की नई पीढ़ी (सबसे पहले BERT) ने *state-of-the-art* को **83.9 अंक** तक पहुँचा दिया।
- 2019 की दूसरी छमाही में GLUE benchmark व्यावहारिक रूप से «पार» कर लिया गया: सर्वोत्तम प्रणालियाँ मानव स्तर के निकट पहुँच गईं, और कुछ कार्यों में तो उसे भी पार कर गईं<sup>[\[3\]](https://systems-analysis.info/int/GLUE_Benchmark_(HI)#cite_note-w4ngatang_superglue-3)</sup>।

GLUE ने भाषा बोध मॉडलों के विकास में **एकल संदर्भ बिंदु** के रूप में विशाल भूमिका निभाई। इसकी बदौलत शोधकर्ता विभिन्न आर्किटेक्चर की कार्यों के जटिल समुच्चय पर सीधे तुलना कर सके, दृष्टिकोणों की शक्तियों और कमज़ोरियों की पहचान कर सके और सार्वजनिक लीडरबोर्ड के माध्यम से उपलब्धियों का त्वरित आदान-प्रदान कर सके।

## SuperGLUE: परवर्ती विकास

GLUE की अप्रत्याशित सफलता के परिणामस्वरूप, केवल एक वर्ष बाद उसी लेखक समूह ने Facebook AI के सहयोगियों की भागीदारी से **SuperGLUE** नामक एक नया, अधिक जटिल परिसर प्रस्तुत किया<sup>[\[4\]](https://systems-analysis.info/int/GLUE_Benchmark_(HI)#cite_note-venturebeat_superglue-4)</sup>।

SuperGLUE को 2019 के अंत में एक «अधिक कठिन» (*stickier*) परीक्षण समुच्चय के रूप में घोषित किया गया था, जिसका उद्देश्य आधुनिक मॉडलों और मनुष्यों की क्षमताओं के बीच पुनः अंतर उत्पन्न करना था। इसमें आठ कार्य शामिल किए गए जिनके लिए भाषा की और भी गहरी समझ आवश्यक है, साथ ही प्रतिभागियों के लिए उपकरण और नियम भी बेहतर किए गए। यद्यपि GLUE एक बुनियादी परीक्षण के रूप में उपयोग में बना हुआ है, प्रतिस्पर्धात्मक सुधार का मुख्य केंद्र SuperGLUE और अन्य अधिक विशेषीकृत benchmark की ओर स्थानांतरित हो गया है।

## संदर्भ

- GLUE Benchmark की आधिकारिक वेबसाइट
- मॉडल परिणामों सहित Papers With Code पर GLUE का पृष्ठ

## साहित्य

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## टिप्पणियाँ

1.  <span id="cite_note-glue_paper-1">↑ <sup>[1.0](https://systems-analysis.info/int/GLUE_Benchmark_(HI)#cite_ref-glue_paper_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/GLUE_Benchmark_(HI)#cite_ref-glue_paper_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/GLUE_Benchmark_(HI)#cite_ref-glue_paper_1-2)</sup> Wang, A. et al. «GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding». *arXiv:1804.07461*, 2019. <a href="https://arxiv.org/abs/1804.07461" class="external autonumber" rel="nofollow">[१]</a></span>
2.  <span id="cite_note-human_vs_muppet-2">[↑](https://systems-analysis.info/int/GLUE_Benchmark_(HI)#cite_ref-human_vs_muppet_2-0) Bowman, S. R. et al. «Human vs. Muppet: A Conservative Estimate of Human Performance on the GLUE Benchmark». *arXiv:1905.10425*, 2019. <a href="https://arxiv.org/abs/1905.10425" class="external autonumber" rel="nofollow">[२]</a></span>
3.  <span id="cite_note-w4ngatang_superglue-3">[↑](https://systems-analysis.info/int/GLUE_Benchmark_(HI)#cite_ref-w4ngatang_superglue_3-0) Wang, A. et al. «SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems». *NeurIPS 2019*. <a href="https://w4ngatang.github.io/static/papers/superglue.pdf" class="external autonumber" rel="nofollow">[३]</a></span>
4.  <span id="cite_note-venturebeat_superglue-4">[↑](https://systems-analysis.info/int/GLUE_Benchmark_(HI)#cite_ref-venturebeat_superglue_4-0) «AI models from Microsoft and Google already surpass human performance on the SuperGLUE language benchmark». *VentureBeat*. <a href="https://venturebeat.com/business/ai-models-from-microsoft-and-google-already-surpass-human-performance-on-the-superglue-language-benchmark/" class="external autonumber" rel="nofollow">[४]</a></span>
