GLUE Benchmark (UR)
GLUE (مخفف General Language Understanding Evaluation، «زبان کی سمجھ کا عمومی جائزہ») — یہ قدرتی زبان کی سمجھ (NLU) کے ماڈلوں کے معیار کی جانچ کے لیے ایک کثیر المقاصد benchmark ہے۔ یہ benchmark 2018 میں نیو یارک یونیورسٹی، یونیورسٹی آف واشنگٹن اور DeepMind کے محققین کے ایک گروہ نے، جن میں الیکس وانگ اور سیموئل بومان شامل تھے، پیش کیا اور تحقیقی برادری میں اسے وسیع پیمانے پر قبولیت ملی[1]۔
GLUE کا بنیادی مقصد یہ ہے کہ NLU ماڈلوں کی صلاحیتوں کا موازنہ ایک واحد، غیر جانبدار اور پیچیدہ آزمائشی مجموعے کے ذریعے کیا جائے، جو کسی ایک مخصوص شعبے تک محدود نہ ہو۔ اس benchmark میں ایک آن لائن پلیٹ فارم شامل ہے جس پر لیڈر بورڈ (ریکارڈ کی جدول) موجود ہے، جو ماڈلوں کا معروضی موازنہ یقینی بناتا ہے اور آزمائشی ڈیٹا پر ہیرا پھیری کو روکتا ہے، کیونکہ بعض آزمائشوں کے اصل لیبل شائع نہیں کیے جاتے اور صرف جائزہ سرور کے ذریعے دستیاب ہوتے ہیں۔ یہ فرض کیا جاتا ہے کہ اعلیٰ نتائج حاصل کرنے کے لیے ماڈل کو عالمگیر لسانی representations نکالنے اور مختلف اقسام کے کاموں کے درمیان علم کو مؤثر طریقے سے منتقل کرنے کی صلاحیت ہونی چاہیے۔
بنچ مارک کی ساخت اور کام
GLUE benchmark زبان کی سمجھ سے متعلق نو مختلف کاموں کو یکجا کرتا ہے، جو پہلے سے موجود اور AI کے لیے مشکل datasets پر مبنی ہیں۔ تمام کام ایک جملے یا جملوں کے جوڑے پر درجہ بندی یا regression کی صورت میں مرتب کیے گئے ہیں[1]۔
- CoLA (Corpus of Linguistic Acceptability) — جملے کی گرامری قبولیت کا تعین کرنے کا کام۔ معیار پیمانہ — Matthews Correlation Coefficient۔
- SST-2 (Stanford Sentiment Treebank) — فلمی تبصرے کا لہجہ (مثبت/منفی) معلوم کرنے کا کام۔ پیمانہ — accuracy۔
- MRPC (Microsoft Research Paraphrase Corpus) — خبری ذرائع سے لیے گئے جملوں کے جوڑے میں paraphrase شناخت کرنے کا کام۔ پیمانے — accuracy اور F1-score۔
- QQP (Quora Question Pairs) — Quora کمیونٹی کے سوالات میں نقول کی شناخت کا کام۔ پیمانے — accuracy اور F1-score۔
- STS-B (Semantic Textual Similarity Benchmark) — دو جملوں کے درمیان معنوی مماثلت کا کام۔ ماڈل کو 1 سے 5 کے پیمانے پر معنوی قربت کی پیش گوئی کرنی ہوتی ہے۔ پیمانے — Pearson اور Spearman correlation coefficients۔
- MNLI (Multi-Genre Natural Language Inference) — مختلف اصناف کے ذرائع سے لیے گئے جملوں کے جوڑوں میں متنی نتیجہ اخذ کرنے کا کام (نتیجہ، تضاد، غیر جانبداری)۔ نتائج کا جائزہ ہم آہنگ (matched) اور غیر ہم آہنگ (mismatched) ذیلی مجموعوں پر الگ الگ کیا جاتا ہے۔
- QNLI (Question Natural Language Inference) — SQuAD dataset کی تبدیلی سے حاصل شدہ کام۔ یہ طے کرنا ہوتا ہے کہ آیا پیراگراف کا جملہ پوچھے گئے سوال کا جواب رکھتا ہے۔
- RTE (Recognizing Textual Entailment) — متنی نتیجہ اخذ کرنے کا مجموعی dataset جو کئی چھوٹے مجموعوں کو یکجا کرتا ہے۔ کام — جملوں کے درمیان تعلق کی دو رُخی درجہ بندی۔
- WNLI (Winograd NLI) — Winograd schema کا ترمیم شدہ ورژن جسے NLI کے فارمیٹ کے مطابق ڈھالا گیا ہے۔ anaphora حل کرنے کا کام: نظام کو مبہم ضمیر والا جملہ دیا جاتا ہے اور یہ بتانا ہوتا ہے کہ ضمیر کن دو چیزوں میں سے کس کی طرف اشارہ کر رہا ہے۔
جائزے کا طریقہ کار
GLUE پر جائزے کے لیے محققین اپنے ماڈل کی پیش گوئیاں ایک مخصوص سرور پر بھیجتے ہیں، جس کے بعد انہیں ہر کام کے لیے خودکار طریقے سے حسابی پیمانے اور مجموعی اسکور ملتا ہے۔
- GLUE-score — حتمی اشاریہ جو تمام نو بنیادی کاموں کے نتائج کی اوسط کے طور پر شمار کیا جاتا ہے۔
- لیڈر بورڈ — ایک عوامی جدول جو موجودہ صورتحال کی عکاسی کرتی ہے اور ظاہر کرتی ہے کہ کون سے ماڈل NLU کے کاموں میں بہتر کارکردگی دکھاتے ہیں۔ پوشیدہ آزمائشی مجموعوں کا استعمال منصفانہ موازنے کو یقینی بناتا ہے۔
- تشخیصی مجموعہ — 1100 مثالوں پر مشتمل ایک خاص مجموعہ جسے ماہرین نے دقیق لسانی تجزیے کے لیے ہاتھ سے حاشیہ آرائی کی ہے۔ یہ درجہ بندی پر اثر نہیں ڈالتا، بلکہ معیاری تجزیے کا ایک ذریعہ ہے تاکہ یہ جانچا جا سکے کہ ماڈل کون سے لسانی مظاہر (لغوی معنیات، منطق، سمجھ بوجھ) پہچان سکتا ہے اور کن میں اسے دشواری ہوتی ہے[1]۔
نتائج اور صنعت پر اثرات
جب 2018 میں GLUE پیش کیا گیا تو اس وقت کے بہترین ماڈل (مثلاً BiLSTM بمع ELMo) مجموعی طور پر تقریباً 70 پوائنٹس (0–100 کے پیمانے پر) تک پہنچتے تھے، جو انسانی سطح (تقریباً 87 پوائنٹس) سے کافی کم تھا[2]۔
GLUE اور کھلے لیڈر بورڈ کی آمد نے NLP میں transfer learning کے میدان میں زبردست پیش رفت کو تحریک دی۔
- مئی 2019 تک، ایک سال سے بھی کم عرصے میں، transformer پر مبنی ماڈلوں کی نئی نسل (بالخصوص BERT) نے state-of-the-art کو 83.9 پوائنٹس تک پہنچا دیا۔
- 2019 کے دوسرے نصف میں GLUE benchmark عملاً «مکمل» ہو گیا: بہترین نظام انسانی سطح کے قریب پہنچ گئے، اور بعض کاموں میں اسے پار بھی کر گئے[3]۔
GLUE نے زبان کی سمجھ کے ماڈلوں کی ترقی میں واحد معیاری نقطہ آغاز کے طور پر بے حد اہم کردار ادا کیا۔ اس کی بدولت محققین مختلف architectures کا ایک پیچیدہ مجموعی کاموں پر براہِ راست موازنہ کر سکے، طریقوں کی خوبیوں اور خامیوں کو شناخت کر سکے اور عوامی لیڈر بورڈ کے ذریعے اپنی کامیابیاں تیزی سے بانٹ سکے۔
SuperGLUE: بعد کی ترقی
GLUE کی تیز کامیابی کے نتیجے میں صرف ایک سال بعد انہی مصنفین نے Facebook AI کے ساتھیوں کی شرکت سے ایک نیا، زیادہ پیچیدہ مجموعہ پیش کیا جسے SuperGLUE کا نام دیا گیا[4]۔
SuperGLUE کا اعلان 2019 کے آخر میں ایک «زیادہ مشکل» (stickier) آزمائشی مجموعے کے طور پر کیا گیا، جس کا مقصد جدید ماڈلوں اور انسانی صلاحیت کے درمیان دوبارہ فاصلہ پیدا کرنا تھا۔ اس میں آٹھ ایسے کام شامل کیے گئے جن میں زبان کی اور بھی گہری سمجھ درکار ہے، اور شرکاء کے لیے اوزار اور قواعد کو بھی بہتر بنایا گیا۔ اگرچہ GLUE ایک بنیادی آزمائش کے طور پر استعمال ہوتا رہتا ہے، لیکن مسابقتی بہتری کا مرکزی رجحان SuperGLUE اور دوسرے، زیادہ مخصوص، benchmarks کی طرف منتقل ہو گیا ہے۔
روابط
- GLUE Benchmark کی سرکاری ویب سائٹ
- ماڈلوں کے نتائج کے ساتھ Papers With Code پر GLUE کا صفحہ
ادب
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
حوالہ جات
- ↑ 1.0 1.1 1.2 Wang, A. et al. «GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding». arXiv:1804.07461, 2019. [1]
- ↑ Bowman, S. R. et al. «Human vs. Muppet: A Conservative Estimate of Human Performance on the GLUE Benchmark». arXiv:1905.10425, 2019. [2]
- ↑ Wang, A. et al. «SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems». NeurIPS 2019. [3]
- ↑ «AI models from Microsoft and Google already surpass human performance on the SuperGLUE language benchmark». VentureBeat. [4]