---
title: "GLUE Benchmark — معيار GLUE"
source: "https://systems-analysis.info/int/GLUE_Benchmark_%E2%80%94_%D9%85%D8%B9%D9%8A%D8%A7%D8%B1_GLUE"
wiki: "systems-analysis.info/int"
article: "GLUE_Benchmark_—_معيار_GLUE"
language: "ar"
categories:
  - "Category:Arabic"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 2443
wiki_created_at: 2026-09-06T23:04:06Z
wiki_modified_at: 2026-09-06T23:04:06Z
downloaded_at: 2026-09-07T22:51:12Z
---

# GLUE Benchmark — معيار GLUE

**GLUE** (وهو اختصار لـ **General Language Understanding Evaluation**، أي "التقييم العام لفهم اللغة") — هو معيار متعدد المهام لتقييم جودة نماذج معالجة اللغة الطبيعية (NLU). تم اقتراح هذا المعيار في عام 2018 من قبل مجموعة من الباحثين من جامعة نيويورك، وجامعة واشنطن، و DeepMind، ومن بينهم **أليكس وانغ** و**صامويل بومان**، وقد حظي بانتشار واسع في مجتمع البحث<sup>[\[1\]](https://systems-analysis.info/int/GLUE_Benchmark_%E2%80%94_%D9%85%D8%B9%D9%8A%D8%A7%D8%B1_GLUE#cite_note-glue_paper-1)</sup>.

الهدف الرئيسي من GLUE هو توفير مجموعة اختبار موحدة ومحايدة ومعقدة لتقييم قدرات نماذج فهم اللغة الطبيعية (NLU) بشكل مقارن عبر مجموعة متنوعة من المهام التي تتجاوز نطاق مجال واحد محدد. يتضمن المعيار منصة عبر الإنترنت مع **leaderboard** (لوحة الصدارة)، التي تضمن مقارنة موضوعية للنماذج وتمنع التخصيص المفرط على بيانات الاختبار، حيث إن الإجابات الصحيحة لجزء من الاختبارات لا تُنشر وتكون متاحة فقط عبر خادم التقييم. يُفترض أنه لتحقيق نتائج عالية، يجب أن يكون النموذج قادرًا على استخلاص تمثيلات لغوية عالمية ونقل المعرفة بفعالية بين أنواع مختلفة من المهام.

## Composition and tasks of the benchmark - مكونات المعيار ومهامه

يجمع معيار GLUE تسع مهام مختلفة لفهم اللغة، مبنية على مجموعات بيانات موجودة مسبقًا وتعتبر صعبة بالنسبة للذكاء الاصطناعي. جميع المهام مصاغة إما كتصنيف أو انحدار (regression) على جملة واحدة أو زوج من الجمل<sup>[\[1\]](https://systems-analysis.info/int/GLUE_Benchmark_%E2%80%94_%D9%85%D8%B9%D9%8A%D8%A7%D8%B1_GLUE#cite_note-glue_paper-1)</sup>.

- **CoLA** (*Corpus of Linguistic Acceptability*) — مهمة تحديد المقبولية النحوية للجملة. مقياس الجودة هو معامل ارتباط ماثيوز.
- **SST-2** (*Stanford Sentiment Treebank*) — مهمة تحديد التوجه (إيجابي/سلبي) لمراجعة فيلم. المقياس هو الدقة (*accuracy*).
- **MRPC** (*Microsoft Research Paraphrase Corpus*) — مهمة الكشف عن إعادة الصياغة في زوج من الجمل من مصادر إخبارية. المقاييس هي الدقة ومقياس F1.
- **QQP** (*Quora Question Pairs*) — مهمة تحديد الأسئلة المكررة من مجتمع Quora. المقاييس هي الدقة ومقياس F1.
- **STS-B** (*Semantic Textual Similarity Benchmark*) — مهمة المقارنة الدلالية بين جملتين. يجب على النموذج التنبؤ بدرجة التشابه في المعنى على مقياس من 1 إلى 5. المقاييس هي معامل ارتباط بيرسون وسبيرمان.
- **MNLI** (*Multi-Genre Natural Language Inference*) — مهمة تمييز الاستتباع النصي (textual entailment) في أزواج من الجمل من مصادر متنوعة الأنواع (استنتاج، تناقض، حياد). تُقيّم النتائج بشكل منفصل على المجموعات الفرعية المتطابقة (*matched*) وغير المتطابقة (*mismatched*).
- **QNLI** (*Question Natural Language Inference*) — مهمة تم الحصول عليها عبر تحويل مجموعة بيانات SQuAD. المطلوب هو تحديد ما إذا كانت الجملة المأخوذة من فقرة تحتوي على إجابة للسؤال المطروح.
- **RTE** (*Recognizing Textual Entailment*) — مجموعة بيانات مجمّعة للاستتباع النصي، تجمع عدة مجموعات صغيرة. المهمة هي تصنيف العلاقة بين الجمل بشكل ثنائي.
- **WNLI** (*Winograd NLI*) — نسخة معدلة من مخطط فينوغراد (Winograd schema)، تم تكييفها لتناسب صيغة NLI. هي مهمة لحل الإحالة (anaphora resolution): يُعطى النظام جملة تحتوي على ضمير غامض، وعليه تحديد أي من الكائنين المشار إليهما يعود عليه الضمير.

## Evaluation methodology - منهجية التقييم

للحصول على تقييم في GLUE، يقوم الباحثون بإرسال تنبؤات نماذجهم إلى خادم مخصص، وبعد ذلك يحصلون على حساب آلي للمقاييس لكل مهمة ودرجة إجمالية.

- **GLUE-score** — هو المؤشر النهائي الذي يُحسب كمتوسط لنتائج جميع المهام التسع الرئيسية.
- **Leaderboard** — جدول عام يعكس الوضع الحالي ويُظهر أي النماذج تحقق أفضل أداء في مهام NLU. يضمن استخدام مجموعات الاختبار المخفية إجراء مقارنة عادلة.
- **المجموعة التشخيصية** — مجموعة خاصة تتكون من 1100 مثال، مشروحة يدويًا من قبل خبراء لتحليل لغوي دقيق. هذه المجموعة لا تؤثر على الترتيب، بل تُستخدم كأداة للتحليل النوعي للتحقق من الظواهر اللغوية التي يستطيع النموذج تمييزها (مثل الدلالات المعجمية، والمنطق، والحس السليم) وتلك التي يواجه صعوبة معها<sup>[\[1\]](https://systems-analysis.info/int/GLUE_Benchmark_%E2%80%94_%D9%85%D8%B9%D9%8A%D8%A7%D8%B1_GLUE#cite_note-glue_paper-1)</sup>.

## Results and impact on the industry - النتائج والتأثير على الصناعة

عند إطلاق GLUE في عام 2018، كانت أفضل النماذج في ذلك الوقت (مثل BiLSTM مع ELMo) تحقق نتيجة إجمالية تبلغ حوالي **70 نقطة** (على مقياس من 0 إلى 100)، وهو ما كان أقل بكثير من مستوى الأداء البشري (حوالي 87 نقطة)<sup>[\[2\]](https://systems-analysis.info/int/GLUE_Benchmark_%E2%80%94_%D9%85%D8%B9%D9%8A%D8%A7%D8%B1_GLUE#cite_note-human_vs_muppet-2)</sup>.

أدى ظهور GLUE ولوحة الصدارة المفتوحة إلى تحفيز تقدم هائل في مجال التعلم بالنقل (transfer learning) في معالجة اللغات الطبيعية.

- بحلول مايو 2019، وفي أقل من عام، رفع الجيل الجديد من النماذج القائمة على المحولات (transformers)، وعلى رأسها BERT، مستوى الأداء الأحدث (*state-of-the-art*) إلى **83.9 نقطة**.
- في النصف الثاني من عام 2019، تم "اجتياز" معيار GLUE فعليًا: اقتربت أفضل الأنظمة بشكل كبير من مستوى الأداء البشري، بل وتفوقت عليه في بعض المهام<sup>[\[3\]](https://systems-analysis.info/int/GLUE_Benchmark_%E2%80%94_%D9%85%D8%B9%D9%8A%D8%A7%D8%B1_GLUE#cite_note-w4ngatang_superglue-3)</sup>.

لعب GLUE دورًا هائلاً **كنقطة مرجعية موحدة** في تطوير نماذج فهم اللغة. بفضله، تمكن الباحثون من مقارنة مختلف البنى الهندسية مباشرةً على مجموعة مهام معقدة، وتحديد نقاط القوة والضعف في الأساليب المختلفة، وتبادل الإنجازات بسرعة عبر لوحة الصدارة العامة.

## SuperGLUE: subsequent development - تطور لاحق :SuperGLUE

النجاح السريع لمعيار GLUE أدى إلى قيام نفس فريق المؤلفين، بعد عام واحد فقط وبمشاركة زملاء من Facebook AI، بتقديم مجموعة مهام جديدة وأكثر تعقيدًا تحت اسم **SuperGLUE**<sup>[\[4\]](https://systems-analysis.info/int/GLUE_Benchmark_%E2%80%94_%D9%85%D8%B9%D9%8A%D8%A7%D8%B1_GLUE#cite_note-venturebeat_superglue-4)</sup>.

تم الإعلان عن SuperGLUE في نهاية عام 2019 كمجموعة اختبارات "أكثر لزوجة" (*stickier*)، مصممة لخلق فجوة جديدة بين قدرات النماذج الحديثة وقدرات الإنسان. تضمنت المجموعة ثماني مهام تتطلب فهمًا أعمق للغة، كما تم تحسين الأدوات والقواعد للمشاركين. على الرغم من أن GLUE لا يزال يُستخدم كاختبار أساسي، إلا أن التركيز الرئيسي في المنافسة على تحسين الأداء قد انتقل إلى SuperGLUE وغيره من المعايير الأكثر تخصصًا.

## روابط خارجية

- <a href="https://gluebenchmark.com/" class="external text" rel="nofollow">الموقع الرسمي لمعيار GLUE</a>
- <a href="https://paperswithcode.com/dataset/glue" class="external text" rel="nofollow">صفحة GLUE على موقع Papers With Code مع نتائج النماذج</a>

## المؤلفات

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. <a href="https://arxiv.org/abs/2211.09110" class="external text" rel="nofollow">arXiv:2211.09110</a>.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. <a href="https://arxiv.org/abs/2307.03109" class="external text" rel="nofollow">arXiv:2307.03109</a>.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. <a href="https://arxiv.org/abs/2508.15361" class="external text" rel="nofollow">arXiv:2508.15361</a>.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. <a href="https://arxiv.org/abs/2405.14782" class="external text" rel="nofollow">arXiv:2405.14782</a>.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. <a href="https://arxiv.org/abs/2104.14337" class="external text" rel="nofollow">arXiv:2104.14337</a>.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. <a href="https://arxiv.org/abs/2106.06052" class="external text" rel="nofollow">arXiv:2106.06052</a>.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. <a href="https://arxiv.org/abs/2101.04840" class="external text" rel="nofollow">arXiv:2101.04840</a>.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. <a href="https://arxiv.org/abs/2406.04244" class="external text" rel="nofollow">arXiv:2406.04244</a>.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. <a href="https://arxiv.org/abs/2506.11094" class="external text" rel="nofollow">arXiv:2506.11094</a>.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. <a href="https://arxiv.org/abs/2403.04132" class="external text" rel="nofollow">arXiv:2403.04132</a>.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. <a href="https://arxiv.org/abs/2311.17295" class="external text" rel="nofollow">arXiv:2311.17295</a>.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. <a href="https://arxiv.org/abs/2311.05232" class="external text" rel="nofollow">arXiv:2311.05232</a>.

## المراجع

1.  <span id="cite_note-glue_paper-1">↑ <sup>[1.0](https://systems-analysis.info/int/GLUE_Benchmark_%E2%80%94_%D9%85%D8%B9%D9%8A%D8%A7%D8%B1_GLUE#cite_ref-glue_paper_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/GLUE_Benchmark_%E2%80%94_%D9%85%D8%B9%D9%8A%D8%A7%D8%B1_GLUE#cite_ref-glue_paper_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/GLUE_Benchmark_%E2%80%94_%D9%85%D8%B9%D9%8A%D8%A7%D8%B1_GLUE#cite_ref-glue_paper_1-2)</sup> Wang, A. et al. «GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding». *arXiv:1804.07461*, 2019. <a href="https://arxiv.org/abs/1804.07461" class="external autonumber" rel="nofollow">[١]</a></span>
2.  <span id="cite_note-human_vs_muppet-2">[↑](https://systems-analysis.info/int/GLUE_Benchmark_%E2%80%94_%D9%85%D8%B9%D9%8A%D8%A7%D8%B1_GLUE#cite_ref-human_vs_muppet_2-0) Bowman, S. R. et al. «Human vs. Muppet: A Conservative Estimate of Human Performance on the GLUE Benchmark». *arXiv:1905.10425*, 2019. <a href="https://arxiv.org/abs/1905.10425" class="external autonumber" rel="nofollow">[٢]</a></span>
3.  <span id="cite_note-w4ngatang_superglue-3">[↑](https://systems-analysis.info/int/GLUE_Benchmark_%E2%80%94_%D9%85%D8%B9%D9%8A%D8%A7%D8%B1_GLUE#cite_ref-w4ngatang_superglue_3-0) Wang, A. et al. «SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems». *NeurIPS 2019*. <a href="https://w4ngatang.github.io/static/papers/superglue.pdf" class="external autonumber" rel="nofollow">[٣]</a></span>
4.  <span id="cite_note-venturebeat_superglue-4">[↑](https://systems-analysis.info/int/GLUE_Benchmark_%E2%80%94_%D9%85%D8%B9%D9%8A%D8%A7%D8%B1_GLUE#cite_ref-venturebeat_superglue_4-0) «AI models from Microsoft and Google already surpass human performance on the SuperGLUE language benchmark». *VentureBeat*. <a href="https://venturebeat.com/business/ai-models-from-microsoft-and-google-already-surpass-human-performance-on-the-superglue-language-benchmark/" class="external autonumber" rel="nofollow">[٤]</a></span>
