GLUE Benchmark — معيار GLUE

From Systems analysis Wiki
Jump to navigation Jump to search

GLUE (وهو اختصار لـ General Language Understanding Evaluation، أي "التقييم العام لفهم اللغة") — هو معيار متعدد المهام لتقييم جودة نماذج معالجة اللغة الطبيعية (NLU). تم اقتراح هذا المعيار في عام 2018 من قبل مجموعة من الباحثين من جامعة نيويورك، وجامعة واشنطن، و DeepMind، ومن بينهم أليكس وانغ وصامويل بومان، وقد حظي بانتشار واسع في مجتمع البحث[1].

الهدف الرئيسي من GLUE هو توفير مجموعة اختبار موحدة ومحايدة ومعقدة لتقييم قدرات نماذج فهم اللغة الطبيعية (NLU) بشكل مقارن عبر مجموعة متنوعة من المهام التي تتجاوز نطاق مجال واحد محدد. يتضمن المعيار منصة عبر الإنترنت مع leaderboard (لوحة الصدارة)، التي تضمن مقارنة موضوعية للنماذج وتمنع التخصيص المفرط على بيانات الاختبار، حيث إن الإجابات الصحيحة لجزء من الاختبارات لا تُنشر وتكون متاحة فقط عبر خادم التقييم. يُفترض أنه لتحقيق نتائج عالية، يجب أن يكون النموذج قادرًا على استخلاص تمثيلات لغوية عالمية ونقل المعرفة بفعالية بين أنواع مختلفة من المهام.

Composition and tasks of the benchmark - مكونات المعيار ومهامه

يجمع معيار GLUE تسع مهام مختلفة لفهم اللغة، مبنية على مجموعات بيانات موجودة مسبقًا وتعتبر صعبة بالنسبة للذكاء الاصطناعي. جميع المهام مصاغة إما كتصنيف أو انحدار (regression) على جملة واحدة أو زوج من الجمل[1].

  • CoLA (Corpus of Linguistic Acceptability) — مهمة تحديد المقبولية النحوية للجملة. مقياس الجودة هو معامل ارتباط ماثيوز.
  • SST-2 (Stanford Sentiment Treebank) — مهمة تحديد التوجه (إيجابي/سلبي) لمراجعة فيلم. المقياس هو الدقة (accuracy).
  • MRPC (Microsoft Research Paraphrase Corpus) — مهمة الكشف عن إعادة الصياغة في زوج من الجمل من مصادر إخبارية. المقاييس هي الدقة ومقياس F1.
  • QQP (Quora Question Pairs) — مهمة تحديد الأسئلة المكررة من مجتمع Quora. المقاييس هي الدقة ومقياس F1.
  • STS-B (Semantic Textual Similarity Benchmark) — مهمة المقارنة الدلالية بين جملتين. يجب على النموذج التنبؤ بدرجة التشابه في المعنى على مقياس من 1 إلى 5. المقاييس هي معامل ارتباط بيرسون وسبيرمان.
  • MNLI (Multi-Genre Natural Language Inference) — مهمة تمييز الاستتباع النصي (textual entailment) في أزواج من الجمل من مصادر متنوعة الأنواع (استنتاج، تناقض، حياد). تُقيّم النتائج بشكل منفصل على المجموعات الفرعية المتطابقة (matched) وغير المتطابقة (mismatched).
  • QNLI (Question Natural Language Inference) — مهمة تم الحصول عليها عبر تحويل مجموعة بيانات SQuAD. المطلوب هو تحديد ما إذا كانت الجملة المأخوذة من فقرة تحتوي على إجابة للسؤال المطروح.
  • RTE (Recognizing Textual Entailment) — مجموعة بيانات مجمّعة للاستتباع النصي، تجمع عدة مجموعات صغيرة. المهمة هي تصنيف العلاقة بين الجمل بشكل ثنائي.
  • WNLI (Winograd NLI) — نسخة معدلة من مخطط فينوغراد (Winograd schema)، تم تكييفها لتناسب صيغة NLI. هي مهمة لحل الإحالة (anaphora resolution): يُعطى النظام جملة تحتوي على ضمير غامض، وعليه تحديد أي من الكائنين المشار إليهما يعود عليه الضمير.

Evaluation methodology - منهجية التقييم

للحصول على تقييم في GLUE، يقوم الباحثون بإرسال تنبؤات نماذجهم إلى خادم مخصص، وبعد ذلك يحصلون على حساب آلي للمقاييس لكل مهمة ودرجة إجمالية.

  • GLUE-score — هو المؤشر النهائي الذي يُحسب كمتوسط لنتائج جميع المهام التسع الرئيسية.
  • Leaderboard — جدول عام يعكس الوضع الحالي ويُظهر أي النماذج تحقق أفضل أداء في مهام NLU. يضمن استخدام مجموعات الاختبار المخفية إجراء مقارنة عادلة.
  • المجموعة التشخيصية — مجموعة خاصة تتكون من 1100 مثال، مشروحة يدويًا من قبل خبراء لتحليل لغوي دقيق. هذه المجموعة لا تؤثر على الترتيب، بل تُستخدم كأداة للتحليل النوعي للتحقق من الظواهر اللغوية التي يستطيع النموذج تمييزها (مثل الدلالات المعجمية، والمنطق، والحس السليم) وتلك التي يواجه صعوبة معها[1].

Results and impact on the industry - النتائج والتأثير على الصناعة

عند إطلاق GLUE في عام 2018، كانت أفضل النماذج في ذلك الوقت (مثل BiLSTM مع ELMo) تحقق نتيجة إجمالية تبلغ حوالي 70 نقطة (على مقياس من 0 إلى 100)، وهو ما كان أقل بكثير من مستوى الأداء البشري (حوالي 87 نقطة)[2].

أدى ظهور GLUE ولوحة الصدارة المفتوحة إلى تحفيز تقدم هائل في مجال التعلم بالنقل (transfer learning) في معالجة اللغات الطبيعية.

  • بحلول مايو 2019، وفي أقل من عام، رفع الجيل الجديد من النماذج القائمة على المحولات (transformers)، وعلى رأسها BERT، مستوى الأداء الأحدث (state-of-the-art) إلى 83.9 نقطة.
  • في النصف الثاني من عام 2019، تم "اجتياز" معيار GLUE فعليًا: اقتربت أفضل الأنظمة بشكل كبير من مستوى الأداء البشري، بل وتفوقت عليه في بعض المهام[3].

لعب GLUE دورًا هائلاً كنقطة مرجعية موحدة في تطوير نماذج فهم اللغة. بفضله، تمكن الباحثون من مقارنة مختلف البنى الهندسية مباشرةً على مجموعة مهام معقدة، وتحديد نقاط القوة والضعف في الأساليب المختلفة، وتبادل الإنجازات بسرعة عبر لوحة الصدارة العامة.

SuperGLUE: subsequent development - تطور لاحق :SuperGLUE

النجاح السريع لمعيار GLUE أدى إلى قيام نفس فريق المؤلفين، بعد عام واحد فقط وبمشاركة زملاء من Facebook AI، بتقديم مجموعة مهام جديدة وأكثر تعقيدًا تحت اسم SuperGLUE[4].

تم الإعلان عن SuperGLUE في نهاية عام 2019 كمجموعة اختبارات "أكثر لزوجة" (stickier)، مصممة لخلق فجوة جديدة بين قدرات النماذج الحديثة وقدرات الإنسان. تضمنت المجموعة ثماني مهام تتطلب فهمًا أعمق للغة، كما تم تحسين الأدوات والقواعد للمشاركين. على الرغم من أن GLUE لا يزال يُستخدم كاختبار أساسي، إلا أن التركيز الرئيسي في المنافسة على تحسين الأداء قد انتقل إلى SuperGLUE وغيره من المعايير الأكثر تخصصًا.

روابط خارجية

المؤلفات

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

المراجع

  1. 1.0 1.1 1.2 Wang, A. et al. «GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding». arXiv:1804.07461, 2019. [١]
  2. Bowman, S. R. et al. «Human vs. Muppet: A Conservative Estimate of Human Performance on the GLUE Benchmark». arXiv:1905.10425, 2019. [٢]
  3. Wang, A. et al. «SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems». NeurIPS 2019. [٣]
  4. «AI models from Microsoft and Google already surpass human performance on the SuperGLUE language benchmark». VentureBeat. [٤]