GLUE Benchmark (FA)
GLUE (مخفف General Language Understanding Evaluation، «ارزیابی کلی درک زبان») یک benchmark چندوظیفهای برای سنجش کیفیت مدلهای پردازش زبان طبیعی (NLU) است. این benchmark در سال ۲۰۱۸ توسط گروهی از محققان دانشگاه نیویورک، دانشگاه واشنگتن و DeepMind، از جمله الکس وانگ و سموئل بومن، معرفی شد و در جامعه پژوهشی بهطور گسترده مورد استفاده قرار گرفت[1].
هدف اصلی GLUE فراهم کردن یک مجموعه آزمایشی یکپارچه، بیطرفانه و چالشبرانگیز برای ارزیابی مقایسهای تواناییهای مدلهای NLU در مجموعهای متنوع از وظایف فراتر از یک حوزه خاص است. این benchmark شامل یک پلتفرم آنلاین با لیدربورد (جدول رکوردها) است که مقایسه عینی مدلها را تضمین کرده و از تنظیم بیش از حد بر روی دادههای آزمایشی جلوگیری میکند، زیرا برچسبهای واقعی برخی آزمونها منتشر نمیشوند و تنها از طریق سرور ارزیابی در دسترس هستند. فرض بر این است که برای دستیابی به نتایج بالا، مدل باید بتواند بازنماییهای زبانی عمومی را استخراج کرده و دانش را بهطور مؤثر بین انواع مختلف وظایف منتقل کند.
ترکیب و وظایف benchmark
بenchmark GLUE نه وظیفه مختلف درک زبان را که بر اساس datasetهای موجود و چالشبرانگیز برای هوش مصنوعی بنا شدهاند، در خود جای میدهد. تمام وظایف بهصورت طبقهبندی یا رگرسیون بر روی یک جمله یا یک جفت جمله فرموله شدهاند[1].
- CoLA (Corpus of Linguistic Acceptability) — وظیفه تعیین پذیرش دستوری یک جمله. معیار کیفیت — ضریب همبستگی Matthews.
- SST-2 (Stanford Sentiment Treebank) — وظیفه تعیین احساسات (مثبت/منفی) نقد فیلم. معیار — دقت (accuracy).
- MRPC (Microsoft Research Paraphrase Corpus) — وظیفه شناسایی بازنویسی در یک جفت جمله از منابع خبری. معیارها — دقت و معیار F1.
- QQP (Quora Question Pairs) — وظیفه تشخیص سؤالات تکراری از جامعه Quora. معیارها — دقت و معیار F1.
- STS-B (Semantic Textual Similarity Benchmark) — وظیفه تطابق معنایی دو جمله. مدل باید میزان شباهت معنایی را در مقیاس ۱ تا ۵ پیشبینی کند. معیارها — ضریب همبستگی Pearson و Spearman.
- MNLI (Multi-Genre Natural Language Inference) — وظیفه تشخیص استنتاج متنی بر اساس جفت جملات از منابع چندژانره (استنتاج، تناقض، خنثی). نتایج بهطور جداگانه بر روی زیرمجموعههای منطبق (matched) و غیرمنطبق (mismatched) ارزیابی میشوند.
- QNLI (Question Natural Language Inference) — وظیفهای که از تبدیل dataset SQuAD به دست آمده است. لازم است تعیین شود آیا جملهای از یک پاراگراف پاسخ سؤال دادهشده را در بر دارد یا خیر.
- RTE (Recognizing Textual Entailment) — یک dataset ترکیبی از استنتاج متنی که چندین مجموعه کوچک را در بر میگیرد. وظیفه — طبقهبندی دوتایی رابطه بین جملات.
- WNLI (Winograd NLI) — نسخه اصلاحشده طرح Winograd که برای فرمت NLI تطبیق یافته است. وظیفه رفع ابهام ارجاع: به سیستم جملهای با یک ضمیر مبهم داده میشود و باید مشخص کند که ضمیر به کدام یک از دو شیء اشاره دارد.
روش ارزیابی
برای ارزیابی در GLUE، محققان پیشبینیهای مدل خود را به سرور اختصاصی ارسال میکنند و پس از آن محاسبه خودکار معیارها برای هر وظیفه و امتیاز کلی را دریافت میکنند.
- GLUE-score — شاخص نهایی که بهعنوان میانگین نتایج در همه نه وظیفه اصلی محاسبه میشود.
- لیدربورد — جدول عمومی که وضعیت جاری را نشان میدهد و مشخص میکند کدام مدلها در وظایف NLU عملکرد بهتری دارند. استفاده از مجموعههای آزمایشی پنهان مقایسه منصفانه را تضمین میکند.
- مجموعه تشخیصی — مجموعه ویژهای از ۱۱۰۰ نمونه که بهصورت دستی توسط متخصصان برای تحلیل زبانشناختی دقیق حاشیهنویسی شدهاند. این مجموعه بر رتبهبندی تأثیری ندارد، بلکه بهعنوان ابزاری برای تحلیل کیفی به کار میرود تا بررسی شود مدل کدام پدیدههای زبانی (معناشناسی واژگانی، منطق، استدلال عقل سلیم) را میشناسد و با کدامها مشکل دارد[1].
نتایج و تأثیر بر صنعت
هنگام راهاندازی GLUE در سال ۲۰۱۸، بهترین مدلهای آن زمان (برای مثال، BiLSTM با ELMo) نتیجه کلی حدود ۷۰ امتیاز (در مقیاس ۰–۱۰۰) به دست میآوردند که بهطور قابلتوجهی پایینتر از سطح انسانی (حدود ۸۷ امتیاز) بود[2].
ظهور GLUE و لیدربورد عمومی پیشرفت سریعی را در حوزه یادگیری انتقالی در NLP برانگیخت.
- تا اردیبهشت ۱۳۹۸ (می ۲۰۱۹)، در کمتر از یک سال، نسل جدیدی از مدلهای مبتنی بر transformer (در درجه اول BERT) سطح state-of-the-art را به ۸۳.۹ امتیاز رساند.
- در نیمه دوم سال ۲۰۱۹، benchmark GLUE عملاً «فتح شد»: بهترین سیستمها به سطح انسانی نزدیک شدند و در برخی وظایف حتی از آن پیشی گرفتند[3].
GLUE نقش بسیار مهمی بهعنوان نقطه مرجع واحد در توسعه مدلهای درک زبان ایفا کرد. به لطف آن، محققان توانستند معماریهای مختلف را مستقیماً در یک مجموعه پیچیده از وظایف مقایسه کنند، نقاط قوت و ضعف رویکردها را شناسایی کنند و از طریق لیدربورد عمومی بهسرعت دستاوردها را به اشتراک بگذارند.
SuperGLUE: توسعه بعدی
موفقیت سریع GLUE موجب شد که تنها یک سال بعد، همان گروه از نویسندگان با مشارکت همکارانی از Facebook AI، مجموعه جدید و پیچیدهتری به نام SuperGLUE را معرفی کردند[4].
SuperGLUE در اواخر سال ۲۰۱۹ بهعنوان مجموعه آزمونهایی «چسبندهتر» (stickier) معرفی شد که هدف آن ایجاد مجدد فاصله بین تواناییهای مدلهای مدرن و انسان بود. این مجموعه شامل هشت وظیفه است که نیاز به درک عمیقتر زبان دارند، و ابزارها و قوانین بهبودیافتهای برای شرکتکنندگان نیز در آن گنجانده شده است. اگرچه GLUE همچنان بهعنوان یک آزمون پایه مورد استفاده قرار میگیرد، تمرکز اصلی بهبود رقابتی به SuperGLUE و سایر benchmarkهای تخصصیتر منتقل شده است.
پیوندها
- وبسایت رسمی GLUE Benchmark
- صفحه GLUE در Papers With Code با نتایج مدلها
منابع
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
یادداشتها
- ↑ 1.0 1.1 1.2 Wang, A. et al. «GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding». arXiv:1804.07461, 2019. [۱]
- ↑ Bowman, S. R. et al. «Human vs. Muppet: A Conservative Estimate of Human Performance on the GLUE Benchmark». arXiv:1905.10425, 2019. [۲]
- ↑ Wang, A. et al. «SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems». NeurIPS 2019. [۳]
- ↑ «AI models from Microsoft and Google already surpass human performance on the SuperGLUE language benchmark». VentureBeat. [۴]