GLUE Benchmark (FA)

From Systems analysis Wiki
Jump to navigation Jump to search

GLUE (مخفف General Language Understanding Evaluation، «ارزیابی کلی درک زبان») یک benchmark چندوظیفه‌ای برای سنجش کیفیت مدل‌های پردازش زبان طبیعی (NLU) است. این benchmark در سال ۲۰۱۸ توسط گروهی از محققان دانشگاه نیویورک، دانشگاه واشنگتن و DeepMind، از جمله الکس وانگ و سموئل بومن، معرفی شد و در جامعه پژوهشی به‌طور گسترده مورد استفاده قرار گرفت[1].

هدف اصلی GLUE فراهم کردن یک مجموعه آزمایشی یکپارچه، بی‌طرفانه و چالش‌برانگیز برای ارزیابی مقایسه‌ای توانایی‌های مدل‌های NLU در مجموعه‌ای متنوع از وظایف فراتر از یک حوزه خاص است. این benchmark شامل یک پلتفرم آنلاین با لیدربورد (جدول رکوردها) است که مقایسه عینی مدل‌ها را تضمین کرده و از تنظیم بیش از حد بر روی داده‌های آزمایشی جلوگیری می‌کند، زیرا برچسب‌های واقعی برخی آزمون‌ها منتشر نمی‌شوند و تنها از طریق سرور ارزیابی در دسترس هستند. فرض بر این است که برای دستیابی به نتایج بالا، مدل باید بتواند بازنمایی‌های زبانی عمومی را استخراج کرده و دانش را به‌طور مؤثر بین انواع مختلف وظایف منتقل کند.

ترکیب و وظایف benchmark

بenchmark GLUE نه وظیفه مختلف درک زبان را که بر اساس dataset‌های موجود و چالش‌برانگیز برای هوش مصنوعی بنا شده‌اند، در خود جای می‌دهد. تمام وظایف به‌صورت طبقه‌بندی یا رگرسیون بر روی یک جمله یا یک جفت جمله فرموله شده‌اند[1].

  • CoLA (Corpus of Linguistic Acceptability) — وظیفه تعیین پذیرش دستوری یک جمله. معیار کیفیت — ضریب همبستگی Matthews.
  • SST-2 (Stanford Sentiment Treebank) — وظیفه تعیین احساسات (مثبت/منفی) نقد فیلم. معیار — دقت (accuracy).
  • MRPC (Microsoft Research Paraphrase Corpus) — وظیفه شناسایی بازنویسی در یک جفت جمله از منابع خبری. معیارها — دقت و معیار F1.
  • QQP (Quora Question Pairs) — وظیفه تشخیص سؤالات تکراری از جامعه Quora. معیارها — دقت و معیار F1.
  • STS-B (Semantic Textual Similarity Benchmark) — وظیفه تطابق معنایی دو جمله. مدل باید میزان شباهت معنایی را در مقیاس ۱ تا ۵ پیش‌بینی کند. معیارها — ضریب همبستگی Pearson و Spearman.
  • MNLI (Multi-Genre Natural Language Inference) — وظیفه تشخیص استنتاج متنی بر اساس جفت جملات از منابع چندژانره (استنتاج، تناقض، خنثی). نتایج به‌طور جداگانه بر روی زیرمجموعه‌های منطبق (matched) و غیرمنطبق (mismatched) ارزیابی می‌شوند.
  • QNLI (Question Natural Language Inference) — وظیفه‌ای که از تبدیل dataset SQuAD به دست آمده است. لازم است تعیین شود آیا جمله‌ای از یک پاراگراف پاسخ سؤال داده‌شده را در بر دارد یا خیر.
  • RTE (Recognizing Textual Entailment) — یک dataset ترکیبی از استنتاج متنی که چندین مجموعه کوچک را در بر می‌گیرد. وظیفه — طبقه‌بندی دوتایی رابطه بین جملات.
  • WNLI (Winograd NLI) — نسخه اصلاح‌شده طرح Winograd که برای فرمت NLI تطبیق یافته است. وظیفه رفع ابهام ارجاع: به سیستم جمله‌ای با یک ضمیر مبهم داده می‌شود و باید مشخص کند که ضمیر به کدام یک از دو شیء اشاره دارد.

روش ارزیابی

برای ارزیابی در GLUE، محققان پیش‌بینی‌های مدل خود را به سرور اختصاصی ارسال می‌کنند و پس از آن محاسبه خودکار معیارها برای هر وظیفه و امتیاز کلی را دریافت می‌کنند.

  • GLUE-score — شاخص نهایی که به‌عنوان میانگین نتایج در همه نه وظیفه اصلی محاسبه می‌شود.
  • لیدربورد — جدول عمومی که وضعیت جاری را نشان می‌دهد و مشخص می‌کند کدام مدل‌ها در وظایف NLU عملکرد بهتری دارند. استفاده از مجموعه‌های آزمایشی پنهان مقایسه منصفانه را تضمین می‌کند.
  • مجموعه تشخیصی — مجموعه ویژه‌ای از ۱۱۰۰ نمونه که به‌صورت دستی توسط متخصصان برای تحلیل زبان‌شناختی دقیق حاشیه‌نویسی شده‌اند. این مجموعه بر رتبه‌بندی تأثیری ندارد، بلکه به‌عنوان ابزاری برای تحلیل کیفی به کار می‌رود تا بررسی شود مدل کدام پدیده‌های زبانی (معناشناسی واژگانی، منطق، استدلال عقل سلیم) را می‌شناسد و با کدام‌ها مشکل دارد[1].

نتایج و تأثیر بر صنعت

هنگام راه‌اندازی GLUE در سال ۲۰۱۸، بهترین مدل‌های آن زمان (برای مثال، BiLSTM با ELMo) نتیجه کلی حدود ۷۰ امتیاز (در مقیاس ۰–۱۰۰) به دست می‌آوردند که به‌طور قابل‌توجهی پایین‌تر از سطح انسانی (حدود ۸۷ امتیاز) بود[2].

ظهور GLUE و لیدربورد عمومی پیشرفت سریعی را در حوزه یادگیری انتقالی در NLP برانگیخت.

  • تا اردیبهشت ۱۳۹۸ (می ۲۰۱۹)، در کمتر از یک سال، نسل جدیدی از مدل‌های مبتنی بر transformer (در درجه اول BERT) سطح state-of-the-art را به ۸۳.۹ امتیاز رساند.
  • در نیمه دوم سال ۲۰۱۹، benchmark GLUE عملاً «فتح شد»: بهترین سیستم‌ها به سطح انسانی نزدیک شدند و در برخی وظایف حتی از آن پیشی گرفتند[3].

GLUE نقش بسیار مهمی به‌عنوان نقطه مرجع واحد در توسعه مدل‌های درک زبان ایفا کرد. به لطف آن، محققان توانستند معماری‌های مختلف را مستقیماً در یک مجموعه پیچیده از وظایف مقایسه کنند، نقاط قوت و ضعف رویکردها را شناسایی کنند و از طریق لیدربورد عمومی به‌سرعت دستاوردها را به اشتراک بگذارند.

SuperGLUE: توسعه بعدی

موفقیت سریع GLUE موجب شد که تنها یک سال بعد، همان گروه از نویسندگان با مشارکت همکارانی از Facebook AI، مجموعه جدید و پیچیده‌تری به نام SuperGLUE را معرفی کردند[4].

SuperGLUE در اواخر سال ۲۰۱۹ به‌عنوان مجموعه آزمون‌هایی «چسبنده‌تر» (stickier) معرفی شد که هدف آن ایجاد مجدد فاصله بین توانایی‌های مدل‌های مدرن و انسان بود. این مجموعه شامل هشت وظیفه است که نیاز به درک عمیق‌تر زبان دارند، و ابزارها و قوانین بهبودیافته‌ای برای شرکت‌کنندگان نیز در آن گنجانده شده است. اگرچه GLUE همچنان به‌عنوان یک آزمون پایه مورد استفاده قرار می‌گیرد، تمرکز اصلی بهبود رقابتی به SuperGLUE و سایر benchmark‌های تخصصی‌تر منتقل شده است.

پیوندها

  • وب‌سایت رسمی GLUE Benchmark
  • صفحه GLUE در Papers With Code با نتایج مدل‌ها

منابع

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

یادداشت‌ها

  1. 1.0 1.1 1.2 Wang, A. et al. «GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding». arXiv:1804.07461, 2019. [۱]
  2. Bowman, S. R. et al. «Human vs. Muppet: A Conservative Estimate of Human Performance on the GLUE Benchmark». arXiv:1905.10425, 2019. [۲]
  3. Wang, A. et al. «SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems». NeurIPS 2019. [۳]
  4. «AI models from Microsoft and Google already surpass human performance on the SuperGLUE language benchmark». VentureBeat. [۴]