WinoGrande Benchmark (FA)

From Systems analysis Wiki
Jump to navigation Jump to search

WinoGrande — یک مجموعه داده مرجع در مقیاس بزرگ است که برای ارزیابی توانایی سیستم‌های هوش مصنوعی در استدلال مبتنی بر عقل سلیم طراحی شده است. این مجموعه شامل حدود ۴۴٬۰۰۰ وظیفه است که بر اساس قالب Winograd Schema Challenge (WSC) ساخته شده، اما با استفاده از روش فیلترینگ «adversarial» به‌منظور حذف سرنخ‌های آماری به‌طور قابل‌توجهی گسترش یافته و پیچیده‌تر شده است[1].

این dataset در سال ۲۰۱۹ توسط گروهی از محققان از Allen Institute for AI و دانشگاه واشنگتن توسعه یافت. هر وظیفه یک جمله با جای خالی است که باید با یکی از دو گزینه پر شود و انتخاب گزینه صحیح بر اساس زمینه و درک موقعیت انجام می‌گیرد. WinoGrande به یکی از benchmark‌های کلیدی در حوزه پردازش زبان طبیعی (NLP) تبدیل شده است[2].

پیش‌زمینه ایجاد: منسوخ شدن WSC

Winograd Schema Challenge (WSC) اصلی که در سال ۲۰۱۱ معرفی شد، تنها ۲۷۳ وظیفه داشت و مدت‌ها به‌عنوان آزمون معتبری برای عقل سلیم شناخته می‌شد. وظایف آن به‌گونه‌ای طراحی شده بودند که درک جهان را می‌طلبیدند، نه صرفاً تطبیق ساده کلمات[3].

اما در سال‌های ۲۰۱۸–۲۰۱۹، با ظهور مدل‌های زبانی بزرگ مبتنی بر معماری transformer، از جمله BERT، اوضاع تغییر کرد. مدل‌ها یاد گرفتند آزمون را «دور بزنند» و با بهره‌برداری از الگوهای آماری غیرعمدی (artifacts) در داده‌ها، دقتی حدود ۹۰٪ کسب کنند، نه از طریق درک واقعی[4]. WSC دیگر شاخص معتبری نبود و این امر ضرورت ایجاد یک benchmark جدیدتر، پیچیده‌تر و گسترده‌تر به نام WinoGrande را آشکار کرد.

توسعه و روش adversarial filtering

ایجاد WinoGrande در دو مرحله اصلی انجام شد: تولید انبوه وظایف و سپس فیلتر کردن آن‌ها.

Crowdsourcing

در مرحله اول، با استفاده از پلتفرم Amazon Mechanical Turk پایگاه داده بزرگی شامل بیش از ۴۷٬۰۰۰ جمله گردآوری شد. کارگران crowdsourcing جفت جمله‌هایی را بر اساس طرح Winograd می‌ساختند که تنوع زبانی و «نویز» مشخصه گفتار طبیعی را فراهم می‌کرد، برخلاف وظایفی که توسط گروه کوچکی از متخصصان نوشته می‌شوند[1].

الگوریتم AfLite

نوآوری کلیدی WinoGrande الگوریتم AfLite (Adversarial Filtering Lite) بود. این روش برای حذف خودکار وظایفی طراحی شد که می‌توان آن‌ها را با سرنخ‌های آماری ساده و بدون نیاز به عقل سلیم حل کرد. الگوریتم از مدل‌های ساده برای شناسایی و حذف نمونه‌هایی استفاده می‌کرد که در آن‌ها یکی از پاسخ‌ها ارتباط آماری بیش از حد آشکاری با سایر کلمات جمله داشت. برای مثال، وظیفه‌ای مانند «شیرها زبراها را خوردند چون آن‌ها شکارچی' هستند» فیلتر می‌شد، زیرا کلمه «شکارچی» از نظر آماری ارتباط تنگاتنگی با «شیرها» دارد.

در نتیجه فیلترینگ، حدود ۱۴٪ از داده‌های گردآوری‌شده حذف شد. نسخه نهایی dataset شامل ۴۳٬۹۷۲ وظیفه است که آن را به آزمونی به‌مراتب معتبرتر و چالش‌برانگیزتر تبدیل می‌کند[1].

نتایج مدل‌ها و پیشرفت

در زمان انتشار WinoGrande، بهترین مدل‌های آن دوره نتایجی به‌مراتب پایین‌تر از انسان نشان دادند.

  • RoBERTa (نسخه بهبودیافته BERT) به دقت ~۷۹٪ دست یافت.
  • انسان به‌طور میانگین وظایف را با دقت ~۹۴٪ حل می‌کند[1].

این شکاف تأیید کرد که فیلترینگ AfLite با موفقیت بسیاری از «مسیرهای آسان» را برای مدل‌ها حذف کرده است. اما با پیشرفت LLM‌ها، این شکاف شروع به کاهش کرد.

  • تا سال ۲۰۲۲، مدل ST-MoE-32B به دقت ۹۶٫۱٪ رسید و از سطح انسانی پیشی گرفت[5].
  • GPT-3 نتیجه‌ای حدود ۸۸٪ کسب کرد[6].
  • GPT-4، بدون fine-tuning اختصاصی، وظایف را با دقت ~۸۷٫۵٪ حل می‌کند[7].

تأثیر و انتقادات

WinoGrande به یکی از benchmark‌های کلیدی برای ارزیابی عقل سلیم تبدیل شده و به‌طور منظم برای آزمایش مدل‌های جدید استفاده می‌شود. نتایج آن در گزارش‌های فنی شرکت‌های پیشرو هوش مصنوعی و در پلتفرم‌های مقایسه مدل‌ها منتشر می‌شود[8].

در عین حال، روش ساخت dataset موضوع بحث علمی شده است. برخی محققان اشاره می‌کنند که crowdsourcing انبوه ممکن است منجر به ظهور عبارات غیرطبیعی یا مبهم شده باشد. همچنین تردیدهایی مطرح شده که آیا فیلترینگ خودکار AfLite می‌تواند تمام artifacts پنهان را به‌طور کامل حذف کند یا نه[5]. با این حال، WinoGrande نه‌تنها پیشرفت در معیارها را تحریک کرد، بلکه بحث مهمی درباره ایجاد روش‌های ارزیابی هوش مصنوعی پایدارتر و معتبرتر را نیز به راه انداخت.

پیوندها

  • وب‌سایت رسمی WinoGrande
  • Dataset در پلتفرم Hugging Face

منابع

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

یادداشت‌ها

  1. 1.0 1.1 1.2 1.3 Sakaguchi, K., Le Bras, R., Bhagavatula, C., Choi, Y. «WinoGrande: An Adversarial Winograd Schema Challenge at Scale». arXiv:1907.10641. [۱]
  2. «allenai/winogrande». Hugging Face. [۲]
  3. «Winograd schema challenge». In Wikipedia. [۳]
  4. Kocijan, V. et al. «The defeat of the Winograd Schema Challenge». Artificial Intelligence. [۴]
  5. 5.0 5.1 Lepore, J. «AI Has Been Surprising for Years». Carnegie Endowment for International Peace. [۵]
  6. Brown, T. et al. «Language Models are Few-Shot Learners». arXiv:2005.14165. [۶]
  7. OpenAI. «GPT-4 Technical Report». arXiv:2303.08774. [۷]
  8. «Common Sense Reasoning On Winogrande». HyperAI. [۸]