WinoGrande Benchmark (FA)
WinoGrande — یک مجموعه داده مرجع در مقیاس بزرگ است که برای ارزیابی توانایی سیستمهای هوش مصنوعی در استدلال مبتنی بر عقل سلیم طراحی شده است. این مجموعه شامل حدود ۴۴٬۰۰۰ وظیفه است که بر اساس قالب Winograd Schema Challenge (WSC) ساخته شده، اما با استفاده از روش فیلترینگ «adversarial» بهمنظور حذف سرنخهای آماری بهطور قابلتوجهی گسترش یافته و پیچیدهتر شده است[1].
این dataset در سال ۲۰۱۹ توسط گروهی از محققان از Allen Institute for AI و دانشگاه واشنگتن توسعه یافت. هر وظیفه یک جمله با جای خالی است که باید با یکی از دو گزینه پر شود و انتخاب گزینه صحیح بر اساس زمینه و درک موقعیت انجام میگیرد. WinoGrande به یکی از benchmarkهای کلیدی در حوزه پردازش زبان طبیعی (NLP) تبدیل شده است[2].
پیشزمینه ایجاد: منسوخ شدن WSC
Winograd Schema Challenge (WSC) اصلی که در سال ۲۰۱۱ معرفی شد، تنها ۲۷۳ وظیفه داشت و مدتها بهعنوان آزمون معتبری برای عقل سلیم شناخته میشد. وظایف آن بهگونهای طراحی شده بودند که درک جهان را میطلبیدند، نه صرفاً تطبیق ساده کلمات[3].
اما در سالهای ۲۰۱۸–۲۰۱۹، با ظهور مدلهای زبانی بزرگ مبتنی بر معماری transformer، از جمله BERT، اوضاع تغییر کرد. مدلها یاد گرفتند آزمون را «دور بزنند» و با بهرهبرداری از الگوهای آماری غیرعمدی (artifacts) در دادهها، دقتی حدود ۹۰٪ کسب کنند، نه از طریق درک واقعی[4]. WSC دیگر شاخص معتبری نبود و این امر ضرورت ایجاد یک benchmark جدیدتر، پیچیدهتر و گستردهتر به نام WinoGrande را آشکار کرد.
توسعه و روش adversarial filtering
ایجاد WinoGrande در دو مرحله اصلی انجام شد: تولید انبوه وظایف و سپس فیلتر کردن آنها.
Crowdsourcing
در مرحله اول، با استفاده از پلتفرم Amazon Mechanical Turk پایگاه داده بزرگی شامل بیش از ۴۷٬۰۰۰ جمله گردآوری شد. کارگران crowdsourcing جفت جملههایی را بر اساس طرح Winograd میساختند که تنوع زبانی و «نویز» مشخصه گفتار طبیعی را فراهم میکرد، برخلاف وظایفی که توسط گروه کوچکی از متخصصان نوشته میشوند[1].
الگوریتم AfLite
نوآوری کلیدی WinoGrande الگوریتم AfLite (Adversarial Filtering Lite) بود. این روش برای حذف خودکار وظایفی طراحی شد که میتوان آنها را با سرنخهای آماری ساده و بدون نیاز به عقل سلیم حل کرد. الگوریتم از مدلهای ساده برای شناسایی و حذف نمونههایی استفاده میکرد که در آنها یکی از پاسخها ارتباط آماری بیش از حد آشکاری با سایر کلمات جمله داشت. برای مثال، وظیفهای مانند «شیرها زبراها را خوردند چون آنها شکارچی' هستند» فیلتر میشد، زیرا کلمه «شکارچی» از نظر آماری ارتباط تنگاتنگی با «شیرها» دارد.
در نتیجه فیلترینگ، حدود ۱۴٪ از دادههای گردآوریشده حذف شد. نسخه نهایی dataset شامل ۴۳٬۹۷۲ وظیفه است که آن را به آزمونی بهمراتب معتبرتر و چالشبرانگیزتر تبدیل میکند[1].
نتایج مدلها و پیشرفت
در زمان انتشار WinoGrande، بهترین مدلهای آن دوره نتایجی بهمراتب پایینتر از انسان نشان دادند.
- RoBERTa (نسخه بهبودیافته BERT) به دقت ~۷۹٪ دست یافت.
- انسان بهطور میانگین وظایف را با دقت ~۹۴٪ حل میکند[1].
این شکاف تأیید کرد که فیلترینگ AfLite با موفقیت بسیاری از «مسیرهای آسان» را برای مدلها حذف کرده است. اما با پیشرفت LLMها، این شکاف شروع به کاهش کرد.
- تا سال ۲۰۲۲، مدل ST-MoE-32B به دقت ۹۶٫۱٪ رسید و از سطح انسانی پیشی گرفت[5].
- GPT-3 نتیجهای حدود ۸۸٪ کسب کرد[6].
- GPT-4، بدون fine-tuning اختصاصی، وظایف را با دقت ~۸۷٫۵٪ حل میکند[7].
تأثیر و انتقادات
WinoGrande به یکی از benchmarkهای کلیدی برای ارزیابی عقل سلیم تبدیل شده و بهطور منظم برای آزمایش مدلهای جدید استفاده میشود. نتایج آن در گزارشهای فنی شرکتهای پیشرو هوش مصنوعی و در پلتفرمهای مقایسه مدلها منتشر میشود[8].
در عین حال، روش ساخت dataset موضوع بحث علمی شده است. برخی محققان اشاره میکنند که crowdsourcing انبوه ممکن است منجر به ظهور عبارات غیرطبیعی یا مبهم شده باشد. همچنین تردیدهایی مطرح شده که آیا فیلترینگ خودکار AfLite میتواند تمام artifacts پنهان را بهطور کامل حذف کند یا نه[5]. با این حال، WinoGrande نهتنها پیشرفت در معیارها را تحریک کرد، بلکه بحث مهمی درباره ایجاد روشهای ارزیابی هوش مصنوعی پایدارتر و معتبرتر را نیز به راه انداخت.
پیوندها
- وبسایت رسمی WinoGrande
- Dataset در پلتفرم Hugging Face
منابع
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
یادداشتها
- ↑ 1.0 1.1 1.2 1.3 Sakaguchi, K., Le Bras, R., Bhagavatula, C., Choi, Y. «WinoGrande: An Adversarial Winograd Schema Challenge at Scale». arXiv:1907.10641. [۱]
- ↑ «allenai/winogrande». Hugging Face. [۲]
- ↑ «Winograd schema challenge». In Wikipedia. [۳]
- ↑ Kocijan, V. et al. «The defeat of the Winograd Schema Challenge». Artificial Intelligence. [۴]
- ↑ 5.0 5.1 Lepore, J. «AI Has Been Surprising for Years». Carnegie Endowment for International Peace. [۵]
- ↑ Brown, T. et al. «Language Models are Few-Shot Learners». arXiv:2005.14165. [۶]
- ↑ OpenAI. «GPT-4 Technical Report». arXiv:2303.08774. [۷]
- ↑ «Common Sense Reasoning On Winogrande». HyperAI. [۸]