---
title: "WinoGrande Benchmark — مقياس WinoGrande"
source: "https://systems-analysis.info/int/WinoGrande_Benchmark_%E2%80%94_%D9%85%D9%82%D9%8A%D8%A7%D8%B3_WinoGrande"
wiki: "systems-analysis.info/int"
article: "WinoGrande_Benchmark_—_مقياس_WinoGrande"
language: "ar"
categories:
  - "Category:Arabic"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 8497
wiki_created_at: 2026-09-07T01:18:15Z
wiki_modified_at: 2026-09-07T01:18:15Z
downloaded_at: 2026-09-07T23:25:42Z
---

# WinoGrande Benchmark — مقياس WinoGrande

**WinoGrande** — هي مجموعة بيانات معيارية واسعة النطاق، مصممة لتقييم قدرة أنظمة الذكاء الاصطناعي على التفكير المنطقي المبني على الفطرة السليمة. تحتوي على حوالي 44,000 مهمة مبنية على صيغة تحدي مخططات وينوجراد (Winograd Schema Challenge - WSC)، ولكنها موسعة ومعقدة بشكل كبير باستخدام طريقة ترشيح "تنافسية" (adversarial) لإزالة الإشارات الإحصائية المضللة<sup>[\[1\]](https://systems-analysis.info/int/WinoGrande_Benchmark_%E2%80%94_%D9%85%D9%82%D9%8A%D8%A7%D8%B3_WinoGrande#cite_note-sakaguchi2019-1)</sup>.

تم تطوير مجموعة البيانات هذه في عام 2019 من قبل مجموعة من الباحثين من **Allen Institute for AI** و**جامعة واشنطن**. كل مهمة عبارة عن جملة بها فراغ يجب ملؤه بأحد خيارين، مع اختيار الإجابة الصحيحة بناءً على السياق وفهم الموقف. أصبح WinoGrande أحد المقاييس الرئيسية في مجال معالجة اللغات الطبيعية (NLP)<sup>[\[2\]](https://systems-analysis.info/int/WinoGrande_Benchmark_%E2%80%94_%D9%85%D9%82%D9%8A%D8%A7%D8%B3_WinoGrande#cite_note-huggingface-2)</sup>.

## الخلفية: تقادم تحدي WSC

تحدي **Winograd Schema Challenge** (WSC) الأصلي، الذي تم اقتراحه في عام 2011، كان يحتوي على 273 مهمة فقط واعتُبر لفترة طويلة اختبارًا موثوقًا للفطرة السليمة. صُممت المهام فيه لتتطلب فهمًا للعالم، وليس مجرد مطابقة بسيطة للكلمات<sup>[\[3\]](https://systems-analysis.info/int/WinoGrande_Benchmark_%E2%80%94_%D9%85%D9%82%D9%8A%D8%A7%D8%B3_WinoGrande#cite_note-wsc_wiki-3)</sup>.

لكن بحلول عامي 2018–2019، ومع ظهور نماذج اللغة الكبيرة القائمة على معمارية "المحول" (Transformer)، مثل **BERT**، تغير الوضع. فقد تعلمت النماذج كيفية "خداع" الاختبار، محققة دقة تصل إلى حوالي 90% من خلال استغلال الأنماط الإحصائية غير المقصودة (العيوب أو artifacts) في البيانات، بدلاً من الفهم الحقيقي<sup>[\[4\]](https://systems-analysis.info/int/WinoGrande_Benchmark_%E2%80%94_%D9%85%D9%82%D9%8A%D8%A7%D8%B3_WinoGrande#cite_note-kocijan2023-4)</sup>. لم يعد تحدي WSC مؤشرًا موثوقًا، مما استدعى الحاجة إلى إنشاء مقياس جديد أكثر تعقيدًا وأوسع نطاقًا، وهو WinoGrande.

## التطوير وطريقة الترشيح التنافسي (adversarial filtering)

مر إنشاء WinoGrande بمرحلتين رئيسيتين: التوليد الجماعي للمهام ثم ترشيحها.

### التعهيد الجماعي (Crowdsourcing)

في المرحلة الأولى، وباستخدام منصة **Amazon Mechanical Turk**، تم تجميع قاعدة بيانات كبيرة تضم أكثر من 47,000 جملة. قام العاملون عبر المنصة بإنشاء أزواج من الجمل وفقًا لمخطط وينوجراد، مما ضمن التنوع اللغوي و"الضوضاء" التي تميز اللغة الطبيعية، على عكس المهام التي يكتبها فريق صغير من الخبراء<sup>[\[1\]](https://systems-analysis.info/int/WinoGrande_Benchmark_%E2%80%94_%D9%85%D9%82%D9%8A%D8%A7%D8%B3_WinoGrande#cite_note-sakaguchi2019-1)</sup>.

### خوارزمية AfLite

كان الابتكار الرئيسي في WinoGrande هو خوارزمية **AfLite** (اختصار لـ **Adversarial Filtering Lite**). صُممت هذه الطريقة لاستبعاد المهام التي يمكن حلها تلقائيًا بالاعتماد على إشارات إحصائية بسيطة، دون الحاجة إلى الفطرة السليمة. استخدمت الخوارزمية نماذج بسيطة لتحديد وإزالة الأمثلة التي كان فيها أحد الخيارين مرتبطًا بشكل واضح جدًا بكلمات أخرى في الجملة. *على سبيل المثال، مهمة مثل «أكلت الأسود الحمر الوحشية لأنها **مفترسة**» كان سيتم استبعادها، لأن كلمة "مفترسة" ترتبط إحصائيًا بشكل وثيق بكلمة "الأسود".*

نتيجة لعملية الترشيح، تم استبعاد حوالي 14% من البيانات التي جُمعت. تتضمن النسخة النهائية من مجموعة البيانات **43972 مهمة**، مما يجعلها اختبارًا أكثر موثوقية وتعقيدًا بشكل ملحوظ<sup>[\[1\]](https://systems-analysis.info/int/WinoGrande_Benchmark_%E2%80%94_%D9%85%D9%82%D9%8A%D8%A7%D8%B3_WinoGrande#cite_note-sakaguchi2019-1)</sup>.

## نتائج النماذج والتقدم المحرز

عند إطلاق WinoGrande، أظهرت أفضل النماذج في ذلك الوقت نتائج أقل بكثير من الأداء البشري.

- **RoBERTa** (نسخة محسّنة من BERT) حقق دقة بلغت **~79%**.
- **الإنسان**، في المتوسط، يحل المهام بدقة تبلغ **~94%**<sup>[\[1\]](https://systems-analysis.info/int/WinoGrande_Benchmark_%E2%80%94_%D9%85%D9%82%D9%8A%D8%A7%D8%B3_WinoGrande#cite_note-sakaguchi2019-1)</sup>.

أكدت هذه الفجوة أن الترشيح باستخدام AfLite قد نجح في إزالة العديد من "الطرق السهلة" أمام النماذج. ولكن مع تطور LLM، بدأت هذه الفجوة تتقلص.

- بحلول عام 2022، وصل نموذج **ST-MoE-32B** إلى دقة **96.1%**، متجاوزًا المستوى البشري<sup>[\[5\]](https://systems-analysis.info/int/WinoGrande_Benchmark_%E2%80%94_%D9%85%D9%82%D9%8A%D8%A7%D8%B3_WinoGrande#cite_note-lepore2025-5)</sup>.
- أظهر نموذج **GPT-3** نتيجة بلغت حوالي **88%**<sup>[\[6\]](https://systems-analysis.info/int/WinoGrande_Benchmark_%E2%80%94_%D9%85%D9%82%D9%8A%D8%A7%D8%B3_WinoGrande#cite_note-brown2020-6)</sup>.
- يحل نموذج **GPT-4**، دون تدريب مسبق متخصص، المهام بدقة تبلغ **~87.5%**<sup>[\[7\]](https://systems-analysis.info/int/WinoGrande_Benchmark_%E2%80%94_%D9%85%D9%82%D9%8A%D8%A7%D8%B3_WinoGrande#cite_note-openai2023-7)</sup>.

## التأثير والنقد

أصبح WinoGrande أحد المقاييس الرئيسية لتقييم الفطرة السليمة، ويُستخدم بانتظام لاختبار النماذج الجديدة. تُنشر نتائجه في التقارير الفنية لـشركات الذكاء الاصطناعي الرائدة وعلى منصات مقارنة النماذج<sup>[\[8\]](https://systems-analysis.info/int/WinoGrande_Benchmark_%E2%80%94_%D9%85%D9%82%D9%8A%D8%A7%D8%B3_WinoGrande#cite_note-hyper_ai-8)</sup>.

في الوقت نفسه، أصبحت منهجية إنشاء مجموعة البيانات موضوعًا للنقاش العلمي. يشير بعض الباحثين إلى أن التعهيد الجماعي المكثف ربما أدى إلى ظهور عبارات غير طبيعية أو غامضة. كما أُثيرت شكوك حول ما إذا كان الترشيح التلقائي باستخدام AfLite قادرًا على إزالة جميع العيوب (artifacts) الخفية بالكامل<sup>[\[5\]](https://systems-analysis.info/int/WinoGrande_Benchmark_%E2%80%94_%D9%85%D9%82%D9%8A%D8%A7%D8%B3_WinoGrande#cite_note-lepore2025-5)</sup>. ومع ذلك، لم يحفز WinoGrande التقدم في المقاييس فحسب، بل أثار أيضًا نقاشًا مهمًا حول تطوير طرق أكثر قوة وموثوقية لتقييم الذكاء الاصطناعي.

## روابط خارجية

- <a href="https://winogrande.allenai.org/" class="external text" rel="nofollow">الموقع الرسمي لـ WinoGrande</a>
- <a href="https://huggingface.co/datasets/allenai/winogrande" class="external text" rel="nofollow">مجموعة البيانات على منصة Hugging Face</a>

## مراجع

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. <a href="https://arxiv.org/abs/2211.09110" class="external text" rel="nofollow">arXiv:2211.09110</a>.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. <a href="https://arxiv.org/abs/2307.03109" class="external text" rel="nofollow">arXiv:2307.03109</a>.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. <a href="https://arxiv.org/abs/2508.15361" class="external text" rel="nofollow">arXiv:2508.15361</a>.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. <a href="https://arxiv.org/abs/2405.14782" class="external text" rel="nofollow">arXiv:2405.14782</a>.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. <a href="https://arxiv.org/abs/2104.14337" class="external text" rel="nofollow">arXiv:2104.14337</a>.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. <a href="https://arxiv.org/abs/2106.06052" class="external text" rel="nofollow">arXiv:2106.06052</a>.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. <a href="https://arxiv.org/abs/2101.04840" class="external text" rel="nofollow">arXiv:2101.04840</a>.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. <a href="https://arxiv.org/abs/2406.04244" class="external text" rel="nofollow">arXiv:2406.04244</a>.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. <a href="https://arxiv.org/abs/2506.11094" class="external text" rel="nofollow">arXiv:2506.11094</a>.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. <a href="https://arxiv.org/abs/2403.04132" class="external text" rel="nofollow">arXiv:2403.04132</a>.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. <a href="https://arxiv.org/abs/2311.17295" class="external text" rel="nofollow">arXiv:2311.17295</a>.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. <a href="https://arxiv.org/abs/2311.05232" class="external text" rel="nofollow">arXiv:2311.05232</a>.

## ملاحظات

1.  <span id="cite_note-sakaguchi2019-1">↑ <sup>[1.0](https://systems-analysis.info/int/WinoGrande_Benchmark_%E2%80%94_%D9%85%D9%82%D9%8A%D8%A7%D8%B3_WinoGrande#cite_ref-sakaguchi2019_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/WinoGrande_Benchmark_%E2%80%94_%D9%85%D9%82%D9%8A%D8%A7%D8%B3_WinoGrande#cite_ref-sakaguchi2019_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/WinoGrande_Benchmark_%E2%80%94_%D9%85%D9%82%D9%8A%D8%A7%D8%B3_WinoGrande#cite_ref-sakaguchi2019_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/WinoGrande_Benchmark_%E2%80%94_%D9%85%D9%82%D9%8A%D8%A7%D8%B3_WinoGrande#cite_ref-sakaguchi2019_1-3)</sup> Sakaguchi, K., Le Bras, R., Bhagavatula, C., Choi, Y. «WinoGrande: An Adversarial Winograd Schema Challenge at Scale». *arXiv:1907.10641*. <a href="https://arxiv.org/abs/1907.10641" class="external autonumber" rel="nofollow">[١]</a></span>
2.  <span id="cite_note-huggingface-2">[↑](https://systems-analysis.info/int/WinoGrande_Benchmark_%E2%80%94_%D9%85%D9%82%D9%8A%D8%A7%D8%B3_WinoGrande#cite_ref-huggingface_2-0) «allenai/winogrande». *Hugging Face*. <a href="https://huggingface.co/datasets/allenai/winogrande" class="external autonumber" rel="nofollow">[٢]</a></span>
3.  <span id="cite_note-wsc_wiki-3">[↑](https://systems-analysis.info/int/WinoGrande_Benchmark_%E2%80%94_%D9%85%D9%82%D9%8A%D8%A7%D8%B3_WinoGrande#cite_ref-wsc_wiki_3-0) «Winograd schema challenge». In *Wikipedia*. <a href="https://en.wikipedia.org/wiki/Winograd_schema_challenge" class="external autonumber" rel="nofollow">[٣]</a></span>
4.  <span id="cite_note-kocijan2023-4">[↑](https://systems-analysis.info/int/WinoGrande_Benchmark_%E2%80%94_%D9%85%D9%82%D9%8A%D8%A7%D8%B3_WinoGrande#cite_ref-kocijan2023_4-0) Kocijan, V. et al. «The defeat of the Winograd Schema Challenge». *Artificial Intelligence*. <a href="https://www.sciencedirect.com/science/article/pii/S000437022300055X" class="external autonumber" rel="nofollow">[٤]</a></span>
5.  <span id="cite_note-lepore2025-5">↑ <sup>[5.0](https://systems-analysis.info/int/WinoGrande_Benchmark_%E2%80%94_%D9%85%D9%82%D9%8A%D8%A7%D8%B3_WinoGrande#cite_ref-lepore2025_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/WinoGrande_Benchmark_%E2%80%94_%D9%85%D9%82%D9%8A%D8%A7%D8%B3_WinoGrande#cite_ref-lepore2025_5-1)</sup> Lepore, J. «AI Has Been Surprising for Years». *Carnegie Endowment for International Peace*. <a href="https://carnegieendowment.org/research/2025/01/ai-has-been-surprising-for-years?lang=en" class="external autonumber" rel="nofollow">[٥]</a></span>
6.  <span id="cite_note-brown2020-6">[↑](https://systems-analysis.info/int/WinoGrande_Benchmark_%E2%80%94_%D9%85%D9%82%D9%8A%D8%A7%D8%B3_WinoGrande#cite_ref-brown2020_6-0) Brown, T. et al. «Language Models are Few-Shot Learners». *arXiv:2005.14165*. <a href="https://arxiv.org/abs/2005.14165" class="external autonumber" rel="nofollow">[٦]</a></span>
7.  <span id="cite_note-openai2023-7">[↑](https://systems-analysis.info/int/WinoGrande_Benchmark_%E2%80%94_%D9%85%D9%82%D9%8A%D8%A7%D8%B3_WinoGrande#cite_ref-openai2023_7-0) OpenAI. «GPT-4 Technical Report». *arXiv:2303.08774*. <a href="https://arxiv.org/abs/2303.08774" class="external autonumber" rel="nofollow">[٧]</a></span>
8.  <span id="cite_note-hyper_ai-8">[↑](https://systems-analysis.info/int/WinoGrande_Benchmark_%E2%80%94_%D9%85%D9%82%D9%8A%D8%A7%D8%B3_WinoGrande#cite_ref-hyper_ai_8-0) «Common Sense Reasoning On Winogrande». *HyperAI*. <a href="https://hyper.ai/en/sota/tasks/common-sense-reasoning/benchmark/common-sense-reasoning-on-winogrande" class="external autonumber" rel="nofollow">[٨]</a></span>
