---
title: "WinoGrande Benchmark — WinoGrandeベンチマーク"
source: "https://systems-analysis.info/int/WinoGrande_Benchmark_%E2%80%94_WinoGrande%E3%83%99%E3%83%B3%E3%83%81%E3%83%9E%E3%83%BC%E3%82%AF"
wiki: "systems-analysis.info/int"
article: "WinoGrande_Benchmark_—_WinoGrandeベンチマーク"
language: "ja"
categories:
  - "Category:Japanese"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 8495
wiki_created_at: 2026-09-07T01:18:14Z
wiki_modified_at: 2026-09-07T01:18:14Z
downloaded_at: 2026-09-07T23:25:42Z
---

# WinoGrande Benchmark — WinoGrandeベンチマーク

**WinoGrande**は、人工知能システムの常識推論能力を評価するために設計された大規模なベンチマークデータセットです。約44,000のタスクを含んでおり、これらはWinograd Schema Challenge (WSC) の形式に基づいていますが、「敵対的」なフィルタリング手法を用いて統計的な手がかりを排除することで、大幅に拡張および複雑化されています<sup>[\[1\]](https://systems-analysis.info/int/WinoGrande_Benchmark_%E2%80%94_WinoGrande%E3%83%99%E3%83%B3%E3%83%81%E3%83%9E%E3%83%BC%E3%82%AF#cite_note-sakaguchi2019-1)</sup>。

このデータセットは、2019年に**Allen Institute for AI**と**ワシントン大学**の研究者グループによって開発されました。各タスクは、文脈と状況の理解に基づいて2つの選択肢から正しいものを選び、空欄を埋める形式の問題です。WinoGrandeは、自然言語処理（NLP）の分野における主要なベンチマークの一つとなりました<sup>[\[2\]](https://systems-analysis.info/int/WinoGrande_Benchmark_%E2%80%94_WinoGrande%E3%83%99%E3%83%B3%E3%83%81%E3%83%9E%E3%83%BC%E3%82%AF#cite_note-huggingface-2)</sup>。

## 作成の背景：WSCの陳腐化

2011年に提案されたオリジナルの**Winograd Schema Challenge**（WSC）は、わずか273のタスクしか含んでおらず、長らく常識を測る信頼性の高いテストと見なされていました。そのタスクは、単なる単語のマッチングではなく、世界の理解を要求するように設計されていました<sup>[\[3\]](https://systems-analysis.info/int/WinoGrande_Benchmark_%E2%80%94_WinoGrande%E3%83%99%E3%83%B3%E3%83%81%E3%83%9E%E3%83%BC%E3%82%AF#cite_note-wsc_wiki-3)</sup>。

しかし、2018年から2019年にかけて、**BERT**のようなトランスフォーマーアーキテクチャに基づく大規模言語モデルの登場により、状況は一変しました。モデルは、真の理解ではなく、データ内の意図しない統計的パターン（アーティファクト）を利用することで、約90%の精度を達成し、テストを「攻略」するようになりました<sup>[\[4\]](https://systems-analysis.info/int/WinoGrande_Benchmark_%E2%80%94_WinoGrande%E3%83%99%E3%83%B3%E3%83%81%E3%83%9E%E3%83%BC%E3%82%AF#cite_note-kocijan2023-4)</sup>。WSCはもはや信頼できる指標ではなくなり、これが、より複雑で大規模な新しいベンチマークであるWinoGrandeの作成につながりました。

## Development and adversarial filtering method - 開発と敵対的フィルタリング手法

WinoGrandeの作成は、主に2つの段階で行われました：タスクの大量生成とその後のフィルタリングです。

### クラウドソーシング

最初の段階では、**Amazon Mechanical Turk**プラットフォームを利用して、47,000以上の文からなる大規模なデータベースが収集されました。クラウドワーカーはWinogradスキーマに従って文のペアを作成しました。これにより、少数の専門家によって作成されたタスクとは異なり、自然な会話に特有の言語的多様性と「ノイズ」が確保されました<sup>[\[1\]](https://systems-analysis.info/int/WinoGrande_Benchmark_%E2%80%94_WinoGrande%E3%83%99%E3%83%B3%E3%83%81%E3%83%9E%E3%83%BC%E3%82%AF#cite_note-sakaguchi2019-1)</sup>。

### AfLite algorithm - AfLiteアルゴリズム

WinoGrandeの主要な革新点は、**AfLite**（**Adversarial Filtering Lite**）アルゴリズムです。この手法は、常識を必要とせず、単純な統計的手がかりで解決できてしまうタスクを自動的に除外するために開発されました。アルゴリズムは、単純なモデルを用いて、選択肢の一方が文中の他の単語とあまりにも明白に関連している例を特定し、削除しました。 *例えば、「ライオンはシマウマを食べた。なぜなら彼らは**捕食者**だからだ」というタスクは、「捕食者」という単語が統計的に「ライオン」と強く関連しているため、フィルタリングされます。*

フィルタリングの結果、収集されたデータの約14%が破棄されました。データセットの最終版には**43,972個のタスク**が含まれており、これにより、はるかに信頼性が高く、困難なテストとなっています<sup>[\[1\]](https://systems-analysis.info/int/WinoGrande_Benchmark_%E2%80%94_WinoGrande%E3%83%99%E3%83%B3%E3%83%81%E3%83%9E%E3%83%BC%E3%82%AF#cite_note-sakaguchi2019-1)</sup>。

## モデルの性能と進展

WinoGrandeが公開された当時、最先端のモデルは人間よりも大幅に低い性能しか示せませんでした。

- **RoBERTa**（BERTの改良版）は、精度**約79%**を達成しました。
- **人間**は平均して**約94%**の精度でタスクを解決します<sup>[\[1\]](https://systems-analysis.info/int/WinoGrande_Benchmark_%E2%80%94_WinoGrande%E3%83%99%E3%83%B3%E3%83%81%E3%83%9E%E3%83%BC%E3%82%AF#cite_note-sakaguchi2019-1)</sup>。

この差は、AfLiteフィルタリングがモデルにとっての多くの「簡単な」解決策を効果的に排除したことを裏付けました。しかし、LLMの発展に伴い、この差は縮まり始めました。

- 2022年までに、モデル**ST-MoE-32B**は**96.1%**の精度を達成し、人間レベルを超えました<sup>[\[5\]](https://systems-analysis.info/int/WinoGrande_Benchmark_%E2%80%94_WinoGrande%E3%83%99%E3%83%B3%E3%83%81%E3%83%9E%E3%83%BC%E3%82%AF#cite_note-lepore2025-5)</sup>。
- **GPT-3**は、約**88%**のスコアを示しました<sup>[\[6\]](https://systems-analysis.info/int/WinoGrande_Benchmark_%E2%80%94_WinoGrande%E3%83%99%E3%83%B3%E3%83%81%E3%83%9E%E3%83%BC%E3%82%AF#cite_note-brown2020-6)</sup>。
- **GPT-4**は、特別なファインチューニングなしで、**約87.5%**の精度でタスクを解決します<sup>[\[7\]](https://systems-analysis.info/int/WinoGrande_Benchmark_%E2%80%94_WinoGrande%E3%83%99%E3%83%B3%E3%83%81%E3%83%9E%E3%83%BC%E3%82%AF#cite_note-openai2023-7)</sup>。

## 影響と批判

WinoGrandeは常識を評価するための主要なベンチマークの一つとなり、新しいモデルのテストに定期的に使用されています。その結果は、主要なAI企業の技術報告書やモデル比較プラットフォームで公開されています<sup>[\[8\]](https://systems-analysis.info/int/WinoGrande_Benchmark_%E2%80%94_WinoGrande%E3%83%99%E3%83%B3%E3%83%81%E3%83%9E%E3%83%BC%E3%82%AF#cite_note-hyper_ai-8)</sup>。

同時に、データセットの作成手法は科学的な議論の対象となりました。一部の研究者は、大規模なクラウドソーシングが不自然または曖昧なフレーズを生み出す可能性があったと指摘しています。また、AfLiteによる自動フィルタリングが、すべての隠れたアーティファクトを完全に排除できるかについても疑問が呈されました<sup>[\[5\]](https://systems-analysis.info/int/WinoGrande_Benchmark_%E2%80%94_WinoGrande%E3%83%99%E3%83%B3%E3%83%81%E3%83%9E%E3%83%BC%E3%82%AF#cite_note-lepore2025-5)</sup>。とはいえ、WinoGrandeは指標の向上だけでなく、AIの評価におけるより堅牢で信頼性の高い手法の創出に関する重要な議論を促進しました。

## 外部リンク

- <a href="https://winogrande.allenai.org/" class="external text" rel="nofollow">WinoGrande公式サイト</a>
- <a href="https://huggingface.co/datasets/allenai/winogrande" class="external text" rel="nofollow">Hugging Face上のデータセット</a>

## 参考文献

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. <a href="https://arxiv.org/abs/2211.09110" class="external text" rel="nofollow">arXiv:2211.09110</a>.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. <a href="https://arxiv.org/abs/2307.03109" class="external text" rel="nofollow">arXiv:2307.03109</a>.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. <a href="https://arxiv.org/abs/2508.15361" class="external text" rel="nofollow">arXiv:2508.15361</a>.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. <a href="https://arxiv.org/abs/2405.14782" class="external text" rel="nofollow">arXiv:2405.14782</a>.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. <a href="https://arxiv.org/abs/2104.14337" class="external text" rel="nofollow">arXiv:2104.14337</a>.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. <a href="https://arxiv.org/abs/2106.06052" class="external text" rel="nofollow">arXiv:2106.06052</a>.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. <a href="https://arxiv.org/abs/2101.04840" class="external text" rel="nofollow">arXiv:2101.04840</a>.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. <a href="https://arxiv.org/abs/2406.04244" class="external text" rel="nofollow">arXiv:2406.04244</a>.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. <a href="https://arxiv.org/abs/2506.11094" class="external text" rel="nofollow">arXiv:2506.11094</a>.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. <a href="https://arxiv.org/abs/2403.04132" class="external text" rel="nofollow">arXiv:2403.04132</a>.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. <a href="https://arxiv.org/abs/2311.17295" class="external text" rel="nofollow">arXiv:2311.17295</a>.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. <a href="https://arxiv.org/abs/2311.05232" class="external text" rel="nofollow">arXiv:2311.05232</a>.

## 脚注

1.  <span id="cite_note-sakaguchi2019-1">↑ <sup>[1.0](https://systems-analysis.info/int/WinoGrande_Benchmark_%E2%80%94_WinoGrande%E3%83%99%E3%83%B3%E3%83%81%E3%83%9E%E3%83%BC%E3%82%AF#cite_ref-sakaguchi2019_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/WinoGrande_Benchmark_%E2%80%94_WinoGrande%E3%83%99%E3%83%B3%E3%83%81%E3%83%9E%E3%83%BC%E3%82%AF#cite_ref-sakaguchi2019_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/WinoGrande_Benchmark_%E2%80%94_WinoGrande%E3%83%99%E3%83%B3%E3%83%81%E3%83%9E%E3%83%BC%E3%82%AF#cite_ref-sakaguchi2019_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/WinoGrande_Benchmark_%E2%80%94_WinoGrande%E3%83%99%E3%83%B3%E3%83%81%E3%83%9E%E3%83%BC%E3%82%AF#cite_ref-sakaguchi2019_1-3)</sup> Sakaguchi, K., Le Bras, R., Bhagavatula, C., Choi, Y. «WinoGrande: An Adversarial Winograd Schema Challenge at Scale». *arXiv:1907.10641*. <a href="https://arxiv.org/abs/1907.10641" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-huggingface-2">[↑](https://systems-analysis.info/int/WinoGrande_Benchmark_%E2%80%94_WinoGrande%E3%83%99%E3%83%B3%E3%83%81%E3%83%9E%E3%83%BC%E3%82%AF#cite_ref-huggingface_2-0) «allenai/winogrande». *Hugging Face*. <a href="https://huggingface.co/datasets/allenai/winogrande" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-wsc_wiki-3">[↑](https://systems-analysis.info/int/WinoGrande_Benchmark_%E2%80%94_WinoGrande%E3%83%99%E3%83%B3%E3%83%81%E3%83%9E%E3%83%BC%E3%82%AF#cite_ref-wsc_wiki_3-0) «Winograd schema challenge». In *Wikipedia*. <a href="https://en.wikipedia.org/wiki/Winograd_schema_challenge" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-kocijan2023-4">[↑](https://systems-analysis.info/int/WinoGrande_Benchmark_%E2%80%94_WinoGrande%E3%83%99%E3%83%B3%E3%83%81%E3%83%9E%E3%83%BC%E3%82%AF#cite_ref-kocijan2023_4-0) Kocijan, V. et al. «The defeat of the Winograd Schema Challenge». *Artificial Intelligence*. <a href="https://www.sciencedirect.com/science/article/pii/S000437022300055X" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-lepore2025-5">↑ <sup>[5.0](https://systems-analysis.info/int/WinoGrande_Benchmark_%E2%80%94_WinoGrande%E3%83%99%E3%83%B3%E3%83%81%E3%83%9E%E3%83%BC%E3%82%AF#cite_ref-lepore2025_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/WinoGrande_Benchmark_%E2%80%94_WinoGrande%E3%83%99%E3%83%B3%E3%83%81%E3%83%9E%E3%83%BC%E3%82%AF#cite_ref-lepore2025_5-1)</sup> Lepore, J. «AI Has Been Surprising for Years». *Carnegie Endowment for International Peace*. <a href="https://carnegieendowment.org/research/2025/01/ai-has-been-surprising-for-years?lang=en" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-brown2020-6">[↑](https://systems-analysis.info/int/WinoGrande_Benchmark_%E2%80%94_WinoGrande%E3%83%99%E3%83%B3%E3%83%81%E3%83%9E%E3%83%BC%E3%82%AF#cite_ref-brown2020_6-0) Brown, T. et al. «Language Models are Few-Shot Learners». *arXiv:2005.14165*. <a href="https://arxiv.org/abs/2005.14165" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-openai2023-7">[↑](https://systems-analysis.info/int/WinoGrande_Benchmark_%E2%80%94_WinoGrande%E3%83%99%E3%83%B3%E3%83%81%E3%83%9E%E3%83%BC%E3%82%AF#cite_ref-openai2023_7-0) OpenAI. «GPT-4 Technical Report». *arXiv:2303.08774*. <a href="https://arxiv.org/abs/2303.08774" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-hyper_ai-8">[↑](https://systems-analysis.info/int/WinoGrande_Benchmark_%E2%80%94_WinoGrande%E3%83%99%E3%83%B3%E3%83%81%E3%83%9E%E3%83%BC%E3%82%AF#cite_ref-hyper_ai_8-0) «Common Sense Reasoning On Winogrande». *HyperAI*. <a href="https://hyper.ai/en/sota/tasks/common-sense-reasoning/benchmark/common-sense-reasoning-on-winogrande" class="external autonumber" rel="nofollow">[8]</a></span>
