---
title: "WinoGrande Benchmark (KO)"
source: "https://systems-analysis.info/int/WinoGrande_Benchmark_(KO)"
wiki: "systems-analysis.info/int"
article: "WinoGrande_Benchmark_(KO)"
language: "ko"
categories:
  - "Category:Korean"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 8484
wiki_created_at: 2026-09-07T01:18:04Z
wiki_modified_at: 2026-09-07T01:18:04Z
downloaded_at: 2026-09-07T23:25:38Z
---

# WinoGrande Benchmark (KO)

**WinoGrande** — 인공지능 시스템의 상식 추론 능력을 평가하기 위해 설계된 대규모 벤치마크 데이터셋입니다. 이 데이터셋은 Winograd Schema Challenge(WSC) 형식을 기반으로 약 44,000개의 문제를 포함하고 있으며, 통계적 단서를 제거하기 위한 '적대적(adversarial)' 필터링 방법을 통해 크게 확장되고 난이도가 높아졌습니다<sup>[\[1\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(KO)#cite_note-sakaguchi2019-1)</sup>.

이 데이터셋은 2019년 **Allen Institute for AI**와 **워싱턴 대학교**의 연구팀에 의해 개발되었습니다. 각 문제는 문맥과 상황 이해를 바탕으로 두 가지 선택지 중 하나를 골라 빈칸을 채우는 형태로 구성되어 있습니다. WinoGrande는 자연어 처리(NLP) 분야의 핵심 benchmark 중 하나로 자리잡았습니다<sup>[\[2\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(KO)#cite_note-huggingface-2)</sup>.

## 개발 배경: WSC의 한계

2011년에 제안된 원본 **Winograd Schema Challenge**(WSC)는 273개의 문제만을 포함하고 있었으며, 오랫동안 상식 추론의 신뢰할 수 있는 테스트로 여겨졌습니다. 이 문제들은 단순한 단어 매칭이 아닌 세계에 대한 이해를 요구하도록 설계되었습니다<sup>[\[3\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(KO)#cite_note-wsc_wiki-3)</sup>.

그러나 2018~2019년경, **BERT**와 같은 Transformer 아키텍처 기반의 대형 언어 모델이 등장하면서 상황이 달라졌습니다. 모델들은 실제 이해가 아닌 데이터 내의 의도치 않은 통계적 패턴(아티팩트)을 활용하는 방식으로 테스트를 '해킹'하여 약 90%의 정확도를 달성하는 법을 익혔습니다<sup>[\[4\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(KO)#cite_note-kocijan2023-4)</sup>. WSC는 더 이상 신뢰할 수 있는 지표가 되지 못했고, 이로 인해 더 복잡하고 대규모의 새로운 benchmark인 WinoGrande의 개발이 필요하게 되었습니다.

## 개발 과정 및 adversarial filtering 방법

WinoGrande의 제작은 크게 두 단계로 이루어졌습니다: 대규모 문제 생성과 그 후의 필터링.

### 크라우드소싱

첫 번째 단계에서는 **Amazon Mechanical Turk** 플랫폼을 활용하여 47,000개 이상의 문장으로 구성된 대규모 데이터베이스를 수집했습니다. 크라우드 작업자들이 Winograd 방식에 따라 문장 쌍을 생성함으로써, 소수의 전문가가 작성한 문제와 달리 자연어에서 나타나는 언어적 다양성과 '노이즈'가 확보되었습니다<sup>[\[1\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(KO)#cite_note-sakaguchi2019-1)</sup>.

### AfLite 알고리즘

WinoGrande의 핵심 혁신은 **AfLite**(**Adversarial Filtering Lite**) 알고리즘입니다. 이 방법은 상식 없이도 단순한 통계적 단서만으로 풀 수 있는 문제를 자동으로 걸러내기 위해 개발되었습니다. 알고리즘은 간단한 모델을 사용하여 정답 선택지 중 하나가 문장 내 다른 단어들과 지나치게 명확하게 연관된 예시를 찾아내고 제거했습니다. *예를 들어, "사자들이 얼룩말을 먹었다. 왜냐하면 그들은 **육식동물**이기 때문이다"와 같은 문제는 '육식동물'이라는 단어가 통계적으로 '사자'와 강하게 연관되어 있으므로 필터링 대상이 됩니다.*

필터링 결과 수집된 데이터의 약 14%가 제거되었습니다. 최종 데이터셋은 **43,972개의 문제**를 포함하며, 이를 통해 훨씬 더 신뢰할 수 있고 난이도 높은 테스트가 완성되었습니다<sup>[\[1\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(KO)#cite_note-sakaguchi2019-1)</sup>.

## 모델 성능 및 발전 현황

WinoGrande가 출시되었을 당시, 당시 최고 성능의 모델들은 인간 수준에 크게 못 미치는 결과를 보였습니다.

- **RoBERTa**(BERT의 개선 버전)는 **~79%**의 정확도를 달성했습니다.
- **인간**은 평균적으로 **~94%**의 정확도로 문제를 풀었습니다<sup>[\[1\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(KO)#cite_note-sakaguchi2019-1)</sup>.

이 격차는 AfLite 필터링이 모델에게 유리한 많은 '쉬운' 경로를 성공적으로 제거했음을 입증했습니다. 그러나 LLM의 발전에 따라 이 격차는 좁혀지기 시작했습니다.

- 2022년에 이르러 **ST-MoE-32B** 모델은 **96.1%**의 정확도를 달성하며 인간 수준을 넘어섰습니다<sup>[\[5\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(KO)#cite_note-lepore2025-5)</sup>.
- **GPT-3**는 약 **88%**의 결과를 기록했습니다<sup>[\[6\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(KO)#cite_note-brown2020-6)</sup>.
- **GPT-4**는 별도의 fine-tuning 없이 **~87.5%**의 정확도로 문제를 풉니다<sup>[\[7\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(KO)#cite_note-openai2023-7)</sup>.

## 영향 및 비판

WinoGrande는 상식 추론 평가를 위한 핵심 benchmark 중 하나가 되었으며, 새로운 모델 테스트에 정기적으로 활용됩니다. 이 benchmark의 결과는 주요 AI 기업의 기술 보고서와 모델 비교 플랫폼에서 공개됩니다<sup>[\[8\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(KO)#cite_note-hyper_ai-8)</sup>.

한편, 데이터셋 제작 방법론은 학술적 논의의 대상이 되기도 했습니다. 일부 연구자들은 대규모 크라우드소싱이 부자연스럽거나 모호한 표현을 초래할 수 있다고 지적합니다. 또한 AfLite 자동 필터링이 숨겨진 아티팩트를 완전히 제거할 수 있는지에 대한 의문도 제기되었습니다<sup>[\[5\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(KO)#cite_note-lepore2025-5)</sup>. 그럼에도 불구하고, WinoGrande는 성능 지표의 발전뿐만 아니라 더 견고하고 신뢰할 수 있는 AI 평가 방법 개발에 관한 중요한 논의를 촉진시켰습니다.

## 외부 링크

- WinoGrande 공식 웹사이트
- Hugging Face 플랫폼의 데이터셋

## 참고 문헌

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## 각주

1.  <span id="cite_note-sakaguchi2019-1">↑ <sup>[1.0](https://systems-analysis.info/int/WinoGrande_Benchmark_(KO)#cite_ref-sakaguchi2019_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/WinoGrande_Benchmark_(KO)#cite_ref-sakaguchi2019_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/WinoGrande_Benchmark_(KO)#cite_ref-sakaguchi2019_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/WinoGrande_Benchmark_(KO)#cite_ref-sakaguchi2019_1-3)</sup> Sakaguchi, K., Le Bras, R., Bhagavatula, C., Choi, Y. «WinoGrande: An Adversarial Winograd Schema Challenge at Scale». *arXiv:1907.10641*. <a href="https://arxiv.org/abs/1907.10641" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-huggingface-2">[↑](https://systems-analysis.info/int/WinoGrande_Benchmark_(KO)#cite_ref-huggingface_2-0) «allenai/winogrande». *Hugging Face*. <a href="https://huggingface.co/datasets/allenai/winogrande" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-wsc_wiki-3">[↑](https://systems-analysis.info/int/WinoGrande_Benchmark_(KO)#cite_ref-wsc_wiki_3-0) «Winograd schema challenge». In *Wikipedia*. <a href="https://en.wikipedia.org/wiki/Winograd_schema_challenge" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-kocijan2023-4">[↑](https://systems-analysis.info/int/WinoGrande_Benchmark_(KO)#cite_ref-kocijan2023_4-0) Kocijan, V. et al. «The defeat of the Winograd Schema Challenge». *Artificial Intelligence*. <a href="https://www.sciencedirect.com/science/article/pii/S000437022300055X" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-lepore2025-5">↑ <sup>[5.0](https://systems-analysis.info/int/WinoGrande_Benchmark_(KO)#cite_ref-lepore2025_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/WinoGrande_Benchmark_(KO)#cite_ref-lepore2025_5-1)</sup> Lepore, J. «AI Has Been Surprising for Years». *Carnegie Endowment for International Peace*. <a href="https://carnegieendowment.org/research/2025/01/ai-has-been-surprising-for-years?lang=en" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-brown2020-6">[↑](https://systems-analysis.info/int/WinoGrande_Benchmark_(KO)#cite_ref-brown2020_6-0) Brown, T. et al. «Language Models are Few-Shot Learners». *arXiv:2005.14165*. <a href="https://arxiv.org/abs/2005.14165" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-openai2023-7">[↑](https://systems-analysis.info/int/WinoGrande_Benchmark_(KO)#cite_ref-openai2023_7-0) OpenAI. «GPT-4 Technical Report». *arXiv:2303.08774*. <a href="https://arxiv.org/abs/2303.08774" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-hyper_ai-8">[↑](https://systems-analysis.info/int/WinoGrande_Benchmark_(KO)#cite_ref-hyper_ai_8-0) «Common Sense Reasoning On Winogrande». *HyperAI*. <a href="https://hyper.ai/en/sota/tasks/common-sense-reasoning/benchmark/common-sense-reasoning-on-winogrande" class="external autonumber" rel="nofollow">[8]</a></span>
