---
title: "WinoGrande Benchmark (VI)"
source: "https://systems-analysis.info/int/WinoGrande_Benchmark_(VI)"
wiki: "systems-analysis.info/int"
article: "WinoGrande_Benchmark_(VI)"
language: "vi"
categories:
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
  - "Category:Vietnamese"
revision_id: 8494
wiki_created_at: 2026-09-07T01:18:13Z
wiki_modified_at: 2026-09-07T01:18:13Z
downloaded_at: 2026-09-07T23:25:41Z
---

# WinoGrande Benchmark (VI)

**WinoGrande** — là một bộ dữ liệu chuẩn quy mô lớn được thiết kế để đánh giá khả năng suy luận dựa trên nhận thức thông thường của các hệ thống trí tuệ nhân tạo. Bộ dữ liệu chứa khoảng 44 000 bài tập theo định dạng Winograd Schema Challenge (WSC), nhưng được mở rộng và nâng cao độ khó đáng kể thông qua phương pháp lọc "adversarial" nhằm loại bỏ các gợi ý thống kê<sup>[\[1\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(VI)#cite_note-sakaguchi2019-1)</sup>.

Dataset được phát triển vào năm 2019 bởi một nhóm các nhà nghiên cứu từ **Allen Institute for AI** và **Đại học Washington**. Mỗi bài tập là một câu có chỗ trống cần điền bằng một trong hai lựa chọn, được chọn dựa trên ngữ cảnh và sự hiểu biết về tình huống. WinoGrande đã trở thành một trong những benchmark quan trọng trong lĩnh vực xử lý ngôn ngữ tự nhiên (NLP)<sup>[\[2\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(VI)#cite_note-huggingface-2)</sup>.

## Tiền đề ra đời: sự lỗi thời của WSC

Bộ **Winograd Schema Challenge** (WSC) gốc, được đề xuất vào năm 2011, chỉ chứa 273 bài tập và trong một thời gian dài được coi là bài kiểm tra đáng tin cậy về nhận thức thông thường. Các bài tập trong đó được thiết kế sao cho đòi hỏi sự hiểu biết về thế giới, chứ không chỉ đơn thuần là so khớp từ ngữ<sup>[\[3\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(VI)#cite_note-wsc_wiki-3)</sup>.

Tuy nhiên, vào khoảng năm 2018–2019, với sự xuất hiện của các mô hình ngôn ngữ lớn theo kiến trúc Transformer như **BERT**, tình hình đã thay đổi. Các mô hình học cách "bẻ khóa" bài kiểm tra, đạt độ chính xác khoảng 90% nhờ khai thác các quy luật thống kê không có chủ đích (các artifact) trong dữ liệu, chứ không phải nhờ sự hiểu biết thực sự<sup>[\[4\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(VI)#cite_note-kocijan2023-4)</sup>. WSC không còn là chỉ số đáng tin cậy nữa, điều này dẫn đến sự cần thiết phải tạo ra một benchmark mới, phức tạp hơn và quy mô lớn hơn — WinoGrande.

## Quá trình phát triển và phương pháp adversarial filtering

Việc tạo ra WinoGrande trải qua hai giai đoạn chính: tạo bài tập hàng loạt và lọc dữ liệu sau đó.

### Crowdsourcing

Ở giai đoạn đầu, thông qua nền tảng **Amazon Mechanical Turk**, một cơ sở dữ liệu lớn gồm hơn 47 000 câu đã được thu thập. Những người tham gia crowdsourcing tạo ra các cặp câu theo sơ đồ Winograd, điều này đảm bảo sự đa dạng về ngôn ngữ và "nhiễu" đặc trưng của ngôn ngữ tự nhiên, khác với các bài tập được viết bởi một nhóm nhỏ chuyên gia<sup>[\[1\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(VI)#cite_note-sakaguchi2019-1)</sup>.

### Thuật toán AfLite

Đổi mới chủ chốt của WinoGrande là thuật toán **AfLite** (**Adversarial Filtering Lite**). Phương pháp này được phát triển để tự động loại bỏ các bài tập có thể được giải quyết bằng các gợi ý thống kê đơn giản mà không cần nhận thức thông thường. Thuật toán sử dụng các mô hình đơn giản để xác định và loại bỏ những ví dụ mà trong đó một trong các đáp án liên kết quá rõ ràng với các từ khác trong câu. *Ví dụ, bài tập "Sư tử đã ăn ngựa vằn vì chúng là **động vật ăn thịt**" sẽ bị lọc bỏ, vì từ "động vật ăn thịt" có liên hệ thống kê chặt chẽ với "sư tử".*

Sau quá trình lọc, khoảng 14% dữ liệu thu thập được đã bị loại bỏ. Phiên bản cuối cùng của dataset bao gồm **43 972 bài tập**, khiến nó trở thành một bài kiểm tra đáng tin cậy và khó khăn hơn đáng kể<sup>[\[1\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(VI)#cite_note-sakaguchi2019-1)</sup>.

## Kết quả của các mô hình và tiến trình phát triển

Khi WinoGrande được phát hành, các mô hình tốt nhất vào thời điểm đó cho thấy kết quả thấp hơn đáng kể so với con người.

- **RoBERTa** (phiên bản cải tiến của BERT) đạt độ chính xác **~79%**.
- **Con người** trung bình giải các bài tập với độ chính xác **~94%**<sup>[\[1\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(VI)#cite_note-sakaguchi2019-1)</sup>.

Khoảng cách này xác nhận rằng lọc AfLite đã loại bỏ thành công nhiều "con đường dễ dàng" cho các mô hình. Tuy nhiên, với sự phát triển của LLM, khoảng cách này bắt đầu thu hẹp lại.

- Đến năm 2022, mô hình **ST-MoE-32B** đạt độ chính xác **96,1%**, vượt qua mức độ của con người<sup>[\[5\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(VI)#cite_note-lepore2025-5)</sup>.
- **GPT-3** cho kết quả khoảng **88%**<sup>[\[6\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(VI)#cite_note-brown2020-6)</sup>.
- **GPT-4**, không có fine-tuning chuyên biệt, giải các bài tập với độ chính xác **~87,5%**<sup>[\[7\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(VI)#cite_note-openai2023-7)</sup>.

## Tác động và những chỉ trích

WinoGrande đã trở thành một trong những benchmark quan trọng để đánh giá nhận thức thông thường và thường xuyên được sử dụng để kiểm tra các mô hình mới. Kết quả của nó được công bố trong các báo cáo kỹ thuật của các công ty AI hàng đầu và trên các nền tảng so sánh mô hình<sup>[\[8\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(VI)#cite_note-hyper_ai-8)</sup>.

Đồng thời, phương pháp tạo dataset đã trở thành chủ đề của các cuộc tranh luận khoa học. Một số nhà nghiên cứu chỉ ra rằng crowdsourcing quy mô lớn có thể dẫn đến xuất hiện các cụm từ không tự nhiên hoặc mơ hồ. Cũng có những nghi ngờ về việc liệu lọc tự động AfLite có khả năng loại bỏ hoàn toàn tất cả các artifact ẩn hay không<sup>[\[5\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(VI)#cite_note-lepore2025-5)</sup>. Tuy nhiên, WinoGrande không chỉ thúc đẩy tiến bộ về các chỉ số, mà còn khơi dậy một cuộc thảo luận quan trọng về việc tạo ra các phương pháp đánh giá AI bền vững và đáng tin cậy hơn.

## Liên kết

- Trang web chính thức của WinoGrande
- Dataset trên nền tảng Hugging Face

## Tài liệu tham khảo

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## Chú thích

1.  <span id="cite_note-sakaguchi2019-1">↑ <sup>[1.0](https://systems-analysis.info/int/WinoGrande_Benchmark_(VI)#cite_ref-sakaguchi2019_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/WinoGrande_Benchmark_(VI)#cite_ref-sakaguchi2019_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/WinoGrande_Benchmark_(VI)#cite_ref-sakaguchi2019_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/WinoGrande_Benchmark_(VI)#cite_ref-sakaguchi2019_1-3)</sup> Sakaguchi, K., Le Bras, R., Bhagavatula, C., Choi, Y. «WinoGrande: An Adversarial Winograd Schema Challenge at Scale». *arXiv:1907.10641*. <a href="https://arxiv.org/abs/1907.10641" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-huggingface-2">[↑](https://systems-analysis.info/int/WinoGrande_Benchmark_(VI)#cite_ref-huggingface_2-0) «allenai/winogrande». *Hugging Face*. <a href="https://huggingface.co/datasets/allenai/winogrande" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-wsc_wiki-3">[↑](https://systems-analysis.info/int/WinoGrande_Benchmark_(VI)#cite_ref-wsc_wiki_3-0) «Winograd schema challenge». In *Wikipedia*. <a href="https://en.wikipedia.org/wiki/Winograd_schema_challenge" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-kocijan2023-4">[↑](https://systems-analysis.info/int/WinoGrande_Benchmark_(VI)#cite_ref-kocijan2023_4-0) Kocijan, V. et al. «The defeat of the Winograd Schema Challenge». *Artificial Intelligence*. <a href="https://www.sciencedirect.com/science/article/pii/S000437022300055X" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-lepore2025-5">↑ <sup>[5.0](https://systems-analysis.info/int/WinoGrande_Benchmark_(VI)#cite_ref-lepore2025_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/WinoGrande_Benchmark_(VI)#cite_ref-lepore2025_5-1)</sup> Lepore, J. «AI Has Been Surprising for Years». *Carnegie Endowment for International Peace*. <a href="https://carnegieendowment.org/research/2025/01/ai-has-been-surprising-for-years?lang=en" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-brown2020-6">[↑](https://systems-analysis.info/int/WinoGrande_Benchmark_(VI)#cite_ref-brown2020_6-0) Brown, T. et al. «Language Models are Few-Shot Learners». *arXiv:2005.14165*. <a href="https://arxiv.org/abs/2005.14165" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-openai2023-7">[↑](https://systems-analysis.info/int/WinoGrande_Benchmark_(VI)#cite_ref-openai2023_7-0) OpenAI. «GPT-4 Technical Report». *arXiv:2303.08774*. <a href="https://arxiv.org/abs/2303.08774" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-hyper_ai-8">[↑](https://systems-analysis.info/int/WinoGrande_Benchmark_(VI)#cite_ref-hyper_ai_8-0) «Common Sense Reasoning On Winogrande». *HyperAI*. <a href="https://hyper.ai/en/sota/tasks/common-sense-reasoning/benchmark/common-sense-reasoning-on-winogrande" class="external autonumber" rel="nofollow">[8]</a></span>
