---
title: "WinoGrande Benchmark (TH)"
source: "https://systems-analysis.info/int/WinoGrande_Benchmark_(TH)"
wiki: "systems-analysis.info/int"
article: "WinoGrande_Benchmark_(TH)"
language: "th"
categories:
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
  - "Category:Thai"
revision_id: 8490
wiki_created_at: 2026-09-07T01:18:09Z
wiki_modified_at: 2026-09-07T01:18:09Z
downloaded_at: 2026-09-07T23:25:40Z
---

# WinoGrande Benchmark (TH)

**WinoGrande** — คือชุดข้อมูลอ้างอิงขนาดใหญ่ที่ออกแบบมาเพื่อประเมินความสามารถในการใช้เหตุผลเชิงสามัญสำนึกของระบบปัญญาประดิษฐ์ ประกอบด้วยภารกิจประมาณ 44,000 รายการที่อิงตามรูปแบบ Winograd Schema Challenge (WSC) แต่ได้รับการขยายและทำให้ซับซ้อนยิ่งขึ้นอย่างมีนัยสำคัญด้วยวิธีการกรองแบบ adversarial เพื่อกำจัดสัญญาณทางสถิติที่ไม่ต้องการ<sup>[\[1\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(TH)#cite_note-sakaguchi2019-1)</sup>

ชุดข้อมูลนี้ได้รับการพัฒนาในปี 2019 โดยกลุ่มนักวิจัยจาก **Allen Institute for AI** และ **มหาวิทยาลัยวอชิงตัน** แต่ละภารกิจเป็นประโยคที่มีช่องว่างซึ่งต้องเติมด้วยหนึ่งในสองตัวเลือก โดยเลือกคำตอบที่ถูกต้องตามบริบทและความเข้าใจสถานการณ์ WinoGrande กลายเป็นหนึ่งใน benchmark หลักในด้านการประมวลผลภาษาธรรมชาติ (NLP)<sup>[\[2\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(TH)#cite_note-huggingface-2)</sup>

## บริบทของการสร้าง: ความล้าสมัยของ WSC

**Winograd Schema Challenge** (WSC) ดั้งเดิมที่เสนอในปี 2011 มีเพียง 273 ภารกิจและถูกพิจารณาว่าเป็นแบบทดสอบสามัญสำนึกที่เชื่อถือได้มาเป็นเวลานาน ภารกิจในชุดนี้ถูกออกแบบมาเพื่อให้ต้องการความเข้าใจโลก ไม่ใช่แค่การจับคู่คำง่ายๆ<sup>[\[3\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(TH)#cite_note-wsc_wiki-3)</sup>

อย่างไรก็ตาม ในช่วงปี 2018–2019 เมื่อโมเดลภาษาขนาดใหญ่บนสถาปัตยกรรม transformer อย่าง **BERT** ปรากฏขึ้น สถานการณ์ก็เปลี่ยนไป โมเดลเรียนรู้ที่จะ "เจาะ" แบบทดสอบ โดยทำคะแนนความถูกต้องได้ประมาณ 90% ผ่านการใช้ประโยชน์จากรูปแบบทางสถิติที่ไม่ตั้งใจ (artifacts) ในข้อมูล แทนที่จะเป็นความเข้าใจที่แท้จริง<sup>[\[4\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(TH)#cite_note-kocijan2023-4)</sup> WSC จึงหยุดเป็นตัวบ่งชี้ที่เชื่อถือได้ ซึ่งนำไปสู่ความจำเป็นในการสร้าง benchmark ใหม่ที่ซับซ้อนและครอบคลุมกว่า นั่นคือ WinoGrande

## การพัฒนาและวิธี adversarial filtering

การสร้าง WinoGrande ดำเนินการเป็นสองขั้นตอนหลัก: การสร้างภารกิจจำนวนมากและการกรองในภายหลัง

### การระดมพลังจากมวลชน (Crowdsourcing)

ในขั้นตอนแรก ด้วยการใช้แพลตฟอร์ม **Amazon Mechanical Turk** ได้รวบรวมฐานข้อมูลขนาดใหญ่ที่มีประโยคมากกว่า 47,000 ประโยค ผู้ทำงานแบบ crowdsource สร้างคู่ประโยคตามรูปแบบ Winograd ซึ่งให้ความหลากหลายทางภาษาและ "สัญญาณรบกวน" ที่มีลักษณะเฉพาะของภาษาธรรมชาติ แตกต่างจากภารกิจที่เขียนโดยกลุ่มผู้เชี่ยวชาญขนาดเล็ก<sup>[\[1\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(TH)#cite_note-sakaguchi2019-1)</sup>

### อัลกอริทึม AfLite

นวัตกรรมสำคัญของ WinoGrande คืออัลกอริทึม **AfLite** (**Adversarial Filtering Lite**) วิธีการนี้ได้รับการพัฒนาเพื่อกรองภารกิจที่สามารถแก้ได้โดยอาศัยสัญญาณทางสถิติง่ายๆ โดยไม่ต้องใช้สามัญสำนึกออกไปโดยอัตโนมัติ อัลกอริทึมใช้โมเดลที่เรียบง่ายในการระบุและลบตัวอย่างที่คำตอบหนึ่งมีความเชื่อมโยงกับคำอื่นๆ ในประโยคอย่างชัดเจนเกินไป *ตัวอย่างเช่น ภารกิจ "สิงโตกินม้าลายเพราะพวกมันเป็น **สัตว์นักล่า**" จะถูกกรองออก เนื่องจากคำว่า "สัตว์นักล่า" มีความสัมพันธ์ทางสถิติกับ "สิงโต" อย่างใกล้ชิด*

ผลจากการกรอง ข้อมูลที่รวบรวมได้ประมาณ 14% ถูกคัดออก เวอร์ชันสุดท้ายของชุดข้อมูลประกอบด้วย **43,972 ภารกิจ** ซึ่งทำให้เป็นแบบทดสอบที่เชื่อถือได้และท้าทายกว่าอย่างมีนัยสำคัญ<sup>[\[1\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(TH)#cite_note-sakaguchi2019-1)</sup>

## ผลลัพธ์ของโมเดลและความก้าวหน้า

เมื่อเปิดตัว WinoGrande โมเดลที่ดีที่สุดในขณะนั้นแสดงผลลัพธ์ที่ต่ำกว่าระดับมนุษย์อย่างมาก

- **RoBERTa** (เวอร์ชันปรับปรุงของ BERT) ทำความถูกต้องได้ **~79%**
- **มนุษย์** โดยเฉลี่ยแก้ภารกิจได้ด้วยความถูกต้อง **~94%**<sup>[\[1\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(TH)#cite_note-sakaguchi2019-1)</sup>

ช่องว่างนี้ยืนยันว่าการกรองด้วย AfLite ประสบความสำเร็จในการกำจัด "เส้นทางง่าย" หลายอย่างสำหรับโมเดล อย่างไรก็ตาม เมื่อ LLM พัฒนาขึ้น ช่องว่างนี้เริ่มลดลง

- ภายในปี 2022 โมเดล **ST-MoE-32B** ทำความถูกต้องได้ **96.1%** ซึ่งเกินระดับมนุษย์<sup>[\[5\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(TH)#cite_note-lepore2025-5)</sup>
- **GPT-3** แสดงผลลัพธ์ประมาณ **88%**<sup>[\[6\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(TH)#cite_note-brown2020-6)</sup>
- **GPT-4** โดยไม่มีการ fine-tuning พิเศษ แก้ภารกิจได้ด้วยความถูกต้อง **~87.5%**<sup>[\[7\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(TH)#cite_note-openai2023-7)</sup>

## อิทธิพลและการวิพากษ์วิจารณ์

WinoGrande กลายเป็นหนึ่งใน benchmark หลักสำหรับการประเมินสามัญสำนึกและถูกใช้ทดสอบโมเดลใหม่เป็นประจำ ผลลัพธ์ของมันได้รับการตีพิมพ์ในรายงานทางเทคนิคของบริษัท AI ชั้นนำและบนแพลตฟอร์มสำหรับการเปรียบเทียบโมเดล<sup>[\[8\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(TH)#cite_note-hyper_ai-8)</sup>

ในขณะเดียวกัน วิธีการสร้างชุดข้อมูลกลายเป็นหัวข้อของการอภิปรายทางวิทยาศาสตร์ นักวิจัยบางคนตั้งข้อสังเกตว่าการระดมพลังจากมวลชนอาจนำไปสู่การปรากฏของวลีที่ไม่เป็นธรรมชาติหรือกำกวม นอกจากนี้ยังมีความสงสัยว่าการกรองอัตโนมัติด้วย AfLite สามารถกำจัด artifacts ที่ซ่อนอยู่ทั้งหมดได้หรือไม่<sup>[\[5\]](https://systems-analysis.info/int/WinoGrande_Benchmark_(TH)#cite_note-lepore2025-5)</sup> อย่างไรก็ตาม WinoGrande ไม่เพียงกระตุ้นความก้าวหน้าในด้านตัวชี้วัด แต่ยังจุดประกายการอภิปรายที่สำคัญเกี่ยวกับการสร้างวิธีการประเมิน AI ที่มีความทนทานและเชื่อถือได้มากขึ้น

## ลิงก์ภายนอก

- เว็บไซต์อย่างเป็นทางการของ WinoGrande
- Dataset บนแพลตฟอร์ม Hugging Face

## วรรณกรรม

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## หมายเหตุ

1.  <span id="cite_note-sakaguchi2019-1">↑ <sup>[1.0](https://systems-analysis.info/int/WinoGrande_Benchmark_(TH)#cite_ref-sakaguchi2019_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/WinoGrande_Benchmark_(TH)#cite_ref-sakaguchi2019_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/WinoGrande_Benchmark_(TH)#cite_ref-sakaguchi2019_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/WinoGrande_Benchmark_(TH)#cite_ref-sakaguchi2019_1-3)</sup> Sakaguchi, K., Le Bras, R., Bhagavatula, C., Choi, Y. «WinoGrande: An Adversarial Winograd Schema Challenge at Scale». *arXiv:1907.10641*. <a href="https://arxiv.org/abs/1907.10641" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-huggingface-2">[↑](https://systems-analysis.info/int/WinoGrande_Benchmark_(TH)#cite_ref-huggingface_2-0) «allenai/winogrande». *Hugging Face*. <a href="https://huggingface.co/datasets/allenai/winogrande" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-wsc_wiki-3">[↑](https://systems-analysis.info/int/WinoGrande_Benchmark_(TH)#cite_ref-wsc_wiki_3-0) «Winograd schema challenge». In *Wikipedia*. <a href="https://en.wikipedia.org/wiki/Winograd_schema_challenge" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-kocijan2023-4">[↑](https://systems-analysis.info/int/WinoGrande_Benchmark_(TH)#cite_ref-kocijan2023_4-0) Kocijan, V. et al. «The defeat of the Winograd Schema Challenge». *Artificial Intelligence*. <a href="https://www.sciencedirect.com/science/article/pii/S000437022300055X" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-lepore2025-5">↑ <sup>[5.0](https://systems-analysis.info/int/WinoGrande_Benchmark_(TH)#cite_ref-lepore2025_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/WinoGrande_Benchmark_(TH)#cite_ref-lepore2025_5-1)</sup> Lepore, J. «AI Has Been Surprising for Years». *Carnegie Endowment for International Peace*. <a href="https://carnegieendowment.org/research/2025/01/ai-has-been-surprising-for-years?lang=en" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-brown2020-6">[↑](https://systems-analysis.info/int/WinoGrande_Benchmark_(TH)#cite_ref-brown2020_6-0) Brown, T. et al. «Language Models are Few-Shot Learners». *arXiv:2005.14165*. <a href="https://arxiv.org/abs/2005.14165" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-openai2023-7">[↑](https://systems-analysis.info/int/WinoGrande_Benchmark_(TH)#cite_ref-openai2023_7-0) OpenAI. «GPT-4 Technical Report». *arXiv:2303.08774*. <a href="https://arxiv.org/abs/2303.08774" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-hyper_ai-8">[↑](https://systems-analysis.info/int/WinoGrande_Benchmark_(TH)#cite_ref-hyper_ai_8-0) «Common Sense Reasoning On Winogrande». *HyperAI*. <a href="https://hyper.ai/en/sota/tasks/common-sense-reasoning/benchmark/common-sense-reasoning-on-winogrande" class="external autonumber" rel="nofollow">[8]</a></span>
