WinoGrande Benchmark (TH)
WinoGrande — คือชุดข้อมูลอ้างอิงขนาดใหญ่ที่ออกแบบมาเพื่อประเมินความสามารถในการใช้เหตุผลเชิงสามัญสำนึกของระบบปัญญาประดิษฐ์ ประกอบด้วยภารกิจประมาณ 44,000 รายการที่อิงตามรูปแบบ Winograd Schema Challenge (WSC) แต่ได้รับการขยายและทำให้ซับซ้อนยิ่งขึ้นอย่างมีนัยสำคัญด้วยวิธีการกรองแบบ adversarial เพื่อกำจัดสัญญาณทางสถิติที่ไม่ต้องการ[1]
ชุดข้อมูลนี้ได้รับการพัฒนาในปี 2019 โดยกลุ่มนักวิจัยจาก Allen Institute for AI และ มหาวิทยาลัยวอชิงตัน แต่ละภารกิจเป็นประโยคที่มีช่องว่างซึ่งต้องเติมด้วยหนึ่งในสองตัวเลือก โดยเลือกคำตอบที่ถูกต้องตามบริบทและความเข้าใจสถานการณ์ WinoGrande กลายเป็นหนึ่งใน benchmark หลักในด้านการประมวลผลภาษาธรรมชาติ (NLP)[2]
บริบทของการสร้าง: ความล้าสมัยของ WSC
Winograd Schema Challenge (WSC) ดั้งเดิมที่เสนอในปี 2011 มีเพียง 273 ภารกิจและถูกพิจารณาว่าเป็นแบบทดสอบสามัญสำนึกที่เชื่อถือได้มาเป็นเวลานาน ภารกิจในชุดนี้ถูกออกแบบมาเพื่อให้ต้องการความเข้าใจโลก ไม่ใช่แค่การจับคู่คำง่ายๆ[3]
อย่างไรก็ตาม ในช่วงปี 2018–2019 เมื่อโมเดลภาษาขนาดใหญ่บนสถาปัตยกรรม transformer อย่าง BERT ปรากฏขึ้น สถานการณ์ก็เปลี่ยนไป โมเดลเรียนรู้ที่จะ "เจาะ" แบบทดสอบ โดยทำคะแนนความถูกต้องได้ประมาณ 90% ผ่านการใช้ประโยชน์จากรูปแบบทางสถิติที่ไม่ตั้งใจ (artifacts) ในข้อมูล แทนที่จะเป็นความเข้าใจที่แท้จริง[4] WSC จึงหยุดเป็นตัวบ่งชี้ที่เชื่อถือได้ ซึ่งนำไปสู่ความจำเป็นในการสร้าง benchmark ใหม่ที่ซับซ้อนและครอบคลุมกว่า นั่นคือ WinoGrande
การพัฒนาและวิธี adversarial filtering
การสร้าง WinoGrande ดำเนินการเป็นสองขั้นตอนหลัก: การสร้างภารกิจจำนวนมากและการกรองในภายหลัง
การระดมพลังจากมวลชน (Crowdsourcing)
ในขั้นตอนแรก ด้วยการใช้แพลตฟอร์ม Amazon Mechanical Turk ได้รวบรวมฐานข้อมูลขนาดใหญ่ที่มีประโยคมากกว่า 47,000 ประโยค ผู้ทำงานแบบ crowdsource สร้างคู่ประโยคตามรูปแบบ Winograd ซึ่งให้ความหลากหลายทางภาษาและ "สัญญาณรบกวน" ที่มีลักษณะเฉพาะของภาษาธรรมชาติ แตกต่างจากภารกิจที่เขียนโดยกลุ่มผู้เชี่ยวชาญขนาดเล็ก[1]
อัลกอริทึม AfLite
นวัตกรรมสำคัญของ WinoGrande คืออัลกอริทึม AfLite (Adversarial Filtering Lite) วิธีการนี้ได้รับการพัฒนาเพื่อกรองภารกิจที่สามารถแก้ได้โดยอาศัยสัญญาณทางสถิติง่ายๆ โดยไม่ต้องใช้สามัญสำนึกออกไปโดยอัตโนมัติ อัลกอริทึมใช้โมเดลที่เรียบง่ายในการระบุและลบตัวอย่างที่คำตอบหนึ่งมีความเชื่อมโยงกับคำอื่นๆ ในประโยคอย่างชัดเจนเกินไป ตัวอย่างเช่น ภารกิจ "สิงโตกินม้าลายเพราะพวกมันเป็น สัตว์นักล่า" จะถูกกรองออก เนื่องจากคำว่า "สัตว์นักล่า" มีความสัมพันธ์ทางสถิติกับ "สิงโต" อย่างใกล้ชิด
ผลจากการกรอง ข้อมูลที่รวบรวมได้ประมาณ 14% ถูกคัดออก เวอร์ชันสุดท้ายของชุดข้อมูลประกอบด้วย 43,972 ภารกิจ ซึ่งทำให้เป็นแบบทดสอบที่เชื่อถือได้และท้าทายกว่าอย่างมีนัยสำคัญ[1]
ผลลัพธ์ของโมเดลและความก้าวหน้า
เมื่อเปิดตัว WinoGrande โมเดลที่ดีที่สุดในขณะนั้นแสดงผลลัพธ์ที่ต่ำกว่าระดับมนุษย์อย่างมาก
- RoBERTa (เวอร์ชันปรับปรุงของ BERT) ทำความถูกต้องได้ ~79%
- มนุษย์ โดยเฉลี่ยแก้ภารกิจได้ด้วยความถูกต้อง ~94%[1]
ช่องว่างนี้ยืนยันว่าการกรองด้วย AfLite ประสบความสำเร็จในการกำจัด "เส้นทางง่าย" หลายอย่างสำหรับโมเดล อย่างไรก็ตาม เมื่อ LLM พัฒนาขึ้น ช่องว่างนี้เริ่มลดลง
- ภายในปี 2022 โมเดล ST-MoE-32B ทำความถูกต้องได้ 96.1% ซึ่งเกินระดับมนุษย์[5]
- GPT-3 แสดงผลลัพธ์ประมาณ 88%[6]
- GPT-4 โดยไม่มีการ fine-tuning พิเศษ แก้ภารกิจได้ด้วยความถูกต้อง ~87.5%[7]
อิทธิพลและการวิพากษ์วิจารณ์
WinoGrande กลายเป็นหนึ่งใน benchmark หลักสำหรับการประเมินสามัญสำนึกและถูกใช้ทดสอบโมเดลใหม่เป็นประจำ ผลลัพธ์ของมันได้รับการตีพิมพ์ในรายงานทางเทคนิคของบริษัท AI ชั้นนำและบนแพลตฟอร์มสำหรับการเปรียบเทียบโมเดล[8]
ในขณะเดียวกัน วิธีการสร้างชุดข้อมูลกลายเป็นหัวข้อของการอภิปรายทางวิทยาศาสตร์ นักวิจัยบางคนตั้งข้อสังเกตว่าการระดมพลังจากมวลชนอาจนำไปสู่การปรากฏของวลีที่ไม่เป็นธรรมชาติหรือกำกวม นอกจากนี้ยังมีความสงสัยว่าการกรองอัตโนมัติด้วย AfLite สามารถกำจัด artifacts ที่ซ่อนอยู่ทั้งหมดได้หรือไม่[5] อย่างไรก็ตาม WinoGrande ไม่เพียงกระตุ้นความก้าวหน้าในด้านตัวชี้วัด แต่ยังจุดประกายการอภิปรายที่สำคัญเกี่ยวกับการสร้างวิธีการประเมิน AI ที่มีความทนทานและเชื่อถือได้มากขึ้น
ลิงก์ภายนอก
- เว็บไซต์อย่างเป็นทางการของ WinoGrande
- Dataset บนแพลตฟอร์ม Hugging Face
วรรณกรรม
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
หมายเหตุ
- ↑ 1.0 1.1 1.2 1.3 Sakaguchi, K., Le Bras, R., Bhagavatula, C., Choi, Y. «WinoGrande: An Adversarial Winograd Schema Challenge at Scale». arXiv:1907.10641. [1]
- ↑ «allenai/winogrande». Hugging Face. [2]
- ↑ «Winograd schema challenge». In Wikipedia. [3]
- ↑ Kocijan, V. et al. «The defeat of the Winograd Schema Challenge». Artificial Intelligence. [4]
- ↑ 5.0 5.1 Lepore, J. «AI Has Been Surprising for Years». Carnegie Endowment for International Peace. [5]
- ↑ Brown, T. et al. «Language Models are Few-Shot Learners». arXiv:2005.14165. [6]
- ↑ OpenAI. «GPT-4 Technical Report». arXiv:2303.08774. [7]
- ↑ «Common Sense Reasoning On Winogrande». HyperAI. [8]