WinoGrande Benchmark (TH)

From Systems analysis Wiki
Jump to navigation Jump to search

WinoGrande — คือชุดข้อมูลอ้างอิงขนาดใหญ่ที่ออกแบบมาเพื่อประเมินความสามารถในการใช้เหตุผลเชิงสามัญสำนึกของระบบปัญญาประดิษฐ์ ประกอบด้วยภารกิจประมาณ 44,000 รายการที่อิงตามรูปแบบ Winograd Schema Challenge (WSC) แต่ได้รับการขยายและทำให้ซับซ้อนยิ่งขึ้นอย่างมีนัยสำคัญด้วยวิธีการกรองแบบ adversarial เพื่อกำจัดสัญญาณทางสถิติที่ไม่ต้องการ[1]

ชุดข้อมูลนี้ได้รับการพัฒนาในปี 2019 โดยกลุ่มนักวิจัยจาก Allen Institute for AI และ มหาวิทยาลัยวอชิงตัน แต่ละภารกิจเป็นประโยคที่มีช่องว่างซึ่งต้องเติมด้วยหนึ่งในสองตัวเลือก โดยเลือกคำตอบที่ถูกต้องตามบริบทและความเข้าใจสถานการณ์ WinoGrande กลายเป็นหนึ่งใน benchmark หลักในด้านการประมวลผลภาษาธรรมชาติ (NLP)[2]

บริบทของการสร้าง: ความล้าสมัยของ WSC

Winograd Schema Challenge (WSC) ดั้งเดิมที่เสนอในปี 2011 มีเพียง 273 ภารกิจและถูกพิจารณาว่าเป็นแบบทดสอบสามัญสำนึกที่เชื่อถือได้มาเป็นเวลานาน ภารกิจในชุดนี้ถูกออกแบบมาเพื่อให้ต้องการความเข้าใจโลก ไม่ใช่แค่การจับคู่คำง่ายๆ[3]

อย่างไรก็ตาม ในช่วงปี 2018–2019 เมื่อโมเดลภาษาขนาดใหญ่บนสถาปัตยกรรม transformer อย่าง BERT ปรากฏขึ้น สถานการณ์ก็เปลี่ยนไป โมเดลเรียนรู้ที่จะ "เจาะ" แบบทดสอบ โดยทำคะแนนความถูกต้องได้ประมาณ 90% ผ่านการใช้ประโยชน์จากรูปแบบทางสถิติที่ไม่ตั้งใจ (artifacts) ในข้อมูล แทนที่จะเป็นความเข้าใจที่แท้จริง[4] WSC จึงหยุดเป็นตัวบ่งชี้ที่เชื่อถือได้ ซึ่งนำไปสู่ความจำเป็นในการสร้าง benchmark ใหม่ที่ซับซ้อนและครอบคลุมกว่า นั่นคือ WinoGrande

การพัฒนาและวิธี adversarial filtering

การสร้าง WinoGrande ดำเนินการเป็นสองขั้นตอนหลัก: การสร้างภารกิจจำนวนมากและการกรองในภายหลัง

การระดมพลังจากมวลชน (Crowdsourcing)

ในขั้นตอนแรก ด้วยการใช้แพลตฟอร์ม Amazon Mechanical Turk ได้รวบรวมฐานข้อมูลขนาดใหญ่ที่มีประโยคมากกว่า 47,000 ประโยค ผู้ทำงานแบบ crowdsource สร้างคู่ประโยคตามรูปแบบ Winograd ซึ่งให้ความหลากหลายทางภาษาและ "สัญญาณรบกวน" ที่มีลักษณะเฉพาะของภาษาธรรมชาติ แตกต่างจากภารกิจที่เขียนโดยกลุ่มผู้เชี่ยวชาญขนาดเล็ก[1]

อัลกอริทึม AfLite

นวัตกรรมสำคัญของ WinoGrande คืออัลกอริทึม AfLite (Adversarial Filtering Lite) วิธีการนี้ได้รับการพัฒนาเพื่อกรองภารกิจที่สามารถแก้ได้โดยอาศัยสัญญาณทางสถิติง่ายๆ โดยไม่ต้องใช้สามัญสำนึกออกไปโดยอัตโนมัติ อัลกอริทึมใช้โมเดลที่เรียบง่ายในการระบุและลบตัวอย่างที่คำตอบหนึ่งมีความเชื่อมโยงกับคำอื่นๆ ในประโยคอย่างชัดเจนเกินไป ตัวอย่างเช่น ภารกิจ "สิงโตกินม้าลายเพราะพวกมันเป็น สัตว์นักล่า" จะถูกกรองออก เนื่องจากคำว่า "สัตว์นักล่า" มีความสัมพันธ์ทางสถิติกับ "สิงโต" อย่างใกล้ชิด

ผลจากการกรอง ข้อมูลที่รวบรวมได้ประมาณ 14% ถูกคัดออก เวอร์ชันสุดท้ายของชุดข้อมูลประกอบด้วย 43,972 ภารกิจ ซึ่งทำให้เป็นแบบทดสอบที่เชื่อถือได้และท้าทายกว่าอย่างมีนัยสำคัญ[1]

ผลลัพธ์ของโมเดลและความก้าวหน้า

เมื่อเปิดตัว WinoGrande โมเดลที่ดีที่สุดในขณะนั้นแสดงผลลัพธ์ที่ต่ำกว่าระดับมนุษย์อย่างมาก

  • RoBERTa (เวอร์ชันปรับปรุงของ BERT) ทำความถูกต้องได้ ~79%
  • มนุษย์ โดยเฉลี่ยแก้ภารกิจได้ด้วยความถูกต้อง ~94%[1]

ช่องว่างนี้ยืนยันว่าการกรองด้วย AfLite ประสบความสำเร็จในการกำจัด "เส้นทางง่าย" หลายอย่างสำหรับโมเดล อย่างไรก็ตาม เมื่อ LLM พัฒนาขึ้น ช่องว่างนี้เริ่มลดลง

  • ภายในปี 2022 โมเดล ST-MoE-32B ทำความถูกต้องได้ 96.1% ซึ่งเกินระดับมนุษย์[5]
  • GPT-3 แสดงผลลัพธ์ประมาณ 88%[6]
  • GPT-4 โดยไม่มีการ fine-tuning พิเศษ แก้ภารกิจได้ด้วยความถูกต้อง ~87.5%[7]

อิทธิพลและการวิพากษ์วิจารณ์

WinoGrande กลายเป็นหนึ่งใน benchmark หลักสำหรับการประเมินสามัญสำนึกและถูกใช้ทดสอบโมเดลใหม่เป็นประจำ ผลลัพธ์ของมันได้รับการตีพิมพ์ในรายงานทางเทคนิคของบริษัท AI ชั้นนำและบนแพลตฟอร์มสำหรับการเปรียบเทียบโมเดล[8]

ในขณะเดียวกัน วิธีการสร้างชุดข้อมูลกลายเป็นหัวข้อของการอภิปรายทางวิทยาศาสตร์ นักวิจัยบางคนตั้งข้อสังเกตว่าการระดมพลังจากมวลชนอาจนำไปสู่การปรากฏของวลีที่ไม่เป็นธรรมชาติหรือกำกวม นอกจากนี้ยังมีความสงสัยว่าการกรองอัตโนมัติด้วย AfLite สามารถกำจัด artifacts ที่ซ่อนอยู่ทั้งหมดได้หรือไม่[5] อย่างไรก็ตาม WinoGrande ไม่เพียงกระตุ้นความก้าวหน้าในด้านตัวชี้วัด แต่ยังจุดประกายการอภิปรายที่สำคัญเกี่ยวกับการสร้างวิธีการประเมิน AI ที่มีความทนทานและเชื่อถือได้มากขึ้น

ลิงก์ภายนอก

  • เว็บไซต์อย่างเป็นทางการของ WinoGrande
  • Dataset บนแพลตฟอร์ม Hugging Face

วรรณกรรม

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

หมายเหตุ

  1. 1.0 1.1 1.2 1.3 Sakaguchi, K., Le Bras, R., Bhagavatula, C., Choi, Y. «WinoGrande: An Adversarial Winograd Schema Challenge at Scale». arXiv:1907.10641. [1]
  2. «allenai/winogrande». Hugging Face. [2]
  3. «Winograd schema challenge». In Wikipedia. [3]
  4. Kocijan, V. et al. «The defeat of the Winograd Schema Challenge». Artificial Intelligence. [4]
  5. 5.0 5.1 Lepore, J. «AI Has Been Surprising for Years». Carnegie Endowment for International Peace. [5]
  6. Brown, T. et al. «Language Models are Few-Shot Learners». arXiv:2005.14165. [6]
  7. OpenAI. «GPT-4 Technical Report». arXiv:2303.08774. [7]
  8. «Common Sense Reasoning On Winogrande». HyperAI. [8]