---
title: "HellaSwag Benchmark (TH)"
source: "https://systems-analysis.info/int/HellaSwag_Benchmark_(TH)"
wiki: "systems-analysis.info/int"
article: "HellaSwag_Benchmark_(TH)"
language: "th"
categories:
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
  - "Category:Thai"
revision_id: 2850
wiki_created_at: 2026-09-06T23:11:56Z
wiki_modified_at: 2026-09-06T23:11:56Z
downloaded_at: 2026-09-07T22:53:42Z
---

# HellaSwag Benchmark (TH)

**HellaSwag** — คือชุดข้อมูลอ้างอิง (benchmark) ที่เปิดตัวในปี 2019 เพื่อประเมินความสามารถของโมเดลปัญญาประดิษฐ์ในการทำความเข้าใจสถานการณ์ในชีวิตประจำวัน (*commonsense reasoning*) ในภาษาธรรมชาติ<sup>[\[1\]](https://systems-analysis.info/int/HellaSwag_Benchmark_(TH)#cite_note-hellaswag_paper-1)</sup> benchmark นี้ได้รับการพัฒนาโดยกลุ่มนักวิจัยจากมหาวิทยาลัยวอชิงตันและสถาบันปัญญาประดิษฐ์อัลเลน

ภารกิจของ HellaSwag คือการเลือกบทสรุปที่น่าเชื่อถือที่สุดสำหรับบริบทข้อความที่กำหนด จุดเด่นสำคัญของชุดข้อมูลนี้คือมันเป็นเรื่องง่ายดายสำหรับมนุษย์ แต่กลับทำให้แม้แต่โมเดลภาษาขั้นสูงที่อาศัยรูปแบบทางสถิติเชิงผิวเผินต้องหยุดชะงัก<sup>[\[2\]](https://systems-analysis.info/int/HellaSwag_Benchmark_(TH)#cite_note-hellaswag_arxiv-2)</sup>

## ประวัติและบริบท

HellaSwag เป็นการพัฒนาต่อยอดแนวคิดจาก dataset **SWAG** (*Situations With Adversarial Generations*) ที่เสนอโดยกลุ่มผู้เขียนชุดเดียวกันในปี 2018 ในภารกิจ SWAG โมเดลต้องเลือกบทสรุปที่น่าจะเป็นไปได้มากที่สุดสำหรับคำอธิบายสถานการณ์ง่าย ๆ ในตอนแรก SWAG มีความยากสำหรับอัลกอริทึม แต่เมื่อโมเดล BERT ปรากฏขึ้น ผลลัพธ์ของมันบน SWAG ก็พุ่งสูงถึงระดับ **~86%** ซึ่งใกล้เคียงกับระดับของมนุษย์แทบจะเท่ากันเลยทีเดียว<sup>[\[2\]](https://systems-analysis.info/int/HellaSwag_Benchmark_(TH)#cite_note-hellaswag_arxiv-2)</sup>

ความสำเร็จนี้ก่อให้เกิดข้อสงสัย: BERT "เข้าใจ" ข้อความจริง ๆ หรือเพียงแค่เรียนรู้ที่จะจดจำสิ่งประดิษฐ์ทางสถิติและรูปแบบที่มีอยู่ใน dataset? ผู้เขียน HellaSwag ตั้งสมมติฐานว่าผลลัพธ์สูงของ BERT ไม่ได้เกิดจากความเข้าใจที่แท้จริง แต่เกิดจากการปรับตัวเข้ากับลักษณะเฉพาะของ dataset พวกเขาแสดงให้เห็นว่าเมื่อการกระจายตัวของข้อมูลเปลี่ยนแปลงเพียงเล็กน้อย ความแม่นยำของ BERT ก็ลดลงอย่างรวดเร็ว ซึ่งหมายความว่าจำเป็นต้องมี benchmark ใหม่ที่ซับซ้อนกว่าและ "ท้าทาย" กว่าเพื่อประเมินความก้าวหน้าใน NLP อย่างเป็นกลาง<sup>[\[2\]](https://systems-analysis.info/int/HellaSwag_Benchmark_(TH)#cite_note-hellaswag_arxiv-2)</sup>

## คำอธิบายและวัตถุประสงค์ของ dataset

HellaSwag ถูกสร้างขึ้นเป็นแบบทดสอบที่มุ่งเปิดเผยข้อจำกัดของโมเดลสมัยใหม่ในการทำความเข้าใจความสัมพันธ์เชิงเหตุและผลและสถานการณ์ในชีวิตประจำวัน

### โครงสร้างของภารกิจ

แต่ละตัวอย่างใน HellaSwag ประกอบด้วยสองส่วน:

1.  **บริบท**: ย่อหน้าสั้น (สูงสุดสามประโยค) ที่อธิบายจุดเริ่มต้นของสถานการณ์หนึ่ง
2.  **ตัวเลือกบทสรุปสี่ตัวเลือก**: บทสรุปที่เป็นไปได้สี่แบบของเรื่องราว ซึ่งประกอบด้วยประโยคหลายประโยคเช่นกัน

มีเพียงหนึ่งในบทสรุปเหล่านี้ที่ถูกต้อง (เป็นบทสรุปจริง) ส่วนอีกสามตัวเลือกเป็นบทสรุปเท็จที่สร้างขึ้นเป็นพิเศษเพื่อทำให้โมเดลสับสน

### แหล่งที่มาของข้อมูล

ตัวอย่างสถานการณ์ถูกนำมาจากสองแหล่ง ซึ่งครอบคลุมสถานการณ์ในชีวิตประจำวันที่หลากหลาย:

- **ActivityNet Captions**: คำอธิบายการกระทำจากวิดีโอ (เช่น "คนเปิดกระป๋องแตงกวาดอง")
- **WikiHow**: คำแนะนำจากบทความ (เช่น "วิธีเปลี่ยนยางรถยนต์")

วัตถุประสงค์ของ HellaSwag คือการสร้าง benchmark ที่มนุษย์แก้ได้ง่าย (โดยสัญชาตญาณ) แต่ทำให้ภารกิจยากที่สุดสำหรับโมเดลที่ไม่มีสามัญสำนึกอย่างสมบูรณ์ ผู้เขียนเรียกผลกระทบนี้ว่า "ผลกระทบโกลดิล็อกส์" (*Goldilocks effect*)<sup>[\[1\]](https://systems-analysis.info/int/HellaSwag_Benchmark_(TH)#cite_note-hellaswag_paper-1)</sup>

## วิธีการ Adversarial Filtering (AF)

นวัตกรรมสำคัญในการสร้าง HellaSwag คือวิธีการ **Adversarial Filtering** (**AF**) — การคัดกรองแบบวนซ้ำของ "กับดัก" ที่ออกแบบมาสำหรับโมเดล "เป้าหมาย" โดยเฉพาะ วิธีการนี้ทำให้สามารถสร้างตัวเลือกเท็จที่มีลักษณะคล้ายคลึงกับตัวเลือกที่ถูกต้องอย่างหลอกลวงจากมุมมองของโมเดลทางสถิติ

แผนการทำงานของ AF มีดังนี้:

1.  **การสร้าง**: จากบริบทต้นฉบับ โมเดลภาษาที่ทำหน้าที่สร้าง (เช่น GPT) จะสร้างบทสรุปที่ไม่ถูกต้องจำนวนมากที่เป็นไปได้
2.  **การจำแนก**: โมเดลตัวแยกประเภท (เช่น BERT) ที่ทำหน้าที่เป็น "เป้าหมาย" พยายามแยกแยะบทสรุปที่สร้างขึ้นจากบทสรุปจริง (ที่ถูกต้อง)
3.  **การคัดเลือก**: ตัวเลือกเท็จที่ตัวแยกประเภทพิจารณาว่าน่าเชื่อถือที่สุดจะถูกคัดเลือก นั่นคือตัวเลือกที่โมเดลมีแนวโน้มผิดพลาดมากที่สุด
4.  **การวนซ้ำ**: กระบวนการทำซ้ำหลายครั้งจนกว่าคำตอบเท็จจะมีความคล้ายคลึงกับคำตอบที่ถูกต้องสำหรับอัลกอริทึมมากที่สุด
5.  **การตรวจสอบโดยมนุษย์**: ในขั้นตอนสุดท้าย ชุดข้อมูลที่ได้ (บริบท + บทสรุปที่ถูกต้อง 1 บท + บทสรุปเท็จที่ดีที่สุด 3 บท) จะได้รับการประเมินโดยมนุษย์ ผู้ประเมินยืนยันว่าตัวเลือกที่ถูกต้องเป็นตัวเลือกที่เป็นธรรมชาติที่สุดอย่างชัดเจน และทางเลือกทั้งหมดมีความไม่สมเหตุสมผลบางอย่างที่มนุษย์สามารถสังเกตเห็นได้<sup>[\[2\]](https://systems-analysis.info/int/HellaSwag_Benchmark_(TH)#cite_note-hellaswag_arxiv-2)</sup>

ด้วย AF ทุกตัวอย่างใน HellaSwag ได้รับการออกแบบมาตั้งแต่ต้นเพื่อทำให้โมเดลเข้าใจผิด แต่ยังคงชัดเจนสำหรับมนุษย์

## ผลลัพธ์และความสำคัญ

HellaSwag กลายเป็นการทดสอบที่เข้มงวดสำหรับโมเดลการทำความเข้าใจข้อความ ผลลัพธ์การทดสอบแสดงให้เห็นช่องว่างขนาดใหญ่ระหว่างปัญญาประดิษฐ์และปัญญาของมนุษย์:

- **มนุษย์** แก้ภารกิจ HellaSwag ได้แทบจะไม่มีข้อผิดพลาด ด้วยความแม่นยำประมาณ **95-96%**<sup>[\[2\]](https://systems-analysis.info/int/HellaSwag_Benchmark_(TH)#cite_note-hellaswag_arxiv-2)</sup>
- โมเดลที่ดีที่สุดในขณะที่สร้าง benchmark คือ **BERT-Large** ทำได้เพียง **~47%** ของความแม่นยำ วิธีการที่ง่ายกว่าแสดงผลลัพธ์ที่ไม่สูงกว่าการเดาแบบสุ่มมากนัก (25%)<sup>[\[2\]](https://systems-analysis.info/int/HellaSwag_Benchmark_(TH)#cite_note-hellaswag_arxiv-2)</sup>

ช่องว่างมากกว่า **45 เปอร์เซ็นต์พอยต์** ยืนยันสมมติฐานที่ว่าผลลัพธ์สูงในการทดสอบก่อนหน้านั้นไม่ได้หมายความว่ามีความเข้าใจที่แท้จริง HellaSwag แสดงให้เห็นว่าแม้หลังจากการฝึกด้วยข้อมูลจำนวนมหาศาล โมเดลก็ยังไม่สามารถพัฒนาสามัญสำนึกทั่วไปสำหรับสถานการณ์ใหม่ได้

ในช่วงปีต่อ ๆ มา HellaSwag ได้กลายเป็นหนึ่งในการทดสอบมาตรฐานสำหรับโมเดลภาษาใหม่ ความก้าวหน้าของระบบ AI สามารถติดตามได้จากผลลัพธ์บน benchmark นี้

- ในปี 2020 โมเดล GPT-3 (175 พันล้านพารามิเตอร์) แสดงความแม่นยำ **~79%** ในโหมด *few-shot* ซึ่งเกินระดับของโมเดลเฉพาะทางหลายตัวในช่วงเวลานั้น แต่ยังคงต่ำกว่ามนุษย์อย่างมีนัยสำคัญ<sup>[\[3\]](https://systems-analysis.info/int/HellaSwag_Benchmark_(TH)#cite_note-gpt3_paper-3)</sup>
- เพียงในปี 2023 เท่านั้นที่โมเดลรุ่นใหม่ เช่น GPT-4 สามารถบรรลุผลลัพธ์บน HellaSwag ที่เทียบเคียงได้กับมนุษย์ (ประมาณ **95%** ของความแม่นยำ)<sup>[\[4\]](https://systems-analysis.info/int/HellaSwag_Benchmark_(TH)#cite_note-hellaswag_official_site-4)</sup>

การสร้าง HellaSwag ได้ระบุแนวทางใหม่ในการประเมินความก้าวหน้าใน NLP โดยอาศัยแนวคิดของ **benchmark ที่วิวัฒนาการ**: เมื่อโมเดลพัฒนาขึ้น จำเป็นต้องสร้างการทดสอบใหม่ที่ซับซ้อนยิ่งขึ้นซึ่งเปิดเผยจุดอ่อนของโมเดลเหล่านั้น

## ลิงก์

- เว็บไซต์อย่างเป็นทางการของโครงการ HellaSwag
- บทความวิชาการ «HellaSwag: Can a Machine Really Finish Your Sentence?»

## เอกสารอ้างอิง

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## หมายเหตุ

1.  <span id="cite_note-hellaswag_paper-1">↑ <sup>[1.0](https://systems-analysis.info/int/HellaSwag_Benchmark_(TH)#cite_ref-hellaswag_paper_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/HellaSwag_Benchmark_(TH)#cite_ref-hellaswag_paper_1-1)</sup> Zellers, R. et al. «HellaSwag: Can a Machine Really Finish Your Sentence?». *Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics*. <a href="https://aclanthology.org/P19-1472/" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-hellaswag_arxiv-2">↑ <sup>[2.0](https://systems-analysis.info/int/HellaSwag_Benchmark_(TH)#cite_ref-hellaswag_arxiv_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/HellaSwag_Benchmark_(TH)#cite_ref-hellaswag_arxiv_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/HellaSwag_Benchmark_(TH)#cite_ref-hellaswag_arxiv_2-2)</sup> <sup>[2.3](https://systems-analysis.info/int/HellaSwag_Benchmark_(TH)#cite_ref-hellaswag_arxiv_2-3)</sup> <sup>[2.4](https://systems-analysis.info/int/HellaSwag_Benchmark_(TH)#cite_ref-hellaswag_arxiv_2-4)</sup> <sup>[2.5](https://systems-analysis.info/int/HellaSwag_Benchmark_(TH)#cite_ref-hellaswag_arxiv_2-5)</sup> Zellers, R. et al. «HellaSwag: Can a Machine Really Finish Your Sentence?». *arXiv:1905.07830*, 2019. <a href="https://ar5iv.labs.arxiv.org/html/1905.07830" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-gpt3_paper-3">[↑](https://systems-analysis.info/int/HellaSwag_Benchmark_(TH)#cite_ref-gpt3_paper_3-0) Brown, T. B. et al. «Language Models are Few-Shot Learners». *arXiv:2005.14165*, 2020. <a href="http://arxiv.org/pdf/2005.14165" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-hellaswag_official_site-4">[↑](https://systems-analysis.info/int/HellaSwag_Benchmark_(TH)#cite_ref-hellaswag_official_site_4-0) Zellers, R. et al. «HellaSwag Project Page». <a href="https://rowanzellers.com/hellaswag/" class="external autonumber" rel="nofollow">[4]</a></span>
