---
title: "GLUE Benchmark (TH)"
source: "https://systems-analysis.info/int/GLUE_Benchmark_(TH)"
wiki: "systems-analysis.info/int"
article: "GLUE_Benchmark_(TH)"
language: "th"
categories:
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
  - "Category:Thai"
revision_id: 2436
wiki_created_at: 2026-09-06T23:03:59Z
wiki_modified_at: 2026-09-06T23:03:59Z
downloaded_at: 2026-09-07T22:51:10Z
---

# GLUE Benchmark (TH)

**GLUE** (ตัวย่อของ **General Language Understanding Evaluation** แปลว่า «การประเมินความเข้าใจภาษาโดยรวม») — คือ benchmark แบบหลายงาน (multitask) สำหรับประเมินคุณภาพของโมเดลการประมวลผลภาษาธรรมชาติ (NLU) benchmark นี้ถูกเสนอขึ้นในปี ค.ศ. 2018 โดยกลุ่มนักวิจัยจากมหาวิทยาลัยนิวยอร์ก มหาวิทยาลัยวอชิงตัน และ DeepMind ซึ่งรวมถึง **Alex Wang** และ **Samuel Bowman** และได้รับการยอมรับอย่างแพร่หลายในชุมชนวิจัย<sup>[\[1\]](https://systems-analysis.info/int/GLUE_Benchmark_(TH)#cite_note-glue_paper-1)</sup>

เป้าหมายหลักของ GLUE คือการจัดเตรียมชุดทดสอบที่เป็นหนึ่งเดียว เป็นกลาง และมีความท้าทาย สำหรับการประเมินเปรียบเทียบความสามารถของโมเดล NLU บนชุดงานที่หลากหลาย ซึ่งไม่จำกัดอยู่เพียงโดเมนใดโดเมนหนึ่ง benchmark นี้มีแพลตฟอร์มออนไลน์พร้อม **ลีดเดอร์บอร์ด** (ตารางอันดับ) ที่ช่วยให้สามารถเปรียบเทียบโมเดลได้อย่างเป็นกลาง และป้องกันการปรับแต่งโมเดลให้เข้ากับข้อมูลทดสอบ เนื่องจากป้ายกำกับที่แท้จริงของการทดสอบบางส่วนไม่ได้เผยแพร่สาธารณะ และสามารถเข้าถึงได้ผ่านเซิร์ฟเวอร์ประเมินเท่านั้น โดยคาดว่าโมเดลที่จะทำคะแนนสูงได้นั้น จะต้องสามารถดึงข้อมูลตัวแทนภาษาสากลและถ่ายทอดความรู้ระหว่างงานประเภทต่างๆ ได้อย่างมีประสิทธิภาพ

## ส่วนประกอบและงานของ benchmark

benchmark GLUE รวบรวมงานทำความเข้าใจภาษาที่แตกต่างกันเก้างาน โดยอิงจาก dataset ที่มีอยู่แล้วและมีความท้าทายสำหรับ AI งานทั้งหมดถูกกำหนดในรูปแบบการจำแนกประเภทหรือการถดถอยบนประโยคเดี่ยวหรือคู่ประโยค<sup>[\[1\]](https://systems-analysis.info/int/GLUE_Benchmark_(TH)#cite_note-glue_paper-1)</sup>

- **CoLA** (*Corpus of Linguistic Acceptability*) — งานกำหนดความถูกต้องทางไวยากรณ์ของประโยค ตัวชี้วัดคุณภาพคือสัมประสิทธิ์สหสัมพันธ์ Matthews
- **SST-2** (*Stanford Sentiment Treebank*) — งานกำหนดความรู้สึก (เชิงบวก/เชิงลบ) ของรีวิวภาพยนตร์ ตัวชี้วัดคือความแม่นยำ (*accuracy*)
- **MRPC** (*Microsoft Research Paraphrase Corpus*) — งานตรวจหาการถอดความในคู่ประโยคจากแหล่งข่าว ตัวชี้วัดคือความแม่นยำและ F1
- **QQP** (*Quora Question Pairs*) — งานระบุคำถามที่ซ้ำกันจากชุมชน Quora ตัวชี้วัดคือความแม่นยำและ F1
- **STS-B** (*Semantic Textual Similarity Benchmark*) — งานเปรียบเทียบความหมายเชิงความหมายของสองประโยค โมเดลต้องทำนายระดับความใกล้เคียงทางความหมายในระดับ 1 ถึง 5 ตัวชี้วัดคือสัมประสิทธิ์สหสัมพันธ์ Pearson และ Spearman
- **MNLI** (*Multi-Genre Natural Language Inference*) — งานจดจำความสัมพันธ์ทางตรรกะระหว่างข้อความในคู่ประโยคจากแหล่งข้อมูลต่างประเภท (การอนุมาน, ความขัดแย้ง, ความเป็นกลาง) ผลลัพธ์ถูกประเมินแยกกันบนชุดย่อยที่ตรงกัน (*matched*) และไม่ตรงกัน (*mismatched*)
- **QNLI** (*Question Natural Language Inference*) — งานที่ได้มาจากการแปลง dataset SQuAD โดยต้องระบุว่าประโยคในย่อหน้านั้นมีคำตอบสำหรับคำถามที่กำหนดหรือไม่
- **RTE** (*Recognizing Textual Entailment*) — dataset รวมเกี่ยวกับความสัมพันธ์เชิงตรรกะระหว่างข้อความ ที่รวบรวมจากชุดข้อมูลขนาดเล็กหลายชุด งานคือการจำแนกประเภทแบบไบนารีของความสัมพันธ์ระหว่างประโยค
- **WNLI** (*Winograd NLI*) — เวอร์ชันที่ดัดแปลงของ Winograd schema ที่ปรับให้เข้ากับรูปแบบ NLI งานแก้ปัญหาการอ้างอิง (anaphora resolution): ระบบได้รับประโยคที่มีสรรพนามที่กำกวม และต้องระบุว่าสรรพนามนั้นอ้างถึงวัตถุใดในสองวัตถุ

## วิธีการประเมิน

สำหรับการประเมินบน GLUE นักวิจัยจะส่งการทำนายของโมเดลไปยังเซิร์ฟเวอร์เฉพาะ จากนั้นจะได้รับการคำนวณตัวชี้วัดอัตโนมัติสำหรับแต่ละงานและคะแนนรวม

- **GLUE-score** — คะแนนสุดท้ายที่คำนวณเป็นค่าเฉลี่ยของผลลัพธ์จากงานหลักทั้งเก้างาน
- **ลีดเดอร์บอร์ด** — ตารางสาธารณะที่แสดงสถานะปัจจุบันและบ่งชี้ว่าโมเดลใดทำงาน NLU ได้ดีกว่า การใช้ชุดทดสอบที่ซ่อนอยู่ช่วยให้การเปรียบเทียบเป็นไปอย่างยุติธรรม
- **ชุดวิเคราะห์เชิงวินิจฉัย** — ชุดพิเศษที่ประกอบด้วยตัวอย่าง 1,100 รายการที่ผู้เชี่ยวชาญอธิบายด้วยตนเองสำหรับการวิเคราะห์ทางภาษาเชิงละเอียด ชุดนี้ไม่ส่งผลต่อการจัดอันดับ แต่ทำหน้าที่เป็นเครื่องมือวิเคราะห์เชิงคุณภาพเพื่อตรวจสอบว่าโมเดลสามารถจดจำปรากฏการณ์ทางภาษาใดได้ (ความหมายศัพท์, ตรรกะ, สามัญสำนึก) และพบความยากลำบากกับอะไร<sup>[\[1\]](https://systems-analysis.info/int/GLUE_Benchmark_(TH)#cite_note-glue_paper-1)</sup>

## ผลลัพธ์และผลกระทบต่ออุตสาหกรรม

เมื่อเปิดตัว GLUE ในปี ค.ศ. 2018 โมเดลที่ดีที่สุดในขณะนั้น (เช่น BiLSTM ที่มี ELMo) ทำคะแนนรวมได้ประมาณ **70 คะแนน** (ในระดับ 0–100) ซึ่งต่ำกว่าระดับมนุษย์อย่างมีนัยสำคัญ (ประมาณ 87 คะแนน)<sup>[\[2\]](https://systems-analysis.info/int/GLUE_Benchmark_(TH)#cite_note-human_vs_muppet-2)</sup>

การปรากฏตัวของ GLUE และลีดเดอร์บอร์ดแบบเปิดกระตุ้นให้เกิดความก้าวหน้าอย่างรวดเร็วในด้าน transfer learning ใน NLP

- ภายในเดือนพฤษภาคม ค.ศ. 2019 ซึ่งเป็นเวลาน้อยกว่าหนึ่งปี โมเดลรุ่นใหม่ที่อิงจาก transformer (โดยเฉพาะอย่างยิ่ง BERT) ได้ยกระดับ *state-of-the-art* ขึ้นเป็น **83.9 คะแนน**
- ในช่วงครึ่งหลังของปี ค.ศ. 2019 benchmark GLUE ถูก «ผ่าน» ไปอย่างแท้จริง: ระบบที่ดีที่สุดเข้าใกล้ระดับมนุษย์อย่างมาก และในบางงานก็เหนือกว่าด้วยซ้ำ<sup>[\[3\]](https://systems-analysis.info/int/GLUE_Benchmark_(TH)#cite_note-w4ngatang_superglue-3)</sup>

GLUE มีบทบาทสำคัญอย่างยิ่งในฐานะ **จุดอ้างอิงเดียว** ในการพัฒนาโมเดลความเข้าใจภาษา ด้วย GLUE นักวิจัยสามารถเปรียบเทียบสถาปัตยกรรมต่างๆ โดยตรงบนชุดงานที่ครอบคลุม ระบุจุดแข็งและจุดอ่อนของแนวทางต่างๆ และแบ่งปันความสำเร็จได้อย่างรวดเร็วผ่านลีดเดอร์บอร์ดสาธารณะ

## SuperGLUE: พัฒนาการในภายหลัง

ความสำเร็จอย่างรวดเร็วของ GLUE นำไปสู่การที่ภายในเวลาเพียงหนึ่งปี ทีมผู้เขียนชุดเดิมร่วมกับเพื่อนร่วมงานจาก Facebook AI ได้เปิดตัวชุดทดสอบใหม่ที่ยากยิ่งขึ้นในชื่อ **SuperGLUE**<sup>[\[4\]](https://systems-analysis.info/int/GLUE_Benchmark_(TH)#cite_note-venturebeat_superglue-4)</sup>

SuperGLUE ถูกประกาศในช่วงปลายปี ค.ศ. 2019 ในฐานะชุดทดสอบที่ «ยึดแน่นกว่า» (*stickier*) ที่มุ่งสร้างช่องว่างระหว่างความสามารถของโมเดลสมัยใหม่กับมนุษย์อีกครั้ง ชุดนี้รวมถึงงานแปดงานที่ต้องการความเข้าใจภาษาในระดับที่ลึกยิ่งขึ้น พร้อมด้วยเครื่องมือและกฎระเบียบสำหรับผู้เข้าร่วมที่ปรับปรุงแล้ว แม้ว่า GLUE ยังคงถูกใช้เป็นการทดสอบพื้นฐาน แต่จุดสนใจหลักในการแข่งขันพัฒนาได้เปลี่ยนไปสู่ SuperGLUE และ benchmark เฉพาะทางอื่นๆ ที่มีความซับซ้อนมากขึ้น

## ลิงก์ภายนอก

- เว็บไซต์อย่างเป็นทางการของ GLUE Benchmark
- หน้า GLUE บน Papers With Code พร้อมผลลัพธ์ของโมเดล

## บรรณานุกรม

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## หมายเหตุ

1.  <span id="cite_note-glue_paper-1">↑ <sup>[1.0](https://systems-analysis.info/int/GLUE_Benchmark_(TH)#cite_ref-glue_paper_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/GLUE_Benchmark_(TH)#cite_ref-glue_paper_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/GLUE_Benchmark_(TH)#cite_ref-glue_paper_1-2)</sup> Wang, A. et al. «GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding». *arXiv:1804.07461*, 2019. <a href="https://arxiv.org/abs/1804.07461" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-human_vs_muppet-2">[↑](https://systems-analysis.info/int/GLUE_Benchmark_(TH)#cite_ref-human_vs_muppet_2-0) Bowman, S. R. et al. «Human vs. Muppet: A Conservative Estimate of Human Performance on the GLUE Benchmark». *arXiv:1905.10425*, 2019. <a href="https://arxiv.org/abs/1905.10425" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-w4ngatang_superglue-3">[↑](https://systems-analysis.info/int/GLUE_Benchmark_(TH)#cite_ref-w4ngatang_superglue_3-0) Wang, A. et al. «SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems». *NeurIPS 2019*. <a href="https://w4ngatang.github.io/static/papers/superglue.pdf" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-venturebeat_superglue-4">[↑](https://systems-analysis.info/int/GLUE_Benchmark_(TH)#cite_ref-venturebeat_superglue_4-0) «AI models from Microsoft and Google already surpass human performance on the SuperGLUE language benchmark». *VentureBeat*. <a href="https://venturebeat.com/business/ai-models-from-microsoft-and-google-already-surpass-human-performance-on-the-superglue-language-benchmark/" class="external autonumber" rel="nofollow">[4]</a></span>
