GLUE Benchmark (TH)
GLUE (ตัวย่อของ General Language Understanding Evaluation แปลว่า «การประเมินความเข้าใจภาษาโดยรวม») — คือ benchmark แบบหลายงาน (multitask) สำหรับประเมินคุณภาพของโมเดลการประมวลผลภาษาธรรมชาติ (NLU) benchmark นี้ถูกเสนอขึ้นในปี ค.ศ. 2018 โดยกลุ่มนักวิจัยจากมหาวิทยาลัยนิวยอร์ก มหาวิทยาลัยวอชิงตัน และ DeepMind ซึ่งรวมถึง Alex Wang และ Samuel Bowman และได้รับการยอมรับอย่างแพร่หลายในชุมชนวิจัย[1]
เป้าหมายหลักของ GLUE คือการจัดเตรียมชุดทดสอบที่เป็นหนึ่งเดียว เป็นกลาง และมีความท้าทาย สำหรับการประเมินเปรียบเทียบความสามารถของโมเดล NLU บนชุดงานที่หลากหลาย ซึ่งไม่จำกัดอยู่เพียงโดเมนใดโดเมนหนึ่ง benchmark นี้มีแพลตฟอร์มออนไลน์พร้อม ลีดเดอร์บอร์ด (ตารางอันดับ) ที่ช่วยให้สามารถเปรียบเทียบโมเดลได้อย่างเป็นกลาง และป้องกันการปรับแต่งโมเดลให้เข้ากับข้อมูลทดสอบ เนื่องจากป้ายกำกับที่แท้จริงของการทดสอบบางส่วนไม่ได้เผยแพร่สาธารณะ และสามารถเข้าถึงได้ผ่านเซิร์ฟเวอร์ประเมินเท่านั้น โดยคาดว่าโมเดลที่จะทำคะแนนสูงได้นั้น จะต้องสามารถดึงข้อมูลตัวแทนภาษาสากลและถ่ายทอดความรู้ระหว่างงานประเภทต่างๆ ได้อย่างมีประสิทธิภาพ
ส่วนประกอบและงานของ benchmark
benchmark GLUE รวบรวมงานทำความเข้าใจภาษาที่แตกต่างกันเก้างาน โดยอิงจาก dataset ที่มีอยู่แล้วและมีความท้าทายสำหรับ AI งานทั้งหมดถูกกำหนดในรูปแบบการจำแนกประเภทหรือการถดถอยบนประโยคเดี่ยวหรือคู่ประโยค[1]
- CoLA (Corpus of Linguistic Acceptability) — งานกำหนดความถูกต้องทางไวยากรณ์ของประโยค ตัวชี้วัดคุณภาพคือสัมประสิทธิ์สหสัมพันธ์ Matthews
- SST-2 (Stanford Sentiment Treebank) — งานกำหนดความรู้สึก (เชิงบวก/เชิงลบ) ของรีวิวภาพยนตร์ ตัวชี้วัดคือความแม่นยำ (accuracy)
- MRPC (Microsoft Research Paraphrase Corpus) — งานตรวจหาการถอดความในคู่ประโยคจากแหล่งข่าว ตัวชี้วัดคือความแม่นยำและ F1
- QQP (Quora Question Pairs) — งานระบุคำถามที่ซ้ำกันจากชุมชน Quora ตัวชี้วัดคือความแม่นยำและ F1
- STS-B (Semantic Textual Similarity Benchmark) — งานเปรียบเทียบความหมายเชิงความหมายของสองประโยค โมเดลต้องทำนายระดับความใกล้เคียงทางความหมายในระดับ 1 ถึง 5 ตัวชี้วัดคือสัมประสิทธิ์สหสัมพันธ์ Pearson และ Spearman
- MNLI (Multi-Genre Natural Language Inference) — งานจดจำความสัมพันธ์ทางตรรกะระหว่างข้อความในคู่ประโยคจากแหล่งข้อมูลต่างประเภท (การอนุมาน, ความขัดแย้ง, ความเป็นกลาง) ผลลัพธ์ถูกประเมินแยกกันบนชุดย่อยที่ตรงกัน (matched) และไม่ตรงกัน (mismatched)
- QNLI (Question Natural Language Inference) — งานที่ได้มาจากการแปลง dataset SQuAD โดยต้องระบุว่าประโยคในย่อหน้านั้นมีคำตอบสำหรับคำถามที่กำหนดหรือไม่
- RTE (Recognizing Textual Entailment) — dataset รวมเกี่ยวกับความสัมพันธ์เชิงตรรกะระหว่างข้อความ ที่รวบรวมจากชุดข้อมูลขนาดเล็กหลายชุด งานคือการจำแนกประเภทแบบไบนารีของความสัมพันธ์ระหว่างประโยค
- WNLI (Winograd NLI) — เวอร์ชันที่ดัดแปลงของ Winograd schema ที่ปรับให้เข้ากับรูปแบบ NLI งานแก้ปัญหาการอ้างอิง (anaphora resolution): ระบบได้รับประโยคที่มีสรรพนามที่กำกวม และต้องระบุว่าสรรพนามนั้นอ้างถึงวัตถุใดในสองวัตถุ
วิธีการประเมิน
สำหรับการประเมินบน GLUE นักวิจัยจะส่งการทำนายของโมเดลไปยังเซิร์ฟเวอร์เฉพาะ จากนั้นจะได้รับการคำนวณตัวชี้วัดอัตโนมัติสำหรับแต่ละงานและคะแนนรวม
- GLUE-score — คะแนนสุดท้ายที่คำนวณเป็นค่าเฉลี่ยของผลลัพธ์จากงานหลักทั้งเก้างาน
- ลีดเดอร์บอร์ด — ตารางสาธารณะที่แสดงสถานะปัจจุบันและบ่งชี้ว่าโมเดลใดทำงาน NLU ได้ดีกว่า การใช้ชุดทดสอบที่ซ่อนอยู่ช่วยให้การเปรียบเทียบเป็นไปอย่างยุติธรรม
- ชุดวิเคราะห์เชิงวินิจฉัย — ชุดพิเศษที่ประกอบด้วยตัวอย่าง 1,100 รายการที่ผู้เชี่ยวชาญอธิบายด้วยตนเองสำหรับการวิเคราะห์ทางภาษาเชิงละเอียด ชุดนี้ไม่ส่งผลต่อการจัดอันดับ แต่ทำหน้าที่เป็นเครื่องมือวิเคราะห์เชิงคุณภาพเพื่อตรวจสอบว่าโมเดลสามารถจดจำปรากฏการณ์ทางภาษาใดได้ (ความหมายศัพท์, ตรรกะ, สามัญสำนึก) และพบความยากลำบากกับอะไร[1]
ผลลัพธ์และผลกระทบต่ออุตสาหกรรม
เมื่อเปิดตัว GLUE ในปี ค.ศ. 2018 โมเดลที่ดีที่สุดในขณะนั้น (เช่น BiLSTM ที่มี ELMo) ทำคะแนนรวมได้ประมาณ 70 คะแนน (ในระดับ 0–100) ซึ่งต่ำกว่าระดับมนุษย์อย่างมีนัยสำคัญ (ประมาณ 87 คะแนน)[2]
การปรากฏตัวของ GLUE และลีดเดอร์บอร์ดแบบเปิดกระตุ้นให้เกิดความก้าวหน้าอย่างรวดเร็วในด้าน transfer learning ใน NLP
- ภายในเดือนพฤษภาคม ค.ศ. 2019 ซึ่งเป็นเวลาน้อยกว่าหนึ่งปี โมเดลรุ่นใหม่ที่อิงจาก transformer (โดยเฉพาะอย่างยิ่ง BERT) ได้ยกระดับ state-of-the-art ขึ้นเป็น 83.9 คะแนน
- ในช่วงครึ่งหลังของปี ค.ศ. 2019 benchmark GLUE ถูก «ผ่าน» ไปอย่างแท้จริง: ระบบที่ดีที่สุดเข้าใกล้ระดับมนุษย์อย่างมาก และในบางงานก็เหนือกว่าด้วยซ้ำ[3]
GLUE มีบทบาทสำคัญอย่างยิ่งในฐานะ จุดอ้างอิงเดียว ในการพัฒนาโมเดลความเข้าใจภาษา ด้วย GLUE นักวิจัยสามารถเปรียบเทียบสถาปัตยกรรมต่างๆ โดยตรงบนชุดงานที่ครอบคลุม ระบุจุดแข็งและจุดอ่อนของแนวทางต่างๆ และแบ่งปันความสำเร็จได้อย่างรวดเร็วผ่านลีดเดอร์บอร์ดสาธารณะ
SuperGLUE: พัฒนาการในภายหลัง
ความสำเร็จอย่างรวดเร็วของ GLUE นำไปสู่การที่ภายในเวลาเพียงหนึ่งปี ทีมผู้เขียนชุดเดิมร่วมกับเพื่อนร่วมงานจาก Facebook AI ได้เปิดตัวชุดทดสอบใหม่ที่ยากยิ่งขึ้นในชื่อ SuperGLUE[4]
SuperGLUE ถูกประกาศในช่วงปลายปี ค.ศ. 2019 ในฐานะชุดทดสอบที่ «ยึดแน่นกว่า» (stickier) ที่มุ่งสร้างช่องว่างระหว่างความสามารถของโมเดลสมัยใหม่กับมนุษย์อีกครั้ง ชุดนี้รวมถึงงานแปดงานที่ต้องการความเข้าใจภาษาในระดับที่ลึกยิ่งขึ้น พร้อมด้วยเครื่องมือและกฎระเบียบสำหรับผู้เข้าร่วมที่ปรับปรุงแล้ว แม้ว่า GLUE ยังคงถูกใช้เป็นการทดสอบพื้นฐาน แต่จุดสนใจหลักในการแข่งขันพัฒนาได้เปลี่ยนไปสู่ SuperGLUE และ benchmark เฉพาะทางอื่นๆ ที่มีความซับซ้อนมากขึ้น
ลิงก์ภายนอก
- เว็บไซต์อย่างเป็นทางการของ GLUE Benchmark
- หน้า GLUE บน Papers With Code พร้อมผลลัพธ์ของโมเดล
บรรณานุกรม
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
หมายเหตุ
- ↑ 1.0 1.1 1.2 Wang, A. et al. «GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding». arXiv:1804.07461, 2019. [1]
- ↑ Bowman, S. R. et al. «Human vs. Muppet: A Conservative Estimate of Human Performance on the GLUE Benchmark». arXiv:1905.10425, 2019. [2]
- ↑ Wang, A. et al. «SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems». NeurIPS 2019. [3]
- ↑ «AI models from Microsoft and Google already surpass human performance on the SuperGLUE language benchmark». VentureBeat. [4]