GLUE Benchmark (TH)

From Systems analysis Wiki
Jump to navigation Jump to search

GLUE (ตัวย่อของ General Language Understanding Evaluation แปลว่า «การประเมินความเข้าใจภาษาโดยรวม») — คือ benchmark แบบหลายงาน (multitask) สำหรับประเมินคุณภาพของโมเดลการประมวลผลภาษาธรรมชาติ (NLU) benchmark นี้ถูกเสนอขึ้นในปี ค.ศ. 2018 โดยกลุ่มนักวิจัยจากมหาวิทยาลัยนิวยอร์ก มหาวิทยาลัยวอชิงตัน และ DeepMind ซึ่งรวมถึง Alex Wang และ Samuel Bowman และได้รับการยอมรับอย่างแพร่หลายในชุมชนวิจัย[1]

เป้าหมายหลักของ GLUE คือการจัดเตรียมชุดทดสอบที่เป็นหนึ่งเดียว เป็นกลาง และมีความท้าทาย สำหรับการประเมินเปรียบเทียบความสามารถของโมเดล NLU บนชุดงานที่หลากหลาย ซึ่งไม่จำกัดอยู่เพียงโดเมนใดโดเมนหนึ่ง benchmark นี้มีแพลตฟอร์มออนไลน์พร้อม ลีดเดอร์บอร์ด (ตารางอันดับ) ที่ช่วยให้สามารถเปรียบเทียบโมเดลได้อย่างเป็นกลาง และป้องกันการปรับแต่งโมเดลให้เข้ากับข้อมูลทดสอบ เนื่องจากป้ายกำกับที่แท้จริงของการทดสอบบางส่วนไม่ได้เผยแพร่สาธารณะ และสามารถเข้าถึงได้ผ่านเซิร์ฟเวอร์ประเมินเท่านั้น โดยคาดว่าโมเดลที่จะทำคะแนนสูงได้นั้น จะต้องสามารถดึงข้อมูลตัวแทนภาษาสากลและถ่ายทอดความรู้ระหว่างงานประเภทต่างๆ ได้อย่างมีประสิทธิภาพ

ส่วนประกอบและงานของ benchmark

benchmark GLUE รวบรวมงานทำความเข้าใจภาษาที่แตกต่างกันเก้างาน โดยอิงจาก dataset ที่มีอยู่แล้วและมีความท้าทายสำหรับ AI งานทั้งหมดถูกกำหนดในรูปแบบการจำแนกประเภทหรือการถดถอยบนประโยคเดี่ยวหรือคู่ประโยค[1]

  • CoLA (Corpus of Linguistic Acceptability) — งานกำหนดความถูกต้องทางไวยากรณ์ของประโยค ตัวชี้วัดคุณภาพคือสัมประสิทธิ์สหสัมพันธ์ Matthews
  • SST-2 (Stanford Sentiment Treebank) — งานกำหนดความรู้สึก (เชิงบวก/เชิงลบ) ของรีวิวภาพยนตร์ ตัวชี้วัดคือความแม่นยำ (accuracy)
  • MRPC (Microsoft Research Paraphrase Corpus) — งานตรวจหาการถอดความในคู่ประโยคจากแหล่งข่าว ตัวชี้วัดคือความแม่นยำและ F1
  • QQP (Quora Question Pairs) — งานระบุคำถามที่ซ้ำกันจากชุมชน Quora ตัวชี้วัดคือความแม่นยำและ F1
  • STS-B (Semantic Textual Similarity Benchmark) — งานเปรียบเทียบความหมายเชิงความหมายของสองประโยค โมเดลต้องทำนายระดับความใกล้เคียงทางความหมายในระดับ 1 ถึง 5 ตัวชี้วัดคือสัมประสิทธิ์สหสัมพันธ์ Pearson และ Spearman
  • MNLI (Multi-Genre Natural Language Inference) — งานจดจำความสัมพันธ์ทางตรรกะระหว่างข้อความในคู่ประโยคจากแหล่งข้อมูลต่างประเภท (การอนุมาน, ความขัดแย้ง, ความเป็นกลาง) ผลลัพธ์ถูกประเมินแยกกันบนชุดย่อยที่ตรงกัน (matched) และไม่ตรงกัน (mismatched)
  • QNLI (Question Natural Language Inference) — งานที่ได้มาจากการแปลง dataset SQuAD โดยต้องระบุว่าประโยคในย่อหน้านั้นมีคำตอบสำหรับคำถามที่กำหนดหรือไม่
  • RTE (Recognizing Textual Entailment) — dataset รวมเกี่ยวกับความสัมพันธ์เชิงตรรกะระหว่างข้อความ ที่รวบรวมจากชุดข้อมูลขนาดเล็กหลายชุด งานคือการจำแนกประเภทแบบไบนารีของความสัมพันธ์ระหว่างประโยค
  • WNLI (Winograd NLI) — เวอร์ชันที่ดัดแปลงของ Winograd schema ที่ปรับให้เข้ากับรูปแบบ NLI งานแก้ปัญหาการอ้างอิง (anaphora resolution): ระบบได้รับประโยคที่มีสรรพนามที่กำกวม และต้องระบุว่าสรรพนามนั้นอ้างถึงวัตถุใดในสองวัตถุ

วิธีการประเมิน

สำหรับการประเมินบน GLUE นักวิจัยจะส่งการทำนายของโมเดลไปยังเซิร์ฟเวอร์เฉพาะ จากนั้นจะได้รับการคำนวณตัวชี้วัดอัตโนมัติสำหรับแต่ละงานและคะแนนรวม

  • GLUE-score — คะแนนสุดท้ายที่คำนวณเป็นค่าเฉลี่ยของผลลัพธ์จากงานหลักทั้งเก้างาน
  • ลีดเดอร์บอร์ด — ตารางสาธารณะที่แสดงสถานะปัจจุบันและบ่งชี้ว่าโมเดลใดทำงาน NLU ได้ดีกว่า การใช้ชุดทดสอบที่ซ่อนอยู่ช่วยให้การเปรียบเทียบเป็นไปอย่างยุติธรรม
  • ชุดวิเคราะห์เชิงวินิจฉัย — ชุดพิเศษที่ประกอบด้วยตัวอย่าง 1,100 รายการที่ผู้เชี่ยวชาญอธิบายด้วยตนเองสำหรับการวิเคราะห์ทางภาษาเชิงละเอียด ชุดนี้ไม่ส่งผลต่อการจัดอันดับ แต่ทำหน้าที่เป็นเครื่องมือวิเคราะห์เชิงคุณภาพเพื่อตรวจสอบว่าโมเดลสามารถจดจำปรากฏการณ์ทางภาษาใดได้ (ความหมายศัพท์, ตรรกะ, สามัญสำนึก) และพบความยากลำบากกับอะไร[1]

ผลลัพธ์และผลกระทบต่ออุตสาหกรรม

เมื่อเปิดตัว GLUE ในปี ค.ศ. 2018 โมเดลที่ดีที่สุดในขณะนั้น (เช่น BiLSTM ที่มี ELMo) ทำคะแนนรวมได้ประมาณ 70 คะแนน (ในระดับ 0–100) ซึ่งต่ำกว่าระดับมนุษย์อย่างมีนัยสำคัญ (ประมาณ 87 คะแนน)[2]

การปรากฏตัวของ GLUE และลีดเดอร์บอร์ดแบบเปิดกระตุ้นให้เกิดความก้าวหน้าอย่างรวดเร็วในด้าน transfer learning ใน NLP

  • ภายในเดือนพฤษภาคม ค.ศ. 2019 ซึ่งเป็นเวลาน้อยกว่าหนึ่งปี โมเดลรุ่นใหม่ที่อิงจาก transformer (โดยเฉพาะอย่างยิ่ง BERT) ได้ยกระดับ state-of-the-art ขึ้นเป็น 83.9 คะแนน
  • ในช่วงครึ่งหลังของปี ค.ศ. 2019 benchmark GLUE ถูก «ผ่าน» ไปอย่างแท้จริง: ระบบที่ดีที่สุดเข้าใกล้ระดับมนุษย์อย่างมาก และในบางงานก็เหนือกว่าด้วยซ้ำ[3]

GLUE มีบทบาทสำคัญอย่างยิ่งในฐานะ จุดอ้างอิงเดียว ในการพัฒนาโมเดลความเข้าใจภาษา ด้วย GLUE นักวิจัยสามารถเปรียบเทียบสถาปัตยกรรมต่างๆ โดยตรงบนชุดงานที่ครอบคลุม ระบุจุดแข็งและจุดอ่อนของแนวทางต่างๆ และแบ่งปันความสำเร็จได้อย่างรวดเร็วผ่านลีดเดอร์บอร์ดสาธารณะ

SuperGLUE: พัฒนาการในภายหลัง

ความสำเร็จอย่างรวดเร็วของ GLUE นำไปสู่การที่ภายในเวลาเพียงหนึ่งปี ทีมผู้เขียนชุดเดิมร่วมกับเพื่อนร่วมงานจาก Facebook AI ได้เปิดตัวชุดทดสอบใหม่ที่ยากยิ่งขึ้นในชื่อ SuperGLUE[4]

SuperGLUE ถูกประกาศในช่วงปลายปี ค.ศ. 2019 ในฐานะชุดทดสอบที่ «ยึดแน่นกว่า» (stickier) ที่มุ่งสร้างช่องว่างระหว่างความสามารถของโมเดลสมัยใหม่กับมนุษย์อีกครั้ง ชุดนี้รวมถึงงานแปดงานที่ต้องการความเข้าใจภาษาในระดับที่ลึกยิ่งขึ้น พร้อมด้วยเครื่องมือและกฎระเบียบสำหรับผู้เข้าร่วมที่ปรับปรุงแล้ว แม้ว่า GLUE ยังคงถูกใช้เป็นการทดสอบพื้นฐาน แต่จุดสนใจหลักในการแข่งขันพัฒนาได้เปลี่ยนไปสู่ SuperGLUE และ benchmark เฉพาะทางอื่นๆ ที่มีความซับซ้อนมากขึ้น

ลิงก์ภายนอก

  • เว็บไซต์อย่างเป็นทางการของ GLUE Benchmark
  • หน้า GLUE บน Papers With Code พร้อมผลลัพธ์ของโมเดล

บรรณานุกรม

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

หมายเหตุ

  1. 1.0 1.1 1.2 Wang, A. et al. «GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding». arXiv:1804.07461, 2019. [1]
  2. Bowman, S. R. et al. «Human vs. Muppet: A Conservative Estimate of Human Performance on the GLUE Benchmark». arXiv:1905.10425, 2019. [2]
  3. Wang, A. et al. «SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems». NeurIPS 2019. [3]
  4. «AI models from Microsoft and Google already surpass human performance on the SuperGLUE language benchmark». VentureBeat. [4]