LLM benchmarks — เกณฑ์มาตรฐาน LLM

From Systems analysis Wiki
Jump to navigation Jump to search

เกณฑ์มาตรฐาน (benchmark) ของโมเดลภาษาขนาดใหญ่ — คือชุดทดสอบที่ได้มาตรฐาน ซึ่งออกแบบมาเพื่อวัด เปรียบเทียบ และประเมินคุณภาพและความสามารถของโมเดลภาษาขนาดใหญ่ (LLM)[1] โดยทั่วไป benchmark แต่ละชุดจะประกอบด้วยชุดงานที่กำหนดตายตัว (เช่น คำถาม ข้อความ หรือคำสั่ง) ซึ่งทราบคำตอบที่ถูกต้องหรือเกณฑ์การประเมินไว้ล่วงหน้า แนวทางนี้ช่วยให้เปรียบเทียบโมเดลต่าง ๆ ได้อย่างเป็นกลางในเงื่อนไขเดียวกัน ทำให้สามารถติดตามความก้าวหน้าในสาขานี้และระบุจุดแข็งจุดอ่อนของโมเดลได้[2]

การใช้ benchmark อย่างสม่ำเสมอมีบทบาทสำคัญในการพัฒนา LLM โดยกระตุ้นให้นักพัฒนาปรับปรุงโมเดลและสร้างความโปร่งใสและความสามารถในการเปรียบเทียบผลลัพธ์ภายในชุมชนวิทยาศาสตร์ วิวัฒนาการของ benchmark สะท้อนให้เห็นพัฒนาการของ LLM เอง ตั้งแต่งานด้านความเข้าใจภาษาอย่างง่ายไปจนถึงการทดสอบที่ซับซ้อนซึ่งตรวจสอบการให้เหตุผลหลายขั้นตอน สามัญสำนึก จริยธรรม และความปลอดภัย[3]

หมวดหมู่หลักและตัวอย่าง

Benchmark ของ LLM ครอบคลุมทักษะและสาขาการประยุกต์ใช้ที่หลากหลาย ด้านล่างนี้จะกล่าวถึงหมวดหมู่หลักและชุดงานที่เป็นที่รู้จักมากที่สุดในแต่ละหมวด

ความเข้าใจภาษาทั่วไป

หมวดหมู่นี้ประเมินความสามารถพื้นฐานของโมเดลในการทำความเข้าใจและตีความภาษาธรรมชาติ

  • GLUE (General Language Understanding Evaluation, 2019) — หนึ่งใน benchmark แบบครบวงจรชุดแรก ๆ ที่ประกอบด้วยงานหลากหลายประเภท ตั้งแต่การตรวจจับอารมณ์ความรู้สึกไปจนถึงการประเมินความสอดคล้องเชิงตรรกะของข้อความ ผลลัพธ์จากงานทั้งหมดจะถูกรวมเป็นคะแนนเดียว ทำให้สามารถเปรียบเทียบโมเดลยุคแรก ๆ ตามประสิทธิภาพโดยรวมได้[4]
  • SuperGLUE (2019) — ผู้สืบทอดที่ "เข้มข้นขึ้น" ของ GLUE ซึ่งพัฒนาขึ้นเพื่อรับมือกับการที่โมเดลต่าง ๆ บรรลุระดับใกล้เคียงมนุษย์บน GLUE ได้อย่างรวดเร็ว SuperGLUE ประกอบด้วยงานที่ยากขึ้น ซึ่งต้องการความเข้าใจบริบทในเชิงลึกและความสามารถในการสรุปความ[5]
  • WinoGrande (2019) — รูปแบบที่ขยายจากปริศนา Winograd Schema ประกอบด้วยงาน 44,000 ข้อสำหรับการแก้ไขความกำกวมของสรรพนามในประโยคที่ต้องใช้สามัญสำนึกในการเลือกการตีความที่ถูกต้อง[6]

Benchmark แบบหลายงานและแบบครบวงจร

ชุดทดสอบเหล่านี้ตรวจสอบโมเดลในช่วงกว้างของความรู้และทักษะ โดยก้าวข้ามขอบเขตของงานทางภาษาศาสตร์ล้วน ๆ

  • MMLU (Massive Multitask Language Understanding, 2020) — ชุดงานในรูปแบบแบบทดสอบที่ครอบคลุม 57 สาขาวิชา ตั้งแต่วิชาระดับโรงเรียนไปจนถึงความรู้เฉพาะทางระดับวิชาชีพ (นิติศาสตร์ การแพทย์) MMLU วัดความกว้างของความรู้รอบด้านของโมเดล[7]
  • BIG-bench (Beyond the Imitation Game Benchmark, 2022) — benchmark แบบร่วมมือที่ใหญ่ที่สุดในช่วงเวลาที่สร้างขึ้น โดยพัฒนาโดยผู้เขียนมากกว่า 400 คน ประกอบด้วยงานมากกว่า 200 รายการในหัวข้อที่หลากหลาย ตั้งแต่ภาษาศาสตร์ไปจนถึงฟิสิกส์ เพื่อทดสอบโมเดลนอกเหนือจากการจับคู่รูปแบบ และเปิดเผยข้อจำกัดของโมเดลในสถานการณ์ที่ไม่เป็นมาตรฐาน[8]

สามัญสำนึกและความน่าเชื่อถือ

Benchmark เหล่านี้ประเมินความสามารถของโมเดลในการสรุปความเชิงตรรกะเกี่ยวกับสถานการณ์ในชีวิตประจำวันและหลีกเลี่ยงการเผยแพร่ข้อมูลเท็จ

  • HellaSwag (2019) — ทดสอบสามัญสำนึกผ่านงานเลือกการต่อเนื้อหาที่น่าเชื่อถือที่สุดสำหรับคำอธิบายสถานการณ์ ลักษณะพิเศษของ benchmark นี้คือการมี "กับดัก": คำตอบผิดถูกสร้างขึ้นโดยอัตโนมัติและดูสมจริงมาก ซึ่งต้องการให้โมเดลมีความเข้าใจบริบทในเชิงลึก[9]
  • TruthfulQA (2021) — วัดแนวโน้มของโมเดลในการเผยแพร่ตำนานและความเชื่อผิด ๆ ที่แพร่หลาย ประกอบด้วยคำถามที่คำตอบที่นิยมบนอินเทอร์เน็ตนั้นผิด (เช่น "วัคซีนทำให้เกิดออทิซึมหรือไม่?") โมเดลต้องไม่ยอมรับแบบแผนเท็จและให้คำตอบที่ถูกต้องตามข้อเท็จจริง[10]

โจทย์คณิตศาสตร์

  • GSM8K (2021) — ประกอบด้วยโจทย์คณิตศาสตร์แบบอธิบายความหลายพันข้อในระดับชั้นประถมศึกษา แต่ละโจทย์ต้องการการดำเนินการตามลำดับ 2–8 ขั้นตอนทางเลขคณิตเพื่อให้ได้คำตอบ ซึ่งทดสอบความสามารถของโมเดลในการให้เหตุผลหลายขั้นตอน[11]
  • MATH (2021) — ชุดงานที่ยากขึ้น ประกอบด้วยโจทย์จากการแข่งขันและโอลิมปิกคณิตศาสตร์ ครอบคลุมเนื้อหาพีชคณิต เรขาคณิต และทฤษฎีจำนวน ซึ่งต้องการให้โมเดลมีความเชี่ยวชาญในวิธีการแก้ปัญหาที่ไม่ธรรมดา[12]

การสร้างโค้ดโปรแกรม

  • HumanEval (2021) — การทดสอบมาตรฐานสำหรับประเมินความสามารถของ LLM ในการเขียนโค้ด ประกอบด้วยงานการเขียนโปรแกรม 164 ข้อ ซึ่งโมเดลต้องสร้างโค้ด Python ที่ถูกต้องตามคำอธิบายที่กำหนด ความถูกต้องจะถูกประเมินด้วย unit test[13]
  • SWE-bench (2023) — benchmark ที่สมจริงยิ่งขึ้น โดยรวบรวมคำอธิบายปัญหาจริง (issues) จาก GitHub โมเดลต้องสร้าง patch (ส่วนของโค้ด) ที่แก้ไขปัญหาดังกล่าว ซึ่งต้องการความเข้าใจโค้ดของผู้อื่นจำนวนมากและการให้เหตุผลแบบขั้นตอนที่ซับซ้อน[14]

การประเมินโมเดลสนทนา

  • Chatbot Arena (2024) — แพลตฟอร์มออนไลน์แบบเปิดที่โมเดลนิรนามสองตัวเข้าร่วมในการสนทนาคู่กับผู้ใช้ หลังจากการสนทนา ผู้ใช้จะโหวตว่าคำตอบของใครดีกว่า จากการ "ดวล" หลายพันครั้ง จะได้คะแนน Elo ตามความชอบของผู้ใช้ ซึ่งสะท้อนคุณภาพของโมเดลในการสนทนาจริง[15]
  • MT-Bench (2023) — benchmark แบบอัตโนมัติสำหรับการทดสอบความเครียดของทักษะการสนทนา ประกอบด้วยคู่คำถาม 80 คู่ที่จำลองการสนทนาหลายรอบ คำตอบของโมเดลจะถูกประเมินโดย LLM ตัวอื่นที่มีประสิทธิภาพสูงกว่า ("LLM-as-a-judge" เช่น GPT-4) ตามเกณฑ์ที่กำหนดไว้ล่วงหน้า[16]

ความปลอดภัยและความน่าเชื่อถือ

  • AgentHarm (2024) — benchmark ที่ประเมินแนวโน้มของ LLM agent ในการดำเนินการตามคำสั่งที่เป็นอันตราย ประกอบด้วย 110 สถานการณ์ที่แสดงถึงงานที่มีเจตนาร้าย (ตั้งแต่การฉ้อโกงไปจนถึงอาชญากรรมทางไซเบอร์) โมเดลที่ดีควรปฏิเสธการดำเนินการตามคำขอเหล่านั้น[17]
  • SafetyBench (2023) — ชุดงานกว้างที่มีคำถามมากกว่า 11,000 ข้อ ตรวจสอบว่าโมเดลหลีกเลี่ยงการสร้างเนื้อหาที่ไม่เหมาะสมและคำแนะนำที่เป็นอันตรายได้อย่างสม่ำเสมอเพียงใด รวมถึงการตอบสนองต่อคำขอที่ยั่วยุ[18]

ข้อจำกัดและปัญหาที่เกิดขึ้นในปัจจุบัน

  • การปนเปื้อนของข้อมูล: ภัยคุกคามหลักต่อความน่าเชื่อถือของการประเมิน — การรั่วไหลของข้อมูลทดสอบไปยังชุดข้อมูลการฝึก โมเดลอาจจำคำตอบได้ ซึ่งทำให้ผลลัพธ์ถูกบวมเกินจริงอย่างไม่เป็นธรรมชาติ[2]
  • การอิ่มตัวของ benchmark: เมื่อโมเดลพัฒนาขึ้น ประสิทธิภาพบน benchmark เก่า (เช่น GLUE) จะถึงเพดาน และการทดสอบก็ไม่เป็นประโยชน์ในการแยกแยะโมเดลใหม่ที่มีประสิทธิภาพสูงกว่าอีกต่อไป สิ่งนี้ต้องการการพัฒนาเกณฑ์มาตรฐานที่ซับซ้อนยิ่งขึ้นอย่างต่อเนื่อง[2]
  • ช่องว่างกับความเป็นจริง: ผลลัพธ์ที่สูงบน benchmark ไม่ได้รับประกันการทำงานที่เชื่อถือได้ของโมเดลในสถานการณ์จริงที่ไม่มีโครงสร้างเสมอไป สภาพแวดล้อมจริงมักมีความหลากหลายและคาดเดาไม่ได้มากกว่าชุดงานที่กำหนดตายตัวใด ๆ[1]

ลิงก์ภายนอก

  • Open LLM Leaderboard — อันดับโมเดลแบบเปิดจากชุมชน Hugging Face
  • Chatbot Arena Leaderboard — อันดับโมเดลสนทนาตามความชอบของผู้ใช้

หมายเหตุ

  1. 1.0 1.1 «What Are LLM Benchmarks?». IBM. [1]
  2. 2.0 2.1 2.2 «20 LLM evaluation benchmarks and how they work». Evidently AI. [2]
  3. Wang, Alex; Singh, Amanpreet; Michael, Julian; et al. «GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding». arXiv. [4]
  4. Wang, Alex; Pruksachatkun, Yada; Nangia, Nikita; et al. «SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems». arXiv. [5]
  5. Sakaguchi, Keisuke; Le Bras, Ronan; Bhagavatula, Chandra; Choi, Yejin. «WinoGrande: An Adversarial Winograd Schema Challenge at Scale». arXiv. [6]
  6. Hendrycks, Dan; Burns, Collin; Basart, Steven; et al. «Measuring Massive Multitask Language Understanding». arXiv. [7]
  7. Srivastava, Aarohi; et al. «Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models». arXiv. [8]
  8. Zellers, Rowan; Holtzman, Ari; Bisk, Yonatan; et al. «HellaSwag: Can a Machine Really Finish Your Sentence?». arXiv. [9]
  9. Lin, Stephanie; Hilton, Jacob; Evans, Owain. «TruthfulQA: Measuring How Models Mimic Human Falsehoods». arXiv. [10]
  10. Cobbe, Karl; Kosaraju, Vineet; Bavarian, Mohammad; et al. «Training Verifiers to Solve Math Word Problems». arXiv. [11]
  11. Hendrycks, Dan; Burns, Collin; Saund, Saurav; et al. «Measuring Mathematical Problem Solving With the MATH Dataset». arXiv. [12]
  12. Chen, Mark; Tworek, Jerry; Jun, Heewoo; et al. «Evaluating Large Language Models Trained on Code». arXiv. [13]
  13. Jimenez, Carlos E.; et al. «SWE-bench: Can Language Models Resolve Real-World GitHub Issues?». arXiv. [14]
  14. Chiang, Wei-Lin; et al. «Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preferences». lmsys.org. [15]
  15. Zheng, Lianmin; et al. «Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena». arXiv. [16]
  16. Andriushchenko, Maksym; et al. «AgentHarm: A Benchmark for Asessing Agentic AI Harm». arXiv. [17]
  17. Zhang, Zhexin; et al. «SafetyBench: A Comprehensive Benchmark for Evaluating the Safety of Large Language Models». arXiv. [18]