LLM evaluation — การประเมิน LLM

From Systems analysis Wiki
Jump to navigation Jump to search

การประเมินโมเดลภาษาขนาดใหญ่ (LLM) — เป็นสาขาวิชาในด้านปัญญาประดิษฐ์ที่ให้วิธีการมาตรฐานสำหรับการวัดความสามารถ ข้อจำกัด และความเสี่ยงของโมเดลภาษา[1] เมื่อ LLM ได้รับการผสานรวมเข้ากับภาคส่วนสำคัญ เช่น การดูแลสุขภาพและการเงิน การประเมินผลอย่างเป็นกลางจึงมีความจำเป็นเพื่อรับประกันความปลอดภัย ความน่าเชื่อถือ และความเป็นธรรม[2]

การประเมิน LLM ทำหน้าที่พื้นฐานหลายประการ:

  • การวัดความสามารถ: การเปรียบเทียบประสิทธิภาพของโมเดลต่าง ๆ อย่างเป็นกลางบนงานที่เป็นมาตรฐาน
  • การติดตามความก้าวหน้า: การบันทึกความสำเร็จและการระบุพื้นที่ที่ต้องการการพัฒนาเพิ่มเติม
  • การลดความเสี่ยง: การระบุผลลัพธ์ที่อาจเป็นอันตราย เช่น อคติ การเกิด hallucination และปัญหาด้านความปลอดภัย
  • การให้ข้อมูลแก่นักพัฒนาและผู้ใช้: การจัดเตรียมข้อมูลที่โปร่งใสสำหรับการเลือกโมเดลที่เหมาะสมที่สุดสำหรับแอปพลิเคชันเฉพาะ

แนวทางและวิธีการหลัก

การประเมิน LLM สมัยใหม่เริ่มต้นด้วยการปรากฏของ benchmark ที่ครอบคลุม เช่น GLUE (General Language Understanding Evaluation) ซึ่งกำหนดมาตรฐานสำหรับการประเมินความเข้าใจภาษาโดยทั่วไป[3] เมื่อโมเดลเริ่มแสดงประสิทธิภาพเกินกว่าผลลัพธ์ของมนุษย์บน GLUE จึงได้มีการพัฒนาตัวสืบทอดที่ซับซ้อนยิ่งขึ้น เช่น SuperGLUE[4]

การเปลี่ยนแปลงขั้นพื้นฐานเกิดขึ้นพร้อมกับการนำ benchmark แบบหลายงานมาใช้ เช่น MMLU และ BIG-bench ซึ่งทดสอบโมเดลในขอบเขตความรู้และความสามารถในการใช้เหตุผลที่กว้างขวาง โดยก้าวข้ามกรอบของงานทางภาษาศาสตร์อย่างเดียว[1]

เมตริกและ benchmark หลัก

เมตริกอัตโนมัติ

  • Perplexity (ค่าความสับสน): เมตริกพื้นฐานที่วัดว่าโมเดลทำนายข้อความได้ดีเพียงใด ค่า Perplexity ที่ต่ำกว่าแสดงถึงความมั่นใจของโมเดลในการทำนายที่สูงกว่า
  • BLEU และ ROUGE: เมตริกที่อิงบน n-gram ที่วัดความตรงกันของคำระหว่างข้อความที่สร้างขึ้นและข้อความอ้างอิง BLEU มุ่งเน้นที่ความแม่นยำ ส่วน ROUGE มุ่งเน้นที่ความครบถ้วน[2]
  • BERTScore: เมตริกเชิงความหมายที่ใช้ embedding จาก BERT เพื่อคำนวณความคล้ายคลึงทางความหมาย สามารถตรวจจับการใช้คำพ้องความหมายและการถอดความ ทำให้มีความแม่นยำมากกว่าเมตริกที่อิงบน n-gram[5]

Benchmark เฉพาะทาง

สำหรับการประเมินความสามารถเฉพาะ ได้มีการพัฒนา benchmark เป้าหมาย:

  • การสร้างโค้ด: HumanEval ประเมินความสามารถของโมเดลในการสร้างโค้ดโปรแกรมที่ถูกต้องจากคำอธิบายข้อความ โดยตรวจสอบฟังก์ชันการทำงานด้วย unit test[6]
  • สามัญสำนึก: HellaSwag ทดสอบความเข้าใจของโมเดลเกี่ยวกับโลกทางกายภาพและความสัมพันธ์เชิงเหตุและผล ผ่านการทำนายตอนจบที่เป็นไปได้มากที่สุดของสถานการณ์ในชีวิตประจำวัน[7]
  • ความรู้ทางวิชาการ: MMLU (Massive Multitask Language Understanding) ครอบคลุม 57 วิชา ตั้งแต่คณิตศาสตร์ขั้นพื้นฐานไปจนถึงกฎหมายและการแพทย์ เพื่อทดสอบความกว้างของความรู้ของโมเดล[8]
  • ขีดจำกัดความสามารถ: BIG-bench (Beyond the Imitation Game) เป็นโครงการความร่วมมือที่รวบรวม 204 งาน ซึ่งออกแบบมาเพื่อค้นหาความสามารถเชิง emergent — ทักษะที่ปรากฏขึ้นอย่างฉับพลันเมื่อโมเดลถึงขนาดที่วิกฤต[9]

การประเมินด้านความปลอดภัยและจริยธรรม

  • อคติ: สำหรับการประเมินอคติทางสังคมและประชากรศาสตร์ จะใช้ dataset เช่น BBQ (Bias Benchmark for Question Answering) และ BOLD (Bias in Open-ended Language generation Dataset)
  • ความเป็นพิษ: Benchmark เช่น RealToxicityPrompts ให้คำถามที่กระตุ้นให้เกิดการสร้างเนื้อหาที่เป็นพิษ เพื่อประเมินความทนทานของโมเดล
  • ความทนทาน (Robustness): ประเมินด้วยการโจมตีแบบ adversarial Framework PromptRobust ให้ชุดคำถามที่ครอบคลุมสำหรับทดสอบความทนทานของโมเดลในระดับอักขระ คำ และประโยค

มาตรฐานและ framework สมัยใหม่

  • HELM (Holistic Evaluation of Language Models): โครงการริเริ่มของมหาวิทยาลัย Stanford ที่เสนอวิธีการ "องค์รวม" HELM ประเมินโมเดลในหลายมิติ ได้แก่ ความแม่นยำ ความทนทาน ความเป็นธรรม อคติ ความเป็นพิษ และประสิทธิภาพ[10]
  • ISO/IEC 42001:2023: มาตรฐานสากลฉบับแรกสำหรับระบบการจัดการ AI ซึ่งกำหนดข้อกำหนดสำหรับการกำกับดูแล AI ตลอดวงจรชีวิตทั้งหมด
  • EU AI Act (ระเบียบ EU 2024/1689): กฎระเบียบ AI ที่ครอบคลุมฉบับแรก ซึ่งกำหนดให้มีการประเมินมาตรฐานสำหรับโมเดลวัตถุประสงค์ทั่วไปที่มีความเสี่ยงเชิงระบบ
  • NIST AI Risk Management Framework 1.0: Framework ภาคสมัครใจสำหรับการพัฒนาและการนำ AI ที่น่าเชื่อถือไปใช้ พัฒนาโดยสถาบันมาตรฐานและเทคโนโลยีแห่งชาติของสหรัฐอเมริกา

ปัญหาและข้อจำกัดของวิธีการที่มีอยู่

  • การอิ่มตัวของ benchmark: โมเดลจำนวนมากบรรลุคะแนนใกล้เคียงสมบูรณ์แบบบน benchmark ยอดนิยม ส่งผลให้เกิดปรากฏการณ์ "การไล่ตาม benchmark" เมื่อโมเดลได้รับการปรับให้เหมาะสมสำหรับการทดสอบเฉพาะแทนที่จะเป็นความสามารถโดยทั่วไป
  • การปนเปื้อนของข้อมูล: ปัญหาสำคัญที่ข้อมูลทดสอบของ benchmark หลุดเข้าไปในชุดข้อมูลการฝึกโดยไม่ตั้งใจ ส่งผลให้ผลการประเมินสูงเกินจริงและไม่ยุติธรรม
  • ความสัมพันธ์ต่ำกับการตัดสินของมนุษย์: เมตริกอัตโนมัติ เช่น BLEU และ ROUGE มักมีความสัมพันธ์ต่ำกับการประเมินคุณภาพโดยมนุษย์ โดยเฉพาะในงานสร้างสรรค์และงานปลายเปิด

การวิจัยและแนวโน้มปัจจุบัน

  • กระบวนทัศน์ LLM-as-a-Judge: การใช้ LLM ที่มีประสิทธิภาพสูง (เช่น GPT-4) เป็น "ผู้ตัดสิน" เพื่อประเมินการตอบสนองของโมเดลอื่น วิธีการนี้ให้ทางเลือกที่ขยายขนาดได้แทนการประเมินโดยมนุษย์ที่มีค่าใช้จ่ายสูง
  • การประเมินแบบไดนามิกและปรับตัว: แพลตฟอร์มเช่น LMArena นำเสนอระบบ crowdsourcing พร้อมการจัดอันดับ Elo สำหรับการประเมินโมเดลในสภาพแวดล้อมจริงจากการโต้ตอบกับผู้ใช้ที่มีชีวิต
  • แนวทางผสมผสาน: การรวมเมตริกอัตโนมัติเข้ากับการตัดสินของมนุษย์และการประเมินด้วย LLM เพื่อให้ได้ภาพที่ครอบคลุมและน่าเชื่อถือมากขึ้นของประสิทธิภาพโมเดล

ภูมิทัศน์การประเมิน LLM ยังคงพัฒนาต่อเนื่อง โดยมุ่งไปสู่การสร้าง framework ที่มีหลายมิติ เป็นมาตรฐาน และทำซ้ำได้ ซึ่งคำนึงถึงไม่เพียงแค่ความแม่นยำ แต่ยังรวมถึงแง่มุมทางสังคมและจริยธรรมของการประยุกต์ใช้เทคโนโลยี AI[1]

ลิงก์อ้างอิง

  • Stanford HELM — เว็บไซต์ทางการของโครงการ Holistic Evaluation of Language Models
  • Chatbot Arena — แพลตฟอร์มสำหรับการประเมินเปรียบเทียบ chatbot โดยอิงจากความต้องการของมนุษย์

วรรณกรรม

  • Wang, A. et al. (2018). GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding. arXiv:1804.07461.
  • Zhang, T. et al. (2019). BERTScore: Evaluating Text Generation with BERT. arXiv:1904.09675.
  • Wang, A. et al. (2019). SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems. arXiv:1905.00537.
  • Zellers, R. et al. (2019). HellaSwag: Can a Machine Really Finish Your Sentence?. arXiv:1905.07830.
  • Hendrycks, D. et al. (2020). Measuring Massive Multitask Language Understanding. arXiv:2009.03300.
  • Gehman, S. et al. (2020). RealToxicityPrompts: Evaluating Neural Toxic Degeneration in Language Models. arXiv:2009.11462.
  • Chen, M. et al. (2021). Evaluating Large Language Models Trained on Code. arXiv:2107.03374.
  • Parrish, A. et al. (2021). BBQ: A Hand-Built Bias Benchmark for Question Answering. arXiv:2110.08193.
  • Dhamala, J. et al. (2021). BOLD: Dataset and Metrics for Measuring Biases in Open-Ended Language Generation. arXiv:2101.11718.
  • Srivastava, A. et al. (2022). Beyond the Imitation Game: Quantifying and Extrapolating the Capabilities of Language Models. arXiv:2206.04615.
  • Bommasani, R. et al. (2022). Holistic Evaluation of Language Models. arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Zhuang, Y. et al. (2023). Through the Lens of Core Competency: Survey on Evaluation of Large Language Models. ACL Anthology:2023.ccl-2.8.
  • Zhu, K. et al. (2023). PromptRobust: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts. arXiv:2306.04528.

หมายเหตุ

  1. 1.0 1.1 1.2 Chang, Y., et al. (2023). «A Survey on Evaluation of Large Language Models». arXiv. [1]
  2. 2.0 2.1 Zhuang, Y., et al. (2023). «Through the Lens of Core Competency: Survey on Evaluation of Large Language Models». ACL Anthology. [2]
  3. Wang, A., et al. (2018). «GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding». arXiv.[3]
  4. Kumar, Pradosh. «Understanding Benchmarking in NLP: GLUE, SuperGLUE, HELM, MMLU, and BIG-Bench». Medium.
  5. Zhang, T., et al. (2019). «BERTScore: Evaluating Text Generation with BERT». arXiv.
  6. Chen, M., et al. (2021). «Evaluating Large Language Models Trained on Code». arXiv.
  7. Zellers, R., et al. (2019). «HellaSwag: Can a Machine Really Finish Your Sentence?». arXiv.
  8. Hendrycks, D., et al. (2020). «Measuring Massive Multitask Language Understanding». arXiv.
  9. Srivastava, A., et al. (2022). «Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models». arXiv.
  10. Bommasani, R., et al. (2022). «Holistic Evaluation of Language Models». arXiv. [4]