LLM quality metrics — เมตริกคุณภาพ LLM

From Systems analysis Wiki
Jump to navigation Jump to search

เมตริกคุณภาพของโมเดลภาษาขนาดใหญ่ (LLM) — คือแนวทางเชิงระบบและชุดเครื่องมือมาตรฐานสำหรับวัดประสิทธิภาพของโมเดลภาษาในด้านต่าง ๆ ครอบคลุมความแม่นยำ ความปลอดภัย ความเป็นธรรม และความน่าเชื่อถือ[1] เมื่อ LLM ถูกนำไปใช้งานอย่างแพร่หลายมากขึ้นในด้านที่มีความสำคัญเชิงวิกฤต เช่น การดูแลสุขภาพ การเงิน และการศึกษา จึงเกิดความจำเป็นเร่งด่วนในการประเมินแบบองค์รวมและเป็นกลาง[2]

เมตริกและ benchmark ทำหน้าที่สำคัญหลายประการ ได้แก่ ช่วยให้เปรียบเทียบโมเดลต่าง ๆ ได้อย่างเป็นกลาง ติดตามความก้าวหน้าในการพัฒนา ระบุจุดอ่อน และสร้างความโปร่งใสในผลลัพธ์สำหรับนักวิจัยและผู้ปฏิบัติงาน[1]

หมวดหมู่ของเมตริก

เมตริกสำหรับประเมิน LLM สามารถแบ่งออกได้เป็นหลายหมวดหมู่หลัก ได้แก่ เมตริกอัตโนมัติ การประเมินโดยมนุษย์ และเมตริกเฉพาะทางสำหรับประเมินความปลอดภัยและความน่าเชื่อถือ

เมตริกอัตโนมัติ

เมตริกเหล่านี้ช่วยให้ประเมินได้อย่างรวดเร็วและปรับขนาดได้โดยไม่ต้องอาศัยมนุษย์

เมตริกบนพื้นฐาน n-gram

เมตริกดั้งเดิมที่วัดความตรงกันของคำศัพท์ระหว่างข้อความที่สร้างขึ้นกับข้อความอ้างอิง

  • BLEU (Bilingual Evaluation Understudy): พัฒนาขึ้นในตอนแรกเพื่อประเมินคุณภาพของการแปลด้วยเครื่อง วัดความแม่นยำของการตรงกันของ n-gram (ลำดับของ n คำ) และใช้บทลงโทษสำหรับข้อความที่สร้างขึ้นซึ่งสั้นเกินไป[3]
  • ROUGE (Recall-Oriented Understudy for Gisting Evaluation): มุ่งเน้นที่ความครบถ้วน โดยวัดว่า n-gram จากข้อความอ้างอิงปรากฏอยู่ในข้อความที่สร้างขึ้นได้ดีเพียงใด มีประสิทธิภาพเป็นพิเศษสำหรับประเมินงานสรุปความ[3]
  • METEOR: ขยายความสามารถของ BLEU โดยคำนึงถึงคำพ้องความหมาย คำที่มีรากศัพท์เดียวกัน และรูปแบบทางสัณฐานวิทยา ซึ่งช่วยให้สอดคล้องกับการประเมินของมนุษย์ได้ดียิ่งขึ้น[3]

เมตริกเชิงความหมาย

เมตริกเหล่านี้ใช้ embedding ตามบริบทเพื่อประเมินความใกล้เคียงทางความหมาย ไม่ใช่เพียงแค่การตรงกันของคำศัพท์

  • BERTScore: คำนวณความคล้ายคลึงทางความหมายระหว่าง token ของข้อความที่สร้างขึ้นและข้อความอ้างอิง โดยใช้ embedding จากโมเดล BERT ซึ่งช่วยให้จดจำความเท่าเทียมกันทางความหมายได้แม้จะมีการใช้ถ้อยคำที่แตกต่างกัน[4]
  • MAUVE: วัดความแตกต่างระหว่างการกระจายตัวของข้อความที่สร้างโดยเครื่องและข้อความของมนุษย์ในปริภูมิ embedding มีประสิทธิภาพเป็นพิเศษสำหรับประเมินการสร้างข้อความแบบเปิด ซึ่งไม่มีข้อความอ้างอิงที่ตายตัว[5]

เมตริกภายในของการสร้างแบบจำลองภาษา

  • Perplexity (ค่าความสับสน): เมตริกพื้นฐานที่วัดว่าโมเดลภาษาทำนายลำดับข้อความได้ดีเพียงใด สะท้อนถึงความไม่แน่ใจของโมเดลในการทำนาย token ถัดไป ค่า Perplexity ที่ต่ำกว่าบ่งชี้ถึงประสิทธิภาพที่ดีกว่า[6]
  • ความแม่นยำและค่า F1: ใช้กันอย่างแพร่หลายในงานจำแนกประเภทและระบบถาม-ตอบ ค่า F1 คือค่าเฉลี่ยฮาร์มอนิกระหว่างความแม่นยำและความครบถ้วน ซึ่งให้การประเมินที่สมดุล[6]

การประเมินโดยมนุษย์

การประเมินโดยมนุษย์ยังคงเป็น "มาตรฐานทอง" เนื่องจากเมตริกอัตโนมัติมักไม่สามารถจับแง่มุมละเอียดอ่อนของคุณภาพ เช่น ความสอดคล้อง ความสร้างสรรค์ และความเกี่ยวข้อง[7]

  • การประเมินโดยตรง: ผู้เชี่ยวชาญหรือผู้ประเมินจาก crowdsource ให้คะแนนคุณภาพของการสร้างข้อความตามมาตราส่วนที่กำหนด (เช่น 1 ถึง 5) ตามเกณฑ์ต่าง ๆ เช่น ความคล่องแคล่วและความสอดคล้อง
  • การประเมินเชิงเปรียบเทียบ: ผู้ประเมินได้รับการขอให้เปรียบเทียบผลลัพธ์จากโมเดลสองตัวขึ้นไปและเลือกตัวที่ดีกว่า (การเปรียบเทียบแบบคู่) หรือจัดลำดับจากดีที่สุดไปยังแย่ที่สุด

ข้อเสียของการประเมินโดยมนุษย์ ได้แก่ ต้นทุนสูง ขยายขนาดได้ยาก และความเป็นอัตวิสัย[7]

การประเมินด้วย LLM (LLM-as-a-Judge)

แนวทางใหม่ที่ใช้โมเดลภาษาตัวหนึ่ง (โดยปกติมีประสิทธิภาพสูงกว่า) เพื่อประเมินคำตอบของโมเดลอื่น ตัวอย่างเช่น GPT-4 สามารถจัดลำดับผลลัพธ์ของโมเดลต่าง ๆ ตามเกณฑ์ที่กำหนด วิธีนี้ให้ทางเลือกที่ปรับขนาดได้สำหรับการประเมินโดยมนุษย์ แม้ว่าจะมีความท้าทายบางประการ เช่น ความอ่อนไหวต่อรูปแบบของ prompt และอคติที่อาจเกิดขึ้น[8]

เมตริกและ benchmark เฉพาะทาง

สำหรับการประเมินแง่มุมเฉพาะของประสิทธิภาพและความน่าเชื่อถือของ LLM จะใช้เมตริกและ benchmark เฉพาะทาง

ความน่าเชื่อถือเชิงข้อเท็จจริง

ประเมินความสามารถของโมเดลในการสร้างข้อมูลที่เป็นความจริงและไม่เกิดการ hallucination

  • TruthfulQA: benchmark ที่ออกแบบมาโดยเฉพาะเพื่อวัดแนวโน้มของโมเดลในการสร้างคำตอบที่อิงจากความเชื่อผิด ๆ และความเข้าใจผิดที่แพร่หลาย โดยกำหนดให้โมเดลให้คำตอบที่ถูกต้องตามข้อเท็จจริง ไม่ใช่แค่คำตอบที่นิยม[9]

ความปลอดภัยและจริยธรรม

  • การประเมินความเป็นพิษ: วัดการปรากฏของเนื้อหาที่ไม่เหมาะสมหรือเป็นอันตราย โดยใช้ตัวจำแนกประเภทเฉพาะทางและ API เช่น Perspective API[9]
  • การประเมินอคติและความเป็นธรรม: ประเมินว่าโมเดลแสดงพฤติกรรมเลือกปฏิบัติต่อกลุ่มประชากรต่าง ๆ หรือไม่ การวิจัยแสดงให้เห็นว่า LLM อาจคงและขยายอคติทางสังคมจาก dataset ที่ใช้ฝึกอบรม[10]
  • SafetyBench: benchmark ครอบคลุมสำหรับประเมินความปลอดภัย รวมถึงการตรวจสอบความทนทานต่อการโจมตีแบบ adversarial และความสามารถในการหลีกเลี่ยงการสร้างเนื้อหาที่เป็นอันตราย[11]

Benchmark ครอบคลุม

  • MMLU (Massive Multitask Language Understanding): หนึ่งใน benchmark ที่ใช้กันอย่างแพร่หลายที่สุด ประกอบด้วยคำถามแบบเลือกตอบใน 57 วิชา ตั้งแต่คณิตศาสตร์พื้นฐานไปจนถึงกฎหมายระหว่างประเทศ ประเมินความกว้างและความลึกของความรู้ของโมเดล[12]
  • BIG-bench (Beyond the Imitation Game): ประกอบด้วยงานมากกว่า 204 รายการที่ออกแบบมาเพื่อประเมินความสามารถที่อยู่นอกเหนือขีดความสามารถของโมเดลภาษามาตรฐาน รวมถึงงานตั้งแต่การเล่นหมากรุกไปจนถึงการทายอิโมจิ[12]

ความท้าทายและข้อจำกัด

  • ปัญหาความสัมพันธ์: เมตริกอัตโนมัติดั้งเดิม เช่น BLEU และ ROUGE มักมีความสัมพันธ์กับการประเมินของมนุษย์ต่ำ โดยเฉพาะในงานสร้างสรรค์[13]
  • การปนเปื้อนของข้อมูล (Data Contamination): มีความเสี่ยงที่ข้อมูลทดสอบของ benchmark อาจรวมอยู่ใน dataset ฝึกอบรมของโมเดล ซึ่งนำไปสู่การประเมินที่สูงเกินจริงและไม่น่าเชื่อถือ[14]
  • การประเมินหลายภาษา: เมตริกและ benchmark ที่มีอยู่ส่วนใหญ่มุ่งเน้นที่ภาษาอังกฤษ ซึ่งจำกัดการนำไปใช้ในการประเมินความสามารถหลายภาษาของ LLM[15]

อ้างอิง

  • What Are LLM Benchmarks? — บทความภาพรวมจาก IBM
  • 20 LLM evaluation benchmarks and how they work — คู่มือ benchmark จาก Evidently AI

วรรณกรรม

  • Papineni, K. et al. (2002). Bleu: a Method for Automatic Evaluation of Machine Translation. ACL:P02-1040.
  • Lin, C.-Y. (2004). ROUGE: A Package for Automatic Evaluation of Summaries. ACL:W04-1013.
  • Banerjee, S.; Lavie, A. (2005). METEOR: An Automatic Metric for MT Evaluation with Improved Correlation with Human Judgments. ACL:W05-0909.
  • Zhang, T. et al. (2019). BERTScore: Evaluating Text Generation with BERT. arXiv:1904.09675.
  • Pillutla, K. et al. (2021). MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers. arXiv:2102.01454.
  • Lin, S. et al. (2021). TruthfulQA: Measuring How Models Mimic Human Falsehoods. arXiv:2109.07958.
  • Parrish, A. et al. (2021). BBQ: A Hand-Built Bias Benchmark for Question Answering. arXiv:2110.08193.
  • Dhamala, J. et al. (2021). BOLD: Dataset and Metrics for Measuring Biases in Open-Ended Language Generation. arXiv:2101.11718.
  • Hendrycks, D. et al. (2020). Measuring Massive Multitask Language Understanding. arXiv:2009.03300.
  • Srivastava, A. et al. (2022). Beyond the Imitation Game: Quantifying and Extrapolating the Capabilities of Language Models. arXiv:2206.04615.
  • Zhang, Z. et al. (2023). SafetyBench: Evaluating the Safety of Large Language Models. arXiv:2309.07045.
  • Huang, H. et al. (2024). An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-Tuned Judge Model is not a General Substitute for GPT-4. arXiv:2403.02839.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Gu, J. et al. (2024). A Survey on LLM-as-a-Judge. arXiv:2411.15594.
  • Li, S. et al. (2025). LLMs Cannot Reliably Judge (Yet?): A Comprehensive Assessment on the Robustness of LLM-as-a-Judge. arXiv:2506.09443.

หมายเหตุ

  1. 1.0 1.1 «Метрики качества LLM». Perplexity AI.
  2. «Специализированные метрики безопасности». Perplexity AI.
  3. 3.0 3.1 3.2 «Традиционные метрики оценки текста». Perplexity AI.
  4. «Семантические метрики». Perplexity AI.
  5. «Метрики на основе распределений». Perplexity AI.
  6. 6.0 6.1 «Intrinsic метрики». Perplexity AI.
  7. 7.0 7.1 «Оценка с участием человека». Perplexity AI.
  8. «LLM-as-a-Judge». Perplexity AI.
  9. 9.0 9.1 «Специализированные метрики безопасности». Perplexity AI.
  10. «Предвзятость и справедливость». Perplexity AI.
  11. «Benchmark'ы безопасности». Perplexity AI.
  12. 12.0 12.1 «Comprehensive оценка». Perplexity AI.
  13. «Проблемы корреляции». Perplexity AI.
  14. «Загрязнение данных». Perplexity AI.
  15. «Многоязычная оценка». Perplexity AI.