LLM quality metrics — เมตริกคุณภาพ LLM
เมตริกคุณภาพของโมเดลภาษาขนาดใหญ่ (LLM) — คือแนวทางเชิงระบบและชุดเครื่องมือมาตรฐานสำหรับวัดประสิทธิภาพของโมเดลภาษาในด้านต่าง ๆ ครอบคลุมความแม่นยำ ความปลอดภัย ความเป็นธรรม และความน่าเชื่อถือ[1] เมื่อ LLM ถูกนำไปใช้งานอย่างแพร่หลายมากขึ้นในด้านที่มีความสำคัญเชิงวิกฤต เช่น การดูแลสุขภาพ การเงิน และการศึกษา จึงเกิดความจำเป็นเร่งด่วนในการประเมินแบบองค์รวมและเป็นกลาง[2]
เมตริกและ benchmark ทำหน้าที่สำคัญหลายประการ ได้แก่ ช่วยให้เปรียบเทียบโมเดลต่าง ๆ ได้อย่างเป็นกลาง ติดตามความก้าวหน้าในการพัฒนา ระบุจุดอ่อน และสร้างความโปร่งใสในผลลัพธ์สำหรับนักวิจัยและผู้ปฏิบัติงาน[1]
หมวดหมู่ของเมตริก
เมตริกสำหรับประเมิน LLM สามารถแบ่งออกได้เป็นหลายหมวดหมู่หลัก ได้แก่ เมตริกอัตโนมัติ การประเมินโดยมนุษย์ และเมตริกเฉพาะทางสำหรับประเมินความปลอดภัยและความน่าเชื่อถือ
เมตริกอัตโนมัติ
เมตริกเหล่านี้ช่วยให้ประเมินได้อย่างรวดเร็วและปรับขนาดได้โดยไม่ต้องอาศัยมนุษย์
เมตริกบนพื้นฐาน n-gram
เมตริกดั้งเดิมที่วัดความตรงกันของคำศัพท์ระหว่างข้อความที่สร้างขึ้นกับข้อความอ้างอิง
- BLEU (Bilingual Evaluation Understudy): พัฒนาขึ้นในตอนแรกเพื่อประเมินคุณภาพของการแปลด้วยเครื่อง วัดความแม่นยำของการตรงกันของ n-gram (ลำดับของ n คำ) และใช้บทลงโทษสำหรับข้อความที่สร้างขึ้นซึ่งสั้นเกินไป[3]
- ROUGE (Recall-Oriented Understudy for Gisting Evaluation): มุ่งเน้นที่ความครบถ้วน โดยวัดว่า n-gram จากข้อความอ้างอิงปรากฏอยู่ในข้อความที่สร้างขึ้นได้ดีเพียงใด มีประสิทธิภาพเป็นพิเศษสำหรับประเมินงานสรุปความ[3]
- METEOR: ขยายความสามารถของ BLEU โดยคำนึงถึงคำพ้องความหมาย คำที่มีรากศัพท์เดียวกัน และรูปแบบทางสัณฐานวิทยา ซึ่งช่วยให้สอดคล้องกับการประเมินของมนุษย์ได้ดียิ่งขึ้น[3]
เมตริกเชิงความหมาย
เมตริกเหล่านี้ใช้ embedding ตามบริบทเพื่อประเมินความใกล้เคียงทางความหมาย ไม่ใช่เพียงแค่การตรงกันของคำศัพท์
- BERTScore: คำนวณความคล้ายคลึงทางความหมายระหว่าง token ของข้อความที่สร้างขึ้นและข้อความอ้างอิง โดยใช้ embedding จากโมเดล BERT ซึ่งช่วยให้จดจำความเท่าเทียมกันทางความหมายได้แม้จะมีการใช้ถ้อยคำที่แตกต่างกัน[4]
- MAUVE: วัดความแตกต่างระหว่างการกระจายตัวของข้อความที่สร้างโดยเครื่องและข้อความของมนุษย์ในปริภูมิ embedding มีประสิทธิภาพเป็นพิเศษสำหรับประเมินการสร้างข้อความแบบเปิด ซึ่งไม่มีข้อความอ้างอิงที่ตายตัว[5]
เมตริกภายในของการสร้างแบบจำลองภาษา
- Perplexity (ค่าความสับสน): เมตริกพื้นฐานที่วัดว่าโมเดลภาษาทำนายลำดับข้อความได้ดีเพียงใด สะท้อนถึงความไม่แน่ใจของโมเดลในการทำนาย token ถัดไป ค่า Perplexity ที่ต่ำกว่าบ่งชี้ถึงประสิทธิภาพที่ดีกว่า[6]
- ความแม่นยำและค่า F1: ใช้กันอย่างแพร่หลายในงานจำแนกประเภทและระบบถาม-ตอบ ค่า F1 คือค่าเฉลี่ยฮาร์มอนิกระหว่างความแม่นยำและความครบถ้วน ซึ่งให้การประเมินที่สมดุล[6]
การประเมินโดยมนุษย์
การประเมินโดยมนุษย์ยังคงเป็น "มาตรฐานทอง" เนื่องจากเมตริกอัตโนมัติมักไม่สามารถจับแง่มุมละเอียดอ่อนของคุณภาพ เช่น ความสอดคล้อง ความสร้างสรรค์ และความเกี่ยวข้อง[7]
- การประเมินโดยตรง: ผู้เชี่ยวชาญหรือผู้ประเมินจาก crowdsource ให้คะแนนคุณภาพของการสร้างข้อความตามมาตราส่วนที่กำหนด (เช่น 1 ถึง 5) ตามเกณฑ์ต่าง ๆ เช่น ความคล่องแคล่วและความสอดคล้อง
- การประเมินเชิงเปรียบเทียบ: ผู้ประเมินได้รับการขอให้เปรียบเทียบผลลัพธ์จากโมเดลสองตัวขึ้นไปและเลือกตัวที่ดีกว่า (การเปรียบเทียบแบบคู่) หรือจัดลำดับจากดีที่สุดไปยังแย่ที่สุด
ข้อเสียของการประเมินโดยมนุษย์ ได้แก่ ต้นทุนสูง ขยายขนาดได้ยาก และความเป็นอัตวิสัย[7]
การประเมินด้วย LLM (LLM-as-a-Judge)
แนวทางใหม่ที่ใช้โมเดลภาษาตัวหนึ่ง (โดยปกติมีประสิทธิภาพสูงกว่า) เพื่อประเมินคำตอบของโมเดลอื่น ตัวอย่างเช่น GPT-4 สามารถจัดลำดับผลลัพธ์ของโมเดลต่าง ๆ ตามเกณฑ์ที่กำหนด วิธีนี้ให้ทางเลือกที่ปรับขนาดได้สำหรับการประเมินโดยมนุษย์ แม้ว่าจะมีความท้าทายบางประการ เช่น ความอ่อนไหวต่อรูปแบบของ prompt และอคติที่อาจเกิดขึ้น[8]
เมตริกและ benchmark เฉพาะทาง
สำหรับการประเมินแง่มุมเฉพาะของประสิทธิภาพและความน่าเชื่อถือของ LLM จะใช้เมตริกและ benchmark เฉพาะทาง
ความน่าเชื่อถือเชิงข้อเท็จจริง
ประเมินความสามารถของโมเดลในการสร้างข้อมูลที่เป็นความจริงและไม่เกิดการ hallucination
- TruthfulQA: benchmark ที่ออกแบบมาโดยเฉพาะเพื่อวัดแนวโน้มของโมเดลในการสร้างคำตอบที่อิงจากความเชื่อผิด ๆ และความเข้าใจผิดที่แพร่หลาย โดยกำหนดให้โมเดลให้คำตอบที่ถูกต้องตามข้อเท็จจริง ไม่ใช่แค่คำตอบที่นิยม[9]
ความปลอดภัยและจริยธรรม
- การประเมินความเป็นพิษ: วัดการปรากฏของเนื้อหาที่ไม่เหมาะสมหรือเป็นอันตราย โดยใช้ตัวจำแนกประเภทเฉพาะทางและ API เช่น Perspective API[9]
- การประเมินอคติและความเป็นธรรม: ประเมินว่าโมเดลแสดงพฤติกรรมเลือกปฏิบัติต่อกลุ่มประชากรต่าง ๆ หรือไม่ การวิจัยแสดงให้เห็นว่า LLM อาจคงและขยายอคติทางสังคมจาก dataset ที่ใช้ฝึกอบรม[10]
- SafetyBench: benchmark ครอบคลุมสำหรับประเมินความปลอดภัย รวมถึงการตรวจสอบความทนทานต่อการโจมตีแบบ adversarial และความสามารถในการหลีกเลี่ยงการสร้างเนื้อหาที่เป็นอันตราย[11]
Benchmark ครอบคลุม
- MMLU (Massive Multitask Language Understanding): หนึ่งใน benchmark ที่ใช้กันอย่างแพร่หลายที่สุด ประกอบด้วยคำถามแบบเลือกตอบใน 57 วิชา ตั้งแต่คณิตศาสตร์พื้นฐานไปจนถึงกฎหมายระหว่างประเทศ ประเมินความกว้างและความลึกของความรู้ของโมเดล[12]
- BIG-bench (Beyond the Imitation Game): ประกอบด้วยงานมากกว่า 204 รายการที่ออกแบบมาเพื่อประเมินความสามารถที่อยู่นอกเหนือขีดความสามารถของโมเดลภาษามาตรฐาน รวมถึงงานตั้งแต่การเล่นหมากรุกไปจนถึงการทายอิโมจิ[12]
ความท้าทายและข้อจำกัด
- ปัญหาความสัมพันธ์: เมตริกอัตโนมัติดั้งเดิม เช่น BLEU และ ROUGE มักมีความสัมพันธ์กับการประเมินของมนุษย์ต่ำ โดยเฉพาะในงานสร้างสรรค์[13]
- การปนเปื้อนของข้อมูล (Data Contamination): มีความเสี่ยงที่ข้อมูลทดสอบของ benchmark อาจรวมอยู่ใน dataset ฝึกอบรมของโมเดล ซึ่งนำไปสู่การประเมินที่สูงเกินจริงและไม่น่าเชื่อถือ[14]
- การประเมินหลายภาษา: เมตริกและ benchmark ที่มีอยู่ส่วนใหญ่มุ่งเน้นที่ภาษาอังกฤษ ซึ่งจำกัดการนำไปใช้ในการประเมินความสามารถหลายภาษาของ LLM[15]
อ้างอิง
- What Are LLM Benchmarks? — บทความภาพรวมจาก IBM
- 20 LLM evaluation benchmarks and how they work — คู่มือ benchmark จาก Evidently AI
วรรณกรรม
- Papineni, K. et al. (2002). Bleu: a Method for Automatic Evaluation of Machine Translation. ACL:P02-1040.
- Lin, C.-Y. (2004). ROUGE: A Package for Automatic Evaluation of Summaries. ACL:W04-1013.
- Banerjee, S.; Lavie, A. (2005). METEOR: An Automatic Metric for MT Evaluation with Improved Correlation with Human Judgments. ACL:W05-0909.
- Zhang, T. et al. (2019). BERTScore: Evaluating Text Generation with BERT. arXiv:1904.09675.
- Pillutla, K. et al. (2021). MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers. arXiv:2102.01454.
- Lin, S. et al. (2021). TruthfulQA: Measuring How Models Mimic Human Falsehoods. arXiv:2109.07958.
- Parrish, A. et al. (2021). BBQ: A Hand-Built Bias Benchmark for Question Answering. arXiv:2110.08193.
- Dhamala, J. et al. (2021). BOLD: Dataset and Metrics for Measuring Biases in Open-Ended Language Generation. arXiv:2101.11718.
- Hendrycks, D. et al. (2020). Measuring Massive Multitask Language Understanding. arXiv:2009.03300.
- Srivastava, A. et al. (2022). Beyond the Imitation Game: Quantifying and Extrapolating the Capabilities of Language Models. arXiv:2206.04615.
- Zhang, Z. et al. (2023). SafetyBench: Evaluating the Safety of Large Language Models. arXiv:2309.07045.
- Huang, H. et al. (2024). An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-Tuned Judge Model is not a General Substitute for GPT-4. arXiv:2403.02839.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Gu, J. et al. (2024). A Survey on LLM-as-a-Judge. arXiv:2411.15594.
- Li, S. et al. (2025). LLMs Cannot Reliably Judge (Yet?): A Comprehensive Assessment on the Robustness of LLM-as-a-Judge. arXiv:2506.09443.
หมายเหตุ
- ↑ 1.0 1.1 «Метрики качества LLM». Perplexity AI.
- ↑ «Специализированные метрики безопасности». Perplexity AI.
- ↑ 3.0 3.1 3.2 «Традиционные метрики оценки текста». Perplexity AI.
- ↑ «Семантические метрики». Perplexity AI.
- ↑ «Метрики на основе распределений». Perplexity AI.
- ↑ 6.0 6.1 «Intrinsic метрики». Perplexity AI.
- ↑ 7.0 7.1 «Оценка с участием человека». Perplexity AI.
- ↑ «LLM-as-a-Judge». Perplexity AI.
- ↑ 9.0 9.1 «Специализированные метрики безопасности». Perplexity AI.
- ↑ «Предвзятость и справедливость». Perplexity AI.
- ↑ «Benchmark'ы безопасности». Perplexity AI.
- ↑ 12.0 12.1 «Comprehensive оценка». Perplexity AI.
- ↑ «Проблемы корреляции». Perplexity AI.
- ↑ «Загрязнение данных». Perplexity AI.
- ↑ «Многоязычная оценка». Perplexity AI.