Perplexity (metric) (TH)
เพอร์เพล็กซิตี (อังกฤษ: Perplexity, PPL) ในทฤษฎีสารสนเทศและ Machine Learning คือการวัดความไม่แน่นอนหรือ «ความประหลาดใจ» ของโมเดลภาษาในการทำนายตัวอย่างข้อความ เพอร์เพล็กซิตีต่ำบ่งชี้ว่าการกระจายความน่าจะเป็นของโมเดลสอดคล้องกับข้อมูลทดสอบเป็นอย่างดี ขณะที่เพอร์เพล็กซิตีสูงหมายความว่าโมเดลทำนายลำดับได้ไม่ดี[1]
ในเชิงทางการ เพอร์เพล็กซิตีของการกระจายความน่าจะเป็นนิยามเป็นเลขชี้กำลังของเอนโทรปีของมัน สำหรับการกระจายแบบไม่ต่อเนื่อง มีค่าเท่ากับ โดยที่ คือเอนโทรปี[2] โดยสัญชาตญาณ เพอร์เพล็กซิตีสามารถเข้าใจได้ว่าเป็นจำนวน «ตัวเลือกที่มีประสิทธิภาพ» ที่โมเดลเลือกในแต่ละขั้นตอน หากเพอร์เพล็กซิตีเท่ากับ 100 หมายความว่าความไม่แน่นอนของโมเดลเทียบเท่ากับการเลือกหนึ่งในผลลัพธ์ที่มีความน่าจะเป็นเท่ากัน 100 แบบ[3]
คำศัพท์นี้ถูกนำเสนอเป็นครั้งแรกในปี ค.ศ. 1977 โดยกลุ่มนักวิจัยจาก IBM ภายใต้การนำของ Frederick Jelinek ในบริบทของการรู้จำเสียงพูดทางสถิติ เพื่อวัดปริมาณ «ความยากง่าย» ของงาน[4]
เพอร์เพล็กซิตีในโมเดลภาษา
ในสาขาการประมวลผลภาษาธรรมชาติ (NLP) เพอร์เพล็กซิตีได้กลายเป็นเมตริกภายใน (intrinsic) มาตรฐานสำหรับการประเมินคุณภาพของโมเดลภาษา โดยวัดว่าโมเดลทำนายลำดับของคำหรือ token ในชุดข้อมูลทดสอบได้ดีเพียงใด
นิยามเชิงทางการ
สำหรับคลังข้อมูลทดสอบ และโมเดลภาษา เพอร์เพล็กซิตีคำนวณเป็นค่าผกผันของค่าเฉลี่ยเรขาคณิตของความน่าจะเป็นของคลังข้อมูลทดสอบ ซึ่งปรับมาตรฐานตามจำนวนคำ:
สูตรนี้เทียบเท่ากับเลขชี้กำลังของ cross-entropy หรือค่าเฉลี่ยของ logarithmic loss (negative log-likelihood):
การลดเพอร์เพล็กซิตีให้น้อยที่สุด เทียบเท่ากับ การเพิ่ม likelihood สูงสุด ของโมเดลบนข้อมูลทดสอบ ดังนั้นโมเดลที่มีเพอร์เพล็กซิตีต่ำกว่าจึงถือว่ามีความถูกต้องทางสถิติมากกว่า[5]
การใช้งานในอดีตและ LLM สมัยใหม่
ในอดีต เพอร์เพล็กซิตีถูกใช้อย่างแพร่หลายสำหรับการประเมินโมเดล n-gram ทางสถิติ ตัวอย่างเช่น สำหรับคลังข้อมูล Wall Street Journal โมเดล unigram (ที่พิจารณาเฉพาะความถี่ของคำ) มีเพอร์เพล็กซิตีประมาณ ~962 ในขณะที่โมเดล trigram (ที่พิจารณาบริบทจากสองคำก่อนหน้า) มีเพอร์เพล็กซิตีประมาณ 109[6] การลดลงอย่างชัดเจนนี้แสดงให้เห็นว่าโมเดลสามารถจับรูปแบบทางภาษาได้ดีขึ้นเพียงใด
ด้วยการพัฒนาของโมเดลภาษาขนาดใหญ่ (LLM) เพอร์เพล็กซิตียังคงรักษาบทบาทเป็นตัวชี้วัดพื้นฐาน นักวิจัยรายงานเพอร์เพล็กซิตีบนชุดข้อมูลทดสอบมาตรฐาน (เช่น WikiText) เป็นตัวบ่งชี้ «ความลื่นไหล» ของโมเดล ตัวอย่างเช่น บทความของ OpenAI เกี่ยวกับ GPT-2 ระบุว่าโมเดลที่มีพารามิเตอร์ประมาณ ~117 ล้านตัวบรรลุเพอร์เพล็กซิตีประมาณ 37 บนคลังข้อมูล WikiText-103[7] การลดลงของเพอร์เพล็กซิตีมักสัมพันธ์กับการปรับปรุงคุณภาพของโมเดล ดังนั้นเมตริกนี้จึงใช้เป็นตัวบ่งชี้ความก้าวหน้าที่สะดวกในระหว่างการฝึกและการปรับแต่ง
ข้อจำกัดและการตีความเมตริก
แม้ว่าเพอร์เพล็กซิตีต่ำจะบ่งชี้ถึง likelihood สูงของข้อมูลตามโมเดล แต่ตัวชี้วัดนี้มีข้อจำกัดที่สำคัญหลายประการและไม่ได้สัมพันธ์กับคุณภาพที่แท้จริงของข้อความที่สร้างขึ้นเสมอไป
- เพอร์เพล็กซิตีต่ำ ≠ คุณภาพสูง. เพอร์เพล็กซิตีวัด ความมั่นใจ ของโมเดลในการทำนาย ไม่ใช่ ความถูกต้อง ของการทำนาย โมเดลอาจมั่นใจแต่ผิดพลาด โดยสร้างข้อความที่ไม่มีความหมายแต่มีความน่าจะเป็นทางสถิติ (เช่น การซ้ำคำและวลีที่พบบ่อยมาก)[3]
- ความไวต่อข้อมูลและ tokenization. เพอร์เพล็กซิตีไม่เหมาะสำหรับการเปรียบเทียบโดยตรงระหว่างโมเดลที่มีสถาปัตยกรรม คลังคำศัพท์ หรือวิธีการแบ่ง token ที่แตกต่างกัน ตัวอย่างเช่น โมเดลระดับตัวอักษรอาจมีเพอร์เพล็กซิตีต่ำกว่าโมเดลระดับคำในเชิงตัวเลข แต่ไม่ได้หมายความว่ามันแก้ปัญหาทางภาษาได้ดีกว่า[3]
- ไม่สามารถประเมิน semantics และบริบทระยะยาวได้. เพอร์เพล็กซิตีเป็นเมตริกเชิงท้องถิ่นที่ประเมินการทำนาย token ถัดไป มีความสัมพันธ์น้อยกับความสามารถของโมเดลในการจับการพึ่งพาระยะยาวและบริบทเชิงความหมายในระยะไกล การศึกษาในปี ค.ศ. 2023 (Hu et al.) แสดงให้เห็นว่าความสามารถของ LLM ในการเข้าใจข้อความยาว (สูงสุด 100,000 token) แทบไม่ปรากฏในเมตริกเพอร์เพล็กซิตี[8]
- ความเป็นไปได้ในการบิดเบือน. เมตริกนี้สามารถถูก «หลอก» ได้ โมเดลที่ถูก overfit จะแสดงเพอร์เพล็กซิตีต่ำอย่างไม่เป็นธรรมชาติบนข้อมูลที่มัน «จำ» มา การวิจัย (Wang et al., 2022) ยังแสดงให้เห็นว่าการซ้ำข้อความบางส่วนหรือแม้แต่การขาดจุดท้ายประโยคอาจลดหรือเพิ่มเพอร์เพล็กซิตีโดยไม่สมเหตุสมผล โดยไม่ส่งผลต่อคุณภาพที่แท้จริงของข้อความ[9]
บทสรุป: บทบาทของเพอร์เพล็กซิตีในปัจจุบัน
เมื่อคำนึงถึงข้อจำกัดที่ระบุไว้ข้างต้น ในทางปฏิบัติสมัยใหม่ เพอร์เพล็กซิตีถูกมองว่าเป็นตัวชี้วัดเสริมและเบื้องต้นของคุณภาพโมเดลภาษา มันยังคงเป็นเครื่องมือที่มีคุณค่าสำหรับการประเมินและการดีบักโมเดลอย่างรวดเร็ว เนื่องจากไม่ขึ้นอยู่กับงานประยุกต์เฉพาะและคำนวณได้ง่าย[3]
อย่างไรก็ตาม สำหรับการประเมิน LLM อย่างสมบูรณ์ เพอร์เพล็กซิตีเพียงอย่างเดียวไม่เพียงพอ ในปัจจุบันต้องเสริมด้วยเมตริกภายนอก (extrinsic) ที่เชื่อมโยงกับงานเฉพาะ เช่น:
- ความถูกต้องของการตอบคำถาม;
- การประเมินโดยมนุษย์ (human evaluation);
- BLEU/ROUGE สำหรับการแปลภาษาด้วยเครื่องและการสรุปความ
ร่วมกับวิธีการเหล่านี้ เพอร์เพล็กซิตียังคงทำหน้าที่สำคัญ — เป็นการวัดเชิงวัตถุของ «ความประหลาดใจ» ของโมเดล แต่ผลลัพธ์ของมันจะถูกตีความโดยคำนึงถึงข้อจำกัดที่ได้กล่าวถึงเสมอ[3]
อ้างอิง
- บทความ «เพอร์เพล็กซิตีในโมเดลภาษา» บน Habr
- เอกสารของ Hugging Face เกี่ยวกับการคำนวณเพอร์เพล็กซิตี
บรรณานุกรม
- Jelinek, F., Bahl, L. R., & Mercer, R. L. (1977). Perplexity — a Measure of the Difficulty of Speech Recognition Tasks. JASA:62(S1):S63.
- Jurafsky, D., & Martin, J. H. (2021). Speech and Language Processing (พิมพ์ครั้งที่ 3, บทที่ 3: N-gram Language Models). PDF.
- Radford, A. et al. (2019). Language Models are Unsupervised Multitask Learners. OpenAI white paper.
- Brown, T. B. et al. (2020). Language Models are Few-Shot Learners. arXiv:2005.14165.
- Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
- Wang, C. et al. (2022). Perplexity by PLM Is Unreliable for Evaluating Text Quality. arXiv:2210.05892.
- Meister, C., & Cotterell, R. (2021). Language Model Evaluation Beyond Perplexity. arXiv:2106.00085.
- Hu, Y. et al. (2024). Can Perplexity Reflect Large Language Model's Ability in Long Text Understanding?. arXiv:2405.06105.
- Lazaridou, A. et al. (2021). Mind the Gap: Assessing Temporal Generalization in Neural Language Models. NeurIPS 2021.
หมายเหตุ
- ↑ «Перплексия». Википедия. [1]
- ↑ «Perplexity». Wikipedia. [2]
- ↑ 3.0 3.1 3.2 3.3 3.4 Morgan, Abby. «Perplexity for LLM Evaluation». Comet AI Blog, 21 Nov 2024. [3]
- ↑ «README.md · evaluate-measurement/perplexity». Hugging Face. [4]
- ↑ Jurafsky, Dan, and James H. Martin. Speech and Language Processing, 3rd ed., Chapter 3: N-gram Language Models, draft (2021). [5]
- ↑ Jurafsky, Dan, and James H. Martin. Speech and Language Processing, 3rd ed., Chapter 3: N-gram Language Models, draft (2021). [6]
- ↑ «Perplexity number of wikitext-103 on gpt-2 don't match the paper». GitHub, huggingface/transformers, Issue #483. [7]
- ↑ Hu, H., et al. «Can Perplexity Reflect Large Language Model's Ability in Long Text Understanding?». arXiv:2405.06105 [cs.CL], 10 мая 2024 г. [8]
- ↑ Wang, C., et al. «Perplexity by PLM Is Unreliable for Evaluating Text Quality». arXiv:2210.05892 [cs.CL], 12 окт. 2022 г. [9]