Perplexity (metric) (TH)

From Systems analysis Wiki
Jump to navigation Jump to search

เพอร์เพล็กซิตี (อังกฤษ: Perplexity, PPL) ในทฤษฎีสารสนเทศและ Machine Learning คือการวัดความไม่แน่นอนหรือ «ความประหลาดใจ» ของโมเดลภาษาในการทำนายตัวอย่างข้อความ เพอร์เพล็กซิตีต่ำบ่งชี้ว่าการกระจายความน่าจะเป็นของโมเดลสอดคล้องกับข้อมูลทดสอบเป็นอย่างดี ขณะที่เพอร์เพล็กซิตีสูงหมายความว่าโมเดลทำนายลำดับได้ไม่ดี[1]

ในเชิงทางการ เพอร์เพล็กซิตีของการกระจายความน่าจะเป็นนิยามเป็นเลขชี้กำลังของเอนโทรปีของมัน สำหรับการกระจายแบบไม่ต่อเนื่อง p(x) มีค่าเท่ากับ 2H(p) โดยที่ H(p) คือเอนโทรปี[2] โดยสัญชาตญาณ เพอร์เพล็กซิตีสามารถเข้าใจได้ว่าเป็นจำนวน «ตัวเลือกที่มีประสิทธิภาพ» ที่โมเดลเลือกในแต่ละขั้นตอน หากเพอร์เพล็กซิตีเท่ากับ 100 หมายความว่าความไม่แน่นอนของโมเดลเทียบเท่ากับการเลือกหนึ่งในผลลัพธ์ที่มีความน่าจะเป็นเท่ากัน 100 แบบ[3]

คำศัพท์นี้ถูกนำเสนอเป็นครั้งแรกในปี ค.ศ. 1977 โดยกลุ่มนักวิจัยจาก IBM ภายใต้การนำของ Frederick Jelinek ในบริบทของการรู้จำเสียงพูดทางสถิติ เพื่อวัดปริมาณ «ความยากง่าย» ของงาน[4]

เพอร์เพล็กซิตีในโมเดลภาษา

ในสาขาการประมวลผลภาษาธรรมชาติ (NLP) เพอร์เพล็กซิตีได้กลายเป็นเมตริกภายใน (intrinsic) มาตรฐานสำหรับการประเมินคุณภาพของโมเดลภาษา โดยวัดว่าโมเดลทำนายลำดับของคำหรือ token ในชุดข้อมูลทดสอบได้ดีเพียงใด

นิยามเชิงทางการ

สำหรับคลังข้อมูลทดสอบ W=w1w2wN และโมเดลภาษา q เพอร์เพล็กซิตีคำนวณเป็นค่าผกผันของค่าเฉลี่ยเรขาคณิตของความน่าจะเป็นของคลังข้อมูลทดสอบ ซึ่งปรับมาตรฐานตามจำนวนคำ: PP(W,q)=(i=1N1q(wiw1,,wi1))1/N

สูตรนี้เทียบเท่ากับเลขชี้กำลังของ cross-entropy หรือค่าเฉลี่ยของ logarithmic loss (negative log-likelihood): PP(W,q)=exp(1Ni=1Nlogq(wiконтекст))

การลดเพอร์เพล็กซิตีให้น้อยที่สุด เทียบเท่ากับ การเพิ่ม likelihood สูงสุด ของโมเดลบนข้อมูลทดสอบ ดังนั้นโมเดลที่มีเพอร์เพล็กซิตีต่ำกว่าจึงถือว่ามีความถูกต้องทางสถิติมากกว่า[5]

การใช้งานในอดีตและ LLM สมัยใหม่

ในอดีต เพอร์เพล็กซิตีถูกใช้อย่างแพร่หลายสำหรับการประเมินโมเดล n-gram ทางสถิติ ตัวอย่างเช่น สำหรับคลังข้อมูล Wall Street Journal โมเดล unigram (ที่พิจารณาเฉพาะความถี่ของคำ) มีเพอร์เพล็กซิตีประมาณ ~962 ในขณะที่โมเดล trigram (ที่พิจารณาบริบทจากสองคำก่อนหน้า) มีเพอร์เพล็กซิตีประมาณ 109[6] การลดลงอย่างชัดเจนนี้แสดงให้เห็นว่าโมเดลสามารถจับรูปแบบทางภาษาได้ดีขึ้นเพียงใด

ด้วยการพัฒนาของโมเดลภาษาขนาดใหญ่ (LLM) เพอร์เพล็กซิตียังคงรักษาบทบาทเป็นตัวชี้วัดพื้นฐาน นักวิจัยรายงานเพอร์เพล็กซิตีบนชุดข้อมูลทดสอบมาตรฐาน (เช่น WikiText) เป็นตัวบ่งชี้ «ความลื่นไหล» ของโมเดล ตัวอย่างเช่น บทความของ OpenAI เกี่ยวกับ GPT-2 ระบุว่าโมเดลที่มีพารามิเตอร์ประมาณ ~117 ล้านตัวบรรลุเพอร์เพล็กซิตีประมาณ 37 บนคลังข้อมูล WikiText-103[7] การลดลงของเพอร์เพล็กซิตีมักสัมพันธ์กับการปรับปรุงคุณภาพของโมเดล ดังนั้นเมตริกนี้จึงใช้เป็นตัวบ่งชี้ความก้าวหน้าที่สะดวกในระหว่างการฝึกและการปรับแต่ง

ข้อจำกัดและการตีความเมตริก

แม้ว่าเพอร์เพล็กซิตีต่ำจะบ่งชี้ถึง likelihood สูงของข้อมูลตามโมเดล แต่ตัวชี้วัดนี้มีข้อจำกัดที่สำคัญหลายประการและไม่ได้สัมพันธ์กับคุณภาพที่แท้จริงของข้อความที่สร้างขึ้นเสมอไป

  • เพอร์เพล็กซิตีต่ำ ≠ คุณภาพสูง. เพอร์เพล็กซิตีวัด ความมั่นใจ ของโมเดลในการทำนาย ไม่ใช่ ความถูกต้อง ของการทำนาย โมเดลอาจมั่นใจแต่ผิดพลาด โดยสร้างข้อความที่ไม่มีความหมายแต่มีความน่าจะเป็นทางสถิติ (เช่น การซ้ำคำและวลีที่พบบ่อยมาก)[3]
  • ความไวต่อข้อมูลและ tokenization. เพอร์เพล็กซิตีไม่เหมาะสำหรับการเปรียบเทียบโดยตรงระหว่างโมเดลที่มีสถาปัตยกรรม คลังคำศัพท์ หรือวิธีการแบ่ง token ที่แตกต่างกัน ตัวอย่างเช่น โมเดลระดับตัวอักษรอาจมีเพอร์เพล็กซิตีต่ำกว่าโมเดลระดับคำในเชิงตัวเลข แต่ไม่ได้หมายความว่ามันแก้ปัญหาทางภาษาได้ดีกว่า[3]
  • ไม่สามารถประเมิน semantics และบริบทระยะยาวได้. เพอร์เพล็กซิตีเป็นเมตริกเชิงท้องถิ่นที่ประเมินการทำนาย token ถัดไป มีความสัมพันธ์น้อยกับความสามารถของโมเดลในการจับการพึ่งพาระยะยาวและบริบทเชิงความหมายในระยะไกล การศึกษาในปี ค.ศ. 2023 (Hu et al.) แสดงให้เห็นว่าความสามารถของ LLM ในการเข้าใจข้อความยาว (สูงสุด 100,000 token) แทบไม่ปรากฏในเมตริกเพอร์เพล็กซิตี[8]
  • ความเป็นไปได้ในการบิดเบือน. เมตริกนี้สามารถถูก «หลอก» ได้ โมเดลที่ถูก overfit จะแสดงเพอร์เพล็กซิตีต่ำอย่างไม่เป็นธรรมชาติบนข้อมูลที่มัน «จำ» มา การวิจัย (Wang et al., 2022) ยังแสดงให้เห็นว่าการซ้ำข้อความบางส่วนหรือแม้แต่การขาดจุดท้ายประโยคอาจลดหรือเพิ่มเพอร์เพล็กซิตีโดยไม่สมเหตุสมผล โดยไม่ส่งผลต่อคุณภาพที่แท้จริงของข้อความ[9]

บทสรุป: บทบาทของเพอร์เพล็กซิตีในปัจจุบัน

เมื่อคำนึงถึงข้อจำกัดที่ระบุไว้ข้างต้น ในทางปฏิบัติสมัยใหม่ เพอร์เพล็กซิตีถูกมองว่าเป็นตัวชี้วัดเสริมและเบื้องต้นของคุณภาพโมเดลภาษา มันยังคงเป็นเครื่องมือที่มีคุณค่าสำหรับการประเมินและการดีบักโมเดลอย่างรวดเร็ว เนื่องจากไม่ขึ้นอยู่กับงานประยุกต์เฉพาะและคำนวณได้ง่าย[3]

อย่างไรก็ตาม สำหรับการประเมิน LLM อย่างสมบูรณ์ เพอร์เพล็กซิตีเพียงอย่างเดียวไม่เพียงพอ ในปัจจุบันต้องเสริมด้วยเมตริกภายนอก (extrinsic) ที่เชื่อมโยงกับงานเฉพาะ เช่น:

  • ความถูกต้องของการตอบคำถาม;
  • การประเมินโดยมนุษย์ (human evaluation);
  • BLEU/ROUGE สำหรับการแปลภาษาด้วยเครื่องและการสรุปความ

ร่วมกับวิธีการเหล่านี้ เพอร์เพล็กซิตียังคงทำหน้าที่สำคัญ — เป็นการวัดเชิงวัตถุของ «ความประหลาดใจ» ของโมเดล แต่ผลลัพธ์ของมันจะถูกตีความโดยคำนึงถึงข้อจำกัดที่ได้กล่าวถึงเสมอ[3]

อ้างอิง

  • บทความ «เพอร์เพล็กซิตีในโมเดลภาษา» บน Habr
  • เอกสารของ Hugging Face เกี่ยวกับการคำนวณเพอร์เพล็กซิตี

บรรณานุกรม

  • Jelinek, F., Bahl, L. R., & Mercer, R. L. (1977). Perplexity — a Measure of the Difficulty of Speech Recognition Tasks. JASA:62(S1):S63.
  • Jurafsky, D., & Martin, J. H. (2021). Speech and Language Processing (พิมพ์ครั้งที่ 3, บทที่ 3: N-gram Language Models). PDF.
  • Radford, A. et al. (2019). Language Models are Unsupervised Multitask Learners. OpenAI white paper.
  • Brown, T. B. et al. (2020). Language Models are Few-Shot Learners. arXiv:2005.14165.
  • Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
  • Wang, C. et al. (2022). Perplexity by PLM Is Unreliable for Evaluating Text Quality. arXiv:2210.05892.
  • Meister, C., & Cotterell, R. (2021). Language Model Evaluation Beyond Perplexity. arXiv:2106.00085.
  • Hu, Y. et al. (2024). Can Perplexity Reflect Large Language Model's Ability in Long Text Understanding?. arXiv:2405.06105.
  • Lazaridou, A. et al. (2021). Mind the Gap: Assessing Temporal Generalization in Neural Language Models. NeurIPS 2021.

หมายเหตุ

  1. «Перплексия». Википедия. [1]
  2. «Perplexity». Wikipedia. [2]
  3. 3.0 3.1 3.2 3.3 3.4 Morgan, Abby. «Perplexity for LLM Evaluation». Comet AI Blog, 21 Nov 2024. [3]
  4. «README.md · evaluate-measurement/perplexity». Hugging Face. [4]
  5. Jurafsky, Dan, and James H. Martin. Speech and Language Processing, 3rd ed., Chapter 3: N-gram Language Models, draft (2021). [5]
  6. Jurafsky, Dan, and James H. Martin. Speech and Language Processing, 3rd ed., Chapter 3: N-gram Language Models, draft (2021). [6]
  7. «Perplexity number of wikitext-103 on gpt-2 don't match the paper». GitHub, huggingface/transformers, Issue #483. [7]
  8. Hu, H., et al. «Can Perplexity Reflect Large Language Model's Ability in Long Text Understanding?». arXiv:2405.06105 [cs.CL], 10 мая 2024 г. [8]
  9. Wang, C., et al. «Perplexity by PLM Is Unreliable for Evaluating Text Quality». arXiv:2210.05892 [cs.CL], 12 окт. 2022 г. [9]