---
title: "Perplexity (metric) (TH)"
source: "https://systems-analysis.info/int/Perplexity_(metric)_(TH)"
wiki: "systems-analysis.info/int"
article: "Perplexity_(metric)_(TH)"
language: "th"
categories:
  - "Category:Large language models"
  - "Category:LLM evaluation"
  - "Category:Machine learning"
  - "Category:Thai"
revision_id: 5536
wiki_created_at: 2026-09-06T23:50:41Z
wiki_modified_at: 2026-09-06T23:50:41Z
downloaded_at: 2026-09-07T23:08:59Z
---

# Perplexity (metric) (TH)

**เพอร์เพล็กซิตี** (อังกฤษ: *Perplexity*, PPL) ในทฤษฎีสารสนเทศและ Machine Learning คือการวัดความไม่แน่นอนหรือ «ความประหลาดใจ» ของโมเดลภาษาในการทำนายตัวอย่างข้อความ เพอร์เพล็กซิตีต่ำบ่งชี้ว่าการกระจายความน่าจะเป็นของโมเดลสอดคล้องกับข้อมูลทดสอบเป็นอย่างดี ขณะที่เพอร์เพล็กซิตีสูงหมายความว่าโมเดลทำนายลำดับได้ไม่ดี<sup>[\[1\]](https://systems-analysis.info/int/Perplexity_(metric)_(TH)#cite_note-ru_wiki-1)</sup>

ในเชิงทางการ เพอร์เพล็กซิตีของการกระจายความน่าจะเป็นนิยามเป็นเลขชี้กำลังของเอนโทรปีของมัน สำหรับการกระจายแบบไม่ต่อเนื่อง $p(x)$ มีค่าเท่ากับ $2^{H(p)}$ โดยที่ $H(p)$ คือเอนโทรปี<sup>[\[2\]](https://systems-analysis.info/int/Perplexity_(metric)_(TH)#cite_note-en_wiki-2)</sup> โดยสัญชาตญาณ เพอร์เพล็กซิตีสามารถเข้าใจได้ว่าเป็นจำนวน «ตัวเลือกที่มีประสิทธิภาพ» ที่โมเดลเลือกในแต่ละขั้นตอน หากเพอร์เพล็กซิตีเท่ากับ 100 หมายความว่าความไม่แน่นอนของโมเดลเทียบเท่ากับการเลือกหนึ่งในผลลัพธ์ที่มีความน่าจะเป็นเท่ากัน 100 แบบ<sup>[\[3\]](https://systems-analysis.info/int/Perplexity_(metric)_(TH)#cite_note-comet_eval-3)</sup>

คำศัพท์นี้ถูกนำเสนอเป็นครั้งแรกในปี ค.ศ. 1977 โดยกลุ่มนักวิจัยจาก IBM ภายใต้การนำของ Frederick Jelinek ในบริบทของการรู้จำเสียงพูดทางสถิติ เพื่อวัดปริมาณ «ความยากง่าย» ของงาน<sup>[\[4\]](https://systems-analysis.info/int/Perplexity_(metric)_(TH)#cite_note-readme_jelinek-4)</sup>

## เพอร์เพล็กซิตีในโมเดลภาษา

ในสาขาการประมวลผลภาษาธรรมชาติ (NLP) เพอร์เพล็กซิตีได้กลายเป็นเมตริกภายใน (*intrinsic*) มาตรฐานสำหรับการประเมินคุณภาพของโมเดลภาษา โดยวัดว่าโมเดลทำนายลำดับของคำหรือ token ในชุดข้อมูลทดสอบได้ดีเพียงใด

### นิยามเชิงทางการ

สำหรับคลังข้อมูลทดสอบ $W = w_{1}w_{2}\ldots w_{N}$ และโมเดลภาษา $q$ เพอร์เพล็กซิตีคำนวณเป็นค่าผกผันของค่าเฉลี่ยเรขาคณิตของความน่าจะเป็นของคลังข้อมูลทดสอบ ซึ่งปรับมาตรฐานตามจำนวนคำ: $\text{PP}(W,q) = \left( \prod\limits_{i = 1}^{N}\frac{1}{q(w_{i} \mid w_{1},\ldots,w_{i - 1})} \right)^{1/N}$

สูตรนี้เทียบเท่ากับเลขชี้กำลังของ cross-entropy หรือค่าเฉลี่ยของ logarithmic loss (*negative log-likelihood*): $\text{PP}(W,q) = \exp\left( - \frac{1}{N}\sum\limits_{i = 1}^{N}\log q(w_{i} \mid \text{контекст}) \right)$

**การลดเพอร์เพล็กซิตีให้น้อยที่สุด** เทียบเท่ากับ **การเพิ่ม likelihood สูงสุด** ของโมเดลบนข้อมูลทดสอบ ดังนั้นโมเดลที่มีเพอร์เพล็กซิตีต่ำกว่าจึงถือว่ามีความถูกต้องทางสถิติมากกว่า<sup>[\[5\]](https://systems-analysis.info/int/Perplexity_(metric)_(TH)#cite_note-stanford_slp-5)</sup>

### การใช้งานในอดีตและ LLM สมัยใหม่

ในอดีต เพอร์เพล็กซิตีถูกใช้อย่างแพร่หลายสำหรับการประเมินโมเดล n-gram ทางสถิติ ตัวอย่างเช่น สำหรับคลังข้อมูล *Wall Street Journal* โมเดล unigram (ที่พิจารณาเฉพาะความถี่ของคำ) มีเพอร์เพล็กซิตีประมาณ ~962 ในขณะที่โมเดล trigram (ที่พิจารณาบริบทจากสองคำก่อนหน้า) มีเพอร์เพล็กซิตีประมาณ 109<sup>[\[6\]](https://systems-analysis.info/int/Perplexity_(metric)_(TH)#cite_note-jurafsky_slp3-6)</sup> การลดลงอย่างชัดเจนนี้แสดงให้เห็นว่าโมเดลสามารถจับรูปแบบทางภาษาได้ดีขึ้นเพียงใด

ด้วยการพัฒนาของโมเดลภาษาขนาดใหญ่ (LLM) เพอร์เพล็กซิตียังคงรักษาบทบาทเป็นตัวชี้วัดพื้นฐาน นักวิจัยรายงานเพอร์เพล็กซิตีบนชุดข้อมูลทดสอบมาตรฐาน (เช่น WikiText) เป็นตัวบ่งชี้ «ความลื่นไหล» ของโมเดล ตัวอย่างเช่น บทความของ OpenAI เกี่ยวกับ GPT-2 ระบุว่าโมเดลที่มีพารามิเตอร์ประมาณ ~117 ล้านตัวบรรลุเพอร์เพล็กซิตีประมาณ 37 บนคลังข้อมูล WikiText-103<sup>[\[7\]](https://systems-analysis.info/int/Perplexity_(metric)_(TH)#cite_note-gpt2_issue-7)</sup> การลดลงของเพอร์เพล็กซิตีมักสัมพันธ์กับการปรับปรุงคุณภาพของโมเดล ดังนั้นเมตริกนี้จึงใช้เป็นตัวบ่งชี้ความก้าวหน้าที่สะดวกในระหว่างการฝึกและการปรับแต่ง

## ข้อจำกัดและการตีความเมตริก

แม้ว่าเพอร์เพล็กซิตีต่ำจะบ่งชี้ถึง likelihood สูงของข้อมูลตามโมเดล แต่ตัวชี้วัดนี้มีข้อจำกัดที่สำคัญหลายประการและไม่ได้สัมพันธ์กับคุณภาพที่แท้จริงของข้อความที่สร้างขึ้นเสมอไป

- **เพอร์เพล็กซิตีต่ำ ≠ คุณภาพสูง**. เพอร์เพล็กซิตีวัด *ความมั่นใจ* ของโมเดลในการทำนาย ไม่ใช่ *ความถูกต้อง* ของการทำนาย โมเดลอาจมั่นใจแต่ผิดพลาด โดยสร้างข้อความที่ไม่มีความหมายแต่มีความน่าจะเป็นทางสถิติ (เช่น การซ้ำคำและวลีที่พบบ่อยมาก)<sup>[\[3\]](https://systems-analysis.info/int/Perplexity_(metric)_(TH)#cite_note-comet_eval-3)</sup>
- **ความไวต่อข้อมูลและ tokenization**. เพอร์เพล็กซิตี**ไม่เหมาะสำหรับการเปรียบเทียบโดยตรงระหว่างโมเดล**ที่มีสถาปัตยกรรม คลังคำศัพท์ หรือวิธีการแบ่ง token ที่แตกต่างกัน ตัวอย่างเช่น โมเดลระดับตัวอักษรอาจมีเพอร์เพล็กซิตีต่ำกว่าโมเดลระดับคำในเชิงตัวเลข แต่ไม่ได้หมายความว่ามันแก้ปัญหาทางภาษาได้ดีกว่า<sup>[\[3\]](https://systems-analysis.info/int/Perplexity_(metric)_(TH)#cite_note-comet_eval-3)</sup>
- **ไม่สามารถประเมิน semantics และบริบทระยะยาวได้**. เพอร์เพล็กซิตีเป็นเมตริกเชิงท้องถิ่นที่ประเมินการทำนาย token ถัดไป มีความสัมพันธ์น้อยกับความสามารถของโมเดลในการจับการพึ่งพาระยะยาวและบริบทเชิงความหมายในระยะไกล การศึกษาในปี ค.ศ. 2023 (Hu et al.) แสดงให้เห็นว่าความสามารถของ LLM ในการเข้าใจข้อความยาว (สูงสุด 100,000 token) แทบไม่ปรากฏในเมตริกเพอร์เพล็กซิตี<sup>[\[8\]](https://systems-analysis.info/int/Perplexity_(metric)_(TH)#cite_note-hu_long_context-8)</sup>
- **ความเป็นไปได้ในการบิดเบือน**. เมตริกนี้สามารถถูก «หลอก» ได้ โมเดลที่ถูก overfit จะแสดงเพอร์เพล็กซิตีต่ำอย่างไม่เป็นธรรมชาติบนข้อมูลที่มัน «จำ» มา การวิจัย (Wang et al., 2022) ยังแสดงให้เห็นว่าการซ้ำข้อความบางส่วนหรือแม้แต่การขาดจุดท้ายประโยคอาจลดหรือเพิ่มเพอร์เพล็กซิตีโดยไม่สมเหตุสมผล โดยไม่ส่งผลต่อคุณภาพที่แท้จริงของข้อความ<sup>[\[9\]](https://systems-analysis.info/int/Perplexity_(metric)_(TH)#cite_note-wang_unreliable-9)</sup>

## บทสรุป: บทบาทของเพอร์เพล็กซิตีในปัจจุบัน

เมื่อคำนึงถึงข้อจำกัดที่ระบุไว้ข้างต้น ในทางปฏิบัติสมัยใหม่ เพอร์เพล็กซิตีถูกมองว่าเป็น**ตัวชี้วัดเสริมและเบื้องต้น**ของคุณภาพโมเดลภาษา มันยังคงเป็นเครื่องมือที่มีคุณค่าสำหรับการประเมินและการดีบักโมเดลอย่างรวดเร็ว เนื่องจากไม่ขึ้นอยู่กับงานประยุกต์เฉพาะและคำนวณได้ง่าย<sup>[\[3\]](https://systems-analysis.info/int/Perplexity_(metric)_(TH)#cite_note-comet_eval-3)</sup>

อย่างไรก็ตาม สำหรับการประเมิน LLM อย่างสมบูรณ์ เพอร์เพล็กซิตีเพียงอย่างเดียวไม่เพียงพอ ในปัจจุบันต้องเสริมด้วยเมตริกภายนอก (*extrinsic*) ที่เชื่อมโยงกับงานเฉพาะ เช่น:

- ความถูกต้องของการตอบคำถาม;
- การประเมินโดยมนุษย์ (*human evaluation*);
- BLEU/ROUGE สำหรับการแปลภาษาด้วยเครื่องและการสรุปความ

ร่วมกับวิธีการเหล่านี้ เพอร์เพล็กซิตียังคงทำหน้าที่สำคัญ — เป็นการวัดเชิงวัตถุของ «ความประหลาดใจ» ของโมเดล แต่ผลลัพธ์ของมันจะถูกตีความโดยคำนึงถึงข้อจำกัดที่ได้กล่าวถึงเสมอ<sup>[\[3\]](https://systems-analysis.info/int/Perplexity_(metric)_(TH)#cite_note-comet_eval-3)</sup>

## อ้างอิง

- บทความ «เพอร์เพล็กซิตีในโมเดลภาษา» บน Habr
- เอกสารของ Hugging Face เกี่ยวกับการคำนวณเพอร์เพล็กซิตี

## บรรณานุกรม

- Jelinek, F., Bahl, L. R., & Mercer, R. L. (1977). *Perplexity — a Measure of the Difficulty of Speech Recognition Tasks*. JASA:62(S1):S63.
- Jurafsky, D., & Martin, J. H. (2021). *Speech and Language Processing* (พิมพ์ครั้งที่ 3, บทที่ 3: N-gram Language Models). PDF.
- Radford, A. et al. (2019). *Language Models are Unsupervised Multitask Learners*. OpenAI white paper.
- Brown, T. B. et al. (2020). *Language Models are Few-Shot Learners*. arXiv:2005.14165.
- Kaplan, J. et al. (2020). *Scaling Laws for Neural Language Models*. arXiv:2001.08361.
- Wang, C. et al. (2022). *Perplexity by PLM Is Unreliable for Evaluating Text Quality*. arXiv:2210.05892.
- Meister, C., & Cotterell, R. (2021). *Language Model Evaluation Beyond Perplexity*. arXiv:2106.00085.
- Hu, Y. et al. (2024). *Can Perplexity Reflect Large Language Model's Ability in Long Text Understanding?*. arXiv:2405.06105.
- Lazaridou, A. et al. (2021). *Mind the Gap: Assessing Temporal Generalization in Neural Language Models*. NeurIPS 2021.

## หมายเหตุ

1.  <span id="cite_note-ru_wiki-1">[↑](https://systems-analysis.info/int/Perplexity_(metric)_(TH)#cite_ref-ru_wiki_1-0) «Перплексия». *Википедия*. <a href="https://ru.wikipedia.org/wiki/Перплексия" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-en_wiki-2">[↑](https://systems-analysis.info/int/Perplexity_(metric)_(TH)#cite_ref-en_wiki_2-0) «Perplexity». *Wikipedia*. <a href="https://en.wikipedia.org/wiki/Perplexity" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-comet_eval-3">↑ <sup>[3.0](https://systems-analysis.info/int/Perplexity_(metric)_(TH)#cite_ref-comet_eval_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/Perplexity_(metric)_(TH)#cite_ref-comet_eval_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/Perplexity_(metric)_(TH)#cite_ref-comet_eval_3-2)</sup> <sup>[3.3](https://systems-analysis.info/int/Perplexity_(metric)_(TH)#cite_ref-comet_eval_3-3)</sup> <sup>[3.4](https://systems-analysis.info/int/Perplexity_(metric)_(TH)#cite_ref-comet_eval_3-4)</sup> Morgan, Abby. «Perplexity for LLM Evaluation». *Comet AI Blog*, 21 Nov 2024. <a href="https://www.comet.com/site/blog/perplexity-for-llm-evaluation/" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-readme_jelinek-4">[↑](https://systems-analysis.info/int/Perplexity_(metric)_(TH)#cite_ref-readme_jelinek_4-0) «README.md · evaluate-measurement/perplexity». *Hugging Face*. <a href="https://huggingface.co/spaces/evaluate-measurement/perplexity/blob/c4de5d6dae834c200992d54151402b80b6b46494/README.md" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-stanford_slp-5">[↑](https://systems-analysis.info/int/Perplexity_(metric)_(TH)#cite_ref-stanford_slp_5-0) Jurafsky, Dan, and James H. Martin. *Speech and Language Processing*, 3rd ed., Chapter 3: N-gram Language Models, draft (2021). <a href="https://web.stanford.edu/~jurafsky/slp3/3.pdf" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-jurafsky_slp3-6">[↑](https://systems-analysis.info/int/Perplexity_(metric)_(TH)#cite_ref-jurafsky_slp3_6-0) Jurafsky, Dan, and James H. Martin. *Speech and Language Processing*, 3rd ed., Chapter 3: N-gram Language Models, draft (2021). <a href="https://web.stanford.edu/~jurafsky/slp3/3.pdf" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-gpt2_issue-7">[↑](https://systems-analysis.info/int/Perplexity_(metric)_(TH)#cite_ref-gpt2_issue_7-0) «Perplexity number of wikitext-103 on gpt-2 don't match the paper». *GitHub, huggingface/transformers, Issue \#483*. <a href="https://github.com/huggingface/transformers/issues/483" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-hu_long_context-8">[↑](https://systems-analysis.info/int/Perplexity_(metric)_(TH)#cite_ref-hu_long_context_8-0) Hu, H., et al. «Can Perplexity Reflect Large Language Model's Ability in Long Text Understanding?». *arXiv:2405.06105* \[cs.CL\], 10 мая 2024 г. <a href="https://ar5iv.labs.arxiv.org/html/2405.06105" class="external autonumber" rel="nofollow">[8]</a></span>
9.  <span id="cite_note-wang_unreliable-9">[↑](https://systems-analysis.info/int/Perplexity_(metric)_(TH)#cite_ref-wang_unreliable_9-0) Wang, C., et al. «Perplexity by PLM Is Unreliable for Evaluating Text Quality». *arXiv:2210.05892* \[cs.CL\], 12 окт. 2022 г. <a href="https://ar5iv.labs.arxiv.org/html/2210.05892" class="external autonumber" rel="nofollow">[9]</a></span>
