Perplexity (metric) — الحيرة

From Systems analysis Wiki
Jump to navigation Jump to search

الحيرة (بالإنجليزية: Perplexity، وتختصر PPL) في نظرية المعلومات وتعلم الآلة هي مقياس لعدم اليقين أو «المفاجأة» لنموذج لغوي عند توقعه عينة من النص. تشير الحيرة المنخفضة إلى أن التوزيع الاحتمالي للنموذج يتوافق جيدًا مع بيانات الاختبار، بينما تعني الحيرة المرتفعة أن النموذج يتنبأ بالتسلسل بشكل سيء[1].

رسميًا، تُعرَّف حيرة التوزيع الاحتمالي بأنها القوة الأسية للإنتروبي الخاص به. بالنسبة لتوزيع احتمالي متقطع p(x)، فإنها تساوي 2H(p)، حيث H(p) هي الإنتروبي[2]. بشكل حدسي، يمكن فهم الحيرة على أنها العدد «الفعال» للخيارات التي يختار النموذج من بينها في كل خطوة. إذا كانت الحيرة تساوي 100، فهذا يعني أن عدم اليقين في النموذج يعادل الاختيار من بين 100 نتيجة متساوية في الاحتمال[3].

طُرح المصطلح لأول مرة في عام 1977 من قبل مجموعة من الباحثين في IBM بقيادة فريدريك جيلينيك في سياق التعرف الإحصائي على الكلام لقياس «صعوبة» المهمة كميًا[4].

Perplexity in language models - الحيرة في النماذج اللغوية

في مجال معالجة اللغات الطبيعية (NLP)، أصبحت الحيرة مقياسًا داخليًا (intrinsic) قياسيًا لـتقييم جودة النماذج اللغوية. وهي تقيس مدى جودة تنبؤ النموذج بتسلسل الكلمات أو الرموز (tokens) في مجموعة بيانات اختبار.

Formal definition - التعريف الرسمي

بالنسبة لمتن اختباري W=w1w2wN ونموذج لغوي q، تُحسب الحيرة كمتوسط هندسي عكسي لاحتمالية متن الاختبار، مُسوَّاة (normalized) بعدد الكلمات: PP(W,q)=(i=1N1q(wiw1,,wi1))1/N

هذه الصيغة تعادل القوة الأسية للإنتروبي المتقاطع، أو متوسط الخسارة اللوغاريتمية السالبة (negative log-likelihood): PP(W,q)=exp(1Ni=1Nlogq(wiالسياق))

تقليل الحيرة يعادل تعظيم الأرجحية للنموذج على بيانات الاختبار. وبالتالي، يُعتبر النموذج ذو الحيرة الأقل أكثر دقة من الناحية الإحصائية[5].

Historical application and modern LLMs - التطبيق التاريخي ونماذج اللغة الكبيرة الحديثة

تاريخيًا، استُخدمت الحيرة على نطاق واسع لتقييم نماذج n-gram الإحصائية. على سبيل المثال، بالنسبة لمتن Wall Street Journal، يبلغ مقياس الحيرة لنموذج أحادي (unigram model)، الذي يأخذ في الاعتبار ترددات الكلمات فقط، حوالي 962، بينما يبلغ حوالي 109 لنموذج ثلاثي (trigram model)، الذي يأخذ في الاعتبار سياق الكلمتين السابقتين[6]. هذا الانخفاض الحاد يوضح مدى قدرة النموذج الأفضل على التقاط الأنماط اللغوية.

مع تطور نماذج اللغة الكبيرة (LLM)، حافظت الحيرة على دورها كمعيار أساسي. يقدم الباحثون تقارير عن الحيرة في مجموعات الاختبار القياسية (مثل WikiText) كمؤشر على «سلاسة» النموذج. على سبيل المثال، في ورقة OpenAI حول GPT-2، ذُكر أن النموذج الذي يحتوي على حوالي 117 مليون مُعلَمة يحقق حيرة تبلغ حوالي 37 على متن WikiText-103[7]. يرتبط انخفاض الحيرة عادةً بتحسن جودة النموذج، لذا يعمل المقياس كمؤشر مناسب للتقدم أثناء التدريب والتحسين.

Limitations and interpretation of the metric - قيود المقياس وتفسيره

على الرغم من أن الحيرة المنخفضة تشير إلى أرجحية عالية للبيانات وفقًا للنموذج، إلا أن هذا المؤشر له عدد من القيود الكبيرة ولا يرتبط دائمًا بالجودة الفعلية للنص المُولَّد.

  • حيرة منخفضة ≠ جودة عالية. تقيس الحيرة ثقة النموذج في توقعاته، ولكن ليس صحتها. قد يكون النموذج واثقًا ومخطئًا في نفس الوقت، حيث يولد نصًا لا معنى له ولكنه محتمل إحصائيًا (على سبيل المثال، عن طريق تكرار كلمات وعبارات شائعة جدًا)[3].
  • الحساسية للبيانات والترميز. الحيرة غير مناسبة للمقارنة المباشرة بين النماذج ذات البنى المختلفة أو المفردات أو طرق الترميز المختلفة. على سبيل المثال، قد تكون الحيرة لنموذج يعتمد على الحروف (character-level model) أقل عدديًا من نموذج يعتمد على الكلمات (word-level model)، لكن هذا لا يعني أنه أفضل في حل المهام اللغوية[3].
  • عدم القدرة على تقييم الدلالة والسياق الطويل. الحيرة مقياس محلي يقيم توقع الرمز التالي. وهي ترتبط بشكل ضعيف بقدرة النموذج على التقاط التبعيات طويلة المدى والسياق الدلالي عبر مسافات كبيرة. أظهرت دراسة أجريت عام 2023 (Hu et al.) أن قدرة نماذج اللغة الكبيرة على فهم النصوص الطويلة (حتى 100 ألف رمز) لا تنعكس عمليًا في مقياس الحيرة[8].
  • إمكانية التلاعب. يمكن «خداع» المقياس. فالنموذج الذي يعاني من فرط التخصيص (overfitting) سيُظهر حيرة منخفضة بشكل مصطنع على البيانات التي «حفظها». كما أظهرت الأبحاث (Wang et al., 2022) أن تكرار أجزاء من النص أو حتى عدم وجود نقطة في نهاية الجملة يمكن أن يقلل أو يزيد من الحيرة بشكل غير مبرر، دون التأثير على الجودة الفعلية للنص[9].

Conclusion: The role of perplexity today - الخلاصة: دور الحيرة اليوم

مع الأخذ في الاعتبار هذه القيود، تُعتبر الحيرة في الممارسة الحديثة مؤشرًا مساعدًا وأوليًا لجودة النموذج اللغوي. لا تزال أداة قيمة للتقييم السريع وتصحيح أخطاء النماذج، لأنها لا تعتمد على مهمة تطبيقية محددة وسهلة الحساب[3].

ومع ذلك، لتقييم نماذج اللغة الكبيرة بشكل كامل، لا تكفي الحيرة وحدها. اليوم، تُستكمل دائمًا بمقاييس خارجية (extrinsic) مرتبطة بمهام محددة، مثل:

  • دقة الإجابات على الأسئلة؛
  • التقييم البشري (human evaluation
  • مقاييس BLEU/ROUGE للترجمة الآلية والتلخيص.

بالاقتران مع هذه الأساليب، تواصل الحيرة أداء دور مهم، حيث تعمل كمقياس موضوعي لـ«مفاجأة» النموذج، ولكن يتم دائمًا تفسير نتائجها مع مراعاة القيود المذكورة[3].

روابط خارجية

المراجع

  • Jelinek, F., Bahl, L. R., & Mercer, R. L. (1977). Perplexity — a Measure of the Difficulty of Speech Recognition Tasks. JASA:62(S1):S63.
  • Jurafsky, D., & Martin, J. H. (2021). Speech and Language Processing (3rd ed., Chapter 3: N-gram Language Models). PDF.
  • Radford, A. et al. (2019). Language Models are Unsupervised Multitask Learners. OpenAI white paper.
  • Brown, T. B. et al. (2020). Language Models are Few-Shot Learners. arXiv:2005.14165.
  • Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
  • Wang, C. et al. (2022). Perplexity by PLM Is Unreliable for Evaluating Text Quality. arXiv:2210.05892.
  • Meister, C., & Cotterell, R. (2021). Language Model Evaluation Beyond Perplexity. arXiv:2106.00085.
  • Hu, Y. et al. (2024). Can Perplexity Reflect Large Language Model's Ability in Long Text Understanding?. arXiv:2405.06105.
  • Lazaridou, A. et al. (2021). Mind the Gap: Assessing Temporal Generalization in Neural Language Models. NeurIPS 2021.

ملاحظات

  1. «Перплексия». Википедия. [١]
  2. «Perplexity». Wikipedia. [٢]
  3. 3.0 3.1 3.2 3.3 3.4 Morgan, Abby. «Perplexity for LLM Evaluation». Comet AI Blog, 21 Nov 2024. [٣]
  4. «README.md · evaluate-measurement/perplexity». Hugging Face. [٤]
  5. Jurafsky, Dan, and James H. Martin. Speech and Language Processing, 3rd ed., Chapter 3: N-gram Language Models, draft (2021). [٥]
  6. Jurafsky, Dan, and James H. Martin. Speech and Language Processing, 3rd ed., Chapter 3: N-gram Language Models, draft (2021). [٦]
  7. «Perplexity number of wikitext-103 on gpt-2 don't match the paper». GitHub, huggingface/transformers, Issue #483. [٧]
  8. Hu, H., et al. «Can Perplexity Reflect Large Language Model's Ability in Long Text Understanding?». arXiv:2405.06105 [cs.CL], 10 May 2024. [٨]
  9. Wang, C., et al. «Perplexity by PLM Is Unreliable for Evaluating Text Quality». arXiv:2210.05892 [cs.CL], 12 Oct. 2022. [٩]