Perplexity (metric) (FA)
پرپلکسیتی (انگلیسی: Perplexity، PPL) در نظریه اطلاعات و machine learning — معیاری از عدم قطعیت یا «شگفتی» یک مدل زبانی هنگام پیشبینی یک نمونه متنی است. پرپلکسیتی پایین نشان میدهد که توزیع احتمالی مدل با دادههای آزمایشی تطابق خوبی دارد، در حالی که پرپلکسیتی بالا بیانگر آن است که مدل دنباله را ضعیف پیشبینی میکند[1].
به صورت رسمی، پرپلکسیتی یک توزیع احتمال به عنوان توان نمایی از آنتروپی آن تعریف میشود. برای یک توزیع گسسته برابر است با ، که در آن آنتروپی است[2]. به صورت شهودی، پرپلکسیتی را میتوان به عنوان تعداد «مؤثر» گزینههایی درک کرد که مدل در هر گام از میان آنها انتخاب میکند. اگر پرپلکسیتی برابر ۱۰۰ باشد، یعنی عدم قطعیت مدل معادل انتخاب یکی از ۱۰۰ نتیجه با احتمال یکسان است[3].
این اصطلاح برای اولین بار در سال ۱۹۷۷ توسط گروهی از محققان IBM به سرپرستی Frederick Jelinek در زمینه تشخیص گفتار آماری، برای ارزیابی کمی «دشواری» وظیفه معرفی شد[4].
پرپلکسیتی در مدلهای زبانی
در حوزه پردازش زبان طبیعی (NLP)، پرپلکسیتی به یک معیار داخلی (intrinsic) استاندارد برای ارزیابی کیفیت مدلهای زبانی تبدیل شده است. این معیار میسنجد که مدل تا چه حد یک دنباله از کلمات یا tokenها را در مجموعه داده آزمایشی به خوبی پیشبینی میکند.
تعریف رسمی
برای یک متن آزمایشی و مدل زبانی ، پرپلکسیتی به صورت معکوس میانگین هندسی احتمال متن آزمایشی، نرمالشده بر اساس تعداد کلمات، محاسبه میشود:
این فرمول معادل توان نمایی از آنتروپی متقاطع، یا میانگین زیان لگاریتمی (negative log-likelihood) است:
کمینهسازی پرپلکسیتی معادل بیشینهسازی درستنمایی مدل روی دادههای آزمایشی است. بنابراین، مدلی با پرپلکسیتی کمتر از نظر آماری دقیقتر محسوب میشود[5].
کاربرد تاریخی و LLMهای مدرن
از نظر تاریخی، پرپلکسیتی به طور گسترده برای ارزیابی مدلهای آماری n-gram استفاده میشد. به عنوان مثال، برای متن Wall Street Journal، مدل unigram (که تنها فراوانی کلمات را در نظر میگیرد) پرپلکسیتی حدود ۹۶۲ دارد، در حالی که مدل trigram (که زمینه دو کلمه قبلی را در نظر میگیرد) حدود ۱۰۹[6]. این کاهش چشمگیر نشان میدهد که مدل چقدر بهتر الگوهای زبانی را درک میکند.
با توسعه مدلهای زبانی بزرگ (LLM)، پرپلکسیتی نقش معیار پایه خود را حفظ کرده است. محققان پرپلکسیتی را روی مجموعههای آزمایشی استاندارد (مانند WikiText) به عنوان شاخص «روانی» مدل گزارش میدهند. به عنوان نمونه، در مقاله OpenAI درباره GPT-2 آمده است که مدل با حدود ۱۱۷ میلیون پارامتر، پرپلکسیتی حدود ۳۷ را روی متن WikiText-103 به دست میآورد[7]. کاهش پرپلکسیتی معمولاً با بهبود کیفیت مدل همبسته است، از این رو این معیار به عنوان یک شاخص مفید برای پیشرفت در حین آموزش و بهینهسازی به کار میرود.
محدودیتها و تفسیر معیار
اگرچه پرپلکسیتی پایین بیانگر درستنمایی بالای دادهها طبق مدل است، این شاخص دارای محدودیتهای اساسی است و همیشه با کیفیت واقعی متن تولیدشده همبستگی ندارد.
- پرپلکسیتی پایین ≠ کیفیت بالا. پرپلکسیتی اطمینان مدل به پیشبینیهایش را میسنجد، نه درستی آنها را. مدل میتواند با اطمینان اشتباه کند و متنی بیمعنی اما از نظر آماری محتمل تولید کند (مثلاً تکرار کلمات و عبارات بسیار رایج)[3].
- حساسیت به دادهها و tokenization. پرپلکسیتی برای مقایسه مستقیم مدلهایی با معماری، واژگان یا روش tokenization متفاوت مناسب نیست. به عنوان مثال، یک مدل مبتنی بر کاراکتر ممکن است پرپلکسیتی عددی پایینتری نسبت به مدل مبتنی بر کلمه داشته باشد، اما این به معنای برتری آن در حل وظایف زبانی نیست[3].
- ناتوانی در ارزیابی معناشناسی و زمینه طولانی. پرپلکسیتی یک معیار محلی است که پیشبینی token بعدی را ارزیابی میکند. این معیار ارتباط ضعیفی با توانایی مدل در درک وابستگیهای بلندمدت و زمینه معنایی در فاصلههای زیاد دارد. پژوهش سال ۲۰۲۳ (Hu و همکاران) نشان داد که توانایی LLMها در درک متون طولانی (تا ۱۰۰ هزار token) تقریباً در معیار پرپلکسیتی بازتاب نمییابد[8].
- امکان دستکاری. این معیار را میتوان «فریب داد». یک مدل بیشبرازششده پرپلکسیتی مصنوعاً پایینی روی دادههایی که «حفظ کرده» نشان میدهد. پژوهشها (Wang و همکاران، ۲۰۲۲) نیز نشان دادهاند که تکرار بخشهایی از متن یا حتی نبود نقطه در پایان جمله میتواند پرپلکسیتی را بدون تأثیر بر کیفیت واقعی متن به صورت غیرمنطقی کاهش یا افزایش دهد[9].
نتیجهگیری: نقش پرپلکسیتی امروز
با توجه به محدودیتهای برشمردهشده، در رویه مدرن، پرپلکسیتی به عنوان یک شاخص کمکی و مقدماتی از کیفیت مدل زبانی تلقی میشود. این معیار همچنان ابزاری ارزشمند برای ارزیابی سریع و اشکالزدایی مدلها است، زیرا به وظیفه کاربردی خاصی وابسته نیست و محاسبه آن ساده است[3].
اما برای ارزیابی جامع LLMها، پرپلکسیتی به تنهایی کافی نیست. امروزه لزوماً با معیارهای خارجی (extrinsic) مرتبط با وظایف خاص تکمیل میشود، از جمله:
- دقت پاسخ به سؤالات؛
- ارزیابی انسانی (human evaluation)؛
- BLEU/ROUGE برای ترجمه ماشینی و خلاصهسازی.
در کنار این روشها، پرپلکسیتی به ایفای نقش مهم خود ادامه میدهد — به عنوان معیاری عینی از «شگفتی» مدل — اما نتایج آن همواره با در نظر گرفتن محدودیتهای ذکرشده تفسیر میشوند[3].
پیوندها
- مقاله «پرپلکسیتی در مدلهای زبانی» در Habr
- مستندات Hugging Face برای محاسبه پرپلکسیتی
منابع
- Jelinek, F., Bahl, L. R., & Mercer, R. L. (1977). Perplexity — a Measure of the Difficulty of Speech Recognition Tasks. JASA:62(S1):S63.
- Jurafsky, D., & Martin, J. H. (2021). Speech and Language Processing (ویرایش ۳، فصل ۳: N-gram Language Models). PDF.
- Radford, A. et al. (2019). Language Models are Unsupervised Multitask Learners. OpenAI white paper.
- Brown, T. B. et al. (2020). Language Models are Few-Shot Learners. arXiv:2005.14165.
- Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
- Wang, C. et al. (2022). Perplexity by PLM Is Unreliable for Evaluating Text Quality. arXiv:2210.05892.
- Meister, C., & Cotterell, R. (2021). Language Model Evaluation Beyond Perplexity. arXiv:2106.00085.
- Hu, Y. et al. (2024). Can Perplexity Reflect Large Language Model's Ability in Long Text Understanding?. arXiv:2405.06105.
- Lazaridou, A. et al. (2021). Mind the Gap: Assessing Temporal Generalization in Neural Language Models. NeurIPS 2021.
یادداشتها
- ↑ «Перплексия». Википедия. [۱]
- ↑ «Perplexity». Wikipedia. [۲]
- ↑ 3.0 3.1 3.2 3.3 3.4 Morgan, Abby. «Perplexity for LLM Evaluation». Comet AI Blog, 21 Nov 2024. [۳]
- ↑ «README.md · evaluate-measurement/perplexity». Hugging Face. [۴]
- ↑ Jurafsky, Dan, and James H. Martin. Speech and Language Processing, 3rd ed., Chapter 3: N-gram Language Models, draft (2021). [۵]
- ↑ Jurafsky, Dan, and James H. Martin. Speech and Language Processing, 3rd ed., Chapter 3: N-gram Language Models, draft (2021). [۶]
- ↑ «Perplexity number of wikitext-103 on gpt-2 don't match the paper». GitHub, huggingface/transformers, Issue #483. [۷]
- ↑ Hu, H., et al. «Can Perplexity Reflect Large Language Model's Ability in Long Text Understanding?». arXiv:2405.06105 [cs.CL], 10 мая 2024 г. [۸]
- ↑ Wang, C., et al. «Perplexity by PLM Is Unreliable for Evaluating Text Quality». arXiv:2210.05892 [cs.CL], 12 окт. 2022 г. [۹]