Perplexity (metric) (BN)
পারপ্লেক্সিটি (ইং. Perplexity, PPL) তথ্য তত্ত্ব এবং Machine Learning-এ — এটি একটি ভাষা মডেলের অনিশ্চয়তা বা "বিস্ময়"-এর পরিমাপ, যা কোনো পাঠ্য নমুনা পূর্বানুমান করার সময় প্রকাশ পায়। কম পারপ্লেক্সিটি ইঙ্গিত করে যে মডেলের সম্ভাব্যতা বিতরণ পরীক্ষামূলক ডেটার সাথে ভালোভাবে সামঞ্জস্যপূর্ণ, অন্যদিকে বেশি পারপ্লেক্সিটি মানে মডেলটি ক্রমটি খারাপভাবে পূর্বানুমান করছে[1]।
আনুষ্ঠানিকভাবে, সম্ভাব্যতা বিতরণের পারপ্লেক্সিটি তার এনট্রপির ঘাত (exponent) হিসেবে সংজ্ঞায়িত হয়। বিযুক্ত বিতরণ -এর জন্য এটি -এর সমান, যেখানে হলো এনট্রপি[2]। স্বজ্ঞাতভাবে পারপ্লেক্সিটিকে "কার্যকর" বিকল্পের সংখ্যা হিসেবে বোঝা যায়, যেখান থেকে মডেল প্রতিটি ধাপে বেছে নেয়। পারপ্লেক্সিটি যদি ১০০ হয়, তাহলে এর অর্থ হলো মডেলের অনিশ্চয়তা ১০০টি সমসম্ভাব্য ফলাফলের মধ্য থেকে একটি বেছে নেওয়ার সমতুল্য[3]।
পদটি প্রথম ১৯৭৭ সালে IBM-এর গবেষকদের একটি দল, ফ্রেডেরিক জেলিনেকের নেতৃত্বে, পরিসংখ্যানগত বাক্ সনাক্তকরণের প্রসঙ্গে কাজের "কঠিনতা" পরিমাপ করতে প্রবর্তন করেছিলেন[4]।
পারপ্লেক্সিটি ভাষা মডেলে
প্রাকৃতিক ভাষা প্রক্রিয়াকরণ (NLP)-এর ক্ষেত্রে পারপ্লেক্সিটি ভাষা মডেলের মান মূল্যায়নের জন্য একটি আদর্শ অভ্যন্তরীণ (intrinsic) মেট্রিকে পরিণত হয়েছে। এটি পরিমাপ করে যে মডেলটি পরীক্ষামূলক ডেটাসেটে শব্দ বা token-এর ক্রম কতটা ভালোভাবে পূর্বানুমান করতে পারে।
আনুষ্ঠানিক সংজ্ঞা
পরীক্ষামূলক কর্পাস এবং ভাষা মডেল -এর জন্য পারপ্লেক্সিটি শব্দের সংখ্যা দিয়ে স্বাভাবিকীকৃত পরীক্ষামূলক কর্পাসের বিপরীত গড় জ্যামিতিক সম্ভাবনা হিসেবে গণনা করা হয়:
এই সূত্রটি ক্রস-এনট্রপি বা গড় লগারিদমিক ক্ষতির (negative log-likelihood) ঘাতের সমতুল্য:
পারপ্লেক্সিটি হ্রাস করা পরীক্ষামূলক ডেটায় মডেলের সম্ভাবনা সর্বাধিক করার সমতুল্য। সুতরাং, কম পারপ্লেক্সিটিযুক্ত মডেলকে পরিসংখ্যানগতভাবে আরও নির্ভুল বলে বিবেচনা করা হয়[5]।
ঐতিহাসিক প্রয়োগ এবং আধুনিক LLM
ঐতিহাসিকভাবে পারপ্লেক্সিটি পরিসংখ্যানগত n-গ্রাম মডেল মূল্যায়নে ব্যাপকভাবে ব্যবহৃত হতো। উদাহরণস্বরূপ, Wall Street Journal কর্পাসের জন্য ইউনিগ্রাম মডেল (শুধুমাত্র শব্দের কম্পাঙ্ক বিবেচনাকারী) পারপ্লেক্সিটি প্রায় ৯৬২, যেখানে ট্রাইগ্রাম মডেল (পূর্বের দুটি শব্দের প্রসঙ্গ বিবেচনাকারী) প্রায় ১০৯[6]। এই তীব্র হ্রাস দেখায় যে মডেলটি ভাষার নিয়মকানুন কতটা ভালোভাবে ধরতে পারছে।
বড় ভাষা মডেলের (LLM) বিকাশের সাথে সাথে পারপ্লেক্সিটি তার ভিত্তি সূচকের ভূমিকা ধরে রেখেছে। গবেষকরা মডেলের "স্বাচ্ছন্দ্য" নির্দেশক হিসেবে আদর্শ পরীক্ষামূলক সেটে (যেমন WikiText) পারপ্লেক্সিটি রিপোর্ট করেন। উদাহরণস্বরূপ, GPT-2 সম্পর্কিত OpenAI-এর গবেষণাপত্রে উল্লেখ করা হয়েছে যে ~১১৭ মিলিয়ন প্যারামিটারযুক্ত মডেলটি WikiText-103 কর্পাসে প্রায় ৩৭ পারপ্লেক্সিটি অর্জন করে[7]। পারপ্লেক্সিটি হ্রাস সাধারণত মডেলের মান উন্নতির সাথে সামঞ্জস্যপূর্ণ, তাই মেট্রিকটি প্রশিক্ষণ এবং অপ্টিমাইজেশনের সময় অগ্রগতির একটি সুবিধাজনক সূচক হিসেবে কাজ করে।
মেট্রিকের সীমাবদ্ধতা ও ব্যাখ্যা
কম পারপ্লেক্সিটি মডেল অনুযায়ী ডেটার উচ্চ সম্ভাবনার প্রমাণ দিলেও, এই সূচকটির বেশ কিছু গুরুত্বপূর্ণ সীমাবদ্ধতা রয়েছে এবং এটি সবসময় উৎপন্ন টেক্সটের প্রকৃত মানের সাথে সামঞ্জস্যপূর্ণ নয়।
- কম পারপ্লেক্সিটি ≠ উচ্চ মান। পারপ্লেক্সিটি মডেলের পূর্বানুমানে আত্মবিশ্বাস পরিমাপ করে, কিন্তু তাদের সঠিকতা নয়। মডেলটি আত্মবিশ্বাসের সাথে ভুল হতে পারে, অর্থহীন কিন্তু পরিসংখ্যানগতভাবে সম্ভাব্য টেক্সট তৈরি করে (যেমন, খুব সাধারণ শব্দ ও বাক্যাংশ পুনরাবৃত্তি করে)[3]।
- ডেটা ও tokenization-এর প্রতি সংবেদনশীলতা। পারপ্লেক্সিটি ভিন্ন আর্কিটেকচার, শব্দভাণ্ডার বা tokenization পদ্ধতির মডেলগুলির সরাসরি তুলনার জন্য উপযুক্ত নয়। উদাহরণস্বরূপ, একটি অক্ষর-ভিত্তিক মডেলের পারপ্লেক্সিটি সংখ্যাগতভাবে শব্দ-ভিত্তিক মডেলের চেয়ে কম হতে পারে, কিন্তু এর মানে এই নয় যে এটি ভাষাগত কাজগুলো আরও ভালোভাবে সমাধান করে[3]।
- শব্দার্থ ও দীর্ঘ প্রসঙ্গ মূল্যায়নে অক্ষমতা। পারপ্লেক্সিটি একটি স্থানীয় মেট্রিক যা পরবর্তী token পূর্বানুমান মূল্যায়ন করে। এটি দীর্ঘমেয়াদী নির্ভরতা এবং বৃহত্তর দূরত্বে অর্থগত প্রসঙ্গ ধরার মডেলের ক্ষমতার সাথে দুর্বলভাবে সামঞ্জস্যপূর্ণ। ২০২৩ সালের একটি গবেষণা (Hu et al.) দেখিয়েছে যে দীর্ঘ টেক্সট (১ লক্ষ token পর্যন্ত) বোঝার LLM-এর ক্ষমতা পারপ্লেক্সিটি মেট্রিকে প্রায় প্রতিফলিত হয় না[8]।
- কারসাজির সম্ভাবনা। মেট্রিকটিকে "প্রতারণা" করা যায়। অতিরিক্ত প্রশিক্ষিত মডেল যে ডেটা "মুখস্থ" করেছে তাতে কৃত্রিমভাবে কম পারপ্লেক্সিটি দেখাবে। গবেষণাগুলো (Wang et al., 2022) আরও দেখিয়েছে যে টেক্সটের অংশ দ্বিগুণ করা বা এমনকি বাক্যের শেষে পিরিয়ড না থাকলেও পারপ্লেক্সিটি অযৌক্তিকভাবে কমতে বা বাড়তে পারে, টেক্সটের প্রকৃত মান প্রভাবিত না করেই[9]।
উপসংহার: আজকের প্রেক্ষাপটে পারপ্লেক্সিটির ভূমিকা
উল্লিখিত সীমাবদ্ধতাগুলো বিবেচনা করে, আধুনিক অনুশীলনে পারপ্লেক্সিটিকে ভাষা মডেলের মানের একটি সহায়ক, প্রাথমিক সূচক হিসেবে দেখা হয়। এটি মডেলের দ্রুত মূল্যায়ন ও ডিবাগিংয়ের জন্য একটি মূল্যবান হাতিয়ার হিসেবে রয়ে গেছে, কারণ এটি কোনো নির্দিষ্ট প্রায়োগিক কাজের উপর নির্ভর করে না এবং গণনায় সহজ[3]।
তবে LLM-এর পূর্ণাঙ্গ মূল্যায়নের জন্য শুধু পারপ্লেক্সিটি যথেষ্ট নয়। আজ এটি অবশ্যই নির্দিষ্ট কাজের সাথে সংযুক্ত বাহ্যিক (extrinsic) মেট্রিক দিয়ে পরিপূরক করা হয়, যেমন:
- প্রশ্নের উত্তরের নির্ভুলতা;
- মানব মূল্যায়ন (human evaluation);
- মেশিন অনুবাদ ও সংক্ষেপণের জন্য BLEU/ROUGE।
এই পদ্ধতিগুলোর সাথে মিলিতভাবে পারপ্লেক্সিটি একটি গুরুত্বপূর্ণ ভূমিকা পালন করতে থাকে — মডেলের "বিস্ময়"-এর একটি বস্তুনিষ্ঠ পরিমাপ হিসেবে কাজ করে, কিন্তু এর ফলাফল সবসময় উল্লিখিত সীমাবদ্ধতাগুলো মাথায় রেখে ব্যাখ্যা করা হয়[3]।
তথ্যসূত্র
- "ভাষা মডেলে পারপ্লেক্সিটি" বিষয়ক নিবন্ধ, Habr-এ
- Hugging Face-এর পারপ্লেক্সিটি গণনার ডকুমেন্টেশন
সাহিত্য
- Jelinek, F., Bahl, L. R., & Mercer, R. L. (1977). Perplexity — a Measure of the Difficulty of Speech Recognition Tasks. JASA:62(S1):S63.
- Jurafsky, D., & Martin, J. H. (2021). Speech and Language Processing (৩য় সংস্করণ, অধ্যায় ৩: N-gram Language Models). PDF.
- Radford, A. et al. (2019). Language Models are Unsupervised Multitask Learners. OpenAI white paper.
- Brown, T. B. et al. (2020). Language Models are Few-Shot Learners. arXiv:2005.14165.
- Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
- Wang, C. et al. (2022). Perplexity by PLM Is Unreliable for Evaluating Text Quality. arXiv:2210.05892.
- Meister, C., & Cotterell, R. (2021). Language Model Evaluation Beyond Perplexity. arXiv:2106.00085.
- Hu, Y. et al. (2024). Can Perplexity Reflect Large Language Model's Ability in Long Text Understanding?. arXiv:2405.06105.
- Lazaridou, A. et al. (2021). Mind the Gap: Assessing Temporal Generalization in Neural Language Models. NeurIPS 2021.
টীকা
- ↑ «Перплексия». Википедия. [১]
- ↑ «Perplexity». Wikipedia. [২]
- ↑ 3.0 3.1 3.2 3.3 3.4 Morgan, Abby. «Perplexity for LLM Evaluation». Comet AI Blog, 21 Nov 2024. [৩]
- ↑ «README.md · evaluate-measurement/perplexity». Hugging Face. [৪]
- ↑ Jurafsky, Dan, and James H. Martin. Speech and Language Processing, 3rd ed., Chapter 3: N-gram Language Models, draft (2021). [৫]
- ↑ Jurafsky, Dan, and James H. Martin. Speech and Language Processing, 3rd ed., Chapter 3: N-gram Language Models, draft (2021). [৬]
- ↑ «Perplexity number of wikitext-103 on gpt-2 don't match the paper». GitHub, huggingface/transformers, Issue #483. [৭]
- ↑ Hu, H., et al. «Can Perplexity Reflect Large Language Model's Ability in Long Text Understanding?». arXiv:2405.06105 [cs.CL], 10 мая 2024 г. [৮]
- ↑ Wang, C., et al. «Perplexity by PLM Is Unreliable for Evaluating Text Quality». arXiv:2210.05892 [cs.CL], 12 окт. 2022 г. [৯]