LLM evaluation — বৃহৎ ভাষা মডেলের মূল্যায়ন
বৃহৎ ভাষা মডেলের (LLM) মূল্যায়ন — কৃত্রিম বুদ্ধিমত্তার একটি শাখা যা ভাষা মডেলের সক্ষমতা, সীমাবদ্ধতা এবং ঝুঁকি পরিমাপের জন্য মানসম্পন্ন পদ্ধতি নিশ্চিত করে[1]। যেহেতু LLM স্বাস্থ্যসেবা ও অর্থায়নের মতো গুরুত্বপূর্ণ ক্ষেত্রে একীভূত হচ্ছে, তাই নিরাপত্তা, নির্ভরযোগ্যতা এবং ন্যায্যতা নিশ্চিত করতে এগুলোর নিরপেক্ষ মূল্যায়ন অপরিহার্য হয়ে উঠেছে[2]।
LLM মূল্যায়ন বেশ কিছু মৌলিক কার্য সম্পাদন করে:
- সক্ষমতা পরিমাপ: মানসম্পন্ন কাজে বিভিন্ন মডেলের কর্মক্ষমতার বস্তুনিষ্ঠ তুলনা।
- অগ্রগতি পর্যবেক্ষণ: অর্জনসমূহ নথিভুক্ত করা এবং আরও উন্নতির প্রয়োজন এমন ক্ষেত্র চিহ্নিত করা।
- ঝুঁকি হ্রাসকরণ: পক্ষপাত, hallucination এবং নিরাপত্তা সমস্যার মতো সম্ভাব্য ক্ষতিকর ফলাফল শনাক্ত করা।
- ডেভেলপার ও ব্যবহারকারীদের অবহিত করা: কোনো নির্দিষ্ট অ্যাপ্লিকেশনের জন্য সবচেয়ে উপযুক্ত মডেল বেছে নিতে স্বচ্ছ তথ্য সরবরাহ করা।
মূল পদ্ধতি ও পদ্ধতিমালা
আধুনিক LLM মূল্যায়ন শুরু হয়েছিল GLUE (General Language Understanding Evaluation)-এর মতো ব্যাপক benchmark-এর আবির্ভাবের মাধ্যমে, যা সাধারণ ভাষা বোঝার মূল্যায়নের মান নির্ধারণ করেছিল[3]। যখন মডেলগুলো GLUE-তে মানবিক ফলাফলকে ছাড়িয়ে যেতে শুরু করল, তখন SuperGLUE-এর মতো আরও জটিল উত্তরসূরি তৈরি করা হয়েছিল[4]।
একটি মৌলিক পরিবর্তন ঘটে MMLU ও BIG-bench-এর মতো বহু-কাজের benchmark প্রবর্তনের সাথে, যা মডেলগুলোকে বিস্তৃত জ্ঞান ও যুক্তির সক্ষমতায় পরীক্ষা করে — শুধু ভাষাগত কাজের সীমা ছাড়িয়ে[1]।
মূল মেট্রিক্স ও benchmark
স্বয়ংক্রিয় মেট্রিক্স
- Perplexity (পার্পলেক্সিটি): একটি মৌলিক মেট্রিক যা পরিমাপ করে মডেল কতটা ভালোভাবে টেক্সট পূর্বাভাস দেয়। কম perplexity মানে মডেলের পূর্বাভাসে বেশি আস্থা।
- BLEU ও ROUGE: n-gram ভিত্তিক মেট্রিক যা উৎপন্ন ও রেফারেন্স টেক্সটের মধ্যে শাব্দিক মিল পরিমাপ করে। BLEU নির্ভুলতার উপর মনোযোগ দেয়, ROUGE সম্পূর্ণতার উপর[2]।
- BERTScore: একটি শব্দার্থিক মেট্রিক যা শব্দার্থিক সাদৃশ্য গণনার জন্য BERT থেকে embedding ব্যবহার করে। এটি প্রতিশব্দ ও পুনর্বিন্যাস ধরতে সক্ষম, যা এটিকে n-gram ভিত্তিক মেট্রিকের চেয়ে আরও সঠিক করে তোলে[5]।
বিশেষায়িত benchmark
নির্দিষ্ট সক্ষমতা মূল্যায়নের জন্য লক্ষ্যভিত্তিক benchmark তৈরি করা হয়েছে:
- কোড জেনারেশন: HumanEval টেক্সট বিবরণ থেকে সঠিক প্রোগ্রাম কোড তৈরি করার মডেলের সক্ষমতা মূল্যায়ন করে, ইউনিট টেস্টের মাধ্যমে এর কার্যকারিতা যাচাই করে[6]।
- সাধারণ জ্ঞান: HellaSwag একটি সাধারণ পরিস্থিতির সবচেয়ে সম্ভাব্য সমাপ্তি অনুমানের মাধ্যমে ভৌত জগৎ ও কার্যকারণ সম্পর্ক বোঝার ক্ষমতা পরীক্ষা করে[7]।
- একাডেমিক জ্ঞান: MMLU (Massive Multitask Language Understanding) প্রাথমিক গণিত থেকে আইন ও চিকিৎসাবিদ্যা পর্যন্ত ৫৭টি বিষয় অন্তর্ভুক্ত করে মডেলের জ্ঞানের বিস্তৃতি যাচাই করে[8]।
- সক্ষমতার সীমানা: BIG-bench (Beyond the Imitation Game) একটি সহযোগিতামূলক প্রকল্প যা ২০৪টি কাজ নিয়ে গঠিত, যা মডেলে emergent সক্ষমতা — অর্থাৎ মডেল একটি সংকটজনক স্কেলে পৌঁছানোর পরে হঠাৎ আবির্ভূত হওয়া দক্ষতা — চিহ্নিত করতে ডিজাইন করা হয়েছে[9]।
নিরাপত্তা ও নৈতিক দিকের মূল্যায়ন
- পক্ষপাত: সামাজিক ও জনতাত্ত্বিক পক্ষপাত মূল্যায়নের জন্য BBQ (Bias Benchmark for Question Answering) ও BOLD (Bias in Open-ended Language generation Dataset)-এর মতো dataset ব্যবহার করা হয়।
- বিষাক্ততা: RealToxicityPrompts-এর মতো benchmark বিষাক্ত কন্টেন্ট তৈরিকে উৎসাহিত করে এমন অনুরোধ সরবরাহ করে মডেলের স্থিতিস্থাপকতা মূল্যায়ন করে।
- দৃঢ়তা (Robustness): প্রতিকূল আক্রমণের মাধ্যমে মূল্যায়ন করা হয়। PromptRobust framework প্রতীক, শব্দ ও বাক্য স্তরে মডেলের দৃঢ়তা যাচাইয়ের জন্য একটি ব্যাপক প্রম্পট সেট সরবরাহ করে।
আধুনিক মান ও framework
- HELM (Holistic Evaluation of Language Models): স্ট্যানফোর্ড বিশ্ববিদ্যালয়ের একটি উদ্যোগ যা "সামগ্রিক" পদ্ধতি প্রস্তাব করে। HELM মডেলগুলোকে একাধিক মাত্রায় মূল্যায়ন করে: নির্ভুলতা, দৃঢ়তা, ন্যায্যতা, পক্ষপাত, বিষাক্ততা এবং দক্ষতা[10]।
- ISO/IEC 42001:2023: AI ব্যবস্থাপনা সিস্টেমের জন্য প্রথম আন্তর্জাতিক মান, যা সম্পূর্ণ জীবনচক্র জুড়ে AI পরিচালনার প্রয়োজনীয়তা নির্ধারণ করে।
- EU AI Act (বিধিমালা ২০২৪/১৬৮৯): AI-এর প্রথম ব্যাপক নিয়ন্ত্রণ যা পদ্ধতিগত ঝুঁকি সহ সাধারণ উদ্দেশ্যের মডেলগুলির জন্য মানসম্পন্ন মূল্যায়নের প্রয়োজন রাখে।
- NIST AI Risk Management Framework 1.0: মার্কিন যুক্তরাষ্ট্রের ন্যাশনাল ইন্সটিটিউট অব স্ট্যান্ডার্ডস অ্যান্ড টেকনোলজি কর্তৃক তৈরি একটি স্বেচ্ছামূলক framework যা নির্ভরযোগ্য AI উন্নয়ন ও মোতায়েনের জন্য।
বিদ্যমান পদ্ধতির সমস্যা ও সীমাবদ্ধতা
- Benchmark স্যাচুরেশন: অনেক মডেল জনপ্রিয় benchmark-এ প্রায় নিখুঁত স্কোর অর্জন করে, যা "benchmark অনুসরণ" নামক ঘটনার দিকে নিয়ে যায়, যেখানে মডেলগুলো সাধারণ সক্ষমতার পরিবর্তে নির্দিষ্ট পরীক্ষার জন্য অপ্টিমাইজ করা হয়।
- ডেটা দূষণ: একটি গুরুত্বপূর্ণ সমস্যা যেখানে benchmark-এর পরীক্ষার ডেটা দুর্ঘটনাক্রমে প্রশিক্ষণ সেটে অন্তর্ভুক্ত হয়, যার ফলে মূল্যায়নের ফলাফল স্ফীত ও অসৎ হয়।
- মানবিক বিচারের সাথে দুর্বল সম্পর্ক: BLEU ও ROUGE-এর মতো স্বয়ংক্রিয় মেট্রিক প্রায়শই মানবিক গুণমান মূল্যায়নের সাথে দুর্বল সম্পর্ক দেখায়, বিশেষত সৃজনশীল ও মুক্ত কাজে।
সাম্প্রতিক গবেষণা ও প্রবণতা
- LLM-as-a-Judge প্যারাডাইম: অন্যান্য মডেলের উত্তর মূল্যায়নের জন্য শক্তিশালী LLM (যেমন GPT-4)-কে "বিচারক" হিসেবে ব্যবহার করা। এই পদ্ধতি ব্যয়বহুল মানবিক মূল্যায়নের একটি মাপযোগ্য বিকল্প প্রদান করে।
- গতিশীল ও অভিযোজিত মূল্যায়ন: LMArena-এর মতো প্ল্যাটফর্ম ব্যবহারকারীদের সাথে সরাসরি মিথস্ক্রিয়ায় মডেলের বাস্তব মূল্যায়নের জন্য Elo রেটিং সহ একটি ক্রাউডসোর্সড সিস্টেম উপস্থাপন করে।
- হাইব্রিড পদ্ধতি: মডেলের কর্মক্ষমতার আরও সম্পূর্ণ ও নির্ভরযোগ্য চিত্র পেতে স্বয়ংক্রিয় মেট্রিক, মানবিক বিচার এবং LLM মূল্যায়নের সমন্বয়।
LLM মূল্যায়নের ভূদৃশ্য বিবর্তিত হতে থাকে, বহুমাত্রিক, মানসম্পন্ন ও পুনরুৎপাদনযোগ্য framework তৈরির দিকে এগিয়ে যাচ্ছে, যা শুধু নির্ভুলতা নয়, AI প্রযুক্তির প্রয়োগের সামাজিক ও নৈতিক দিকগুলোও বিবেচনা করে[1]।
তথ্যসূত্র
- Stanford HELM — Holistic Evaluation of Language Models প্রকল্পের অফিশিয়াল সাইট।
- Chatbot Arena — মানবিক পছন্দের ভিত্তিতে চ্যাটবট তুলনামূলক মূল্যায়নের প্ল্যাটফর্ম।
সাহিত্য
- Wang, A. et al. (2018). GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding. arXiv:1804.07461.
- Zhang, T. et al. (2019). BERTScore: Evaluating Text Generation with BERT. arXiv:1904.09675.
- Wang, A. et al. (2019). SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems. arXiv:1905.00537.
- Zellers, R. et al. (2019). HellaSwag: Can a Machine Really Finish Your Sentence?. arXiv:1905.07830.
- Hendrycks, D. et al. (2020). Measuring Massive Multitask Language Understanding. arXiv:2009.03300.
- Gehman, S. et al. (2020). RealToxicityPrompts: Evaluating Neural Toxic Degeneration in Language Models. arXiv:2009.11462.
- Chen, M. et al. (2021). Evaluating Large Language Models Trained on Code. arXiv:2107.03374.
- Parrish, A. et al. (2021). BBQ: A Hand-Built Bias Benchmark for Question Answering. arXiv:2110.08193.
- Dhamala, J. et al. (2021). BOLD: Dataset and Metrics for Measuring Biases in Open-Ended Language Generation. arXiv:2101.11718.
- Srivastava, A. et al. (2022). Beyond the Imitation Game: Quantifying and Extrapolating the Capabilities of Language Models. arXiv:2206.04615.
- Bommasani, R. et al. (2022). Holistic Evaluation of Language Models. arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Zhuang, Y. et al. (2023). Through the Lens of Core Competency: Survey on Evaluation of Large Language Models. ACL Anthology:2023.ccl-2.8.
- Zhu, K. et al. (2023). PromptRobust: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts. arXiv:2306.04528.
টীকা
- ↑ 1.0 1.1 1.2 Chang, Y., et al. (2023). «A Survey on Evaluation of Large Language Models». arXiv. [১]
- ↑ 2.0 2.1 Zhuang, Y., et al. (2023). «Through the Lens of Core Competency: Survey on Evaluation of Large Language Models». ACL Anthology. [২]
- ↑ Wang, A., et al. (2018). «GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding». arXiv.[৩]
- ↑ Kumar, Pradosh. «Understanding Benchmarking in NLP: GLUE, SuperGLUE, HELM, MMLU, and BIG-Bench». Medium.
- ↑ Zhang, T., et al. (2019). «BERTScore: Evaluating Text Generation with BERT». arXiv.
- ↑ Chen, M., et al. (2021). «Evaluating Large Language Models Trained on Code». arXiv.
- ↑ Zellers, R., et al. (2019). «HellaSwag: Can a Machine Really Finish Your Sentence?». arXiv.
- ↑ Hendrycks, D., et al. (2020). «Measuring Massive Multitask Language Understanding». arXiv.
- ↑ Srivastava, A., et al. (2022). «Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models». arXiv.
- ↑ Bommasani, R., et al. (2022). «Holistic Evaluation of Language Models». arXiv. [৪]