LLM benchmarks — LLM বেঞ্চমার্ক

From Systems analysis Wiki
Jump to navigation Jump to search

বৃহৎ ভাষা মডেলের বেঞ্চমার্ক — এগুলি হল মানসম্পন্ন পরীক্ষার সংকলন, যা বৃহৎ ভাষা মডেলের (LLM) গুণমান ও সক্ষমতা পরিমাপ, তুলনা এবং মূল্যায়নের জন্য তৈরি করা হয়েছে[1]। সাধারণত প্রতিটি বেঞ্চমার্ক হল একটি নির্দিষ্ট কাজের সংকলন (যেমন প্রশ্ন, পাঠ্য বা নির্দেশনা), যেগুলির সঠিক উত্তর বা মূল্যায়নের মানদণ্ড আগে থেকেই জানা থাকে। এই পদ্ধতি একই পরিস্থিতিতে বিভিন্ন মডেলের মধ্যে বস্তুনিষ্ঠ তুলনা নিশ্চিত করে, যা ক্ষেত্রটির অগ্রগতি অনুসরণ করতে এবং মডেলগুলির শক্তি ও দুর্বলতা চিহ্নিত করতে সাহায্য করে[2]

বেঞ্চমার্কের নিয়মিত ব্যবহার LLM-এর বিকাশে গুরুত্বপূর্ণ ভূমিকা পালন করে — এটি ডেভেলপারদের মডেল উন্নত করতে অনুপ্রাণিত করে এবং বৈজ্ঞানিক সমাজে ফলাফলের স্বচ্ছতা ও তুলনাযোগ্যতা নিশ্চিত করে। বেঞ্চমার্কের বিবর্তন LLM-এরই বিকাশকে প্রতিফলিত করে: ভাষা বোঝার সহজ কাজ থেকে শুরু করে বহু-স্তরীয় যুক্তি, সাধারণ জ্ঞান, নৈতিকতা এবং নিরাপত্তা পরীক্ষাকারী জটিল পরীক্ষা পর্যন্ত[3]

মূল বিভাগ ও উদাহরণ

LLM বেঞ্চমার্ক বিভিন্ন দক্ষতা ও প্রয়োগের ক্ষেত্র অন্তর্ভুক্ত করে। নিচে মূল বিভাগগুলি এবং প্রতিটিতে সবচেয়ে পরিচিত কাজের সংকলনগুলি আলোচনা করা হয়েছে।

সাধারণ ভাষা বোঝার সক্ষমতা

এই বিভাগ প্রাকৃতিক ভাষা বোঝা ও ব্যাখ্যা করার ক্ষেত্রে মডেলের মৌলিক সক্ষমতা মূল্যায়ন করে।

  • GLUE (General Language Understanding Evaluation, ২০১৯) — প্রথম দিককার একটি ব্যাপক বেঞ্চমার্ক, যাতে বিভিন্ন ধরনের কাজ অন্তর্ভুক্ত রয়েছে: মনোভাব নির্ধারণ থেকে শুরু করে পাঠ্যের যৌক্তিক সংযোগ মূল্যায়ন পর্যন্ত। সব কাজের ফলাফল একটি একক স্কোরে একত্রিত হয়, যা প্রাথমিক মডেলগুলিকে তাদের সামগ্রিক কার্যকারিতার ভিত্তিতে তুলনা করার সুযোগ দিয়েছিল[4]
  • SuperGLUE (২০১৯) — GLUE-এর একটি "উন্নত" উত্তরসূরি, যা এই কারণে তৈরি করা হয়েছিল যে মডেলগুলি দ্রুত GLUE-তে মানুষের কাছাকাছি স্তরে পৌঁছে গিয়েছিল। SuperGLUE-তে আরও কঠিন কাজ রয়েছে, যেগুলির জন্য প্রসঙ্গের গভীর বোঝাপড়া এবং সিদ্ধান্ত নেওয়ার দক্ষতা প্রয়োজন[5]
  • WinoGrande (২০১৯) — Winograd Schema কুইজের একটি বিস্তারিত সংস্করণ। এতে ৪৪ হাজার প্রশ্ন রয়েছে যেখানে বাক্যে অস্পষ্ট সর্বনামের সঠিক ব্যাখ্যা বেছে নিতে সাধারণ জ্ঞান প্রয়োজন[6]

বহু-কাজ ও জটিল বেঞ্চমার্ক

এই সংকলনগুলি মডেলগুলিকে বিস্তৃত জ্ঞান ও দক্ষতার উপর পরীক্ষা করে, যা নিছক ভাষাগত কাজের সীমার বাইরে যায়।

  • MMLU (Massive Multitask Language Understanding, ২০২০) — কুইজ আকারে ৫৭টি বিষয়ের কাজের সংকলন: স্কুলের বিষয় থেকে শুরু করে অত্যন্ত বিশেষায়িত পেশাদার জ্ঞান পর্যন্ত (আইন, চিকিৎসা)। MMLU মডেলের জ্ঞানের বিস্তার পরিমাপ করে[7]
  • BIG-bench (Beyond the Imitation Game Benchmark, ২০২২) — তৈরির সময় সবচেয়ে বড় সহযোগিতামূলক বেঞ্চমার্ক, যা ৪০০-এরও বেশি লেখক দ্বারা তৈরি। এতে ভাষাবিজ্ঞান থেকে পদার্থবিজ্ঞান পর্যন্ত বিভিন্ন বিষয়ে ২০০-এরও বেশি কাজ রয়েছে, যা মডেলগুলিকে শাব্লোনিক মিলের বাইরে পরীক্ষা করে এবং অপ্রচলিত পরিস্থিতিতে তাদের সীমা উন্মোচন করে[8]

সাধারণ জ্ঞান ও সত্যবাদিতা

এই বেঞ্চমার্কগুলি দৈনন্দিন পরিস্থিতি সম্পর্কে যুক্তিসঙ্গত সিদ্ধান্তে আসার এবং মিথ্যা তথ্য ছড়ানো এড়ানোর ক্ষেত্রে মডেলের সক্ষমতা মূল্যায়ন করে।

  • HellaSwag (২০১৯) — একটি পরিস্থিতির বর্ণনার জন্য সবচেয়ে বিশ্বাসযোগ্য সমাপ্তি বেছে নেওয়ার কাজের মাধ্যমে সাধারণ জ্ঞান পরীক্ষা করে। এই বেঞ্চমার্কের বৈশিষ্ট্য হল "ফাঁদ" থাকা: ভুল উত্তরগুলি স্বয়ংক্রিয়ভাবে তৈরি এবং অত্যন্ত বিশ্বাসযোগ্য দেখায়, যার জন্য মডেলের প্রসঙ্গের গভীর বোঝাপড়া প্রয়োজন[9]
  • TruthfulQA (২০২১) — জনপ্রিয় মিথ ও ভুল ধারণা ছড়ানোর প্রতি মডেলের প্রবণতা পরিমাপ করে। এতে এমন প্রশ্ন রয়েছে যেখানে ইন্টারনেটে প্রচলিত উত্তর ভুল (যেমন, "ভ্যাকসিন কি অটিজম সৃষ্টি করে?")। মডেলকে মিথ্যা ধারণার ফাঁদে না পড়ে সত্যিকারের সঠিক উত্তর দিতে হবে[10]

গাণিতিক সমস্যা

  • GSM8K (২০২১) — প্রাথমিক বিদ্যালয় স্তরের হাজার হাজার গাণিতিক শব্দ সমস্যা অন্তর্ভুক্ত করে। প্রতিটি সমস্যার সমাধানের জন্য ২–৮টি পাটিগণিতের ধাপ সম্পন্ন করতে হয়, যা মডেলের বহু-স্তরীয় যুক্তির সক্ষমতা পরীক্ষা করে[11]
  • MATH (২০২১) — আরও জটিল একটি সংকলন, যা গণিত অলিম্পিয়াড ও প্রতিযোগিতার সমস্যা নিয়ে গঠিত। এতে বীজগণিত, জ্যামিতি ও সংখ্যা তত্ত্বের বিভাগ রয়েছে, যার জন্য মডেলের অ-তুচ্ছ সমাধান পদ্ধতির দক্ষতা প্রয়োজন[12]

প্রোগ্রাম কোড তৈরি

  • HumanEval (২০২১) — কোড লেখার ক্ষেত্রে LLM-এর সক্ষমতা মূল্যায়নের জন্য একটি মানক পরীক্ষা। এতে ১৬৪টি প্রোগ্রামিং কাজ রয়েছে, যেখানে মডেলকে দেওয়া বিবরণ অনুযায়ী সঠিক Python কোড তৈরি করতে হবে। সঠিকতা ইউনিট পরীক্ষার মাধ্যমে মূল্যায়ন করা হয়[13]
  • SWE-bench (২০২৩) — আরও বাস্তবসম্মত একটি বেঞ্চমার্ক, যা GitHub থেকে বাস্তব সমস্যার (issues) বিবরণ সংগ্রহ করে। মডেলকে একটি প্যাচ (কোড খণ্ড) তৈরি করতে হবে যা সমস্যাটি সমাধান করে। এর জন্য বিপুল পরিমাণ অন্যের কোড বোঝা এবং জটিল ধাপে-ধাপে যুক্তি প্রয়োগের দক্ষতা প্রয়োজন[14]

ডায়ালগ মডেলের মূল্যায়ন

  • Chatbot Arena (২০২৪) — একটি উন্মুক্ত অনলাইন প্ল্যাটফর্ম যেখানে দুটি বেনামী মডেল ব্যবহারকারীর সাথে জোড়া কথোপকথনে অংশ নেয়। কথোপকথনের পরে ব্যবহারকারী ভোট দেন কার উত্তর ভালো ছিল। এই ধরনের হাজার হাজার "দ্বন্দ্বের" ভিত্তিতে ব্যবহারকারীর পছন্দের একটি Elo রেটিং তৈরি হয়, যা সরাসরি কথোপকথনে মডেলের গুণমান প্রতিফলিত করে[15]
  • MT-Bench (২০২৩) — ডায়ালগ দক্ষতার স্ট্রেস-টেস্টিংয়ের জন্য একটি স্বয়ংক্রিয় বেঞ্চমার্ক। এতে বহু-পর্যায়ের কথোপকথন অনুকরণ করে ৮০ জোড়া প্রশ্ন রয়েছে। মডেলের উত্তরগুলি আরেকটি, আরও শক্তিশালী LLM ("LLM-as-a-judge", যেমন GPT-4) দ্বারা পূর্বনির্ধারিত স্কেলে মূল্যায়ন করা হয়[16]

নিরাপত্তা ও নির্ভরযোগ্যতা

  • AgentHarm (২০২৪) — একটি বেঞ্চমার্ক যা LLM এজেন্টদের বিপজ্জনক নির্দেশনা পালন করার প্রবণতা মূল্যায়ন করে। এতে ১১০টি পরিস্থিতি রয়েছে যা দুরভিসন্ধিমূলক কাজ উপস্থাপন করে (প্রতারণা থেকে সাইবার অপরাধ পর্যন্ত)। একটি ভালো মডেলকে এই ধরনের অনুরোধ প্রত্যাখ্যান করতে হবে[17]
  • SafetyBench (২০২৩) — ১১ হাজারেরও বেশি প্রশ্নের একটি বিস্তৃত সংকলন, যা পরীক্ষা করে যে মডেল কতটা সামঞ্জস্যপূর্ণভাবে অগ্রহণযোগ্য বিষয়বস্তু এবং ক্ষতিকর পরামর্শ তৈরি করা এড়িয়ে চলে, উস্কানিমূলক অনুরোধের ক্ষেত্রেও[18]

সীমাবদ্ধতা ও প্রাসঙ্গিক সমস্যাগুলি

  • ডেটা দূষণ: মূল্যায়নের বিশ্বাসযোগ্যতার প্রধান হুমকি হল প্রশিক্ষণ ডেটাসেটে পরীক্ষার ডেটা ফাঁস হওয়া। মডেল কেবল উত্তর মুখস্থ করে ফেলতে পারে, যা কৃত্রিমভাবে তার ফলাফল বাড়িয়ে দেয়[2]
  • বেঞ্চমার্ক স্যাচুরেশন: মডেলের বিকাশের সাথে সাথে পুরনো বেঞ্চমার্কে (যেমন GLUE) তাদের কার্যকারিতা সীমায় পৌঁছায় এবং পরীক্ষাটি নতুন, আরও শক্তিশালী মডেলগুলির মধ্যে পার্থক্য করার জন্য আর কার্যকর থাকে না। এর জন্য ক্রমাগত আরও জটিল মানদণ্ড তৈরি করা প্রয়োজন[2]
  • বাস্তবতার সাথে ব্যবধান: বেঞ্চমার্কে উচ্চ ফলাফল সবসময় বাস্তব, অসংগঠিত পরিস্থিতিতে মডেলের নির্ভরযোগ্য কার্যক্ষমতার নিশ্চয়তা দেয় না। বাস্তব পরিবেশ প্রায়ই যেকোনো নির্দিষ্ট কাজের সংকলনের চেয়ে বেশি বৈচিত্র্যময় ও অনির্দেশ্য[1]

তথ্যসূত্র

  • Open LLM Leaderboard — Hugging Face সমাজের পক্ষ থেকে মডেলের উন্মুক্ত রেটিং
  • Chatbot Arena Leaderboard — মানুষের পছন্দের ভিত্তিতে চ্যাট মডেলের রেটিং

পাদটীকা

  1. 1.0 1.1 «What Are LLM Benchmarks?». IBM. [১]
  2. 2.0 2.1 2.2 «20 LLM evaluation benchmarks and how they work». Evidently AI. [২]
  3. Wang, Alex; Singh, Amanpreet; Michael, Julian; et al. «GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding». arXiv. [৪]
  4. Wang, Alex; Pruksachatkun, Yada; Nangia, Nikita; et al. «SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems». arXiv. [৫]
  5. Sakaguchi, Keisuke; Le Bras, Ronan; Bhagavatula, Chandra; Choi, Yejin. «WinoGrande: An Adversarial Winograd Schema Challenge at Scale». arXiv. [৬]
  6. Hendrycks, Dan; Burns, Collin; Basart, Steven; et al. «Measuring Massive Multitask Language Understanding». arXiv. [৭]
  7. Srivastava, Aarohi; et al. «Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models». arXiv. [৮]
  8. Zellers, Rowan; Holtzman, Ari; Bisk, Yonatan; et al. «HellaSwag: Can a Machine Really Finish Your Sentence?». arXiv. [৯]
  9. Lin, Stephanie; Hilton, Jacob; Evans, Owain. «TruthfulQA: Measuring How Models Mimic Human Falsehoods». arXiv. [১০]
  10. Cobbe, Karl; Kosaraju, Vineet; Bavarian, Mohammad; et al. «Training Verifiers to Solve Math Word Problems». arXiv. [১১]
  11. Hendrycks, Dan; Burns, Collin; Saund, Saurav; et al. «Measuring Mathematical Problem Solving With the MATH Dataset». arXiv. [১২]
  12. Chen, Mark; Tworek, Jerry; Jun, Heewoo; et al. «Evaluating Large Language Models Trained on Code». arXiv. [১৩]
  13. Jimenez, Carlos E.; et al. «SWE-bench: Can Language Models Resolve Real-World GitHub Issues?». arXiv. [১৪]
  14. Chiang, Wei-Lin; et al. «Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preferences». lmsys.org. [১৫]
  15. Zheng, Lianmin; et al. «Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena». arXiv. [১৬]
  16. Andriushchenko, Maksym; et al. «AgentHarm: A Benchmark for Asessing Agentic AI Harm». arXiv. [১৭]
  17. Zhang, Zhexin; et al. «SafetyBench: A Comprehensive Benchmark for Evaluating the Safety of Large Language Models». arXiv. [১৮]