LLM quality metrics — LLM-এর মান পরিমাপের মেট্রিক্স

From Systems analysis Wiki
Jump to navigation Jump to search

বৃহৎ ভাষা মডেলের (LLM) মান পরিমাপের মেট্রিক্স — এটি একটি পদ্ধতিগত পদ্ধতি এবং মানসম্মত সরঞ্জামের সমষ্টি, যা ভাষা মডেলের বিভিন্ন দিক পরিমাপ করে, যার মধ্যে রয়েছে নির্ভুলতা, নিরাপত্তা, ন্যায্যতা এবং নির্ভরযোগ্যতা[1]। যেহেতু LLM স্বাস্থ্যসেবা, অর্থায়ন এবং শিক্ষার মতো গুরুত্বপূর্ণ ক্ষেত্রে ক্রমশ ব্যাপক প্রয়োগ পাচ্ছে, তাই এগুলোর সামগ্রিক ও বস্তুনিষ্ঠ মূল্যায়নের প্রয়োজনীয়তা তীব্রভাবে অনুভূত হচ্ছে[2]

মেট্রিক্স এবং benchmark কয়েকটি মূল কাজ সম্পাদন করে: এগুলো বিভিন্ন মডেলের মধ্যে বস্তুনিষ্ঠ তুলনা করতে, তাদের উন্নয়নের অগ্রগতি পর্যবেক্ষণ করতে, দুর্বলতা চিহ্নিত করতে এবং গবেষক ও চর্চাকারীদের জন্য ফলাফলের স্বচ্ছতা নিশ্চিত করতে সক্ষম করে[1]

মেট্রিক্সের শ্রেণিবিভাগ

LLM মূল্যায়নের জন্য মেট্রিক্সকে কয়েকটি প্রধান শ্রেণিতে ভাগ করা যায়: স্বয়ংক্রিয় মেট্রিক্স, মানব অংশগ্রহণে মূল্যায়ন এবং নিরাপত্তা ও নির্ভরযোগ্যতা মূল্যায়নের জন্য বিশেষায়িত মেট্রিক্স।

স্বয়ংক্রিয় মেট্রিক্স

এই মেট্রিক্সগুলো মানুষের অংশগ্রহণ ছাড়াই দ্রুত ও পরিমাপযোগ্য মূল্যায়ন পরিচালনার সুযোগ দেয়।

n-গ্রাম ভিত্তিক মেট্রিক্স

ঐতিহ্যগত মেট্রিক্স যা সৃষ্ট এবং রেফারেন্স পাঠ্যের মধ্যে শাব্দিক মিল পরিমাপ করে।

  • BLEU (Bilingual Evaluation Understudy): মূলত মেশিন অনুবাদের মান মূল্যায়নের জন্য তৈরি করা হয়েছিল। এটি n-গ্রামের (n শব্দের ক্রম) নির্ভুল মিল পরিমাপ করে এবং অতিরিক্ত সংক্ষিপ্ত সৃষ্ট পাঠ্যের জন্য জরিমানা প্রয়োগ করে[3]
  • ROUGE (Recall-Oriented Understudy for Gisting Evaluation): সম্পূর্ণতার উপর মনোযোগ দেয়, পরিমাপ করে যে রেফারেন্স পাঠ্যের n-গ্রামগুলো সৃষ্ট পাঠ্যে কতটা ভালোভাবে উপস্থিত। সারসংক্ষেপ কার্যের মূল্যায়নে বিশেষভাবে কার্যকর[3]
  • METEOR: BLEU-এর সক্ষমতা প্রসারিত করে, প্রতিশব্দ, একই মূলের শব্দ এবং রূপতাত্ত্বিক রূপান্তর বিবেচনা করে, যা মানবিক মূল্যায়নের সাথে আরও ভালো সম্পর্ক অর্জনে সক্ষম করে[3]

শব্দার্থিক মেট্রিক্স

এই মেট্রিক্সগুলো শুধু শাব্দিক মিল নয়, শব্দার্থিক নৈকট্য মূল্যায়ন করতে প্রাসঙ্গিক embedding ব্যবহার করে।

  • BERTScore: BERT মডেলের embedding ব্যবহার করে সৃষ্ট এবং রেফারেন্স পাঠ্যের token-গুলোর মধ্যে শব্দার্থিক সাদৃশ্য গণনা করে। এটি ভিন্ন প্রণালীবিন্যাসেও শব্দার্থিক সমতুল্যতা শনাক্ত করতে সক্ষম[4]
  • MAUVE: embedding-এর স্থানে মেশিন এবং মানব পাঠ্যের বিতরণের মধ্যে পার্থক্য পরিমাপ করে। মুক্ত প্রজন্ম মূল্যায়নের জন্য বিশেষভাবে কার্যকর, যেখানে কোনো নির্দিষ্ট রেফারেন্স পাঠ্য নেই[5]

ভাষা মডেলিংয়ের অভ্যন্তরীণ মেট্রিক্স

  • পারপ্লেক্সিটি (Perplexity): একটি মৌলিক মেট্রিক যা পরিমাপ করে ভাষা মডেল কতটা ভালো পাঠ্যের ক্রম পূর্বানুমান করতে পারে। এটি পরবর্তী token পূর্বানুমানে মডেলের অনিশ্চয়তা প্রতিফলিত করে। পারপ্লেক্সিটির নিম্নতর মান উন্নততর কার্যকারিতা নির্দেশ করে[6]
  • নির্ভুলতা এবং F1-মাপ: শ্রেণিবিভাগ কার্য এবং প্রশ্নোত্তর ব্যবস্থায় ব্যাপকভাবে প্রয়োগ করা হয়। F1-মাপ নির্ভুলতা এবং সম্পূর্ণতার মধ্যে হারমোনিক গড় হিসেবে প্রতিনিধিত্ব করে, সুষম মূল্যায়ন নিশ্চিত করে[6]

মানব অংশগ্রহণে মূল্যায়ন

মানবিক মূল্যায়ন 'স্বর্ণমান' হিসেবে রয়ে গেছে, কারণ স্বয়ংক্রিয় মেট্রিক্স প্রায়ই মানের সূক্ষ্ম দিকগুলো যেমন সংযোগ, সৃজনশীলতা এবং প্রাসঙ্গিকতা ধরতে পারে না[7]

  • প্রত্যক্ষ মূল্যায়ন: বিশেষজ্ঞ বা ক্রাউডসোর্সকারীরা একটি নির্ধারিত স্কেলে (যেমন ১ থেকে ৫) সাবলীলতা এবং সংযোগের মতো মানদণ্ডে প্রজন্মের মান মূল্যায়ন করেন।
  • তুলনামূলক মূল্যায়ন: মূল্যায়নকারীদের দুই বা ততোধিক মডেলের আউটপুট তুলনা করতে এবং সেরাটি বেছে নিতে (যুগল তুলনা) অথবা সেরা থেকে নিকৃষ্ট পর্যন্ত ক্রমবিন্যাস করতে বলা হয়।

মানবিক মূল্যায়নের অসুবিধাগুলো হলো উচ্চ ব্যয়, পরিমাপযোগ্যতার জটিলতা এবং বিষয়পরায়ণতা[7]

LLM-এর মাধ্যমে মূল্যায়ন (LLM-as-a-Judge)

এটি একটি নতুন পদ্ধতি, যেখানে একটি (সাধারণত আরও শক্তিশালী) ভাষা মডেল অন্যটির উত্তর মূল্যায়নের জন্য ব্যবহৃত হয়। উদাহরণস্বরূপ, GPT-4 নির্দিষ্ট মানদণ্ড অনুযায়ী মডেলের আউটপুটগুলো ক্রমবিন্যাস করতে পারে। এই পদ্ধতি মানবিক মূল্যায়নের একটি পরিমাপযোগ্য বিকল্প প্রদান করে, যদিও এর নিজস্ব সমস্যা রয়েছে, যেমন প্রম্পটের ধরনের প্রতি সংবেদনশীলতা এবং সম্ভাব্য পক্ষপাত[8]

বিশেষায়িত মেট্রিক্স এবং benchmark

LLM-এর কার্যকারিতা এবং নির্ভরযোগ্যতার নির্দিষ্ট দিক মূল্যায়নের জন্য বিশেষায়িত মেট্রিক্স এবং benchmark ব্যবহার করা হয়।

তথ্যগত নির্ভরযোগ্যতা

সত্যিকারের তথ্য তৈরি করার এবং হ্যালুসিনেশন এড়ানোর ক্ষেত্রে মডেলের সক্ষমতা মূল্যায়ন করে।

  • TruthfulQA: একটি benchmark যা বিশেষভাবে মডেলগুলোর প্রচলিত মিথ ও ভুল ধারণার উপর ভিত্তি করে উত্তর তৈরির প্রবণতা পরিমাপের জন্য তৈরি করা হয়েছে। মডেলের কাছ থেকে শুধু জনপ্রিয় নয়, তথ্যগতভাবে সঠিক উত্তর প্রদান করা প্রয়োজন[9]

নিরাপত্তা এবং নীতিশাস্ত্র

  • বিষাক্ততা মূল্যায়ন: আপত্তিকর বা ক্ষতিকর বিষয়বস্তুর উপস্থিতি পরিমাপ করে। এজন্য বিশেষায়িত শ্রেণিবিন্যাসকারী এবং API, যেমন Perspective API ব্যবহার করা হয়[9]
  • পক্ষপাত এবং ন্যায্যতা মূল্যায়ন: মডেল বিভিন্ন জনতাত্ত্বিক গোষ্ঠীর প্রতি বৈষম্যমূলক আচরণ প্রদর্শন করে কিনা তা মূল্যায়ন করে। গবেষণা দেখায় যে LLM প্রশিক্ষণ ডেটা থেকে সামাজিক স্টেরিওটাইপ সংরক্ষণ ও শক্তিশালী করতে পারে[10]
  • SafetyBench: নিরাপত্তা মূল্যায়নের জন্য একটি ব্যাপক benchmark, যার মধ্যে adversarial-আক্রমণের বিরুদ্ধে স্থিতিস্থাপকতা এবং ক্ষতিকর বিষয়বস্তু তৈরি এড়ানোর সক্ষমতা পরীক্ষা অন্তর্ভুক্ত[11]

সামগ্রিক benchmark

  • MMLU (Massive Multitask Language Understanding): সবচেয়ে ব্যাপকভাবে ব্যবহৃত benchmark-গুলোর মধ্যে একটি, যা প্রাথমিক গণিত থেকে আন্তর্জাতিক আইন পর্যন্ত ৫৭টি বিষয়ে বহু-পছন্দ প্রশ্ন অন্তর্ভুক্ত করে। এটি মডেলের জ্ঞানের বিস্তৃতি এবং গভীরতা মূল্যায়ন করে[12]
  • BIG-bench (Beyond the Imitation Game): ২০৪টিরও বেশি কার্য ধারণ করে যা স্বাভাবিক ভাষা মডেলের সক্ষমতার সীমার বাইরে যাওয়া দক্ষতা মূল্যায়নের জন্য তৈরি, দাবা খেলা থেকে ইমোজি অনুমান পর্যন্ত কার্য অন্তর্ভুক্ত[12]

চ্যালেঞ্জ এবং সীমাবদ্ধতা

  • সম্পর্কের সমস্যা: BLEU এবং ROUGE-এর মতো ঐতিহ্যগত স্বয়ংক্রিয় মেট্রিক্স প্রায়ই মানবিক মূল্যায়নের সাথে খারাপ সম্পর্ক রাখে, বিশেষত সৃজনশীল কার্যে[13]
  • ডেটা দূষণ (Data Contamination): ঝুঁকি রয়েছে যে benchmark-এর পরীক্ষা ডেটা মডেলের প্রশিক্ষণ সেটে অন্তর্ভুক্ত হয়ে যেতে পারে, যা অতিরিক্ত ও অবিশ্বস্ত মূল্যায়নের দিকে পরিচালিত করে[14]
  • বহুভাষিক মূল্যায়ন: বিদ্যমান বেশিরভাগ মেট্রিক্স এবং benchmark ইংরেজি ভাষায় কেন্দ্রীভূত, যা LLM-এর বহুভাষিক সক্ষমতা মূল্যায়নে তাদের প্রযোজ্যতা সীমিত করে[15]

তথ্যসূত্র

  • What Are LLM Benchmarks? — IBM-এর একটি সামগ্রিক নিবন্ধ
  • 20 LLM evaluation benchmarks and how they work — Evidently AI-এর benchmark সংক্রান্ত নির্দেশিকা

সাহিত্য

  • Papineni, K. et al. (2002). Bleu: a Method for Automatic Evaluation of Machine Translation. ACL:P02-1040.
  • Lin, C.-Y. (2004). ROUGE: A Package for Automatic Evaluation of Summaries. ACL:W04-1013.
  • Banerjee, S.; Lavie, A. (2005). METEOR: An Automatic Metric for MT Evaluation with Improved Correlation with Human Judgments. ACL:W05-0909.
  • Zhang, T. et al. (2019). BERTScore: Evaluating Text Generation with BERT. arXiv:1904.09675.
  • Pillutla, K. et al. (2021). MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers. arXiv:2102.01454.
  • Lin, S. et al. (2021). TruthfulQA: Measuring How Models Mimic Human Falsehoods. arXiv:2109.07958.
  • Parrish, A. et al. (2021). BBQ: A Hand-Built Bias Benchmark for Question Answering. arXiv:2110.08193.
  • Dhamala, J. et al. (2021). BOLD: Dataset and Metrics for Measuring Biases in Open-Ended Language Generation. arXiv:2101.11718.
  • Hendrycks, D. et al. (2020). Measuring Massive Multitask Language Understanding. arXiv:2009.03300.
  • Srivastava, A. et al. (2022). Beyond the Imitation Game: Quantifying and Extrapolating the Capabilities of Language Models. arXiv:2206.04615.
  • Zhang, Z. et al. (2023). SafetyBench: Evaluating the Safety of Large Language Models. arXiv:2309.07045.
  • Huang, H. et al. (2024). An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-Tuned Judge Model is not a General Substitute for GPT-4. arXiv:2403.02839.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Gu, J. et al. (2024). A Survey on LLM-as-a-Judge. arXiv:2411.15594.
  • Li, S. et al. (2025). LLMs Cannot Reliably Judge (Yet?): A Comprehensive Assessment on the Robustness of LLM-as-a-Judge. arXiv:2506.09443.

টীকা

  1. 1.0 1.1 «Метрики качества LLM». Perplexity AI.
  2. «Специализированные метрики безопасности». Perplexity AI.
  3. 3.0 3.1 3.2 «Традиционные метрики оценки текста». Perplexity AI.
  4. «Семантические метрики». Perplexity AI.
  5. «Метрики на основе распределений». Perplexity AI.
  6. 6.0 6.1 «Intrinsic метрики». Perplexity AI.
  7. 7.0 7.1 «Оценка с участием человека». Perplexity AI.
  8. «LLM-as-a-Judge». Perplexity AI.
  9. 9.0 9.1 «Специализированные метрики безопасности». Perplexity AI.
  10. «Предвзятость и справедливость». Perplexity AI.
  11. «Benchmark'ы безопасности». Perplexity AI.
  12. 12.0 12.1 «Comprehensive оценка». Perplexity AI.
  13. «Проблемы корреляции». Perplexity AI.
  14. «Загрязнение данных». Perplexity AI.
  15. «Многоязычная оценка». Perplexity AI.