---
title: "LLM evaluation — বৃহৎ ভাষা মডেলের মূল্যায়ন"
source: "https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%AE%E0%A7%82%E0%A6%B2%E0%A7%8D%E0%A6%AF%E0%A6%BE%E0%A6%AF%E0%A6%BC%E0%A6%A8"
wiki: "systems-analysis.info/int"
article: "LLM_evaluation_—_বৃহৎ_ভাষা_মডেলের_মূল্যায়ন"
language: "bn"
categories:
  - "Category:Bengali"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:LLM evaluation"
  - "Category:Machine learning"
revision_id: 3625
wiki_created_at: 2026-09-06T23:23:35Z
wiki_modified_at: 2026-09-06T23:23:35Z
downloaded_at: 2026-09-07T22:57:57Z
---

# LLM evaluation — বৃহৎ ভাষা মডেলের মূল্যায়ন

**বৃহৎ ভাষা মডেলের (LLM) মূল্যায়ন** — কৃত্রিম বুদ্ধিমত্তার একটি শাখা যা ভাষা মডেলের সক্ষমতা, সীমাবদ্ধতা এবং ঝুঁকি পরিমাপের জন্য মানসম্পন্ন পদ্ধতি নিশ্চিত করে<sup>[\[1\]](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%AE%E0%A7%82%E0%A6%B2%E0%A7%8D%E0%A6%AF%E0%A6%BE%E0%A6%AF%E0%A6%BC%E0%A6%A8#cite_note-chang2023-1)</sup>। যেহেতু LLM স্বাস্থ্যসেবা ও অর্থায়নের মতো গুরুত্বপূর্ণ ক্ষেত্রে একীভূত হচ্ছে, তাই নিরাপত্তা, নির্ভরযোগ্যতা এবং ন্যায্যতা নিশ্চিত করতে এগুলোর নিরপেক্ষ মূল্যায়ন অপরিহার্য হয়ে উঠেছে<sup>[\[2\]](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%AE%E0%A7%82%E0%A6%B2%E0%A7%8D%E0%A6%AF%E0%A6%BE%E0%A6%AF%E0%A6%BC%E0%A6%A8#cite_note-ccl-survey-2)</sup>।

LLM মূল্যায়ন বেশ কিছু মৌলিক কার্য সম্পাদন করে:

- সক্ষমতা পরিমাপ: মানসম্পন্ন কাজে বিভিন্ন মডেলের কর্মক্ষমতার বস্তুনিষ্ঠ তুলনা।
- অগ্রগতি পর্যবেক্ষণ: অর্জনসমূহ নথিভুক্ত করা এবং আরও উন্নতির প্রয়োজন এমন ক্ষেত্র চিহ্নিত করা।
- ঝুঁকি হ্রাসকরণ: পক্ষপাত, hallucination এবং নিরাপত্তা সমস্যার মতো সম্ভাব্য ক্ষতিকর ফলাফল শনাক্ত করা।
- ডেভেলপার ও ব্যবহারকারীদের অবহিত করা: কোনো নির্দিষ্ট অ্যাপ্লিকেশনের জন্য সবচেয়ে উপযুক্ত মডেল বেছে নিতে স্বচ্ছ তথ্য সরবরাহ করা।

## মূল পদ্ধতি ও পদ্ধতিমালা

আধুনিক LLM মূল্যায়ন শুরু হয়েছিল **GLUE** (General Language Understanding Evaluation)-এর মতো ব্যাপক benchmark-এর আবির্ভাবের মাধ্যমে, যা সাধারণ ভাষা বোঝার মূল্যায়নের মান নির্ধারণ করেছিল<sup>[\[3\]](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%AE%E0%A7%82%E0%A6%B2%E0%A7%8D%E0%A6%AF%E0%A6%BE%E0%A6%AF%E0%A6%BC%E0%A6%A8#cite_note-wang2018-3)</sup>। যখন মডেলগুলো GLUE-তে মানবিক ফলাফলকে ছাড়িয়ে যেতে শুরু করল, তখন **SuperGLUE**-এর মতো আরও জটিল উত্তরসূরি তৈরি করা হয়েছিল<sup>[\[4\]](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%AE%E0%A7%82%E0%A6%B2%E0%A7%8D%E0%A6%AF%E0%A6%BE%E0%A6%AF%E0%A6%BC%E0%A6%A8#cite_note-understanding-benchmarks-4)</sup>।

একটি মৌলিক পরিবর্তন ঘটে **MMLU** ও **BIG-bench**-এর মতো বহু-কাজের benchmark প্রবর্তনের সাথে, যা মডেলগুলোকে বিস্তৃত জ্ঞান ও যুক্তির সক্ষমতায় পরীক্ষা করে — শুধু ভাষাগত কাজের সীমা ছাড়িয়ে<sup>[\[1\]](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%AE%E0%A7%82%E0%A6%B2%E0%A7%8D%E0%A6%AF%E0%A6%BE%E0%A6%AF%E0%A6%BC%E0%A6%A8#cite_note-chang2023-1)</sup>।

### মূল মেট্রিক্স ও benchmark

#### স্বয়ংক্রিয় মেট্রিক্স

- **Perplexity** (পার্পলেক্সিটি): একটি মৌলিক মেট্রিক যা পরিমাপ করে মডেল কতটা ভালোভাবে টেক্সট পূর্বাভাস দেয়। কম perplexity মানে মডেলের পূর্বাভাসে বেশি আস্থা।
- **BLEU** ও **ROUGE**: n-gram ভিত্তিক মেট্রিক যা উৎপন্ন ও রেফারেন্স টেক্সটের মধ্যে শাব্দিক মিল পরিমাপ করে। BLEU নির্ভুলতার উপর মনোযোগ দেয়, ROUGE সম্পূর্ণতার উপর<sup>[\[2\]](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%AE%E0%A7%82%E0%A6%B2%E0%A7%8D%E0%A6%AF%E0%A6%BE%E0%A6%AF%E0%A6%BC%E0%A6%A8#cite_note-ccl-survey-2)</sup>।
- **BERTScore**: একটি শব্দার্থিক মেট্রিক যা শব্দার্থিক সাদৃশ্য গণনার জন্য BERT থেকে embedding ব্যবহার করে। এটি প্রতিশব্দ ও পুনর্বিন্যাস ধরতে সক্ষম, যা এটিকে n-gram ভিত্তিক মেট্রিকের চেয়ে আরও সঠিক করে তোলে<sup>[\[5\]](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%AE%E0%A7%82%E0%A6%B2%E0%A7%8D%E0%A6%AF%E0%A6%BE%E0%A6%AF%E0%A6%BC%E0%A6%A8#cite_note-zhang2019-bertscore-5)</sup>।

#### বিশেষায়িত benchmark

নির্দিষ্ট সক্ষমতা মূল্যায়নের জন্য লক্ষ্যভিত্তিক benchmark তৈরি করা হয়েছে:

- **কোড জেনারেশন**: **HumanEval** টেক্সট বিবরণ থেকে সঠিক প্রোগ্রাম কোড তৈরি করার মডেলের সক্ষমতা মূল্যায়ন করে, ইউনিট টেস্টের মাধ্যমে এর কার্যকারিতা যাচাই করে<sup>[\[6\]](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%AE%E0%A7%82%E0%A6%B2%E0%A7%8D%E0%A6%AF%E0%A6%BE%E0%A6%AF%E0%A6%BC%E0%A6%A8#cite_note-chen2021-humaneval-6)</sup>।
- **সাধারণ জ্ঞান**: **HellaSwag** একটি সাধারণ পরিস্থিতির সবচেয়ে সম্ভাব্য সমাপ্তি অনুমানের মাধ্যমে ভৌত জগৎ ও কার্যকারণ সম্পর্ক বোঝার ক্ষমতা পরীক্ষা করে<sup>[\[7\]](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%AE%E0%A7%82%E0%A6%B2%E0%A7%8D%E0%A6%AF%E0%A6%BE%E0%A6%AF%E0%A6%BC%E0%A6%A8#cite_note-zellers2019-hellaswag-7)</sup>।
- **একাডেমিক জ্ঞান**: **MMLU** (Massive Multitask Language Understanding) প্রাথমিক গণিত থেকে আইন ও চিকিৎসাবিদ্যা পর্যন্ত ৫৭টি বিষয় অন্তর্ভুক্ত করে মডেলের জ্ঞানের বিস্তৃতি যাচাই করে<sup>[\[8\]](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%AE%E0%A7%82%E0%A6%B2%E0%A7%8D%E0%A6%AF%E0%A6%BE%E0%A6%AF%E0%A6%BC%E0%A6%A8#cite_note-hendrycks2020-mmlu-8)</sup>।
- **সক্ষমতার সীমানা**: **BIG-bench** (Beyond the Imitation Game) একটি সহযোগিতামূলক প্রকল্প যা ২০৪টি কাজ নিয়ে গঠিত, যা মডেলে emergent সক্ষমতা — অর্থাৎ মডেল একটি সংকটজনক স্কেলে পৌঁছানোর পরে হঠাৎ আবির্ভূত হওয়া দক্ষতা — চিহ্নিত করতে ডিজাইন করা হয়েছে<sup>[\[9\]](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%AE%E0%A7%82%E0%A6%B2%E0%A7%8D%E0%A6%AF%E0%A6%BE%E0%A6%AF%E0%A6%BC%E0%A6%A8#cite_note-srivastava2022-bigbench-9)</sup>।

### নিরাপত্তা ও নৈতিক দিকের মূল্যায়ন

- **পক্ষপাত**: সামাজিক ও জনতাত্ত্বিক পক্ষপাত মূল্যায়নের জন্য **BBQ** (Bias Benchmark for Question Answering) ও **BOLD** (Bias in Open-ended Language generation Dataset)-এর মতো dataset ব্যবহার করা হয়।
- **বিষাক্ততা**: **RealToxicityPrompts**-এর মতো benchmark বিষাক্ত কন্টেন্ট তৈরিকে উৎসাহিত করে এমন অনুরোধ সরবরাহ করে মডেলের স্থিতিস্থাপকতা মূল্যায়ন করে।
- **দৃঢ়তা (Robustness)**: প্রতিকূল আক্রমণের মাধ্যমে মূল্যায়ন করা হয়। **PromptRobust** framework প্রতীক, শব্দ ও বাক্য স্তরে মডেলের দৃঢ়তা যাচাইয়ের জন্য একটি ব্যাপক প্রম্পট সেট সরবরাহ করে।

### আধুনিক মান ও framework

- **HELM** (Holistic Evaluation of Language Models): স্ট্যানফোর্ড বিশ্ববিদ্যালয়ের একটি উদ্যোগ যা "সামগ্রিক" পদ্ধতি প্রস্তাব করে। HELM মডেলগুলোকে একাধিক মাত্রায় মূল্যায়ন করে: নির্ভুলতা, দৃঢ়তা, ন্যায্যতা, পক্ষপাত, বিষাক্ততা এবং দক্ষতা<sup>[\[10\]](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%AE%E0%A7%82%E0%A6%B2%E0%A7%8D%E0%A6%AF%E0%A6%BE%E0%A6%AF%E0%A6%BC%E0%A6%A8#cite_note-bommasani2022-helm-10)</sup>।
- **ISO/IEC 42001:2023**: AI ব্যবস্থাপনা সিস্টেমের জন্য প্রথম আন্তর্জাতিক মান, যা সম্পূর্ণ জীবনচক্র জুড়ে AI পরিচালনার প্রয়োজনীয়তা নির্ধারণ করে।
- **EU AI Act (বিধিমালা ২০২৪/১৬৮৯)**: AI-এর প্রথম ব্যাপক নিয়ন্ত্রণ যা পদ্ধতিগত ঝুঁকি সহ সাধারণ উদ্দেশ্যের মডেলগুলির জন্য মানসম্পন্ন মূল্যায়নের প্রয়োজন রাখে।
- **NIST AI Risk Management Framework 1.0**: মার্কিন যুক্তরাষ্ট্রের ন্যাশনাল ইন্সটিটিউট অব স্ট্যান্ডার্ডস অ্যান্ড টেকনোলজি কর্তৃক তৈরি একটি স্বেচ্ছামূলক framework যা নির্ভরযোগ্য AI উন্নয়ন ও মোতায়েনের জন্য।

## বিদ্যমান পদ্ধতির সমস্যা ও সীমাবদ্ধতা

- **Benchmark স্যাচুরেশন**: অনেক মডেল জনপ্রিয় benchmark-এ প্রায় নিখুঁত স্কোর অর্জন করে, যা "benchmark অনুসরণ" নামক ঘটনার দিকে নিয়ে যায়, যেখানে মডেলগুলো সাধারণ সক্ষমতার পরিবর্তে নির্দিষ্ট পরীক্ষার জন্য অপ্টিমাইজ করা হয়।
- **ডেটা দূষণ**: একটি গুরুত্বপূর্ণ সমস্যা যেখানে benchmark-এর পরীক্ষার ডেটা দুর্ঘটনাক্রমে প্রশিক্ষণ সেটে অন্তর্ভুক্ত হয়, যার ফলে মূল্যায়নের ফলাফল স্ফীত ও অসৎ হয়।
- **মানবিক বিচারের সাথে দুর্বল সম্পর্ক**: BLEU ও ROUGE-এর মতো স্বয়ংক্রিয় মেট্রিক প্রায়শই মানবিক গুণমান মূল্যায়নের সাথে দুর্বল সম্পর্ক দেখায়, বিশেষত সৃজনশীল ও মুক্ত কাজে।

## সাম্প্রতিক গবেষণা ও প্রবণতা

- **LLM-as-a-Judge প্যারাডাইম**: অন্যান্য মডেলের উত্তর মূল্যায়নের জন্য শক্তিশালী LLM (যেমন GPT-4)-কে "বিচারক" হিসেবে ব্যবহার করা। এই পদ্ধতি ব্যয়বহুল মানবিক মূল্যায়নের একটি মাপযোগ্য বিকল্প প্রদান করে।
- **গতিশীল ও অভিযোজিত মূল্যায়ন**: **LMArena**-এর মতো প্ল্যাটফর্ম ব্যবহারকারীদের সাথে সরাসরি মিথস্ক্রিয়ায় মডেলের বাস্তব মূল্যায়নের জন্য Elo রেটিং সহ একটি ক্রাউডসোর্সড সিস্টেম উপস্থাপন করে।
- **হাইব্রিড পদ্ধতি**: মডেলের কর্মক্ষমতার আরও সম্পূর্ণ ও নির্ভরযোগ্য চিত্র পেতে স্বয়ংক্রিয় মেট্রিক, মানবিক বিচার এবং LLM মূল্যায়নের সমন্বয়।

LLM মূল্যায়নের ভূদৃশ্য বিবর্তিত হতে থাকে, বহুমাত্রিক, মানসম্পন্ন ও পুনরুৎপাদনযোগ্য framework তৈরির দিকে এগিয়ে যাচ্ছে, যা শুধু নির্ভুলতা নয়, AI প্রযুক্তির প্রয়োগের সামাজিক ও নৈতিক দিকগুলোও বিবেচনা করে<sup>[\[1\]](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%AE%E0%A7%82%E0%A6%B2%E0%A7%8D%E0%A6%AF%E0%A6%BE%E0%A6%AF%E0%A6%BC%E0%A6%A8#cite_note-chang2023-1)</sup>।

## তথ্যসূত্র

- Stanford HELM — Holistic Evaluation of Language Models প্রকল্পের অফিশিয়াল সাইট।
- Chatbot Arena — মানবিক পছন্দের ভিত্তিতে চ্যাটবট তুলনামূলক মূল্যায়নের প্ল্যাটফর্ম।

## সাহিত্য

- Wang, A. et al. (2018). *GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding*. arXiv:1804.07461.
- Zhang, T. et al. (2019). *BERTScore: Evaluating Text Generation with BERT*. arXiv:1904.09675.
- Wang, A. et al. (2019). *SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems*. arXiv:1905.00537.
- Zellers, R. et al. (2019). *HellaSwag: Can a Machine Really Finish Your Sentence?*. arXiv:1905.07830.
- Hendrycks, D. et al. (2020). *Measuring Massive Multitask Language Understanding*. arXiv:2009.03300.
- Gehman, S. et al. (2020). *RealToxicityPrompts: Evaluating Neural Toxic Degeneration in Language Models*. arXiv:2009.11462.
- Chen, M. et al. (2021). *Evaluating Large Language Models Trained on Code*. arXiv:2107.03374.
- Parrish, A. et al. (2021). *BBQ: A Hand-Built Bias Benchmark for Question Answering*. arXiv:2110.08193.
- Dhamala, J. et al. (2021). *BOLD: Dataset and Metrics for Measuring Biases in Open-Ended Language Generation*. arXiv:2101.11718.
- Srivastava, A. et al. (2022). *Beyond the Imitation Game: Quantifying and Extrapolating the Capabilities of Language Models*. arXiv:2206.04615.
- Bommasani, R. et al. (2022). *Holistic Evaluation of Language Models*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Zhuang, Y. et al. (2023). *Through the Lens of Core Competency: Survey on Evaluation of Large Language Models*. ACL Anthology:2023.ccl-2.8.
- Zhu, K. et al. (2023). *PromptRobust: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts*. arXiv:2306.04528.

## টীকা

1.  <span id="cite_note-chang2023-1">↑ <sup>[1.0](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%AE%E0%A7%82%E0%A6%B2%E0%A7%8D%E0%A6%AF%E0%A6%BE%E0%A6%AF%E0%A6%BC%E0%A6%A8#cite_ref-chang2023_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%AE%E0%A7%82%E0%A6%B2%E0%A7%8D%E0%A6%AF%E0%A6%BE%E0%A6%AF%E0%A6%BC%E0%A6%A8#cite_ref-chang2023_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%AE%E0%A7%82%E0%A6%B2%E0%A7%8D%E0%A6%AF%E0%A6%BE%E0%A6%AF%E0%A6%BC%E0%A6%A8#cite_ref-chang2023_1-2)</sup> Chang, Y., et al. (2023). «A Survey on Evaluation of Large Language Models». *arXiv*. <a href="https://arxiv.org/abs/2307.03109" class="external autonumber" rel="nofollow">[১]</a></span>
2.  <span id="cite_note-ccl-survey-2">↑ <sup>[2.0](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%AE%E0%A7%82%E0%A6%B2%E0%A7%8D%E0%A6%AF%E0%A6%BE%E0%A6%AF%E0%A6%BC%E0%A6%A8#cite_ref-ccl-survey_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%AE%E0%A7%82%E0%A6%B2%E0%A7%8D%E0%A6%AF%E0%A6%BE%E0%A6%AF%E0%A6%BC%E0%A6%A8#cite_ref-ccl-survey_2-1)</sup> Zhuang, Y., et al. (2023). «Through the Lens of Core Competency: Survey on Evaluation of Large Language Models». *ACL Anthology*. <a href="https://aclanthology.org/2023.ccl-2.8/" class="external autonumber" rel="nofollow">[২]</a></span>
3.  <span id="cite_note-wang2018-3">[↑](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%AE%E0%A7%82%E0%A6%B2%E0%A7%8D%E0%A6%AF%E0%A6%BE%E0%A6%AF%E0%A6%BC%E0%A6%A8#cite_ref-wang2018_3-0) Wang, A., et al. (2018). «GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding». *arXiv*.<a href="https://arxiv.org/abs/1804.07461" class="external autonumber" rel="nofollow">[৩]</a></span>
4.  <span id="cite_note-understanding-benchmarks-4">[↑](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%AE%E0%A7%82%E0%A6%B2%E0%A7%8D%E0%A6%AF%E0%A6%BE%E0%A6%AF%E0%A6%BC%E0%A6%A8#cite_ref-understanding-benchmarks_4-0) Kumar, Pradosh. «Understanding Benchmarking in NLP: GLUE, SuperGLUE, HELM, MMLU, and BIG-Bench». *Medium*.</span>
5.  <span id="cite_note-zhang2019-bertscore-5">[↑](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%AE%E0%A7%82%E0%A6%B2%E0%A7%8D%E0%A6%AF%E0%A6%BE%E0%A6%AF%E0%A6%BC%E0%A6%A8#cite_ref-zhang2019-bertscore_5-0) Zhang, T., et al. (2019). «BERTScore: Evaluating Text Generation with BERT». *arXiv*.</span>
6.  <span id="cite_note-chen2021-humaneval-6">[↑](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%AE%E0%A7%82%E0%A6%B2%E0%A7%8D%E0%A6%AF%E0%A6%BE%E0%A6%AF%E0%A6%BC%E0%A6%A8#cite_ref-chen2021-humaneval_6-0) Chen, M., et al. (2021). «Evaluating Large Language Models Trained on Code». *arXiv*.</span>
7.  <span id="cite_note-zellers2019-hellaswag-7">[↑](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%AE%E0%A7%82%E0%A6%B2%E0%A7%8D%E0%A6%AF%E0%A6%BE%E0%A6%AF%E0%A6%BC%E0%A6%A8#cite_ref-zellers2019-hellaswag_7-0) Zellers, R., et al. (2019). «HellaSwag: Can a Machine Really Finish Your Sentence?». *arXiv*.</span>
8.  <span id="cite_note-hendrycks2020-mmlu-8">[↑](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%AE%E0%A7%82%E0%A6%B2%E0%A7%8D%E0%A6%AF%E0%A6%BE%E0%A6%AF%E0%A6%BC%E0%A6%A8#cite_ref-hendrycks2020-mmlu_8-0) Hendrycks, D., et al. (2020). «Measuring Massive Multitask Language Understanding». *arXiv*.</span>
9.  <span id="cite_note-srivastava2022-bigbench-9">[↑](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%AE%E0%A7%82%E0%A6%B2%E0%A7%8D%E0%A6%AF%E0%A6%BE%E0%A6%AF%E0%A6%BC%E0%A6%A8#cite_ref-srivastava2022-bigbench_9-0) Srivastava, A., et al. (2022). «Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models». *arXiv*.</span>
10. <span id="cite_note-bommasani2022-helm-10">[↑](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%E0%A6%AC%E0%A7%83%E0%A6%B9%E0%A7%8E_%E0%A6%AD%E0%A6%BE%E0%A6%B7%E0%A6%BE_%E0%A6%AE%E0%A6%A1%E0%A7%87%E0%A6%B2%E0%A7%87%E0%A6%B0_%E0%A6%AE%E0%A7%82%E0%A6%B2%E0%A7%8D%E0%A6%AF%E0%A6%BE%E0%A6%AF%E0%A6%BC%E0%A6%A8#cite_ref-bommasani2022-helm_10-0) Bommasani, R., et al. (2022). «Holistic Evaluation of Language Models». *arXiv*. <a href="https://arxiv.org/abs/2211.09110" class="external autonumber" rel="nofollow">[৪]</a></span>
