---
title: "LLM benchmarks — LLM বেঞ্চমার্ক"
source: "https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A6%AC%E0%A7%87%E0%A6%9E%E0%A7%8D%E0%A6%9A%E0%A6%AE%E0%A6%BE%E0%A6%B0%E0%A7%8D%E0%A6%95"
wiki: "systems-analysis.info/int"
article: "LLM_benchmarks_—_LLM_বেঞ্চমার্ক"
language: "bn"
categories:
  - "Category:Bengali"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 3586
wiki_created_at: 2026-09-06T23:23:00Z
wiki_modified_at: 2026-09-06T23:23:00Z
downloaded_at: 2026-09-07T22:57:44Z
---

# LLM benchmarks — LLM বেঞ্চমার্ক

**বৃহৎ ভাষা মডেলের বেঞ্চমার্ক** — এগুলি হল মানসম্পন্ন পরীক্ষার সংকলন, যা বৃহৎ ভাষা মডেলের (LLM) গুণমান ও সক্ষমতা পরিমাপ, তুলনা এবং মূল্যায়নের জন্য তৈরি করা হয়েছে<sup>[\[1\]](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A6%AC%E0%A7%87%E0%A6%9E%E0%A7%8D%E0%A6%9A%E0%A6%AE%E0%A6%BE%E0%A6%B0%E0%A7%8D%E0%A6%95#cite_note-ibm-benchmarks-1)</sup>। সাধারণত প্রতিটি বেঞ্চমার্ক হল একটি নির্দিষ্ট কাজের সংকলন (যেমন প্রশ্ন, পাঠ্য বা নির্দেশনা), যেগুলির সঠিক উত্তর বা মূল্যায়নের মানদণ্ড আগে থেকেই জানা থাকে। এই পদ্ধতি একই পরিস্থিতিতে বিভিন্ন মডেলের মধ্যে বস্তুনিষ্ঠ তুলনা নিশ্চিত করে, যা ক্ষেত্রটির অগ্রগতি অনুসরণ করতে এবং মডেলগুলির শক্তি ও দুর্বলতা চিহ্নিত করতে সাহায্য করে<sup>[\[2\]](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A6%AC%E0%A7%87%E0%A6%9E%E0%A7%8D%E0%A6%9A%E0%A6%AE%E0%A6%BE%E0%A6%B0%E0%A7%8D%E0%A6%95#cite_note-evidently-guide-2)</sup>।

বেঞ্চমার্কের নিয়মিত ব্যবহার LLM-এর বিকাশে গুরুত্বপূর্ণ ভূমিকা পালন করে — এটি ডেভেলপারদের মডেল উন্নত করতে অনুপ্রাণিত করে এবং বৈজ্ঞানিক সমাজে ফলাফলের স্বচ্ছতা ও তুলনাযোগ্যতা নিশ্চিত করে। বেঞ্চমার্কের বিবর্তন LLM-এরই বিকাশকে প্রতিফলিত করে: ভাষা বোঝার সহজ কাজ থেকে শুরু করে বহু-স্তরীয় যুক্তি, সাধারণ জ্ঞান, নৈতিকতা এবং নিরাপত্তা পরীক্ষাকারী জটিল পরীক্ষা পর্যন্ত<sup>[\[3\]](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A6%AC%E0%A7%87%E0%A6%9E%E0%A7%8D%E0%A6%9A%E0%A6%AE%E0%A6%BE%E0%A6%B0%E0%A7%8D%E0%A6%95#cite_note-habr-popular-llm-3)</sup>।

## মূল বিভাগ ও উদাহরণ

LLM বেঞ্চমার্ক বিভিন্ন দক্ষতা ও প্রয়োগের ক্ষেত্র অন্তর্ভুক্ত করে। নিচে মূল বিভাগগুলি এবং প্রতিটিতে সবচেয়ে পরিচিত কাজের সংকলনগুলি আলোচনা করা হয়েছে।

### সাধারণ ভাষা বোঝার সক্ষমতা

এই বিভাগ প্রাকৃতিক ভাষা বোঝা ও ব্যাখ্যা করার ক্ষেত্রে মডেলের মৌলিক সক্ষমতা মূল্যায়ন করে।

- **GLUE** (General Language Understanding Evaluation, ২০১৯) — প্রথম দিককার একটি ব্যাপক বেঞ্চমার্ক, যাতে বিভিন্ন ধরনের কাজ অন্তর্ভুক্ত রয়েছে: মনোভাব নির্ধারণ থেকে শুরু করে পাঠ্যের যৌক্তিক সংযোগ মূল্যায়ন পর্যন্ত। সব কাজের ফলাফল একটি একক স্কোরে একত্রিত হয়, যা প্রাথমিক মডেলগুলিকে তাদের সামগ্রিক কার্যকারিতার ভিত্তিতে তুলনা করার সুযোগ দিয়েছিল<sup>[\[4\]](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A6%AC%E0%A7%87%E0%A6%9E%E0%A7%8D%E0%A6%9A%E0%A6%AE%E0%A6%BE%E0%A6%B0%E0%A7%8D%E0%A6%95#cite_note-wang2019glue-4)</sup>।
- **SuperGLUE** (২০১৯) — GLUE-এর একটি "উন্নত" উত্তরসূরি, যা এই কারণে তৈরি করা হয়েছিল যে মডেলগুলি দ্রুত GLUE-তে মানুষের কাছাকাছি স্তরে পৌঁছে গিয়েছিল। SuperGLUE-তে আরও কঠিন কাজ রয়েছে, যেগুলির জন্য প্রসঙ্গের গভীর বোঝাপড়া এবং সিদ্ধান্ত নেওয়ার দক্ষতা প্রয়োজন<sup>[\[5\]](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A6%AC%E0%A7%87%E0%A6%9E%E0%A7%8D%E0%A6%9A%E0%A6%AE%E0%A6%BE%E0%A6%B0%E0%A7%8D%E0%A6%95#cite_note-wang2019superglue-5)</sup>।
- **WinoGrande** (২০১৯) — Winograd Schema কুইজের একটি বিস্তারিত সংস্করণ। এতে ৪৪ হাজার প্রশ্ন রয়েছে যেখানে বাক্যে অস্পষ্ট সর্বনামের সঠিক ব্যাখ্যা বেছে নিতে সাধারণ জ্ঞান প্রয়োজন<sup>[\[6\]](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A6%AC%E0%A7%87%E0%A6%9E%E0%A7%8D%E0%A6%9A%E0%A6%AE%E0%A6%BE%E0%A6%B0%E0%A7%8D%E0%A6%95#cite_note-sakaguchi2019-6)</sup>।

### বহু-কাজ ও জটিল বেঞ্চমার্ক

এই সংকলনগুলি মডেলগুলিকে বিস্তৃত জ্ঞান ও দক্ষতার উপর পরীক্ষা করে, যা নিছক ভাষাগত কাজের সীমার বাইরে যায়।

- **MMLU** (Massive Multitask Language Understanding, ২০২০) — কুইজ আকারে ৫৭টি বিষয়ের কাজের সংকলন: স্কুলের বিষয় থেকে শুরু করে অত্যন্ত বিশেষায়িত পেশাদার জ্ঞান পর্যন্ত (আইন, চিকিৎসা)। MMLU মডেলের জ্ঞানের বিস্তার পরিমাপ করে<sup>[\[7\]](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A6%AC%E0%A7%87%E0%A6%9E%E0%A7%8D%E0%A6%9A%E0%A6%AE%E0%A6%BE%E0%A6%B0%E0%A7%8D%E0%A6%95#cite_note-hendrycks2020mmlu-7)</sup>।
- **BIG-bench** (Beyond the Imitation Game Benchmark, ২০২২) — তৈরির সময় সবচেয়ে বড় সহযোগিতামূলক বেঞ্চমার্ক, যা ৪০০-এরও বেশি লেখক দ্বারা তৈরি। এতে ভাষাবিজ্ঞান থেকে পদার্থবিজ্ঞান পর্যন্ত বিভিন্ন বিষয়ে ২০০-এরও বেশি কাজ রয়েছে, যা মডেলগুলিকে শাব্লোনিক মিলের বাইরে পরীক্ষা করে এবং অপ্রচলিত পরিস্থিতিতে তাদের সীমা উন্মোচন করে<sup>[\[8\]](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A6%AC%E0%A7%87%E0%A6%9E%E0%A7%8D%E0%A6%9A%E0%A6%AE%E0%A6%BE%E0%A6%B0%E0%A7%8D%E0%A6%95#cite_note-srivastava2022bigbench-8)</sup>।

### সাধারণ জ্ঞান ও সত্যবাদিতা

এই বেঞ্চমার্কগুলি দৈনন্দিন পরিস্থিতি সম্পর্কে যুক্তিসঙ্গত সিদ্ধান্তে আসার এবং মিথ্যা তথ্য ছড়ানো এড়ানোর ক্ষেত্রে মডেলের সক্ষমতা মূল্যায়ন করে।

- **HellaSwag** (২০১৯) — একটি পরিস্থিতির বর্ণনার জন্য সবচেয়ে বিশ্বাসযোগ্য সমাপ্তি বেছে নেওয়ার কাজের মাধ্যমে সাধারণ জ্ঞান পরীক্ষা করে। এই বেঞ্চমার্কের বৈশিষ্ট্য হল "ফাঁদ" থাকা: ভুল উত্তরগুলি স্বয়ংক্রিয়ভাবে তৈরি এবং অত্যন্ত বিশ্বাসযোগ্য দেখায়, যার জন্য মডেলের প্রসঙ্গের গভীর বোঝাপড়া প্রয়োজন<sup>[\[9\]](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A6%AC%E0%A7%87%E0%A6%9E%E0%A7%8D%E0%A6%9A%E0%A6%AE%E0%A6%BE%E0%A6%B0%E0%A7%8D%E0%A6%95#cite_note-zellers2019hellaswag-9)</sup>।
- **TruthfulQA** (২০২১) — জনপ্রিয় মিথ ও ভুল ধারণা ছড়ানোর প্রতি মডেলের প্রবণতা পরিমাপ করে। এতে এমন প্রশ্ন রয়েছে যেখানে ইন্টারনেটে প্রচলিত উত্তর ভুল (যেমন, "ভ্যাকসিন কি অটিজম সৃষ্টি করে?")। মডেলকে মিথ্যা ধারণার ফাঁদে না পড়ে সত্যিকারের সঠিক উত্তর দিতে হবে<sup>[\[10\]](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A6%AC%E0%A7%87%E0%A6%9E%E0%A7%8D%E0%A6%9A%E0%A6%AE%E0%A6%BE%E0%A6%B0%E0%A7%8D%E0%A6%95#cite_note-lin2021truthfulqa-10)</sup>।

### গাণিতিক সমস্যা

- **GSM8K** (২০২১) — প্রাথমিক বিদ্যালয় স্তরের হাজার হাজার গাণিতিক শব্দ সমস্যা অন্তর্ভুক্ত করে। প্রতিটি সমস্যার সমাধানের জন্য ২–৮টি পাটিগণিতের ধাপ সম্পন্ন করতে হয়, যা মডেলের বহু-স্তরীয় যুক্তির সক্ষমতা পরীক্ষা করে<sup>[\[11\]](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A6%AC%E0%A7%87%E0%A6%9E%E0%A7%8D%E0%A6%9A%E0%A6%AE%E0%A6%BE%E0%A6%B0%E0%A7%8D%E0%A6%95#cite_note-cobbe2021gsm8k-11)</sup>।
- **MATH** (২০২১) — আরও জটিল একটি সংকলন, যা গণিত অলিম্পিয়াড ও প্রতিযোগিতার সমস্যা নিয়ে গঠিত। এতে বীজগণিত, জ্যামিতি ও সংখ্যা তত্ত্বের বিভাগ রয়েছে, যার জন্য মডেলের অ-তুচ্ছ সমাধান পদ্ধতির দক্ষতা প্রয়োজন<sup>[\[12\]](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A6%AC%E0%A7%87%E0%A6%9E%E0%A7%8D%E0%A6%9A%E0%A6%AE%E0%A6%BE%E0%A6%B0%E0%A7%8D%E0%A6%95#cite_note-hendrycks2021math-12)</sup>।

### প্রোগ্রাম কোড তৈরি

- **HumanEval** (২০২১) — কোড লেখার ক্ষেত্রে LLM-এর সক্ষমতা মূল্যায়নের জন্য একটি মানক পরীক্ষা। এতে ১৬৪টি প্রোগ্রামিং কাজ রয়েছে, যেখানে মডেলকে দেওয়া বিবরণ অনুযায়ী সঠিক Python কোড তৈরি করতে হবে। সঠিকতা ইউনিট পরীক্ষার মাধ্যমে মূল্যায়ন করা হয়<sup>[\[13\]](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A6%AC%E0%A7%87%E0%A6%9E%E0%A7%8D%E0%A6%9A%E0%A6%AE%E0%A6%BE%E0%A6%B0%E0%A7%8D%E0%A6%95#cite_note-chen2021humaneval-13)</sup>।
- **SWE-bench** (২০২৩) — আরও বাস্তবসম্মত একটি বেঞ্চমার্ক, যা GitHub থেকে বাস্তব সমস্যার (*issues*) বিবরণ সংগ্রহ করে। মডেলকে একটি প্যাচ (কোড খণ্ড) তৈরি করতে হবে যা সমস্যাটি সমাধান করে। এর জন্য বিপুল পরিমাণ অন্যের কোড বোঝা এবং জটিল ধাপে-ধাপে যুক্তি প্রয়োগের দক্ষতা প্রয়োজন<sup>[\[14\]](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A6%AC%E0%A7%87%E0%A6%9E%E0%A7%8D%E0%A6%9A%E0%A6%AE%E0%A6%BE%E0%A6%B0%E0%A7%8D%E0%A6%95#cite_note-jimenez2023swebench-14)</sup>।

### ডায়ালগ মডেলের মূল্যায়ন

- **Chatbot Arena** (২০২৪) — একটি উন্মুক্ত অনলাইন প্ল্যাটফর্ম যেখানে দুটি বেনামী মডেল ব্যবহারকারীর সাথে জোড়া কথোপকথনে অংশ নেয়। কথোপকথনের পরে ব্যবহারকারী ভোট দেন কার উত্তর ভালো ছিল। এই ধরনের হাজার হাজার "দ্বন্দ্বের" ভিত্তিতে ব্যবহারকারীর পছন্দের একটি Elo রেটিং তৈরি হয়, যা সরাসরি কথোপকথনে মডেলের গুণমান প্রতিফলিত করে<sup>[\[15\]](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A6%AC%E0%A7%87%E0%A6%9E%E0%A7%8D%E0%A6%9A%E0%A6%AE%E0%A6%BE%E0%A6%B0%E0%A7%8D%E0%A6%95#cite_note-chiang2024chatbot-15)</sup>।
- **MT-Bench** (২০২৩) — ডায়ালগ দক্ষতার স্ট্রেস-টেস্টিংয়ের জন্য একটি স্বয়ংক্রিয় বেঞ্চমার্ক। এতে বহু-পর্যায়ের কথোপকথন অনুকরণ করে ৮০ জোড়া প্রশ্ন রয়েছে। মডেলের উত্তরগুলি আরেকটি, আরও শক্তিশালী LLM ("LLM-as-a-judge", যেমন GPT-4) দ্বারা পূর্বনির্ধারিত স্কেলে মূল্যায়ন করা হয়<sup>[\[16\]](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A6%AC%E0%A7%87%E0%A6%9E%E0%A7%8D%E0%A6%9A%E0%A6%AE%E0%A6%BE%E0%A6%B0%E0%A7%8D%E0%A6%95#cite_note-zheng2023mtbench-16)</sup>।

### নিরাপত্তা ও নির্ভরযোগ্যতা

- **AgentHarm** (২০২৪) — একটি বেঞ্চমার্ক যা LLM এজেন্টদের বিপজ্জনক নির্দেশনা পালন করার প্রবণতা মূল্যায়ন করে। এতে ১১০টি পরিস্থিতি রয়েছে যা দুরভিসন্ধিমূলক কাজ উপস্থাপন করে (প্রতারণা থেকে সাইবার অপরাধ পর্যন্ত)। একটি ভালো মডেলকে এই ধরনের অনুরোধ প্রত্যাখ্যান করতে হবে<sup>[\[17\]](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A6%AC%E0%A7%87%E0%A6%9E%E0%A7%8D%E0%A6%9A%E0%A6%AE%E0%A6%BE%E0%A6%B0%E0%A7%8D%E0%A6%95#cite_note-andriushchenko2024agentharm-17)</sup>।
- **SafetyBench** (২০২৩) — ১১ হাজারেরও বেশি প্রশ্নের একটি বিস্তৃত সংকলন, যা পরীক্ষা করে যে মডেল কতটা সামঞ্জস্যপূর্ণভাবে অগ্রহণযোগ্য বিষয়বস্তু এবং ক্ষতিকর পরামর্শ তৈরি করা এড়িয়ে চলে, উস্কানিমূলক অনুরোধের ক্ষেত্রেও<sup>[\[18\]](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A6%AC%E0%A7%87%E0%A6%9E%E0%A7%8D%E0%A6%9A%E0%A6%AE%E0%A6%BE%E0%A6%B0%E0%A7%8D%E0%A6%95#cite_note-zhang2023safetybench-18)</sup>।

## সীমাবদ্ধতা ও প্রাসঙ্গিক সমস্যাগুলি

- **ডেটা দূষণ**: মূল্যায়নের বিশ্বাসযোগ্যতার প্রধান হুমকি হল প্রশিক্ষণ ডেটাসেটে পরীক্ষার ডেটা ফাঁস হওয়া। মডেল কেবল উত্তর মুখস্থ করে ফেলতে পারে, যা কৃত্রিমভাবে তার ফলাফল বাড়িয়ে দেয়<sup>[\[2\]](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A6%AC%E0%A7%87%E0%A6%9E%E0%A7%8D%E0%A6%9A%E0%A6%AE%E0%A6%BE%E0%A6%B0%E0%A7%8D%E0%A6%95#cite_note-evidently-guide-2)</sup>।
- **বেঞ্চমার্ক স্যাচুরেশন**: মডেলের বিকাশের সাথে সাথে পুরনো বেঞ্চমার্কে (যেমন GLUE) তাদের কার্যকারিতা সীমায় পৌঁছায় এবং পরীক্ষাটি নতুন, আরও শক্তিশালী মডেলগুলির মধ্যে পার্থক্য করার জন্য আর কার্যকর থাকে না। এর জন্য ক্রমাগত আরও জটিল মানদণ্ড তৈরি করা প্রয়োজন<sup>[\[2\]](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A6%AC%E0%A7%87%E0%A6%9E%E0%A7%8D%E0%A6%9A%E0%A6%AE%E0%A6%BE%E0%A6%B0%E0%A7%8D%E0%A6%95#cite_note-evidently-guide-2)</sup>।
- **বাস্তবতার সাথে ব্যবধান**: বেঞ্চমার্কে উচ্চ ফলাফল সবসময় বাস্তব, অসংগঠিত পরিস্থিতিতে মডেলের নির্ভরযোগ্য কার্যক্ষমতার নিশ্চয়তা দেয় না। বাস্তব পরিবেশ প্রায়ই যেকোনো নির্দিষ্ট কাজের সংকলনের চেয়ে বেশি বৈচিত্র্যময় ও অনির্দেশ্য<sup>[\[1\]](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A6%AC%E0%A7%87%E0%A6%9E%E0%A7%8D%E0%A6%9A%E0%A6%AE%E0%A6%BE%E0%A6%B0%E0%A7%8D%E0%A6%95#cite_note-ibm-benchmarks-1)</sup>।

## তথ্যসূত্র

- Open LLM Leaderboard — Hugging Face সমাজের পক্ষ থেকে মডেলের উন্মুক্ত রেটিং
- Chatbot Arena Leaderboard — মানুষের পছন্দের ভিত্তিতে চ্যাট মডেলের রেটিং

## পাদটীকা

1.  <span id="cite_note-ibm-benchmarks-1">↑ <sup>[1.0](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A6%AC%E0%A7%87%E0%A6%9E%E0%A7%8D%E0%A6%9A%E0%A6%AE%E0%A6%BE%E0%A6%B0%E0%A7%8D%E0%A6%95#cite_ref-ibm-benchmarks_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A6%AC%E0%A7%87%E0%A6%9E%E0%A7%8D%E0%A6%9A%E0%A6%AE%E0%A6%BE%E0%A6%B0%E0%A7%8D%E0%A6%95#cite_ref-ibm-benchmarks_1-1)</sup> «What Are LLM Benchmarks?». *IBM*. <a href="https://www.ibm.com/think/topics/llm-benchmarks" class="external autonumber" rel="nofollow">[১]</a></span>
2.  <span id="cite_note-evidently-guide-2">↑ <sup>[2.0](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A6%AC%E0%A7%87%E0%A6%9E%E0%A7%8D%E0%A6%9A%E0%A6%AE%E0%A6%BE%E0%A6%B0%E0%A7%8D%E0%A6%95#cite_ref-evidently-guide_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A6%AC%E0%A7%87%E0%A6%9E%E0%A7%8D%E0%A6%9A%E0%A6%AE%E0%A6%BE%E0%A6%B0%E0%A7%8D%E0%A6%95#cite_ref-evidently-guide_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A6%AC%E0%A7%87%E0%A6%9E%E0%A7%8D%E0%A6%9A%E0%A6%AE%E0%A6%BE%E0%A6%B0%E0%A7%8D%E0%A6%95#cite_ref-evidently-guide_2-2)</sup> «20 LLM evaluation benchmarks and how they work». *Evidently AI*. <a href="https://www.evidentlyai.com/llm-guide/llm-benchmarks" class="external autonumber" rel="nofollow">[২]</a></span>
3.  <span id="cite_note-habr-popular-llm-3">[↑](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A6%AC%E0%A7%87%E0%A6%9E%E0%A7%8D%E0%A6%9A%E0%A6%AE%E0%A6%BE%E0%A6%B0%E0%A7%8D%E0%A6%95#cite_ref-habr-popular-llm_3-0) «Самые популярные LLM бенчмарки». *Хабр*. <a href="https://habr.com/ru/articles/844974/" class="external autonumber" rel="nofollow">[৩]</a></span>
4.  <span id="cite_note-wang2019glue-4">[↑](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A6%AC%E0%A7%87%E0%A6%9E%E0%A7%8D%E0%A6%9A%E0%A6%AE%E0%A6%BE%E0%A6%B0%E0%A7%8D%E0%A6%95#cite_ref-wang2019glue_4-0) Wang, Alex; Singh, Amanpreet; Michael, Julian; et al. «GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding». *arXiv*. <a href="https://arxiv.org/abs/1804.07461" class="external autonumber" rel="nofollow">[৪]</a></span>
5.  <span id="cite_note-wang2019superglue-5">[↑](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A6%AC%E0%A7%87%E0%A6%9E%E0%A7%8D%E0%A6%9A%E0%A6%AE%E0%A6%BE%E0%A6%B0%E0%A7%8D%E0%A6%95#cite_ref-wang2019superglue_5-0) Wang, Alex; Pruksachatkun, Yada; Nangia, Nikita; et al. «SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems». *arXiv*. <a href="https://arxiv.org/abs/1905.00537" class="external autonumber" rel="nofollow">[৫]</a></span>
6.  <span id="cite_note-sakaguchi2019-6">[↑](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A6%AC%E0%A7%87%E0%A6%9E%E0%A7%8D%E0%A6%9A%E0%A6%AE%E0%A6%BE%E0%A6%B0%E0%A7%8D%E0%A6%95#cite_ref-sakaguchi2019_6-0) Sakaguchi, Keisuke; Le Bras, Ronan; Bhagavatula, Chandra; Choi, Yejin. «WinoGrande: An Adversarial Winograd Schema Challenge at Scale». *arXiv*. <a href="https://arxiv.org/abs/1907.10641" class="external autonumber" rel="nofollow">[৬]</a></span>
7.  <span id="cite_note-hendrycks2020mmlu-7">[↑](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A6%AC%E0%A7%87%E0%A6%9E%E0%A7%8D%E0%A6%9A%E0%A6%AE%E0%A6%BE%E0%A6%B0%E0%A7%8D%E0%A6%95#cite_ref-hendrycks2020mmlu_7-0) Hendrycks, Dan; Burns, Collin; Basart, Steven; et al. «Measuring Massive Multitask Language Understanding». *arXiv*. <a href="https://arxiv.org/abs/2009.03300" class="external autonumber" rel="nofollow">[৭]</a></span>
8.  <span id="cite_note-srivastava2022bigbench-8">[↑](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A6%AC%E0%A7%87%E0%A6%9E%E0%A7%8D%E0%A6%9A%E0%A6%AE%E0%A6%BE%E0%A6%B0%E0%A7%8D%E0%A6%95#cite_ref-srivastava2022bigbench_8-0) Srivastava, Aarohi; et al. «Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models». *arXiv*. <a href="https://arxiv.org/abs/2206.04615" class="external autonumber" rel="nofollow">[৮]</a></span>
9.  <span id="cite_note-zellers2019hellaswag-9">[↑](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A6%AC%E0%A7%87%E0%A6%9E%E0%A7%8D%E0%A6%9A%E0%A6%AE%E0%A6%BE%E0%A6%B0%E0%A7%8D%E0%A6%95#cite_ref-zellers2019hellaswag_9-0) Zellers, Rowan; Holtzman, Ari; Bisk, Yonatan; et al. «HellaSwag: Can a Machine Really Finish Your Sentence?». *arXiv*. <a href="https://arxiv.org/abs/1905.07830" class="external autonumber" rel="nofollow">[৯]</a></span>
10. <span id="cite_note-lin2021truthfulqa-10">[↑](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A6%AC%E0%A7%87%E0%A6%9E%E0%A7%8D%E0%A6%9A%E0%A6%AE%E0%A6%BE%E0%A6%B0%E0%A7%8D%E0%A6%95#cite_ref-lin2021truthfulqa_10-0) Lin, Stephanie; Hilton, Jacob; Evans, Owain. «TruthfulQA: Measuring How Models Mimic Human Falsehoods». *arXiv*. <a href="https://arxiv.org/abs/2109.07958" class="external autonumber" rel="nofollow">[১০]</a></span>
11. <span id="cite_note-cobbe2021gsm8k-11">[↑](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A6%AC%E0%A7%87%E0%A6%9E%E0%A7%8D%E0%A6%9A%E0%A6%AE%E0%A6%BE%E0%A6%B0%E0%A7%8D%E0%A6%95#cite_ref-cobbe2021gsm8k_11-0) Cobbe, Karl; Kosaraju, Vineet; Bavarian, Mohammad; et al. «Training Verifiers to Solve Math Word Problems». *arXiv*. <a href="https://arxiv.org/abs/2110.14168" class="external autonumber" rel="nofollow">[১১]</a></span>
12. <span id="cite_note-hendrycks2021math-12">[↑](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A6%AC%E0%A7%87%E0%A6%9E%E0%A7%8D%E0%A6%9A%E0%A6%AE%E0%A6%BE%E0%A6%B0%E0%A7%8D%E0%A6%95#cite_ref-hendrycks2021math_12-0) Hendrycks, Dan; Burns, Collin; Saund, Saurav; et al. «Measuring Mathematical Problem Solving With the MATH Dataset». *arXiv*. <a href="https://arxiv.org/abs/2103.03874" class="external autonumber" rel="nofollow">[১২]</a></span>
13. <span id="cite_note-chen2021humaneval-13">[↑](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A6%AC%E0%A7%87%E0%A6%9E%E0%A7%8D%E0%A6%9A%E0%A6%AE%E0%A6%BE%E0%A6%B0%E0%A7%8D%E0%A6%95#cite_ref-chen2021humaneval_13-0) Chen, Mark; Tworek, Jerry; Jun, Heewoo; et al. «Evaluating Large Language Models Trained on Code». *arXiv*. <a href="https://arxiv.org/abs/2107.03374" class="external autonumber" rel="nofollow">[১৩]</a></span>
14. <span id="cite_note-jimenez2023swebench-14">[↑](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A6%AC%E0%A7%87%E0%A6%9E%E0%A7%8D%E0%A6%9A%E0%A6%AE%E0%A6%BE%E0%A6%B0%E0%A7%8D%E0%A6%95#cite_ref-jimenez2023swebench_14-0) Jimenez, Carlos E.; et al. «SWE-bench: Can Language Models Resolve Real-World GitHub Issues?». *arXiv*. <a href="https://arxiv.org/abs/2310.06770" class="external autonumber" rel="nofollow">[১৪]</a></span>
15. <span id="cite_note-chiang2024chatbot-15">[↑](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A6%AC%E0%A7%87%E0%A6%9E%E0%A7%8D%E0%A6%9A%E0%A6%AE%E0%A6%BE%E0%A6%B0%E0%A7%8D%E0%A6%95#cite_ref-chiang2024chatbot_15-0) Chiang, Wei-Lin; et al. «Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preferences». *lmsys.org*. <a href="https://lmsys.org/blog/2023-05-03-arena/" class="external autonumber" rel="nofollow">[১৫]</a></span>
16. <span id="cite_note-zheng2023mtbench-16">[↑](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A6%AC%E0%A7%87%E0%A6%9E%E0%A7%8D%E0%A6%9A%E0%A6%AE%E0%A6%BE%E0%A6%B0%E0%A7%8D%E0%A6%95#cite_ref-zheng2023mtbench_16-0) Zheng, Lianmin; et al. «Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena». *arXiv*. <a href="https://arxiv.org/abs/2306.05685" class="external autonumber" rel="nofollow">[১৬]</a></span>
17. <span id="cite_note-andriushchenko2024agentharm-17">[↑](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A6%AC%E0%A7%87%E0%A6%9E%E0%A7%8D%E0%A6%9A%E0%A6%AE%E0%A6%BE%E0%A6%B0%E0%A7%8D%E0%A6%95#cite_ref-andriushchenko2024agentharm_17-0) Andriushchenko, Maksym; et al. «AgentHarm: A Benchmark for Asessing Agentic AI Harm». *arXiv*. <a href="https://arxiv.org/abs/2402.12249" class="external autonumber" rel="nofollow">[১৭]</a></span>
18. <span id="cite_note-zhang2023safetybench-18">[↑](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A6%AC%E0%A7%87%E0%A6%9E%E0%A7%8D%E0%A6%9A%E0%A6%AE%E0%A6%BE%E0%A6%B0%E0%A7%8D%E0%A6%95#cite_ref-zhang2023safetybench_18-0) Zhang, Zhexin; et al. «SafetyBench: A Comprehensive Benchmark for Evaluating the Safety of Large Language Models». *arXiv*. <a href="https://arxiv.org/abs/2309.07045" class="external autonumber" rel="nofollow">[১৮]</a></span>
