---
title: "LLM benchmarks — LLM बेंचमार्क"
source: "https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A4%AC%E0%A5%87%E0%A4%82%E0%A4%9A%E0%A4%AE%E0%A4%BE%E0%A4%B0%E0%A5%8D%E0%A4%95"
wiki: "systems-analysis.info/int"
article: "LLM_benchmarks_—_LLM_बेंचमार्क"
language: "hi"
categories:
  - "Category:Hindi"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 3585
wiki_created_at: 2026-09-06T23:22:59Z
wiki_modified_at: 2026-09-06T23:22:59Z
downloaded_at: 2026-09-07T22:57:43Z
---

# LLM benchmarks — LLM बेंचमार्क

**बड़े भाषा मॉडलों के बेंचमार्क** — ये मानकीकृत परीक्षण सेट हैं, जो बड़े भाषा मॉडलों (LLM) की गुणवत्ता और क्षमताओं को मापने, तुलना करने और मूल्यांकन करने के लिए बनाए गए हैं<sup>[\[1\]](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A4%AC%E0%A5%87%E0%A4%82%E0%A4%9A%E0%A4%AE%E0%A4%BE%E0%A4%B0%E0%A5%8D%E0%A4%95#cite_note-ibm-benchmarks-1)</sup>। आमतौर पर प्रत्येक benchmark एक निश्चित कार्य-समूह (जैसे प्रश्न, पाठ या निर्देश) होता है, जिसके लिए सही उत्तर या मूल्यांकन मानदंड पहले से ज्ञात होते हैं। यह दृष्टिकोण विभिन्न मॉडलों की एकसमान परिस्थितियों में वस्तुनिष्ठ तुलना सुनिश्चित करता है, जिससे क्षेत्र में प्रगति को ट्रैक किया जा सकता है और मॉडलों की शक्तियों एवं कमज़ोरियों की पहचान की जा सकती है<sup>[\[2\]](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A4%AC%E0%A5%87%E0%A4%82%E0%A4%9A%E0%A4%AE%E0%A4%BE%E0%A4%B0%E0%A5%8D%E0%A4%95#cite_note-evidently-guide-2)</sup>।

बेंचमार्क का नियमित उपयोग LLM के विकास में महत्वपूर्ण भूमिका निभाता है — यह डेवलपर्स को मॉडल सुधारने के लिए प्रेरित करता है और वैज्ञानिक समुदाय में परिणामों की पारदर्शिता और तुलनीयता सुनिश्चित करता है। बेंचमार्क का विकास LLM के विकास को ही दर्शाता है: भाषा-समझ के सरल कार्यों से लेकर बहु-चरणीय तर्क, सामान्य ज्ञान, नैतिकता और सुरक्षा को परखने वाले जटिल परीक्षणों तक<sup>[\[3\]](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A4%AC%E0%A5%87%E0%A4%82%E0%A4%9A%E0%A4%AE%E0%A4%BE%E0%A4%B0%E0%A5%8D%E0%A4%95#cite_note-habr-popular-llm-3)</sup>।

## मुख्य श्रेणियाँ और उदाहरण

LLM बेंचमार्क विविध कौशलों और उपयोग के क्षेत्रों को समाहित करते हैं। नीचे मुख्य श्रेणियाँ और उनमें सबसे प्रसिद्ध कार्य-समूहों पर चर्चा की गई है।

### सामान्य भाषा समझ

यह श्रेणी प्राकृतिक भाषा को समझने और व्याख्या करने की मॉडल की बुनियादी क्षमताओं का मूल्यांकन करती है।

- **GLUE** (General Language Understanding Evaluation, 2019) — पहले व्यापक बेंचमार्कों में से एक, जिसमें भावना-निर्धारण से लेकर पाठ की तार्किक संगति के मूल्यांकन तक विविध कार्य शामिल हैं। सभी कार्यों के परिणामों को एक समग्र अंक में एकत्रित किया जाता है, जिससे प्रारंभिक मॉडलों की कुल दक्षता की तुलना संभव हुई<sup>[\[4\]](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A4%AC%E0%A5%87%E0%A4%82%E0%A4%9A%E0%A4%AE%E0%A4%BE%E0%A4%B0%E0%A5%8D%E0%A4%95#cite_note-wang2019glue-4)</sup>।
- **SuperGLUE** (2019) — GLUE का "उन्नत" उत्तराधिकारी, जिसे इसलिए विकसित किया गया क्योंकि मॉडल जल्दी ही GLUE पर मानवीय स्तर के निकट पहुँच गए। SuperGLUE में अधिक कठिन कार्य शामिल हैं, जिनमें गहरी संदर्भ-समझ और निष्कर्ष निकालने की क्षमता आवश्यक है<sup>[\[5\]](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A4%AC%E0%A5%87%E0%A4%82%E0%A4%9A%E0%A4%AE%E0%A4%BE%E0%A4%B0%E0%A5%8D%E0%A4%95#cite_note-wang2019superglue-5)</sup>।
- **WinoGrande** (2019) — Winograd Schema प्रश्नोत्तरी का विस्तारित संस्करण। इसमें वाक्यों में अस्पष्ट सर्वनामों के समाधान के लिए 44 हजार कार्य हैं, जिनमें सही व्याख्या चुनने के लिए सामान्य बुद्धि आवश्यक है<sup>[\[6\]](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A4%AC%E0%A5%87%E0%A4%82%E0%A4%9A%E0%A4%AE%E0%A4%BE%E0%A4%B0%E0%A5%8D%E0%A4%95#cite_note-sakaguchi2019-6)</sup>।

### बहु-कार्य और जटिल बेंचमार्क

ये सेट मॉडलों को ज्ञान और कौशल की विस्तृत श्रृंखला पर परखते हैं, जो विशुद्ध भाषाई कार्यों से परे जाते हैं।

- **MMLU** (Massive Multitask Language Understanding, 2020) — प्रश्नोत्तरी रूप में कार्यों का संग्रह, जो 57 विषय क्षेत्रों को समाहित करता है: विद्यालयी विषयों से लेकर अत्यधिक विशिष्ट व्यावसायिक ज्ञान (कानून, चिकित्सा) तक। MMLU मॉडल की ज्ञान-विस्तार को मापता है<sup>[\[7\]](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A4%AC%E0%A5%87%E0%A4%82%E0%A4%9A%E0%A4%AE%E0%A4%BE%E0%A4%B0%E0%A5%8D%E0%A4%95#cite_note-hendrycks2020mmlu-7)</sup>।
- **BIG-bench** (Beyond the Imitation Game Benchmark, 2022) — निर्माण के समय सबसे बड़ा सहयोगी benchmark, जिसे 400 से अधिक लेखकों ने विकसित किया। इसमें भाषाविज्ञान से लेकर भौतिकी तक विविध विषयों पर 200 से अधिक कार्य शामिल हैं, ताकि मॉडलों को सांचेबद्ध उत्तरों से परे परखा जा सके और असामान्य परिस्थितियों में उनकी सीमाओं की पहचान की जा सके<sup>[\[8\]](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A4%AC%E0%A5%87%E0%A4%82%E0%A4%9A%E0%A4%AE%E0%A4%BE%E0%A4%B0%E0%A5%8D%E0%A4%95#cite_note-srivastava2022bigbench-8)</sup>।

### सामान्य बुद्धि और सत्यता

ये बेंचमार्क मॉडल की रोज़मर्रा की परिस्थितियों के बारे में तार्किक निष्कर्ष निकालने और झूठी जानकारी फैलाने से बचने की क्षमता का मूल्यांकन करते हैं।

- **HellaSwag** (2019) — किसी परिस्थिति के विवरण के लिए सबसे प्रशंसनीय समापन चुनने के कार्य के माध्यम से सामान्य बुद्धि की जाँच करता है। इस benchmark की विशेषता "जाल" का होना है: गलत उत्तर स्वचालित रूप से उत्पन्न किए जाते हैं और बहुत प्रशंसनीय लगते हैं, जिससे मॉडल को संदर्भ की गहरी समझ की आवश्यकता होती है<sup>[\[9\]](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A4%AC%E0%A5%87%E0%A4%82%E0%A4%9A%E0%A4%AE%E0%A4%BE%E0%A4%B0%E0%A5%8D%E0%A4%95#cite_note-zellers2019hellaswag-9)</sup>।
- **TruthfulQA** (2021) — प्रचलित मिथकों और भ्रांतियों को फैलाने की मॉडल की प्रवृत्ति को मापता है। इसमें ऐसे प्रश्न हैं जिनका इंटरनेट पर प्रचलित उत्तर गलत है (उदाहरण के लिए, "क्या टीके ऑटिज्म का कारण बनते हैं?")। मॉडल से अपेक्षा की जाती है कि वह झूठे रूढ़िवादी विचारों के प्रभाव में न आए और तथ्यात्मक रूप से सही उत्तर दे<sup>[\[10\]](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A4%AC%E0%A5%87%E0%A4%82%E0%A4%9A%E0%A4%AE%E0%A4%BE%E0%A4%B0%E0%A5%8D%E0%A4%95#cite_note-lin2021truthfulqa-10)</sup>।

### गणितीय समस्याएँ

- **GSM8K** (2021) — प्राथमिक विद्यालय स्तर की गणित की हजारों पाठ्य-समस्याएँ शामिल हैं। प्रत्येक समस्या को हल करने के लिए 2–8 अंकगणितीय चरणों की एक श्रृंखला की आवश्यकता होती है, जो मॉडल की बहु-चरणीय तर्क क्षमता की जाँच करती है<sup>[\[11\]](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A4%AC%E0%A5%87%E0%A4%82%E0%A4%9A%E0%A4%AE%E0%A4%BE%E0%A4%B0%E0%A5%8D%E0%A4%95#cite_note-cobbe2021gsm8k-11)</sup>।
- **MATH** (2021) — एक अधिक जटिल सेट, जिसमें गणितीय ओलंपियाड और प्रतियोगिताओं की समस्याएँ शामिल हैं। इसमें बीजगणित, ज्यामिति और संख्या सिद्धांत के खंड हैं, जिनके लिए मॉडल को गैर-तुच्छ समाधान विधियों में दक्षता आवश्यक है<sup>[\[12\]](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A4%AC%E0%A5%87%E0%A4%82%E0%A4%9A%E0%A4%AE%E0%A4%BE%E0%A4%B0%E0%A5%8D%E0%A4%95#cite_note-hendrycks2021math-12)</sup>।

### प्रोग्राम कोड निर्माण

- **HumanEval** (2021) — LLM की कोड लिखने की क्षमता के मूल्यांकन के लिए मानक परीक्षण। इसमें प्रोग्रामिंग की 164 समस्याएँ हैं, जहाँ मॉडल को दिए गए विवरण के अनुसार Python में सही कोड उत्पन्न करना होता है। शुद्धता का मूल्यांकन unit tests के माध्यम से किया जाता है<sup>[\[13\]](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A4%AC%E0%A5%87%E0%A4%82%E0%A4%9A%E0%A4%AE%E0%A4%BE%E0%A4%B0%E0%A5%8D%E0%A4%95#cite_note-chen2021humaneval-13)</sup>।
- **SWE-bench** (2023) — एक अधिक यथार्थवादी benchmark, जो GitHub से वास्तविक समस्याओं (*issues*) का विवरण एकत्रित करता है। मॉडल को समस्या को दूर करने वाला एक patch (कोड का टुकड़ा) उत्पन्न करना होता है। इसके लिए दूसरों के बड़ी मात्रा के कोड की समझ और जटिल चरण-दर-चरण तर्क की आवश्यकता होती है<sup>[\[14\]](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A4%AC%E0%A5%87%E0%A4%82%E0%A4%9A%E0%A4%AE%E0%A4%BE%E0%A4%B0%E0%A5%8D%E0%A4%95#cite_note-jimenez2023swebench-14)</sup>।

### संवाद मॉडलों का मूल्यांकन

- **Chatbot Arena** (2024) — एक खुला ऑनलाइन प्लेटफ़ॉर्म, जहाँ दो अनाम मॉडल उपयोगकर्ता के साथ युगल संवाद में भाग लेते हैं। संवाद के बाद उपयोगकर्ता मतदान करता है कि किसका उत्तर बेहतर था। हजारों ऐसी "द्वंद्वों" के आधार पर उपयोगकर्ता प्राथमिकताओं की Elo रेटिंग बनाई जाती है, जो लाइव संचार में मॉडलों की गुणवत्ता को दर्शाती है<sup>[\[15\]](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A4%AC%E0%A5%87%E0%A4%82%E0%A4%9A%E0%A4%AE%E0%A4%BE%E0%A4%B0%E0%A5%8D%E0%A4%95#cite_note-chiang2024chatbot-15)</sup>।
- **MT-Bench** (2023) — संवाद कौशल के तनाव-परीक्षण के लिए स्वचालित benchmark। इसमें बहु-चरणीय संवाद का अनुकरण करने वाले 80 प्रश्न-युगल हैं। मॉडलों के उत्तरों का मूल्यांकन एक अन्य, अधिक शक्तिशाली LLM द्वारा पूर्व-निर्धारित पैमाने पर किया जाता है ("LLM-as-a-judge", उदाहरण के लिए GPT-4)<sup>[\[16\]](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A4%AC%E0%A5%87%E0%A4%82%E0%A4%9A%E0%A4%AE%E0%A4%BE%E0%A4%B0%E0%A5%8D%E0%A4%95#cite_note-zheng2023mtbench-16)</sup>।

### सुरक्षा और विश्वसनीयता

- **AgentHarm** (2024) — LLM एजेंटों की खतरनाक निर्देशों का पालन करने की प्रवृत्ति का मूल्यांकन करने वाला benchmark। इसमें 110 परिदृश्य शामिल हैं जो दुर्भावनापूर्ण कार्यों का प्रतिनिधित्व करते हैं (धोखाधड़ी से लेकर साइबर अपराध तक)। एक अच्छे मॉडल को ऐसे अनुरोधों को अस्वीकार करना चाहिए<sup>[\[17\]](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A4%AC%E0%A5%87%E0%A4%82%E0%A4%9A%E0%A4%AE%E0%A4%BE%E0%A4%B0%E0%A5%8D%E0%A4%95#cite_note-andriushchenko2024agentharm-17)</sup>।
- **SafetyBench** (2023) — 11 हजार से अधिक प्रश्नों का व्यापक सेट, जो यह जाँचता है कि मॉडल अस्वीकार्य सामग्री और हानिकारक सलाह उत्पन्न करने से कितनी निरंतरता से बचता है, जिसमें उकसावे वाले अनुरोध भी शामिल हैं<sup>[\[18\]](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A4%AC%E0%A5%87%E0%A4%82%E0%A4%9A%E0%A4%AE%E0%A4%BE%E0%A4%B0%E0%A5%8D%E0%A4%95#cite_note-zhang2023safetybench-18)</sup>।

## सीमाएँ और वर्तमान समस्याएँ

- **डेटा संदूषण**: मूल्यांकन की विश्वसनीयता के लिए सबसे बड़ा खतरा — प्रशिक्षण सेट में परीक्षण डेटा का रिसाव। मॉडल केवल उत्तरों को याद कर सकता है, जिससे उसका परिणाम कृत्रिम रूप से बढ़ जाता है<sup>[\[2\]](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A4%AC%E0%A5%87%E0%A4%82%E0%A4%9A%E0%A4%AE%E0%A4%BE%E0%A4%B0%E0%A5%8D%E0%A4%95#cite_note-evidently-guide-2)</sup>।
- **बेंचमार्क संतृप्ति**: जैसे-जैसे मॉडल विकसित होते हैं, पुराने बेंचमार्क (जैसे GLUE) पर उनका प्रदर्शन अधिकतम सीमा तक पहुँच जाता है, और परीक्षण नए, अधिक शक्तिशाली मॉडलों में अंतर करने के लिए उपयोगी नहीं रह जाता। इसके लिए अधिक जटिल मानकों के निरंतर विकास की आवश्यकता होती है<sup>[\[2\]](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A4%AC%E0%A5%87%E0%A4%82%E0%A4%9A%E0%A4%AE%E0%A4%BE%E0%A4%B0%E0%A5%8D%E0%A4%95#cite_note-evidently-guide-2)</sup>।
- **वास्तविकता से अंतर**: बेंचमार्क पर उच्च परिणाम हमेशा वास्तविक, असंरचित परिदृश्यों में मॉडल के विश्वसनीय प्रदर्शन की गारंटी नहीं देते। वास्तविक वातावरण अक्सर किसी भी निश्चित कार्य-समूह से अधिक समृद्ध और अप्रत्याशित होता है<sup>[\[1\]](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A4%AC%E0%A5%87%E0%A4%82%E0%A4%9A%E0%A4%AE%E0%A4%BE%E0%A4%B0%E0%A5%8D%E0%A4%95#cite_note-ibm-benchmarks-1)</sup>।

## संदर्भ

- Open LLM Leaderboard — Hugging Face समुदाय द्वारा मॉडलों की खुली रेटिंग
- Chatbot Arena Leaderboard — मानवीय प्राथमिकताओं के आधार पर चैट मॉडलों की रेटिंग

## टिप्पणियाँ

1.  <span id="cite_note-ibm-benchmarks-1">↑ <sup>[1.0](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A4%AC%E0%A5%87%E0%A4%82%E0%A4%9A%E0%A4%AE%E0%A4%BE%E0%A4%B0%E0%A5%8D%E0%A4%95#cite_ref-ibm-benchmarks_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A4%AC%E0%A5%87%E0%A4%82%E0%A4%9A%E0%A4%AE%E0%A4%BE%E0%A4%B0%E0%A5%8D%E0%A4%95#cite_ref-ibm-benchmarks_1-1)</sup> «What Are LLM Benchmarks?». *IBM*. <a href="https://www.ibm.com/think/topics/llm-benchmarks" class="external autonumber" rel="nofollow">[१]</a></span>
2.  <span id="cite_note-evidently-guide-2">↑ <sup>[2.0](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A4%AC%E0%A5%87%E0%A4%82%E0%A4%9A%E0%A4%AE%E0%A4%BE%E0%A4%B0%E0%A5%8D%E0%A4%95#cite_ref-evidently-guide_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A4%AC%E0%A5%87%E0%A4%82%E0%A4%9A%E0%A4%AE%E0%A4%BE%E0%A4%B0%E0%A5%8D%E0%A4%95#cite_ref-evidently-guide_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A4%AC%E0%A5%87%E0%A4%82%E0%A4%9A%E0%A4%AE%E0%A4%BE%E0%A4%B0%E0%A5%8D%E0%A4%95#cite_ref-evidently-guide_2-2)</sup> «20 LLM evaluation benchmarks and how they work». *Evidently AI*. <a href="https://www.evidentlyai.com/llm-guide/llm-benchmarks" class="external autonumber" rel="nofollow">[२]</a></span>
3.  <span id="cite_note-habr-popular-llm-3">[↑](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A4%AC%E0%A5%87%E0%A4%82%E0%A4%9A%E0%A4%AE%E0%A4%BE%E0%A4%B0%E0%A5%8D%E0%A4%95#cite_ref-habr-popular-llm_3-0) «Самые популярные LLM бенчмарки». *Хабр*. <a href="https://habr.com/ru/articles/844974/" class="external autonumber" rel="nofollow">[३]</a></span>
4.  <span id="cite_note-wang2019glue-4">[↑](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A4%AC%E0%A5%87%E0%A4%82%E0%A4%9A%E0%A4%AE%E0%A4%BE%E0%A4%B0%E0%A5%8D%E0%A4%95#cite_ref-wang2019glue_4-0) Wang, Alex; Singh, Amanpreet; Michael, Julian; et al. «GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding». *arXiv*. <a href="https://arxiv.org/abs/1804.07461" class="external autonumber" rel="nofollow">[४]</a></span>
5.  <span id="cite_note-wang2019superglue-5">[↑](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A4%AC%E0%A5%87%E0%A4%82%E0%A4%9A%E0%A4%AE%E0%A4%BE%E0%A4%B0%E0%A5%8D%E0%A4%95#cite_ref-wang2019superglue_5-0) Wang, Alex; Pruksachatkun, Yada; Nangia, Nikita; et al. «SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems». *arXiv*. <a href="https://arxiv.org/abs/1905.00537" class="external autonumber" rel="nofollow">[५]</a></span>
6.  <span id="cite_note-sakaguchi2019-6">[↑](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A4%AC%E0%A5%87%E0%A4%82%E0%A4%9A%E0%A4%AE%E0%A4%BE%E0%A4%B0%E0%A5%8D%E0%A4%95#cite_ref-sakaguchi2019_6-0) Sakaguchi, Keisuke; Le Bras, Ronan; Bhagavatula, Chandra; Choi, Yejin. «WinoGrande: An Adversarial Winograd Schema Challenge at Scale». *arXiv*. <a href="https://arxiv.org/abs/1907.10641" class="external autonumber" rel="nofollow">[६]</a></span>
7.  <span id="cite_note-hendrycks2020mmlu-7">[↑](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A4%AC%E0%A5%87%E0%A4%82%E0%A4%9A%E0%A4%AE%E0%A4%BE%E0%A4%B0%E0%A5%8D%E0%A4%95#cite_ref-hendrycks2020mmlu_7-0) Hendrycks, Dan; Burns, Collin; Basart, Steven; et al. «Measuring Massive Multitask Language Understanding». *arXiv*. <a href="https://arxiv.org/abs/2009.03300" class="external autonumber" rel="nofollow">[७]</a></span>
8.  <span id="cite_note-srivastava2022bigbench-8">[↑](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A4%AC%E0%A5%87%E0%A4%82%E0%A4%9A%E0%A4%AE%E0%A4%BE%E0%A4%B0%E0%A5%8D%E0%A4%95#cite_ref-srivastava2022bigbench_8-0) Srivastava, Aarohi; et al. «Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models». *arXiv*. <a href="https://arxiv.org/abs/2206.04615" class="external autonumber" rel="nofollow">[८]</a></span>
9.  <span id="cite_note-zellers2019hellaswag-9">[↑](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A4%AC%E0%A5%87%E0%A4%82%E0%A4%9A%E0%A4%AE%E0%A4%BE%E0%A4%B0%E0%A5%8D%E0%A4%95#cite_ref-zellers2019hellaswag_9-0) Zellers, Rowan; Holtzman, Ari; Bisk, Yonatan; et al. «HellaSwag: Can a Machine Really Finish Your Sentence?». *arXiv*. <a href="https://arxiv.org/abs/1905.07830" class="external autonumber" rel="nofollow">[९]</a></span>
10. <span id="cite_note-lin2021truthfulqa-10">[↑](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A4%AC%E0%A5%87%E0%A4%82%E0%A4%9A%E0%A4%AE%E0%A4%BE%E0%A4%B0%E0%A5%8D%E0%A4%95#cite_ref-lin2021truthfulqa_10-0) Lin, Stephanie; Hilton, Jacob; Evans, Owain. «TruthfulQA: Measuring How Models Mimic Human Falsehoods». *arXiv*. <a href="https://arxiv.org/abs/2109.07958" class="external autonumber" rel="nofollow">[१०]</a></span>
11. <span id="cite_note-cobbe2021gsm8k-11">[↑](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A4%AC%E0%A5%87%E0%A4%82%E0%A4%9A%E0%A4%AE%E0%A4%BE%E0%A4%B0%E0%A5%8D%E0%A4%95#cite_ref-cobbe2021gsm8k_11-0) Cobbe, Karl; Kosaraju, Vineet; Bavarian, Mohammad; et al. «Training Verifiers to Solve Math Word Problems». *arXiv*. <a href="https://arxiv.org/abs/2110.14168" class="external autonumber" rel="nofollow">[११]</a></span>
12. <span id="cite_note-hendrycks2021math-12">[↑](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A4%AC%E0%A5%87%E0%A4%82%E0%A4%9A%E0%A4%AE%E0%A4%BE%E0%A4%B0%E0%A5%8D%E0%A4%95#cite_ref-hendrycks2021math_12-0) Hendrycks, Dan; Burns, Collin; Saund, Saurav; et al. «Measuring Mathematical Problem Solving With the MATH Dataset». *arXiv*. <a href="https://arxiv.org/abs/2103.03874" class="external autonumber" rel="nofollow">[१२]</a></span>
13. <span id="cite_note-chen2021humaneval-13">[↑](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A4%AC%E0%A5%87%E0%A4%82%E0%A4%9A%E0%A4%AE%E0%A4%BE%E0%A4%B0%E0%A5%8D%E0%A4%95#cite_ref-chen2021humaneval_13-0) Chen, Mark; Tworek, Jerry; Jun, Heewoo; et al. «Evaluating Large Language Models Trained on Code». *arXiv*. <a href="https://arxiv.org/abs/2107.03374" class="external autonumber" rel="nofollow">[१३]</a></span>
14. <span id="cite_note-jimenez2023swebench-14">[↑](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A4%AC%E0%A5%87%E0%A4%82%E0%A4%9A%E0%A4%AE%E0%A4%BE%E0%A4%B0%E0%A5%8D%E0%A4%95#cite_ref-jimenez2023swebench_14-0) Jimenez, Carlos E.; et al. «SWE-bench: Can Language Models Resolve Real-World GitHub Issues?». *arXiv*. <a href="https://arxiv.org/abs/2310.06770" class="external autonumber" rel="nofollow">[१४]</a></span>
15. <span id="cite_note-chiang2024chatbot-15">[↑](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A4%AC%E0%A5%87%E0%A4%82%E0%A4%9A%E0%A4%AE%E0%A4%BE%E0%A4%B0%E0%A5%8D%E0%A4%95#cite_ref-chiang2024chatbot_15-0) Chiang, Wei-Lin; et al. «Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preferences». *lmsys.org*. <a href="https://lmsys.org/blog/2023-05-03-arena/" class="external autonumber" rel="nofollow">[१५]</a></span>
16. <span id="cite_note-zheng2023mtbench-16">[↑](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A4%AC%E0%A5%87%E0%A4%82%E0%A4%9A%E0%A4%AE%E0%A4%BE%E0%A4%B0%E0%A5%8D%E0%A4%95#cite_ref-zheng2023mtbench_16-0) Zheng, Lianmin; et al. «Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena». *arXiv*. <a href="https://arxiv.org/abs/2306.05685" class="external autonumber" rel="nofollow">[१६]</a></span>
17. <span id="cite_note-andriushchenko2024agentharm-17">[↑](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A4%AC%E0%A5%87%E0%A4%82%E0%A4%9A%E0%A4%AE%E0%A4%BE%E0%A4%B0%E0%A5%8D%E0%A4%95#cite_ref-andriushchenko2024agentharm_17-0) Andriushchenko, Maksym; et al. «AgentHarm: A Benchmark for Asessing Agentic AI Harm». *arXiv*. <a href="https://arxiv.org/abs/2402.12249" class="external autonumber" rel="nofollow">[१७]</a></span>
18. <span id="cite_note-zhang2023safetybench-18">[↑](https://systems-analysis.info/int/LLM_benchmarks_%E2%80%94_LLM_%E0%A4%AC%E0%A5%87%E0%A4%82%E0%A4%9A%E0%A4%AE%E0%A4%BE%E0%A4%B0%E0%A5%8D%E0%A4%95#cite_ref-zhang2023safetybench_18-0) Zhang, Zhexin; et al. «SafetyBench: A Comprehensive Benchmark for Evaluating the Safety of Large Language Models». *arXiv*. <a href="https://arxiv.org/abs/2309.07045" class="external autonumber" rel="nofollow">[१८]</a></span>
