---
title: "LLM evaluation — LLM का मूल्यांकन"
source: "https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_LLM_%E0%A4%95%E0%A4%BE_%E0%A4%AE%E0%A5%82%E0%A4%B2%E0%A5%8D%E0%A4%AF%E0%A4%BE%E0%A4%82%E0%A4%95%E0%A4%A8"
wiki: "systems-analysis.info/int"
article: "LLM_evaluation_—_LLM_का_मूल्यांकन"
language: "hi"
categories:
  - "Category:Hindi"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:LLM evaluation"
  - "Category:Machine learning"
revision_id: 3618
wiki_created_at: 2026-09-06T23:23:29Z
wiki_modified_at: 2026-09-06T23:23:29Z
downloaded_at: 2026-09-07T22:57:54Z
---

# LLM evaluation — LLM का मूल्यांकन

**बड़े भाषा मॉडलों (LLM) का मूल्यांकन** — कृत्रिम बुद्धिमत्ता के क्षेत्र में एक अनुशासन है, जो भाषा मॉडलों की क्षमताओं, सीमाओं और जोखिमों को मापने के लिए मानकीकृत विधियाँ प्रदान करता है<sup>[\[1\]](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_LLM_%E0%A4%95%E0%A4%BE_%E0%A4%AE%E0%A5%82%E0%A4%B2%E0%A5%8D%E0%A4%AF%E0%A4%BE%E0%A4%82%E0%A4%95%E0%A4%A8#cite_note-chang2023-1)</sup>। जैसे-जैसे LLM स्वास्थ्य सेवा और वित्त जैसे महत्वपूर्ण क्षेत्रों में एकीकृत होते जा रहे हैं, उनका वस्तुनिष्ठ मूल्यांकन सुरक्षा, विश्वसनीयता और निष्पक्षता सुनिश्चित करने के लिए आवश्यक हो गया है<sup>[\[2\]](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_LLM_%E0%A4%95%E0%A4%BE_%E0%A4%AE%E0%A5%82%E0%A4%B2%E0%A5%8D%E0%A4%AF%E0%A4%BE%E0%A4%82%E0%A4%95%E0%A4%A8#cite_note-ccl-survey-2)</sup>।

LLM का मूल्यांकन कई मूलभूत कार्य करता है:

- क्षमताओं का मापन: मानकीकृत कार्यों पर विभिन्न मॉडलों के प्रदर्शन की वस्तुनिष्ठ तुलना।
- प्रगति की निगरानी: उपलब्धियों को दर्ज करना और उन क्षेत्रों की पहचान करना जिनमें और सुधार की आवश्यकता है।
- जोखिम न्यूनीकरण: संभावित हानिकारक परिणामों की पहचान करना, जैसे कि पूर्वाग्रह, मतिभ्रम (hallucinations) और सुरक्षा संबंधी समस्याएँ।
- डेवलपर्स और उपयोगकर्ताओं को सूचित करना: किसी विशेष अनुप्रयोग के लिए सबसे उपयुक्त मॉडल चुनने हेतु पारदर्शी जानकारी प्रदान करना।

## मुख्य दृष्टिकोण और पद्धतियाँ

आधुनिक LLM मूल्यांकन की शुरुआत **GLUE** (General Language Understanding Evaluation) जैसे व्यापक benchmark के आगमन से हुई, जिसने सामान्य भाषा समझ के मूल्यांकन के लिए मानक स्थापित किया<sup>[\[3\]](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_LLM_%E0%A4%95%E0%A4%BE_%E0%A4%AE%E0%A5%82%E0%A4%B2%E0%A5%8D%E0%A4%AF%E0%A4%BE%E0%A4%82%E0%A4%95%E0%A4%A8#cite_note-wang2018-3)</sup>। जैसे-जैसे मॉडलों ने GLUE पर मानवीय परिणामों को पीछे छोड़ना शुरू किया, **SuperGLUE** जैसे अधिक जटिल उत्तरवर्ती benchmark विकसित किए गए<sup>[\[4\]](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_LLM_%E0%A4%95%E0%A4%BE_%E0%A4%AE%E0%A5%82%E0%A4%B2%E0%A5%8D%E0%A4%AF%E0%A4%BE%E0%A4%82%E0%A4%95%E0%A4%A8#cite_note-understanding-benchmarks-4)</sup>।

एक मूलभूत बदलाव **MMLU** और **BIG-bench** जैसे बहु-कार्य benchmark की शुरूआत के साथ आया, जो मॉडलों को व्यापक ज्ञान और तर्क क्षमताओं पर परखते हैं — और यह परीक्षण विशुद्ध भाषाई कार्यों से परे जाता है<sup>[\[1\]](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_LLM_%E0%A4%95%E0%A4%BE_%E0%A4%AE%E0%A5%82%E0%A4%B2%E0%A5%8D%E0%A4%AF%E0%A4%BE%E0%A4%82%E0%A4%95%E0%A4%A8#cite_note-chang2023-1)</sup>।

### मुख्य मेट्रिक्स और benchmark

#### स्वचालित मेट्रिक्स

- **Perplexity** (पर्पलेक्सिटी): एक मूलभूत मेट्रिक जो मापती है कि मॉडल पाठ का अनुमान कितनी अच्छी तरह लगाता है। कम perplexity मॉडल के अपने अनुमानों में अधिक आत्मविश्वास को इंगित करती है।
- **BLEU** और **ROUGE**: n-gram पर आधारित मेट्रिक्स जो उत्पन्न और संदर्भ पाठों के बीच शाब्दिक मिलान को मापती हैं। BLEU सटीकता पर केंद्रित है, जबकि ROUGE पूर्णता पर<sup>[\[2\]](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_LLM_%E0%A4%95%E0%A4%BE_%E0%A4%AE%E0%A5%82%E0%A4%B2%E0%A5%8D%E0%A4%AF%E0%A4%BE%E0%A4%82%E0%A4%95%E0%A4%A8#cite_note-ccl-survey-2)</sup>।
- **BERTScore**: एक semantic मेट्रिक जो semantic समानता की गणना के लिए BERT से embedding का उपयोग करती है। यह समानार्थकता और पुनः वाक्यांशीकरण को पकड़ने में सक्षम है, जो इसे n-gram आधारित मेट्रिक्स से अधिक सटीक बनाती है<sup>[\[5\]](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_LLM_%E0%A4%95%E0%A4%BE_%E0%A4%AE%E0%A5%82%E0%A4%B2%E0%A5%8D%E0%A4%AF%E0%A4%BE%E0%A4%82%E0%A4%95%E0%A4%A8#cite_note-zhang2019-bertscore-5)</sup>।

#### विशेष benchmark

विशिष्ट क्षमताओं के मूल्यांकन के लिए लक्षित benchmark विकसित किए गए हैं:

- **कोड जनरेशन**: **HumanEval** मॉडल की पाठ्य विवरण से सही प्रोग्राम कोड उत्पन्न करने की क्षमता का मूल्यांकन करता है और unit tests के माध्यम से उसकी कार्यात्मकता की जाँच करता है<sup>[\[6\]](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_LLM_%E0%A4%95%E0%A4%BE_%E0%A4%AE%E0%A5%82%E0%A4%B2%E0%A5%8D%E0%A4%AF%E0%A4%BE%E0%A4%82%E0%A4%95%E0%A4%A8#cite_note-chen2021-humaneval-6)</sup>।
- **सामान्य ज्ञान**: **HellaSwag** किसी सामान्य स्थिति के सबसे संभावित अंत की भविष्यवाणी के माध्यम से मॉडल की भौतिक दुनिया और कारण-प्रभाव संबंधों की समझ का परीक्षण करता है<sup>[\[7\]](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_LLM_%E0%A4%95%E0%A4%BE_%E0%A4%AE%E0%A5%82%E0%A4%B2%E0%A5%8D%E0%A4%AF%E0%A4%BE%E0%A4%82%E0%A4%95%E0%A4%A8#cite_note-zellers2019-hellaswag-7)</sup>।
- **शैक्षणिक ज्ञान**: **MMLU** (Massive Multitask Language Understanding) प्राथमिक गणित से लेकर कानून और चिकित्सा तक 57 विषयों को कवर करता है, और मॉडल की व्यापक विद्वत्ता की जाँच करता है<sup>[\[8\]](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_LLM_%E0%A4%95%E0%A4%BE_%E0%A4%AE%E0%A5%82%E0%A4%B2%E0%A5%8D%E0%A4%AF%E0%A4%BE%E0%A4%82%E0%A4%95%E0%A4%A8#cite_note-hendrycks2020-mmlu-8)</sup>।
- **क्षमताओं की सीमाएँ**: **BIG-bench** (Beyond the Imitation Game) — एक सहयोगी परियोजना है जिसमें 204 कार्य शामिल हैं, जो उभरती हुई क्षमताओं (emergent abilities) — अर्थात् ऐसे कौशल जो मॉडल के एक महत्वपूर्ण पैमाने पर पहुँचने पर अचानक प्रकट होते हैं — की पहचान के लिए डिज़ाइन किए गए हैं<sup>[\[9\]](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_LLM_%E0%A4%95%E0%A4%BE_%E0%A4%AE%E0%A5%82%E0%A4%B2%E0%A5%8D%E0%A4%AF%E0%A4%BE%E0%A4%82%E0%A4%95%E0%A4%A8#cite_note-srivastava2022-bigbench-9)</sup>।

### सुरक्षा और नैतिक पहलुओं का मूल्यांकन

- **पूर्वाग्रह**: सामाजिक और जनसांख्यिकीय पूर्वाग्रहों के मूल्यांकन के लिए **BBQ** (Bias Benchmark for Question Answering) और **BOLD** (Bias in Open-ended Language generation Dataset) जैसे dataset उपयोग किए जाते हैं।
- **विषाक्तता**: **RealToxicityPrompts** जैसे benchmark ऐसे अनुरोध प्रदान करते हैं जो विषाक्त सामग्री की उत्पत्ति को प्रेरित करते हैं, ताकि मॉडल की प्रतिरोधक क्षमता का मूल्यांकन किया जा सके।
- **Robustness**: इसका मूल्यांकन adversarial attacks के माध्यम से किया जाता है। **PromptRobust** framework अक्षर, शब्द और वाक्य स्तरों पर मॉडल की स्थिरता की जाँच के लिए अनुरोधों का एक व्यापक सेट प्रदान करता है।

### आधुनिक मानक और framework

- **HELM** (Holistic Evaluation of Language Models): स्टैनफोर्ड विश्वविद्यालय की एक पहल जो "समग्र" पद्धति प्रस्तुत करती है। HELM मॉडलों का मूल्यांकन कई आयामों पर करता है: सटीकता, robustness, निष्पक्षता, पूर्वाग्रह, विषाक्तता और दक्षता<sup>[\[10\]](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_LLM_%E0%A4%95%E0%A4%BE_%E0%A4%AE%E0%A5%82%E0%A4%B2%E0%A5%8D%E0%A4%AF%E0%A4%BE%E0%A4%82%E0%A4%95%E0%A4%A8#cite_note-bommasani2022-helm-10)</sup>।
- **ISO/IEC 42001:2023**: AI प्रबंधन प्रणालियों के लिए पहला अंतर्राष्ट्रीय मानक, जो पूरे जीवन चक्र में AI के प्रबंधन के लिए आवश्यकताएँ स्थापित करता है।
- **EU विनियमन 2024/1689 (EU AI Act)**: AI का पहला व्यापक विनियमन, जो प्रणालीगत जोखिमों वाले सामान्य-उद्देश्य वाले मॉडलों के लिए मानकीकृत मूल्यांकन की आवश्यकता करता है।
- **NIST AI Risk Management Framework 1.0**: अमेरिकी राष्ट्रीय मानक और प्रौद्योगिकी संस्थान द्वारा विकसित विश्वसनीय AI के विकास और तैनाती के लिए एक स्वैच्छिक framework।

## मौजूदा तरीकों की समस्याएँ और सीमाएँ

- **Benchmark संतृप्ति**: कई मॉडल लोकप्रिय benchmark पर लगभग आदर्श परिणाम प्राप्त कर लेते हैं, जिससे "benchmark की दौड़" जैसी घटना उत्पन्न होती है, जहाँ मॉडलों को सामान्य क्षमताओं के बजाय विशेष परीक्षणों के लिए अनुकूलित किया जाता है।
- **डेटा संदूषण**: एक गंभीर समस्या जिसमें benchmark का परीक्षण डेटा गलती से प्रशिक्षण सेट में शामिल हो जाता है, जिससे मूल्यांकन के परिणाम अतिरंजित और अनुचित हो जाते हैं।
- **मानवीय निर्णयों से कम सहसंबंध**: BLEU और ROUGE जैसी स्वचालित मेट्रिक्स अक्सर मानव द्वारा गुणवत्ता मूल्यांकन से कमज़ोर सहसंबंध दिखाती हैं, विशेष रूप से रचनात्मक और मुक्त-रूपी कार्यों में।

## वर्तमान शोध और प्रवृत्तियाँ

- **LLM-as-a-Judge पद्धति**: अन्य मॉडलों के उत्तरों का मूल्यांकन करने के लिए शक्तिशाली LLM (जैसे GPT-4) का "न्यायाधीश" के रूप में उपयोग। यह दृष्टिकोण महँगी मानव मूल्यांकन प्रक्रिया का एक मापनीय विकल्प प्रदान करता है।
- **गतिशील और अनुकूली मूल्यांकन**: **LMArena** जैसे प्लेटफ़ॉर्म उपयोगकर्ताओं के साथ जीवंत संपर्क में मॉडलों के वास्तविक मूल्यांकन के लिए Elo रेटिंग के साथ एक crowdsourcing प्रणाली प्रस्तुत करते हैं।
- **हाइब्रिड दृष्टिकोण**: मॉडल के प्रदर्शन की अधिक संपूर्ण और विश्वसनीय तस्वीर प्राप्त करने के लिए स्वचालित मेट्रिक्स को मानवीय निर्णय और LLM मूल्यांकन के साथ संयोजित करना।

LLM मूल्यांकन का परिदृश्य निरंतर विकसित होता जा रहा है, और यह बहु-आयामी, मानकीकृत और पुनरुत्पादनीय framework बनाने की दिशा में आगे बढ़ रहा है, जो न केवल सटीकता को, बल्कि AI प्रौद्योगिकियों के अनुप्रयोग के सामाजिक और नैतिक पहलुओं को भी ध्यान में रखते हैं<sup>[\[1\]](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_LLM_%E0%A4%95%E0%A4%BE_%E0%A4%AE%E0%A5%82%E0%A4%B2%E0%A5%8D%E0%A4%AF%E0%A4%BE%E0%A4%82%E0%A4%95%E0%A4%A8#cite_note-chang2023-1)</sup>।

## संदर्भ

- Stanford HELM — Holistic Evaluation of Language Models परियोजना की आधिकारिक वेबसाइट।
- Chatbot Arena — मानवीय प्राथमिकताओं के आधार पर chat-bot के तुलनात्मक मूल्यांकन के लिए एक प्लेटफ़ॉर्म।

## साहित्य

- Wang, A. et al. (2018). *GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding*. arXiv:1804.07461.
- Zhang, T. et al. (2019). *BERTScore: Evaluating Text Generation with BERT*. arXiv:1904.09675.
- Wang, A. et al. (2019). *SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems*. arXiv:1905.00537.
- Zellers, R. et al. (2019). *HellaSwag: Can a Machine Really Finish Your Sentence?*. arXiv:1905.07830.
- Hendrycks, D. et al. (2020). *Measuring Massive Multitask Language Understanding*. arXiv:2009.03300.
- Gehman, S. et al. (2020). *RealToxicityPrompts: Evaluating Neural Toxic Degeneration in Language Models*. arXiv:2009.11462.
- Chen, M. et al. (2021). *Evaluating Large Language Models Trained on Code*. arXiv:2107.03374.
- Parrish, A. et al. (2021). *BBQ: A Hand-Built Bias Benchmark for Question Answering*. arXiv:2110.08193.
- Dhamala, J. et al. (2021). *BOLD: Dataset and Metrics for Measuring Biases in Open-Ended Language Generation*. arXiv:2101.11718.
- Srivastava, A. et al. (2022). *Beyond the Imitation Game: Quantifying and Extrapolating the Capabilities of Language Models*. arXiv:2206.04615.
- Bommasani, R. et al. (2022). *Holistic Evaluation of Language Models*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Zhuang, Y. et al. (2023). *Through the Lens of Core Competency: Survey on Evaluation of Large Language Models*. ACL Anthology:2023.ccl-2.8.
- Zhu, K. et al. (2023). *PromptRobust: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts*. arXiv:2306.04528.

## टिप्पणियाँ

1.  <span id="cite_note-chang2023-1">↑ <sup>[1.0](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_LLM_%E0%A4%95%E0%A4%BE_%E0%A4%AE%E0%A5%82%E0%A4%B2%E0%A5%8D%E0%A4%AF%E0%A4%BE%E0%A4%82%E0%A4%95%E0%A4%A8#cite_ref-chang2023_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_LLM_%E0%A4%95%E0%A4%BE_%E0%A4%AE%E0%A5%82%E0%A4%B2%E0%A5%8D%E0%A4%AF%E0%A4%BE%E0%A4%82%E0%A4%95%E0%A4%A8#cite_ref-chang2023_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_LLM_%E0%A4%95%E0%A4%BE_%E0%A4%AE%E0%A5%82%E0%A4%B2%E0%A5%8D%E0%A4%AF%E0%A4%BE%E0%A4%82%E0%A4%95%E0%A4%A8#cite_ref-chang2023_1-2)</sup> Chang, Y., et al. (2023). «A Survey on Evaluation of Large Language Models». *arXiv*. <a href="https://arxiv.org/abs/2307.03109" class="external autonumber" rel="nofollow">[१]</a></span>
2.  <span id="cite_note-ccl-survey-2">↑ <sup>[2.0](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_LLM_%E0%A4%95%E0%A4%BE_%E0%A4%AE%E0%A5%82%E0%A4%B2%E0%A5%8D%E0%A4%AF%E0%A4%BE%E0%A4%82%E0%A4%95%E0%A4%A8#cite_ref-ccl-survey_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_LLM_%E0%A4%95%E0%A4%BE_%E0%A4%AE%E0%A5%82%E0%A4%B2%E0%A5%8D%E0%A4%AF%E0%A4%BE%E0%A4%82%E0%A4%95%E0%A4%A8#cite_ref-ccl-survey_2-1)</sup> Zhuang, Y., et al. (2023). «Through the Lens of Core Competency: Survey on Evaluation of Large Language Models». *ACL Anthology*. <a href="https://aclanthology.org/2023.ccl-2.8/" class="external autonumber" rel="nofollow">[२]</a></span>
3.  <span id="cite_note-wang2018-3">[↑](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_LLM_%E0%A4%95%E0%A4%BE_%E0%A4%AE%E0%A5%82%E0%A4%B2%E0%A5%8D%E0%A4%AF%E0%A4%BE%E0%A4%82%E0%A4%95%E0%A4%A8#cite_ref-wang2018_3-0) Wang, A., et al. (2018). «GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding». *arXiv*.<a href="https://arxiv.org/abs/1804.07461" class="external autonumber" rel="nofollow">[३]</a></span>
4.  <span id="cite_note-understanding-benchmarks-4">[↑](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_LLM_%E0%A4%95%E0%A4%BE_%E0%A4%AE%E0%A5%82%E0%A4%B2%E0%A5%8D%E0%A4%AF%E0%A4%BE%E0%A4%82%E0%A4%95%E0%A4%A8#cite_ref-understanding-benchmarks_4-0) Kumar, Pradosh. «Understanding Benchmarking in NLP: GLUE, SuperGLUE, HELM, MMLU, and BIG-Bench». *Medium*.</span>
5.  <span id="cite_note-zhang2019-bertscore-5">[↑](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_LLM_%E0%A4%95%E0%A4%BE_%E0%A4%AE%E0%A5%82%E0%A4%B2%E0%A5%8D%E0%A4%AF%E0%A4%BE%E0%A4%82%E0%A4%95%E0%A4%A8#cite_ref-zhang2019-bertscore_5-0) Zhang, T., et al. (2019). «BERTScore: Evaluating Text Generation with BERT». *arXiv*.</span>
6.  <span id="cite_note-chen2021-humaneval-6">[↑](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_LLM_%E0%A4%95%E0%A4%BE_%E0%A4%AE%E0%A5%82%E0%A4%B2%E0%A5%8D%E0%A4%AF%E0%A4%BE%E0%A4%82%E0%A4%95%E0%A4%A8#cite_ref-chen2021-humaneval_6-0) Chen, M., et al. (2021). «Evaluating Large Language Models Trained on Code». *arXiv*.</span>
7.  <span id="cite_note-zellers2019-hellaswag-7">[↑](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_LLM_%E0%A4%95%E0%A4%BE_%E0%A4%AE%E0%A5%82%E0%A4%B2%E0%A5%8D%E0%A4%AF%E0%A4%BE%E0%A4%82%E0%A4%95%E0%A4%A8#cite_ref-zellers2019-hellaswag_7-0) Zellers, R., et al. (2019). «HellaSwag: Can a Machine Really Finish Your Sentence?». *arXiv*.</span>
8.  <span id="cite_note-hendrycks2020-mmlu-8">[↑](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_LLM_%E0%A4%95%E0%A4%BE_%E0%A4%AE%E0%A5%82%E0%A4%B2%E0%A5%8D%E0%A4%AF%E0%A4%BE%E0%A4%82%E0%A4%95%E0%A4%A8#cite_ref-hendrycks2020-mmlu_8-0) Hendrycks, D., et al. (2020). «Measuring Massive Multitask Language Understanding». *arXiv*.</span>
9.  <span id="cite_note-srivastava2022-bigbench-9">[↑](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_LLM_%E0%A4%95%E0%A4%BE_%E0%A4%AE%E0%A5%82%E0%A4%B2%E0%A5%8D%E0%A4%AF%E0%A4%BE%E0%A4%82%E0%A4%95%E0%A4%A8#cite_ref-srivastava2022-bigbench_9-0) Srivastava, A., et al. (2022). «Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models». *arXiv*.</span>
10. <span id="cite_note-bommasani2022-helm-10">[↑](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_LLM_%E0%A4%95%E0%A4%BE_%E0%A4%AE%E0%A5%82%E0%A4%B2%E0%A5%8D%E0%A4%AF%E0%A4%BE%E0%A4%82%E0%A4%95%E0%A4%A8#cite_ref-bommasani2022-helm_10-0) Bommasani, R., et al. (2022). «Holistic Evaluation of Language Models». *arXiv*. <a href="https://arxiv.org/abs/2211.09110" class="external autonumber" rel="nofollow">[४]</a></span>
