---
title: "LLM evaluation — تقييم نماذج اللغة الكبيرة"
source: "https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%D8%AA%D9%82%D9%8A%D9%8A%D9%85_%D9%86%D9%85%D8%A7%D8%B0%D8%AC_%D8%A7%D9%84%D9%84%D8%BA%D8%A9_%D8%A7%D9%84%D9%83%D8%A8%D9%8A%D8%B1%D8%A9"
wiki: "systems-analysis.info/int"
article: "LLM_evaluation_—_تقييم_نماذج_اللغة_الكبيرة"
language: "ar"
categories:
  - "Category:Arabic"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:LLM evaluation"
  - "Category:Machine learning"
revision_id: 3624
wiki_created_at: 2026-09-06T23:23:35Z
wiki_modified_at: 2026-09-06T23:23:35Z
downloaded_at: 2026-09-07T22:57:56Z
---

# LLM evaluation — تقييم نماذج اللغة الكبيرة

**تقييم نماذج اللغة الكبيرة (LLM)** هو تخصص في مجال الذكاء الاصطناعي يوفر أساليب موحدة لقياس قدرات النماذج اللغوية وقيودها ومخاطرها<sup>[\[1\]](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%D8%AA%D9%82%D9%8A%D9%8A%D9%85_%D9%86%D9%85%D8%A7%D8%B0%D8%AC_%D8%A7%D9%84%D9%84%D8%BA%D8%A9_%D8%A7%D9%84%D9%83%D8%A8%D9%8A%D8%B1%D8%A9#cite_note-chang2023-1)</sup>. مع تزايد دمج LLM في قطاعات حيوية مثل الرعاية الصحية والتمويل، أصبح تقييمها الموضوعي ضروريًا لضمان السلامة والموثوقية والعدالة<sup>[\[2\]](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%D8%AA%D9%82%D9%8A%D9%8A%D9%85_%D9%86%D9%85%D8%A7%D8%B0%D8%AC_%D8%A7%D9%84%D9%84%D8%BA%D8%A9_%D8%A7%D9%84%D9%83%D8%A8%D9%8A%D8%B1%D8%A9#cite_note-ccl-survey-2)</sup>.

يؤدي تقييم نماذج اللغة الكبيرة عدة وظائف أساسية:

- قياس القدرات: مقارنة موضوعية لأداء النماذج المختلفة في مهام موحدة.
- تتبع التقدم: توثيق الإنجازات وتحديد المجالات التي تحتاج إلى مزيد من التحسين.
- تقليل المخاطر: تحديد المخرجات الضارة المحتملة، مثل التحيز والهلوسة والمشكلات الأمنية.
- إعلام المطورين والمستخدمين: توفير معلومات شفافة لاختيار النموذج الأنسب لتطبيق معين.

## المناهج والمنهجيات الأساسية

بدأ التقييم الحديث لنماذج اللغة الكبيرة مع ظهور المعايير الشاملة، مثل **GLUE** (التقييم العام لفهم اللغة)، الذي وضع معيارًا لتقييم الفهم العام للغة<sup>[\[3\]](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%D8%AA%D9%82%D9%8A%D9%8A%D9%85_%D9%86%D9%85%D8%A7%D8%B0%D8%AC_%D8%A7%D9%84%D9%84%D8%BA%D8%A9_%D8%A7%D9%84%D9%83%D8%A8%D9%8A%D8%B1%D8%A9#cite_note-wang2018-3)</sup>. ومع تفوق النماذج على الأداء البشري في GLUE، تم تطوير معايير لاحقة أكثر تعقيدًا، مثل **SuperGLUE**<sup>[\[4\]](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%D8%AA%D9%82%D9%8A%D9%8A%D9%85_%D9%86%D9%85%D8%A7%D8%B0%D8%AC_%D8%A7%D9%84%D9%84%D8%BA%D8%A9_%D8%A7%D9%84%D9%83%D8%A8%D9%8A%D8%B1%D8%A9#cite_note-understanding-benchmarks-4)</sup>.

حدث تحول جوهري مع إدخال المعايير متعددة المهام مثل **MMLU** و**BIG-bench**، التي تختبر النماذج على مجموعة واسعة من المعارف وقدرات الاستدلال، متجاوزة المهام اللغوية البحتة<sup>[\[1\]](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%D8%AA%D9%82%D9%8A%D9%8A%D9%85_%D9%86%D9%85%D8%A7%D8%B0%D8%AC_%D8%A7%D9%84%D9%84%D8%BA%D8%A9_%D8%A7%D9%84%D9%83%D8%A8%D9%8A%D8%B1%D8%A9#cite_note-chang2023-1)</sup>.

### المقاييس والمعايير الرئيسية

#### المقاييس الآلية

- **الحيرة** (Perplexity): مقياس أساسي يقيس مدى جودة النموذج في التنبؤ بالنص. تشير الحيرة المنخفضة إلى ثقة أكبر للنموذج في تنبؤاته.
- **BLEU** و**ROUGE**: مقاييس تعتمد على n-grams وتقيس التطابق المعجمي بين النص الذي تم إنشاؤه والنص المرجعي. يركز BLEU على الدقة، بينما يركز ROUGE على الاستدعاء (الشمولية)<sup>[\[2\]](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%D8%AA%D9%82%D9%8A%D9%8A%D9%85_%D9%86%D9%85%D8%A7%D8%B0%D8%AC_%D8%A7%D9%84%D9%84%D8%BA%D8%A9_%D8%A7%D9%84%D9%83%D8%A8%D9%8A%D8%B1%D8%A9#cite_note-ccl-survey-2)</sup>.
- **BERTScore**: مقياس دلالي يستخدم تضمينات من BERT لحساب التشابه الدلالي. وهو قادر على التقاط الترادف وإعادة الصياغة، مما يجعله أكثر دقة من المقاييس المعتمدة على n-grams<sup>[\[5\]](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%D8%AA%D9%82%D9%8A%D9%8A%D9%85_%D9%86%D9%85%D8%A7%D8%B0%D8%AC_%D8%A7%D9%84%D9%84%D8%BA%D8%A9_%D8%A7%D9%84%D9%83%D8%A8%D9%8A%D8%B1%D8%A9#cite_note-zhang2019-bertscore-5)</sup>.

#### المعايير المتخصصة

لتقييم قدرات محددة، تم تطوير معايير مستهدفة:

- **توليد الشيفرة البرمجية**: يقيم **HumanEval** قدرة النموذج على إنشاء شيفرة برمجية صحيحة من وصف نصي، ويتحقق من وظائفها باستخدام اختبارات الوحدة<sup>[\[6\]](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%D8%AA%D9%82%D9%8A%D9%8A%D9%85_%D9%86%D9%85%D8%A7%D8%B0%D8%AC_%D8%A7%D9%84%D9%84%D8%BA%D8%A9_%D8%A7%D9%84%D9%83%D8%A8%D9%8A%D8%B1%D8%A9#cite_note-chen2021-humaneval-6)</sup>.
- **الفطرة السليمة**: يختبر **HellaSwag** فهم النموذج للعالم المادي والعلاقات السببية من خلال التنبؤ بالنهاية الأكثر احتمالاً لموقف من الحياة اليومية<sup>[\[7\]](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%D8%AA%D9%82%D9%8A%D9%8A%D9%85_%D9%86%D9%85%D8%A7%D8%B0%D8%AC_%D8%A7%D9%84%D9%84%D8%BA%D8%A9_%D8%A7%D9%84%D9%83%D8%A8%D9%8A%D8%B1%D8%A9#cite_note-zellers2019-hellaswag-7)</sup>.
- **المعرفة الأكاديمية**: يغطي **MMLU** (الفهم اللغوي الهائل متعدد المهام) 57 موضوعًا، من الرياضيات الابتدائية إلى القانون والطب، لاختبار اتساع معرفة النموذج<sup>[\[8\]](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%D8%AA%D9%82%D9%8A%D9%8A%D9%85_%D9%86%D9%85%D8%A7%D8%B0%D8%AC_%D8%A7%D9%84%D9%84%D8%BA%D8%A9_%D8%A7%D9%84%D9%83%D8%A8%D9%8A%D8%B1%D8%A9#cite_note-hendrycks2020-mmlu-8)</sup>.
- **حدود القدرات**: **BIG-bench** (ما وراء لعبة التقليد) هو مشروع تعاوني يجمع 204 مهمة مصممة للكشف عن القدرات الناشئة — وهي مهارات تظهر فجأة عندما يصل النموذج إلى مستويات حرجة من الحجم<sup>[\[9\]](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%D8%AA%D9%82%D9%8A%D9%8A%D9%85_%D9%86%D9%85%D8%A7%D8%B0%D8%AC_%D8%A7%D9%84%D9%84%D8%BA%D8%A9_%D8%A7%D9%84%D9%83%D8%A8%D9%8A%D8%B1%D8%A9#cite_note-srivastava2022-bigbench-9)</sup>.

### تقييم السلامة والجوانب الأخلاقية

- **التحيز**: لتقييم التحيزات الاجتماعية والديموغرافية، تُستخدم مجموعات بيانات مثل **BBQ** (معيار التحيز للإجابة على الأسئلة) و**BOLD** (التحيز في مجموعة بيانات توليد اللغة المفتوحة).
- **السُمِّيّة**: توفر المعايير مثل **RealToxicityPrompts** موجهات تحفز توليد محتوى سام، وذلك لتقييم مقاومة النموذج.
- **المتانة**: يتم تقييمها باستخدام الهجمات الخصومية. يوفر إطار العمل **PromptRobust** مجموعة شاملة من الموجهات لاختبار متانة النموذج على مستويات الرموز والكلمات والجمل.

### المعايير وأطر العمل الحديثة

- **HELM** (التقييم الشامل لنماذج اللغة): مبادرة من جامعة ستانفورد تقترح منهجية «شاملة». يقوم HELM بتقييم النماذج عبر أبعاد متعددة: الدقة، المتانة، العدالة، التحيز، السُمِّيّة، والكفاءة<sup>[\[10\]](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%D8%AA%D9%82%D9%8A%D9%8A%D9%85_%D9%86%D9%85%D8%A7%D8%B0%D8%AC_%D8%A7%D9%84%D9%84%D8%BA%D8%A9_%D8%A7%D9%84%D9%83%D8%A8%D9%8A%D8%B1%D8%A9#cite_note-bommasani2022-helm-10)</sup>.
- **ISO/IEC 42001:2023**: أول معيار دولي لأنظمة إدارة الذكاء الاصطناعي، يحدد متطلبات إدارة الذكاء الاصطناعي طوال دورة حياته.
- **لائحة الاتحاد الأوروبي 2024/1689 (EU AI Act)**: أول تشريع شامل للذكاء الاصطناعي، يتطلب تقييمات موحدة للنماذج ذات الأغراض العامة التي تنطوي على مخاطر نظامية.
- **NIST AI Risk Management Framework 1.0**: إطار عمل طوعي لتطوير ونشر ذكاء اصطناعي موثوق، تم تطويره من قبل المعهد الوطني للمعايير والتكنولوجيا في الولايات المتحدة.

## المشكلات والقيود في الأساليب الحالية

- **إشباع المعايير**: تصل العديد من النماذج إلى نتائج شبه مثالية في المعايير الشائعة، مما يؤدي إلى ظاهرة «مطاردة المعايير»، حيث يتم تحسين النماذج لاجتياز اختبارات محددة بدلاً من تحسين القدرات العامة.
- **تلوث البيانات**: مشكلة حرجة تحدث عندما تتسرب بيانات اختبار المعيار عن طريق الخطأ إلى مجموعة بيانات التدريب، مما يؤدي إلى نتائج تقييم مبالغ فيها وغير عادلة.
- **ضعف الارتباط مع التقييم البشري**: غالبًا ما ترتبط المقاييس الآلية مثل BLEU وROUGE بشكل ضعيف مع تقييم الجودة من قبل الإنسان، خاصة في المهام الإبداعية والمفتوحة.

## الأبحاث والاتجاهات الحالية

- **نموذج LLM-as-a-Judge**: استخدام نماذج لغة كبيرة قوية (مثل GPT-4) كـ«حكام» لتقييم إجابات النماذج الأخرى. يوفر هذا النهج بديلاً قابلاً للتوسع للتقييم البشري المكلف.
- **التقييم الديناميكي والتكيفي**: تقدم منصات مثل **LMArena** نظامًا يعتمد على التعهيد الجماعي مع تصنيفات إيلو (Elo ratings) لتقييم النماذج في تفاعل حي مع المستخدمين.
- **المناهج الهجينة**: الجمع بين المقاييس الآلية والتقييم البشري وتقييم نماذج اللغة الكبيرة للحصول على صورة أكثر اكتمالاً وموثوقية لأداء النموذج.

يستمر مشهد تقييم نماذج اللغة الكبيرة في التطور، متجهاً نحو إنشاء أطر عمل متعددة الأبعاد وموحدة وقابلة للتكرار، لا تأخذ في الاعتبار الدقة فحسب، بل أيضًا الجوانب الاجتماعية والأخلاقية لتطبيقات تقنيات الذكاء الاصطناعي<sup>[\[1\]](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%D8%AA%D9%82%D9%8A%D9%8A%D9%85_%D9%86%D9%85%D8%A7%D8%B0%D8%AC_%D8%A7%D9%84%D9%84%D8%BA%D8%A9_%D8%A7%D9%84%D9%83%D8%A8%D9%8A%D8%B1%D8%A9#cite_note-chang2023-1)</sup>.

## روابط خارجية

- <a href="https://crfm.stanford.edu/helm/" class="external text" rel="nofollow">Stanford HELM</a> — الموقع الرسمي لمشروع التقييم الشامل لنماذج اللغة.
- <a href="https://lmsys.org/blog/2023-05-03-arena/" class="external text" rel="nofollow">Chatbot Arena</a> — منصة للتقييم المقارن لروبوتات الدردشة بناءً على تفضيلات المستخدمين.

## المراجع

- Wang, A. et al. (2018). *GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding*. <a href="https://arxiv.org/abs/1804.07461" class="external text" rel="nofollow">arXiv:1804.07461</a>.
- Zhang, T. et al. (2019). *BERTScore: Evaluating Text Generation with BERT*. <a href="https://arxiv.org/abs/1904.09675" class="external text" rel="nofollow">arXiv:1904.09675</a>.
- Wang, A. et al. (2019). *SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems*. <a href="https://arxiv.org/abs/1905.00537" class="external text" rel="nofollow">arXiv:1905.00537</a>.
- Zellers, R. et al. (2019). *HellaSwag: Can a Machine Really Finish Your Sentence?*. <a href="https://arxiv.org/abs/1905.07830" class="external text" rel="nofollow">arXiv:1905.07830</a>.
- Hendrycks, D. et al. (2020). *Measuring Massive Multitask Language Understanding*. <a href="https://arxiv.org/abs/2009.03300" class="external text" rel="nofollow">arXiv:2009.03300</a>.
- Gehman, S. et al. (2020). *RealToxicityPrompts: Evaluating Neural Toxic Degeneration in Language Models*. <a href="https://arxiv.org/abs/2009.11462" class="external text" rel="nofollow">arXiv:2009.11462</a>.
- Chen, M. et al. (2021). *Evaluating Large Language Models Trained on Code*. <a href="https://arxiv.org/abs/2107.03374" class="external text" rel="nofollow">arXiv:2107.03374</a>.
- Parrish, A. et al. (2021). *BBQ: A Hand-Built Bias Benchmark for Question Answering*. <a href="https://arxiv.org/abs/2110.08193" class="external text" rel="nofollow">arXiv:2110.08193</a>.
- Dhamala, J. et al. (2021). *BOLD: Dataset and Metrics for Measuring Biases in Open-Ended Language Generation*. <a href="https://arxiv.org/abs/2101.11718" class="external text" rel="nofollow">arXiv:2101.11718</a>.
- Srivastava, A. et al. (2022). *Beyond the Imitation Game: Quantifying and Extrapolating the Capabilities of Language Models*. <a href="https://arxiv.org/abs/2206.04615" class="external text" rel="nofollow">arXiv:2206.04615</a>.
- Bommasani, R. et al. (2022). *Holistic Evaluation of Language Models*. <a href="https://arxiv.org/abs/2211.09110" class="external text" rel="nofollow">arXiv:2211.09110</a>.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. <a href="https://arxiv.org/abs/2307.03109" class="external text" rel="nofollow">arXiv:2307.03109</a>.
- Zhuang, Y. et al. (2023). *Through the Lens of Core Competency: Survey on Evaluation of Large Language Models*. <a href="https://aclanthology.org/2023.ccl-2.8/" class="external text" rel="nofollow">ACL Anthology:2023.ccl-2.8</a>.
- Zhu, K. et al. (2023). *PromptRobust: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts*. <a href="https://arxiv.org/abs/2306.04528" class="external text" rel="nofollow">arXiv:2306.04528</a>.

## ملاحظات

1.  <span id="cite_note-chang2023-1">↑ <sup>[1.0](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%D8%AA%D9%82%D9%8A%D9%8A%D9%85_%D9%86%D9%85%D8%A7%D8%B0%D8%AC_%D8%A7%D9%84%D9%84%D8%BA%D8%A9_%D8%A7%D9%84%D9%83%D8%A8%D9%8A%D8%B1%D8%A9#cite_ref-chang2023_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%D8%AA%D9%82%D9%8A%D9%8A%D9%85_%D9%86%D9%85%D8%A7%D8%B0%D8%AC_%D8%A7%D9%84%D9%84%D8%BA%D8%A9_%D8%A7%D9%84%D9%83%D8%A8%D9%8A%D8%B1%D8%A9#cite_ref-chang2023_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%D8%AA%D9%82%D9%8A%D9%8A%D9%85_%D9%86%D9%85%D8%A7%D8%B0%D8%AC_%D8%A7%D9%84%D9%84%D8%BA%D8%A9_%D8%A7%D9%84%D9%83%D8%A8%D9%8A%D8%B1%D8%A9#cite_ref-chang2023_1-2)</sup> Chang, Y., et al. (2023). «A Survey on Evaluation of Large Language Models». *arXiv*. <a href="https://arxiv.org/abs/2307.03109" class="external autonumber" rel="nofollow">[١]</a></span>
2.  <span id="cite_note-ccl-survey-2">↑ <sup>[2.0](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%D8%AA%D9%82%D9%8A%D9%8A%D9%85_%D9%86%D9%85%D8%A7%D8%B0%D8%AC_%D8%A7%D9%84%D9%84%D8%BA%D8%A9_%D8%A7%D9%84%D9%83%D8%A8%D9%8A%D8%B1%D8%A9#cite_ref-ccl-survey_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%D8%AA%D9%82%D9%8A%D9%8A%D9%85_%D9%86%D9%85%D8%A7%D8%B0%D8%AC_%D8%A7%D9%84%D9%84%D8%BA%D8%A9_%D8%A7%D9%84%D9%83%D8%A8%D9%8A%D8%B1%D8%A9#cite_ref-ccl-survey_2-1)</sup> Zhuang, Y., et al. (2023). «Through the Lens of Core Competency: Survey on Evaluation of Large Language Models». *ACL Anthology*. <a href="https://aclanthology.org/2023.ccl-2.8/" class="external autonumber" rel="nofollow">[٢]</a></span>
3.  <span id="cite_note-wang2018-3">[↑](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%D8%AA%D9%82%D9%8A%D9%8A%D9%85_%D9%86%D9%85%D8%A7%D8%B0%D8%AC_%D8%A7%D9%84%D9%84%D8%BA%D8%A9_%D8%A7%D9%84%D9%83%D8%A8%D9%8A%D8%B1%D8%A9#cite_ref-wang2018_3-0) Wang, A., et al. (2018). «GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding». *arXiv*.<a href="https://arxiv.org/abs/1804.07461" class="external autonumber" rel="nofollow">[٣]</a></span>
4.  <span id="cite_note-understanding-benchmarks-4">[↑](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%D8%AA%D9%82%D9%8A%D9%8A%D9%85_%D9%86%D9%85%D8%A7%D8%B0%D8%AC_%D8%A7%D9%84%D9%84%D8%BA%D8%A9_%D8%A7%D9%84%D9%83%D8%A8%D9%8A%D8%B1%D8%A9#cite_ref-understanding-benchmarks_4-0) Kumar, Pradosh. «Understanding Benchmarking in NLP: GLUE, SuperGLUE, HELM, MMLU, and BIG-Bench». *Medium*.</span>
5.  <span id="cite_note-zhang2019-bertscore-5">[↑](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%D8%AA%D9%82%D9%8A%D9%8A%D9%85_%D9%86%D9%85%D8%A7%D8%B0%D8%AC_%D8%A7%D9%84%D9%84%D8%BA%D8%A9_%D8%A7%D9%84%D9%83%D8%A8%D9%8A%D8%B1%D8%A9#cite_ref-zhang2019-bertscore_5-0) Zhang, T., et al. (2019). «BERTScore: Evaluating Text Generation with BERT». *arXiv*.</span>
6.  <span id="cite_note-chen2021-humaneval-6">[↑](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%D8%AA%D9%82%D9%8A%D9%8A%D9%85_%D9%86%D9%85%D8%A7%D8%B0%D8%AC_%D8%A7%D9%84%D9%84%D8%BA%D8%A9_%D8%A7%D9%84%D9%83%D8%A8%D9%8A%D8%B1%D8%A9#cite_ref-chen2021-humaneval_6-0) Chen, M., et al. (2021). «Evaluating Large Language Models Trained on Code». *arXiv*.</span>
7.  <span id="cite_note-zellers2019-hellaswag-7">[↑](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%D8%AA%D9%82%D9%8A%D9%8A%D9%85_%D9%86%D9%85%D8%A7%D8%B0%D8%AC_%D8%A7%D9%84%D9%84%D8%BA%D8%A9_%D8%A7%D9%84%D9%83%D8%A8%D9%8A%D8%B1%D8%A9#cite_ref-zellers2019-hellaswag_7-0) Zellers, R., et al. (2019). «HellaSwag: Can a Machine Really Finish Your Sentence?». *arXiv*.</span>
8.  <span id="cite_note-hendrycks2020-mmlu-8">[↑](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%D8%AA%D9%82%D9%8A%D9%8A%D9%85_%D9%86%D9%85%D8%A7%D8%B0%D8%AC_%D8%A7%D9%84%D9%84%D8%BA%D8%A9_%D8%A7%D9%84%D9%83%D8%A8%D9%8A%D8%B1%D8%A9#cite_ref-hendrycks2020-mmlu_8-0) Hendrycks, D., et al. (2020). «Measuring Massive Multitask Language Understanding». *arXiv*.</span>
9.  <span id="cite_note-srivastava2022-bigbench-9">[↑](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%D8%AA%D9%82%D9%8A%D9%8A%D9%85_%D9%86%D9%85%D8%A7%D8%B0%D8%AC_%D8%A7%D9%84%D9%84%D8%BA%D8%A9_%D8%A7%D9%84%D9%83%D8%A8%D9%8A%D8%B1%D8%A9#cite_ref-srivastava2022-bigbench_9-0) Srivastava, A., et al. (2022). «Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models». *arXiv*.</span>
10. <span id="cite_note-bommasani2022-helm-10">[↑](https://systems-analysis.info/int/LLM_evaluation_%E2%80%94_%D8%AA%D9%82%D9%8A%D9%8A%D9%85_%D9%86%D9%85%D8%A7%D8%B0%D8%AC_%D8%A7%D9%84%D9%84%D8%BA%D8%A9_%D8%A7%D9%84%D9%83%D8%A8%D9%8A%D8%B1%D8%A9#cite_ref-bommasani2022-helm_10-0) Bommasani, R., et al. (2022). «Holistic Evaluation of Language Models». *arXiv*. <a href="https://arxiv.org/abs/2211.09110" class="external autonumber" rel="nofollow">[٤]</a></span>
