---
title: "Бенчмарки LLM"
source: "https://systems-analysis.info/wiki/%D0%91%D0%B5%D0%BD%D1%87%D0%BC%D0%B0%D1%80%D0%BA%D0%B8_LLM"
wiki: "systems-analysis.info/wiki"
article: "Бенчмарки_LLM"
language: "ru"
categories:
  - "Категория:Russian"
  - "Категория:Бенчмарки LLM"
  - "Категория:Большие языковые модели"
  - "Категория:Машинное обучение"
revision_id: 212
wiki_created_at: 2026-09-06T22:05:32Z
wiki_modified_at: 2026-09-06T22:05:32Z
downloaded_at: 2026-09-07T22:18:23Z
---

# Бенчмарки LLM

**Бенчмарки больших языковых моделей** — это стандартизированные наборы тестов, предназначенные для измерения, сравнения и оценки качества и возможностей [больших языковых моделей (LLM)](https://systems-analysis.info/wiki/%D0%91%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D0%B5_%D1%8F%D0%B7%D1%8B%D0%BA%D0%BE%D0%B2%D1%8B%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8 "Большие языковые модели")<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%91%D0%B5%D0%BD%D1%87%D0%BC%D0%B0%D1%80%D0%BA%D0%B8_LLM#cite_note-ibm-benchmarks-1)</sup>. Обычно каждый бенчмарк представляет собой фиксированный набор задач (например, вопросы, тексты или инструкции), для которых заранее известны правильные ответы или критерии оценки. Такой подход обеспечивает объективное сравнение разных моделей в одинаковых условиях, позволяя отслеживать прогресс в области и выявлять сильные и слабые стороны моделей<sup>[\[2\]](https://systems-analysis.info/wiki/%D0%91%D0%B5%D0%BD%D1%87%D0%BC%D0%B0%D1%80%D0%BA%D0%B8_LLM#cite_note-evidently-guide-2)</sup>.

Регулярное использование бенчмарков играет ключевую роль в развитии LLM, стимулируя разработчиков улучшать модели и обеспечивая прозрачность и сопоставимость результатов в научном сообществе. Эволюция бенчмарков отражает развитие самих LLM: от простых задач на понимание языка до комплексных тестов, проверяющих многошаговые рассуждения, здравый смысл, этику и безопасность<sup>[\[3\]](https://systems-analysis.info/wiki/%D0%91%D0%B5%D0%BD%D1%87%D0%BC%D0%B0%D1%80%D0%BA%D0%B8_LLM#cite_note-habr-popular-llm-3)</sup>.

## Основные категории и примеры

Бенчмарки LLM охватывают разнообразные навыки и области применения. Ниже рассмотрены основные категории и наиболее известные наборы задач в каждой из них.

### Общее языковое понимание

Эта категория оценивает базовые способности модели к пониманию и интерпретации естественного языка.

- **[GLUE](https://systems-analysis.info/wiki/GLUE_benchmark "GLUE benchmark")** (General Language Understanding Evaluation, 2019) — один из первых комплексных бенчмарков, включающий ряд разноплановых задач: от определения тональности до оценки логической связности текста. Результаты по всем заданиям агрегируются в единый балл, что позволило сравнивать ранние модели по их суммарной эффективности<sup>[\[4\]](https://systems-analysis.info/wiki/%D0%91%D0%B5%D0%BD%D1%87%D0%BC%D0%B0%D1%80%D0%BA%D0%B8_LLM#cite_note-wang2019glue-4)</sup>.
- **[SuperGLUE](https://systems-analysis.info/wiki/SuperGLUE "SuperGLUE")** (2019) — «усиленный» преемник GLUE, разработанный в ответ на то, что модели быстро достигли на нём уровня, близкого к человеческому. SuperGLUE включает более трудные задачи, требующие глубокого понимания контекста и умения делать выводы<sup>[\[5\]](https://systems-analysis.info/wiki/%D0%91%D0%B5%D0%BD%D1%87%D0%BC%D0%B0%D1%80%D0%BA%D0%B8_LLM#cite_note-wang2019superglue-5)</sup>.
- **[WinoGrande](https://systems-analysis.info/wiki/WinoGrande_benchmark "WinoGrande benchmark")** (2019) — расширенный вариант викторины Winograd Schema. Содержит 44 тысячи заданий на разрешение неоднозначных местоимений в предложениях, требующих здравого смысла для выбора правильной интерпретации<sup>[\[6\]](https://systems-analysis.info/wiki/%D0%91%D0%B5%D0%BD%D1%87%D0%BC%D0%B0%D1%80%D0%BA%D0%B8_LLM#cite_note-sakaguchi2019-6)</sup>.

### Мультизадачные и комплексные бенчмарки

Эти наборы проверяют модели на широком спектре знаний и умений, выходя за рамки чисто лингвистических задач.

- **[MMLU](https://systems-analysis.info/wiki/MMLU_benchmark "MMLU benchmark")** (Massive Multitask Language Understanding, 2020) — сборник задач в виде викторины, охватывающий 57 предметных областей: от школьных дисциплин до узкоспециализированных профессиональных знаний (юриспруденция, медицина). MMLU измеряет широту эрудиции модели<sup>[\[7\]](https://systems-analysis.info/wiki/%D0%91%D0%B5%D0%BD%D1%87%D0%BC%D0%B0%D1%80%D0%BA%D0%B8_LLM#cite_note-hendrycks2020mmlu-7)</sup>.
- **[BIG-bench](https://systems-analysis.info/wiki/BIG-bench "BIG-bench")** (Beyond the Imitation Game Benchmark, 2022) — крупнейший на момент создания коллаборативный бенчмарк, разработанный более чем 400 авторами. Он включает свыше 200 задач на самые разные темы, от лингвистики до физики, чтобы проверить модели за пределами шаблонного соответствия и выявить их границы в нестандартных ситуациях<sup>[\[8\]](https://systems-analysis.info/wiki/%D0%91%D0%B5%D0%BD%D1%87%D0%BC%D0%B0%D1%80%D0%BA%D0%B8_LLM#cite_note-srivastava2022bigbench-8)</sup>.

### Здравый смысл и правдивость

Эти бенчмарки оценивают способность модели делать логичные выводы о повседневных ситуациях и избегать распространения ложной информации.

- **[HellaSwag](https://systems-analysis.info/wiki/HellaSwag_benchmark "HellaSwag benchmark")** (2019) — проверяет здравый смысл через задачу выбора наиболее правдоподобного завершения для описания ситуации. Особенность бенчмарка — наличие «ловушек»: неправильные ответы сгенерированы автоматически и выглядят очень правдоподобно, что требует от модели глубокого понимания контекста<sup>[\[9\]](https://systems-analysis.info/wiki/%D0%91%D0%B5%D0%BD%D1%87%D0%BC%D0%B0%D1%80%D0%BA%D0%B8_LLM#cite_note-zellers2019hellaswag-9)</sup>.
- **[TruthfulQA](https://systems-analysis.info/wiki/TruthfulQA_benchmark "TruthfulQA benchmark")** (2021) — измеряет склонность модели распространять популярные мифы и заблуждения. Содержит вопросы, где распространённый в интернете ответ является неверным (например, «Вызывают ли вакцины аутизм?»). От модели требуется не поддаться ложным стереотипам и дать фактически корректный ответ<sup>[\[10\]](https://systems-analysis.info/wiki/%D0%91%D0%B5%D0%BD%D1%87%D0%BC%D0%B0%D1%80%D0%BA%D0%B8_LLM#cite_note-lin2021truthfulqa-10)</sup>.

### Математические задачи

- **[GSM8K](https://systems-analysis.info/wiki/GSM8K "GSM8K")** (2021) — включает тысячи текстовых задач по математике уровня начальной школы. Каждая задача требует выполнения последовательности из 2–8 арифметических шагов для получения ответа, что проверяет способность модели к многошаговым рассуждениям<sup>[\[11\]](https://systems-analysis.info/wiki/%D0%91%D0%B5%D0%BD%D1%87%D0%BC%D0%B0%D1%80%D0%BA%D0%B8_LLM#cite_note-cobbe2021gsm8k-11)</sup>.
- **[MATH](https://systems-analysis.info/wiki/MATH_benchmark "MATH benchmark")** (2021) — более сложный набор, состоящий из задач с математических олимпиад и конкурсов. Он включает разделы алгебры, геометрии и теории чисел, требуя от модели владения нетривиальными методами решения<sup>[\[12\]](https://systems-analysis.info/wiki/%D0%91%D0%B5%D0%BD%D1%87%D0%BC%D0%B0%D1%80%D0%BA%D0%B8_LLM#cite_note-hendrycks2021math-12)</sup>.

### Генерация программного кода

- **[HumanEval](https://systems-analysis.info/wiki/HumanEval_benchmark "HumanEval benchmark")** (2021) — стандартный тест для оценки способности LLM писать код. Содержит 164 задачи по программированию, где модель должна сгенерировать корректный код на Python по заданному описанию. Правильность оценивается с помощью юнит-тестов<sup>[\[13\]](https://systems-analysis.info/wiki/%D0%91%D0%B5%D0%BD%D1%87%D0%BC%D0%B0%D1%80%D0%BA%D0%B8_LLM#cite_note-chen2021humaneval-13)</sup>.
- **[SWE-bench](https://systems-analysis.info/wiki/SWE-bench "SWE-bench")** (2023) — более реалистичный бенчмарк, собирающий описания реальных проблем (*issues*) с GitHub. Модель должна сгенерировать патч (фрагмент кода), устраняющий проблему. Это требует понимания большого объёма чужого кода и сложного пошагового рассуждения<sup>[\[14\]](https://systems-analysis.info/wiki/%D0%91%D0%B5%D0%BD%D1%87%D0%BC%D0%B0%D1%80%D0%BA%D0%B8_LLM#cite_note-jimenez2023swebench-14)</sup>.

### Оценка диалоговых моделей

- **[Chatbot Arena](https://systems-analysis.info/wiki/LMArena "LMArena")** (2024) — открытая онлайн-платформа, где две анонимные модели участвуют в парном диалоге с пользователем. После диалога пользователь голосует, чей ответ был лучше. На основе тысяч таких «дуэлей» формируется рейтинг Эло предпочтений пользователей, который отражает качество моделей в живом общении<sup>[\[15\]](https://systems-analysis.info/wiki/%D0%91%D0%B5%D0%BD%D1%87%D0%BC%D0%B0%D1%80%D0%BA%D0%B8_LLM#cite_note-chiang2024chatbot-15)</sup>.
- [**MT-Bench**](https://systems-analysis.info/wiki/MT-Bench_benchmark "MT-Bench benchmark") (2023) — автоматизированный бенчмарк для стресс-тестирования диалоговых умений. Он содержит 80 пар вопросов, имитирующих многоходовой диалог. Ответы моделей оцениваются другой, более мощной LLM («LLM-as-a-judge», например GPT-4) по заранее заданной шкале<sup>[\[16\]](https://systems-analysis.info/wiki/%D0%91%D0%B5%D0%BD%D1%87%D0%BC%D0%B0%D1%80%D0%BA%D0%B8_LLM#cite_note-zheng2023mtbench-16)</sup>.

### Безопасность и надёжность

- **[AgentHarm](https://systems-analysis.info/wiki/AgentHarm "AgentHarm")** (2024) — бенчмарк, оценивающий склонность LLM-агентов выполнять опасные инструкции. Он включает 110 сценариев, представляющих злонамеренные задачи (от мошенничества до киберпреступлений). Хорошая модель должна отказывать в выполнении таких запросов<sup>[\[17\]](https://systems-analysis.info/wiki/%D0%91%D0%B5%D0%BD%D1%87%D0%BC%D0%B0%D1%80%D0%BA%D0%B8_LLM#cite_note-andriushchenko2024agentharm-17)</sup>.
- **[SafetyBench](https://systems-analysis.info/wiki/SafetyBench "SafetyBench")** (2023) — широкий набор из более чем 11 тысяч вопросов, проверяющих, насколько последовательно модель избегает генерации неприемлемого контента и вредных советов, в том числе на провокационные запросы<sup>[\[18\]](https://systems-analysis.info/wiki/%D0%91%D0%B5%D0%BD%D1%87%D0%BC%D0%B0%D1%80%D0%BA%D0%B8_LLM#cite_note-zhang2023safetybench-18)</sup>.

## Ограничения и актуальные проблемы

- **Контаминация данных**: Главная угроза достоверности оценки — утечка тестовых данных в обучающие наборы. Модель может просто запомнить ответы, что искусственно завышает её результат<sup>[\[2\]](https://systems-analysis.info/wiki/%D0%91%D0%B5%D0%BD%D1%87%D0%BC%D0%B0%D1%80%D0%BA%D0%B8_LLM#cite_note-evidently-guide-2)</sup>.
- **Насыщение бенчмарков**: По мере развития моделей их производительность на старых бенчмарках (как GLUE) достигает потолка, и тест перестаёт быть полезным для различения новых, более мощных моделей. Это требует постоянной разработки более сложных эталонов<sup>[\[2\]](https://systems-analysis.info/wiki/%D0%91%D0%B5%D0%BD%D1%87%D0%BC%D0%B0%D1%80%D0%BA%D0%B8_LLM#cite_note-evidently-guide-2)</sup>.
- **Разрыв с реальностью**: Высокие результаты на бенчмарках не всегда гарантируют надёжную работу модели в реальных, неструктурированных сценариях. Реальная среда часто богаче и непредсказуемее любого фиксированного набора задач<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%91%D0%B5%D0%BD%D1%87%D0%BC%D0%B0%D1%80%D0%BA%D0%B8_LLM#cite_note-ibm-benchmarks-1)</sup>.

## См. также

- [Оценка LLM](https://systems-analysis.info/wiki/%D0%9E%D1%86%D0%B5%D0%BD%D0%BA%D0%B0_LLM "Оценка LLM")
- [MT-Bench benchmark](https://systems-analysis.info/wiki/MT-Bench_benchmark "MT-Bench benchmark")
- [BIG-bench](https://systems-analysis.info/wiki/BIG-bench "BIG-bench")
- [HumanEval benchmark](https://systems-analysis.info/wiki/HumanEval_benchmark "HumanEval benchmark")
- [MATH benchmark](https://systems-analysis.info/wiki/MATH_benchmark "MATH benchmark")

## Ссылки

- <a href="https://huggingface.co/spaces/HuggingFaceH4/open_llm_leaderboard" class="external text" rel="nofollow">Open LLM Leaderboard</a> — открытый рейтинг моделей от сообщества Hugging Face
- <a href="https://lmsys.org/blog/2023-05-03-arena/" class="external text" rel="nofollow">Chatbot Arena Leaderboard</a> — рейтинг чат-моделей на основе человеческих предпочтений

## Примечания

1.  <span id="cite_note-ibm-benchmarks-1">↑ <sup>[1,0](https://systems-analysis.info/wiki/%D0%91%D0%B5%D0%BD%D1%87%D0%BC%D0%B0%D1%80%D0%BA%D0%B8_LLM#cite_ref-ibm-benchmarks_1-0)</sup> <sup>[1,1](https://systems-analysis.info/wiki/%D0%91%D0%B5%D0%BD%D1%87%D0%BC%D0%B0%D1%80%D0%BA%D0%B8_LLM#cite_ref-ibm-benchmarks_1-1)</sup> «What Are LLM Benchmarks?». *IBM*. <a href="https://www.ibm.com/think/topics/llm-benchmarks" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-evidently-guide-2">↑ <sup>[2,0](https://systems-analysis.info/wiki/%D0%91%D0%B5%D0%BD%D1%87%D0%BC%D0%B0%D1%80%D0%BA%D0%B8_LLM#cite_ref-evidently-guide_2-0)</sup> <sup>[2,1](https://systems-analysis.info/wiki/%D0%91%D0%B5%D0%BD%D1%87%D0%BC%D0%B0%D1%80%D0%BA%D0%B8_LLM#cite_ref-evidently-guide_2-1)</sup> <sup>[2,2](https://systems-analysis.info/wiki/%D0%91%D0%B5%D0%BD%D1%87%D0%BC%D0%B0%D1%80%D0%BA%D0%B8_LLM#cite_ref-evidently-guide_2-2)</sup> «20 LLM evaluation benchmarks and how they work». *Evidently AI*. <a href="https://www.evidentlyai.com/llm-guide/llm-benchmarks" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-habr-popular-llm-3">[↑](https://systems-analysis.info/wiki/%D0%91%D0%B5%D0%BD%D1%87%D0%BC%D0%B0%D1%80%D0%BA%D0%B8_LLM#cite_ref-habr-popular-llm_3-0) «Самые популярные LLM бенчмарки». *Хабр*. <a href="https://habr.com/ru/articles/844974/" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-wang2019glue-4">[↑](https://systems-analysis.info/wiki/%D0%91%D0%B5%D0%BD%D1%87%D0%BC%D0%B0%D1%80%D0%BA%D0%B8_LLM#cite_ref-wang2019glue_4-0) Wang, Alex; Singh, Amanpreet; Michael, Julian; et al. «GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding». *arXiv*. <a href="https://arxiv.org/abs/1804.07461" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-wang2019superglue-5">[↑](https://systems-analysis.info/wiki/%D0%91%D0%B5%D0%BD%D1%87%D0%BC%D0%B0%D1%80%D0%BA%D0%B8_LLM#cite_ref-wang2019superglue_5-0) Wang, Alex; Pruksachatkun, Yada; Nangia, Nikita; et al. «SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems». *arXiv*. <a href="https://arxiv.org/abs/1905.00537" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-sakaguchi2019-6">[↑](https://systems-analysis.info/wiki/%D0%91%D0%B5%D0%BD%D1%87%D0%BC%D0%B0%D1%80%D0%BA%D0%B8_LLM#cite_ref-sakaguchi2019_6-0) Sakaguchi, Keisuke; Le Bras, Ronan; Bhagavatula, Chandra; Choi, Yejin. «WinoGrande: An Adversarial Winograd Schema Challenge at Scale». *arXiv*. <a href="https://arxiv.org/abs/1907.10641" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-hendrycks2020mmlu-7">[↑](https://systems-analysis.info/wiki/%D0%91%D0%B5%D0%BD%D1%87%D0%BC%D0%B0%D1%80%D0%BA%D0%B8_LLM#cite_ref-hendrycks2020mmlu_7-0) Hendrycks, Dan; Burns, Collin; Basart, Steven; et al. «Measuring Massive Multitask Language Understanding». *arXiv*. <a href="https://arxiv.org/abs/2009.03300" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-srivastava2022bigbench-8">[↑](https://systems-analysis.info/wiki/%D0%91%D0%B5%D0%BD%D1%87%D0%BC%D0%B0%D1%80%D0%BA%D0%B8_LLM#cite_ref-srivastava2022bigbench_8-0) Srivastava, Aarohi; et al. «Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models». *arXiv*. <a href="https://arxiv.org/abs/2206.04615" class="external autonumber" rel="nofollow">[8]</a></span>
9.  <span id="cite_note-zellers2019hellaswag-9">[↑](https://systems-analysis.info/wiki/%D0%91%D0%B5%D0%BD%D1%87%D0%BC%D0%B0%D1%80%D0%BA%D0%B8_LLM#cite_ref-zellers2019hellaswag_9-0) Zellers, Rowan; Holtzman, Ari; Bisk, Yonatan; et al. «HellaSwag: Can a Machine Really Finish Your Sentence?». *arXiv*. <a href="https://arxiv.org/abs/1905.07830" class="external autonumber" rel="nofollow">[9]</a></span>
10. <span id="cite_note-lin2021truthfulqa-10">[↑](https://systems-analysis.info/wiki/%D0%91%D0%B5%D0%BD%D1%87%D0%BC%D0%B0%D1%80%D0%BA%D0%B8_LLM#cite_ref-lin2021truthfulqa_10-0) Lin, Stephanie; Hilton, Jacob; Evans, Owain. «TruthfulQA: Measuring How Models Mimic Human Falsehoods». *arXiv*. <a href="https://arxiv.org/abs/2109.07958" class="external autonumber" rel="nofollow">[10]</a></span>
11. <span id="cite_note-cobbe2021gsm8k-11">[↑](https://systems-analysis.info/wiki/%D0%91%D0%B5%D0%BD%D1%87%D0%BC%D0%B0%D1%80%D0%BA%D0%B8_LLM#cite_ref-cobbe2021gsm8k_11-0) Cobbe, Karl; Kosaraju, Vineet; Bavarian, Mohammad; et al. «Training Verifiers to Solve Math Word Problems». *arXiv*. <a href="https://arxiv.org/abs/2110.14168" class="external autonumber" rel="nofollow">[11]</a></span>
12. <span id="cite_note-hendrycks2021math-12">[↑](https://systems-analysis.info/wiki/%D0%91%D0%B5%D0%BD%D1%87%D0%BC%D0%B0%D1%80%D0%BA%D0%B8_LLM#cite_ref-hendrycks2021math_12-0) Hendrycks, Dan; Burns, Collin; Saund, Saurav; et al. «Measuring Mathematical Problem Solving With the MATH Dataset». *arXiv*. <a href="https://arxiv.org/abs/2103.03874" class="external autonumber" rel="nofollow">[12]</a></span>
13. <span id="cite_note-chen2021humaneval-13">[↑](https://systems-analysis.info/wiki/%D0%91%D0%B5%D0%BD%D1%87%D0%BC%D0%B0%D1%80%D0%BA%D0%B8_LLM#cite_ref-chen2021humaneval_13-0) Chen, Mark; Tworek, Jerry; Jun, Heewoo; et al. «Evaluating Large Language Models Trained on Code». *arXiv*. <a href="https://arxiv.org/abs/2107.03374" class="external autonumber" rel="nofollow">[13]</a></span>
14. <span id="cite_note-jimenez2023swebench-14">[↑](https://systems-analysis.info/wiki/%D0%91%D0%B5%D0%BD%D1%87%D0%BC%D0%B0%D1%80%D0%BA%D0%B8_LLM#cite_ref-jimenez2023swebench_14-0) Jimenez, Carlos E.; et al. «SWE-bench: Can Language Models Resolve Real-World GitHub Issues?». *arXiv*. <a href="https://arxiv.org/abs/2310.06770" class="external autonumber" rel="nofollow">[14]</a></span>
15. <span id="cite_note-chiang2024chatbot-15">[↑](https://systems-analysis.info/wiki/%D0%91%D0%B5%D0%BD%D1%87%D0%BC%D0%B0%D1%80%D0%BA%D0%B8_LLM#cite_ref-chiang2024chatbot_15-0) Chiang, Wei-Lin; et al. «Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preferences». *lmsys.org*. <a href="https://lmsys.org/blog/2023-05-03-arena/" class="external autonumber" rel="nofollow">[15]</a></span>
16. <span id="cite_note-zheng2023mtbench-16">[↑](https://systems-analysis.info/wiki/%D0%91%D0%B5%D0%BD%D1%87%D0%BC%D0%B0%D1%80%D0%BA%D0%B8_LLM#cite_ref-zheng2023mtbench_16-0) Zheng, Lianmin; et al. «Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena». *arXiv*. <a href="https://arxiv.org/abs/2306.05685" class="external autonumber" rel="nofollow">[16]</a></span>
17. <span id="cite_note-andriushchenko2024agentharm-17">[↑](https://systems-analysis.info/wiki/%D0%91%D0%B5%D0%BD%D1%87%D0%BC%D0%B0%D1%80%D0%BA%D0%B8_LLM#cite_ref-andriushchenko2024agentharm_17-0) Andriushchenko, Maksym; et al. «AgentHarm: A Benchmark for Asessing Agentic AI Harm». *arXiv*. <a href="https://arxiv.org/abs/2402.12249" class="external autonumber" rel="nofollow">[17]</a></span>
18. <span id="cite_note-zhang2023safetybench-18">[↑](https://systems-analysis.info/wiki/%D0%91%D0%B5%D0%BD%D1%87%D0%BC%D0%B0%D1%80%D0%BA%D0%B8_LLM#cite_ref-zhang2023safetybench_18-0) Zhang, Zhexin; et al. «SafetyBench: A Comprehensive Benchmark for Evaluating the Safety of Large Language Models». *arXiv*. <a href="https://arxiv.org/abs/2309.07045" class="external autonumber" rel="nofollow">[18]</a></span>
