---
title: "Метрики качества LLM"
source: "https://systems-analysis.info/wiki/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%B0_LLM"
wiki: "systems-analysis.info/wiki"
article: "Метрики_качества_LLM"
language: "ru"
categories:
  - "Категория:Russian"
  - "Категория:Большие языковые модели"
  - "Категория:Машинное обучение"
  - "Категория:Оценка LLM"
revision_id: 297
wiki_created_at: 2026-09-06T22:06:46Z
wiki_modified_at: 2026-09-06T22:06:46Z
downloaded_at: 2026-09-07T22:18:55Z
---

# Метрики качества LLM

**Метрики качества больших языковых моделей (LLM)** — это систематический подход и набор стандартизированных инструментов для измерения различных аспектов производительности языковых моделей, включая точность, безопасность, справедливость и надёжность<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%B0_LLM#cite_note-perplexity-overview-1)</sup>. По мере того как [LLM](https://systems-analysis.info/wiki/%D0%91%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D0%B5_%D1%8F%D0%B7%D1%8B%D0%BA%D0%BE%D0%B2%D1%8B%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8 "Большие языковые модели") находят всё более широкое применение в критически важных областях, таких как здравоохранение, финансы и образование, возникает острая необходимость в их комплексной и объективной оценке<sup>[\[2\]](https://systems-analysis.info/wiki/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%B0_LLM#cite_note-perplexity-security-2)</sup>.

Метрики и бенчмарки служат нескольким ключевым функциям: они позволяют объективно сравнивать разные модели, отслеживать прогресс в их развитии, выявлять слабые места и обеспечивать прозрачность результатов для исследователей и практиков<sup>[\[1\]](https://systems-analysis.info/wiki/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%B0_LLM#cite_note-perplexity-overview-1)</sup>.

## Категории метрик

Метрики для оценки LLM можно разделить на несколько основных категорий: автоматические метрики, оценка с участием человека и специализированные метрики для оценки безопасности и надёжности.

### Автоматические метрики

Эти метрики позволяют проводить быструю и масштабируемую оценку без участия человека.

#### Метрики на основе n-грамм

Традиционные метрики, измеряющие лексическое совпадение между сгенерированным и эталонным текстом.

- **[BLEU](https://systems-analysis.info/wiki/BLEU "BLEU")** (Bilingual Evaluation Understudy): Первоначально разработана для оценки качества машинного перевода. Измеряет точность совпадения n-грамм (последовательностей из n слов) и применяет штраф за слишком короткие сгенерированные тексты<sup>[\[3\]](https://systems-analysis.info/wiki/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%B0_LLM#cite_note-ngram-metrics-3)</sup>.
- **[ROUGE](https://systems-analysis.info/wiki/ROUGE "ROUGE")** (Recall-Oriented Understudy for Gisting Evaluation): Фокусируется на полноте, измеряя, насколько хорошо n-граммы из эталонного текста представлены в сгенерированном. Особенно эффективна для оценки задач суммаризации<sup>[\[3\]](https://systems-analysis.info/wiki/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%B0_LLM#cite_note-ngram-metrics-3)</sup>.
- **[METEOR](https://systems-analysis.info/wiki/METEOR "METEOR")**: Расширяет возможности BLEU, учитывая синонимы, однокоренные слова и морфологические варианты, что позволяет добиться лучшей корреляции с человеческими оценками<sup>[\[3\]](https://systems-analysis.info/wiki/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%B0_LLM#cite_note-ngram-metrics-3)</sup>.

#### Семантические метрики

Эти метрики используют контекстуальные эмбеддинги для оценки семантической близости, а не только лексического совпадения.

- **[BERTScore](https://systems-analysis.info/wiki/BERTScore "BERTScore")**: Вычисляет семантическое сходство между токенами сгенерированного и эталонного текстов, используя эмбеддинги из модели [BERT](https://systems-analysis.info/wiki/BERT "BERT"). Это позволяет распознавать семантическую эквивалентность даже при разной формулировке<sup>[\[4\]](https://systems-analysis.info/wiki/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%B0_LLM#cite_note-semantic-metrics-4)</sup>.
- **[MAUVE](https://systems-analysis.info/wiki/MAUVE "MAUVE")**: Измеряет расхождение между распределениями машинного и человеческого текстов в пространстве эмбеддингов. Особенно эффективна для оценки открытой генерации, где нет фиксированного эталонного текста<sup>[\[5\]](https://systems-analysis.info/wiki/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%B0_LLM#cite_note-distribution-metrics-5)</sup>.

#### Внутренние метрики языкового моделирования

- **[Перплексия](https://systems-analysis.info/wiki/%D0%9F%D0%B5%D1%80%D0%BF%D0%BB%D0%B5%D0%BA%D1%81%D0%B8%D1%8F "Перплексия")** (Perplexity): Фундаментальная метрика, измеряющая, насколько хорошо языковая модель предсказывает последовательность текста. Она отражает неуверенность модели в предсказании следующего токена. Более низкие значения перплексии указывают на лучшую производительность<sup>[\[6\]](https://systems-analysis.info/wiki/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%B0_LLM#cite_note-intrinsic-metrics-6)</sup>.
- **Точность и F1-мера**: Широко применяются в задачах классификации и вопросно-ответных системах. F1-мера представляет собой гармоническое среднее между точностью и полнотой, обеспечивая сбалансированную оценку<sup>[\[6\]](https://systems-analysis.info/wiki/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%B0_LLM#cite_note-intrinsic-metrics-6)</sup>.

### Оценка с участием человека

Человеческая оценка остаётся «золотым стандартом», поскольку автоматические метрики часто не способны уловить тонкие аспекты качества, такие как связность, креативность и релевантность<sup>[\[7\]](https://systems-analysis.info/wiki/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%B0_LLM#cite_note-human-eval-7)</sup>.

- **Прямая оценка**: Эксперты или краудсорсеры оценивают качество генерации по заданной шкале (например, от 1 до 5) по таким критериям, как беглость и связность.
- **Сравнительная оценка**: Оценщикам предлагается сравнить выходы двух или более моделей и выбрать лучший (парное сравнение) или ранжировать их от лучшего к худшему.

Недостатками человеческой оценки являются высокая стоимость, сложность масштабирования и субъективность<sup>[\[7\]](https://systems-analysis.info/wiki/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%B0_LLM#cite_note-human-eval-7)</sup>.

### Оценка с помощью LLM (LLM-as-a-Judge)

Новый подход, при котором одна (обычно более мощная) языковая модель используется для оценки ответов другой. Например, GPT-4 может ранжировать выходы моделей по заданным критериям. Этот метод обеспечивает масштабируемую альтернативу человеческой оценке, хотя и имеет свои проблемы, такие как чувствительность к стилю запросов и потенциальная предвзятость<sup>[\[8\]](https://systems-analysis.info/wiki/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%B0_LLM#cite_note-llm-as-judge-8)</sup>.

## Специализированные метрики и бенчмарки

Для оценки конкретных аспектов производительности и надёжности LLM используются специализированные метрики и бенчмарки.

### Фактологическая надёжность

Оценивает способность модели генерировать правдивую информацию и не прибегать к галлюцинациям.

- **[TruthfulQA](https://systems-analysis.info/wiki/TruthfulQA_benchmark "TruthfulQA benchmark")**: Бенчмарк, специально разработанный для измерения склонности моделей генерировать ответы, основанные на распространённых мифах и заблуждениях. От модели требуется давать фактически верные, а не просто популярные ответы<sup>[\[9\]](https://systems-analysis.info/wiki/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%B0_LLM#cite_note-security-metrics-9)</sup>.

### Безопасность и этика

- **Оценка токсичности**: Измеряет присутствие оскорбительного или вредного контента. Для этого используются специализированные классификаторы и API, например, **Perspective API**<sup>[\[9\]](https://systems-analysis.info/wiki/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%B0_LLM#cite_note-security-metrics-9)</sup>.
- **Оценка предвзятости и справедливости**: Оценивает, демонстрирует ли модель дискриминационное поведение по отношению к различным демографическим группам. Исследования показывают, что LLM могут сохранять и усиливать социальные стереотипы из обучающих данных<sup>[\[10\]](https://systems-analysis.info/wiki/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%B0_LLM#cite_note-bias-metrics-10)</sup>.
- **SafetyBench**: Комплексный бенчмарк для оценки безопасности, включающий проверку устойчивости к adversarial-атакам и способности избегать генерации вредного контента<sup>[\[11\]](https://systems-analysis.info/wiki/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%B0_LLM#cite_note-safety-bench-11)</sup>.

### Комплексные бенчмарки

- **[MMLU](https://systems-analysis.info/wiki/MMLU_benchmark "MMLU benchmark")** (Massive Multitask Language Understanding): Один из наиболее широко используемых бенчмарков, включающий вопросы с множественным выбором по 57 предметам, от элементарной математики до международного права. Он оценивает широту и глубину знаний модели<sup>[\[12\]](https://systems-analysis.info/wiki/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%B0_LLM#cite_note-comprehensive-benchmarks-12)</sup>.
- **[BIG-bench](https://systems-analysis.info/wiki/BIG-bench "BIG-bench")** (Beyond the Imitation Game): Содержит более 204 задач, разработанных для оценки способностей, которые выходят за рамки возможностей стандартных языковых моделей, включая задачи от игры в шахматы до угадывания эмодзи<sup>[\[12\]](https://systems-analysis.info/wiki/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%B0_LLM#cite_note-comprehensive-benchmarks-12)</sup>.

## Вызовы и ограничения

- **Проблема корреляции**: Традиционные автоматические метрики, такие как BLEU и ROUGE, часто плохо коррелируют с человеческими оценками, особенно в творческих задачах<sup>[\[13\]](https://systems-analysis.info/wiki/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%B0_LLM#cite_note-challenges-correlation-13)</sup>.
- **Загрязнение данных (Data Contamination)**: Существует риск, что тестовые данные бенчмарка могли попасть в обучающий набор модели, что приводит к завышенным и недостоверным оценкам<sup>[\[14\]](https://systems-analysis.info/wiki/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%B0_LLM#cite_note-challenges-contamination-14)</sup>.
- **Многоязычная оценка**: Большинство существующих метрик и бенчмарков сосредоточено на английском языке, что ограничивает их применимость для оценки многоязычных способностей LLM<sup>[\[15\]](https://systems-analysis.info/wiki/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%B0_LLM#cite_note-challenges-multilingual-15)</sup>.

## См. также

- [Оценка LLM](https://systems-analysis.info/wiki/%D0%9E%D1%86%D0%B5%D0%BD%D0%BA%D0%B0_LLM "Оценка LLM")
- [BERTScore](https://systems-analysis.info/wiki/BERTScore "BERTScore")
- [METEOR](https://systems-analysis.info/wiki/METEOR "METEOR")
- [ROUGE](https://systems-analysis.info/wiki/ROUGE "ROUGE")
- [MAUVE](https://systems-analysis.info/wiki/MAUVE "MAUVE")

## Ссылки

- <a href="https://www.ibm.com/think/topics/llm-benchmarks" class="external text" rel="nofollow">What Are LLM Benchmarks?</a> — обзорная статья от IBM
- <a href="https://www.evidentlyai.com/llm-guide/llm-benchmarks" class="external text" rel="nofollow">20 LLM evaluation benchmarks and how they work</a> — руководство по бенчмаркам от Evidently AI

## Литература

- Papineni, K. et al. (2002). *Bleu: a Method for Automatic Evaluation of Machine Translation*. <a href="https://aclanthology.org/P02-1040/" class="external text" rel="nofollow">ACL:P02-1040</a>.
- Lin, C.-Y. (2004). *ROUGE: A Package for Automatic Evaluation of Summaries*. <a href="https://aclanthology.org/W04-1013/" class="external text" rel="nofollow">ACL:W04-1013</a>.
- Banerjee, S.; Lavie, A. (2005). *METEOR: An Automatic Metric for MT Evaluation with Improved Correlation with Human Judgments*. <a href="https://aclanthology.org/W05-0909/" class="external text" rel="nofollow">ACL:W05-0909</a>.
- Zhang, T. et al. (2019). *BERTScore: Evaluating Text Generation with BERT*. <a href="https://arxiv.org/abs/1904.09675" class="external text" rel="nofollow">arXiv:1904.09675</a>.
- Pillutla, K. et al. (2021). *MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers*. <a href="https://arxiv.org/abs/2102.01454" class="external text" rel="nofollow">arXiv:2102.01454</a>.
- Lin, S. et al. (2021). *TruthfulQA: Measuring How Models Mimic Human Falsehoods*. <a href="https://arxiv.org/abs/2109.07958" class="external text" rel="nofollow">arXiv:2109.07958</a>.
- Parrish, A. et al. (2021). *BBQ: A Hand-Built Bias Benchmark for Question Answering*. <a href="https://arxiv.org/abs/2110.08193" class="external text" rel="nofollow">arXiv:2110.08193</a>.
- Dhamala, J. et al. (2021). *BOLD: Dataset and Metrics for Measuring Biases in Open-Ended Language Generation*. <a href="https://arxiv.org/abs/2101.11718" class="external text" rel="nofollow">arXiv:2101.11718</a>.
- Hendrycks, D. et al. (2020). *Measuring Massive Multitask Language Understanding*. <a href="https://arxiv.org/abs/2009.03300" class="external text" rel="nofollow">arXiv:2009.03300</a>.
- Srivastava, A. et al. (2022). *Beyond the Imitation Game: Quantifying and Extrapolating the Capabilities of Language Models*. <a href="https://arxiv.org/abs/2206.04615" class="external text" rel="nofollow">arXiv:2206.04615</a>.
- Zhang, Z. et al. (2023). *SafetyBench: Evaluating the Safety of Large Language Models*. <a href="https://arxiv.org/abs/2309.07045" class="external text" rel="nofollow">arXiv:2309.07045</a>.
- Huang, H. et al. (2024). *An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-Tuned Judge Model is not a General Substitute for GPT-4*. <a href="https://arxiv.org/abs/2403.02839" class="external text" rel="nofollow">arXiv:2403.02839</a>.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. <a href="https://arxiv.org/abs/2403.04132" class="external text" rel="nofollow">arXiv:2403.04132</a>.
- Gu, J. et al. (2024). *A Survey on LLM-as-a-Judge*. <a href="https://arxiv.org/abs/2411.15594" class="external text" rel="nofollow">arXiv:2411.15594</a>.
- Li, S. et al. (2025). *LLMs Cannot Reliably Judge (Yet?): A Comprehensive Assessment on the Robustness of LLM-as-a-Judge*. <a href="https://arxiv.org/abs/2506.09443" class="external text" rel="nofollow">arXiv:2506.09443</a>.

## Примечания

1.  <span id="cite_note-perplexity-overview-1">↑ <sup>[1,0](https://systems-analysis.info/wiki/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%B0_LLM#cite_ref-perplexity-overview_1-0)</sup> <sup>[1,1](https://systems-analysis.info/wiki/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%B0_LLM#cite_ref-perplexity-overview_1-1)</sup> «Метрики качества LLM». *Perplexity AI*.</span>
2.  <span id="cite_note-perplexity-security-2">[↑](https://systems-analysis.info/wiki/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%B0_LLM#cite_ref-perplexity-security_2-0) «Специализированные метрики безопасности». *Perplexity AI*.</span>
3.  <span id="cite_note-ngram-metrics-3">↑ <sup>[3,0](https://systems-analysis.info/wiki/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%B0_LLM#cite_ref-ngram-metrics_3-0)</sup> <sup>[3,1](https://systems-analysis.info/wiki/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%B0_LLM#cite_ref-ngram-metrics_3-1)</sup> <sup>[3,2](https://systems-analysis.info/wiki/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%B0_LLM#cite_ref-ngram-metrics_3-2)</sup> «Традиционные метрики оценки текста». *Perplexity AI*.</span>
4.  <span id="cite_note-semantic-metrics-4">[↑](https://systems-analysis.info/wiki/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%B0_LLM#cite_ref-semantic-metrics_4-0) «Семантические метрики». *Perplexity AI*.</span>
5.  <span id="cite_note-distribution-metrics-5">[↑](https://systems-analysis.info/wiki/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%B0_LLM#cite_ref-distribution-metrics_5-0) «Метрики на основе распределений». *Perplexity AI*.</span>
6.  <span id="cite_note-intrinsic-metrics-6">↑ <sup>[6,0](https://systems-analysis.info/wiki/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%B0_LLM#cite_ref-intrinsic-metrics_6-0)</sup> <sup>[6,1](https://systems-analysis.info/wiki/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%B0_LLM#cite_ref-intrinsic-metrics_6-1)</sup> «Intrinsic метрики». *Perplexity AI*.</span>
7.  <span id="cite_note-human-eval-7">↑ <sup>[7,0](https://systems-analysis.info/wiki/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%B0_LLM#cite_ref-human-eval_7-0)</sup> <sup>[7,1](https://systems-analysis.info/wiki/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%B0_LLM#cite_ref-human-eval_7-1)</sup> «Оценка с участием человека». *Perplexity AI*.</span>
8.  <span id="cite_note-llm-as-judge-8">[↑](https://systems-analysis.info/wiki/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%B0_LLM#cite_ref-llm-as-judge_8-0) «LLM-as-a-Judge». *Perplexity AI*.</span>
9.  <span id="cite_note-security-metrics-9">↑ <sup>[9,0](https://systems-analysis.info/wiki/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%B0_LLM#cite_ref-security-metrics_9-0)</sup> <sup>[9,1](https://systems-analysis.info/wiki/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%B0_LLM#cite_ref-security-metrics_9-1)</sup> «Специализированные метрики безопасности». *Perplexity AI*.</span>
10. <span id="cite_note-bias-metrics-10">[↑](https://systems-analysis.info/wiki/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%B0_LLM#cite_ref-bias-metrics_10-0) «Предвзятость и справедливость». *Perplexity AI*.</span>
11. <span id="cite_note-safety-bench-11">[↑](https://systems-analysis.info/wiki/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%B0_LLM#cite_ref-safety-bench_11-0) «Benchmark'ы безопасности». *Perplexity AI*.</span>
12. <span id="cite_note-comprehensive-benchmarks-12">↑ <sup>[12,0](https://systems-analysis.info/wiki/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%B0_LLM#cite_ref-comprehensive-benchmarks_12-0)</sup> <sup>[12,1](https://systems-analysis.info/wiki/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%B0_LLM#cite_ref-comprehensive-benchmarks_12-1)</sup> «Comprehensive оценка». *Perplexity AI*.</span>
13. <span id="cite_note-challenges-correlation-13">[↑](https://systems-analysis.info/wiki/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%B0_LLM#cite_ref-challenges-correlation_13-0) «Проблемы корреляции». *Perplexity AI*.</span>
14. <span id="cite_note-challenges-contamination-14">[↑](https://systems-analysis.info/wiki/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%B0_LLM#cite_ref-challenges-contamination_14-0) «Загрязнение данных». *Perplexity AI*.</span>
15. <span id="cite_note-challenges-multilingual-15">[↑](https://systems-analysis.info/wiki/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%B0_LLM#cite_ref-challenges-multilingual_15-0) «Многоязычная оценка». *Perplexity AI*.</span>
