---
title: "Метрики за качество на LLM"
source: "https://systems-analysis.info/int/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%B7%D0%B0_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%BE_%D0%BD%D0%B0_LLM"
wiki: "systems-analysis.info/int"
article: "Метрики_за_качество_на_LLM"
language: "bg"
categories:
  - "Category:Bulgarian"
  - "Category:Large language models"
  - "Category:LLM evaluation"
  - "Category:Machine learning"
revision_id: 8703
wiki_created_at: 2026-09-07T01:21:24Z
wiki_modified_at: 2026-09-07T01:21:24Z
downloaded_at: 2026-09-07T23:26:54Z
---

# Метрики за качество на LLM

**Метрики за качество на големите езикови модели (LLM)** — това е систематичен подход и набор от стандартизирани инструменти за измерване на различни аспекти на производителността на езиковите модели, включително точност, безопасност, справедливост и надеждност<sup>[\[1\]](https://systems-analysis.info/int/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%B7%D0%B0_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%BE_%D0%BD%D0%B0_LLM#cite_note-perplexity-overview-1)</sup>. Тъй като LLM намират все по-широко приложение в критично важни области като здравеопазването, финансите и образованието, възниква остра необходимост от тяхната комплексна и обективна оценка<sup>[\[2\]](https://systems-analysis.info/int/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%B7%D0%B0_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%BE_%D0%BD%D0%B0_LLM#cite_note-perplexity-security-2)</sup>.

Метриките и benchmark-овете изпълняват няколко ключови функции: те позволяват обективно сравняване на различни модели, проследяване на напредъка в тяхното развитие, идентифициране на слабите места и осигуряване на прозрачност на резултатите за изследователи и практици<sup>[\[1\]](https://systems-analysis.info/int/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%B7%D0%B0_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%BE_%D0%BD%D0%B0_LLM#cite_note-perplexity-overview-1)</sup>.

## Категории метрики

Метриките за оценка на LLM могат да бъдат разделени на няколко основни категории: автоматични метрики, оценка с участието на човек и специализирани метрики за оценка на безопасността и надеждността.

### Автоматични метрики

Тези метрики позволяват бърза и мащабируема оценка без участието на човек.

#### Метрики на базата на n-грами

Традиционни метрики, измерващи лексикалното съвпадение между генерирания и еталонния текст.

- **BLEU** (Bilingual Evaluation Understudy): Първоначално разработена за оценка на качеството на машинния превод. Измерва точността на съвпадение на n-грами (последователности от n думи) и прилага наказание за прекалено кратки генерирани текстове<sup>[\[3\]](https://systems-analysis.info/int/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%B7%D0%B0_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%BE_%D0%BD%D0%B0_LLM#cite_note-ngram-metrics-3)</sup>.
- **ROUGE** (Recall-Oriented Understudy for Gisting Evaluation): Фокусира се върху пълнотата, измервайки доколко добре n-грамите от еталонния текст са представени в генерирания. Особено ефективна за оценка на задачи по резюмиране<sup>[\[3\]](https://systems-analysis.info/int/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%B7%D0%B0_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%BE_%D0%BD%D0%B0_LLM#cite_note-ngram-metrics-3)</sup>.
- **METEOR**: Разширява възможностите на BLEU, като отчита синоними, еднокоренни думи и морфологични варианти, което позволява постигане на по-добра корелация с човешките оценки<sup>[\[3\]](https://systems-analysis.info/int/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%B7%D0%B0_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%BE_%D0%BD%D0%B0_LLM#cite_note-ngram-metrics-3)</sup>.

#### Семантични метрики

Тези метрики използват контекстуални embedding-и за оценка на семантичната близост, а не само на лексикалното съвпадение.

- **BERTScore**: Изчислява семантичното сходство между token-ите на генерирания и еталонния текст, използвайки embedding-и от модела BERT. Това позволява разпознаване на семантична еквивалентност дори при различна формулировка<sup>[\[4\]](https://systems-analysis.info/int/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%B7%D0%B0_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%BE_%D0%BD%D0%B0_LLM#cite_note-semantic-metrics-4)</sup>.
- **MAUVE**: Измерва разминаването между разпределенията на машинния и човешкия текст в пространството на embedding-ите. Особено ефективна за оценка на отворена генерация, при която няма фиксиран еталонен текст<sup>[\[5\]](https://systems-analysis.info/int/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%B7%D0%B0_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%BE_%D0%BD%D0%B0_LLM#cite_note-distribution-metrics-5)</sup>.

#### Вътрешни метрики на езиковото моделиране

- **Перплексия** (Perplexity): Фундаментална метрика, измерваща доколко добре езиковият модел предсказва последователност от текст. Тя отразява несигурността на модела при предсказване на следващия token. По-ниските стойности на перплексията указват по-добра производителност<sup>[\[6\]](https://systems-analysis.info/int/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%B7%D0%B0_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%BE_%D0%BD%D0%B0_LLM#cite_note-intrinsic-metrics-6)</sup>.
- **Точност и F1-мярка**: Широко прилагани в задачи по класификация и въпросно-отговорни системи. F1-мярката представлява хармонично средно между точността и пълнотата, осигурявайки балансирана оценка<sup>[\[6\]](https://systems-analysis.info/int/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%B7%D0%B0_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%BE_%D0%BD%D0%B0_LLM#cite_note-intrinsic-metrics-6)</sup>.

### Оценка с участието на човек

Човешката оценка остава „златен стандарт", тъй като автоматичните метрики често не са в състояние да уловят фините аспекти на качеството, като свързаност, креативност и релевантност<sup>[\[7\]](https://systems-analysis.info/int/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%B7%D0%B0_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%BE_%D0%BD%D0%B0_LLM#cite_note-human-eval-7)</sup>.

- **Пряка оценка**: Експерти или краудсорсъри оценяват качеството на генерацията по зададена скала (например от 1 до 5) по такива критерии като плавност и свързаност.
- **Сравнителна оценка**: На оценителите се предлага да сравнят изходите на два или повече модела и да изберат най-добрия (двойно сравнение) или да ги наредят от най-добрия към най-лошия.

Недостатъците на човешката оценка са висока цена, сложност при мащабиране и субективност<sup>[\[7\]](https://systems-analysis.info/int/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%B7%D0%B0_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%BE_%D0%BD%D0%B0_LLM#cite_note-human-eval-7)</sup>.

### Оценка с помощта на LLM (LLM-as-a-Judge)

Нов подход, при който един (обикновено по-мощен) езиков модел се използва за оценка на отговорите на друг. Например GPT-4 може да наредва изходите на модели по зададени критерии. Този метод осигурява мащабируема алтернатива на човешката оценка, макар и да има свои проблеми, като чувствителност към стила на заявките и потенциална предубеденост<sup>[\[8\]](https://systems-analysis.info/int/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%B7%D0%B0_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%BE_%D0%BD%D0%B0_LLM#cite_note-llm-as-judge-8)</sup>.

## Специализирани метрики и benchmark-ове

За оценка на конкретни аспекти на производителността и надеждността на LLM се използват специализирани метрики и benchmark-ове.

### Фактологична надеждност

Оценява способността на модела да генерира достоверна информация и да не прибягва до халюцинации.

- **TruthfulQA**: Benchmark, специално разработен за измерване на склонността на моделите да генерират отговори, основани на разпространени митове и заблуди. От модела се изисква да дава фактически верни, а не просто популярни отговори<sup>[\[9\]](https://systems-analysis.info/int/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%B7%D0%B0_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%BE_%D0%BD%D0%B0_LLM#cite_note-security-metrics-9)</sup>.

### Безопасност и етика

- **Оценка на токсичността**: Измерва наличието на обидно или вредно съдържание. За целта се използват специализирани класификатори и API, например **Perspective API**<sup>[\[9\]](https://systems-analysis.info/int/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%B7%D0%B0_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%BE_%D0%BD%D0%B0_LLM#cite_note-security-metrics-9)</sup>.
- **Оценка на предубеденост и справедливост**: Оценява дали моделът демонстрира дискриминационно поведение спрямо различни демографски групи. Изследванията показват, че LLM могат да запазват и усилват социални стереотипи от обучаващите данни<sup>[\[10\]](https://systems-analysis.info/int/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%B7%D0%B0_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%BE_%D0%BD%D0%B0_LLM#cite_note-bias-metrics-10)</sup>.
- **SafetyBench**: Комплексен benchmark за оценка на безопасността, включващ проверка на устойчивостта срещу adversarial атаки и способността за избягване на генериране на вредно съдържание<sup>[\[11\]](https://systems-analysis.info/int/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%B7%D0%B0_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%BE_%D0%BD%D0%B0_LLM#cite_note-safety-bench-11)</sup>.

### Комплексни benchmark-ове

- **MMLU** (Massive Multitask Language Understanding): Един от най-широко използваните benchmark-ове, включващ въпроси с множествен избор по 57 предмета, от елементарна математика до международно право. Той оценява широчината и дълбочината на знанията на модела<sup>[\[12\]](https://systems-analysis.info/int/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%B7%D0%B0_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%BE_%D0%BD%D0%B0_LLM#cite_note-comprehensive-benchmarks-12)</sup>.
- **BIG-bench** (Beyond the Imitation Game): Съдържа повече от 204 задачи, разработени за оценка на способности, излизащи извън рамките на възможностите на стандартните езикови модели, включително задачи от игра на шах до познаване на емоджи<sup>[\[12\]](https://systems-analysis.info/int/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%B7%D0%B0_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%BE_%D0%BD%D0%B0_LLM#cite_note-comprehensive-benchmarks-12)</sup>.

## Предизвикателства и ограничения

- **Проблемът с корелацията**: Традиционните автоматични метрики като BLEU и ROUGE често корелират слабо с човешките оценки, особено при творчески задачи<sup>[\[13\]](https://systems-analysis.info/int/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%B7%D0%B0_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%BE_%D0%BD%D0%B0_LLM#cite_note-challenges-correlation-13)</sup>.
- **Замърсяване на данните (Data Contamination)**: Съществува риск тестовите данни на benchmark-а да са попаднали в обучаващия набор на модела, което води до завишени и недостоверни оценки<sup>[\[14\]](https://systems-analysis.info/int/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%B7%D0%B0_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%BE_%D0%BD%D0%B0_LLM#cite_note-challenges-contamination-14)</sup>.
- **Многоезична оценка**: По-голямата част от съществуващите метрики и benchmark-ове са насочени към английски език, което ограничава тяхната приложимост за оценка на многоезичните способности на LLM<sup>[\[15\]](https://systems-analysis.info/int/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%B7%D0%B0_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%BE_%D0%BD%D0%B0_LLM#cite_note-challenges-multilingual-15)</sup>.

## Препратки

- What Are LLM Benchmarks? — обзорна статия от IBM
- 20 LLM evaluation benchmarks and how they work — ръководство за benchmark-ове от Evidently AI

## Литература

- Papineni, K. et al. (2002). *Bleu: a Method for Automatic Evaluation of Machine Translation*. ACL:P02-1040.
- Lin, C.-Y. (2004). *ROUGE: A Package for Automatic Evaluation of Summaries*. ACL:W04-1013.
- Banerjee, S.; Lavie, A. (2005). *METEOR: An Automatic Metric for MT Evaluation with Improved Correlation with Human Judgments*. ACL:W05-0909.
- Zhang, T. et al. (2019). *BERTScore: Evaluating Text Generation with BERT*. arXiv:1904.09675.
- Pillutla, K. et al. (2021). *MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers*. arXiv:2102.01454.
- Lin, S. et al. (2021). *TruthfulQA: Measuring How Models Mimic Human Falsehoods*. arXiv:2109.07958.
- Parrish, A. et al. (2021). *BBQ: A Hand-Built Bias Benchmark for Question Answering*. arXiv:2110.08193.
- Dhamala, J. et al. (2021). *BOLD: Dataset and Metrics for Measuring Biases in Open-Ended Language Generation*. arXiv:2101.11718.
- Hendrycks, D. et al. (2020). *Measuring Massive Multitask Language Understanding*. arXiv:2009.03300.
- Srivastava, A. et al. (2022). *Beyond the Imitation Game: Quantifying and Extrapolating the Capabilities of Language Models*. arXiv:2206.04615.
- Zhang, Z. et al. (2023). *SafetyBench: Evaluating the Safety of Large Language Models*. arXiv:2309.07045.
- Huang, H. et al. (2024). *An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-Tuned Judge Model is not a General Substitute for GPT-4*. arXiv:2403.02839.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Gu, J. et al. (2024). *A Survey on LLM-as-a-Judge*. arXiv:2411.15594.
- Li, S. et al. (2025). *LLMs Cannot Reliably Judge (Yet?): A Comprehensive Assessment on the Robustness of LLM-as-a-Judge*. arXiv:2506.09443.

## Бележки

1.  <span id="cite_note-perplexity-overview-1">↑ <sup>[1.0](https://systems-analysis.info/int/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%B7%D0%B0_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%BE_%D0%BD%D0%B0_LLM#cite_ref-perplexity-overview_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%B7%D0%B0_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%BE_%D0%BD%D0%B0_LLM#cite_ref-perplexity-overview_1-1)</sup> «Метрики качества LLM». *Perplexity AI*.</span>
2.  <span id="cite_note-perplexity-security-2">[↑](https://systems-analysis.info/int/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%B7%D0%B0_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%BE_%D0%BD%D0%B0_LLM#cite_ref-perplexity-security_2-0) «Специализированные метрики безопасности». *Perplexity AI*.</span>
3.  <span id="cite_note-ngram-metrics-3">↑ <sup>[3.0](https://systems-analysis.info/int/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%B7%D0%B0_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%BE_%D0%BD%D0%B0_LLM#cite_ref-ngram-metrics_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%B7%D0%B0_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%BE_%D0%BD%D0%B0_LLM#cite_ref-ngram-metrics_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%B7%D0%B0_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%BE_%D0%BD%D0%B0_LLM#cite_ref-ngram-metrics_3-2)</sup> «Традиционные метрики оценки текста». *Perplexity AI*.</span>
4.  <span id="cite_note-semantic-metrics-4">[↑](https://systems-analysis.info/int/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%B7%D0%B0_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%BE_%D0%BD%D0%B0_LLM#cite_ref-semantic-metrics_4-0) «Семантические метрики». *Perplexity AI*.</span>
5.  <span id="cite_note-distribution-metrics-5">[↑](https://systems-analysis.info/int/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%B7%D0%B0_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%BE_%D0%BD%D0%B0_LLM#cite_ref-distribution-metrics_5-0) «Метрики на основе распределений». *Perplexity AI*.</span>
6.  <span id="cite_note-intrinsic-metrics-6">↑ <sup>[6.0](https://systems-analysis.info/int/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%B7%D0%B0_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%BE_%D0%BD%D0%B0_LLM#cite_ref-intrinsic-metrics_6-0)</sup> <sup>[6.1](https://systems-analysis.info/int/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%B7%D0%B0_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%BE_%D0%BD%D0%B0_LLM#cite_ref-intrinsic-metrics_6-1)</sup> «Intrinsic метрики». *Perplexity AI*.</span>
7.  <span id="cite_note-human-eval-7">↑ <sup>[7.0](https://systems-analysis.info/int/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%B7%D0%B0_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%BE_%D0%BD%D0%B0_LLM#cite_ref-human-eval_7-0)</sup> <sup>[7.1](https://systems-analysis.info/int/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%B7%D0%B0_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%BE_%D0%BD%D0%B0_LLM#cite_ref-human-eval_7-1)</sup> «Оценка с участием человека». *Perplexity AI*.</span>
8.  <span id="cite_note-llm-as-judge-8">[↑](https://systems-analysis.info/int/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%B7%D0%B0_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%BE_%D0%BD%D0%B0_LLM#cite_ref-llm-as-judge_8-0) «LLM-as-a-Judge». *Perplexity AI*.</span>
9.  <span id="cite_note-security-metrics-9">↑ <sup>[9.0](https://systems-analysis.info/int/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%B7%D0%B0_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%BE_%D0%BD%D0%B0_LLM#cite_ref-security-metrics_9-0)</sup> <sup>[9.1](https://systems-analysis.info/int/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%B7%D0%B0_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%BE_%D0%BD%D0%B0_LLM#cite_ref-security-metrics_9-1)</sup> «Специализированные метрики безопасности». *Perplexity AI*.</span>
10. <span id="cite_note-bias-metrics-10">[↑](https://systems-analysis.info/int/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%B7%D0%B0_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%BE_%D0%BD%D0%B0_LLM#cite_ref-bias-metrics_10-0) «Предвзятость и справедливость». *Perplexity AI*.</span>
11. <span id="cite_note-safety-bench-11">[↑](https://systems-analysis.info/int/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%B7%D0%B0_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%BE_%D0%BD%D0%B0_LLM#cite_ref-safety-bench_11-0) «Benchmark'ы безопасности». *Perplexity AI*.</span>
12. <span id="cite_note-comprehensive-benchmarks-12">↑ <sup>[12.0](https://systems-analysis.info/int/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%B7%D0%B0_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%BE_%D0%BD%D0%B0_LLM#cite_ref-comprehensive-benchmarks_12-0)</sup> <sup>[12.1](https://systems-analysis.info/int/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%B7%D0%B0_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%BE_%D0%BD%D0%B0_LLM#cite_ref-comprehensive-benchmarks_12-1)</sup> «Comprehensive оценка». *Perplexity AI*.</span>
13. <span id="cite_note-challenges-correlation-13">[↑](https://systems-analysis.info/int/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%B7%D0%B0_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%BE_%D0%BD%D0%B0_LLM#cite_ref-challenges-correlation_13-0) «Проблемы корреляции». *Perplexity AI*.</span>
14. <span id="cite_note-challenges-contamination-14">[↑](https://systems-analysis.info/int/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%B7%D0%B0_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%BE_%D0%BD%D0%B0_LLM#cite_ref-challenges-contamination_14-0) «Загрязнение данных». *Perplexity AI*.</span>
15. <span id="cite_note-challenges-multilingual-15">[↑](https://systems-analysis.info/int/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%B7%D0%B0_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%BE_%D0%BD%D0%B0_LLM#cite_ref-challenges-multilingual_15-0) «Многоязычная оценка». *Perplexity AI*.</span>
