---
title: "BLEU"
source: "https://systems-analysis.info/wiki/BLEU"
wiki: "systems-analysis.info/wiki"
article: "BLEU"
language: "ru"
categories:
  - "Категория:Russian"
  - "Категория:Большие языковые модели"
  - "Категория:Машинное обучение"
  - "Категория:Оценка LLM"
revision_id: 74
wiki_created_at: 2026-09-06T21:54:37Z
wiki_modified_at: 2026-09-06T21:54:37Z
downloaded_at: 2026-09-07T22:17:14Z
---

# BLEU

**BLEU** (от англ. *Bilingual Evaluation Understudy* — «двуязычный подменяющий оценщик») — это алгоритм для автоматической оценки качества текста, переведённого машиной. Оценка производится путём сравнения перевода-кандидата с одним или несколькими эталонными (референсными) человеческими переводами<sup>[\[1\]](https://systems-analysis.info/wiki/BLEU#cite_note-wiki_bleu-1)</sup>. Качество определяется степенью лексической близости машинного перевода к профессиональному. Как отмечали авторы, «чем ближе машинный перевод к переводу профессионального человека, тем он лучше»<sup>[\[2\]](https://systems-analysis.info/wiki/BLEU#cite_note-bleu_dvi-2)</sup>.

Метод был предложен в 2002 году группой исследователей из IBM под руководством **Кишора Папинени** и стал одной из первых метрик, показавших высокую корреляцию с оценками экспертов-переводчиков. BLEU быстро завоевала популярность благодаря простоте расчёта, языковой независимости и хорошему совпадению с человеческой оценкой на уровне корпуса текстов<sup>[\[1\]](https://systems-analysis.info/wiki/BLEU#cite_note-wiki_bleu-1)</sup>.

## Методика расчёта BLEU

BLEU оценивает перевод путём подсчёта совпадений n-грамм (последовательностей из *n* слов) между переводом-кандидатом и эталонными переводами.

### 1. Модифицированная точность n-грамм

Сначала для n-грамм разной длины (обычно от 1 до 4) рассчитывается их точность ($p_{n}$) — доля n-грамм из перевода-кандидата, которые встречаются в эталонных переводах<sup>[\[3\]](https://systems-analysis.info/wiki/BLEU#cite_note-mt_companion-3)</sup>. При этом количество совпадений для каждой n-граммы ограничивается максимальным числом её вхождений в любом из эталонных текстов, чтобы избежать завышения оценки за повторение одного и того же слова.

### 2. Агрегирование и геометрическое среднее

Чтобы получить единую оценку, точности для 1-, 2-, 3- и 4-грамм агрегируются с помощью среднего геометрического. Это делается для того, чтобы низкая точность для одного типа n-грамм (например, 4-грамм) сильно влияла на итоговый балл, отражая плохое качество длинных фраз. $\sqrt[4]{p_{1} \cdot p_{2} \cdot p_{3} \cdot p_{4}}$

### 3. Штраф за краткость (Brevity Penalty)

Чтобы предотвратить получение завышенных оценок за счёт слишком коротких, но точных переводов, BLEU вводит **штраф за краткость** (*Brevity Penalty*, BP). Если длина перевода-кандидата (c) существенно меньше длины эталонного перевода (r), итоговый балл BLEU уменьшается. Штраф рассчитывается по формуле: $\text{BP} = \left\{ \begin{matrix}
1 & {\text{if~}c > r} \\
e^{1 - r/c} & {\text{if~}c \leq r}
\end{matrix} \right.$

### 4. Итоговая формула BLEU

Окончательный BLEU-скор рассчитывается как произведение штрафа за краткость на среднее геометрическое точностей n-грамм<sup>[\[4\]](https://systems-analysis.info/wiki/BLEU#cite_note-callison_burch-4)</sup>: $\text{BLEU} = \text{BP} \cdot \exp\left( \sum\limits_{n = 1}^{N}w_{n}\log p_{n} \right)$ где N — максимальная длина n-грамм (обычно 4), а $w_{n}$ — веса (обычно $1/N$).

Значение BLEU находится в диапазоне от 0 до 1 (часто умножается на 100 и выражается в процентах). Чем ближе результат к 1 (100%), тем более «близким к человеческому» считается перевод.

## Применение и значение

С момента публикации метрика BLEU стала де-факто стандартом для оценки систем машинного перевода (МП). Она позволила преодолеть «узкое место» в развитии МП-систем — длительность и дороговизну ручной оценки. Разработчики получили возможность быстро измерять эффект от изменений в моделях и оперативно отсеивать неудачные решения<sup>[\[2\]](https://systems-analysis.info/wiki/BLEU#cite_note-bleu_dvi-2)</sup>.

BLEU хорошо коррелирует с человеческими оценками на **уровне всего корпуса** текстов, но ненадёжен для оценки отдельных предложений<sup>[\[3\]](https://systems-analysis.info/wiki/BLEU#cite_note-mt_companion-3)</sup>. Поэтому метрика широко использовалась в стандартизированных соревнованиях по МП (например, NIST и WMT) для сравнения систем.

## Ограничения и критика

Несмотря на широкое распространение, BLEU имеет ряд существенных ограничений:

- **Отсутствие семантической оценки**: BLEU измеряет лишь поверхностное совпадение слов и не способен оценить, верно ли передан **смысл** исходного текста. Перевод может получить высокий балл, но быть грамматически неверным или искажать значение<sup>[\[5\]](https://systems-analysis.info/wiki/BLEU#cite_note-deep_hub-5)</sup>.
- **Игнорирование синонимов и парафразов**: Алгоритм наказывает переводы, использующие синонимы или иные формулировки, чем в эталоне, даже если они полностью корректны. Использование нескольких эталонов смягчает, но не решает эту проблему полностью.
- **Чувствительность к токенизации**: Результаты BLEU сильно зависят от способа разбиения текста на [токены](https://systems-analysis.info/wiki/%D0%A2%D0%BE%D0%BA%D0%B5%D0%BD "Токен"). Разные реализации токенизаторов могут приводить к разным значениям, делая сравнение моделей некорректным. Для решения этой проблемы был предложен стандарт **SacreBLEU**, унифицирующий вычисление метрики<sup>[\[1\]](https://systems-analysis.info/wiki/BLEU#cite_note-wiki_bleu-1)</sup>.
- **Сложность применения к некоторым языкам**: BLEU плохо работает с языками, не имеющими чётких разделителей слов (например, китайским или японским), без предварительной сегментации.

## Альтернативы и современные подходы

Со временем для преодоления недостатков BLEU были предложены новые автоматические метрики:

- **METEOR**: Учитывает совпадения синонимов, стемминг и порядок слов.
- **ROUGE**: Применяется для оценки реферирования текстов, фокусируясь на полноте (recall), а не на точности.
- **Обучаемые метрики (Learned Metrics)**: Современные подходы, использующие модели машинного обучения для учёта семантической близости. Метрики, такие как **BLEURT** и **COMET**, показывают значительно более высокую корреляцию с оценками людей, чем классический BLEU<sup>[\[6\]](https://systems-analysis.info/wiki/BLEU#cite_note-bleurt-6)</sup>.

К 2020-м годам BLEU утратил статус безусловного стандарта, уступив место более точным методам<sup>[\[7\]](https://systems-analysis.info/wiki/BLEU#cite_note-ai_mil_lexicon-7)</sup>. Тем не менее, он остаётся важной вехой в истории оценки МП и продолжает использоваться как базовая точка отсчёта при измерении прогресса.

## См. также

- [BERTScore](https://systems-analysis.info/wiki/BERTScore "BERTScore")
- [LLM‑as‑a‑Judge](https://systems-analysis.info/wiki/LLM%E2%80%91as%E2%80%91a%E2%80%91Judge "LLM‑as‑a‑Judge")
- [METEOR](https://systems-analysis.info/wiki/METEOR "METEOR")
- [ROUGE](https://systems-analysis.info/wiki/ROUGE "ROUGE")
- [Метрики качества LLM](https://systems-analysis.info/wiki/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%B0_LLM "Метрики качества LLM")

## Ссылки

- <a href="https://learn.microsoft.com/ru-ru/azure/ai-services/translator/custom-translator/concepts/bleu-score" class="external text" rel="nofollow">Что такое оценка BLEU? — Документация Microsoft Azure</a>

## Примечания

1.  <span id="cite_note-wiki_bleu-1">↑ <sup>[1,0](https://systems-analysis.info/wiki/BLEU#cite_ref-wiki_bleu_1-0)</sup> <sup>[1,1](https://systems-analysis.info/wiki/BLEU#cite_ref-wiki_bleu_1-1)</sup> <sup>[1,2](https://systems-analysis.info/wiki/BLEU#cite_ref-wiki_bleu_1-2)</sup> «BLEU». *Wikipedia*. <a href="https://en.wikipedia.org/wiki/BLEU" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-bleu_dvi-2">↑ <sup>[2,0](https://systems-analysis.info/wiki/BLEU#cite_ref-bleu_dvi_2-0)</sup> <sup>[2,1](https://systems-analysis.info/wiki/BLEU#cite_ref-bleu_dvi_2-1)</sup> Papineni, Kishore, et al. «Bleu: a Method for Automatic Evaluation of Machine Translation». *Proceedings of the 40th Annual Meeting of the Association for Computational Linguistics*, 2002. <a href="https://aclanthology.org/P02-1040.pdf" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-mt_companion-3">↑ <sup>[3,0](https://systems-analysis.info/wiki/BLEU#cite_ref-mt_companion_3-0)</sup> <sup>[3,1](https://systems-analysis.info/wiki/BLEU#cite_ref-mt_companion_3-1)</sup> «BLEU». *MT Companion 4.0 documentation*. <a href="https://companion.languageweaver.com/help/EvaluationAutomated/metrics-bleu.html" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-callison_burch-4">[↑](https://systems-analysis.info/wiki/BLEU#cite_ref-callison_burch_4-0) Callison-Burch, Chris, et al. «BLEU: a Method for Automatic Evaluation of Machine Translation». *Proceedings of the EACL 2006 Workshop on Statistical Machine Translation*, 2006. <a href="https://aclanthology.org/E06-1032.pdf" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-deep_hub-5">[↑](https://systems-analysis.info/wiki/BLEU#cite_ref-deep_hub_5-0) Cardete, Jorge. «Beyond BLEU Score. When it comes to the nuanced world of...». *The Deep Hub \| Medium*. <a href="https://medium.com/thedeephub/beyond-bleu-score-unraveling-the-myths-of-machine-translations-favorite-metric-afac33f56de8" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-bleurt-6">[↑](https://systems-analysis.info/wiki/BLEU#cite_ref-bleurt_6-0) «BLEURT: метрика для оценки моделей для генерации текста». *Neurohive*. <a href="https://neurohive.io/ru/novosti/bleurt-metrika-dlya-ocenki-modelej-dlya-generacii-teksta/" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-ai_mil_lexicon-7">[↑](https://systems-analysis.info/wiki/BLEU#cite_ref-ai_mil_lexicon_7-0) «Chief Digital and Artificial Intelligence Office \> Lexicon». *ai.mil*. <a href="https://www.ai.mil/Lexicon/" class="external autonumber" rel="nofollow">[7]</a></span>
