---
title: "BLEU (Bilingual Evaluation Understudy) (BG)"
source: "https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(BG)"
wiki: "systems-analysis.info/int"
article: "BLEU_(Bilingual_Evaluation_Understudy)_(BG)"
language: "bg"
categories:
  - "Category:Bulgarian"
  - "Category:Large language models"
  - "Category:LLM evaluation"
  - "Category:Machine learning"
revision_id: 621
wiki_created_at: 2026-09-06T22:36:31Z
wiki_modified_at: 2026-09-06T22:36:31Z
downloaded_at: 2026-09-07T22:41:18Z
---

# BLEU (Bilingual Evaluation Understudy) (BG)

**BLEU** (от англ. *Bilingual Evaluation Understudy* — „двуезичен заместващ оценител") — това е алгоритъм за автоматична оценка на качеството на текст, преведен от машина. Оценката се извършва чрез сравняване на превода-кандидат с един или повече еталонни (референтни) човешки превода<sup>[\[1\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(BG)#cite_note-wiki_bleu-1)</sup>. Качеството се определя от степента на лексикална близост на машинния превод до професионалния. Както отбелязват авторите, „колкото по-близо е машинният превод до превода на професионален човек, толкова е по-добър"<sup>[\[2\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(BG)#cite_note-bleu_dvi-2)</sup>.

Методът е предложен през 2002 година от група изследователи от IBM под ръководството на **Кишор Папинени** и се превърна в една от първите метрики, показали висока корелация с оценките на експерти-преводачи. BLEU бързо спечели популярност благодарение на простотата на изчисление, езиковата независимост и доброто съответствие с човешката оценка на ниво корпус от текстове<sup>[\[1\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(BG)#cite_note-wiki_bleu-1)</sup>.

## Методика на изчисляване на BLEU

BLEU оценява превода чрез преброяване на съвпаденията на n-грами (последователности от *n* думи) между превода-кандидат и еталонните преводи.

### 1. Модифицирана точност на n-грами

Най-напред за n-грами с различна дължина (обикновено от 1 до 4) се изчислява тяхната точност ($p_{n}$) — делът на n-грамите от превода-кандидат, които се срещат в еталонните преводи<sup>[\[3\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(BG)#cite_note-mt_companion-3)</sup>. При това броят на съвпаденията за всяка n-грама е ограничен до максималния брой на нейните срещания в кой да е от еталонните текстове, за да се избегне надценяване заради повторение на една и съща дума.

### 2. Агрегиране и геометрично средно

За да се получи единна оценка, точностите за 1-, 2-, 3- и 4-грами се агрегират чрез геометрично средно. Това се прави, за да може ниската точност за един вид n-грами (например 4-грами) да влияе силно върху крайния резултат, отразявайки лошото качество на дългите фрази. $\sqrt[4]{p_{1} \cdot p_{2} \cdot p_{3} \cdot p_{4}}$

### 3. Наказание за краткост (Brevity Penalty)

За да се предотврати получаването на завишени оценки за сметка на прекалено кратки, но точни преводи, BLEU въвежда **наказание за краткост** (*Brevity Penalty*, BP). Ако дължината на превода-кандидат (c) е значително по-малка от дължината на еталонния превод (r), крайният резултат BLEU се намалява. Наказанието се изчислява по формулата: $ext{BP} = \left\{ \begin{matrix}
1 & {ext{if}c > r} \\
e^{1 - r/c} & {ext{if}c \leq r}
\end{matrix} \right.$

### 4. Крайна формула на BLEU

Окончателният BLEU-резултат се изчислява като произведение на наказанието за краткост и геометричното средно на точностите на n-грамите<sup>[\[4\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(BG)#cite_note-callison_burch-4)</sup>: $ext{BLEU} = ext{BP} \cdot \exp\left( \sum\limits_{n = 1}^{N}w_{n}\log p_{n} \right)$ където N — максималната дължина на n-грамите (обикновено 4), а $w_{n}$ — тегла (обикновено $1/N$).

Стойността на BLEU се намира в диапазона от 0 до 1 (често се умножава по 100 и се изразява в проценти). Колкото по-близо е резултатът до 1 (100%), толкова по-„близък до човешкия" се счита преводът.

## Приложение и значение

От момента на публикуване метриката BLEU се превърна в де факто стандарт за оценка на системите за машинен превод (МП). Тя позволи да се преодолее „тесното място" в развитието на МП-системите — продължителността и скъпоструващността на ръчната оценка. Разработчиците получиха възможност бързо да измерват ефекта от промените в моделите и оперативно да отсяват неуспешните решения<sup>[\[2\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(BG)#cite_note-bleu_dvi-2)</sup>.

BLEU корелира добре с човешките оценки на **ниво целия корпус** от текстове, но е ненадежден за оценка на отделни изречения<sup>[\[3\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(BG)#cite_note-mt_companion-3)</sup>. Затова метриката широко се използваше в стандартизирани състезания по МП (например NIST и WMT) за сравняване на системи.

## Ограничения и критика

Въпреки широкото си разпространение, BLEU има редица съществени ограничения:

- **Липса на семантична оценка**: BLEU измерва само повърхностното съвпадение на думи и не е в състояние да оцени дали **смисълът** на изходния текст е предаден правилно. Преводът може да получи висок резултат, но да бъде граматически неверен или да изкривява значението<sup>[\[5\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(BG)#cite_note-deep_hub-5)</sup>.
- **Игнориране на синоними и парафрази**: Алгоритъмът наказва преводи, използващи синоними или различни формулировки от тези в еталона, дори ако те са напълно коректни. Използването на няколко еталона смекчава, но не решава напълно този проблем.
- **Чувствителност към токенизация**: Резултатите от BLEU силно зависят от начина на разбиване на текста на token-и. Различните реализации на токенизатори могат да водят до различни стойности, правейки сравнението на модели некоректно. За решаването на този проблем бе предложен стандартът **SacreBLEU**, унифициращ изчисляването на метриката<sup>[\[1\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(BG)#cite_note-wiki_bleu-1)</sup>.
- **Трудност при прилагане към някои езици**: BLEU работи зле с езици, нямащи ясни разделители на думите (например китайски или японски), без предварителна сегментация.

## Алтернативи и съвременни подходи

С течение на времето за преодоляване на недостатъците на BLEU бяха предложени нови автоматични метрики:

- **METEOR**: Отчита съвпаденията на синоними, stemming и реда на думите.
- **ROUGE**: Прилага се за оценка на реферирането на текстове, фокусирайки се върху пълнотата (recall), а не върху точността.
- **Обучаеми метрики (Learned Metrics)**: Съвременни подходи, използващи модели за Machine Learning за отчитане на семантичната близост. Метрики като **BLEURT** и **COMET** показват значително по-висока корелация с оценките на хората, отколкото класическият BLEU<sup>[\[6\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(BG)#cite_note-bleurt-6)</sup>.

Към 2020-те години BLEU загуби статута на безусловен стандарт, отстъпвайки място на по-точни методи<sup>[\[7\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(BG)#cite_note-ai_mil_lexicon-7)</sup>. Въпреки това той остава важна веха в историята на оценката на МП и продължава да се използва като базова отправна точка при измерване на напредъка.

## Връзки

- Какво представлява оценката BLEU? — Документация на Microsoft Azure

## Бележки

1.  <span id="cite_note-wiki_bleu-1">↑ <sup>[1.0](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(BG)#cite_ref-wiki_bleu_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(BG)#cite_ref-wiki_bleu_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(BG)#cite_ref-wiki_bleu_1-2)</sup> «BLEU». *Wikipedia*. <a href="https://en.wikipedia.org/wiki/BLEU" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-bleu_dvi-2">↑ <sup>[2.0](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(BG)#cite_ref-bleu_dvi_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(BG)#cite_ref-bleu_dvi_2-1)</sup> Papineni, Kishore, et al. «Bleu: a Method for Automatic Evaluation of Machine Translation». *Proceedings of the 40th Annual Meeting of the Association for Computational Linguistics*, 2002. <a href="https://aclanthology.org/P02-1040.pdf" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-mt_companion-3">↑ <sup>[3.0](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(BG)#cite_ref-mt_companion_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(BG)#cite_ref-mt_companion_3-1)</sup> «BLEU». *MT Companion 4.0 documentation*. <a href="https://companion.languageweaver.com/help/EvaluationAutomated/metrics-bleu.html" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-callison_burch-4">[↑](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(BG)#cite_ref-callison_burch_4-0) Callison-Burch, Chris, et al. «BLEU: a Method for Automatic Evaluation of Machine Translation». *Proceedings of the EACL 2006 Workshop on Statistical Machine Translation*, 2006. <a href="https://aclanthology.org/E06-1032.pdf" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-deep_hub-5">[↑](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(BG)#cite_ref-deep_hub_5-0) Cardete, Jorge. «Beyond BLEU Score. When it comes to the nuanced world of...». *The Deep Hub \| Medium*. <a href="https://medium.com/thedeephub/beyond-bleu-score-unraveling-the-myths-of-machine-translations-favorite-metric-afac33f56de8" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-bleurt-6">[↑](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(BG)#cite_ref-bleurt_6-0) «BLEURT: метрика для оценки моделей для генерации текста». *Neurohive*. <a href="https://neurohive.io/ru/novosti/bleurt-metrika-dlya-ocenki-modelej-dlya-generacii-teksta/" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-ai_mil_lexicon-7">[↑](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(BG)#cite_ref-ai_mil_lexicon_7-0) «Chief Digital and Artificial Intelligence Office \> Lexicon». *ai.mil*. <a href="https://www.ai.mil/Lexicon/" class="external autonumber" rel="nofollow">[7]</a></span>
