---
title: "BLEU (Bilingual Evaluation Understudy) (KO)"
source: "https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(KO)"
wiki: "systems-analysis.info/int"
article: "BLEU_(Bilingual_Evaluation_Understudy)_(KO)"
language: "ko"
categories:
  - "Category:Korean"
  - "Category:Large language models"
  - "Category:LLM evaluation"
  - "Category:Machine learning"
revision_id: 634
wiki_created_at: 2026-09-06T22:36:42Z
wiki_modified_at: 2026-09-06T22:36:42Z
downloaded_at: 2026-09-07T22:41:23Z
---

# BLEU (Bilingual Evaluation Understudy) (KO)

**BLEU** (영어 *Bilingual Evaluation Understudy* — «이중 언어 평가 대리 지표»의 약어) — 기계가 번역한 텍스트의 품질을 자동으로 평가하기 위한 알고리즘입니다. 평가는 후보 번역문을 하나 이상의 기준(참조) 인간 번역문과 비교하는 방식으로 이루어집니다<sup>[\[1\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(KO)#cite_note-wiki_bleu-1)</sup>. 품질은 기계 번역이 전문 번역에 얼마나 어휘적으로 근접한지에 따라 결정됩니다. 저자들이 언급했듯이, «기계 번역이 전문 인간 번역에 가까울수록 품질이 높다»고 할 수 있습니다<sup>[\[2\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(KO)#cite_note-bleu_dvi-2)</sup>.

이 방법은 2002년 **키쇼어 파피네니(Kishore Papineni)**가 이끄는 IBM 연구팀에 의해 제안되었으며, 번역 전문가의 평가와 높은 상관관계를 보인 최초의 지표 중 하나가 되었습니다. BLEU는 계산의 단순성, 언어 독립성, 그리고 코퍼스 수준에서의 인간 평가와의 높은 일치도 덕분에 빠르게 인기를 얻었습니다<sup>[\[1\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(KO)#cite_note-wiki_bleu-1)</sup>.

## BLEU 계산 방법

BLEU는 후보 번역문과 기준 번역문 사이의 n-gram(*n*개의 단어로 이루어진 연속 단위) 일치 횟수를 계산하여 번역을 평가합니다.

### 1. 수정된 n-gram 정밀도

먼저 다양한 길이의 n-gram(보통 1에서 4까지)에 대해 정밀도($p_{n}$)를 계산합니다. 이는 후보 번역문의 n-gram 중 기준 번역문에 등장하는 n-gram의 비율입니다<sup>[\[3\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(KO)#cite_note-mt_companion-3)</sup>. 이때 각 n-gram의 일치 횟수는 기준 텍스트 중 하나에서의 최대 등장 횟수로 제한되어, 동일한 단어의 반복으로 인한 점수 과대 평가를 방지합니다.

### 2. 집계 및 기하 평균

단일 점수를 산출하기 위해 1-, 2-, 3-, 4-gram의 정밀도를 기하 평균을 사용하여 집계합니다. 이는 특정 n-gram 유형(예: 4-gram)의 정밀도가 낮을 경우 최종 점수에 크게 영향을 미치도록 하여 긴 구문의 낮은 품질을 반영하기 위함입니다. $\sqrt[4]{p_{1} \cdot p_{2} \cdot p_{3} \cdot p_{4}}$

### 3. 간결성 패널티 (Brevity Penalty)

너무 짧지만 정확한 번역으로 인해 점수가 과대 평가되는 것을 방지하기 위해, BLEU는 **간결성 패널티** (*Brevity Penalty*, BP)를 도입합니다. 후보 번역문의 길이(c)가 기준 번역문의 길이(r)보다 현저히 짧을 경우 최종 BLEU 점수가 감소합니다. 패널티는 다음 공식으로 계산됩니다: $\text{BP} = \left\{ \begin{matrix}
1 & {\text{if~}c > r} \\
e^{1 - r/c} & {\text{if~}c \leq r}
\end{matrix} \right.$

### 4. 최종 BLEU 공식

최종 BLEU 점수는 간결성 패널티와 n-gram 정밀도의 기하 평균의 곱으로 계산됩니다<sup>[\[4\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(KO)#cite_note-callison_burch-4)</sup>: $\text{BLEU} = \text{BP} \cdot \exp\left( \sum\limits_{n = 1}^{N}w_{n}\log p_{n} \right)$ 여기서 N은 n-gram의 최대 길이(보통 4)이고, $w_{n}$는 가중치(보통 $1/N$)입니다.

BLEU 값은 0에서 1 사이의 범위에 있으며(종종 100을 곱하여 퍼센트로 표현됩니다). 결과가 1(100%)에 가까울수록 번역이 «인간 번역에 가깝다»고 간주됩니다.

## 적용 및 의의

발표 이후 BLEU 지표는 기계 번역(MT) 시스템 평가의 사실상 표준이 되었습니다. 이 지표는 MT 시스템 발전의 «병목»이었던 수동 평가의 긴 소요 시간과 높은 비용 문제를 극복할 수 있게 해주었습니다. 개발자들은 모델 변경의 효과를 신속하게 측정하고 비효율적인 솔루션을 빠르게 걸러낼 수 있게 되었습니다<sup>[\[2\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(KO)#cite_note-bleu_dvi-2)</sup>.

BLEU는 **코퍼스 전체 수준**에서 인간 평가와 잘 상관되지만, 개별 문장 평가에는 신뢰성이 떨어집니다<sup>[\[3\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(KO)#cite_note-mt_companion-3)</sup>. 따라서 이 지표는 시스템 비교를 위한 표준화된 MT 경진대회(예: NIST 및 WMT)에서 널리 사용되었습니다.

## 한계 및 비판

널리 사용됨에도 불구하고 BLEU에는 몇 가지 중요한 한계가 있습니다:

- **의미론적 평가 부재**: BLEU는 단어의 표면적 일치만을 측정하며, 원문의 **의미**가 정확하게 전달되었는지를 평가할 수 없습니다. 번역이 높은 점수를 받더라도 문법적으로 잘못되었거나 의미가 왜곡될 수 있습니다<sup>[\[5\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(KO)#cite_note-deep_hub-5)</sup>.
- **동의어 및 바꿔 쓰기 무시**: 이 알고리즘은 기준 번역과 다른 동의어나 표현을 사용하는 번역에 불이익을 줍니다. 설령 그 표현이 완전히 올바르더라도 마찬가지입니다. 여러 기준 번역의 사용이 이 문제를 완화하지만 완전히 해결하지는 못합니다.
- **토크나이제이션(tokenization)에 대한 민감성**: BLEU 결과는 텍스트를 토큰으로 분할하는 방식에 따라 크게 달라집니다. 서로 다른 토크나이저 구현은 다른 값을 산출하여 모델 비교를 부정확하게 만들 수 있습니다. 이 문제를 해결하기 위해 지표 계산을 표준화하는 **SacreBLEU** 표준이 제안되었습니다<sup>[\[1\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(KO)#cite_note-wiki_bleu-1)</sup>.
- **일부 언어에의 적용 어려움**: BLEU는 사전 분절 없이는 명확한 단어 구분자가 없는 언어(예: 중국어 또는 일본어)에서 잘 작동하지 않습니다.

## 대안 및 현대적 접근법

시간이 지남에 따라 BLEU의 단점을 극복하기 위한 새로운 자동 지표들이 제안되었습니다:

- **METEOR**: 동의어 일치, 어간 추출(stemming) 및 단어 순서를 고려합니다.
- **ROUGE**: 정밀도보다 재현율(recall)에 초점을 맞추어 텍스트 요약 평가에 사용됩니다.
- **학습 기반 지표 (Learned Metrics)**: 의미론적 근접성을 고려하기 위해 머신 러닝 모델을 사용하는 현대적 접근법입니다. **BLEURT** 및 **COMET**과 같은 지표들은 고전적인 BLEU보다 인간 평가와 훨씬 높은 상관관계를 보입니다<sup>[\[6\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(KO)#cite_note-bleurt-6)</sup>.

2020년대에 이르러 BLEU는 절대적 표준의 지위를 잃고 더 정확한 방법들에 자리를 내주었습니다<sup>[\[7\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(KO)#cite_note-ai_mil_lexicon-7)</sup>. 그럼에도 불구하고, BLEU는 MT 평가 역사에서 중요한 이정표로 남아 있으며 진보를 측정하는 기준점으로 계속 활용되고 있습니다.

## 외부 링크

- BLEU 점수란 무엇인가? — Microsoft Azure 문서

## 각주

1.  <span id="cite_note-wiki_bleu-1">↑ <sup>[1.0](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(KO)#cite_ref-wiki_bleu_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(KO)#cite_ref-wiki_bleu_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(KO)#cite_ref-wiki_bleu_1-2)</sup> «BLEU». *Wikipedia*. <a href="https://en.wikipedia.org/wiki/BLEU" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-bleu_dvi-2">↑ <sup>[2.0](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(KO)#cite_ref-bleu_dvi_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(KO)#cite_ref-bleu_dvi_2-1)</sup> Papineni, Kishore, et al. «Bleu: a Method for Automatic Evaluation of Machine Translation». *Proceedings of the 40th Annual Meeting of the Association for Computational Linguistics*, 2002. <a href="https://aclanthology.org/P02-1040.pdf" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-mt_companion-3">↑ <sup>[3.0](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(KO)#cite_ref-mt_companion_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(KO)#cite_ref-mt_companion_3-1)</sup> «BLEU». *MT Companion 4.0 documentation*. <a href="https://companion.languageweaver.com/help/EvaluationAutomated/metrics-bleu.html" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-callison_burch-4">[↑](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(KO)#cite_ref-callison_burch_4-0) Callison-Burch, Chris, et al. «BLEU: a Method for Automatic Evaluation of Machine Translation». *Proceedings of the EACL 2006 Workshop on Statistical Machine Translation*, 2006. <a href="https://aclanthology.org/E06-1032.pdf" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-deep_hub-5">[↑](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(KO)#cite_ref-deep_hub_5-0) Cardete, Jorge. «Beyond BLEU Score. When it comes to the nuanced world of...». *The Deep Hub \| Medium*. <a href="https://medium.com/thedeephub/beyond-bleu-score-unraveling-the-myths-of-machine-translations-favorite-metric-afac33f56de8" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-bleurt-6">[↑](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(KO)#cite_ref-bleurt_6-0) «BLEURT: метрика для оценки моделей для генерации текста». *Neurohive*. <a href="https://neurohive.io/ru/novosti/bleurt-metrika-dlya-ocenki-modelej-dlya-generacii-teksta/" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-ai_mil_lexicon-7">[↑](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(KO)#cite_ref-ai_mil_lexicon_7-0) «Chief Digital and Artificial Intelligence Office \> Lexicon». *ai.mil*. <a href="https://www.ai.mil/Lexicon/" class="external autonumber" rel="nofollow">[7]</a></span>
