---
title: "BLEU (Bilingual Evaluation Understudy) (TR)"
source: "https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(TR)"
wiki: "systems-analysis.info/int"
article: "BLEU_(Bilingual_Evaluation_Understudy)_(TR)"
language: "tr"
categories:
  - "Category:Large language models"
  - "Category:LLM evaluation"
  - "Category:Machine learning"
  - "Category:Turkish"
revision_id: 642
wiki_created_at: 2026-09-06T22:36:48Z
wiki_modified_at: 2026-09-06T22:36:48Z
downloaded_at: 2026-09-07T22:41:25Z
---

# BLEU (Bilingual Evaluation Understudy) (TR)

**BLEU** (İng. *Bilingual Evaluation Understudy* — «iki dilli değerlendirici yedek») — bir makinenin çevirdiği metnin kalitesini otomatik olarak değerlendirmeye yarayan bir algoritmadır. Değerlendirme, aday çeviriyi bir veya birden fazla referans insan çevirisiyle karşılaştırarak yapılır<sup>[\[1\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(TR)#cite_note-wiki_bleu-1)</sup>. Kalite, makine çevirisinin profesyonel çeviriyle sözcüksel yakınlığı esas alınarak belirlenir. Yazarların belirttiği üzere, «makine çevirisi profesyonel bir insan çevirisine ne kadar yakınsa, o kadar iyidir»<sup>[\[2\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(TR)#cite_note-bleu_dvi-2)</sup>.

Yöntem, 2002 yılında IBM'den **Kishore Papineni** önderliğindeki bir araştırmacı grubu tarafından önerilmiş ve uzman çevirmenlerinin değerlendirmeleriyle yüksek korelasyon gösteren ilk metriklerden biri olmuştur. BLEU, hesaplama kolaylığı, dilden bağımsızlığı ve metin derlemesi düzeyinde insan değerlendirmesiyle iyi örtüşmesi sayesinde hızla popülerlik kazanmıştır<sup>[\[1\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(TR)#cite_note-wiki_bleu-1)</sup>.

## BLEU Hesaplama Yöntemi

BLEU, aday çeviri ile referans çeviriler arasındaki n-gram (*n* kelimelik diziler) eşleşmelerini sayarak çeviriyi değerlendirir.

### 1. Değiştirilmiş n-gram kesinliği

Önce farklı uzunluktaki n-gramlar için (genellikle 1'den 4'e kadar) kesinlik ($p_{n}$) hesaplanır; bu, aday çevirideki n-gramların referans çevirilerde bulunma oranıdır<sup>[\[3\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(TR)#cite_note-mt_companion-3)</sup>. Bu süreçte her n-gram için eşleşme sayısı, aynı kelimenin tekrarlanmasından kaynaklanan puan şişmesini önlemek amacıyla herhangi bir referans metindeki maksimum geçiş sayısıyla sınırlandırılır.

### 2. Toplama ve geometrik ortalama

Tek bir puan elde etmek için 1-, 2-, 3- ve 4-gramlara ait kesinlikler geometrik ortalama kullanılarak bir araya getirilir. Bu yaklaşım, belirli bir n-gram türü için (örneğin 4-gramlar) düşük kesinliğin nihai skoru belirgin biçimde etkilemesini sağlar ve uzun ifadelerdeki düşük kaliteyi yansıtır. $\sqrt[4]{p_{1} \cdot p_{2} \cdot p_{3} \cdot p_{4}}$

### 3. Kısalık Cezası (Brevity Penalty)

Çok kısa ancak doğru çeviriler üzerinden yüksek puan alınmasını engellemek için BLEU, **kısalık cezası** (*Brevity Penalty*, BP) uygular. Aday çevirinin uzunluğu (c), referans çevirinin uzunluğundan (r) önemli ölçüde kısaysa nihai BLEU skoru azaltılır. Ceza şu formülle hesaplanır: $\text{BP} = \left\{ \begin{matrix}
1 & {\text{if~}c > r} \\
e^{1 - r/c} & {\text{if~}c \leq r}
\end{matrix} \right.$

### 4. BLEU'nun Nihai Formülü

Nihai BLEU skoru, kısalık cezasının n-gram kesinliklerinin geometrik ortalamasıyla çarpımı olarak hesaplanır<sup>[\[4\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(TR)#cite_note-callison_burch-4)</sup>: $\text{BLEU} = \text{BP} \cdot \exp\left( \sum\limits_{n = 1}^{N}w_{n}\log p_{n} \right)$ burada N — maksimum n-gram uzunluğu (genellikle 4) ve $w_{n}$ — ağırlıklar (genellikle $1/N$).

BLEU değeri 0 ile 1 arasında değişir (çoğunlukla 100 ile çarpılarak yüzde olarak ifade edilir). Sonuç 1'e (100%) ne kadar yakınsa çeviri o kadar «insana yakın» kabul edilir.

## Uygulama ve Önemi

Yayımlandığından bu yana BLEU metriği, makine çevirisi (MÇ) sistemlerinin değerlendirilmesinde fiilî standart hâline gelmiştir. MÇ sistemlerinin gelişimindeki «darboğaz» olan uzun ve maliyetli elle değerlendirme sürecinin aşılmasını sağlamıştır. Geliştiriciler, modellerdeki değişikliklerin etkisini hızla ölçme ve başarısız çözümleri hızlıca eleme olanağına kavuşmuştur<sup>[\[2\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(TR)#cite_note-bleu_dvi-2)</sup>.

BLEU, **tüm derleme düzeyinde** insan değerlendirmeleriyle iyi korelasyon göstermekle birlikte, tek tek cümlelerin değerlendirilmesinde güvenilir değildir<sup>[\[3\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(TR)#cite_note-mt_companion-3)</sup>. Bu nedenle metrik, sistemleri karşılaştırmak amacıyla standartlaştırılmış MÇ yarışmalarında (örneğin NIST ve WMT) yaygın biçimde kullanılmıştır.

## Sınırlılıklar ve Eleştiriler

Yaygın kullanımına karşın BLEU'nun bir dizi önemli sınırlılığı bulunmaktadır:

- **Anlamsal değerlendirmenin yokluğu**: BLEU yalnızca sözcüklerin yüzeysel eşleşmesini ölçer; kaynak metnin **anlamının** doğru aktarılıp aktarılmadığını değerlendiremez. Bir çeviri yüksek puan alabilir, ancak dilbilgisel açıdan hatalı olabilir ya da anlamı çarpıtabilir<sup>[\[5\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(TR)#cite_note-deep_hub-5)</sup>.
- **Eş anlamlılar ve başka ifade biçimlerinin göz ardı edilmesi**: Algoritma, eş anlamlı sözcükler veya referanstakinden farklı ifadeler kullanan çevirileri, tamamen doğru olsalar bile cezalandırır. Birden fazla referans kullanmak bu sorunu hafifletir, ancak tamamen çözmez.
- **Tokenizasyona duyarlılık**: BLEU sonuçları, metnin token'lara bölünme biçimine göre önemli ölçüde değişir. Farklı tokenizer uygulamaları, modellerin karşılaştırılmasını güçleştiren farklı değerlere yol açabilir. Bu sorunu gidermek için metriğin hesaplanmasını standartlaştıran **SacreBLEU** standardı önerilmiştir<sup>[\[1\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(TR)#cite_note-wiki_bleu-1)</sup>.
- **Bazı dillere uygulamanın güçlüğü**: BLEU, belirgin sözcük ayırıcıları bulunmayan dillerde (örneğin Çince veya Japonca) ön segmentasyon yapılmaksızın iyi sonuç vermez.

## Alternatifler ve Modern Yaklaşımlar

Zamanla BLEU'nun eksikliklerini gidermek amacıyla yeni otomatik metrikler önerilmiştir:

- **METEOR**: Eş anlamlı eşleşmeleri, kök bulma (stemming) ve sözcük sıralamasını dikkate alır.
- **ROUGE**: Kesinlik (precision) yerine tamlık (recall) odaklı olarak metin özetleme değerlendirmesinde kullanılır.
- **Öğrenilebilir Metrikler (Learned Metrics)**: Anlamsal yakınlığı hesaba katmak için makine öğrenmesi modellerini kullanan modern yaklaşımlar. **BLEURT** ve **COMET** gibi metrikler, klasik BLEU'ya kıyasla insan değerlendirmeleriyle çok daha yüksek korelasyon göstermektedir<sup>[\[6\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(TR)#cite_note-bleurt-6)</sup>.

2020'li yıllara gelindiğinde BLEU, tartışmasız standart konumunu yitirmiş ve yerini daha doğru yöntemlere bırakmıştır<sup>[\[7\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(TR)#cite_note-ai_mil_lexicon-7)</sup>. Bununla birlikte, MÇ değerlendirme tarihinde önemli bir dönüm noktası olmayı sürdürmekte ve ilerlemenin ölçülmesinde temel bir referans noktası olarak kullanılmaya devam etmektedir.

## Dış bağlantılar

- BLEU skoru nedir? — Microsoft Azure Belgeleri

## Notlar

1.  <span id="cite_note-wiki_bleu-1">↑ <sup>[1.0](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(TR)#cite_ref-wiki_bleu_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(TR)#cite_ref-wiki_bleu_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(TR)#cite_ref-wiki_bleu_1-2)</sup> «BLEU». *Wikipedia*. <a href="https://en.wikipedia.org/wiki/BLEU" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-bleu_dvi-2">↑ <sup>[2.0](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(TR)#cite_ref-bleu_dvi_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(TR)#cite_ref-bleu_dvi_2-1)</sup> Papineni, Kishore, et al. «Bleu: a Method for Automatic Evaluation of Machine Translation». *Proceedings of the 40th Annual Meeting of the Association for Computational Linguistics*, 2002. <a href="https://aclanthology.org/P02-1040.pdf" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-mt_companion-3">↑ <sup>[3.0](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(TR)#cite_ref-mt_companion_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(TR)#cite_ref-mt_companion_3-1)</sup> «BLEU». *MT Companion 4.0 documentation*. <a href="https://companion.languageweaver.com/help/EvaluationAutomated/metrics-bleu.html" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-callison_burch-4">[↑](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(TR)#cite_ref-callison_burch_4-0) Callison-Burch, Chris, et al. «BLEU: a Method for Automatic Evaluation of Machine Translation». *Proceedings of the EACL 2006 Workshop on Statistical Machine Translation*, 2006. <a href="https://aclanthology.org/E06-1032.pdf" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-deep_hub-5">[↑](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(TR)#cite_ref-deep_hub_5-0) Cardete, Jorge. «Beyond BLEU Score. When it comes to the nuanced world of...». *The Deep Hub \| Medium*. <a href="https://medium.com/thedeephub/beyond-bleu-score-unraveling-the-myths-of-machine-translations-favorite-metric-afac33f56de8" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-bleurt-6">[↑](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(TR)#cite_ref-bleurt_6-0) «BLEURT: метрика для оценки моделей для генерации текста». *Neurohive*. <a href="https://neurohive.io/ru/novosti/bleurt-metrika-dlya-ocenki-modelej-dlya-generacii-teksta/" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-ai_mil_lexicon-7">[↑](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(TR)#cite_ref-ai_mil_lexicon_7-0) «Chief Digital and Artificial Intelligence Office \> Lexicon». *ai.mil*. <a href="https://www.ai.mil/Lexicon/" class="external autonumber" rel="nofollow">[7]</a></span>
