---
title: "BLEU (Bilingual Evaluation Understudy) (FA)"
source: "https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(FA)"
wiki: "systems-analysis.info/int"
article: "BLEU_(Bilingual_Evaluation_Understudy)_(FA)"
language: "fa"
categories:
  - "Category:Large language models"
  - "Category:LLM evaluation"
  - "Category:Machine learning"
  - "Category:Persian"
revision_id: 627
wiki_created_at: 2026-09-06T22:36:36Z
wiki_modified_at: 2026-09-06T22:36:36Z
downloaded_at: 2026-09-07T22:41:20Z
---

# BLEU (Bilingual Evaluation Understudy) (FA)

**BLEU** (مخفف انگلیسی *Bilingual Evaluation Understudy* — «ارزیاب جایگزین دوزبانه») — الگوریتمی برای ارزیابی خودکار کیفیت متن ترجمه‌شده توسط ماشین است. ارزیابی از طریق مقایسه ترجمه نامزد با یک یا چند ترجمه مرجع انسانی انجام می‌شود<sup>[\[1\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(FA)#cite_note-wiki_bleu-1)</sup>. کیفیت بر اساس میزان شباهت واژگانی ترجمه ماشینی به ترجمه حرفه‌ای سنجیده می‌شود. همان‌طور که نویسندگان اشاره کردند، «هر چه ترجمه ماشینی به ترجمه یک انسان حرفه‌ای نزدیک‌تر باشد، بهتر است»<sup>[\[2\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(FA)#cite_note-bleu_dvi-2)</sup>.

این روش در سال ۲۰۰۲ توسط گروهی از پژوهشگران IBM به رهبری **کیشور پاپینی** پیشنهاد شد و به یکی از نخستین معیارهایی تبدیل گشت که همبستگی بالایی با ارزیابی‌های متخصصان ترجمه نشان داد. BLEU به سرعت به دلیل سادگی محاسبه، استقلال از زبان و تطابق خوب با ارزیابی انسانی در سطح پیکره متنی محبوبیت یافت<sup>[\[1\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(FA)#cite_note-wiki_bleu-1)</sup>.

## روش محاسبه BLEU

BLEU ترجمه را از طریق شمارش تطابق n-گرام‌ها (دنباله‌هایی از *n* کلمه) میان ترجمه نامزد و ترجمه‌های مرجع ارزیابی می‌کند.

### ۱. دقت اصلاح‌شده n-گرام

ابتدا برای n-گرام‌های با طول‌های مختلف (معمولاً از ۱ تا ۴)، دقت آن‌ها ($p_{n}$) محاسبه می‌شود — یعنی نسبت n-گرام‌های موجود در ترجمه نامزد که در ترجمه‌های مرجع نیز یافت می‌شوند<sup>[\[3\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(FA)#cite_note-mt_companion-3)</sup>. در این فرآیند، تعداد تطابق‌ها برای هر n-گرام به حداکثر تعداد رخداد آن در هر یک از متون مرجع محدود می‌شود تا از بالا رفتن ناروای امتیاز به خاطر تکرار یک کلمه جلوگیری گردد.

### ۲. تجمیع و میانگین هندسی

برای به دست آوردن یک امتیاز واحد، دقت‌های ۱-گرام، ۲-گرام، ۳-گرام و ۴-گرام با استفاده از میانگین هندسی تجمیع می‌شوند. این کار به این دلیل انجام می‌شود که دقت پایین برای یک نوع n-گرام (مثلاً ۴-گرام) تأثیر قابل‌توجهی بر امتیاز نهایی بگذارد و کیفیت ضعیف عبارات بلند را منعکس کند. $\sqrt[4]{p_{1} \cdot p_{2} \cdot p_{3} \cdot p_{4}}$

### ۳. جریمه کوتاهی (Brevity Penalty)

برای جلوگیری از دریافت امتیازهای ناروا از طریق ترجمه‌های بسیار کوتاه اما دقیق، BLEU **جریمه کوتاهی** (*Brevity Penalty*، BP) را معرفی می‌کند. اگر طول ترجمه نامزد (c) به طور قابل‌توجهی کمتر از طول ترجمه مرجع (r) باشد، امتیاز نهایی BLEU کاهش می‌یابد. جریمه بر اساس فرمول زیر محاسبه می‌شود: $\text{BP} = \left\{ \begin{matrix}
1 & {\text{if~}c > r} \\
e^{1 - r/c} & {\text{if~}c \leq r}
\end{matrix} \right.$

### ۴. فرمول نهایی BLEU

امتیاز نهایی BLEU به عنوان حاصل‌ضرب جریمه کوتاهی در میانگین هندسی دقت‌های n-گرام محاسبه می‌شود<sup>[\[4\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(FA)#cite_note-callison_burch-4)</sup>: $\text{BLEU} = \text{BP} \cdot \exp\left( \sum\limits_{n = 1}^{N}w_{n}\log p_{n} \right)$ که در آن N حداکثر طول n-گرام (معمولاً ۴) و $w_{n}$ وزن‌ها هستند (معمولاً $1/N$).

مقدار BLEU در بازه ۰ تا ۱ قرار دارد (اغلب در ۱۰۰ ضرب شده و به صورت درصد بیان می‌شود). هر چه نتیجه به ۱ (۱۰۰٪) نزدیک‌تر باشد، ترجمه «نزدیک‌تر به ترجمه انسانی» محسوب می‌شود.

## کاربرد و اهمیت

از زمان انتشار، معیار BLEU به استاندارد de facto برای ارزیابی سیستم‌های ترجمه ماشینی (MT) تبدیل شد. این معیار امکان عبور از «گلوگاه» توسعه سیستم‌های MT — یعنی زمان‌بر و پرهزینه بودن ارزیابی دستی — را فراهم کرد. توسعه‌دهندگان توانستند به سرعت تأثیر تغییرات در مدل‌ها را اندازه‌گیری کرده و راه‌حل‌های ناموفق را سریعاً حذف کنند<sup>[\[2\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(FA)#cite_note-bleu_dvi-2)</sup>.

BLEU همبستگی خوبی با ارزیابی‌های انسانی در **سطح کل پیکره** متنی دارد، اما برای ارزیابی جملات منفرد قابل اعتماد نیست<sup>[\[3\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(FA)#cite_note-mt_companion-3)</sup>. به همین دلیل، این معیار به طور گسترده در مسابقات استاندارد MT (مانند NIST و WMT) برای مقایسه سیستم‌ها مورد استفاده قرار می‌گرفت.

## محدودیت‌ها و انتقادات

علی‌رغم گستردگی استفاده، BLEU دارای چندین محدودیت اساسی است:

- **فقدان ارزیابی معنایی**: BLEU تنها تطابق سطحی کلمات را اندازه می‌گیرد و قادر به ارزیابی صحت انتقال **معنا** متن مبدأ نیست. ترجمه‌ای ممکن است امتیاز بالایی کسب کند اما از نظر دستوری نادرست باشد یا معنا را تحریف کند<sup>[\[5\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(FA)#cite_note-deep_hub-5)</sup>.
- **نادیده گرفتن مترادف‌ها و بازنویسی**: الگوریتم ترجمه‌هایی را که از مترادف‌ها یا عبارات متفاوت نسبت به مرجع استفاده می‌کنند جریمه می‌کند، حتی اگر کاملاً صحیح باشند. استفاده از چندین مرجع این مشکل را کاهش می‌دهد اما به طور کامل حل نمی‌کند.
- **حساسیت به توکن‌سازی**: نتایج BLEU به شدت به روش تقسیم متن به token بستگی دارد. پیاده‌سازی‌های مختلف tokenizer می‌توانند مقادیر متفاوتی ایجاد کنند و مقایسه مدل‌ها را نادرست کنند. برای حل این مشکل، استاندارد **SacreBLEU** پیشنهاد شد که محاسبه معیار را یکپارچه می‌کند<sup>[\[1\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(FA)#cite_note-wiki_bleu-1)</sup>.
- **دشواری کاربرد برای برخی زبان‌ها**: BLEU برای زبان‌هایی که جداکننده مشخصی برای کلمات ندارند (مثلاً چینی یا ژاپنی) بدون بخش‌بندی اولیه به خوبی عمل نمی‌کند.

## جایگزین‌ها و رویکردهای نوین

با گذشت زمان، معیارهای خودکار جدیدی برای غلبه بر کاستی‌های BLEU پیشنهاد شدند:

- **METEOR**: تطابق مترادف‌ها، stemming و ترتیب کلمات را در نظر می‌گیرد.
- **ROUGE**: برای ارزیابی خلاصه‌سازی متن به کار می‌رود و بر جامعیت (recall) به جای دقت تمرکز دارد.
- **معیارهای آموخته‌شده (Learned Metrics)**: رویکردهای نوینی که از مدل‌های Machine Learning برای در نظر گرفتن شباهت معنایی استفاده می‌کنند. معیارهایی مانند **BLEURT** و **COMET** همبستگی به مراتب بیشتری با ارزیابی‌های انسانی نسبت به BLEU کلاسیک نشان می‌دهند<sup>[\[6\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(FA)#cite_note-bleurt-6)</sup>.

تا دهه ۲۰۲۰، BLEU جایگاه خود را به عنوان استاندارد مطلق از دست داد و جای خود را به روش‌های دقیق‌تر سپرد<sup>[\[7\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(FA)#cite_note-ai_mil_lexicon-7)</sup>. با این حال، این معیار همچنان به عنوان نقطه عطف مهمی در تاریخ ارزیابی MT باقی مانده و به عنوان نقطه مرجع پایه در اندازه‌گیری پیشرفت مورد استفاده قرار می‌گیرد.

## پیوندها

- BLEU score چیست؟ — مستندات Microsoft Azure

## یادداشت‌ها

1.  <span id="cite_note-wiki_bleu-1">↑ <sup>[1.0](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(FA)#cite_ref-wiki_bleu_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(FA)#cite_ref-wiki_bleu_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(FA)#cite_ref-wiki_bleu_1-2)</sup> «BLEU». *Wikipedia*. <a href="https://en.wikipedia.org/wiki/BLEU" class="external autonumber" rel="nofollow">[۱]</a></span>
2.  <span id="cite_note-bleu_dvi-2">↑ <sup>[2.0](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(FA)#cite_ref-bleu_dvi_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(FA)#cite_ref-bleu_dvi_2-1)</sup> Papineni, Kishore, et al. «Bleu: a Method for Automatic Evaluation of Machine Translation». *Proceedings of the 40th Annual Meeting of the Association for Computational Linguistics*, 2002. <a href="https://aclanthology.org/P02-1040.pdf" class="external autonumber" rel="nofollow">[۲]</a></span>
3.  <span id="cite_note-mt_companion-3">↑ <sup>[3.0](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(FA)#cite_ref-mt_companion_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(FA)#cite_ref-mt_companion_3-1)</sup> «BLEU». *MT Companion 4.0 documentation*. <a href="https://companion.languageweaver.com/help/EvaluationAutomated/metrics-bleu.html" class="external autonumber" rel="nofollow">[۳]</a></span>
4.  <span id="cite_note-callison_burch-4">[↑](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(FA)#cite_ref-callison_burch_4-0) Callison-Burch, Chris, et al. «BLEU: a Method for Automatic Evaluation of Machine Translation». *Proceedings of the EACL 2006 Workshop on Statistical Machine Translation*, 2006. <a href="https://aclanthology.org/E06-1032.pdf" class="external autonumber" rel="nofollow">[۴]</a></span>
5.  <span id="cite_note-deep_hub-5">[↑](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(FA)#cite_ref-deep_hub_5-0) Cardete, Jorge. «Beyond BLEU Score. When it comes to the nuanced world of...». *The Deep Hub \| Medium*. <a href="https://medium.com/thedeephub/beyond-bleu-score-unraveling-the-myths-of-machine-translations-favorite-metric-afac33f56de8" class="external autonumber" rel="nofollow">[۵]</a></span>
6.  <span id="cite_note-bleurt-6">[↑](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(FA)#cite_ref-bleurt_6-0) «BLEURT: метрика для оценки моделей для генерации текста». *Neurohive*. <a href="https://neurohive.io/ru/novosti/bleurt-metrika-dlya-ocenki-modelej-dlya-generacii-teksta/" class="external autonumber" rel="nofollow">[۶]</a></span>
7.  <span id="cite_note-ai_mil_lexicon-7">[↑](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(FA)#cite_ref-ai_mil_lexicon_7-0) «Chief Digital and Artificial Intelligence Office \> Lexicon». *ai.mil*. <a href="https://www.ai.mil/Lexicon/" class="external autonumber" rel="nofollow">[۷]</a></span>
