---
title: "BLEU (Bilingual Evaluation Understudy) (HI)"
source: "https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HI)"
wiki: "systems-analysis.info/int"
article: "BLEU_(Bilingual_Evaluation_Understudy)_(HI)"
language: "hi"
categories:
  - "Category:Hindi"
  - "Category:Large language models"
  - "Category:LLM evaluation"
  - "Category:Machine learning"
revision_id: 630
wiki_created_at: 2026-09-06T22:36:38Z
wiki_modified_at: 2026-09-06T22:36:38Z
downloaded_at: 2026-09-07T22:41:21Z
---

# BLEU (Bilingual Evaluation Understudy) (HI)

**BLEU** (अंग्रेज़ी *Bilingual Evaluation Understudy* — «द्विभाषी प्रतिस्थापन मूल्यांकक») — यह मशीन द्वारा अनुवादित पाठ की गुणवत्ता के स्वचालित मूल्यांकन के लिए एक एल्गोरिदम है। मूल्यांकन उम्मीदवार अनुवाद की एक या अधिक संदर्भ (reference) मानव अनुवादों से तुलना करके किया जाता है<sup>[\[1\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HI)#cite_note-wiki_bleu-1)</sup>। गुणवत्ता मशीनी अनुवाद की पेशेवर अनुवाद से शाब्दिक निकटता की मात्रा से निर्धारित होती है। जैसा कि लेखकों ने कहा था, «मशीनी अनुवाद जितना एक पेशेवर मानव अनुवाद के करीब होता है, वह उतना ही बेहतर होता है»<sup>[\[2\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HI)#cite_note-bleu_dvi-2)</sup>।

यह विधि 2002 में **किशोर पापिनेनी** के नेतृत्व में IBM के शोधकर्ताओं के एक समूह द्वारा प्रस्तावित की गई थी और यह उन पहली metrics में से एक बन गई जिन्होंने अनुवाद विशेषज्ञों के मूल्यांकन के साथ उच्च सहसंबंध प्रदर्शित किया। BLEU ने गणना की सरलता, भाषाई स्वतंत्रता और पाठ corpus के स्तर पर मानव मूल्यांकन के साथ अच्छे मेल के कारण तेज़ी से लोकप्रियता हासिल की<sup>[\[1\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HI)#cite_note-wiki_bleu-1)</sup>।

## BLEU की गणना पद्धति

BLEU उम्मीदवार अनुवाद और संदर्भ अनुवादों के बीच n-gram (*n* शब्दों के अनुक्रम) मिलानों की गणना करके अनुवाद का मूल्यांकन करता है।

### 1. संशोधित n-gram परिशुद्धता

सबसे पहले विभिन्न लंबाई के n-gram (सामान्यतः 1 से 4 तक) के लिए उनकी परिशुद्धता ($p_{n}$) की गणना की जाती है — उम्मीदवार अनुवाद के उन n-gram का अनुपात जो संदर्भ अनुवादों में पाए जाते हैं<sup>[\[3\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HI)#cite_note-mt_companion-3)</sup>। इस दौरान प्रत्येक n-gram के मिलान की संख्या किसी भी संदर्भ पाठ में उसकी अधिकतम उपस्थिति तक सीमित होती है, ताकि एक ही शब्द की पुनरावृत्ति से अंक बढ़ने से बचा जा सके।

### 2. एकत्रीकरण और ज्यामितीय माध्य

एकल मूल्यांकन प्राप्त करने के लिए, 1-, 2-, 3- और 4-gram की परिशुद्धताओं को ज्यामितीय माध्य की सहायता से एकत्रित किया जाता है। यह इसलिए किया जाता है ताकि किसी एक प्रकार के n-gram (जैसे 4-gram) की कम परिशुद्धता अंतिम स्कोर को प्रभावित करे, जो लंबे वाक्यांशों की खराब गुणवत्ता को दर्शाता है। $\sqrt[4]{p_{1} \cdot p_{2} \cdot p_{3} \cdot p_{4}}$

### 3. संक्षिप्तता दंड (Brevity Penalty)

अत्यधिक छोटे, किंतु सटीक अनुवादों के कारण अधिक अंक प्राप्त करने से रोकने के लिए, BLEU **संक्षिप्तता दंड** (*Brevity Penalty*, BP) लागू करता है। यदि उम्मीदवार अनुवाद की लंबाई (c) संदर्भ अनुवाद की लंबाई (r) से काफी कम है, तो BLEU का अंतिम स्कोर कम हो जाता है। दंड की गणना निम्न सूत्र से की जाती है: $\text{BP} = \left\{ \begin{matrix}
1 & {\text{if~}c > r} \\
e^{1 - r/c} & {\text{if~}c \leq r}
\end{matrix} \right.$

### 4. BLEU का अंतिम सूत्र

अंतिम BLEU स्कोर की गणना संक्षिप्तता दंड और n-gram परिशुद्धताओं के ज्यामितीय माध्य के गुणनफल के रूप में की जाती है<sup>[\[4\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HI)#cite_note-callison_burch-4)</sup>: $\text{BLEU} = \text{BP} \cdot \exp\left( \sum\limits_{n = 1}^{N}w_{n}\log p_{n} \right)$ जहाँ N — n-gram की अधिकतम लंबाई (सामान्यतः 4) है, और $w_{n}$ — भार हैं (सामान्यतः $1/N$)।

BLEU का मान 0 से 1 के बीच होता है (अक्सर 100 से गुणा करके प्रतिशत में व्यक्त किया जाता है)। परिणाम जितना 1 (100%) के करीब होता है, अनुवाद उतना ही «मानव अनुवाद के समतुल्य» माना जाता है।

## अनुप्रयोग और महत्व

प्रकाशन के समय से ही BLEU metric मशीनी अनुवाद (MT) प्रणालियों के मूल्यांकन के लिए वास्तविक मानक बन गई। इसने MT प्रणालियों के विकास में «अड़चन» को दूर करने में सहायता की — हस्तचालित मूल्यांकन की लंबी और महंगी प्रक्रिया को। डेवलपर्स को मॉडलों में बदलावों के प्रभाव को तेज़ी से मापने और असफल समाधानों को शीघ्रता से हटाने का अवसर मिला<sup>[\[2\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HI)#cite_note-bleu_dvi-2)</sup>।

BLEU संपूर्ण corpus **के स्तर पर** मानव मूल्यांकनों के साथ अच्छा सहसंबंध प्रदर्शित करता है, किंतु व्यक्तिगत वाक्यों के मूल्यांकन के लिए यह अविश्वसनीय है<sup>[\[3\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HI)#cite_note-mt_companion-3)</sup>। इसलिए यह metric MT प्रतियोगिताओं (जैसे NIST और WMT) में प्रणालियों की तुलना के लिए व्यापक रूप से उपयोग की जाती रही।

## सीमाएँ और आलोचना

व्यापक प्रसार के बावजूद, BLEU की कुछ महत्वपूर्ण सीमाएँ हैं:

- **अर्थगत मूल्यांकन का अभाव**: BLEU केवल शब्दों का सतही मिलान मापता है और यह मूल्यांकन नहीं कर सकता कि मूल पाठ का **अर्थ** सही ढंग से व्यक्त हुआ है या नहीं। एक अनुवाद उच्च अंक प्राप्त कर सकता है, लेकिन व्याकरणिक रूप से गलत हो सकता है या अर्थ को विकृत कर सकता है<sup>[\[5\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HI)#cite_note-deep_hub-5)</sup>।
- **पर्यायवाची शब्दों और paraphrase की अनदेखी**: एल्गोरिदम उन अनुवादों को दंडित करता है जो संदर्भ से भिन्न पर्यायवाची शब्द या अन्य शब्दावली का उपयोग करते हैं, भले ही वे पूर्णतः सही हों। कई संदर्भों का उपयोग इस समस्या को कम करता है, लेकिन पूरी तरह हल नहीं करता।
- **tokenization के प्रति संवेदनशीलता**: BLEU के परिणाम पाठ को tokens में विभाजित करने की विधि पर बहुत निर्भर करते हैं। tokenizer के विभिन्न कार्यान्वयन भिन्न मान उत्पन्न कर सकते हैं, जिससे मॉडलों की तुलना गलत हो जाती है। इस समस्या के समाधान के लिए **SacreBLEU** मानक प्रस्तावित किया गया, जो metric की गणना को एकीकृत करता है<sup>[\[1\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HI)#cite_note-wiki_bleu-1)</sup>।
- **कुछ भाषाओं में अनुप्रयोग की कठिनाई**: BLEU उन भाषाओं के साथ ठीक से काम नहीं करता जिनमें शब्दों के बीच स्पष्ट विभाजक नहीं होते (जैसे चीनी या जापानी), बिना पूर्व segmentation के।

## विकल्प और आधुनिक दृष्टिकोण

समय के साथ BLEU की कमियों को दूर करने के लिए नई स्वचालित metrics प्रस्तावित की गईं:

- **METEOR**: पर्यायवाची मिलान, stemming और शब्द क्रम को ध्यान में रखती है।
- **ROUGE**: पाठ सारांशण के मूल्यांकन के लिए उपयोग की जाती है, परिशुद्धता के बजाय पूर्णता (recall) पर ध्यान केंद्रित करती है।
- **Learned Metrics (सीखी हुई metrics)**: आधुनिक दृष्टिकोण जो अर्थगत निकटता को ध्यान में रखने के लिए Machine Learning मॉडलों का उपयोग करते हैं। **BLEURT** और **COMET** जैसी metrics, शास्त्रीय BLEU की तुलना में मानव मूल्यांकन के साथ काफी अधिक सहसंबंध प्रदर्शित करती हैं<sup>[\[6\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HI)#cite_note-bleurt-6)</sup>।

2020 के दशक तक BLEU ने निर्विवाद मानक का दर्जा खो दिया और अधिक सटीक विधियों ने इसकी जगह ले ली<sup>[\[7\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HI)#cite_note-ai_mil_lexicon-7)</sup>। फिर भी, यह MT मूल्यांकन के इतिहास में एक महत्वपूर्ण मील का पत्थर बना हुआ है और प्रगति मापते समय आधारभूत संदर्भ बिंदु के रूप में उपयोग में आता रहता है।

## संदर्भ

- BLEU मूल्यांकन क्या है? — Microsoft Azure प्रलेखन

## टिप्पणियाँ

1.  <span id="cite_note-wiki_bleu-1">↑ <sup>[1.0](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HI)#cite_ref-wiki_bleu_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HI)#cite_ref-wiki_bleu_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HI)#cite_ref-wiki_bleu_1-2)</sup> «BLEU». *Wikipedia*. <a href="https://en.wikipedia.org/wiki/BLEU" class="external autonumber" rel="nofollow">[१]</a></span>
2.  <span id="cite_note-bleu_dvi-2">↑ <sup>[2.0](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HI)#cite_ref-bleu_dvi_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HI)#cite_ref-bleu_dvi_2-1)</sup> Papineni, Kishore, et al. «Bleu: a Method for Automatic Evaluation of Machine Translation». *Proceedings of the 40th Annual Meeting of the Association for Computational Linguistics*, 2002. <a href="https://aclanthology.org/P02-1040.pdf" class="external autonumber" rel="nofollow">[२]</a></span>
3.  <span id="cite_note-mt_companion-3">↑ <sup>[3.0](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HI)#cite_ref-mt_companion_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HI)#cite_ref-mt_companion_3-1)</sup> «BLEU». *MT Companion 4.0 documentation*. <a href="https://companion.languageweaver.com/help/EvaluationAutomated/metrics-bleu.html" class="external autonumber" rel="nofollow">[३]</a></span>
4.  <span id="cite_note-callison_burch-4">[↑](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HI)#cite_ref-callison_burch_4-0) Callison-Burch, Chris, et al. «BLEU: a Method for Automatic Evaluation of Machine Translation». *Proceedings of the EACL 2006 Workshop on Statistical Machine Translation*, 2006. <a href="https://aclanthology.org/E06-1032.pdf" class="external autonumber" rel="nofollow">[४]</a></span>
5.  <span id="cite_note-deep_hub-5">[↑](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HI)#cite_ref-deep_hub_5-0) Cardete, Jorge. «Beyond BLEU Score. When it comes to the nuanced world of...». *The Deep Hub \| Medium*. <a href="https://medium.com/thedeephub/beyond-bleu-score-unraveling-the-myths-of-machine-translations-favorite-metric-afac33f56de8" class="external autonumber" rel="nofollow">[५]</a></span>
6.  <span id="cite_note-bleurt-6">[↑](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HI)#cite_ref-bleurt_6-0) «BLEURT: метрика для оценки моделей для генерации текста». *Neurohive*. <a href="https://neurohive.io/ru/novosti/bleurt-metrika-dlya-ocenki-modelej-dlya-generacii-teksta/" class="external autonumber" rel="nofollow">[६]</a></span>
7.  <span id="cite_note-ai_mil_lexicon-7">[↑](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(HI)#cite_ref-ai_mil_lexicon_7-0) «Chief Digital and Artificial Intelligence Office \> Lexicon». *ai.mil*. <a href="https://www.ai.mil/Lexicon/" class="external autonumber" rel="nofollow">[७]</a></span>
