---
title: "BLEU (Bilingual Evaluation Understudy) (BN)"
source: "https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(BN)"
wiki: "systems-analysis.info/int"
article: "BLEU_(Bilingual_Evaluation_Understudy)_(BN)"
language: "bn"
categories:
  - "Category:Bengali"
  - "Category:Large language models"
  - "Category:LLM evaluation"
  - "Category:Machine learning"
revision_id: 622
wiki_created_at: 2026-09-06T22:36:32Z
wiki_modified_at: 2026-09-06T22:36:32Z
downloaded_at: 2026-09-07T22:41:19Z
---

# BLEU (Bilingual Evaluation Understudy) (BN)

**BLEU** (ইংরেজি *Bilingual Evaluation Understudy* — «দ্বিভাষিক প্রতিস্থাপনকারী মূল্যায়নকারী») — এটি মেশিন অনূদিত পাঠ্যের গুণমান স্বয়ংক্রিয়ভাবে মূল্যায়নের একটি অ্যালগরিদম। মূল্যায়ন করা হয় প্রার্থী অনুবাদটিকে এক বা একাধিক আদর্শ (রেফারেন্স) মানব অনুবাদের সঙ্গে তুলনা করে<sup>[\[1\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(BN)#cite_note-wiki_bleu-1)</sup>। গুণমান নির্ধারিত হয় পেশাদার অনুবাদের সঙ্গে মেশিন অনুবাদের শাব্দিক সাদৃশ্যের মাত্রা দ্বারা। লেখকরা যেমন উল্লেখ করেছিলেন, «মেশিন অনুবাদ যত বেশি একজন পেশাদার মানুষের অনুবাদের কাছাকাছি হয়, সেটি তত ভালো»<sup>[\[2\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(BN)#cite_note-bleu_dvi-2)</sup>।

পদ্ধতিটি ২০০২ সালে **কিশোর পাপিনেনি**-র নেতৃত্বে IBM-এর একদল গবেষক প্রস্তাব করেছিলেন এবং এটি প্রথম দিকের এমন একটি metric হয়ে ওঠে যা বিশেষজ্ঞ অনুবাদকদের মূল্যায়নের সঙ্গে উচ্চ সহসম্পর্ক দেখিয়েছিল। BLEU দ্রুত জনপ্রিয়তা অর্জন করে গণনার সরলতা, ভাষা-নিরপেক্ষতা এবং পাঠ্য corpus স্তরে মানব মূল্যায়নের সঙ্গে ভালো মিলের কারণে<sup>[\[1\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(BN)#cite_note-wiki_bleu-1)</sup>।

## BLEU গণনার পদ্ধতি

BLEU অনুবাদ মূল্যায়ন করে প্রার্থী অনুবাদ ও আদর্শ অনুবাদের মধ্যে n-gram (*n*টি শব্দের ক্রম)-এর মিল গণনা করে।

### ১. পরিবর্তিত n-gram নির্ভুলতা

প্রথমে বিভিন্ন দৈর্ঘ্যের n-gram-এর (সাধারণত ১ থেকে ৪ পর্যন্ত) নির্ভুলতা ($p_{n}$) গণনা করা হয় — প্রার্থী অনুবাদের n-gram-এর মধ্যে কোনগুলো আদর্শ অনুবাদে পাওয়া যায় তার অনুপাত<sup>[\[3\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(BN)#cite_note-mt_companion-3)</sup>। এ ক্ষেত্রে প্রতিটি n-gram-এর মিলের সংখ্যা যেকোনো আদর্শ পাঠ্যে সেটির সর্বোচ্চ উপস্থিতির সংখ্যার মধ্যে সীমাবদ্ধ রাখা হয়, যাতে একই শব্দের পুনরাবৃত্তির কারণে মূল্যায়ন স্ফীত না হয়।

### ২. একত্রীকরণ ও জ্যামিতিক গড়

একটি একক মূল্যায়ন পেতে, ১-, ২-, ৩- ও ৪-gram-এর নির্ভুলতাগুলো জ্যামিতিক গড়ের মাধ্যমে একত্রিত করা হয়। এটি করা হয় যাতে এক ধরনের n-gram-এর (যেমন ৪-gram) কম নির্ভুলতা চূড়ান্ত স্কোরকে উল্লেখযোগ্যভাবে প্রভাবিত করে, দীর্ঘ বাক্যাংশের দুর্বল গুণমান প্রতিফলিত করে। $\sqrt[4]{p_{1} \cdot p_{2} \cdot p_{3} \cdot p_{4}}$

### ৩. সংক্ষিপ্ততার জরিমানা (Brevity Penalty)

অতিরিক্ত সংক্ষিপ্ত কিন্তু নির্ভুল অনুবাদের কারণে স্ফীত মূল্যায়ন প্রতিরোধ করতে, BLEU **সংক্ষিপ্ততার জরিমানা** (*Brevity Penalty*, BP) প্রবর্তন করে। যদি প্রার্থী অনুবাদের দৈর্ঘ্য (c) আদর্শ অনুবাদের দৈর্ঘ্য (r)-এর তুলনায় উল্লেখযোগ্যভাবে কম হয়, তবে চূড়ান্ত BLEU স্কোর হ্রাস পায়। জরিমানা নিম্নলিখিত সূত্র অনুযায়ী গণনা করা হয়: $\text{BP} = \left\{ \begin{matrix}
1 & {\text{if~}c > r} \\
e^{1 - r/c} & {\text{if~}c \leq r}
\end{matrix} \right.$

### ৪. BLEU-এর চূড়ান্ত সূত্র

চূড়ান্ত BLEU স্কোর গণনা করা হয় সংক্ষিপ্ততার জরিমানা ও n-gram নির্ভুলতার জ্যামিতিক গড়ের গুণফল হিসেবে<sup>[\[4\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(BN)#cite_note-callison_burch-4)</sup>: $\text{BLEU} = \text{BP} \cdot \exp\left( \sum\limits_{n = 1}^{N}w_{n}\log p_{n} \right)$ যেখানে N হলো n-gram-এর সর্বোচ্চ দৈর্ঘ্য (সাধারণত ৪), এবং $w_{n}$ হলো ওজন (সাধারণত $1/N$)।

BLEU-এর মান ০ থেকে ১ পরিসরে থাকে (প্রায়ই ১০০ দিয়ে গুণ করে শতকরা হিসেবে প্রকাশ করা হয়)। ফলাফল ১ (১০০%)-এর যত কাছাকাছি, অনুবাদটি মানব অনুবাদের তত বেশি «কাছাকাছি» বলে বিবেচিত হয়।

## প্রয়োগ ও গুরুত্ব

প্রকাশের পর থেকে BLEU metric মেশিন অনুবাদ (MT) সিস্টেম মূল্যায়নের ক্ষেত্রে কার্যত একটি মান হয়ে ওঠে। এটি MT সিস্টেমের উন্নয়নের «সংকীর্ণ পথ» — ম্যানুয়াল মূল্যায়নের দীর্ঘসূত্রিতা ও ব্যয়বহুলতা — অতিক্রম করতে সহায়তা করে। ডেভেলপাররা দ্রুত মডেলের পরিবর্তনের প্রভাব পরিমাপ করতে এবং দ্রুত ব্যর্থ সমাধান বাদ দিতে সক্ষম হন<sup>[\[2\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(BN)#cite_note-bleu_dvi-2)</sup>।

BLEU সমগ্র **corpus স্তরে** মানব মূল্যায়নের সঙ্গে ভালো সহসম্পর্ক দেখায়, কিন্তু পৃথক বাক্য মূল্যায়নের ক্ষেত্রে এটি অবিশ্বস্ত<sup>[\[3\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(BN)#cite_note-mt_companion-3)</sup>। তাই এই metric ব্যাপকভাবে MT-এর মানসম্পন্ন প্রতিযোগিতায় (যেমন NIST ও WMT) সিস্টেম তুলনার জন্য ব্যবহৃত হয়েছে।

## সীমাবদ্ধতা ও সমালোচনা

ব্যাপক প্রচলন সত্ত্বেও BLEU-এর বেশ কিছু উল্লেখযোগ্য সীমাবদ্ধতা রয়েছে:

- **অর্থগত মূল্যায়নের অনুপস্থিতি**: BLEU কেবল শব্দের উপরিতলীয় মিল পরিমাপ করে এবং মূল পাঠ্যের **অর্থ** সঠিকভাবে প্রকাশ হয়েছে কিনা তা মূল্যায়ন করতে পারে না। একটি অনুবাদ উচ্চ স্কোর পেতে পারে কিন্তু ব্যাকরণগতভাবে ভুল বা অর্থ বিকৃত করতে পারে<sup>[\[5\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(BN)#cite_note-deep_hub-5)</sup>।
- **প্রতিশব্দ ও paraphrase উপেক্ষা**: অ্যালগরিদম এমন অনুবাদকে শাস্তি দেয় যেগুলো আদর্শের চেয়ে প্রতিশব্দ বা ভিন্ন প্রকাশভঙ্গি ব্যবহার করে, এমনকি যদি সেগুলো সম্পূর্ণ সঠিক হয়। একাধিক আদর্শ ব্যবহার এই সমস্যা কমায়, তবে সম্পূর্ণ সমাধান করে না।
- **Tokenization-এর প্রতি সংবেদনশীলতা**: BLEU-এর ফলাফল পাঠ্যকে token-এ বিভক্ত করার পদ্ধতির উপর ব্যাপকভাবে নির্ভর করে। বিভিন্ন tokenizer বাস্তবায়ন ভিন্ন মান তৈরি করতে পারে, মডেল তুলনাকে ত্রুটিপূর্ণ করে তোলে। এই সমস্যা সমাধানের জন্য **SacreBLEU** মান প্রস্তাব করা হয়েছে, যা metric গণনাকে একীভূত করে<sup>[\[1\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(BN)#cite_note-wiki_bleu-1)</sup>।
- **কিছু ভাষায় প্রয়োগের জটিলতা**: BLEU এমন ভাষায় ভালো কাজ করে না যেগুলোতে স্পষ্ট শব্দ বিভাজক নেই (যেমন চীনা বা জাপানি), পূর্ববর্তী বিভাজন ছাড়া।

## বিকল্প ও আধুনিক পদ্ধতি

সময়ের সাথে সাথে BLEU-এর দুর্বলতা কাটিয়ে উঠতে নতুন স্বয়ংক্রিয় metric প্রস্তাব করা হয়েছে:

- **METEOR**: প্রতিশব্দের মিল, stemming ও শব্দের ক্রম বিবেচনা করে।
- **ROUGE**: পাঠ্য সংক্ষেপণ মূল্যায়নের জন্য ব্যবহৃত হয়, নির্ভুলতার পরিবর্তে পূর্ণতা (recall)-এর উপর মনোযোগ দিয়ে।
- **শেখানো metric (Learned Metrics)**: আধুনিক পদ্ধতি যেগুলো অর্থগত সাদৃশ্য বিবেচনার জন্য Machine Learning মডেল ব্যবহার করে। **BLEURT** ও **COMET**-এর মতো metric গুলো ক্লাসিক BLEU-এর তুলনায় মানুষের মূল্যায়নের সঙ্গে উল্লেখযোগ্যভাবে বেশি সহসম্পর্ক দেখায়<sup>[\[6\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(BN)#cite_note-bleurt-6)</sup>।

২০২০-এর দশকের মধ্যে BLEU নিঃশর্ত মানের মর্যাদা হারিয়ে আরও নির্ভুল পদ্ধতির কাছে স্থান ছেড়ে দিয়েছে<sup>[\[7\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(BN)#cite_note-ai_mil_lexicon-7)</sup>। তবুও এটি MT মূল্যায়নের ইতিহাসে একটি গুরুত্বপূর্ণ মাইলফলক হিসেবে রয়ে গেছে এবং অগ্রগতি পরিমাপে মূল রেফারেন্স বিন্দু হিসেবে ব্যবহৃত হতে থাকে।

## তথ্যসূত্র

- BLEU মূল্যায়ন কী? — Microsoft Azure ডকুমেন্টেশন

## টীকা

1.  <span id="cite_note-wiki_bleu-1">↑ <sup>[1.0](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(BN)#cite_ref-wiki_bleu_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(BN)#cite_ref-wiki_bleu_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(BN)#cite_ref-wiki_bleu_1-2)</sup> «BLEU». *Wikipedia*. <a href="https://en.wikipedia.org/wiki/BLEU" class="external autonumber" rel="nofollow">[১]</a></span>
2.  <span id="cite_note-bleu_dvi-2">↑ <sup>[2.0](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(BN)#cite_ref-bleu_dvi_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(BN)#cite_ref-bleu_dvi_2-1)</sup> Papineni, Kishore, et al. «Bleu: a Method for Automatic Evaluation of Machine Translation». *Proceedings of the 40th Annual Meeting of the Association for Computational Linguistics*, 2002. <a href="https://aclanthology.org/P02-1040.pdf" class="external autonumber" rel="nofollow">[২]</a></span>
3.  <span id="cite_note-mt_companion-3">↑ <sup>[3.0](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(BN)#cite_ref-mt_companion_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(BN)#cite_ref-mt_companion_3-1)</sup> «BLEU». *MT Companion 4.0 documentation*. <a href="https://companion.languageweaver.com/help/EvaluationAutomated/metrics-bleu.html" class="external autonumber" rel="nofollow">[৩]</a></span>
4.  <span id="cite_note-callison_burch-4">[↑](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(BN)#cite_ref-callison_burch_4-0) Callison-Burch, Chris, et al. «BLEU: a Method for Automatic Evaluation of Machine Translation». *Proceedings of the EACL 2006 Workshop on Statistical Machine Translation*, 2006. <a href="https://aclanthology.org/E06-1032.pdf" class="external autonumber" rel="nofollow">[৪]</a></span>
5.  <span id="cite_note-deep_hub-5">[↑](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(BN)#cite_ref-deep_hub_5-0) Cardete, Jorge. «Beyond BLEU Score. When it comes to the nuanced world of...». *The Deep Hub \| Medium*. <a href="https://medium.com/thedeephub/beyond-bleu-score-unraveling-the-myths-of-machine-translations-favorite-metric-afac33f56de8" class="external autonumber" rel="nofollow">[৫]</a></span>
6.  <span id="cite_note-bleurt-6">[↑](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(BN)#cite_ref-bleurt_6-0) «BLEURT: метрика для оценки моделей для генерации текста». *Neurohive*. <a href="https://neurohive.io/ru/novosti/bleurt-metrika-dlya-ocenki-modelej-dlya-generacii-teksta/" class="external autonumber" rel="nofollow">[৬]</a></span>
7.  <span id="cite_note-ai_mil_lexicon-7">[↑](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(BN)#cite_ref-ai_mil_lexicon_7-0) «Chief Digital and Artificial Intelligence Office \> Lexicon». *ai.mil*. <a href="https://www.ai.mil/Lexicon/" class="external autonumber" rel="nofollow">[৭]</a></span>
