---
title: "BLEU (Bilingual Evaluation Understudy) (TH)"
source: "https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(TH)"
wiki: "systems-analysis.info/int"
article: "BLEU_(Bilingual_Evaluation_Understudy)_(TH)"
language: "th"
categories:
  - "Category:Large language models"
  - "Category:LLM evaluation"
  - "Category:Machine learning"
  - "Category:Thai"
revision_id: 640
wiki_created_at: 2026-09-06T22:36:47Z
wiki_modified_at: 2026-09-06T22:36:47Z
downloaded_at: 2026-09-07T22:41:25Z
---

# BLEU (Bilingual Evaluation Understudy) (TH)

**BLEU** (จากภาษาอังกฤษ *Bilingual Evaluation Understudy* — «ผู้ประเมินทดแทนสองภาษา») — คืออัลกอริทึมสำหรับการประเมินคุณภาพข้อความที่แปลโดยเครื่องโดยอัตโนมัติ การประเมินดำเนินการโดยการเปรียบเทียบการแปลที่เป็นตัวเลือกกับการแปลของมนุษย์ที่เป็นมาตรฐานอ้างอิง (reference) หนึ่งรายการหรือมากกว่า<sup>[\[1\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(TH)#cite_note-wiki_bleu-1)</sup> คุณภาพถูกกำหนดโดยระดับความใกล้ชิดทางคำศัพท์ของการแปลด้วยเครื่องกับการแปลโดยผู้เชี่ยวชาญ ดังที่ผู้เขียนระบุไว้ว่า «ยิ่งการแปลด้วยเครื่องใกล้เคียงกับการแปลของมนุษย์ผู้เชี่ยวชาญมากเท่าใด ก็ยิ่งดีมากเท่านั้น»<sup>[\[2\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(TH)#cite_note-bleu_dvi-2)</sup>

วิธีการนี้ถูกเสนอขึ้นในปี ค.ศ. 2002 โดยกลุ่มนักวิจัยจาก IBM ภายใต้การนำของ **Kishore Papineni** และได้กลายเป็นหนึ่งในตัวชี้วัดแรกๆ ที่แสดงให้เห็นความสัมพันธ์สูงกับการประเมินของผู้เชี่ยวชาญด้านการแปล BLEU ได้รับความนิยมอย่างรวดเร็วเนื่องจากความเรียบง่ายในการคำนวณ ความเป็นอิสระจากภาษา และความสอดคล้องที่ดีกับการประเมินของมนุษย์ในระดับคลังข้อความ<sup>[\[1\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(TH)#cite_note-wiki_bleu-1)</sup>

## วิธีการคำนวณ BLEU

BLEU ประเมินการแปลโดยการนับการจับคู่ n-gram (ลำดับของคำ *n* คำ) ระหว่างการแปลที่เป็นตัวเลือกกับการแปลมาตรฐานอ้างอิง

### 1. ความแม่นยำ n-gram ที่ปรับปรุงแล้ว

ขั้นแรก สำหรับ n-gram ที่มีความยาวต่างกัน (โดยปกติตั้งแต่ 1 ถึง 4) จะคำนวณความแม่นยำ ($p_{n}$) ซึ่งคือสัดส่วนของ n-gram จากการแปลที่เป็นตัวเลือกที่ปรากฏในการแปลมาตรฐานอ้างอิง<sup>[\[3\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(TH)#cite_note-mt_companion-3)</sup> โดยจำนวนการจับคู่ของแต่ละ n-gram ถูกจำกัดด้วยจำนวนการปรากฏสูงสุดในข้อความอ้างอิงใดข้อความหนึ่ง เพื่อหลีกเลี่ยงการให้คะแนนสูงเกินจริงจากการซ้ำคำเดิม

### 2. การรวมค่าและค่าเฉลี่ยเรขาคณิต

เพื่อให้ได้คะแนนเดียว ความแม่นยำของ 1-gram, 2-gram, 3-gram และ 4-gram จะถูกรวมค่าโดยใช้ค่าเฉลี่ยเรขาคณิต สิ่งนี้ทำขึ้นเพื่อให้ความแม่นยำที่ต่ำสำหรับ n-gram ประเภทหนึ่ง (เช่น 4-gram) มีผลกระทบอย่างมากต่อคะแนนสุดท้าย สะท้อนถึงคุณภาพที่ต่ำของวลียาว $\sqrt[4]{p_{1} \cdot p_{2} \cdot p_{3} \cdot p_{4}}$

### 3. บทลงโทษสำหรับความสั้น (Brevity Penalty)

เพื่อป้องกันการได้รับคะแนนสูงเกินจริงจากการแปลที่สั้นเกินไปแต่แม่นยำ BLEU นำ **บทลงโทษสำหรับความสั้น** (*Brevity Penalty*, BP) มาใช้ หากความยาวของการแปลที่เป็นตัวเลือก (c) น้อยกว่าความยาวของการแปลมาตรฐานอ้างอิง (r) อย่างมีนัยสำคัญ คะแนน BLEU สุดท้ายจะลดลง บทลงโทษคำนวณตามสูตร: $\text{BP} = \left\{ \begin{matrix}
1 & {\text{if~}c > r} \\
e^{1 - r/c} & {\text{if~}c \leq r}
\end{matrix} \right.$

### 4. สูตร BLEU สุดท้าย

คะแนน BLEU ขั้นสุดท้ายคำนวณเป็นผลคูณของบทลงโทษสำหรับความสั้นกับค่าเฉลี่ยเรขาคณิตของความแม่นยำ n-gram<sup>[\[4\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(TH)#cite_note-callison_burch-4)</sup>: $\text{BLEU} = \text{BP} \cdot \exp\left( \sum\limits_{n = 1}^{N}w_{n}\log p_{n} \right)$ โดยที่ N คือความยาวสูงสุดของ n-gram (โดยปกติคือ 4) และ $w_{n}$ คือน้ำหนัก (โดยปกติคือ $1/N$)

ค่า BLEU อยู่ในช่วงตั้งแต่ 0 ถึง 1 (มักคูณด้วย 100 และแสดงเป็นเปอร์เซ็นต์) ยิ่งผลลัพธ์ใกล้ 1 (100%) มากเท่าใด การแปลก็ถือว่า «ใกล้เคียงกับมนุษย์» มากขึ้นเท่านั้น

## การประยุกต์ใช้และความสำคัญ

นับตั้งแต่การเผยแพร่ ตัวชี้วัด BLEU ได้กลายเป็นมาตรฐานโดยพฤตินัยสำหรับการประเมินระบบการแปลด้วยเครื่อง (MT) มันช่วยขจัด «คอขวด» ในการพัฒนาระบบ MT ซึ่งได้แก่ ความยาวนานและค่าใช้จ่ายสูงของการประเมินด้วยมือ นักพัฒนาได้รับความสามารถในการวัดผลกระทบจากการเปลี่ยนแปลงในโมเดลอย่างรวดเร็ว และคัดกรองทางเลือกที่ไม่ดีออกอย่างทันท่วงที<sup>[\[2\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(TH)#cite_note-bleu_dvi-2)</sup>

BLEU มีความสัมพันธ์ที่ดีกับการประเมินของมนุษย์ใน**ระดับคลังข้อความทั้งหมด** แต่ไม่น่าเชื่อถือสำหรับการประเมินประโยคแต่ละประโยค<sup>[\[3\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(TH)#cite_note-mt_companion-3)</sup> ด้วยเหตุนี้ ตัวชี้วัดนี้จึงถูกนำมาใช้อย่างแพร่หลายในการแข่งขัน MT มาตรฐาน (เช่น NIST และ WMT) เพื่อเปรียบเทียบระบบต่างๆ

## ข้อจำกัดและข้อวิจารณ์

แม้จะแพร่หลาย แต่ BLEU มีข้อจำกัดที่สำคัญหลายประการ:

- **ขาดการประเมินเชิงความหมาย**: BLEU วัดเพียงการจับคู่คำในระดับผิวเผินและไม่สามารถประเมินได้ว่า **ความหมาย** ของข้อความต้นฉบับถูกถ่ายทอดอย่างถูกต้องหรือไม่ การแปลอาจได้คะแนนสูงแต่ผิดหลักไวยากรณ์หรือบิดเบือนความหมาย<sup>[\[5\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(TH)#cite_note-deep_hub-5)</sup>
- **การไม่สนใจคำพ้องความหมายและการถอดความ**: อัลกอริทึมลงโทษการแปลที่ใช้คำพ้องความหมายหรือการกำหนดสูตรที่แตกต่างจากข้อความอ้างอิง แม้ว่าจะถูกต้องอย่างสมบูรณ์ก็ตาม การใช้ข้อความอ้างอิงหลายรายการช่วยบรรเทาแต่ไม่ได้แก้ไขปัญหานี้อย่างสมบูรณ์
- **ความไวต่อการทำ token**: ผลลัพธ์ของ BLEU ขึ้นอยู่อย่างมากกับวิธีการแบ่งข้อความออกเป็น token การใช้งาน tokenizer ที่แตกต่างกันอาจนำไปสู่ค่าที่แตกต่างกัน ทำให้การเปรียบเทียบโมเดลไม่ถูกต้อง เพื่อแก้ไขปัญหานี้ จึงมีการเสนอมาตรฐาน **SacreBLEU** ที่รวมการคำนวณตัวชี้วัดให้เป็นหนึ่งเดียว<sup>[\[1\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(TH)#cite_note-wiki_bleu-1)</sup>
- **ความยากในการประยุกต์ใช้กับบางภาษา**: BLEU ทำงานได้ไม่ดีกับภาษาที่ไม่มีตัวคั่นคำที่ชัดเจน (เช่น ภาษาจีนหรือญี่ปุ่น) หากไม่มีการแบ่งส่วนล่วงหน้า

## ทางเลือกและแนวทางสมัยใหม่

เมื่อเวลาผ่านไป มีการเสนอตัวชี้วัดอัตโนมัติใหม่เพื่อเอาชนะข้อเสียของ BLEU:

- **METEOR**: คำนึงถึงการจับคู่คำพ้องความหมาย การทำ stemming และลำดับของคำ
- **ROUGE**: ใช้สำหรับการประเมินการสรุปข้อความ โดยเน้นที่ความครบถ้วน (recall) มากกว่าความแม่นยำ
- **ตัวชี้วัดที่เรียนรู้ได้ (Learned Metrics)**: แนวทางสมัยใหม่ที่ใช้โมเดล Machine Learning เพื่อคำนึงถึงความใกล้ชิดเชิงความหมาย ตัวชี้วัดเช่น **BLEURT** และ **COMET** แสดงความสัมพันธ์กับการประเมินของมนุษย์ที่สูงกว่า BLEU แบบดั้งเดิมอย่างมีนัยสำคัญ<sup>[\[6\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(TH)#cite_note-bleurt-6)</sup>

เมื่อถึงช่วงทศวรรษ 2020 BLEU ได้สูญเสียสถานะของมาตรฐานที่ไม่มีเงื่อนไข โดยถูกแทนที่ด้วยวิธีการที่แม่นยำยิ่งขึ้น<sup>[\[7\]](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(TH)#cite_note-ai_mil_lexicon-7)</sup> อย่างไรก็ตาม มันยังคงเป็นจุดสำคัญในประวัติศาสตร์ของการประเมิน MT และยังคงถูกใช้เป็นจุดอ้างอิงพื้นฐานในการวัดความก้าวหน้า

## ลิงก์

- การประเมิน BLEU คืออะไร? — เอกสาร Microsoft Azure

## หมายเหตุ

1.  <span id="cite_note-wiki_bleu-1">↑ <sup>[1.0](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(TH)#cite_ref-wiki_bleu_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(TH)#cite_ref-wiki_bleu_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(TH)#cite_ref-wiki_bleu_1-2)</sup> «BLEU». *Wikipedia*. <a href="https://en.wikipedia.org/wiki/BLEU" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-bleu_dvi-2">↑ <sup>[2.0](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(TH)#cite_ref-bleu_dvi_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(TH)#cite_ref-bleu_dvi_2-1)</sup> Papineni, Kishore, et al. «Bleu: a Method for Automatic Evaluation of Machine Translation». *Proceedings of the 40th Annual Meeting of the Association for Computational Linguistics*, 2002. <a href="https://aclanthology.org/P02-1040.pdf" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-mt_companion-3">↑ <sup>[3.0](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(TH)#cite_ref-mt_companion_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(TH)#cite_ref-mt_companion_3-1)</sup> «BLEU». *MT Companion 4.0 documentation*. <a href="https://companion.languageweaver.com/help/EvaluationAutomated/metrics-bleu.html" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-callison_burch-4">[↑](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(TH)#cite_ref-callison_burch_4-0) Callison-Burch, Chris, et al. «BLEU: a Method for Automatic Evaluation of Machine Translation». *Proceedings of the EACL 2006 Workshop on Statistical Machine Translation*, 2006. <a href="https://aclanthology.org/E06-1032.pdf" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-deep_hub-5">[↑](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(TH)#cite_ref-deep_hub_5-0) Cardete, Jorge. «Beyond BLEU Score. When it comes to the nuanced world of...». *The Deep Hub \| Medium*. <a href="https://medium.com/thedeephub/beyond-bleu-score-unraveling-the-myths-of-machine-translations-favorite-metric-afac33f56de8" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-bleurt-6">[↑](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(TH)#cite_ref-bleurt_6-0) «BLEURT: метрика для оценки моделей для генерации текста». *Neurohive*. <a href="https://neurohive.io/ru/novosti/bleurt-metrika-dlya-ocenki-modelej-dlya-generacii-teksta/" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-ai_mil_lexicon-7">[↑](https://systems-analysis.info/int/BLEU_(Bilingual_Evaluation_Understudy)_(TH)#cite_ref-ai_mil_lexicon_7-0) «Chief Digital and Artificial Intelligence Office \> Lexicon». *ai.mil*. <a href="https://www.ai.mil/Lexicon/" class="external autonumber" rel="nofollow">[7]</a></span>
