BLEU (Bilingual Evaluation Understudy) (TH)
BLEU (จากภาษาอังกฤษ Bilingual Evaluation Understudy — «ผู้ประเมินทดแทนสองภาษา») — คืออัลกอริทึมสำหรับการประเมินคุณภาพข้อความที่แปลโดยเครื่องโดยอัตโนมัติ การประเมินดำเนินการโดยการเปรียบเทียบการแปลที่เป็นตัวเลือกกับการแปลของมนุษย์ที่เป็นมาตรฐานอ้างอิง (reference) หนึ่งรายการหรือมากกว่า[1] คุณภาพถูกกำหนดโดยระดับความใกล้ชิดทางคำศัพท์ของการแปลด้วยเครื่องกับการแปลโดยผู้เชี่ยวชาญ ดังที่ผู้เขียนระบุไว้ว่า «ยิ่งการแปลด้วยเครื่องใกล้เคียงกับการแปลของมนุษย์ผู้เชี่ยวชาญมากเท่าใด ก็ยิ่งดีมากเท่านั้น»[2]
วิธีการนี้ถูกเสนอขึ้นในปี ค.ศ. 2002 โดยกลุ่มนักวิจัยจาก IBM ภายใต้การนำของ Kishore Papineni และได้กลายเป็นหนึ่งในตัวชี้วัดแรกๆ ที่แสดงให้เห็นความสัมพันธ์สูงกับการประเมินของผู้เชี่ยวชาญด้านการแปล BLEU ได้รับความนิยมอย่างรวดเร็วเนื่องจากความเรียบง่ายในการคำนวณ ความเป็นอิสระจากภาษา และความสอดคล้องที่ดีกับการประเมินของมนุษย์ในระดับคลังข้อความ[1]
วิธีการคำนวณ BLEU
BLEU ประเมินการแปลโดยการนับการจับคู่ n-gram (ลำดับของคำ n คำ) ระหว่างการแปลที่เป็นตัวเลือกกับการแปลมาตรฐานอ้างอิง
1. ความแม่นยำ n-gram ที่ปรับปรุงแล้ว
ขั้นแรก สำหรับ n-gram ที่มีความยาวต่างกัน (โดยปกติตั้งแต่ 1 ถึง 4) จะคำนวณความแม่นยำ () ซึ่งคือสัดส่วนของ n-gram จากการแปลที่เป็นตัวเลือกที่ปรากฏในการแปลมาตรฐานอ้างอิง[3] โดยจำนวนการจับคู่ของแต่ละ n-gram ถูกจำกัดด้วยจำนวนการปรากฏสูงสุดในข้อความอ้างอิงใดข้อความหนึ่ง เพื่อหลีกเลี่ยงการให้คะแนนสูงเกินจริงจากการซ้ำคำเดิม
2. การรวมค่าและค่าเฉลี่ยเรขาคณิต
เพื่อให้ได้คะแนนเดียว ความแม่นยำของ 1-gram, 2-gram, 3-gram และ 4-gram จะถูกรวมค่าโดยใช้ค่าเฉลี่ยเรขาคณิต สิ่งนี้ทำขึ้นเพื่อให้ความแม่นยำที่ต่ำสำหรับ n-gram ประเภทหนึ่ง (เช่น 4-gram) มีผลกระทบอย่างมากต่อคะแนนสุดท้าย สะท้อนถึงคุณภาพที่ต่ำของวลียาว
3. บทลงโทษสำหรับความสั้น (Brevity Penalty)
เพื่อป้องกันการได้รับคะแนนสูงเกินจริงจากการแปลที่สั้นเกินไปแต่แม่นยำ BLEU นำ บทลงโทษสำหรับความสั้น (Brevity Penalty, BP) มาใช้ หากความยาวของการแปลที่เป็นตัวเลือก (c) น้อยกว่าความยาวของการแปลมาตรฐานอ้างอิง (r) อย่างมีนัยสำคัญ คะแนน BLEU สุดท้ายจะลดลง บทลงโทษคำนวณตามสูตร:
4. สูตร BLEU สุดท้าย
คะแนน BLEU ขั้นสุดท้ายคำนวณเป็นผลคูณของบทลงโทษสำหรับความสั้นกับค่าเฉลี่ยเรขาคณิตของความแม่นยำ n-gram[4]: โดยที่ N คือความยาวสูงสุดของ n-gram (โดยปกติคือ 4) และ คือน้ำหนัก (โดยปกติคือ )
ค่า BLEU อยู่ในช่วงตั้งแต่ 0 ถึง 1 (มักคูณด้วย 100 และแสดงเป็นเปอร์เซ็นต์) ยิ่งผลลัพธ์ใกล้ 1 (100%) มากเท่าใด การแปลก็ถือว่า «ใกล้เคียงกับมนุษย์» มากขึ้นเท่านั้น
การประยุกต์ใช้และความสำคัญ
นับตั้งแต่การเผยแพร่ ตัวชี้วัด BLEU ได้กลายเป็นมาตรฐานโดยพฤตินัยสำหรับการประเมินระบบการแปลด้วยเครื่อง (MT) มันช่วยขจัด «คอขวด» ในการพัฒนาระบบ MT ซึ่งได้แก่ ความยาวนานและค่าใช้จ่ายสูงของการประเมินด้วยมือ นักพัฒนาได้รับความสามารถในการวัดผลกระทบจากการเปลี่ยนแปลงในโมเดลอย่างรวดเร็ว และคัดกรองทางเลือกที่ไม่ดีออกอย่างทันท่วงที[2]
BLEU มีความสัมพันธ์ที่ดีกับการประเมินของมนุษย์ในระดับคลังข้อความทั้งหมด แต่ไม่น่าเชื่อถือสำหรับการประเมินประโยคแต่ละประโยค[3] ด้วยเหตุนี้ ตัวชี้วัดนี้จึงถูกนำมาใช้อย่างแพร่หลายในการแข่งขัน MT มาตรฐาน (เช่น NIST และ WMT) เพื่อเปรียบเทียบระบบต่างๆ
ข้อจำกัดและข้อวิจารณ์
แม้จะแพร่หลาย แต่ BLEU มีข้อจำกัดที่สำคัญหลายประการ:
- ขาดการประเมินเชิงความหมาย: BLEU วัดเพียงการจับคู่คำในระดับผิวเผินและไม่สามารถประเมินได้ว่า ความหมาย ของข้อความต้นฉบับถูกถ่ายทอดอย่างถูกต้องหรือไม่ การแปลอาจได้คะแนนสูงแต่ผิดหลักไวยากรณ์หรือบิดเบือนความหมาย[5]
- การไม่สนใจคำพ้องความหมายและการถอดความ: อัลกอริทึมลงโทษการแปลที่ใช้คำพ้องความหมายหรือการกำหนดสูตรที่แตกต่างจากข้อความอ้างอิง แม้ว่าจะถูกต้องอย่างสมบูรณ์ก็ตาม การใช้ข้อความอ้างอิงหลายรายการช่วยบรรเทาแต่ไม่ได้แก้ไขปัญหานี้อย่างสมบูรณ์
- ความไวต่อการทำ token: ผลลัพธ์ของ BLEU ขึ้นอยู่อย่างมากกับวิธีการแบ่งข้อความออกเป็น token การใช้งาน tokenizer ที่แตกต่างกันอาจนำไปสู่ค่าที่แตกต่างกัน ทำให้การเปรียบเทียบโมเดลไม่ถูกต้อง เพื่อแก้ไขปัญหานี้ จึงมีการเสนอมาตรฐาน SacreBLEU ที่รวมการคำนวณตัวชี้วัดให้เป็นหนึ่งเดียว[1]
- ความยากในการประยุกต์ใช้กับบางภาษา: BLEU ทำงานได้ไม่ดีกับภาษาที่ไม่มีตัวคั่นคำที่ชัดเจน (เช่น ภาษาจีนหรือญี่ปุ่น) หากไม่มีการแบ่งส่วนล่วงหน้า
ทางเลือกและแนวทางสมัยใหม่
เมื่อเวลาผ่านไป มีการเสนอตัวชี้วัดอัตโนมัติใหม่เพื่อเอาชนะข้อเสียของ BLEU:
- METEOR: คำนึงถึงการจับคู่คำพ้องความหมาย การทำ stemming และลำดับของคำ
- ROUGE: ใช้สำหรับการประเมินการสรุปข้อความ โดยเน้นที่ความครบถ้วน (recall) มากกว่าความแม่นยำ
- ตัวชี้วัดที่เรียนรู้ได้ (Learned Metrics): แนวทางสมัยใหม่ที่ใช้โมเดล Machine Learning เพื่อคำนึงถึงความใกล้ชิดเชิงความหมาย ตัวชี้วัดเช่น BLEURT และ COMET แสดงความสัมพันธ์กับการประเมินของมนุษย์ที่สูงกว่า BLEU แบบดั้งเดิมอย่างมีนัยสำคัญ[6]
เมื่อถึงช่วงทศวรรษ 2020 BLEU ได้สูญเสียสถานะของมาตรฐานที่ไม่มีเงื่อนไข โดยถูกแทนที่ด้วยวิธีการที่แม่นยำยิ่งขึ้น[7] อย่างไรก็ตาม มันยังคงเป็นจุดสำคัญในประวัติศาสตร์ของการประเมิน MT และยังคงถูกใช้เป็นจุดอ้างอิงพื้นฐานในการวัดความก้าวหน้า
ลิงก์
- การประเมิน BLEU คืออะไร? — เอกสาร Microsoft Azure
หมายเหตุ
- ↑ 1.0 1.1 1.2 «BLEU». Wikipedia. [1]
- ↑ 2.0 2.1 Papineni, Kishore, et al. «Bleu: a Method for Automatic Evaluation of Machine Translation». Proceedings of the 40th Annual Meeting of the Association for Computational Linguistics, 2002. [2]
- ↑ 3.0 3.1 «BLEU». MT Companion 4.0 documentation. [3]
- ↑ Callison-Burch, Chris, et al. «BLEU: a Method for Automatic Evaluation of Machine Translation». Proceedings of the EACL 2006 Workshop on Statistical Machine Translation, 2006. [4]
- ↑ Cardete, Jorge. «Beyond BLEU Score. When it comes to the nuanced world of...». The Deep Hub | Medium. [5]
- ↑ «BLEURT: метрика для оценки моделей для генерации текста». Neurohive. [6]
- ↑ «Chief Digital and Artificial Intelligence Office > Lexicon». ai.mil. [7]