BLEU (Bilingual Evaluation Understudy) (TH)

From Systems analysis Wiki
Jump to navigation Jump to search

BLEU (จากภาษาอังกฤษ Bilingual Evaluation Understudy — «ผู้ประเมินทดแทนสองภาษา») — คืออัลกอริทึมสำหรับการประเมินคุณภาพข้อความที่แปลโดยเครื่องโดยอัตโนมัติ การประเมินดำเนินการโดยการเปรียบเทียบการแปลที่เป็นตัวเลือกกับการแปลของมนุษย์ที่เป็นมาตรฐานอ้างอิง (reference) หนึ่งรายการหรือมากกว่า[1] คุณภาพถูกกำหนดโดยระดับความใกล้ชิดทางคำศัพท์ของการแปลด้วยเครื่องกับการแปลโดยผู้เชี่ยวชาญ ดังที่ผู้เขียนระบุไว้ว่า «ยิ่งการแปลด้วยเครื่องใกล้เคียงกับการแปลของมนุษย์ผู้เชี่ยวชาญมากเท่าใด ก็ยิ่งดีมากเท่านั้น»[2]

วิธีการนี้ถูกเสนอขึ้นในปี ค.ศ. 2002 โดยกลุ่มนักวิจัยจาก IBM ภายใต้การนำของ Kishore Papineni และได้กลายเป็นหนึ่งในตัวชี้วัดแรกๆ ที่แสดงให้เห็นความสัมพันธ์สูงกับการประเมินของผู้เชี่ยวชาญด้านการแปล BLEU ได้รับความนิยมอย่างรวดเร็วเนื่องจากความเรียบง่ายในการคำนวณ ความเป็นอิสระจากภาษา และความสอดคล้องที่ดีกับการประเมินของมนุษย์ในระดับคลังข้อความ[1]

วิธีการคำนวณ BLEU

BLEU ประเมินการแปลโดยการนับการจับคู่ n-gram (ลำดับของคำ n คำ) ระหว่างการแปลที่เป็นตัวเลือกกับการแปลมาตรฐานอ้างอิง

1. ความแม่นยำ n-gram ที่ปรับปรุงแล้ว

ขั้นแรก สำหรับ n-gram ที่มีความยาวต่างกัน (โดยปกติตั้งแต่ 1 ถึง 4) จะคำนวณความแม่นยำ (pn) ซึ่งคือสัดส่วนของ n-gram จากการแปลที่เป็นตัวเลือกที่ปรากฏในการแปลมาตรฐานอ้างอิง[3] โดยจำนวนการจับคู่ของแต่ละ n-gram ถูกจำกัดด้วยจำนวนการปรากฏสูงสุดในข้อความอ้างอิงใดข้อความหนึ่ง เพื่อหลีกเลี่ยงการให้คะแนนสูงเกินจริงจากการซ้ำคำเดิม

2. การรวมค่าและค่าเฉลี่ยเรขาคณิต

เพื่อให้ได้คะแนนเดียว ความแม่นยำของ 1-gram, 2-gram, 3-gram และ 4-gram จะถูกรวมค่าโดยใช้ค่าเฉลี่ยเรขาคณิต สิ่งนี้ทำขึ้นเพื่อให้ความแม่นยำที่ต่ำสำหรับ n-gram ประเภทหนึ่ง (เช่น 4-gram) มีผลกระทบอย่างมากต่อคะแนนสุดท้าย สะท้อนถึงคุณภาพที่ต่ำของวลียาว p1p2p3p44

3. บทลงโทษสำหรับความสั้น (Brevity Penalty)

เพื่อป้องกันการได้รับคะแนนสูงเกินจริงจากการแปลที่สั้นเกินไปแต่แม่นยำ BLEU นำ บทลงโทษสำหรับความสั้น (Brevity Penalty, BP) มาใช้ หากความยาวของการแปลที่เป็นตัวเลือก (c) น้อยกว่าความยาวของการแปลมาตรฐานอ้างอิง (r) อย่างมีนัยสำคัญ คะแนน BLEU สุดท้ายจะลดลง บทลงโทษคำนวณตามสูตร: BP={1if c>re1r/cif cr

4. สูตร BLEU สุดท้าย

คะแนน BLEU ขั้นสุดท้ายคำนวณเป็นผลคูณของบทลงโทษสำหรับความสั้นกับค่าเฉลี่ยเรขาคณิตของความแม่นยำ n-gram[4]: BLEU=BPexp(n=1Nwnlogpn) โดยที่ N คือความยาวสูงสุดของ n-gram (โดยปกติคือ 4) และ wn คือน้ำหนัก (โดยปกติคือ 1/N)

ค่า BLEU อยู่ในช่วงตั้งแต่ 0 ถึง 1 (มักคูณด้วย 100 และแสดงเป็นเปอร์เซ็นต์) ยิ่งผลลัพธ์ใกล้ 1 (100%) มากเท่าใด การแปลก็ถือว่า «ใกล้เคียงกับมนุษย์» มากขึ้นเท่านั้น

การประยุกต์ใช้และความสำคัญ

นับตั้งแต่การเผยแพร่ ตัวชี้วัด BLEU ได้กลายเป็นมาตรฐานโดยพฤตินัยสำหรับการประเมินระบบการแปลด้วยเครื่อง (MT) มันช่วยขจัด «คอขวด» ในการพัฒนาระบบ MT ซึ่งได้แก่ ความยาวนานและค่าใช้จ่ายสูงของการประเมินด้วยมือ นักพัฒนาได้รับความสามารถในการวัดผลกระทบจากการเปลี่ยนแปลงในโมเดลอย่างรวดเร็ว และคัดกรองทางเลือกที่ไม่ดีออกอย่างทันท่วงที[2]

BLEU มีความสัมพันธ์ที่ดีกับการประเมินของมนุษย์ในระดับคลังข้อความทั้งหมด แต่ไม่น่าเชื่อถือสำหรับการประเมินประโยคแต่ละประโยค[3] ด้วยเหตุนี้ ตัวชี้วัดนี้จึงถูกนำมาใช้อย่างแพร่หลายในการแข่งขัน MT มาตรฐาน (เช่น NIST และ WMT) เพื่อเปรียบเทียบระบบต่างๆ

ข้อจำกัดและข้อวิจารณ์

แม้จะแพร่หลาย แต่ BLEU มีข้อจำกัดที่สำคัญหลายประการ:

  • ขาดการประเมินเชิงความหมาย: BLEU วัดเพียงการจับคู่คำในระดับผิวเผินและไม่สามารถประเมินได้ว่า ความหมาย ของข้อความต้นฉบับถูกถ่ายทอดอย่างถูกต้องหรือไม่ การแปลอาจได้คะแนนสูงแต่ผิดหลักไวยากรณ์หรือบิดเบือนความหมาย[5]
  • การไม่สนใจคำพ้องความหมายและการถอดความ: อัลกอริทึมลงโทษการแปลที่ใช้คำพ้องความหมายหรือการกำหนดสูตรที่แตกต่างจากข้อความอ้างอิง แม้ว่าจะถูกต้องอย่างสมบูรณ์ก็ตาม การใช้ข้อความอ้างอิงหลายรายการช่วยบรรเทาแต่ไม่ได้แก้ไขปัญหานี้อย่างสมบูรณ์
  • ความไวต่อการทำ token: ผลลัพธ์ของ BLEU ขึ้นอยู่อย่างมากกับวิธีการแบ่งข้อความออกเป็น token การใช้งาน tokenizer ที่แตกต่างกันอาจนำไปสู่ค่าที่แตกต่างกัน ทำให้การเปรียบเทียบโมเดลไม่ถูกต้อง เพื่อแก้ไขปัญหานี้ จึงมีการเสนอมาตรฐาน SacreBLEU ที่รวมการคำนวณตัวชี้วัดให้เป็นหนึ่งเดียว[1]
  • ความยากในการประยุกต์ใช้กับบางภาษา: BLEU ทำงานได้ไม่ดีกับภาษาที่ไม่มีตัวคั่นคำที่ชัดเจน (เช่น ภาษาจีนหรือญี่ปุ่น) หากไม่มีการแบ่งส่วนล่วงหน้า

ทางเลือกและแนวทางสมัยใหม่

เมื่อเวลาผ่านไป มีการเสนอตัวชี้วัดอัตโนมัติใหม่เพื่อเอาชนะข้อเสียของ BLEU:

  • METEOR: คำนึงถึงการจับคู่คำพ้องความหมาย การทำ stemming และลำดับของคำ
  • ROUGE: ใช้สำหรับการประเมินการสรุปข้อความ โดยเน้นที่ความครบถ้วน (recall) มากกว่าความแม่นยำ
  • ตัวชี้วัดที่เรียนรู้ได้ (Learned Metrics): แนวทางสมัยใหม่ที่ใช้โมเดล Machine Learning เพื่อคำนึงถึงความใกล้ชิดเชิงความหมาย ตัวชี้วัดเช่น BLEURT และ COMET แสดงความสัมพันธ์กับการประเมินของมนุษย์ที่สูงกว่า BLEU แบบดั้งเดิมอย่างมีนัยสำคัญ[6]

เมื่อถึงช่วงทศวรรษ 2020 BLEU ได้สูญเสียสถานะของมาตรฐานที่ไม่มีเงื่อนไข โดยถูกแทนที่ด้วยวิธีการที่แม่นยำยิ่งขึ้น[7] อย่างไรก็ตาม มันยังคงเป็นจุดสำคัญในประวัติศาสตร์ของการประเมิน MT และยังคงถูกใช้เป็นจุดอ้างอิงพื้นฐานในการวัดความก้าวหน้า

ลิงก์

  • การประเมิน BLEU คืออะไร? — เอกสาร Microsoft Azure

หมายเหตุ

  1. 1.0 1.1 1.2 «BLEU». Wikipedia. [1]
  2. 2.0 2.1 Papineni, Kishore, et al. «Bleu: a Method for Automatic Evaluation of Machine Translation». Proceedings of the 40th Annual Meeting of the Association for Computational Linguistics, 2002. [2]
  3. 3.0 3.1 «BLEU». MT Companion 4.0 documentation. [3]
  4. Callison-Burch, Chris, et al. «BLEU: a Method for Automatic Evaluation of Machine Translation». Proceedings of the EACL 2006 Workshop on Statistical Machine Translation, 2006. [4]
  5. Cardete, Jorge. «Beyond BLEU Score. When it comes to the nuanced world of...». The Deep Hub | Medium. [5]
  6. «BLEURT: метрика для оценки моделей для генерации текста». Neurohive. [6]
  7. «Chief Digital and Artificial Intelligence Office > Lexicon». ai.mil. [7]