BERTScore (metric) (TH)

From Systems analysis Wiki
Jump to navigation Jump to search

BERTScore — คือเมตริกอัตโนมัติสำหรับประเมินคุณภาพของข้อความที่สร้างขึ้น โดยอาศัยการวัดความคล้ายคลึงเชิงความหมายด้วย contextual embedding จากโมเดลภาษาที่ผ่านการ pre-training มาแล้ว เช่น BERT เมตริกนี้ถูกเสนอขึ้นในปี 2019 โดยกลุ่มนักวิจัยที่นำโดย Tianyi Zhang ในงานวิจัย «BERTScore: Evaluating Text Generation with BERT»[1]

แตกต่างจากเมตริกแบบดั้งเดิม เช่น BLEU และ ROUGE ซึ่งอิงการจับคู่ n-gram แบบตรงทั้งหมด BERTScore สามารถตรวจจับความเท่าเทียมของความหมายได้แม้คำและสำนวนจะแตกต่างกัน โดยคำนึงถึงคำพ้องความหมายและการถอดความ[2]

วิธีการคำนวณ

วิธีการของ BERTScore ประกอบด้วยหลายขั้นตอน:

  1. การได้รับ contextual embedding: ทั้งสองข้อความ (ข้อความอ้างอิงและข้อความที่สร้างขึ้น) จะถูกแบ่งเป็น token และส่งผ่านโมเดล transformer ที่ผ่านการ pre-training (เช่น BERT หรือ RoBERTa) สำหรับแต่ละ token จะดึง embedding เวกเตอร์เชิงบริบทออกมา
  2. การคำนวณความคล้ายคลึงเชิงโคไซน์: สำหรับคู่ token ทั้งหมดจากสองข้อความจะคำนวณ cosine similarity และสร้างเมทริกซ์ความคล้ายคลึงของ token[3]
  3. การคำนวณค่า precision, recall และ F1: จากเมทริกซ์ความคล้ายคลึง สำหรับแต่ละ token ในข้อความที่สร้างขึ้นจะค้นหา token ที่คล้ายกันมากที่สุดในข้อความอ้างอิง ซึ่งช่วยให้คำนวณ precision ได้ ในทำนองเดียวกัน สำหรับแต่ละ token ของข้อความอ้างอิงจะค้นหา token ที่ใกล้เคียงที่สุดในข้อความที่สร้างขึ้น ซึ่งให้ค่า recall ค่าสุดท้ายของ BERTScore คือ F₁ แบบสมดุลที่รวม precision และ recall เข้าด้วยกัน:
   RBERT=1|x|xixmaxyjyxiTyj(Recall)
   PBERT=1|y|yjymaxxixxiTyj(Precision)
   FBERT=2PBERTRBERTPBERT+RBERT

เมตริกนี้มีความยืดหยุ่น: สามารถเลือกโมเดล pre-training ที่แตกต่างกัน กำหนดน้ำหนักให้ token ตามความสำคัญ (ด้วยน้ำหนัก IDF) และแปลงคะแนนเชิงเส้นเพื่อให้ตีความได้ดีขึ้น[3]

การประยุกต์ใช้และประสิทธิภาพ

BERTScore ถูกนำมาใช้ประเมินคุณภาพในงานสร้างข้อความหลากหลายประเภท:

  • การแปลภาษาด้วยเครื่อง: จับการรักษาความหมายได้แม้รูปแบบการแปลจะแตกต่างจากข้อความอ้างอิง
  • การสรุปความอัตโนมัติ: สามารถระบุได้ว่าสำนวนที่แตกต่างกันอาจถ่ายทอดข้อเท็จจริงหลักเดียวกัน ทำให้มีความยืดหยุ่นมากกว่า ROUGE
  • ระบบโต้ตอบ: ช่วยวัดความเหมาะสมของคำตอบโดยเปรียบเทียบกับข้อความอ้างอิงในระดับความหมาย

การประเมินขนาดใหญ่ที่ผู้เขียนดำเนินการแสดงให้เห็นว่าสัมประสิทธิ์สหสัมพันธ์ของ BERTScore กับการประเมินของมนุษย์สูงกว่าอย่างเห็นได้ชัดเมื่อเทียบกับเมตริกประเภท BLEU และ ROUGE นอกจากนี้เมตริกยังแสดงให้เห็นถึงความทนทานที่เพิ่มขึ้นต่อกรณีการถอดความที่ซับซ้อน[1]

ข้อดี

  • การคำนึงถึงความหมาย: เปรียบเทียบข้อความในระดับความหมาย โดยคำนึงถึงคำพ้องความหมายและการถอดความ
  • ความสัมพันธ์สูงกับมนุษย์: คะแนน BERTScore สอดคล้องกับการตัดสินของมนุษย์เกี่ยวกับคุณภาพข้อความได้ดีกว่าเมตริกแบบดั้งเดิม
  • ความเป็นสากลและการถ่ายโอน: เมตริกไม่ผูกติดกับภาษาหรืองานเฉพาะใด เพียงแค่เลือกโมเดล pre-training ที่เหมาะสม
  • ไม่ต้องการการฝึกอบรม: BERTScore เป็นเมตริกที่ไม่ต้องฝึกอบรม แตกต่างจากเมตริกที่ซับซ้อนกว่า (เช่น BLEURT) ซึ่งต้องการการฝึกอบรมล่วงหน้าบน dataset การประเมิน
  • การบูรณาการโมเดลสมัยใหม่: ใช้ประโยชน์จากพลังของ transformer เพื่อดึงคุณลักษณะเชิงบริบทเชิงลึก

ข้อจำกัดและการวิจารณ์

  • ต้นทุนการคำนวณสูง: การคำนวณบน embedding ต้องการทรัพยากรมากกว่าการนับ n-gram อย่างมีนัยสำคัญ และมักต้องใช้ GPU[2]
  • การพึ่งพาโมเดล: คุณภาพของการประเมินเชื่อมโยงโดยตรงกับคุณภาพของโมเดล pre-training การเลือกโมเดลและเลเยอร์สำหรับดึง embedding มีผลต่อผลลัพธ์ ซึ่งอาจก่อให้เกิดปัญหาด้านการทำซ้ำได้[4]
  • การไม่คำนึงถึงข้อเท็จจริงและโครงสร้าง: BERTScore มุ่งเน้นความคล้ายคลึงเชิงความหมายเฉพาะที่และไม่รับประกันความเข้าใจโครงสร้างข้อความหรือความถูกต้องของข้อเท็จจริง ข้อความที่มีการสลับวลีหรือมีข้อผิดพลาดเชิงข้อเท็จจริงอาจได้คะแนนสูง[3]
  • การตีความได้ต่ำ: แตกต่างจาก BLEU/ROUGE คะแนน BERTScore มีความโปร่งใสน้อยกว่า ทำให้การวิเคราะห์ข้อผิดพลาดเป็นเรื่องยาก
  • อคติทางสังคม (bias): เมตริกรับช่วงอคติและภาพจำที่ฝังอยู่ในโมเดล pre-training งานวิจัยปี 2022 แสดงให้เห็นว่าเมตริกที่อิง LLM (รวมถึง BERTScore) แสดงอคติทางสังคมมากกว่าเมตริกแบบดั้งเดิมอย่างมีนัยสำคัญ[5]

ความสำคัญและบทบาทในการประเมิน

BERTScore ถือเป็นก้าวสำคัญในการพัฒนาวิธีการประเมินข้อความที่สร้างขึ้น เนื่องจากช่วยให้สามารถคำนึงถึงความเท่าเทียมเชิงความหมาย ไม่ใช่เพียงแค่การจับคู่คำศัพท์เท่านั้น แม้ว่าจะไม่มีเมตริกอัตโนมัติใดที่สามารถวัดคุณภาพข้อความได้อย่างสมบูรณ์แบบ BERTScore ได้พิสูจน์ตัวเองว่าเป็นเครื่องมือที่เชื่อถือได้ ซึ่งเสริมวิธีการคลาสสิก (เช่น BLEU และ ROUGE) แทนที่จะแทนที่อย่างสมบูรณ์

ในทางปฏิบัติ BERTScore มักถูกใช้ร่วมกับการตรวจสอบโดยผู้เชี่ยวชาญและเมตริกอื่น ๆ เพื่อให้ได้ภาพที่ครบถ้วนและลึกซึ้งยิ่งขึ้นเกี่ยวกับความสำเร็จของโมเดลในการสร้างข้อความที่สอดคล้องและมีความหมายตรงกัน[2]

ลิงก์

  • คลังข้อมูลอย่างเป็นทางการของ BERTScore บน GitHub

หมายเหตุ

  1. 1.0 1.1 Zhang, Tianyi, et al. «BERTScore: Evaluating Text Generation with BERT». arXiv:1904.09675 [cs.CL], 22 апр. 2019 г. [1]
  2. 2.0 2.1 2.2 «BERTScore: New Metrics for Language Models». Analytics Vidhya. [2]
  3. 3.0 3.1 3.2 Sojasingarayar, Abonia. «BERTScore Explained in 5 minutes». Medium. [3]
  4. Alakulju, D., et al. «Reproducibility of BERTScore». Theseus.fi. [4]
  5. Peyrard, M., et al. «BERTScore is Unfair: On Social Bias in Language Model-Based Metrics for Text Generation». arXiv:2210.07626 [cs.CL], 14 окт. 2022 г. [5]