BERTScore (metric) (TH)
BERTScore — คือเมตริกอัตโนมัติสำหรับประเมินคุณภาพของข้อความที่สร้างขึ้น โดยอาศัยการวัดความคล้ายคลึงเชิงความหมายด้วย contextual embedding จากโมเดลภาษาที่ผ่านการ pre-training มาแล้ว เช่น BERT เมตริกนี้ถูกเสนอขึ้นในปี 2019 โดยกลุ่มนักวิจัยที่นำโดย Tianyi Zhang ในงานวิจัย «BERTScore: Evaluating Text Generation with BERT»[1]
แตกต่างจากเมตริกแบบดั้งเดิม เช่น BLEU และ ROUGE ซึ่งอิงการจับคู่ n-gram แบบตรงทั้งหมด BERTScore สามารถตรวจจับความเท่าเทียมของความหมายได้แม้คำและสำนวนจะแตกต่างกัน โดยคำนึงถึงคำพ้องความหมายและการถอดความ[2]
วิธีการคำนวณ
วิธีการของ BERTScore ประกอบด้วยหลายขั้นตอน:
- การได้รับ contextual embedding: ทั้งสองข้อความ (ข้อความอ้างอิงและข้อความที่สร้างขึ้น) จะถูกแบ่งเป็น token และส่งผ่านโมเดล transformer ที่ผ่านการ pre-training (เช่น BERT หรือ RoBERTa) สำหรับแต่ละ token จะดึง embedding เวกเตอร์เชิงบริบทออกมา
- การคำนวณความคล้ายคลึงเชิงโคไซน์: สำหรับคู่ token ทั้งหมดจากสองข้อความจะคำนวณ cosine similarity และสร้างเมทริกซ์ความคล้ายคลึงของ token[3]
- การคำนวณค่า precision, recall และ F1: จากเมทริกซ์ความคล้ายคลึง สำหรับแต่ละ token ในข้อความที่สร้างขึ้นจะค้นหา token ที่คล้ายกันมากที่สุดในข้อความอ้างอิง ซึ่งช่วยให้คำนวณ precision ได้ ในทำนองเดียวกัน สำหรับแต่ละ token ของข้อความอ้างอิงจะค้นหา token ที่ใกล้เคียงที่สุดในข้อความที่สร้างขึ้น ซึ่งให้ค่า recall ค่าสุดท้ายของ BERTScore คือ F₁ แบบสมดุลที่รวม precision และ recall เข้าด้วยกัน:
เมตริกนี้มีความยืดหยุ่น: สามารถเลือกโมเดล pre-training ที่แตกต่างกัน กำหนดน้ำหนักให้ token ตามความสำคัญ (ด้วยน้ำหนัก IDF) และแปลงคะแนนเชิงเส้นเพื่อให้ตีความได้ดีขึ้น[3]
การประยุกต์ใช้และประสิทธิภาพ
BERTScore ถูกนำมาใช้ประเมินคุณภาพในงานสร้างข้อความหลากหลายประเภท:
- การแปลภาษาด้วยเครื่อง: จับการรักษาความหมายได้แม้รูปแบบการแปลจะแตกต่างจากข้อความอ้างอิง
- การสรุปความอัตโนมัติ: สามารถระบุได้ว่าสำนวนที่แตกต่างกันอาจถ่ายทอดข้อเท็จจริงหลักเดียวกัน ทำให้มีความยืดหยุ่นมากกว่า ROUGE
- ระบบโต้ตอบ: ช่วยวัดความเหมาะสมของคำตอบโดยเปรียบเทียบกับข้อความอ้างอิงในระดับความหมาย
การประเมินขนาดใหญ่ที่ผู้เขียนดำเนินการแสดงให้เห็นว่าสัมประสิทธิ์สหสัมพันธ์ของ BERTScore กับการประเมินของมนุษย์สูงกว่าอย่างเห็นได้ชัดเมื่อเทียบกับเมตริกประเภท BLEU และ ROUGE นอกจากนี้เมตริกยังแสดงให้เห็นถึงความทนทานที่เพิ่มขึ้นต่อกรณีการถอดความที่ซับซ้อน[1]
ข้อดี
- การคำนึงถึงความหมาย: เปรียบเทียบข้อความในระดับความหมาย โดยคำนึงถึงคำพ้องความหมายและการถอดความ
- ความสัมพันธ์สูงกับมนุษย์: คะแนน BERTScore สอดคล้องกับการตัดสินของมนุษย์เกี่ยวกับคุณภาพข้อความได้ดีกว่าเมตริกแบบดั้งเดิม
- ความเป็นสากลและการถ่ายโอน: เมตริกไม่ผูกติดกับภาษาหรืองานเฉพาะใด เพียงแค่เลือกโมเดล pre-training ที่เหมาะสม
- ไม่ต้องการการฝึกอบรม: BERTScore เป็นเมตริกที่ไม่ต้องฝึกอบรม แตกต่างจากเมตริกที่ซับซ้อนกว่า (เช่น BLEURT) ซึ่งต้องการการฝึกอบรมล่วงหน้าบน dataset การประเมิน
- การบูรณาการโมเดลสมัยใหม่: ใช้ประโยชน์จากพลังของ transformer เพื่อดึงคุณลักษณะเชิงบริบทเชิงลึก
ข้อจำกัดและการวิจารณ์
- ต้นทุนการคำนวณสูง: การคำนวณบน embedding ต้องการทรัพยากรมากกว่าการนับ n-gram อย่างมีนัยสำคัญ และมักต้องใช้ GPU[2]
- การพึ่งพาโมเดล: คุณภาพของการประเมินเชื่อมโยงโดยตรงกับคุณภาพของโมเดล pre-training การเลือกโมเดลและเลเยอร์สำหรับดึง embedding มีผลต่อผลลัพธ์ ซึ่งอาจก่อให้เกิดปัญหาด้านการทำซ้ำได้[4]
- การไม่คำนึงถึงข้อเท็จจริงและโครงสร้าง: BERTScore มุ่งเน้นความคล้ายคลึงเชิงความหมายเฉพาะที่และไม่รับประกันความเข้าใจโครงสร้างข้อความหรือความถูกต้องของข้อเท็จจริง ข้อความที่มีการสลับวลีหรือมีข้อผิดพลาดเชิงข้อเท็จจริงอาจได้คะแนนสูง[3]
- การตีความได้ต่ำ: แตกต่างจาก BLEU/ROUGE คะแนน BERTScore มีความโปร่งใสน้อยกว่า ทำให้การวิเคราะห์ข้อผิดพลาดเป็นเรื่องยาก
- อคติทางสังคม (bias): เมตริกรับช่วงอคติและภาพจำที่ฝังอยู่ในโมเดล pre-training งานวิจัยปี 2022 แสดงให้เห็นว่าเมตริกที่อิง LLM (รวมถึง BERTScore) แสดงอคติทางสังคมมากกว่าเมตริกแบบดั้งเดิมอย่างมีนัยสำคัญ[5]
ความสำคัญและบทบาทในการประเมิน
BERTScore ถือเป็นก้าวสำคัญในการพัฒนาวิธีการประเมินข้อความที่สร้างขึ้น เนื่องจากช่วยให้สามารถคำนึงถึงความเท่าเทียมเชิงความหมาย ไม่ใช่เพียงแค่การจับคู่คำศัพท์เท่านั้น แม้ว่าจะไม่มีเมตริกอัตโนมัติใดที่สามารถวัดคุณภาพข้อความได้อย่างสมบูรณ์แบบ BERTScore ได้พิสูจน์ตัวเองว่าเป็นเครื่องมือที่เชื่อถือได้ ซึ่งเสริมวิธีการคลาสสิก (เช่น BLEU และ ROUGE) แทนที่จะแทนที่อย่างสมบูรณ์
ในทางปฏิบัติ BERTScore มักถูกใช้ร่วมกับการตรวจสอบโดยผู้เชี่ยวชาญและเมตริกอื่น ๆ เพื่อให้ได้ภาพที่ครบถ้วนและลึกซึ้งยิ่งขึ้นเกี่ยวกับความสำเร็จของโมเดลในการสร้างข้อความที่สอดคล้องและมีความหมายตรงกัน[2]
ลิงก์
- คลังข้อมูลอย่างเป็นทางการของ BERTScore บน GitHub
หมายเหตุ
- ↑ 1.0 1.1 Zhang, Tianyi, et al. «BERTScore: Evaluating Text Generation with BERT». arXiv:1904.09675 [cs.CL], 22 апр. 2019 г. [1]
- ↑ 2.0 2.1 2.2 «BERTScore: New Metrics for Language Models». Analytics Vidhya. [2]
- ↑ 3.0 3.1 3.2 Sojasingarayar, Abonia. «BERTScore Explained in 5 minutes». Medium. [3]
- ↑ Alakulju, D., et al. «Reproducibility of BERTScore». Theseus.fi. [4]
- ↑ Peyrard, M., et al. «BERTScore is Unfair: On Social Bias in Language Model-Based Metrics for Text Generation». arXiv:2210.07626 [cs.CL], 14 окт. 2022 г. [5]