---
title: "BERTScore (metric) (TH)"
source: "https://systems-analysis.info/int/BERTScore_(metric)_(TH)"
wiki: "systems-analysis.info/int"
article: "BERTScore_(metric)_(TH)"
language: "th"
categories:
  - "Category:Large language models"
  - "Category:LLM evaluation"
  - "Category:Machine learning"
  - "Category:Thai"
revision_id: 559
wiki_created_at: 2026-09-06T22:35:35Z
wiki_modified_at: 2026-09-06T22:35:35Z
downloaded_at: 2026-09-07T22:40:59Z
---

# BERTScore (metric) (TH)

**BERTScore** — คือเมตริกอัตโนมัติสำหรับประเมินคุณภาพของข้อความที่สร้างขึ้น โดยอาศัยการวัดความคล้ายคลึงเชิงความหมายด้วย contextual embedding จากโมเดลภาษาที่ผ่านการ pre-training มาแล้ว เช่น BERT เมตริกนี้ถูกเสนอขึ้นในปี 2019 โดยกลุ่มนักวิจัยที่นำโดย **Tianyi Zhang** ในงานวิจัย «BERTScore: Evaluating Text Generation with BERT»<sup>[\[1\]](https://systems-analysis.info/int/BERTScore_(metric)_(TH)#cite_note-bertscore_paper-1)</sup>

แตกต่างจากเมตริกแบบดั้งเดิม เช่น BLEU และ ROUGE ซึ่งอิงการจับคู่ n-gram แบบตรงทั้งหมด BERTScore สามารถตรวจจับความเท่าเทียมของความหมายได้แม้คำและสำนวนจะแตกต่างกัน โดยคำนึงถึงคำพ้องความหมายและการถอดความ<sup>[\[2\]](https://systems-analysis.info/int/BERTScore_(metric)_(TH)#cite_note-analytics_vidhya-2)</sup>

## วิธีการคำนวณ

วิธีการของ BERTScore ประกอบด้วยหลายขั้นตอน:

1.  **การได้รับ contextual embedding**: ทั้งสองข้อความ (ข้อความอ้างอิงและข้อความที่สร้างขึ้น) จะถูกแบ่งเป็น token และส่งผ่านโมเดล transformer ที่ผ่านการ pre-training (เช่น BERT หรือ RoBERTa) สำหรับแต่ละ token จะดึง embedding เวกเตอร์เชิงบริบทออกมา
2.  **การคำนวณความคล้ายคลึงเชิงโคไซน์**: สำหรับคู่ token ทั้งหมดจากสองข้อความจะคำนวณ cosine similarity และสร้างเมทริกซ์ความคล้ายคลึงของ token<sup>[\[3\]](https://systems-analysis.info/int/BERTScore_(metric)_(TH)#cite_note-bertscore_explained-3)</sup>
3.  **การคำนวณค่า precision, recall และ F1**: จากเมทริกซ์ความคล้ายคลึง สำหรับแต่ละ token ในข้อความที่สร้างขึ้นจะค้นหา token ที่คล้ายกันมากที่สุดในข้อความอ้างอิง ซึ่งช่วยให้คำนวณ **precision** ได้ ในทำนองเดียวกัน สำหรับแต่ละ token ของข้อความอ้างอิงจะค้นหา token ที่ใกล้เคียงที่สุดในข้อความที่สร้างขึ้น ซึ่งให้ค่า **recall** ค่าสุดท้ายของ BERTScore คือ F₁ แบบสมดุลที่รวม precision และ recall เข้าด้วยกัน:

<!-- -->

       RBERT=1|x|∑xi∈xmaxyj∈yxiTyj(Recall)
       PBERT=1|y|∑yj∈ymaxxi∈xxiTyj(Precision)
       FBERT=2PBERT⋅RBERTPBERT+RBERT

เมตริกนี้มีความยืดหยุ่น: สามารถเลือกโมเดล pre-training ที่แตกต่างกัน กำหนดน้ำหนักให้ token ตามความสำคัญ (ด้วยน้ำหนัก IDF) และแปลงคะแนนเชิงเส้นเพื่อให้ตีความได้ดีขึ้น<sup>[\[3\]](https://systems-analysis.info/int/BERTScore_(metric)_(TH)#cite_note-bertscore_explained-3)</sup>

## การประยุกต์ใช้และประสิทธิภาพ

BERTScore ถูกนำมาใช้ประเมินคุณภาพในงานสร้างข้อความหลากหลายประเภท:

- **การแปลภาษาด้วยเครื่อง**: จับการรักษาความหมายได้แม้รูปแบบการแปลจะแตกต่างจากข้อความอ้างอิง
- **การสรุปความอัตโนมัติ**: สามารถระบุได้ว่าสำนวนที่แตกต่างกันอาจถ่ายทอดข้อเท็จจริงหลักเดียวกัน ทำให้มีความยืดหยุ่นมากกว่า ROUGE
- **ระบบโต้ตอบ**: ช่วยวัดความเหมาะสมของคำตอบโดยเปรียบเทียบกับข้อความอ้างอิงในระดับความหมาย

การประเมินขนาดใหญ่ที่ผู้เขียนดำเนินการแสดงให้เห็นว่าสัมประสิทธิ์สหสัมพันธ์ของ BERTScore กับการประเมินของมนุษย์**สูงกว่าอย่างเห็นได้ชัด**เมื่อเทียบกับเมตริกประเภท BLEU และ ROUGE นอกจากนี้เมตริกยังแสดงให้เห็นถึงความทนทานที่เพิ่มขึ้นต่อกรณีการถอดความที่ซับซ้อน<sup>[\[1\]](https://systems-analysis.info/int/BERTScore_(metric)_(TH)#cite_note-bertscore_paper-1)</sup>

## ข้อดี

- **การคำนึงถึงความหมาย**: เปรียบเทียบข้อความในระดับความหมาย โดยคำนึงถึงคำพ้องความหมายและการถอดความ
- **ความสัมพันธ์สูงกับมนุษย์**: คะแนน BERTScore สอดคล้องกับการตัดสินของมนุษย์เกี่ยวกับคุณภาพข้อความได้ดีกว่าเมตริกแบบดั้งเดิม
- **ความเป็นสากลและการถ่ายโอน**: เมตริกไม่ผูกติดกับภาษาหรืองานเฉพาะใด เพียงแค่เลือกโมเดล pre-training ที่เหมาะสม
- **ไม่ต้องการการฝึกอบรม**: BERTScore เป็น**เมตริกที่ไม่ต้องฝึกอบรม** แตกต่างจากเมตริกที่ซับซ้อนกว่า (เช่น BLEURT) ซึ่งต้องการการฝึกอบรมล่วงหน้าบน dataset การประเมิน
- **การบูรณาการโมเดลสมัยใหม่**: ใช้ประโยชน์จากพลังของ transformer เพื่อดึงคุณลักษณะเชิงบริบทเชิงลึก

## ข้อจำกัดและการวิจารณ์

- **ต้นทุนการคำนวณสูง**: การคำนวณบน embedding ต้องการทรัพยากรมากกว่าการนับ n-gram อย่างมีนัยสำคัญ และมักต้องใช้ GPU<sup>[\[2\]](https://systems-analysis.info/int/BERTScore_(metric)_(TH)#cite_note-analytics_vidhya-2)</sup>
- **การพึ่งพาโมเดล**: คุณภาพของการประเมินเชื่อมโยงโดยตรงกับคุณภาพของโมเดล pre-training การเลือกโมเดลและเลเยอร์สำหรับดึง embedding มีผลต่อผลลัพธ์ ซึ่งอาจก่อให้เกิดปัญหาด้านการทำซ้ำได้<sup>[\[4\]](https://systems-analysis.info/int/BERTScore_(metric)_(TH)#cite_note-theseus_fi-4)</sup>
- **การไม่คำนึงถึงข้อเท็จจริงและโครงสร้าง**: BERTScore มุ่งเน้นความคล้ายคลึงเชิงความหมายเฉพาะที่และไม่รับประกันความเข้าใจโครงสร้างข้อความหรือความถูกต้องของข้อเท็จจริง ข้อความที่มีการสลับวลีหรือมีข้อผิดพลาดเชิงข้อเท็จจริงอาจได้คะแนนสูง<sup>[\[3\]](https://systems-analysis.info/int/BERTScore_(metric)_(TH)#cite_note-bertscore_explained-3)</sup>
- **การตีความได้ต่ำ**: แตกต่างจาก BLEU/ROUGE คะแนน BERTScore มีความโปร่งใสน้อยกว่า ทำให้การวิเคราะห์ข้อผิดพลาดเป็นเรื่องยาก
- **อคติทางสังคม (bias)**: เมตริกรับช่วงอคติและภาพจำที่ฝังอยู่ในโมเดล pre-training งานวิจัยปี 2022 แสดงให้เห็นว่าเมตริกที่อิง LLM (รวมถึง BERTScore) แสดงอคติทางสังคมมากกว่าเมตริกแบบดั้งเดิมอย่างมีนัยสำคัญ<sup>[\[5\]](https://systems-analysis.info/int/BERTScore_(metric)_(TH)#cite_note-bertscore_unfair-5)</sup>

## ความสำคัญและบทบาทในการประเมิน

BERTScore ถือเป็นก้าวสำคัญในการพัฒนาวิธีการประเมินข้อความที่สร้างขึ้น เนื่องจากช่วยให้สามารถคำนึงถึงความเท่าเทียมเชิงความหมาย ไม่ใช่เพียงแค่การจับคู่คำศัพท์เท่านั้น แม้ว่าจะไม่มีเมตริกอัตโนมัติใดที่สามารถวัดคุณภาพข้อความได้อย่างสมบูรณ์แบบ BERTScore ได้พิสูจน์ตัวเองว่าเป็นเครื่องมือที่เชื่อถือได้ ซึ่งเสริมวิธีการคลาสสิก (เช่น BLEU และ ROUGE) แทนที่จะแทนที่อย่างสมบูรณ์

ในทางปฏิบัติ BERTScore มักถูกใช้ร่วมกับการตรวจสอบโดยผู้เชี่ยวชาญและเมตริกอื่น ๆ เพื่อให้ได้ภาพที่ครบถ้วนและลึกซึ้งยิ่งขึ้นเกี่ยวกับความสำเร็จของโมเดลในการสร้างข้อความที่สอดคล้องและมีความหมายตรงกัน<sup>[\[2\]](https://systems-analysis.info/int/BERTScore_(metric)_(TH)#cite_note-analytics_vidhya-2)</sup>

## ลิงก์

- คลังข้อมูลอย่างเป็นทางการของ BERTScore บน GitHub

## หมายเหตุ

1.  <span id="cite_note-bertscore_paper-1">↑ <sup>[1.0](https://systems-analysis.info/int/BERTScore_(metric)_(TH)#cite_ref-bertscore_paper_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/BERTScore_(metric)_(TH)#cite_ref-bertscore_paper_1-1)</sup> Zhang, Tianyi, et al. «BERTScore: Evaluating Text Generation with BERT». *arXiv:1904.09675* \[cs.CL\], 22 апр. 2019 г. <a href="https://arxiv.org/abs/1904.09675" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-analytics_vidhya-2">↑ <sup>[2.0](https://systems-analysis.info/int/BERTScore_(metric)_(TH)#cite_ref-analytics_vidhya_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/BERTScore_(metric)_(TH)#cite_ref-analytics_vidhya_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/BERTScore_(metric)_(TH)#cite_ref-analytics_vidhya_2-2)</sup> «BERTScore: New Metrics for Language Models». *Analytics Vidhya*. <a href="https://www.analyticsvidhya.com/blog/2025/04/bertscore-a-contextual-metric-for-llm-evaluation/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-bertscore_explained-3">↑ <sup>[3.0](https://systems-analysis.info/int/BERTScore_(metric)_(TH)#cite_ref-bertscore_explained_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/BERTScore_(metric)_(TH)#cite_ref-bertscore_explained_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/BERTScore_(metric)_(TH)#cite_ref-bertscore_explained_3-2)</sup> Sojasingarayar, Abonia. «BERTScore Explained in 5 minutes». *Medium*. <a href="https://medium.com/@abonia/bertscore-explained-in-5-minutes-0b98553bfb71" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-theseus_fi-4">[↑](https://systems-analysis.info/int/BERTScore_(metric)_(TH)#cite_ref-theseus_fi_4-0) Alakulju, D., et al. «Reproducibility of BERTScore». *Theseus.fi*. <a href="https://www.theseus.fi/bitstream/handle/10024/884189/Alakulju_Dkhili_Moufida.pdf?sequence=2&amp;isAllowed=y" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-bertscore_unfair-5">[↑](https://systems-analysis.info/int/BERTScore_(metric)_(TH)#cite_ref-bertscore_unfair_5-0) Peyrard, M., et al. «BERTScore is Unfair: On Social Bias in Language Model-Based Metrics for Text Generation». *arXiv:2210.07626* \[cs.CL\], 14 окт. 2022 г. <a href="https://arxiv.org/abs/2210.07626" class="external autonumber" rel="nofollow">[5]</a></span>
