---
title: "BERTScore (metric) (TL)"
source: "https://systems-analysis.info/int/BERTScore_(metric)_(TL)"
wiki: "systems-analysis.info/int"
article: "BERTScore_(metric)_(TL)"
language: "tl"
categories:
  - "Category:Large language models"
  - "Category:LLM evaluation"
  - "Category:Machine learning"
  - "Category:Tagalog"
revision_id: 560
wiki_created_at: 2026-09-06T22:35:36Z
wiki_modified_at: 2026-09-06T22:35:36Z
downloaded_at: 2026-09-07T22:40:59Z
---

# BERTScore (metric) (TL)

**BERTScore** — ito ay isang awtomatikong sukatan para sa pagtatasa ng kalidad ng nabuong teksto, batay sa pagsukat ng semantic na pagkakatulad gamit ang mga kontekstwal na embedding mula sa mga pre-trained na language model, tulad ng BERT. Ang sukatan ay iminungkahi noong 2019 ng isang pangkat ng mga mananaliksik na pinamumunuan ni **Tianyi Zhang** sa akdang «BERTScore: Evaluating Text Generation with BERT»<sup>[\[1\]](https://systems-analysis.info/int/BERTScore_(metric)_(TL)#cite_note-bertscore_paper-1)</sup>.

Kaiba sa mga tradisyonal na sukatan tulad ng BLEU at ROUGE, na nakabatay sa eksaktong pagkatugma ng mga n-gram, ang BERTScore ay nagbibigay-daan sa pagtukoy ng katumbasan ng kahulugan kahit na magkaiba ang mga salita at parirala, isinasaalang-alang ang mga kasingkahulugan at mga parafrase<sup>[\[2\]](https://systems-analysis.info/int/BERTScore_(metric)_(TL)#cite_note-analytics_vidhya-2)</sup>.

## Pamamaraan ng Pagkalkula

Ang pamamaraan ng BERTScore ay binubuo ng ilang yugto:

1.  **Pagkuha ng mga kontekstwal na embedding**: Ang parehong teksto (reference at nabuong teksto) ay hinahati sa mga token at pinoproseso sa pamamagitan ng isang pre-trained na transformer model (halimbawa, BERT o RoBERTa). Para sa bawat token, kinukuha ang kontekstwal na vector representation (embedding) nito.
2.  **Pagkalkula ng cosine similarity**: Para sa lahat ng pares ng mga token mula sa dalawang teksto, kinakalkula ang cosine similarity, at nabubuo ang isang similarity matrix ng mga token<sup>[\[3\]](https://systems-analysis.info/int/BERTScore_(metric)_(TL)#cite_note-bertscore_explained-3)</sup>.
3.  **Pagkalkula ng precision, recall, at F1-measure**: Batay sa similarity matrix, para sa bawat token sa nabuong teksto, hinahanap ang pinaka-katulad na token sa reference na teksto, na nagbibigay-daan sa pagkalkula ng **precision**. Gayundin, para sa bawat token ng reference, hinahanap ang pinaka-malapit na token sa nabuong teksto, na nagbibigay ng **recall**. Ang panghuling halaga ng BERTScore ay ang balanseng F₁-measure, na pinagsasama ang precision at recall:

<!-- -->

       RBERT=1|x|∑xi∈xmaxyj∈yxiTyj(Recall)
       PBERT=1|y|∑yj∈ymaxxi∈xxiTyj(Precision)
       FBERT=2PBERT⋅RBERTPBERT+RBERT

Ang sukatan ay nababaluktot: maaaring pumili ng iba't ibang pre-trained na modelo, timbangin ang mga token ayon sa kanilang kahalagahan (gamit ang mga IDF-weight), at linear na i-transform ang mga marka para sa mas mahusay na interpretasyon<sup>[\[3\]](https://systems-analysis.info/int/BERTScore_(metric)_(TL)#cite_note-bertscore_explained-3)</sup>.

## Paggamit at Bisa

Ang BERTScore ay ginagamit para sa pagtatasa ng kalidad sa iba't ibang gawain ng pagsasalin at pagbuo ng teksto:

- **Makina-salin**: Kinukuha ang pagpapanatili ng kahulugan, kahit na magkaiba ang mga konstruksyon ng pagsasalin mula sa mga pamantayan.
- **Awtomatikong buod**: Kayang tukuyin na ang iba't ibang pagpapalawak ay maaaring maghatid ng parehong mahahalagang katotohanan, na ginagawa itong mas nababaluktot kaysa sa ROUGE.
- **Mga dialog na sistema**: Tumutulong sa pagsukat ng angkop na tugon sa pamamagitan ng paghahambing nito sa reference sa antas ng kahulugan.

Ang malawakang pagtatasa na isinagawa ng mga may-akda ay nagpakita na ang koepisyente ng ugnayan ng BERTScore sa mga pagtatasa ng tao ay **kapansin-pansing mas mataas** kaysa sa mga sukatan tulad ng BLEU at ROUGE. Bukod dito, ipinakita ng sukatan ang pinahusay na katatagan sa mga kumplikadong kaso ng parafrase<sup>[\[1\]](https://systems-analysis.info/int/BERTScore_(metric)_(TL)#cite_note-bertscore_paper-1)</sup>.

## Mga Kalamangan

- **Pagsasaalang-alang ng semantika**: Inihahambing ang mga teksto sa antas ng kahulugan, isinasaalang-alang ang mga kasingkahulugan at parafrase.
- **Mataas na ugnayan sa tao**: Ang mga marka ng BERTScore ay mas naaayon sa mga hatol ng tao tungkol sa kalidad ng teksto kaysa sa mga tradisyonal na sukatan.
- **Pangkalahatan at pagiging madaling ilipat**: Ang sukatan ay hindi nakatali sa isang partikular na wika o gawain; sapat na pumili ng angkop na pre-trained na modelo.
- **Walang pangangailangan ng pagsasanay**: Ang BERTScore ay isang **hindi kinakailangang sanayin na sukatan**, kaiba sa mas kumplikadong mga sukatan (halimbawa, BLEURT), na nangangailangan ng paunang pagsasanay sa mga corpus ng pagtatasa.
- **Integrasyon ng mga makabagong modelo**: Ginagamit ang kapangyarihan ng mga transformer para sa pagkuha ng malalim na kontekstwal na katangian.

## Mga Limitasyon at Kritisismo

- **Mataas na computational na gastos**: Ang pagkalkula batay sa mga embedding ay nangangailangan ng mas maraming mapagkukunan kaysa sa pagbibilang ng mga n-gram, at kadalasang nangangailangan ng paggamit ng GPU<sup>[\[2\]](https://systems-analysis.info/int/BERTScore_(metric)_(TL)#cite_note-analytics_vidhya-2)</sup>.
- **Pag-asa sa modelo**: Ang kalidad ng pagtatasa ay direktang nauugnay sa kalidad ng pre-trained na modelo. Ang pagpili ng modelo at layer para sa pagkuha ng mga embedding ay nakakaapekto sa resulta, na maaaring magdulot ng mga isyu sa reproducibility<sup>[\[4\]](https://systems-analysis.info/int/BERTScore_(metric)_(TL)#cite_note-theseus_fi-4)</sup>.
- **Kawalan ng pagsasaalang-alang ng mga katotohanan at istraktura**: Ang BERTScore ay nakatutok sa lokal na semantic na pagkakatulad at hindi ginagarantiyahan ang pag-unawa sa istraktura ng teksto o katumpakan ng mga katotohanan. Ang teksto na may mga inilipat na parirala o mga pagkakamali sa katotohanan ay maaaring makatanggap ng mataas na marka<sup>[\[3\]](https://systems-analysis.info/int/BERTScore_(metric)_(TL)#cite_note-bertscore_explained-3)</sup>.
- **Mababang interpretability**: Kaiba sa BLEU/ROUGE, ang tagapagpahiwatig ng BERTScore ay hindi gaanong malinaw, na nagpapahirap sa pagsusuri ng mga pagkakamali.
- **Mga panlipunang kinikilingan (bias)**: Ang sukatan ay nagmamana ng mga stereotipo at kinikilingan na nakapaloob sa mga pre-trained na modelo. Ipinakita ng isang pag-aaral noong 2022 na ang mga sukatan batay sa LLM (kabilang ang BERTScore) ay nagpapakita ng mas malaking panlipunang bias kaysa sa mga tradisyonal na sukatan<sup>[\[5\]](https://systems-analysis.info/int/BERTScore_(metric)_(TL)#cite_note-bertscore_unfair-5)</sup>.

## Kahalagahan at Papel sa Pagtatasa

Ang BERTScore ay kumakatawan sa isang mahalagang hakbang sa pagpapaunlad ng mga pamamaraan ng pagtatasa ng nabuong teksto, dahil nagbibigay-daan ito sa pagsasaalang-alang ng semantic na katumbasan, at hindi lamang ng mga leksikal na pagkatugma. Sa kabila ng katotohanang walang awtomatikong sukatan ang kayang perpektong sukatin ang kalidad ng teksto, ang BERTScore ay nagpapatunay bilang isang maaasahang kasangkapan na nagpupunan sa mga klasikal na pamamaraan (tulad ng BLEU at ROUGE), at hindi ganap na pinapalitan ang mga ito.

Sa praktika, ang BERTScore ay madalas na ginagamit nang kasabay ng manu-manong pagsusuri ng eksperto at iba pang mga sukatan upang makakuha ng mas kumpleto at malalim na pag-unawa sa kung gaano katagumpay ang mga modelo sa pagbuo ng magkakaugnay at semantically na angkop na mga teksto<sup>[\[2\]](https://systems-analysis.info/int/BERTScore_(metric)_(TL)#cite_note-analytics_vidhya-2)</sup>.

## Mga Sanggunian

- Opisyal na repositoryo ng BERTScore sa GitHub

## Mga Tala

1.  <span id="cite_note-bertscore_paper-1">↑ <sup>[1.0](https://systems-analysis.info/int/BERTScore_(metric)_(TL)#cite_ref-bertscore_paper_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/BERTScore_(metric)_(TL)#cite_ref-bertscore_paper_1-1)</sup> Zhang, Tianyi, et al. «BERTScore: Evaluating Text Generation with BERT». *arXiv:1904.09675* \[cs.CL\], 22 апр. 2019 г. <a href="https://arxiv.org/abs/1904.09675" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-analytics_vidhya-2">↑ <sup>[2.0](https://systems-analysis.info/int/BERTScore_(metric)_(TL)#cite_ref-analytics_vidhya_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/BERTScore_(metric)_(TL)#cite_ref-analytics_vidhya_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/BERTScore_(metric)_(TL)#cite_ref-analytics_vidhya_2-2)</sup> «BERTScore: New Metrics for Language Models». *Analytics Vidhya*. <a href="https://www.analyticsvidhya.com/blog/2025/04/bertscore-a-contextual-metric-for-llm-evaluation/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-bertscore_explained-3">↑ <sup>[3.0](https://systems-analysis.info/int/BERTScore_(metric)_(TL)#cite_ref-bertscore_explained_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/BERTScore_(metric)_(TL)#cite_ref-bertscore_explained_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/BERTScore_(metric)_(TL)#cite_ref-bertscore_explained_3-2)</sup> Sojasingarayar, Abonia. «BERTScore Explained in 5 minutes». *Medium*. <a href="https://medium.com/@abonia/bertscore-explained-in-5-minutes-0b98553bfb71" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-theseus_fi-4">[↑](https://systems-analysis.info/int/BERTScore_(metric)_(TL)#cite_ref-theseus_fi_4-0) Alakulju, D., et al. «Reproducibility of BERTScore». *Theseus.fi*. <a href="https://www.theseus.fi/bitstream/handle/10024/884189/Alakulju_Dkhili_Moufida.pdf?sequence=2&amp;isAllowed=y" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-bertscore_unfair-5">[↑](https://systems-analysis.info/int/BERTScore_(metric)_(TL)#cite_ref-bertscore_unfair_5-0) Peyrard, M., et al. «BERTScore is Unfair: On Social Bias in Language Model-Based Metrics for Text Generation». *arXiv:2210.07626* \[cs.CL\], 14 окт. 2022 г. <a href="https://arxiv.org/abs/2210.07626" class="external autonumber" rel="nofollow">[5]</a></span>
