---
title: "BERTScore (metric) (PL)"
source: "https://systems-analysis.info/int/BERTScore_(metric)_(PL)"
wiki: "systems-analysis.info/int"
article: "BERTScore_(metric)_(PL)"
language: "pl"
categories:
  - "Category:Large language models"
  - "Category:LLM evaluation"
  - "Category:Machine learning"
  - "Category:Polish"
revision_id: 555
wiki_created_at: 2026-09-06T22:35:32Z
wiki_modified_at: 2026-09-06T22:35:32Z
downloaded_at: 2026-09-07T22:40:58Z
---

# BERTScore (metric) (PL)

**BERTScore** — to automatyczna metryka oceny jakości wygenerowanego tekstu, oparta na pomiarze podobieństwa semantycznego za pomocą kontekstowych embedding z wstępnie wytrenowanych modeli językowych, takich jak BERT. Metryka została zaproponowana w 2019 roku przez grupę badaczy pod kierownictwem **Tianyi Zhanga** w pracy „BERTScore: Evaluating Text Generation with BERT"<sup>[\[1\]](https://systems-analysis.info/int/BERTScore_(metric)_(PL)#cite_note-bertscore_paper-1)</sup>.

W odróżnieniu od tradycyjnych metryk, takich jak BLEU i ROUGE, które opierają się na dokładnym dopasowaniu n-gramów, BERTScore pozwala wykrywać równoważność znaczenia nawet przy różnicach w słowach i sformułowaniach, uwzględniając synonimy i parafrazy<sup>[\[2\]](https://systems-analysis.info/int/BERTScore_(metric)_(PL)#cite_note-analytics_vidhya-2)</sup>.

## Metodyka obliczania

Metoda BERTScore składa się z kilku etapów:

1.  **Uzyskanie kontekstowych embeddingów**: Oba teksty (referencyjny i wygenerowany) są dzielone na tokeny i przepuszczane przez wstępnie wytrenowany model transformerowy (np. BERT lub RoBERTa). Dla każdego tokena wyodrębniana jest jego kontekstowa reprezentacja wektorowa (embedding).
2.  **Obliczanie podobieństwa kosinusowego**: Dla wszystkich par tokenów z obu tekstów obliczane jest podobieństwo kosinusowe i tworzona jest macierz podobieństwa tokenów<sup>[\[3\]](https://systems-analysis.info/int/BERTScore_(metric)_(PL)#cite_note-bertscore_explained-3)</sup>.
3.  **Obliczanie precyzji, pełności i miary F1**: Na podstawie macierzy podobieństwa dla każdego tokena w wygenerowanym tekście wyszukiwany jest najbardziej podobny token w tekście referencyjnym, co pozwala obliczyć **precyzję** (*precision*). Analogicznie, dla każdego tokena referencji wyszukiwany jest najbliższy token w wygenerowanym tekście, co daje **pełność** (*recall*). Końcową wartością BERTScore jest wyważona miara F₁, łącząca precyzję i pełność:

<!-- -->

       RextBERT=1|x|∑xi∈xmaxyj∈yxiTyj(extRecall)
       PextBERT=1|y|∑yj∈ymaxxi∈xxiTyj(extPrecision)
       FextBERT=2PextBERT⋅RextBERTPextBERT+RextBERT

Metryka jest elastyczna: można wybierać różne wstępnie wytrenowane modele, ważyć tokeny według ich ważności (za pomocą wag IDF) i liniowo przekształcać oceny w celu lepszej interpretowalności<sup>[\[3\]](https://systems-analysis.info/int/BERTScore_(metric)_(PL)#cite_note-bertscore_explained-3)</sup>.

## Zastosowanie i skuteczność

BERTScore jest stosowany do oceny jakości w różnych zadaniach generowania tekstu:

- **Tłumaczenie maszynowe**: Wykrywa zachowanie znaczenia, nawet jeśli konstrukcje tłumaczenia różnią się od wzorcowych.
- **Automatyczne streszczanie**: Potrafi określić, że różne sformułowania mogą przekazywać te same kluczowe fakty, co czyni go bardziej elastycznym niż ROUGE.
- **Systemy dialogowe**: Pomaga mierzyć trafność odpowiedzi, porównując ją z wzorcową na poziomie znaczenia.

Zakrojona na szeroką skalę ocena przeprowadzona przez autorów wykazała, że współczynnik korelacji BERTScore z ocenami ludzkimi jest **wyraźnie wyższy** niż w przypadku metryk typu BLEU i ROUGE. Ponadto metryka wykazała zwiększoną odporność na trudne przypadki parafrazowania<sup>[\[1\]](https://systems-analysis.info/int/BERTScore_(metric)_(PL)#cite_note-bertscore_paper-1)</sup>.

## Zalety

- **Uwzględnienie semantyki**: Porównuje teksty na poziomie znaczenia, biorąc pod uwagę synonimy i parafrazy.
- **Wysoka korelacja z oceną ludzką**: Oceny BERTScore lepiej zgadzają się z ludzkimi sądami o jakości tekstu niż tradycyjne metryki.
- **Uniwersalność i przenośność**: Metryka nie jest przywiązana do konkretnego języka ani zadania — wystarczy wybrać odpowiedni wstępnie wytrenowany model.
- **Brak konieczności trenowania**: BERTScore jest **metryką nieparametryczną**, w odróżnieniu od bardziej złożonych metryk (np. BLEURT), które wymagają wstępnego trenowania na korpusach ocen.
- **Integracja nowoczesnych modeli**: Wykorzystuje moc transformerów do wyodrębniania głębokich cech kontekstowych.

## Ograniczenia i krytyka

- **Wysokie koszty obliczeniowe**: Obliczenia oparte na embeddingach wymagają znacznie więcej zasobów niż liczenie n-gramów i często wymagają użycia GPU<sup>[\[2\]](https://systems-analysis.info/int/BERTScore_(metric)_(PL)#cite_note-analytics_vidhya-2)</sup>.
- **Zależność od modelu**: Jakość oceny jest bezpośrednio związana z jakością wstępnie wytrenowanego modelu. Wybór modelu i warstwy do wyodrębniania embeddingów wpływa na wynik, co może powodować problemy z odtwarzalnością<sup>[\[4\]](https://systems-analysis.info/int/BERTScore_(metric)_(PL)#cite_note-theseus_fi-4)</sup>.
- **Brak uwzględnienia faktów i struktury**: BERTScore koncentruje się na lokalnym podobieństwie semantycznym i nie gwarantuje rozumienia struktury tekstu ani dokładności faktycznej. Tekst z przestawionymi frazami lub błędami merytorycznymi może uzyskać wysoki wynik<sup>[\[3\]](https://systems-analysis.info/int/BERTScore_(metric)_(PL)#cite_note-bertscore_explained-3)</sup>.
- **Niska interpretowalność**: W odróżnieniu od BLEU/ROUGE wskaźnik BERTScore jest mniej przejrzysty, co utrudnia analizę błędów.
- **Odchylenia społeczne (bias)**: Metryka dziedziczy stereotypy i odchylenia wbudowane we wstępnie wytrenowane modele. Badanie z 2022 roku wykazało, że metryki oparte na LLM (w tym BERTScore) wykazują znacznie większy społeczny bias niż tradycyjne metryki<sup>[\[5\]](https://systems-analysis.info/int/BERTScore_(metric)_(PL)#cite_note-bertscore_unfair-5)</sup>.

## Znaczenie i rola w ocenie

BERTScore stanowi ważny krok w rozwoju metod oceny wygenerowanego tekstu, ponieważ pozwala uwzględniać równoważność znaczenia, a nie tylko dopasowania leksykalne. Mimo że żadna automatyczna metryka nie jest w stanie idealnie zmierzyć jakości tekstu, BERTScore ugruntował swoją pozycję jako niezawodne narzędzie, które uzupełnia klasyczne podejścia (takie jak BLEU i ROUGE), a nie zastępuje ich całkowicie.

W praktyce BERTScore jest często stosowany w połączeniu z ręczną ekspertyzą i innymi metrykami, aby uzyskać pełniejszy i głębszy obraz tego, jak skutecznie modele generują spójne i znaczeniowo adekwatne teksty<sup>[\[2\]](https://systems-analysis.info/int/BERTScore_(metric)_(PL)#cite_note-analytics_vidhya-2)</sup>.

## Odnośniki

- Oficjalne repozytorium BERTScore na GitHub

## Przypisy

1.  <span id="cite_note-bertscore_paper-1">↑ <sup>[1.0](https://systems-analysis.info/int/BERTScore_(metric)_(PL)#cite_ref-bertscore_paper_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/BERTScore_(metric)_(PL)#cite_ref-bertscore_paper_1-1)</sup> Zhang, Tianyi, et al. «BERTScore: Evaluating Text Generation with BERT». *arXiv:1904.09675* \[cs.CL\], 22 апр. 2019 г. <a href="https://arxiv.org/abs/1904.09675" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-analytics_vidhya-2">↑ <sup>[2.0](https://systems-analysis.info/int/BERTScore_(metric)_(PL)#cite_ref-analytics_vidhya_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/BERTScore_(metric)_(PL)#cite_ref-analytics_vidhya_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/BERTScore_(metric)_(PL)#cite_ref-analytics_vidhya_2-2)</sup> «BERTScore: New Metrics for Language Models». *Analytics Vidhya*. <a href="https://www.analyticsvidhya.com/blog/2025/04/bertscore-a-contextual-metric-for-llm-evaluation/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-bertscore_explained-3">↑ <sup>[3.0](https://systems-analysis.info/int/BERTScore_(metric)_(PL)#cite_ref-bertscore_explained_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/BERTScore_(metric)_(PL)#cite_ref-bertscore_explained_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/BERTScore_(metric)_(PL)#cite_ref-bertscore_explained_3-2)</sup> Sojasingarayar, Abonia. «BERTScore Explained in 5 minutes». *Medium*. <a href="https://medium.com/@abonia/bertscore-explained-in-5-minutes-0b98553bfb71" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-theseus_fi-4">[↑](https://systems-analysis.info/int/BERTScore_(metric)_(PL)#cite_ref-theseus_fi_4-0) Alakulju, D., et al. «Reproducibility of BERTScore». *Theseus.fi*. <a href="https://www.theseus.fi/bitstream/handle/10024/884189/Alakulju_Dkhili_Moufida.pdf?sequence=2&amp;isAllowed=y" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-bertscore_unfair-5">[↑](https://systems-analysis.info/int/BERTScore_(metric)_(PL)#cite_ref-bertscore_unfair_5-0) Peyrard, M., et al. «BERTScore is Unfair: On Social Bias in Language Model-Based Metrics for Text Generation». *arXiv:2210.07626* \[cs.CL\], 14 окт. 2022 г. <a href="https://arxiv.org/abs/2210.07626" class="external autonumber" rel="nofollow">[5]</a></span>
