---
title: "BERTScore (metric) (CS)"
source: "https://systems-analysis.info/int/BERTScore_(metric)_(CS)"
wiki: "systems-analysis.info/int"
article: "BERTScore_(metric)_(CS)"
language: "cs"
categories:
  - "Category:Czech"
  - "Category:Large language models"
  - "Category:LLM evaluation"
  - "Category:Machine learning"
revision_id: 542
wiki_created_at: 2026-09-06T22:35:21Z
wiki_modified_at: 2026-09-06T22:35:21Z
downloaded_at: 2026-09-07T22:40:53Z
---

# BERTScore (metric) (CS)

**BERTScore** — je automatická metrika pro hodnocení kvality generovaného textu, která měří sémantickou podobnost pomocí kontextuálních embeddingů z předtrénovaných jazykových modelů, jako je BERT. Metrika byla navržena v roce 2019 skupinou výzkumníků v čele s **Tianyi Zhangem** v práci „BERTScore: Evaluating Text Generation with BERT"<sup>[\[1\]](https://systems-analysis.info/int/BERTScore_(metric)_(CS)#cite_note-bertscore_paper-1)</sup>.

Na rozdíl od tradičních metrik, jako jsou BLEU a ROUGE, které jsou založeny na přesné shodě n-gramů, umožňuje BERTScore odhalovat ekvivalenci významu i při odlišnosti slov a formulací, přičemž zohledňuje synonyma a parafrázování<sup>[\[2\]](https://systems-analysis.info/int/BERTScore_(metric)_(CS)#cite_note-analytics_vidhya-2)</sup>.

## Metodika výpočtu

Metoda BERTScore se skládá z několika kroků:

1.  **Získání kontextuálních embeddingů**: Oba texty (referenční a generovaný) jsou rozděleny na tokeny a propuštěny přes předtrénovaný transformerový model (například BERT nebo RoBERTa). Pro každý token je extrahováno jeho kontextuální vektorové vyjádření (embedding).
2.  **Výpočet kosinové podobnosti**: Pro všechny páry tokenů z obou textů se vypočítá kosinová podobnost a vytvoří se matice podobnosti tokenů<sup>[\[3\]](https://systems-analysis.info/int/BERTScore_(metric)_(CS)#cite_note-bertscore_explained-3)</sup>.
3.  **Výpočet přesnosti, úplnosti a F1-míry**: Na základě matice podobnosti se pro každý token v generovaném textu nalezne nejpodobnější token v referenčním textu, což umožňuje vypočítat **přesnost** (*precision*). Obdobně se pro každý token referenčního textu nalezne nejbližší token v generovaném textu, čímž se získá **úplnost** (*recall*). Výslednou hodnotou BERTScore je vyvážená F₁-míra, která kombinuje přesnost a úplnost:

<!-- -->

       RextBERT=1|x|∑xi∈xmaxyj∈yxiTyj(extRecall)
       PextBERT=1|y|∑yj∈ymaxxi∈xxiTyj(extPrecision)
       FextBERT=2PextBERT⋅RextBERTPextBERT+RextBERT

Metrika je flexibilní: lze vybírat různé předtrénované modely, vážit tokeny podle jejich důležitosti (pomocí IDF vah) a lineárně transformovat skóre pro lepší interpretovatelnost<sup>[\[3\]](https://systems-analysis.info/int/BERTScore_(metric)_(CS)#cite_note-bertscore_explained-3)</sup>.

## Využití a efektivita

BERTScore se využívá k hodnocení kvality v různých úlohách generování textu:

- **Strojový překlad**: Zachycuje zachování smyslu, i když se překladatelské konstrukce liší od referenčních.
- **Automatická sumarizace**: Je schopen rozpoznat, že různé formulace mohou vyjadřovat stejné klíčové fakty, což jej činí flexibilnějším než ROUGE.
- **Dialogové systémy**: Pomáhá měřit relevantnost odpovědi porovnáváním se vzorovou odpovědí na úrovni významu.

Rozsáhlé hodnocení provedené autory ukázalo, že korelační koeficient BERTScore s lidskými hodnoceními je **výrazně vyšší** než u metrik typu BLEU a ROUGE. Metrika navíc prokázala zvýšenou odolnost vůči obtížným případům parafrázování<sup>[\[1\]](https://systems-analysis.info/int/BERTScore_(metric)_(CS)#cite_note-bertscore_paper-1)</sup>.

## Výhody

- **Zohledňování sémantiky**: Porovnává texty na úrovni významu, přičemž bere v úvahu synonyma a parafrázování.
- **Vysoká korelace s lidským hodnocením**: Hodnocení BERTScore lépe odpovídají lidským úsudkům o kvalitě textu než tradiční metriky.
- **Univerzálnost a přenositelnost**: Metrika není vázána na konkrétní jazyk nebo úlohu — stačí zvolit odpovídající předtrénovaný model.
- **Nevyžaduje trénování**: BERTScore je **netrénovaná metrika**, na rozdíl od složitějších metrik (například BLEURT), které vyžadují předchozí trénování na hodnotících korpusech.
- **Integrace moderních modelů**: Využívá sílu transformerů k extrakci hlubokých kontextuálních příznaků.

## Omezení a kritika

- **Vysoké výpočetní nároky**: Výpočet na základě embeddingů vyžaduje výrazně více zdrojů než počítání n-gramů a často vyžaduje použití GPU<sup>[\[2\]](https://systems-analysis.info/int/BERTScore_(metric)_(CS)#cite_note-analytics_vidhya-2)</sup>.
- **Závislost na modelu**: Kvalita hodnocení přímo závisí na kvalitě předtrénovaného modelu. Volba modelu a vrstvy pro extrakci embeddingů ovlivňuje výsledek, což může způsobovat problémy s reprodukovatelností<sup>[\[4\]](https://systems-analysis.info/int/BERTScore_(metric)_(CS)#cite_note-theseus_fi-4)</sup>.
- **Nezohledňování faktů a struktury**: BERTScore se zaměřuje na lokální sémantickou podobnost a nezaručuje porozumění struktuře textu ani faktické přesnosti. Text s přeházenými frázemi nebo faktickými chybami může obdržet vysoké skóre<sup>[\[3\]](https://systems-analysis.info/int/BERTScore_(metric)_(CS)#cite_note-bertscore_explained-3)</sup>.
- **Nízká interpretovatelnost**: Na rozdíl od BLEU/ROUGE je hodnota BERTScore méně průhledná, což ztěžuje analýzu chyb.
- **Společenské zkreslení (bias)**: Metrika přebírá stereotypy a zkreslení zakódovaná v předtrénovaných modelech. Studie z roku 2022 ukázala, že metriky založené na LLM (včetně BERTScore) vykazují výrazně vyšší společenský bias než tradiční metriky<sup>[\[5\]](https://systems-analysis.info/int/BERTScore_(metric)_(CS)#cite_note-bertscore_unfair-5)</sup>.

## Význam a role v hodnocení

BERTScore představuje důležitý krok ve vývoji metod hodnocení generovaného textu, protože umožňuje zohledňovat sémantickou ekvivalenci, a nejen lexikální shody. Přestože žádná automatická metrika není schopna dokonale změřit kvalitu textu, BERTScore se osvědčil jako spolehlivý nástroj, který doplňuje klasické přístupy (jako jsou BLEU a ROUGE), ale zcela je nenahrazuje.

V praxi se BERTScore často používá v kombinaci s ruční expertízou a dalšími metrikami, aby bylo dosaženo úplnějšího a hlubšího přehledu o tom, jak úspěšně modely generují koherentní a sémanticky odpovídající texty<sup>[\[2\]](https://systems-analysis.info/int/BERTScore_(metric)_(CS)#cite_note-analytics_vidhya-2)</sup>.

## Odkazy

- Oficiální repozitář BERTScore na GitHubu

## Poznámky

1.  <span id="cite_note-bertscore_paper-1">↑ <sup>[1.0](https://systems-analysis.info/int/BERTScore_(metric)_(CS)#cite_ref-bertscore_paper_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/BERTScore_(metric)_(CS)#cite_ref-bertscore_paper_1-1)</sup> Zhang, Tianyi, et al. «BERTScore: Evaluating Text Generation with BERT». *arXiv:1904.09675* \[cs.CL\], 22 апр. 2019 г. <a href="https://arxiv.org/abs/1904.09675" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-analytics_vidhya-2">↑ <sup>[2.0](https://systems-analysis.info/int/BERTScore_(metric)_(CS)#cite_ref-analytics_vidhya_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/BERTScore_(metric)_(CS)#cite_ref-analytics_vidhya_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/BERTScore_(metric)_(CS)#cite_ref-analytics_vidhya_2-2)</sup> «BERTScore: New Metrics for Language Models». *Analytics Vidhya*. <a href="https://www.analyticsvidhya.com/blog/2025/04/bertscore-a-contextual-metric-for-llm-evaluation/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-bertscore_explained-3">↑ <sup>[3.0](https://systems-analysis.info/int/BERTScore_(metric)_(CS)#cite_ref-bertscore_explained_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/BERTScore_(metric)_(CS)#cite_ref-bertscore_explained_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/BERTScore_(metric)_(CS)#cite_ref-bertscore_explained_3-2)</sup> Sojasingarayar, Abonia. «BERTScore Explained in 5 minutes». *Medium*. <a href="https://medium.com/@abonia/bertscore-explained-in-5-minutes-0b98553bfb71" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-theseus_fi-4">[↑](https://systems-analysis.info/int/BERTScore_(metric)_(CS)#cite_ref-theseus_fi_4-0) Alakulju, D., et al. «Reproducibility of BERTScore». *Theseus.fi*. <a href="https://www.theseus.fi/bitstream/handle/10024/884189/Alakulju_Dkhili_Moufida.pdf?sequence=2&amp;isAllowed=y" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-bertscore_unfair-5">[↑](https://systems-analysis.info/int/BERTScore_(metric)_(CS)#cite_ref-bertscore_unfair_5-0) Peyrard, M., et al. «BERTScore is Unfair: On Social Bias in Language Model-Based Metrics for Text Generation». *arXiv:2210.07626* \[cs.CL\], 14 окт. 2022 г. <a href="https://arxiv.org/abs/2210.07626" class="external autonumber" rel="nofollow">[5]</a></span>
