BERTScore (metric) (CS)
BERTScore — je automatická metrika pro hodnocení kvality generovaného textu, která měří sémantickou podobnost pomocí kontextuálních embeddingů z předtrénovaných jazykových modelů, jako je BERT. Metrika byla navržena v roce 2019 skupinou výzkumníků v čele s Tianyi Zhangem v práci „BERTScore: Evaluating Text Generation with BERT"[1].
Na rozdíl od tradičních metrik, jako jsou BLEU a ROUGE, které jsou založeny na přesné shodě n-gramů, umožňuje BERTScore odhalovat ekvivalenci významu i při odlišnosti slov a formulací, přičemž zohledňuje synonyma a parafrázování[2].
Metodika výpočtu
Metoda BERTScore se skládá z několika kroků:
- Získání kontextuálních embeddingů: Oba texty (referenční a generovaný) jsou rozděleny na tokeny a propuštěny přes předtrénovaný transformerový model (například BERT nebo RoBERTa). Pro každý token je extrahováno jeho kontextuální vektorové vyjádření (embedding).
- Výpočet kosinové podobnosti: Pro všechny páry tokenů z obou textů se vypočítá kosinová podobnost a vytvoří se matice podobnosti tokenů[3].
- Výpočet přesnosti, úplnosti a F1-míry: Na základě matice podobnosti se pro každý token v generovaném textu nalezne nejpodobnější token v referenčním textu, což umožňuje vypočítat přesnost (precision). Obdobně se pro každý token referenčního textu nalezne nejbližší token v generovaném textu, čímž se získá úplnost (recall). Výslednou hodnotou BERTScore je vyvážená F₁-míra, která kombinuje přesnost a úplnost:
Metrika je flexibilní: lze vybírat různé předtrénované modely, vážit tokeny podle jejich důležitosti (pomocí IDF vah) a lineárně transformovat skóre pro lepší interpretovatelnost[3].
Využití a efektivita
BERTScore se využívá k hodnocení kvality v různých úlohách generování textu:
- Strojový překlad: Zachycuje zachování smyslu, i když se překladatelské konstrukce liší od referenčních.
- Automatická sumarizace: Je schopen rozpoznat, že různé formulace mohou vyjadřovat stejné klíčové fakty, což jej činí flexibilnějším než ROUGE.
- Dialogové systémy: Pomáhá měřit relevantnost odpovědi porovnáváním se vzorovou odpovědí na úrovni významu.
Rozsáhlé hodnocení provedené autory ukázalo, že korelační koeficient BERTScore s lidskými hodnoceními je výrazně vyšší než u metrik typu BLEU a ROUGE. Metrika navíc prokázala zvýšenou odolnost vůči obtížným případům parafrázování[1].
Výhody
- Zohledňování sémantiky: Porovnává texty na úrovni významu, přičemž bere v úvahu synonyma a parafrázování.
- Vysoká korelace s lidským hodnocením: Hodnocení BERTScore lépe odpovídají lidským úsudkům o kvalitě textu než tradiční metriky.
- Univerzálnost a přenositelnost: Metrika není vázána na konkrétní jazyk nebo úlohu — stačí zvolit odpovídající předtrénovaný model.
- Nevyžaduje trénování: BERTScore je netrénovaná metrika, na rozdíl od složitějších metrik (například BLEURT), které vyžadují předchozí trénování na hodnotících korpusech.
- Integrace moderních modelů: Využívá sílu transformerů k extrakci hlubokých kontextuálních příznaků.
Omezení a kritika
- Vysoké výpočetní nároky: Výpočet na základě embeddingů vyžaduje výrazně více zdrojů než počítání n-gramů a často vyžaduje použití GPU[2].
- Závislost na modelu: Kvalita hodnocení přímo závisí na kvalitě předtrénovaného modelu. Volba modelu a vrstvy pro extrakci embeddingů ovlivňuje výsledek, což může způsobovat problémy s reprodukovatelností[4].
- Nezohledňování faktů a struktury: BERTScore se zaměřuje na lokální sémantickou podobnost a nezaručuje porozumění struktuře textu ani faktické přesnosti. Text s přeházenými frázemi nebo faktickými chybami může obdržet vysoké skóre[3].
- Nízká interpretovatelnost: Na rozdíl od BLEU/ROUGE je hodnota BERTScore méně průhledná, což ztěžuje analýzu chyb.
- Společenské zkreslení (bias): Metrika přebírá stereotypy a zkreslení zakódovaná v předtrénovaných modelech. Studie z roku 2022 ukázala, že metriky založené na LLM (včetně BERTScore) vykazují výrazně vyšší společenský bias než tradiční metriky[5].
Význam a role v hodnocení
BERTScore představuje důležitý krok ve vývoji metod hodnocení generovaného textu, protože umožňuje zohledňovat sémantickou ekvivalenci, a nejen lexikální shody. Přestože žádná automatická metrika není schopna dokonale změřit kvalitu textu, BERTScore se osvědčil jako spolehlivý nástroj, který doplňuje klasické přístupy (jako jsou BLEU a ROUGE), ale zcela je nenahrazuje.
V praxi se BERTScore často používá v kombinaci s ruční expertízou a dalšími metrikami, aby bylo dosaženo úplnějšího a hlubšího přehledu o tom, jak úspěšně modely generují koherentní a sémanticky odpovídající texty[2].
Odkazy
- Oficiální repozitář BERTScore na GitHubu
Poznámky
- ↑ 1.0 1.1 Zhang, Tianyi, et al. «BERTScore: Evaluating Text Generation with BERT». arXiv:1904.09675 [cs.CL], 22 апр. 2019 г. [1]
- ↑ 2.0 2.1 2.2 «BERTScore: New Metrics for Language Models». Analytics Vidhya. [2]
- ↑ 3.0 3.1 3.2 Sojasingarayar, Abonia. «BERTScore Explained in 5 minutes». Medium. [3]
- ↑ Alakulju, D., et al. «Reproducibility of BERTScore». Theseus.fi. [4]
- ↑ Peyrard, M., et al. «BERTScore is Unfair: On Social Bias in Language Model-Based Metrics for Text Generation». arXiv:2210.07626 [cs.CL], 14 окт. 2022 г. [5]