BERTScore (metric) (CS)

From Systems analysis Wiki
Jump to navigation Jump to search

BERTScore — je automatická metrika pro hodnocení kvality generovaného textu, která měří sémantickou podobnost pomocí kontextuálních embeddingů z předtrénovaných jazykových modelů, jako je BERT. Metrika byla navržena v roce 2019 skupinou výzkumníků v čele s Tianyi Zhangem v práci „BERTScore: Evaluating Text Generation with BERT"[1].

Na rozdíl od tradičních metrik, jako jsou BLEU a ROUGE, které jsou založeny na přesné shodě n-gramů, umožňuje BERTScore odhalovat ekvivalenci významu i při odlišnosti slov a formulací, přičemž zohledňuje synonyma a parafrázování[2].

Metodika výpočtu

Metoda BERTScore se skládá z několika kroků:

  1. Získání kontextuálních embeddingů: Oba texty (referenční a generovaný) jsou rozděleny na tokeny a propuštěny přes předtrénovaný transformerový model (například BERT nebo RoBERTa). Pro každý token je extrahováno jeho kontextuální vektorové vyjádření (embedding).
  2. Výpočet kosinové podobnosti: Pro všechny páry tokenů z obou textů se vypočítá kosinová podobnost a vytvoří se matice podobnosti tokenů[3].
  3. Výpočet přesnosti, úplnosti a F1-míry: Na základě matice podobnosti se pro každý token v generovaném textu nalezne nejpodobnější token v referenčním textu, což umožňuje vypočítat přesnost (precision). Obdobně se pro každý token referenčního textu nalezne nejbližší token v generovaném textu, čímž se získá úplnost (recall). Výslednou hodnotou BERTScore je vyvážená F₁-míra, která kombinuje přesnost a úplnost:
   RextBERT=1|x|xixmaxyjyxiTyj(extRecall)
   PextBERT=1|y|yjymaxxixxiTyj(extPrecision)
   FextBERT=2PextBERTRextBERTPextBERT+RextBERT

Metrika je flexibilní: lze vybírat různé předtrénované modely, vážit tokeny podle jejich důležitosti (pomocí IDF vah) a lineárně transformovat skóre pro lepší interpretovatelnost[3].

Využití a efektivita

BERTScore se využívá k hodnocení kvality v různých úlohách generování textu:

  • Strojový překlad: Zachycuje zachování smyslu, i když se překladatelské konstrukce liší od referenčních.
  • Automatická sumarizace: Je schopen rozpoznat, že různé formulace mohou vyjadřovat stejné klíčové fakty, což jej činí flexibilnějším než ROUGE.
  • Dialogové systémy: Pomáhá měřit relevantnost odpovědi porovnáváním se vzorovou odpovědí na úrovni významu.

Rozsáhlé hodnocení provedené autory ukázalo, že korelační koeficient BERTScore s lidskými hodnoceními je výrazně vyšší než u metrik typu BLEU a ROUGE. Metrika navíc prokázala zvýšenou odolnost vůči obtížným případům parafrázování[1].

Výhody

  • Zohledňování sémantiky: Porovnává texty na úrovni významu, přičemž bere v úvahu synonyma a parafrázování.
  • Vysoká korelace s lidským hodnocením: Hodnocení BERTScore lépe odpovídají lidským úsudkům o kvalitě textu než tradiční metriky.
  • Univerzálnost a přenositelnost: Metrika není vázána na konkrétní jazyk nebo úlohu — stačí zvolit odpovídající předtrénovaný model.
  • Nevyžaduje trénování: BERTScore je netrénovaná metrika, na rozdíl od složitějších metrik (například BLEURT), které vyžadují předchozí trénování na hodnotících korpusech.
  • Integrace moderních modelů: Využívá sílu transformerů k extrakci hlubokých kontextuálních příznaků.

Omezení a kritika

  • Vysoké výpočetní nároky: Výpočet na základě embeddingů vyžaduje výrazně více zdrojů než počítání n-gramů a často vyžaduje použití GPU[2].
  • Závislost na modelu: Kvalita hodnocení přímo závisí na kvalitě předtrénovaného modelu. Volba modelu a vrstvy pro extrakci embeddingů ovlivňuje výsledek, což může způsobovat problémy s reprodukovatelností[4].
  • Nezohledňování faktů a struktury: BERTScore se zaměřuje na lokální sémantickou podobnost a nezaručuje porozumění struktuře textu ani faktické přesnosti. Text s přeházenými frázemi nebo faktickými chybami může obdržet vysoké skóre[3].
  • Nízká interpretovatelnost: Na rozdíl od BLEU/ROUGE je hodnota BERTScore méně průhledná, což ztěžuje analýzu chyb.
  • Společenské zkreslení (bias): Metrika přebírá stereotypy a zkreslení zakódovaná v předtrénovaných modelech. Studie z roku 2022 ukázala, že metriky založené na LLM (včetně BERTScore) vykazují výrazně vyšší společenský bias než tradiční metriky[5].

Význam a role v hodnocení

BERTScore představuje důležitý krok ve vývoji metod hodnocení generovaného textu, protože umožňuje zohledňovat sémantickou ekvivalenci, a nejen lexikální shody. Přestože žádná automatická metrika není schopna dokonale změřit kvalitu textu, BERTScore se osvědčil jako spolehlivý nástroj, který doplňuje klasické přístupy (jako jsou BLEU a ROUGE), ale zcela je nenahrazuje.

V praxi se BERTScore často používá v kombinaci s ruční expertízou a dalšími metrikami, aby bylo dosaženo úplnějšího a hlubšího přehledu o tom, jak úspěšně modely generují koherentní a sémanticky odpovídající texty[2].

Odkazy

  • Oficiální repozitář BERTScore na GitHubu

Poznámky

  1. 1.0 1.1 Zhang, Tianyi, et al. «BERTScore: Evaluating Text Generation with BERT». arXiv:1904.09675 [cs.CL], 22 апр. 2019 г. [1]
  2. 2.0 2.1 2.2 «BERTScore: New Metrics for Language Models». Analytics Vidhya. [2]
  3. 3.0 3.1 3.2 Sojasingarayar, Abonia. «BERTScore Explained in 5 minutes». Medium. [3]
  4. Alakulju, D., et al. «Reproducibility of BERTScore». Theseus.fi. [4]
  5. Peyrard, M., et al. «BERTScore is Unfair: On Social Bias in Language Model-Based Metrics for Text Generation». arXiv:2210.07626 [cs.CL], 14 окт. 2022 г. [5]