ROUGE (metric) (CS)

From Systems analysis Wiki
Jump to navigation Jump to search

ROUGE (akronym z angl. Recall-Oriented Understudy for Gisting Evaluation — „Náhradní hodnotitel pro sumarizaci orientovaný na úplnost") — je sada automatických metrik pro hodnocení kvality textových shrnutí (resumé) generovaných systémy. Hodnocení se provádí porovnáním automaticky vygenerovaného shrnutí s jedním nebo více vzorovými (referenčními) shrnutími vytvořenými lidmi[1].

Metrika byla původně vyvinuta pro úlohy automatického resumování textu, avšak využívá se také při hodnocení kvality strojového překladu. Na rozdíl od metriky BLEU, která hodnotí přesnost (precision), se ROUGE zaměřuje na úplnost (recall) — ukazuje, jaká část významných fragmentů z referenčního shrnutí byla reprodukována v generovaném textu.

Sada metrik ROUGE byla navržena v roce 2004 výzkumníkem Chin-Yewem Linem (Chin-Yew Lin) z Institutu informačních věd Univerzity Jižní Kalifornie[2]. Metriky ROUGE se staly de facto standardem pro hodnocení algoritmů sumarizace, zejména po jejich použití na velkých soutěžích, jako je DUC (Document Understanding Conference).

Základní varianty metrik ROUGE

Rodina ROUGE zahrnuje několik příbuzných metrik, z nichž každá měří překryv obsahu podle různých kritérií[3]:

  • ROUGE-N: Měří překryv n-gramů (sekvencí n slov).
    • ROUGE-1 vypočítává překryv unigramů (jednotlivých slov).
    • ROUGE-2 vypočítává překryv bigramů (dvojic po sobě jdoucích slov).
  • ROUGE-L: Je založena na nejdelší společné podsekvenci (Longest Common Subsequence, LCS) mezi generovaným a referenčním shrnutím. Tato metrika zohledňuje shodu na úrovni struktury věty, protože měří nejdelší sekvenci slov vyskytujících se ve stejném pořadí, avšak ne nutně za sebou.
  • ROUGE-W: Modifikace ROUGE-L (Weighted LCS), která přiřazuje větší váhu těm společným podsekvencím, jež se skládají z po sobě jdoucích slov, čímž podporuje nepřetržitou shodu frází.
  • ROUGE-S a ROUGE-SU: Metriky založené na shodě přeskočených bigramů (skip-bigrams). Přeskočený bigram je libovolný pár slov vyskytující se v obou textech ve stejném pořadí, avšak ne nutně za sebou. To umožňuje zohledňovat shody s mezerami mezi slovy.
    • ROUGE-SU je rozšířením ROUGE-S, které zohledňuje také shodu unigramů, aby se zabránilo nulovému skóre pro shrnutí bez shodných dvojic slov.

Každá z metrik může být vypočítána z hlediska úplnosti (recall), přesnosti (precision) nebo jejich harmonického průměru (F-míra). Tradičně se u úloh sumarizace klade důraz na úplnost (ROUGE-N recall), protože je důležité, aby model extrahoval co nejvíce klíčových informací ze zdrojového textu.

Využití a význam

Metriky ROUGE se staly standardním nástrojem pro objektivní hodnocení algoritmů sumarizace. Od poloviny 2000-tých let prakticky všechny soutěže v automatickém resumování (například DUC a TAC) používaly ROUGE pro řazení systémů. Popularita metriky je vysvětlena její jednoduchostí a prokázanou účinností: překryv n-gramů se ukázal jako dostatečně spolehlivý ukazatel pro vyjádření obsahu shrnutí.

S příchodem neuronových modelů a LLM role ROUGE přetrvala, avšak interpretace se stala složitější. Moderní modely generují tak kvalitní shrnutí, že tradiční metriky mohou dosáhnout „stropu" a špatně rozlišovat nuance kvality, což podnítilo vývoj nových metod hodnocení[4].

Omezení a kritika

Navzdory popularitě má ROUGE známá omezení:

  • Povrchní charakter: Metrika se opírá pouze o lexikální shodu a není schopna hodnotit sémantickou ekvivalenci. Může podhodnotit dobré shrnutí, pokud v něm jsou použita synonyma nebo přeformulování.
  • Ignorování kvality textu: ROUGE nehodnotí gramatickou správnost, soudržnost ani čitelnost textu. Model může získat vysoké skóre pouhým opakováním důležitých fragmentů z referenčního shrnutí, i když výsledný text není soudržný.
  • Závislost na referenčním shrnutí: Kvalita hodnocení přímo závisí na kvalitě a úplnosti referenčního shrnutí. Pokud je vzorové shrnutí napsáno špatně, hodnocení bude nespolehlivé.
  • Absence hodnocení faktů: Metrika není schopna ověřit faktickou přesnost. Shrnutí může získat vysoké skóre ROUGE, ale obsahovat nesprávné fakty, pokud byly zkopírovány ze zdroje, a nikoli z referenčního shrnutí.

Alternativy a moderní přístupy

Omezení ROUGE podnítila vývoj alternativních metod hodnocení:

  • Sémanticky orientované metriky: Snaží se měřit podobnost na úrovni významu, nikoli přesné shody slov. Příklady zahrnují BERTScore, který porovnává vektorové reprezentace (embeddingy) generovaného a referenčního textu.
  • Kombinované metriky: Spojují lexikální a sémantická kritéria. Například přístup ROUGE-SEM doplňuje klasické ROUGE modulem sémantické podobnosti na základě embeddingů, aby lépe hodnotil přeformulované texty[5].
  • Metriky na bázi LLM: Moderní přístupy, při nichž jsou výkonné modely (například GPT) využívány v roli „soudce" pro hodnocení kvality shrnutí podle několika kritérií, čímž napodobují odborné hodnocení člověkem.

Závěrem lze říci, že ROUGE se osvědčila jako jednoduchý a účinný nástroj pro hodnocení automatických sumarizací. Navzdory vzniku složitějších metrik zůstává ROUGE se všemi svými nedostatky nezbytným základním nástrojem v arzenálu výzkumníků NLP.

Odkazy

  • Původní článek Chin-Yewa Lina o ROUGE (2004)

Poznámky

  1. «ROUGE (metric)». Wikipedia. [1]
  2. Lin, Chin-Yew. «ROUGE: A Package for Automatic Evaluation of Summaries». Proceedings of the ACL-04 Workshop on Text Summarization Branches Out, 2004. [2]
  3. «ROUGE (Recall-Oriented Understudy for Gisting Evaluation) Performance Metric». GM-RKB. [3]
  4. Deutsch, Daniel, and Rotem Dror. «A Statistical Analysis of Summarization Evaluation Metrics». Transactions of the Association for Computational Linguistics, vol. 9, 2021, pp. 495-508. [4]
  5. Zhang, M., et al. «ROUGE-SEM: Better evaluation of summarization using ROUGE combined with semantics». Expert Systems with Applications, vol. 237, 2024, p. 121364. [5]