---
title: "ROUGE (metric) (PL)"
source: "https://systems-analysis.info/int/ROUGE_(metric)_(PL)"
wiki: "systems-analysis.info/int"
article: "ROUGE_(metric)_(PL)"
language: "pl"
categories:
  - "Category:Large language models"
  - "Category:LLM evaluation"
  - "Category:Machine learning"
  - "Category:Polish"
revision_id: 6138
wiki_created_at: 2026-09-06T23:58:51Z
wiki_modified_at: 2026-09-06T23:58:51Z
downloaded_at: 2026-09-07T23:12:16Z
---

# ROUGE (metric) (PL)

**ROUGE** (akronim od ang. *Recall-Oriented Understudy for Gisting Evaluation* — „Zastępczy oceniacz do streszczania, zorientowany na pełność") — to zestaw automatycznych metryk służących do oceny jakości streszczeń tekstowych generowanych przez systemy. Ocena jest przeprowadzana poprzez porównanie automatycznie wygenerowanego streszczenia z jednym lub kilkoma wzorcowymi (referencyjnymi) streszczeniami stworzonymi przez ludzi<sup>[\[1\]](https://systems-analysis.info/int/ROUGE_(metric)_(PL)#cite_note-wiki_rouge-1)</sup>.

Początkow metrika została opracowana dla zadań automatycznego streszczania tekstu, jednak jest również stosowana w ocenie jakości tłumaczenia maszynowego. W odróżnieniu od metryki BLEU, która ocenia dokładność (precision), ROUGE koncentruje się na **pełności** (*recall*) — pokazuje, jaka część istotnych fragmentów z wzorcowego streszczenia została odtworzona w wygenerowanym tekście.

Zestaw metryk ROUGE został zaproponowany w 2004 roku przez badacza **Chin-Yew Lina** (Chin-Yew Lin) z Instytutu Nauk Informacyjnych Uniwersytetu Południowej Kalifornii<sup>[\[2\]](https://systems-analysis.info/int/ROUGE_(metric)_(PL)#cite_note-lin_2004-2)</sup>. Metryki ROUGE stały się de facto standardem oceny algorytmów streszczania, zwłaszcza po ich zastosowaniu na dużych konkursach, takich jak DUC (*Document Understanding Conference*).

## Podstawowe warianty metryk ROUGE

Rodzina ROUGE obejmuje kilka powiązanych metryk, z których każda mierzy pokrycie treści według różnych kryteriów<sup>[\[3\]](https://systems-analysis.info/int/ROUGE_(metric)_(PL)#cite_note-gm_rkb-3)</sup>:

- **ROUGE-N**: Mierzy pokrycie pod względem n-gramów (sekwencji *n* słów).
  - **ROUGE-1** oblicza pokrycie unigramów (pojedynczych słów).
  - **ROUGE-2** oblicza pokrycie bigramów (par kolejnych słów).

<!-- -->

- **ROUGE-L**: Opiera się na **najdłuższej wspólnej podciągu** (*Longest Common Subsequence*, LCS) między wygenerowanym a wzorcowym streszczeniem. Metryka ta uwzględnia zgodność na poziomie struktury zdania, ponieważ mierzy najdłuższą sekwencję słów występujących w tej samej kolejności, lecz niekoniecznie bezpośrednio po sobie.

<!-- -->

- **ROUGE-W**: Modyfikacja ROUGE-L (*Weighted LCS*), która przypisuje większą wagę tym wspólnym podciągom, które składają się ze słów następujących bezpośrednio po sobie, nagradzając ciągłe dopasowanie fraz.

<!-- -->

- **ROUGE-S** i **ROUGE-SU**: Metryki oparte na dopasowaniu **bigramów z pominięciem** (*skip-bigrams*). Bigramem z pominięciem jest dowolna para słów występująca w obu tekstach w tej samej kolejności, lecz niekoniecznie sąsiadująca. Pozwala to uwzględniać dopasowania z przerwami między słowami.
  - **ROUGE-SU** jest rozszerzeniem ROUGE-S, które uwzględnia również dopasowanie unigramów, aby uniknąć zerowej oceny dla streszczeń bez dopasowanych par słów.

Każda z metryk może być obliczana w kategoriach pełności (*recall*), dokładności (*precision*) lub ich średniej harmonicznej (miara F). Tradycyjnie w zadaniach streszczania nacisk kładzie się na **pełność** (ROUGE-N recall), ponieważ ważne jest, aby model wydobył jak najwięcej kluczowych informacji z tekstu źródłowego.

## Zastosowanie i znaczenie

Metryki ROUGE stały się standardowym narzędziem do obiektywnej oceny algorytmów streszczania. Począwszy od połowy lat 2000. praktycznie wszystkie konkursy dotyczące automatycznego streszczania (np. DUC i TAC) wykorzystywały ROUGE do rankingowania systemów. Popularność metryki wynika z jej prostoty i udowodnionej skuteczności: pokrycie n-gramów okazało się wystarczająco wiarygodnym wskaźnikiem odzwierciedlającym treść streszczenia.

Po pojawieniu się modeli sieci neuronowych i LLM rola ROUGE utrzymała się, jednak interpretacja stała się bardziej złożona. Nowoczesne modele generują streszczenia o tak wysokiej jakości, że tradycyjne metryki mogą osiągać „sufit" i słabo rozróżniać niuanse jakości, co pobudziło do opracowania nowych metod oceny<sup>[\[4\]](https://systems-analysis.info/int/ROUGE_(metric)_(PL)#cite_note-tacl_2021-4)</sup>.

## Ograniczenia i krytyka

Pomimo popularności ROUGE posiada znane ograniczenia:

- **Powierzchowny charakter**: Metryka opiera się wyłącznie na dopasowaniu leksykalnym i nie jest w stanie ocenić równoważności semantycznej. Może zaniżyć ocenę dobrego streszczenia, jeśli zostały w nim użyte synonimy lub parafrazy.
- **Ignorowanie jakości tekstu**: ROUGE nie ocenia poprawności gramatycznej, spójności ani czytelności tekstu. Model może uzyskać wysoki wynik, po prostu powtarzając ważne fragmenty ze wzorca, nawet jeśli wynikowy tekst jest niespójny.
- **Zależność od wzorcowego streszczenia**: Jakość oceny bezpośrednio zależy od jakości i kompletności streszczenia referencyjnego. Jeśli wzorzec jest napisany słabo, ocena będzie mało wiarygodna.
- **Brak oceny faktów**: Metryka nie jest w stanie zweryfikować faktycznej dokładności. Streszczenie może uzyskać wysoki wynik ROUGE, ale zawierać błędne fakty, jeśli zostały one skopiowane ze źródła, a nie z wzorca.

## Alternatywy i nowoczesne podejścia

Ograniczenia ROUGE skłoniły do opracowania alternatywnych metod oceny:

- **Metryki zorientowane semantycznie**: Starają się mierzyć podobieństwo na poziomie znaczenia, a nie dokładnego dopasowania słów. Przykłady obejmują **BERTScore**, który porównuje reprezentacje wektorowe (embeddingi) wygenerowanego i wzorcowego tekstu.
- **Metryki kombinowane**: Łączą kryteria leksykalne i semantyczne. Na przykład podejście **ROUGE-SEM** uzupełnia klasyczny ROUGE modułem podobieństwa semantycznego opartego na embeddingach, aby lepiej oceniać sparafrazowane teksty<sup>[\[5\]](https://systems-analysis.info/int/ROUGE_(metric)_(PL)#cite_note-rouge_sem-5)</sup>.
- **Metryki oparte na LLM**: Nowoczesne podejścia, w których potężne modele (np. GPT) pełnią rolę „sędziego" oceniającego jakość streszczeń według kilku kryteriów, naśladując ekspercką ocenę człowieka.

Podsumowując, ROUGE ugruntowała swoją pozycję jako proste i skuteczne narzędzie do oceny automatycznych streszczeń. Pomimo pojawienia się bardziej zaawansowanych metryk, ROUGE — przy wszystkich swoich wadach — pozostaje nieodzownym podstawowym narzędziem w arsenale badaczy NLP.

## Odnośniki

- Oryginalna praca Chin-Yew Lina o ROUGE (2004)

## Przypisy

1.  <span id="cite_note-wiki_rouge-1">[↑](https://systems-analysis.info/int/ROUGE_(metric)_(PL)#cite_ref-wiki_rouge_1-0) «ROUGE (metric)». *Wikipedia*. <a href="https://en.wikipedia.org/wiki/ROUGE_(metric)" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-lin_2004-2">[↑](https://systems-analysis.info/int/ROUGE_(metric)_(PL)#cite_ref-lin_2004_2-0) Lin, Chin-Yew. «ROUGE: A Package for Automatic Evaluation of Summaries». *Proceedings of the ACL-04 Workshop on Text Summarization Branches Out*, 2004. <a href="https://aclanthology.org/W04-1013.pdf" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-gm_rkb-3">[↑](https://systems-analysis.info/int/ROUGE_(metric)_(PL)#cite_ref-gm_rkb_3-0) «ROUGE (Recall-Oriented Understudy for Gisting Evaluation) Performance Metric». *GM-RKB*. <a href="http://www.gabormelli.com/RKB/ROUGE_(Recall-Oriented_Understudy_for_Gisting_Evaluation)_Performance_Metric" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-tacl_2021-4">[↑](https://systems-analysis.info/int/ROUGE_(metric)_(PL)#cite_ref-tacl_2021_4-0) Deutsch, Daniel, and Rotem Dror. «A Statistical Analysis of Summarization Evaluation Metrics». *Transactions of the Association for Computational Linguistics*, vol. 9, 2021, pp. 495-508. <a href="https://aclanthology.org/anthology-files/anthology-files/pdf/tacl/2021.tacl-1.24.pdf" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-rouge_sem-5">[↑](https://systems-analysis.info/int/ROUGE_(metric)_(PL)#cite_ref-rouge_sem_5-0) Zhang, M., et al. «ROUGE-SEM: Better evaluation of summarization using ROUGE combined with semantics». *Expert Systems with Applications*, vol. 237, 2024, p. 121364. <a href="https://github.com/zhangming-19/ROUGE-SEM" class="external autonumber" rel="nofollow">[5]</a></span>
