---
title: "ROUGE (metric) (HU)"
source: "https://systems-analysis.info/int/ROUGE_(metric)_(HU)"
wiki: "systems-analysis.info/int"
article: "ROUGE_(metric)_(HU)"
language: "hu"
categories:
  - "Category:Hungarian"
  - "Category:Large language models"
  - "Category:LLM evaluation"
  - "Category:Machine learning"
revision_id: 6133
wiki_created_at: 2026-09-06T23:58:47Z
wiki_modified_at: 2026-09-06T23:58:47Z
downloaded_at: 2026-09-07T23:12:15Z
---

# ROUGE (metric) (HU)

**ROUGE** (a *Recall-Oriented Understudy for Gisting Evaluation* angol kifejezés rövidítése — „Teljességre orientált helyettesítő értékelő szövegösszefoglaláshoz") — automatikus metrikák gyűjteménye, amelyet a rendszerek által generált szöveges összefoglalók (kivonatok) minőségének értékelésére használnak. Az értékelés az automatikusan generált összefoglaló összehasonlításával történik egy vagy több, emberek által készített referencia-összefoglalóval<sup>[\[1\]](https://systems-analysis.info/int/ROUGE_(metric)_(HU)#cite_note-wiki_rouge-1)</sup>.

A metrikát eredetileg automatikus szöveg-összefoglalási feladatokhoz fejlesztették ki, azonban gépi fordítás minőségének értékelésére is alkalmazzák. A BLEU metrikával ellentétben, amely a pontosságot (precision) méri, a ROUGE a **teljességre** (*recall*) összpontosít — azt mutatja meg, hogy a referencia-összefoglaló jelentős töredékeinek mekkora hányada jelenik meg a generált szövegben.

A ROUGE metrikagyűjteményt 2004-ben javasolta **Chin-Yew Lin** kutató a Dél-Kaliforniai Egyetem Információtudományi Intézetéből<sup>[\[2\]](https://systems-analysis.info/int/ROUGE_(metric)_(HU)#cite_note-lin_2004-2)</sup>. A ROUGE metrikák de facto szabvánnyá váltak az összefoglalási algoritmusok értékelésében, különösen azután, hogy olyan nagy versenyeken kezdték alkalmazni őket, mint a DUC (*Document Understanding Conference*).

## A ROUGE metrikák fő változatai

A ROUGE-család több kapcsolódó metrikát tartalmaz, amelyek mindegyike különböző szempontok szerint méri a tartalmi átfedést<sup>[\[3\]](https://systems-analysis.info/int/ROUGE_(metric)_(HU)#cite_note-gm_rkb-3)</sup>:

- **ROUGE-N**: Az n-gram (*n* szóból álló szekvenciák) szerinti átfedést méri.
  - A **ROUGE-1** az unigramok (egyes szavak) átfedését számítja.
  - A **ROUGE-2** a bigramok (egymást követő szópárok) átfedését számítja.

<!-- -->

- **ROUGE-L**: A generált és a referencia-összefoglaló közötti **leghosszabb közös részsorozaton** (*Longest Common Subsequence*, LCS) alapul. Ez a metrika a mondatszerkezet szintjén méri az egyezést, mivel azt a leghosszabb szószekvenciát méri, amely azonos sorrendben szerepel, de nem feltétlenül egymás után.

<!-- -->

- **ROUGE-W**: A ROUGE-L módosítása (*Weighted LCS*), amely nagyobb súlyt ad azoknak a közös részsorozatoknak, amelyek egymást követő szavakból állnak, ezzel ösztönözve a folytonos frázisegyezést.

<!-- -->

- **ROUGE-S** és **ROUGE-SU**: **Kihagyott bigramokon** (*skip-bigrams*) alapuló egyezési metrikák. A kihagyott bigram bármely szópár, amely mindkét szövegben azonos sorrendben szerepel, de nem feltétlenül egymás után. Ez lehetővé teszi a szavak közötti kihagyásokat tartalmazó egyezések figyelembevételét.
  - A **ROUGE-SU** a ROUGE-S kiterjesztése, amely az unigramok egyezését is figyelembe veszi, elkerülve az egyező szópárokat nem tartalmazó összefoglalók nullás értékelését.

Mindegyik metrika kiszámítható teljességi (*recall*), pontossági (*precision*) vagy harmonikus közép (F-mérték) formában. Összefoglalási feladatoknál hagyományosan a **teljességre** (ROUGE-N recall) helyezik a hangsúlyt, mivel fontos, hogy a modell a lehető legtöbb kulcsinformációt kinyerje a forrásszövegből.

## Alkalmazás és jelentőség

A ROUGE metrikák az összefoglalási algoritmusok objektív értékelésének szabványos eszközévé váltak. A 2000-es évek közepétől szinte valamennyi automatikus összefoglalási verseny (például a DUC és a TAC) a ROUGE-t használta a rendszerek rangsorolásához. A metrika népszerűsége egyszerűségéből és bizonyított hatékonyságából fakad: az n-gram átfedés kellően megbízható mutatónak bizonyult az összefoglaló tartalmának tükrözésére.

A neurális hálózati modellek és az LLM-ek megjelenésével a ROUGE szerepe megmaradt, de az értelmezés összetettebbé vált. A modern modellek olyan minőségű összefoglalókat generálnak, hogy a hagyományos metrikák „plafont" érhetnek el, és nehezen különböztetik meg a minőség árnyalatait, ami új értékelési módszerek kidolgozására ösztönzött<sup>[\[4\]](https://systems-analysis.info/int/ROUGE_(metric)_(HU)#cite_note-tacl_2021-4)</sup>.

## Korlátok és kritika

Népsége ellenére a ROUGE-nak ismert korlátai vannak:

- **Felszínes jelleg**: A metrika kizárólag lexikai egyezésre támaszkodik, és nem képes szemantikai ekvivalenciát értékelni. Alulértékelhet egy jó összefoglalót, ha abban szinonimákat vagy átfogalmazásokat alkalmaznak.
- **A szövegminőség figyelmen kívül hagyása**: A ROUGE nem értékeli a nyelvtani helyességet, a koherenciát vagy az olvashatóságot. Egy modell magas pontszámot érhet el pusztán azzal, hogy a referenciából fontos töredékeket megismétel, még akkor is, ha az eredményül kapott szöveg összefüggéstelen.
- **Függőség a referencia-összefoglalótól**: Az értékelés minősége közvetlenül függ a referencia-összefoglaló minőségétől és teljességétől. Ha az etalon rosszul van megírva, az értékelés megbízhatatlan lesz.
- **A tények értékelésének hiánya**: A metrika nem képes ellenőrizni a tényszerű pontosságot. Egy összefoglaló magas ROUGE-értéket kaphat, de helytelen tényeket tartalmazhat, ha azokat a forrásból másolták, nem pedig az etalonból.

## Alternatívák és modern megközelítések

A ROUGE korlátai alternatív értékelési módszerek kidolgozására ösztönöztek:

- **Szemantikailag orientált metrikák**: A szóegyezés helyett a jelentés szintjén próbálják mérni a hasonlóságot. Ilyenek például a **BERTScore**, amely a generált és a referenciaszöveg vektoros reprezentációit (embedding) hasonlítja össze.
- **Kombinált metrikák**: Lexikai és szemantikai szempontokat ötvöznek. Például a **ROUGE-SEM** megközelítés az osztályikus ROUGE-t egy embedding-alapú szemantikai hasonlósági modullal egészíti ki, hogy jobban értékelje az átfogalmazott szövegeket<sup>[\[5\]](https://systems-analysis.info/int/ROUGE_(metric)_(HU)#cite_note-rouge_sem-5)</sup>.
- **LLM-alapú metrikák**: Modern megközelítések, amelyekben hatékony modellek (például GPT) „bíróként" értékelik az összefoglalók minőségét több szempont szerint, az emberi szakértői értékelést utánozva.

Összefoglalva, a ROUGE egyszerű és hatékony eszközként bizonyította értékét az automatikus összefoglalók értékelésében. Az összetettebb metrikák megjelenése ellenére a ROUGE minden hiányossága mellett is nélkülözhetetlen alapeszköz marad az NLP-kutatók eszköztárában.

## Hivatkozások

- Chin-Yew Lin eredeti ROUGE-cikke (2004)

## Megjegyzések

1.  <span id="cite_note-wiki_rouge-1">[↑](https://systems-analysis.info/int/ROUGE_(metric)_(HU)#cite_ref-wiki_rouge_1-0) «ROUGE (metric)». *Wikipedia*. <a href="https://en.wikipedia.org/wiki/ROUGE_(metric)" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-lin_2004-2">[↑](https://systems-analysis.info/int/ROUGE_(metric)_(HU)#cite_ref-lin_2004_2-0) Lin, Chin-Yew. «ROUGE: A Package for Automatic Evaluation of Summaries». *Proceedings of the ACL-04 Workshop on Text Summarization Branches Out*, 2004. <a href="https://aclanthology.org/W04-1013.pdf" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-gm_rkb-3">[↑](https://systems-analysis.info/int/ROUGE_(metric)_(HU)#cite_ref-gm_rkb_3-0) «ROUGE (Recall-Oriented Understudy for Gisting Evaluation) Performance Metric». *GM-RKB*. <a href="http://www.gabormelli.com/RKB/ROUGE_(Recall-Oriented_Understudy_for_Gisting_Evaluation)_Performance_Metric" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-tacl_2021-4">[↑](https://systems-analysis.info/int/ROUGE_(metric)_(HU)#cite_ref-tacl_2021_4-0) Deutsch, Daniel, and Rotem Dror. «A Statistical Analysis of Summarization Evaluation Metrics». *Transactions of the Association for Computational Linguistics*, vol. 9, 2021, pp. 495-508. <a href="https://aclanthology.org/anthology-files/anthology-files/pdf/tacl/2021.tacl-1.24.pdf" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-rouge_sem-5">[↑](https://systems-analysis.info/int/ROUGE_(metric)_(HU)#cite_ref-rouge_sem_5-0) Zhang, M., et al. «ROUGE-SEM: Better evaluation of summarization using ROUGE combined with semantics». *Expert Systems with Applications*, vol. 237, 2024, p. 121364. <a href="https://github.com/zhangming-19/ROUGE-SEM" class="external autonumber" rel="nofollow">[5]</a></span>
