---
title: "ROUGE (metric) (BG)"
source: "https://systems-analysis.info/int/ROUGE_(metric)_(BG)"
wiki: "systems-analysis.info/int"
article: "ROUGE_(metric)_(BG)"
language: "bg"
categories:
  - "Category:Bulgarian"
  - "Category:Large language models"
  - "Category:LLM evaluation"
  - "Category:Machine learning"
revision_id: 6125
wiki_created_at: 2026-09-06T23:58:41Z
wiki_modified_at: 2026-09-06T23:58:41Z
downloaded_at: 2026-09-07T23:12:12Z
---

# ROUGE (metric) (BG)

**ROUGE** (акроним от англ. *Recall-Oriented Understudy for Gisting Evaluation* — „Заместващ оценител за резюмиране, ориентиран към пълнота") — това е набор от автоматични метрики за оценка на качеството на текстови резюмета, генерирани от системи. Оценката се извършва чрез сравняване на автоматично генерираното резюме с едно или повече еталонни (референтни) резюмета, създадени от хора<sup>[\[1\]](https://systems-analysis.info/int/ROUGE_(metric)_(BG)#cite_note-wiki_rouge-1)</sup>.

Първоначално метриката е разработена за задачи по автоматично реферирање на текст, но се прилага и при оценка на качеството на машинния превод. За разлика от метриката BLEU, която оценява точността (precision), ROUGE се фокусира върху **пълнотата** (*recall*) — тя показва каква част от значимите фрагменти от еталонното резюме е възпроизведена в генерирания текст.

Наборът от метрики ROUGE е предложен през 2004 година от изследователя **Чин-Ю Лин** (Chin-Yew Lin) от Института по информационни науки на Университета на Южна Калифорния<sup>[\[2\]](https://systems-analysis.info/int/ROUGE_(metric)_(BG)#cite_note-lin_2004-2)</sup>. Метриките ROUGE се превърнаха в де факто стандарт за оценка на алгоритми за резюмиране, особено след използването им в мащабни състезания като DUC (*Document Understanding Conference*).

## Основни варианти на метриките ROUGE

Семейството ROUGE включва няколко свързани метрики, всяка от които измерва пресечеността на съдържанието по различни критерии<sup>[\[3\]](https://systems-analysis.info/int/ROUGE_(metric)_(BG)#cite_note-gm_rkb-3)</sup>:

- **ROUGE-N**: Измерва пресечеността по n-грами (последователности от *n* думи).
  - **ROUGE-1** изчислява пресечеността на униграми (отделни думи).
  - **ROUGE-2** изчислява пресечеността на биграми (двойки последователни думи).

<!-- -->

- **ROUGE-L**: Основана е на **най-дългата обща подпоследователност** (*Longest Common Subsequence*, LCS) между генерираното и еталонното резюме. Тази метрика отчита съвпадението на ниво структура на изречението, тъй като измерва най-дългата последователност от думи, следващи в един и същи ред, но не непременно последователно.

<!-- -->

- **ROUGE-W**: Модификация на ROUGE-L (*Weighted LCS*), която присвоява по-голяма тежест на онези общи подпоследователности, които се състоят от последователно следващи се думи, поощрявайки непрекъснатото съвпадение на фрази.

<!-- -->

- **ROUGE-S** и **ROUGE-SU**: Метрики, основани на съвпадение на **пропуснати биграми** (*skip-bigrams*). Пропусната биграма е всяка двойка думи, срещаща се и в двата текста в един и същи ред, но не непременно последователно. Това позволява отчитане на съвпадения с пропуски между думите.
  - **ROUGE-SU** е разширение на ROUGE-S, което отчита и съвпадението на униграми, за да се избегне нулева оценка за резюмета без съвпадащи двойки думи.

Всяка от метриките може да се изчислява в термините на пълнота (*recall*), точност (*precision*) или тяхното хармонично средно (F-мярка). Традиционно при задачи за реферирање акцентът се поставя върху **пълнотата** (ROUGE-N recall), тъй като е важно моделът да извлече възможно най-много ключова информация от изходния текст.

## Приложение и значимост

Метриките ROUGE се превърнаха в стандартен инструмент за обективна оценка на алгоритмите за реферирање. От средата на 2000-те години насам практически всички конкурси по автоматично реферирање (например DUC и TAC) използват ROUGE за класиране на системите. Популярността на метриката се обяснява с нейната простота и доказана ефективност: пресечеността на n-грамите се оказа достатъчно надежден показател за отразяване на съдържанието на резюмето.

С появата на невронни мрежови модели и LLM ролята на ROUGE се запази, но интерпретацията стана по-сложна. Съвременните модели генерират толкова качествени резюмета, че традиционните метрики могат да достигнат „таван" и да разграничават лошо нюансите на качеството, което стимулира разработването на нови методи за оценка<sup>[\[4\]](https://systems-analysis.info/int/ROUGE_(metric)_(BG)#cite_note-tacl_2021-4)</sup>.

## Ограничения и критика

Въпреки популярността си, ROUGE притежава известни ограничения:

- **Повърхностен характер**: Метриката се опира единствено на лексикалното съвпадение и не е в състояние да оцени семантичната еквивалентност. Тя може да занижи оценката на добро резюме, ако в него се използват синоними или перифрази.
- **Игнориране на качеството на текста**: ROUGE не оценява граматическата правилност, свързаността или четимостта на изложението. Моделът може да получи висок резултат, като просто повтори важни фрагменти от еталона, дори ако крайният текст е несвързан.
- **Зависимост от еталонното резюме**: Качеството на оценката пряко зависи от качеството и пълнотата на референтното резюме. Ако еталонът е написан лошо, оценката ще бъде ненадеждна.
- **Липса на оценка на факти**: Метриката не е в състояние да провери фактическата точност. Резюмето може да получи висок ROUGE, но да съдържа неверни факти, ако те са копирани от източника, а не от еталона.

## Алтернативи и съвременни подходи

Ограниченията на ROUGE подтикнаха към разработване на алтернативни методи за оценка:

- **Семантично ориентирани метрики**: Стремят се да измерват сходството на ниво смисъл, а не точното съвпадение на думи. Примерите включват **BERTScore**, който сравнява векторните представи (embedding-и) на генерирания и еталонния текст.
- **Комбинирани метрики**: Съчетават лексикални и семантични критерии. Например подходът **ROUGE-SEM** допълва класическия ROUGE с модул за семантично сходство на базата на embedding-и, за да оценява по-добре перифразирани текстове<sup>[\[5\]](https://systems-analysis.info/int/ROUGE_(metric)_(BG)#cite_note-rouge_sem-5)</sup>.
- **Метрики на базата на LLM**: Съвременни подходи, при които мощни модели (например GPT) се използват в ролята на „съдия" за оценка на качеството на резюмета по няколко критерия, имитирайки експертната оценка на човек.

В заключение, ROUGE се утвърди като прост и ефективен инструмент за оценка на автоматичните сумаризации. Въпреки появата на по-сложни метрики, ROUGE, при всичките си недостатъци, остава неизменен базов инструмент в арсенала на изследователите по NLP.

## Препратки

- Оригинална статия на Чин-Ю Лин за ROUGE (2004)

## Бележки

1.  <span id="cite_note-wiki_rouge-1">[↑](https://systems-analysis.info/int/ROUGE_(metric)_(BG)#cite_ref-wiki_rouge_1-0) «ROUGE (metric)». *Wikipedia*. <a href="https://en.wikipedia.org/wiki/ROUGE_(metric)" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-lin_2004-2">[↑](https://systems-analysis.info/int/ROUGE_(metric)_(BG)#cite_ref-lin_2004_2-0) Lin, Chin-Yew. «ROUGE: A Package for Automatic Evaluation of Summaries». *Proceedings of the ACL-04 Workshop on Text Summarization Branches Out*, 2004. <a href="https://aclanthology.org/W04-1013.pdf" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-gm_rkb-3">[↑](https://systems-analysis.info/int/ROUGE_(metric)_(BG)#cite_ref-gm_rkb_3-0) «ROUGE (Recall-Oriented Understudy for Gisting Evaluation) Performance Metric». *GM-RKB*. <a href="http://www.gabormelli.com/RKB/ROUGE_(Recall-Oriented_Understudy_for_Gisting_Evaluation)_Performance_Metric" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-tacl_2021-4">[↑](https://systems-analysis.info/int/ROUGE_(metric)_(BG)#cite_ref-tacl_2021_4-0) Deutsch, Daniel, and Rotem Dror. «A Statistical Analysis of Summarization Evaluation Metrics». *Transactions of the Association for Computational Linguistics*, vol. 9, 2021, pp. 495-508. <a href="https://aclanthology.org/anthology-files/anthology-files/pdf/tacl/2021.tacl-1.24.pdf" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-rouge_sem-5">[↑](https://systems-analysis.info/int/ROUGE_(metric)_(BG)#cite_ref-rouge_sem_5-0) Zhang, M., et al. «ROUGE-SEM: Better evaluation of summarization using ROUGE combined with semantics». *Expert Systems with Applications*, vol. 237, 2024, p. 121364. <a href="https://github.com/zhangming-19/ROUGE-SEM" class="external autonumber" rel="nofollow">[5]</a></span>
