---
title: "ROUGE (metric) (KO)"
source: "https://systems-analysis.info/int/ROUGE_(metric)_(KO)"
wiki: "systems-analysis.info/int"
article: "ROUGE_(metric)_(KO)"
language: "ko"
categories:
  - "Category:Korean"
  - "Category:Large language models"
  - "Category:LLM evaluation"
  - "Category:Machine learning"
revision_id: 6136
wiki_created_at: 2026-09-06T23:58:49Z
wiki_modified_at: 2026-09-06T23:58:49Z
downloaded_at: 2026-09-07T23:12:16Z
---

# ROUGE (metric) (KO)

**ROUGE** (*Recall-Oriented Understudy for Gisting Evaluation*의 약어 — «내용 완전성을 중심으로 한 요약 평가용 대리 평가 지표»)는 시스템이 생성한 텍스트 요약(초록)의 품질을 자동으로 평가하기 위한 지표 모음입니다. 평가는 자동 생성된 요약과 사람이 작성한 하나 이상의 기준(참조) 요약을 비교하는 방식으로 이루어집니다<sup>[\[1\]](https://systems-analysis.info/int/ROUGE_(metric)_(KO)#cite_note-wiki_rouge-1)</sup>.

본래 이 지표는 자동 텍스트 요약 과제를 위해 개발되었으나, 기계 번역 품질 평가에도 활용됩니다. 정밀도(precision)를 평가하는 BLEU 지표와 달리, ROUGE는 **완전성**(*recall*)에 초점을 맞춥니다 — 즉, 기준 요약에 포함된 중요한 단편들이 생성된 텍스트에 얼마나 재현되었는지를 측정합니다.

ROUGE 지표 모음은 2004년 남캘리포니아대학교 정보과학연구소의 연구자 **Chin-Yew Lin**(린 친위)에 의해 제안되었습니다<sup>[\[2\]](https://systems-analysis.info/int/ROUGE_(metric)_(KO)#cite_note-lin_2004-2)</sup>. ROUGE 지표는 요약 알고리즘 평가의 사실상 표준이 되었으며, 특히 DUC(*Document Understanding Conference*) 같은 대규모 대회에서 사용된 이후 더욱 확고히 자리 잡았습니다.

## ROUGE 지표의 주요 변형

ROUGE 계열은 서로 관련된 여러 지표를 포함하며, 각각 다른 기준으로 내용의 교집합을 측정합니다<sup>[\[3\]](https://systems-analysis.info/int/ROUGE_(metric)_(KO)#cite_note-gm_rkb-3)</sup>:

- **ROUGE-N**: n-그램(*n*개 단어의 연속 배열)의 교집합을 측정합니다.
  - **ROUGE-1**은 유니그램(개별 단어)의 교집합을 계산합니다.
  - **ROUGE-2**는 바이그램(연속된 단어 쌍)의 교집합을 계산합니다.

<!-- -->

- **ROUGE-L**: 생성된 요약과 기준 요약 사이의 **최장 공통 부분 수열**(*Longest Common Subsequence*, LCS)에 기반합니다. 이 지표는 동일한 순서로 나타나지만 반드시 연속적일 필요는 없는 가장 긴 단어 시퀀스를 측정하므로, 문장 구조 수준의 일치를 고려합니다.

<!-- -->

- **ROUGE-W**: ROUGE-L의 변형(*Weighted LCS*)으로, 연속된 단어로 이루어진 공통 부분 수열에 더 높은 가중치를 부여하여 연속적인 구문 일치를 장려합니다.

<!-- -->

- **ROUGE-S** 및 **ROUGE-SU**: **건너뛰기 바이그램**(*skip-bigrams*) 일치에 기반한 지표입니다. 건너뛰기 바이그램이란 두 텍스트에서 동일한 순서로 등장하지만 반드시 연속적이지 않아도 되는 모든 단어 쌍입니다. 이를 통해 단어 사이에 간격이 있는 일치도 고려할 수 있습니다.
  - **ROUGE-SU**는 ROUGE-S의 확장으로, 일치하는 단어 쌍이 없는 요약에서 점수가 0이 되는 것을 방지하기 위해 유니그램 일치도 함께 고려합니다.

각 지표는 완전성(*recall*), 정밀도(*precision*), 또는 두 값의 조화 평균(F-점수) 형태로 계산될 수 있습니다. 요약 과제에서는 전통적으로 **완전성**(ROUGE-N recall)에 중점을 두는데, 모델이 원문에서 최대한 많은 핵심 정보를 추출하는 것이 중요하기 때문입니다.

## 활용 및 중요성

ROUGE 지표는 요약 알고리즘을 객관적으로 평가하는 표준 도구가 되었습니다. 2000년대 중반부터 자동 요약 관련 거의 모든 대회(예: DUC 및 TAC)에서 시스템 순위를 매기는 데 ROUGE를 사용했습니다. 이 지표의 인기는 단순성과 검증된 효과성 덕분입니다: n-그램 교집합은 요약 내용을 반영하는 충분히 신뢰할 만한 지표임이 입증되었습니다.

신경망 모델과 LLM의 등장으로 ROUGE의 역할은 유지되고 있지만 해석은 더 복잡해졌습니다. 현대 모델은 매우 높은 품질의 요약을 생성하기 때문에 전통적인 지표가 «천장»에 도달하여 품질의 미묘한 차이를 제대로 구분하지 못하는 경우가 있으며, 이로 인해 새로운 평가 방법 개발이 촉진되었습니다<sup>[\[4\]](https://systems-analysis.info/int/ROUGE_(metric)_(KO)#cite_note-tacl_2021-4)</sup>.

## 한계와 비판

인기에도 불구하고 ROUGE는 잘 알려진 한계를 가지고 있습니다:

- **표면적 특성**: 이 지표는 어휘적 일치에만 의존하며 의미론적 동등성을 평가할 수 없습니다. 생성된 요약에서 동의어나 바꿔쓰기가 사용된 경우 좋은 요약의 점수를 낮게 평가할 수 있습니다.
- **텍스트 품질 무시**: ROUGE는 문법적 정확성, 응집성 또는 가독성을 평가하지 않습니다. 최종 텍스트가 비일관적이더라도 기준에서 중요한 단편들을 단순히 반복하면 높은 점수를 받을 수 있습니다.
- **기준 요약에 대한 의존성**: 평가 품질은 참조 요약의 품질과 완전성에 직접적으로 달려 있습니다. 기준이 잘못 작성된 경우 평가는 신뢰할 수 없게 됩니다.
- **사실 평가 부재**: 이 지표는 사실적 정확성을 검증할 수 없습니다. 요약이 기준이 아닌 원문에서 복사된 잘못된 사실을 포함하더라도 높은 ROUGE 점수를 받을 수 있습니다.

## 대안 및 현대적 접근 방식

ROUGE의 한계로 인해 대안적인 평가 방법들이 개발되었습니다:

- **의미론적 지향 지표**: 정확한 단어 일치가 아닌 의미 수준의 유사도를 측정하려 합니다. 생성된 텍스트와 기준 텍스트의 벡터 표현(embedding)을 비교하는 **BERTScore**가 그 예입니다.
- **복합 지표**: 어휘적 기준과 의미론적 기준을 결합합니다. 예를 들어, **ROUGE-SEM** 접근 방식은 바꿔쓰기된 텍스트를 더 잘 평가하기 위해 embedding 기반의 의미론적 유사도 모듈로 고전적인 ROUGE를 보완합니다<sup>[\[5\]](https://systems-analysis.info/int/ROUGE_(metric)_(KO)#cite_note-rouge_sem-5)</sup>.
- **LLM 기반 지표**: 강력한 모델(예: GPT)이 여러 기준에 따라 요약 품질을 평가하는 «심판» 역할을 하여 전문가의 인간 평가를 모방하는 현대적 접근 방식입니다.

결론적으로, ROUGE는 자동 요약 평가를 위한 간단하고 효과적인 도구로 자리매김했습니다. 더 복잡한 지표들이 등장했음에도 불구하고, ROUGE는 모든 단점에도 불구하고 NLP 연구자들의 필수적인 기본 도구로 남아 있습니다.

## 참고 링크

- Chin-Yew Lin의 ROUGE 원본 논문 (2004)

## 주석

1.  <span id="cite_note-wiki_rouge-1">[↑](https://systems-analysis.info/int/ROUGE_(metric)_(KO)#cite_ref-wiki_rouge_1-0) «ROUGE (metric)». *Wikipedia*. <a href="https://en.wikipedia.org/wiki/ROUGE_(metric)" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-lin_2004-2">[↑](https://systems-analysis.info/int/ROUGE_(metric)_(KO)#cite_ref-lin_2004_2-0) Lin, Chin-Yew. «ROUGE: A Package for Automatic Evaluation of Summaries». *Proceedings of the ACL-04 Workshop on Text Summarization Branches Out*, 2004. <a href="https://aclanthology.org/W04-1013.pdf" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-gm_rkb-3">[↑](https://systems-analysis.info/int/ROUGE_(metric)_(KO)#cite_ref-gm_rkb_3-0) «ROUGE (Recall-Oriented Understudy for Gisting Evaluation) Performance Metric». *GM-RKB*. <a href="http://www.gabormelli.com/RKB/ROUGE_(Recall-Oriented_Understudy_for_Gisting_Evaluation)_Performance_Metric" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-tacl_2021-4">[↑](https://systems-analysis.info/int/ROUGE_(metric)_(KO)#cite_ref-tacl_2021_4-0) Deutsch, Daniel, and Rotem Dror. «A Statistical Analysis of Summarization Evaluation Metrics». *Transactions of the Association for Computational Linguistics*, vol. 9, 2021, pp. 495-508. <a href="https://aclanthology.org/anthology-files/anthology-files/pdf/tacl/2021.tacl-1.24.pdf" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-rouge_sem-5">[↑](https://systems-analysis.info/int/ROUGE_(metric)_(KO)#cite_ref-rouge_sem_5-0) Zhang, M., et al. «ROUGE-SEM: Better evaluation of summarization using ROUGE combined with semantics». *Expert Systems with Applications*, vol. 237, 2024, p. 121364. <a href="https://github.com/zhangming-19/ROUGE-SEM" class="external autonumber" rel="nofollow">[5]</a></span>
