---
title: "ROUGE (metric) (TR)"
source: "https://systems-analysis.info/int/ROUGE_(metric)_(TR)"
wiki: "systems-analysis.info/int"
article: "ROUGE_(metric)_(TR)"
language: "tr"
categories:
  - "Category:Large language models"
  - "Category:LLM evaluation"
  - "Category:Machine learning"
  - "Category:Turkish"
revision_id: 6144
wiki_created_at: 2026-09-06T23:58:56Z
wiki_modified_at: 2026-09-06T23:58:56Z
downloaded_at: 2026-09-07T23:12:18Z
---

# ROUGE (metric) (TR)

**ROUGE** (İngilizce *Recall-Oriented Understudy for Gisting Evaluation* — "Bütünlük odaklı özetleme değerlendirme yedeği" ifadesinin kısaltması) — sistemler tarafından otomatik olarak üretilen metin özetlerinin kalitesini değerlendirmeye yarayan bir otomatik metrik kümesidir. Değerlendirme, otomatik olarak üretilen özet ile insanlar tarafından oluşturulmuş bir veya birden fazla referans özetle karşılaştırılarak gerçekleştirilir<sup>[\[1\]](https://systems-analysis.info/int/ROUGE_(metric)_(TR)#cite_note-wiki_rouge-1)</sup>.

Metrik, başlangıçta otomatik metin özetleme görevleri için geliştirilmiş olmakla birlikte, makine çevirisi kalitesinin değerlendirilmesinde de kullanılmaktadır. Doğruluğu (precision) ölçen BLEU metriğinin aksine, ROUGE **bütünlüğe** (*recall*) odaklanır — referans özetteki anlamlı parçaların ne kadarının üretilen metinde yeniden oluşturulduğunu gösterir.

ROUGE metrik kümesi, 2004 yılında Güney Kaliforniya Üniversitesi Bilgi Bilimleri Enstitüsü'nden araştırmacı **Chin-Yew Lin** tarafından önerilmiştir<sup>[\[2\]](https://systems-analysis.info/int/ROUGE_(metric)_(TR)#cite_note-lin_2004-2)</sup>. ROUGE metrikleri, özellikle DUC (*Document Understanding Conference*) gibi büyük yarışmalarda kullanılmalarının ardından özetleme algoritmalarının değerlendirilmesinde fiilî standart haline gelmiştir.

## ROUGE Metriklerinin Temel Türleri

ROUGE ailesi, her biri içerik örtüşmesini farklı ölçütlere göre ölçen birkaç ilgili metrik içermektedir<sup>[\[3\]](https://systems-analysis.info/int/ROUGE_(metric)_(TR)#cite_note-gm_rkb-3)</sup>:

- **ROUGE-N**: N-gram (*n* sözcükten oluşan diziler) örtüşmesini ölçer.
  - **ROUGE-1** tek sözcük (unigram) örtüşmesini hesaplar.
  - **ROUGE-2** iki sözcüklü (bigram) örtüşmeyi hesaplar.

<!-- -->

- **ROUGE-L**: Üretilen özet ile referans özet arasındaki **En Uzun Ortak Alt Dizi** (*Longest Common Subsequence*, LCS) temel alınır. Bu metrik, cümle yapısı düzeyindeki örtüşmeyi dikkate alır; aynı sırada yer alan ancak mutlaka ardışık olmayan en uzun sözcük dizisini ölçer.

<!-- -->

- **ROUGE-W**: ROUGE-L'nin bir modifikasyonu olan *Weighted LCS*, ardışık sözcüklerden oluşan ortak alt dizilere daha yüksek ağırlık atayarak kesintisiz ifade örtüşmesini teşvik eder.

<!-- -->

- **ROUGE-S** ve **ROUGE-SU**: **Atlamalı bigram** (*skip-bigram*) örtüşmesine dayalı metriklerdir. Atlamalı bigram, her iki metinde de aynı sırada yer alan ancak mutlaka ardışık olmayan herhangi bir sözcük çiftidir. Bu, sözcükler arasında boşluklar olsa dahi örtüşmelerin hesaba katılmasını sağlar.
  - **ROUGE-SU**, ROUGE-S'nin bir uzantısıdır; örtüşen sözcük çifti bulunmayan özetlerde sıfır puan verilmesini önlemek amacıyla unigram örtüşmesini de dikkate alır.

Metriklerin her biri bütünlük (*recall*), doğruluk (*precision*) veya bunların harmonik ortalaması (F-ölçütü) cinsinden hesaplanabilir. Geleneksel olarak özetleme görevlerinde **bütünlüğe** (ROUGE-N recall) vurgu yapılır; çünkü modelin kaynak metindeki anahtar bilgilerin mümkün olduğunca büyük bir bölümünü çıkarması önem taşır.

## Kullanım Alanları ve Önemi

ROUGE metrikleri, özetleme algoritmalarının nesnel olarak değerlendirilmesinde standart bir araç haline gelmiştir. 2000'lerin ortasından itibaren otomatik özetleme alanındaki hemen tüm yarışmalar (örneğin DUC ve TAC) sistemleri sıralamak için ROUGE'u kullanmıştır. Metriğin popülaritesi, basitliğinden ve kanıtlanmış etkinliğinden kaynaklanmaktadır: n-gram örtüşmesi, özet içeriğini yansıtmada yeterince güvenilir bir gösterge olduğunu kanıtlamıştır.

Sinir ağı tabanlı modellerin ve LLM'lerin ortaya çıkmasıyla birlikte ROUGE'un rolü korunmuş, ancak yorumu daha karmaşık bir hal almıştır. Modern modeller o denli yüksek kaliteli özetler üretmektedir ki geleneksel metrikler bir "tavana" ulaşabilmekte ve kalite nüanslarını yeterince ayırt edememektedir; bu durum yeni değerlendirme yöntemlerinin geliştirilmesini teşvik etmiştir<sup>[\[4\]](https://systems-analysis.info/int/ROUGE_(metric)_(TR)#cite_note-tacl_2021-4)</sup>.

## Sınırlılıklar ve Eleştiriler

Popülaritesine karşın ROUGE'un bilinen sınırlılıkları mevcuttur:

- **Yüzeysel nitelik**: Metrik yalnızca sözcüksel örtüşmeye dayanır ve anlamsal eşdeğerliği değerlendiremez. İyi bir özette eş anlamlı sözcükler veya yeniden ifade kullanılmışsa metrik düşük puan verebilir.
- **Metin kalitesinin göz ardı edilmesi**: ROUGE dilbilgisel doğruluğu, tutarlılığı veya okunabilirliği değerlendirmez. Bir model, sonuçta ortaya çıkan metin tutarsız olsa bile referanstan önemli parçaları tekrar ederek yüksek puan alabilir.
- **Referans özete bağımlılık**: Değerlendirmenin kalitesi doğrudan referans özetin kalitesine ve kapsamına bağlıdır. Referans özet kötü yazılmışsa değerlendirme güvenilmez olacaktır.
- **Olgusal doğruluğun değerlendirilememesi**: Metrik, olgusal doğruluğu kontrol edemez. Bir özet, gerçek hatalar içerse de referanstan değil kaynaktan kopyalanan bilgiler nedeniyle yüksek ROUGE puanı alabilir.

## Alternatifler ve Çağdaş Yaklaşımlar

ROUGE'un sınırlılıkları, alternatif değerlendirme yöntemlerinin geliştirilmesini teşvik etmiştir:

- **Anlam odaklı metrikler**: Sözcüklerin tam eşleşmesi yerine anlam düzeyinde benzerliği ölçmeye çalışır. Üretilen ve referans metinlerin vektör temsillerini (embedding) karşılaştıran **BERTScore** bu yaklaşıma örnek gösterilebilir.
- **Karma metrikler**: Sözcüksel ve anlamsal ölçütleri bir arada kullanır. Örneğin **ROUGE-SEM** yaklaşımı, yeniden ifade edilmiş metinleri daha iyi değerlendirebilmek amacıyla klasik ROUGE'u embedding tabanlı anlamsal benzerlik modülüyle tamamlar<sup>[\[5\]](https://systems-analysis.info/int/ROUGE_(metric)_(TR)#cite_note-rouge_sem-5)</sup>.
- **LLM tabanlı metrikler**: Güçlü modellerin (örneğin GPT) birden fazla ölçüte göre özet kalitesini değerlendirmek amacıyla "yargıç" rolünde kullanıldığı, insan uzmanlığını taklit eden çağdaş yaklaşımlardır.

Sonuç olarak ROUGE, otomatik özetleme değerlendirmesinde basit ve etkili bir araç olarak kendini kanıtlamıştır. Daha karmaşık metriklerin ortaya çıkmasına karşın ROUGE, tüm eksikliklerine rağmen NLP araştırmacılarının vazgeçilmez temel araçlarından biri olmayı sürdürmektedir.

## Kaynakça

- Chin-Yew Lin'in ROUGE hakkındaki özgün makalesi (2004)

## Notlar

1.  <span id="cite_note-wiki_rouge-1">[↑](https://systems-analysis.info/int/ROUGE_(metric)_(TR)#cite_ref-wiki_rouge_1-0) «ROUGE (metric)». *Wikipedia*. <a href="https://en.wikipedia.org/wiki/ROUGE_(metric)" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-lin_2004-2">[↑](https://systems-analysis.info/int/ROUGE_(metric)_(TR)#cite_ref-lin_2004_2-0) Lin, Chin-Yew. «ROUGE: A Package for Automatic Evaluation of Summaries». *Proceedings of the ACL-04 Workshop on Text Summarization Branches Out*, 2004. <a href="https://aclanthology.org/W04-1013.pdf" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-gm_rkb-3">[↑](https://systems-analysis.info/int/ROUGE_(metric)_(TR)#cite_ref-gm_rkb_3-0) «ROUGE (Recall-Oriented Understudy for Gisting Evaluation) Performance Metric». *GM-RKB*. <a href="http://www.gabormelli.com/RKB/ROUGE_(Recall-Oriented_Understudy_for_Gisting_Evaluation)_Performance_Metric" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-tacl_2021-4">[↑](https://systems-analysis.info/int/ROUGE_(metric)_(TR)#cite_ref-tacl_2021_4-0) Deutsch, Daniel, and Rotem Dror. «A Statistical Analysis of Summarization Evaluation Metrics». *Transactions of the Association for Computational Linguistics*, vol. 9, 2021, pp. 495-508. <a href="https://aclanthology.org/anthology-files/anthology-files/pdf/tacl/2021.tacl-1.24.pdf" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-rouge_sem-5">[↑](https://systems-analysis.info/int/ROUGE_(metric)_(TR)#cite_ref-rouge_sem_5-0) Zhang, M., et al. «ROUGE-SEM: Better evaluation of summarization using ROUGE combined with semantics». *Expert Systems with Applications*, vol. 237, 2024, p. 121364. <a href="https://github.com/zhangming-19/ROUGE-SEM" class="external autonumber" rel="nofollow">[5]</a></span>
