---
title: "ROUGE (metric) (IT)"
source: "https://systems-analysis.info/int/ROUGE_(metric)_(IT)"
wiki: "systems-analysis.info/int"
article: "ROUGE_(metric)_(IT)"
language: "it"
categories:
  - "Category:Italian"
  - "Category:Large language models"
  - "Category:LLM evaluation"
  - "Category:Machine learning"
revision_id: 6135
wiki_created_at: 2026-09-06T23:58:49Z
wiki_modified_at: 2026-09-06T23:58:49Z
downloaded_at: 2026-09-07T23:12:15Z
---

# ROUGE (metric) (IT)

**ROUGE** (acronimo dall'inglese *Recall-Oriented Understudy for Gisting Evaluation* — «Valutatore sostitutivo per la sintesi, orientato alla completezza») — è un insieme di metriche automatiche per la valutazione della qualità dei riassunti testuali generati da sistemi automatici. La valutazione viene effettuata confrontando il riassunto generato automaticamente con uno o più riassunti di riferimento (reference) creati da esseri umani<sup>[\[1\]](https://systems-analysis.info/int/ROUGE_(metric)_(IT)#cite_note-wiki_rouge-1)</sup>.

Originariamente la metrica è stata sviluppata per i compiti di riassunto automatico del testo, tuttavia viene utilizzata anche nella valutazione della qualità della traduzione automatica. A differenza della metrica BLEU, che valuta la precisione (precision), ROUGE si concentra sulla **completezza** (*recall*) — indica quale parte dei frammenti significativi del riassunto di riferimento è stata riprodotta nel testo generato.

L'insieme di metriche ROUGE è stato proposto nel 2004 dal ricercatore **Chin-Yew Lin** dell'Istituto di Scienze dell'Informazione dell'Università della California del Sud<sup>[\[2\]](https://systems-analysis.info/int/ROUGE_(metric)_(IT)#cite_note-lin_2004-2)</sup>. Le metriche ROUGE sono diventate lo standard de facto per la valutazione degli algoritmi di riassunto, specialmente dopo il loro utilizzo in importanti competizioni come DUC (*Document Understanding Conference*).

## Principali varianti delle metriche ROUGE

La famiglia ROUGE include diverse metriche correlate, ciascuna delle quali misura l'intersezione del contenuto secondo criteri diversi<sup>[\[3\]](https://systems-analysis.info/int/ROUGE_(metric)_(IT)#cite_note-gm_rkb-3)</sup>:

- **ROUGE-N**: Misura l'intersezione degli n-grammi (sequenze di *n* parole).
  - **ROUGE-1** calcola l'intersezione degli unigrammi (singole parole).
  - **ROUGE-2** calcola l'intersezione dei bigrammi (coppie di parole consecutive).

<!-- -->

- **ROUGE-L**: Si basa sulla **sottosequenza comune più lunga** (*Longest Common Subsequence*, LCS) tra il riassunto generato e quello di riferimento. Questa metrica tiene conto della corrispondenza a livello di struttura della frase, poiché misura la sequenza più lunga di parole che compaiono nello stesso ordine, ma non necessariamente in modo contiguo.

<!-- -->

- **ROUGE-W**: Modifica di ROUGE-L (*Weighted LCS*), che assegna un peso maggiore alle sottosequenze comuni composte da parole consecutive, premiando le corrispondenze continue di frasi.

<!-- -->

- **ROUGE-S** e **ROUGE-SU**: Metriche basate sulla corrispondenza dei **bigrammi con salto** (*skip-bigrams*). Un bigramma con salto è qualsiasi coppia di parole che compare in entrambi i testi nello stesso ordine, ma non necessariamente in modo contiguo. Ciò consente di tenere conto delle corrispondenze con salti tra le parole.
  - **ROUGE-SU** è un'estensione di ROUGE-S che considera anche la corrispondenza degli unigrammi, per evitare una valutazione nulla per i riassunti senza coppie di parole corrispondenti.

Ciascuna delle metriche può essere calcolata in termini di completezza (*recall*), precisione (*precision*) o della loro media armonica (F-misura). Tradizionalmente, per i compiti di riassunto, l'enfasi è posta sulla **completezza** (ROUGE-N recall), poiché è importante che il modello estragga quante più informazioni chiave possibile dal testo originale.

## Applicazione e rilevanza

Le metriche ROUGE sono diventate lo strumento standard per la valutazione oggettiva degli algoritmi di riassunto. A partire dalla metà degli anni 2000, praticamente tutte le competizioni di riassunto automatico (ad esempio DUC e TAC) hanno utilizzato ROUGE per classificare i sistemi. La popolarità della metrica è spiegata dalla sua semplicità e dalla comprovata efficacia: l'intersezione degli n-grammi si è rivelata un indicatore sufficientemente affidabile per riflettere il contenuto dei riassunti.

Con l'avvento dei modelli neurali e degli LLM, il ruolo di ROUGE si è mantenuto, ma l'interpretazione è diventata più complessa. I modelli moderni generano riassunti di qualità talmente elevata che le metriche tradizionali possono raggiungere un «soffitto» e distinguere male le sfumature di qualità, il che ha stimolato lo sviluppo di nuovi metodi di valutazione<sup>[\[4\]](https://systems-analysis.info/int/ROUGE_(metric)_(IT)#cite_note-tacl_2021-4)</sup>.

## Limitazioni e critiche

Nonostante la sua popolarità, ROUGE presenta note limitazioni:

- **Carattere superficiale**: La metrica si basa esclusivamente sulla corrispondenza lessicale e non è in grado di valutare l'equivalenza semantica. Può sottovalutare un buon riassunto se in esso vengono utilizzati sinonimi o parafrasi.
- **Ignoranza della qualità del testo**: ROUGE non valuta la correttezza grammaticale, la coerenza o la leggibilità dell'esposizione. Un modello può ottenere un punteggio elevato semplicemente ripetendo frammenti importanti del riferimento, anche se il testo risultante è incoerente.
- **Dipendenza dal riassunto di riferimento**: La qualità della valutazione dipende direttamente dalla qualità e dalla completezza del riassunto di riferimento. Se il riferimento è scritto male, la valutazione non sarà affidabile.
- **Assenza di valutazione dei fatti**: La metrica non è in grado di verificare l'accuratezza fattuale. Un riassunto può ottenere un ROUGE elevato, ma contenere fatti errati, se questi sono stati copiati dalla fonte e non dal riferimento.

## Alternative e approcci moderni

Le limitazioni di ROUGE hanno stimolato lo sviluppo di metodi di valutazione alternativi:

- **Metriche orientate semanticamente**: Cercano di misurare la somiglianza a livello di significato, piuttosto che la corrispondenza esatta delle parole. Esempi includono **BERTScore**, che confronta le rappresentazioni vettoriali (embedding) del testo generato e di quello di riferimento.
- **Metriche combinate**: Combinano criteri lessicali e semantici. Ad esempio, l'approccio **ROUGE-SEM** integra il classico ROUGE con un modulo di somiglianza semantica basato su embedding, per valutare meglio i testi parafrasati<sup>[\[5\]](https://systems-analysis.info/int/ROUGE_(metric)_(IT)#cite_note-rouge_sem-5)</sup>.
- **Metriche basate su LLM**: Approcci moderni in cui modelli potenti (ad esempio GPT) vengono utilizzati come «giudici» per valutare la qualità dei riassunti secondo diversi criteri, imitando la valutazione esperta umana.

In conclusione, ROUGE si è affermato come uno strumento semplice ed efficace per la valutazione delle sintesi automatiche. Nonostante la comparsa di metriche più sofisticate, ROUGE, con tutti i suoi limiti, rimane uno strumento di riferimento imprescindibile nell'arsenale dei ricercatori NLP.

## Riferimenti

- Articolo originale di Chin-Yew Lin su ROUGE (2004)

## Note

1.  <span id="cite_note-wiki_rouge-1">[↑](https://systems-analysis.info/int/ROUGE_(metric)_(IT)#cite_ref-wiki_rouge_1-0) «ROUGE (metric)». *Wikipedia*. <a href="https://en.wikipedia.org/wiki/ROUGE_(metric)" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-lin_2004-2">[↑](https://systems-analysis.info/int/ROUGE_(metric)_(IT)#cite_ref-lin_2004_2-0) Lin, Chin-Yew. «ROUGE: A Package for Automatic Evaluation of Summaries». *Proceedings of the ACL-04 Workshop on Text Summarization Branches Out*, 2004. <a href="https://aclanthology.org/W04-1013.pdf" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-gm_rkb-3">[↑](https://systems-analysis.info/int/ROUGE_(metric)_(IT)#cite_ref-gm_rkb_3-0) «ROUGE (Recall-Oriented Understudy for Gisting Evaluation) Performance Metric». *GM-RKB*. <a href="http://www.gabormelli.com/RKB/ROUGE_(Recall-Oriented_Understudy_for_Gisting_Evaluation)_Performance_Metric" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-tacl_2021-4">[↑](https://systems-analysis.info/int/ROUGE_(metric)_(IT)#cite_ref-tacl_2021_4-0) Deutsch, Daniel, and Rotem Dror. «A Statistical Analysis of Summarization Evaluation Metrics». *Transactions of the Association for Computational Linguistics*, vol. 9, 2021, pp. 495-508. <a href="https://aclanthology.org/anthology-files/anthology-files/pdf/tacl/2021.tacl-1.24.pdf" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-rouge_sem-5">[↑](https://systems-analysis.info/int/ROUGE_(metric)_(IT)#cite_ref-rouge_sem_5-0) Zhang, M., et al. «ROUGE-SEM: Better evaluation of summarization using ROUGE combined with semantics». *Expert Systems with Applications*, vol. 237, 2024, p. 121364. <a href="https://github.com/zhangming-19/ROUGE-SEM" class="external autonumber" rel="nofollow">[5]</a></span>
