---
title: "BERTScore (metric) (IT)"
source: "https://systems-analysis.info/int/BERTScore_(metric)_(IT)"
wiki: "systems-analysis.info/int"
article: "BERTScore_(metric)_(IT)"
language: "it"
categories:
  - "Category:Italian"
  - "Category:Large language models"
  - "Category:LLM evaluation"
  - "Category:Machine learning"
revision_id: 552
wiki_created_at: 2026-09-06T22:35:29Z
wiki_modified_at: 2026-09-06T22:35:29Z
downloaded_at: 2026-09-07T22:40:57Z
---

# BERTScore (metric) (IT)

**BERTScore** — è una metrica automatica per valutare la qualità del testo generato, basata sulla misurazione della similarità semantica tramite embedding contestuali estratti da modelli linguistici pre-addestrati, come BERT. La metrica è stata proposta nel 2019 da un gruppo di ricercatori guidati da **Tianyi Zhang** nell'articolo «BERTScore: Evaluating Text Generation with BERT»<sup>[\[1\]](https://systems-analysis.info/int/BERTScore_(metric)_(IT)#cite_note-bertscore_paper-1)</sup>.

A differenza delle metriche tradizionali come BLEU e ROUGE, che si basano sulla corrispondenza esatta di n-grammi, BERTScore è in grado di rilevare l'equivalenza semantica anche quando le parole e le formulazioni differiscono, tenendo conto di sinonimi e parafrasi<sup>[\[2\]](https://systems-analysis.info/int/BERTScore_(metric)_(IT)#cite_note-analytics_vidhya-2)</sup>.

## Metodologia di calcolo

Il metodo BERTScore si articola in più fasi:

1.  **Ottenimento degli embedding contestuali**: Entrambi i testi (di riferimento e generato) vengono suddivisi in token e passati attraverso un modello transformer pre-addestrato (ad esempio BERT o RoBERTa). Per ciascun token viene estratta la sua rappresentazione vettoriale contestuale (embedding).
2.  **Calcolo della similarità coseno**: Per tutte le coppie di token dei due testi viene calcolata la similarità coseno, formando una matrice di similarità tra token<sup>[\[3\]](https://systems-analysis.info/int/BERTScore_(metric)_(IT)#cite_note-bertscore_explained-3)</sup>.
3.  **Calcolo di precision, recall e F1**: Sulla base della matrice di similarità, per ciascun token nel testo generato viene individuato il token più simile nel testo di riferimento, consentendo di calcolare la **precision**. Analogamente, per ciascun token del riferimento viene individuato il token più vicino nel testo generato, ottenendo la **recall**. Il valore finale di BERTScore è la misura F₁ bilanciata, che combina precision e recall:

<!-- -->

       RBERT=1|x|∑xi∈xmaxyj∈yxiTyj(Recall)
       PBERT=1|y|∑yj∈ymaxxi∈xxiTyj(Precision)
       FBERT=2PBERT⋅RBERTPBERT+RBERT

La metrica è flessibile: è possibile scegliere diversi modelli pre-addestrati, pesare i token in base alla loro importanza (tramite pesi IDF) e applicare trasformazioni lineari ai punteggi per migliorarne l'interpretabilità<sup>[\[3\]](https://systems-analysis.info/int/BERTScore_(metric)_(IT)#cite_note-bertscore_explained-3)</sup>.

## Applicazione ed efficacia

BERTScore viene impiegato per valutare la qualità in diversi compiti di generazione del testo:

- **Traduzione automatica**: Rileva la conservazione del significato anche quando le costruzioni traduttive differiscono da quelle di riferimento.
- **Riassunto automatico**: È in grado di riconoscere che formulazioni diverse possono trasmettere gli stessi fatti chiave, risultando più flessibile di ROUGE.
- **Sistemi di dialogo**: Aiuta a misurare la pertinenza di una risposta confrontandola con quella di riferimento a livello semantico.

Una valutazione su larga scala condotta dagli autori ha dimostrato che il coefficiente di correlazione di BERTScore con le valutazioni umane è **notevolmente superiore** a quello di metriche come BLEU e ROUGE. Inoltre, la metrica ha mostrato una maggiore robustezza nei confronti di casi complessi di parafrasi<sup>[\[1\]](https://systems-analysis.info/int/BERTScore_(metric)_(IT)#cite_note-bertscore_paper-1)</sup>.

## Vantaggi

- **Considerazione della semantica**: Confronta i testi a livello di significato, tenendo conto di sinonimi e parafrasi.
- **Alta correlazione con il giudizio umano**: I punteggi di BERTScore si allineano meglio ai giudizi umani sulla qualità del testo rispetto alle metriche tradizionali.
- **Universalità e trasferibilità**: La metrica non è vincolata a una lingua o a un compito specifico: è sufficiente scegliere il modello pre-addestrato appropriato.
- **Assenza di necessità di addestramento**: BERTScore è una **metrica non addestrabile**, a differenza di metriche più complesse (come BLEURT) che richiedono un pre-addestramento su corpus di valutazioni.
- **Integrazione di modelli moderni**: Sfrutta la potenza dei transformer per estrarre caratteristiche contestuali profonde.

## Limiti e critiche

- **Elevato costo computazionale**: Il calcolo basato sugli embedding richiede risorse notevolmente maggiori rispetto al conteggio degli n-grammi e spesso necessita dell'utilizzo di GPU<sup>[\[2\]](https://systems-analysis.info/int/BERTScore_(metric)_(IT)#cite_note-analytics_vidhya-2)</sup>.
- **Dipendenza dal modello**: La qualità della valutazione è direttamente legata alla qualità del modello pre-addestrato. La scelta del modello e dello strato da cui estrarre gli embedding influenza il risultato, il che può causare problemi di riproducibilità<sup>[\[4\]](https://systems-analysis.info/int/BERTScore_(metric)_(IT)#cite_note-theseus_fi-4)</sup>.
- **Mancata considerazione di fatti e struttura**: BERTScore si concentra sulla similarità semantica locale e non garantisce la comprensione della struttura del testo o dell'accuratezza fattuale. Un testo con frasi riorganizzate o errori fattuali può ricevere un punteggio elevato<sup>[\[3\]](https://systems-analysis.info/int/BERTScore_(metric)_(IT)#cite_note-bertscore_explained-3)</sup>.
- **Bassa interpretabilità**: A differenza di BLEU/ROUGE, il punteggio di BERTScore è meno trasparente, rendendo più difficile l'analisi degli errori.
- **Bias sociali**: La metrica eredita gli stereotipi e i bias presenti nei modelli pre-addestrati. Uno studio del 2022 ha dimostrato che le metriche basate su LLM (incluso BERTScore) mostrano un bias sociale significativamente maggiore rispetto alle metriche tradizionali<sup>[\[5\]](https://systems-analysis.info/int/BERTScore_(metric)_(IT)#cite_note-bertscore_unfair-5)</sup>.

## Importanza e ruolo nella valutazione

BERTScore rappresenta un importante passo avanti nello sviluppo dei metodi di valutazione del testo generato, poiché consente di considerare l'equivalenza semantica e non solo le corrispondenze lessicali. Nonostante nessuna metrica automatica sia in grado di misurare perfettamente la qualità del testo, BERTScore si è affermato come uno strumento affidabile che integra gli approcci classici (come BLEU e ROUGE) senza sostituirli completamente.

Nella pratica, BERTScore viene spesso utilizzato in combinazione con la valutazione manuale da parte di esperti e con altre metriche, al fine di ottenere una visione più completa e approfondita di quanto efficacemente i modelli generino testi coerenti e semanticamente adeguati<sup>[\[2\]](https://systems-analysis.info/int/BERTScore_(metric)_(IT)#cite_note-analytics_vidhya-2)</sup>.

## Collegamenti esterni

- Repository ufficiale di BERTScore su GitHub

## Note

1.  <span id="cite_note-bertscore_paper-1">↑ <sup>[1.0](https://systems-analysis.info/int/BERTScore_(metric)_(IT)#cite_ref-bertscore_paper_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/BERTScore_(metric)_(IT)#cite_ref-bertscore_paper_1-1)</sup> Zhang, Tianyi, et al. «BERTScore: Evaluating Text Generation with BERT». *arXiv:1904.09675* \[cs.CL\], 22 апр. 2019 г. <a href="https://arxiv.org/abs/1904.09675" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-analytics_vidhya-2">↑ <sup>[2.0](https://systems-analysis.info/int/BERTScore_(metric)_(IT)#cite_ref-analytics_vidhya_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/BERTScore_(metric)_(IT)#cite_ref-analytics_vidhya_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/BERTScore_(metric)_(IT)#cite_ref-analytics_vidhya_2-2)</sup> «BERTScore: New Metrics for Language Models». *Analytics Vidhya*. <a href="https://www.analyticsvidhya.com/blog/2025/04/bertscore-a-contextual-metric-for-llm-evaluation/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-bertscore_explained-3">↑ <sup>[3.0](https://systems-analysis.info/int/BERTScore_(metric)_(IT)#cite_ref-bertscore_explained_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/BERTScore_(metric)_(IT)#cite_ref-bertscore_explained_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/BERTScore_(metric)_(IT)#cite_ref-bertscore_explained_3-2)</sup> Sojasingarayar, Abonia. «BERTScore Explained in 5 minutes». *Medium*. <a href="https://medium.com/@abonia/bertscore-explained-in-5-minutes-0b98553bfb71" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-theseus_fi-4">[↑](https://systems-analysis.info/int/BERTScore_(metric)_(IT)#cite_ref-theseus_fi_4-0) Alakulju, D., et al. «Reproducibility of BERTScore». *Theseus.fi*. <a href="https://www.theseus.fi/bitstream/handle/10024/884189/Alakulju_Dkhili_Moufida.pdf?sequence=2&amp;isAllowed=y" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-bertscore_unfair-5">[↑](https://systems-analysis.info/int/BERTScore_(metric)_(IT)#cite_ref-bertscore_unfair_5-0) Peyrard, M., et al. «BERTScore is Unfair: On Social Bias in Language Model-Based Metrics for Text Generation». *arXiv:2210.07626* \[cs.CL\], 14 окт. 2022 г. <a href="https://arxiv.org/abs/2210.07626" class="external autonumber" rel="nofollow">[5]</a></span>
