BERTScore (metric) (RO)

From Systems analysis Wiki
Jump to navigation Jump to search

BERTScore — este o metrică automată pentru evaluarea calității textului generat, bazată pe măsurarea similarității semantice cu ajutorul embedding-urilor contextuale din modele lingvistice preantrenate, precum BERT. Metrica a fost propusă în 2019 de un grup de cercetători condus de Tianyi Zhang în lucrarea «BERTScore: Evaluating Text Generation with BERT»[1].

Spre deosebire de metricile tradiționale, precum BLEU și ROUGE, care se bazează pe potrivirea exactă a n-gramelor, BERTScore permite identificarea echivalenței de sens chiar și atunci când cuvintele și formulările diferă, luând în considerare sinonimele și parafrazele[2].

Metodologia de calcul

Metoda BERTScore constă din mai multe etape:

  1. Obținerea embedding-urilor contextuale: Ambele texte (de referință și generat) sunt împărțite în token-uri și trecute printr-un model transformer preantrenat (de exemplu, BERT sau RoBERTa). Pentru fiecare token se extrage reprezentarea sa vectorială contextuală (embedding).
  2. Calculul similarității cosinus: Pentru toate perechile de token-uri din cele două texte se calculează similaritatea cosinus și se formează o matrice de similaritate a token-urilor[3].
  3. Calculul preciziei, recall-ului și măsurii F1: Pe baza matricei de similaritate, pentru fiecare token din textul generat se identifică token-ul cel mai similar din textul de referință, ceea ce permite calculul preciziei (precision). Similar, pentru fiecare token din referință se găsește token-ul cel mai apropiat din textul generat, obținând astfel recall-ul (recall). Valoarea finală BERTScore este măsura F₁ echilibrată, care combină precizia și recall-ul:
   RBERT=1|x|xixmaxyjyxiTyj(Recall)
   PBERT=1|y|yjymaxxixxiTyj(Precision)
   FBERT=2PBERTRBERTPBERT+RBERT

Metrica este flexibilă: se pot alege diferite modele preantrenate, se pot pondera token-urile după importanța lor (cu ajutorul ponderilor IDF) și se pot transforma liniar scorurile pentru o mai bună interpretabilitate[3].

Aplicare și eficiență

BERTScore este utilizat pentru evaluarea calității în diverse sarcini de generare a textului:

  • Traducere automată: Surprinde păstrarea sensului chiar dacă structurile de traducere diferă de cele de referință.
  • Rezumare automată: Este capabil să determine că formulări diferite pot transmite aceleași fapte cheie, ceea ce îl face mai flexibil decât ROUGE.
  • Sisteme de dialog: Ajută la măsurarea relevanței răspunsului prin compararea acestuia cu cel de referință la nivel de sens.

Evaluarea la scară largă realizată de autori a arătat că coeficientul de corelație al BERTScore cu evaluările umane este semnificativ mai ridicat decât cel al metricilor de tip BLEU și ROUGE. În plus, metrica a demonstrat o rezistență sporită la cazurile complexe de parafraze[1].

Avantaje

  • Luarea în considerare a semanticii: Compară textele la nivel de sens, ținând cont de sinonime și parafraze.
  • Corelație ridicată cu evaluarea umană: Scorurile BERTScore se aliniază mai bine cu judecățile umane privind calitatea textului decât metricile tradiționale.
  • Universalitate și portabilitate: Metrica nu este legată de o limbă sau sarcină specifică — este suficient să se aleagă modelul preantrenat corespunzător.
  • Fără necesitatea antrenării: BERTScore este o metrică neantrenabilă, spre deosebire de metricile mai complexe (de exemplu, BLEURT), care necesită antrenare prealabilă pe corpusuri de evaluări.
  • Integrarea modelelor moderne: Valorifică puterea transformer-elor pentru extragerea unor trăsături contextuale profunde.

Limitări și critici

  • Costuri computaționale ridicate: Calculul bazat pe embedding-uri necesită resurse semnificativ mai mari decât numărarea n-gramelor și implică adesea utilizarea unui GPU[2].
  • Dependența de model: Calitatea evaluării este direct legată de calitatea modelului preantrenat. Alegerea modelului și a stratului pentru extragerea embedding-urilor influențează rezultatul, ceea ce poate cauza probleme de reproductibilitate[4].
  • Lipsa înțelegerii faptelor și structurii: BERTScore se concentrează pe similaritatea semantică locală și nu garantează înțelegerea structurii textului sau a acurateței factuale. Un text cu fraze rearanjate sau cu erori factuale poate obține un scor ridicat[3].
  • Interpretabilitate redusă: Spre deosebire de BLEU/ROUGE, scorul BERTScore este mai puțin transparent, ceea ce îngreunează analiza erorilor.
  • Distorsiuni sociale (bias): Metrica moștenește stereotipurile și distorsiunile încorporate în modelele preantrenate. Un studiu din 2022 a arătat că metricile bazate pe LLM (inclusiv BERTScore) manifestă un bias social semnificativ mai mare decât metricile tradiționale[5].

Importanță și rol în evaluare

BERTScore reprezintă un pas important în dezvoltarea metodelor de evaluare a textului generat, deoarece permite luarea în considerare a echivalenței semantice, nu doar a coincidențelor lexicale. Deși nicio metrică automată nu poate măsura perfect calitatea textului, BERTScore s-a dovedit a fi un instrument fiabil care completează abordările clasice (precum BLEU și ROUGE), fără a le înlocui complet.

În practică, BERTScore este adesea utilizat în combinație cu expertiza manuală și alte metrici pentru a obține o imagine mai completă și mai profundă asupra cât de reușit generează modelele texte coerente și semantic relevante[2].

Referințe

  • Depozitul oficial BERTScore pe GitHub

Note

  1. 1.0 1.1 Zhang, Tianyi, et al. «BERTScore: Evaluating Text Generation with BERT». arXiv:1904.09675 [cs.CL], 22 апр. 2019 г. [1]
  2. 2.0 2.1 2.2 «BERTScore: New Metrics for Language Models». Analytics Vidhya. [2]
  3. 3.0 3.1 3.2 Sojasingarayar, Abonia. «BERTScore Explained in 5 minutes». Medium. [3]
  4. Alakulju, D., et al. «Reproducibility of BERTScore». Theseus.fi. [4]
  5. Peyrard, M., et al. «BERTScore is Unfair: On Social Bias in Language Model-Based Metrics for Text Generation». arXiv:2210.07626 [cs.CL], 14 окт. 2022 г. [5]