BERTScore (metric) (RO)
BERTScore — este o metrică automată pentru evaluarea calității textului generat, bazată pe măsurarea similarității semantice cu ajutorul embedding-urilor contextuale din modele lingvistice preantrenate, precum BERT. Metrica a fost propusă în 2019 de un grup de cercetători condus de Tianyi Zhang în lucrarea «BERTScore: Evaluating Text Generation with BERT»[1].
Spre deosebire de metricile tradiționale, precum BLEU și ROUGE, care se bazează pe potrivirea exactă a n-gramelor, BERTScore permite identificarea echivalenței de sens chiar și atunci când cuvintele și formulările diferă, luând în considerare sinonimele și parafrazele[2].
Metodologia de calcul
Metoda BERTScore constă din mai multe etape:
- Obținerea embedding-urilor contextuale: Ambele texte (de referință și generat) sunt împărțite în token-uri și trecute printr-un model transformer preantrenat (de exemplu, BERT sau RoBERTa). Pentru fiecare token se extrage reprezentarea sa vectorială contextuală (embedding).
- Calculul similarității cosinus: Pentru toate perechile de token-uri din cele două texte se calculează similaritatea cosinus și se formează o matrice de similaritate a token-urilor[3].
- Calculul preciziei, recall-ului și măsurii F1: Pe baza matricei de similaritate, pentru fiecare token din textul generat se identifică token-ul cel mai similar din textul de referință, ceea ce permite calculul preciziei (precision). Similar, pentru fiecare token din referință se găsește token-ul cel mai apropiat din textul generat, obținând astfel recall-ul (recall). Valoarea finală BERTScore este măsura F₁ echilibrată, care combină precizia și recall-ul:
Metrica este flexibilă: se pot alege diferite modele preantrenate, se pot pondera token-urile după importanța lor (cu ajutorul ponderilor IDF) și se pot transforma liniar scorurile pentru o mai bună interpretabilitate[3].
Aplicare și eficiență
BERTScore este utilizat pentru evaluarea calității în diverse sarcini de generare a textului:
- Traducere automată: Surprinde păstrarea sensului chiar dacă structurile de traducere diferă de cele de referință.
- Rezumare automată: Este capabil să determine că formulări diferite pot transmite aceleași fapte cheie, ceea ce îl face mai flexibil decât ROUGE.
- Sisteme de dialog: Ajută la măsurarea relevanței răspunsului prin compararea acestuia cu cel de referință la nivel de sens.
Evaluarea la scară largă realizată de autori a arătat că coeficientul de corelație al BERTScore cu evaluările umane este semnificativ mai ridicat decât cel al metricilor de tip BLEU și ROUGE. În plus, metrica a demonstrat o rezistență sporită la cazurile complexe de parafraze[1].
Avantaje
- Luarea în considerare a semanticii: Compară textele la nivel de sens, ținând cont de sinonime și parafraze.
- Corelație ridicată cu evaluarea umană: Scorurile BERTScore se aliniază mai bine cu judecățile umane privind calitatea textului decât metricile tradiționale.
- Universalitate și portabilitate: Metrica nu este legată de o limbă sau sarcină specifică — este suficient să se aleagă modelul preantrenat corespunzător.
- Fără necesitatea antrenării: BERTScore este o metrică neantrenabilă, spre deosebire de metricile mai complexe (de exemplu, BLEURT), care necesită antrenare prealabilă pe corpusuri de evaluări.
- Integrarea modelelor moderne: Valorifică puterea transformer-elor pentru extragerea unor trăsături contextuale profunde.
Limitări și critici
- Costuri computaționale ridicate: Calculul bazat pe embedding-uri necesită resurse semnificativ mai mari decât numărarea n-gramelor și implică adesea utilizarea unui GPU[2].
- Dependența de model: Calitatea evaluării este direct legată de calitatea modelului preantrenat. Alegerea modelului și a stratului pentru extragerea embedding-urilor influențează rezultatul, ceea ce poate cauza probleme de reproductibilitate[4].
- Lipsa înțelegerii faptelor și structurii: BERTScore se concentrează pe similaritatea semantică locală și nu garantează înțelegerea structurii textului sau a acurateței factuale. Un text cu fraze rearanjate sau cu erori factuale poate obține un scor ridicat[3].
- Interpretabilitate redusă: Spre deosebire de BLEU/ROUGE, scorul BERTScore este mai puțin transparent, ceea ce îngreunează analiza erorilor.
- Distorsiuni sociale (bias): Metrica moștenește stereotipurile și distorsiunile încorporate în modelele preantrenate. Un studiu din 2022 a arătat că metricile bazate pe LLM (inclusiv BERTScore) manifestă un bias social semnificativ mai mare decât metricile tradiționale[5].
Importanță și rol în evaluare
BERTScore reprezintă un pas important în dezvoltarea metodelor de evaluare a textului generat, deoarece permite luarea în considerare a echivalenței semantice, nu doar a coincidențelor lexicale. Deși nicio metrică automată nu poate măsura perfect calitatea textului, BERTScore s-a dovedit a fi un instrument fiabil care completează abordările clasice (precum BLEU și ROUGE), fără a le înlocui complet.
În practică, BERTScore este adesea utilizat în combinație cu expertiza manuală și alte metrici pentru a obține o imagine mai completă și mai profundă asupra cât de reușit generează modelele texte coerente și semantic relevante[2].
Referințe
- Depozitul oficial BERTScore pe GitHub
Note
- ↑ 1.0 1.1 Zhang, Tianyi, et al. «BERTScore: Evaluating Text Generation with BERT». arXiv:1904.09675 [cs.CL], 22 апр. 2019 г. [1]
- ↑ 2.0 2.1 2.2 «BERTScore: New Metrics for Language Models». Analytics Vidhya. [2]
- ↑ 3.0 3.1 3.2 Sojasingarayar, Abonia. «BERTScore Explained in 5 minutes». Medium. [3]
- ↑ Alakulju, D., et al. «Reproducibility of BERTScore». Theseus.fi. [4]
- ↑ Peyrard, M., et al. «BERTScore is Unfair: On Social Bias in Language Model-Based Metrics for Text Generation». arXiv:2210.07626 [cs.CL], 14 окт. 2022 г. [5]