BERTScore (metric) (SV)
BERTScore — är ett automatiskt mått för att utvärdera kvaliteten på genererad text, baserat på mätning av semantisk likhet med hjälp av kontextuella embeddings från förtränade språkmodeller, såsom BERT. Måttet föreslogs år 2019 av en grupp forskare under ledning av Tianyi Zhang i artikeln «BERTScore: Evaluating Text Generation with BERT»[1].
Skilt från traditionella mått som BLEU och ROUGE, vilka baseras på exakt matchning av n-gram, gör BERTScore det möjligt att identifiera meningsekvivalens även när ord och formuleringar skiljer sig åt, genom att ta hänsyn till synonymer och parafraser[2].
Beräkningsmetodik
Metoden BERTScore består av flera steg:
- Hämtning av kontextuella embeddings: Båda texterna (referenstext och genererad text) delas upp i tokens och passeras genom en förtränad transformer-modell (t.ex. BERT eller RoBERTa). För varje token extraheras dess kontextuella vektorrepresentation (embedding).
- Beräkning av kosinuslikhet: För alla tokenpar från de två texterna beräknas kosinuslikheten, och en likhetsmatris för tokens skapas[3].
- Beräkning av precision, recall och F1-mått: Utifrån likhetsmatrisen söks för varje token i den genererade texten den mest liknande token i referenstexten, vilket gör det möjligt att beräkna precision. På motsvarande sätt söks för varje token i referenstexten den närmaste token i den genererade texten, vilket ger recall. Det slutliga värdet för BERTScore är det balanserade F₁-måttet, som kombinerar precision och recall:
Måttet är flexibelt: man kan välja olika förtränade modeller, vikta tokens efter deras betydelse (med hjälp av IDF-vikter) och linjärt transformera poängen för bättre tolkbarhet[3].
Användning och effektivitet
BERTScore används för kvalitetsutvärdering i olika uppgifter inom textgenerering:
- Maskinöversättning: Fångar bevarandet av mening, även om översättningskonstruktionerna skiljer sig från referensen.
- Automatisk sammanfattning: Kan avgöra att olika formuleringar kan förmedla samma nyckeluppgifter, vilket gör det mer flexibelt än ROUGE.
- Dialogsystem: Hjälper till att mäta svarets relevans genom att jämföra det med ett referenssvar på meningsnivå.
Den storskaliga utvärdering som genomfördes av författarna visade att korrelationskoefficienten för BERTScore med mänskliga bedömningar är märkbart högre än för mått som BLEU och ROUGE. Dessutom visade måttet ökad robusthet mot komplexa fall av omformulering[1].
Fördelar
- Semantisk hänsyn: Jämför texter på meningsnivå och tar hänsyn till synonymer och parafraser.
- Hög korrelation med människor: BERTScore-bedömningar stämmer bättre överens med mänskliga omdömen om textkvalitet än traditionella mått.
- Mångsidighet och överförbarhet: Måttet är inte bundet till ett specifikt språk eller en specifik uppgift — det räcker att välja en lämplig förtränad modell.
- Inget träningsbehov: BERTScore är ett otränat mått, till skillnad från mer komplexa mått (t.ex. BLEURT) som kräver förträning på bedömningskorpora.
- Integration av moderna modeller: Utnyttjar transformers kraft för att extrahera djupa kontextuella egenskaper.
Begränsningar och kritik
- Höga beräkningskostnader: Beräkning baserad på embeddings kräver betydligt mer resurser än räkning av n-gram och kräver ofta användning av GPU[2].
- Modellberoende: Utvärderingens kvalitet är direkt kopplad till den förtränade modellens kvalitet. Valet av modell och lager för extrahering av embeddings påverkar resultatet, vilket kan orsaka problem med reproducerbarhet[4].
- Avsaknad av fakta- och strukturhänsyn: BERTScore fokuserar på lokal semantisk likhet och garanterar inte förståelse av textstruktur eller faktamässig korrekthet. En text med omplacerade fraser eller faktafel kan få ett högt poäng[3].
- Låg tolkbarhet: Till skillnad från BLEU/ROUGE är BERTScore-värdet mindre transparent, vilket försvårar felanalys.
- Sociala snedvridningar (bias): Måttet ärver stereotyper och snedvridningar som finns inbyggda i de förtränade modellerna. En studie från 2022 visade att mått baserade på LLM (inklusive BERTScore) uppvisar betydligt mer social bias än traditionella mått[5].
Betydelse och roll i utvärdering
BERTScore utgör ett viktigt steg i utvecklingen av metoder för utvärdering av genererad text, eftersom det möjliggör hänsyn till semantisk ekvivalens och inte bara lexikala matchningar. Trots att inget automatiskt mått kan mäta textkvalitet på ett perfekt sätt har BERTScore etablerat sig som ett tillförlitligt verktyg som kompletterar klassiska metoder (såsom BLEU och ROUGE) snarare än att helt ersätta dem.
I praktiken används BERTScore ofta i kombination med manuell granskning och andra mått för att ge en mer fullständig och djupgående bild av hur framgångsrikt modeller genererar sammanhängande och meningsenliga texter[2].
Externa länkar
- Officiellt BERTScore-förråd på GitHub
Noter
- ↑ 1.0 1.1 Zhang, Tianyi, et al. «BERTScore: Evaluating Text Generation with BERT». arXiv:1904.09675 [cs.CL], 22 апр. 2019 г. [1]
- ↑ 2.0 2.1 2.2 «BERTScore: New Metrics for Language Models». Analytics Vidhya. [2]
- ↑ 3.0 3.1 3.2 Sojasingarayar, Abonia. «BERTScore Explained in 5 minutes». Medium. [3]
- ↑ Alakulju, D., et al. «Reproducibility of BERTScore». Theseus.fi. [4]
- ↑ Peyrard, M., et al. «BERTScore is Unfair: On Social Bias in Language Model-Based Metrics for Text Generation». arXiv:2210.07626 [cs.CL], 14 окт. 2022 г. [5]