BERTScore (metric) (TR)
BERTScore — otomatik olarak üretilen metnin kalitesini değerlendirmeye yönelik bir otomatik metriktir; BERT gibi önceden eğitilmiş dil modellerinden elde edilen bağlamsal embedding'ler aracılığıyla anlamsal benzerliği ölçmeye dayanır. Metrik, 2019 yılında Tianyi Zhang öncülüğündeki bir araştırmacı grubu tarafından «BERTScore: Evaluating Text Generation with BERT» adlı çalışmada önerilmiştir[1].
BLEU ve ROUGE gibi n-gram tam eşleşmesine dayanan geleneksel metriklerden farklı olarak BERTScore, kelimeler ve ifadeler farklı olsa bile eş anlamlıları ve parafrazları göz önünde bulundurarak anlam eşdeğerliğini saptamaya olanak tanır[2].
Hesaplama Yöntemi
BERTScore yöntemi birkaç aşamadan oluşur:
- Bağlamsal embedding'lerin elde edilmesi: Her iki metin de (referans ve üretilen) token'lara ayrılır ve önceden eğitilmiş bir transformer modeline (örneğin BERT veya RoBERTa) geçirilir. Her token için bağlamsal vektör temsili (embedding) çıkarılır.
- Kosinüs benzerliğinin hesaplanması: İki metindeki tüm token çiftleri için kosinüs benzerliği hesaplanır ve bir token benzerlik matrisi oluşturulur[3].
- Precision, Recall ve F1 skorunun hesaplanması: Benzerlik matrisine dayanarak, üretilen metindeki her token için referans metindeki en benzer token bulunur; bu sayede precision (kesinlik) hesaplanır. Benzer şekilde, referanstaki her token için üretilen metindeki en yakın token bulunur ve bu da recall (duyarlılık) değerini verir. BERTScore'un nihai değeri, precision ve recall'u birleştiren dengeli F₁ ölçüsüdür:
Metrik esnektir: farklı önceden eğitilmiş modeller seçilebilir, token'lar önem düzeylerine göre ağırlıklandırılabilir (IDF ağırlıkları aracılığıyla) ve skorlar daha iyi yorumlanabilirlik için doğrusal dönüşüme tabi tutulabilir[3].
Uygulama ve Etkinlik
BERTScore, çeşitli metin üretme görevlerinde kalite değerlendirmesi amacıyla kullanılır:
- Makine çevirisi: Çeviri yapıları referans metinden farklı olsa bile anlam korumasını yakalar.
- Otomatik özetleme: Farklı ifadelerin aynı temel gerçekleri aktarabildiğini saptayabilir; bu da onu ROUGE'dan daha esnek kılar.
- Diyalog sistemleri: Yanıtın uygunluğunu anlamsal düzeyde referansla karşılaştırarak ölçmeye yardımcı olur.
Yazarların gerçekleştirdiği kapsamlı değerlendirme, BERTScore'un insan değerlendirmeleriyle korelasyon katsayısının BLEU ve ROUGE gibi metriklere kıyasla belirgin biçimde daha yüksek olduğunu ortaya koymuştur. Bunun yanı sıra metrik, karmaşık parafrazlama durumlarına karşı artırılmış bir dayanıklılık sergilemiştir[1].
Avantajlar
- Anlambilimi dikkate alma: Eş anlamlıları ve parafrazları göz önünde bulundurarak metinleri anlam düzeyinde karşılaştırır.
- İnsanla yüksek korelasyon: BERTScore değerlendirmeleri, metin kalitesine ilişkin insan yargılarıyla geleneksel metriklere kıyasla daha iyi örtüşür.
- Evrensellik ve taşınabilirlik: Metrik belirli bir dile veya göreve bağlı değildir; uygun önceden eğitilmiş bir modelin seçilmesi yeterlidir.
- Eğitim gerektirmeme: BERTScore, değerlendirme külliyatları üzerinde ön eğitim gerektiren daha karmaşık metriklerin (örneğin BLEURT) aksine eğitimsiz bir metriktir.
- Modern modellerin entegrasyonu: Derin bağlamsal özellikleri çıkarmak için transformer'ların gücünden yararlanır.
Sınırlılıklar ve Eleştiriler
- Yüksek hesaplama maliyeti: Embedding tabanlı hesaplama, n-gram sayımından çok daha fazla kaynak gerektirir ve çoğunlukla GPU kullanımını zorunlu kılar[2].
- Modele bağımlılık: Değerlendirme kalitesi, önceden eğitilmiş modelin kalitesiyle doğrudan ilişkilidir. Embedding çıkarmak için kullanılan modelin ve katmanın seçimi sonucu etkiler; bu durum yeniden üretilebilirlik sorunlarına yol açabilir[4].
- Gerçekleri ve yapıyı dikkate almama: BERTScore yerel anlamsal benzerliğe odaklanır; metin yapısının veya olgusal doğruluğun anlaşılmasını garanti etmez. Cümleleri yeniden düzenlenmiş veya olgusal hatalar içeren bir metin yüksek puan alabilir[3].
- Düşük yorumlanabilirlik: BLEU/ROUGE'dan farklı olarak BERTScore değeri daha az şeffaftır; bu da hata analizini güçleştirir.
- Toplumsal önyargılar (bias): Metrik, önceden eğitilmiş modellere yerleştirilmiş stereotipleri ve önyargıları devralır. 2022 yılında gerçekleştirilen bir araştırma, LLM tabanlı metriklerin (BERTScore dahil) geleneksel metriklere kıyasla çok daha belirgin toplumsal bias sergilediğini ortaya koymuştur[5].
Önemi ve Değerlendirmedeki Rolü
BERTScore, yalnızca sözcüksel eşleşmeleri değil anlamsal eşdeğerliği de dikkate almasına olanak tanıdığı için üretilen metin değerlendirme yöntemlerinin gelişiminde önemli bir adımı temsil eder. Hiçbir otomatik metriğin metin kalitesini mükemmel biçimde ölçemeyeceği gerçeğine karşın, BERTScore kendini güvenilir bir araç olarak kanıtlamış; BLEU ve ROUGE gibi klasik yaklaşımları tamamen ikame etmek yerine tamamlar nitelikte bir işlev üstlenmiştir.
Uygulamada BERTScore, modellerin tutarlı ve anlam bakımından uygun metinler üretmedeki başarısını daha kapsamlı ve derinlemesine değerlendirebilmek amacıyla manuel uzman incelemesi ve diğer metriklerle birlikte sıklıkla kullanılmaktadır[2].
Dış bağlantılar
- BERTScore'un GitHub'daki resmi deposu
Notlar
- ↑ 1.0 1.1 Zhang, Tianyi, et al. «BERTScore: Evaluating Text Generation with BERT». arXiv:1904.09675 [cs.CL], 22 апр. 2019 г. [1]
- ↑ 2.0 2.1 2.2 «BERTScore: New Metrics for Language Models». Analytics Vidhya. [2]
- ↑ 3.0 3.1 3.2 Sojasingarayar, Abonia. «BERTScore Explained in 5 minutes». Medium. [3]
- ↑ Alakulju, D., et al. «Reproducibility of BERTScore». Theseus.fi. [4]
- ↑ Peyrard, M., et al. «BERTScore is Unfair: On Social Bias in Language Model-Based Metrics for Text Generation». arXiv:2210.07626 [cs.CL], 14 окт. 2022 г. [5]