BERTScore (metric) (FA)
BERTScore — یک معیار خودکار برای ارزیابی کیفیت متن تولیدشده است که بر اساس اندازهگیری شباهت معنایی با استفاده از embeddingهای متنی از مدلهای زبانی پیشآموزشدیده مانند BERT عمل میکند. این معیار در سال ۲۰۱۹ توسط گروهی از پژوهشگران به رهبری تیانیی ژانگ (Tianyi Zhang) در مقاله «BERTScore: Evaluating Text Generation with BERT» معرفی شد[1].
بر خلاف معیارهای سنتی مانند BLEU و ROUGE که بر تطابق دقیق n-gram استوارند، BERTScore حتی در صورت تفاوت در کلمات و عبارات، معادلسازی معنایی را شناسایی میکند و مترادفها و parافرازها را در نظر میگیرد[2].
روش محاسبه
روش BERTScore از چند مرحله تشکیل شده است:
- دریافت embeddingهای متنی: هر دو متن (مرجع و تولیدشده) به token تبدیل شده و از طریق یک مدل transformer پیشآموزشدیده (مانند BERT یا RoBERTa) عبور میکنند. برای هر token، بازنمایی برداری متنی (embedding) آن استخراج میشود.
- محاسبه شباهت کسینوسی: برای تمام جفتهای token از دو متن، شباهت کسینوسی محاسبه شده و ماتریس شباهت tokenها تشکیل میشود[3].
- محاسبه دقت، فراخوانی و F1: بر اساس ماتریس شباهت، برای هر token در متن تولیدشده، مشابهترین token در متن مرجع یافته میشود که این امر محاسبه دقت (precision) را ممکن میسازد. به همین ترتیب، برای هر token مرجع، نزدیکترین token در متن تولیدشده یافته میشود که فراخوانی (recall) را میدهد. مقدار نهایی BERTScore، F₁ متوازن است که دقت و فراخوانی را ترکیب میکند:
این معیار انعطافپذیر است: میتوان مدلهای پیشآموزشدیده مختلف را انتخاب کرد، tokenها را بر اساس اهمیتشان وزندهی کرد (با استفاده از وزنهای IDF) و امتیازها را برای تفسیرپذیری بهتر بهصورت خطی تبدیل کرد[3].
کاربرد و اثربخشی
BERTScore برای ارزیابی کیفیت در وظایف مختلف تولید متن به کار میرود:
- ترجمه ماشینی: حفظ معنا را حتی در صورتی که ساختارهای ترجمه با نمونههای مرجع متفاوت باشند، شناسایی میکند.
- خلاصهسازی خودکار: قادر است تشخیص دهد که عبارات مختلف میتوانند همان حقایق کلیدی را منتقل کنند، که آن را نسبت به ROUGE انعطافپذیرتر میسازد.
- سیستمهای مکالمه: به اندازهگیری تناسب پاسخ از طریق مقایسه معنایی آن با پاسخ مرجع کمک میکند.
ارزیابی گستردهای که توسط نویسندگان انجام شد نشان داد که ضریب همبستگی BERTScore با ارزیابیهای انسانی به طور قابل توجهی بالاتر از معیارهایی مانند BLEU و ROUGE است. علاوه بر این، این معیار مقاومت بیشتری در برابر موارد دشوار parافرازها نشان داد[1].
مزایا
- در نظر گرفتن معناشناسی: متون را در سطح معنا مقایسه میکند و مترادفها و parافرازها را در نظر میگیرد.
- همبستگی بالا با انسان: امتیازهای BERTScore نسبت به معیارهای سنتی با قضاوتهای انسانی درباره کیفیت متن همخوانی بهتری دارند.
- جامعیت و قابلیت انتقال: این معیار به زبان یا وظیفه خاصی وابسته نیست و کافی است مدل پیشآموزشدیده مناسب انتخاب شود.
- عدم نیاز به آموزش: BERTScore یک معیار آموزشناپذیر است، بر خلاف معیارهای پیچیدهتر (مانند BLEURT) که نیاز به پیشآموزش روی مجموعهدادههای ارزیابی دارند.
- یکپارچهسازی مدلهای مدرن: از توان transformerها برای استخراج ویژگیهای عمیق متنی استفاده میکند.
محدودیتها و نقدها
- هزینه محاسباتی بالا: محاسبه بر اساس embedding به منابع بسیار بیشتری نسبت به شمارش n-gram نیاز دارد و اغلب نیازمند استفاده از GPU است[2].
- وابستگی به مدل: کیفیت ارزیابی مستقیماً با کیفیت مدل پیشآموزشدیده مرتبط است. انتخاب مدل و لایه برای استخراج embedding بر نتیجه تأثیر میگذارد که میتواند مشکلات بازتولیدپذیری ایجاد کند[4].
- عدم توجه به حقایق و ساختار: BERTScore بر شباهت معنایی محلی تمرکز دارد و درک ساختار متن یا دقت واقعی را تضمین نمیکند. متنی با عبارات جابهجا شده یا خطاهای واقعی ممکن است امتیاز بالایی دریافت کند[3].
- تفسیرپذیری پایین: بر خلاف BLEU/ROUGE، شاخص BERTScore شفافیت کمتری دارد که تحلیل خطا را دشوار میسازد.
- سوگیریهای اجتماعی (bias): این معیار کلیشهها و سوگیریهای موجود در مدلهای پیشآموزشدیده را به ارث میبرد. پژوهشی در سال ۲۰۲۲ نشان داد که معیارهای مبتنی بر LLM (از جمله BERTScore) bias اجتماعی بسیار بیشتری نسبت به معیارهای سنتی نشان میدهند[5].
اهمیت و نقش در ارزیابی
BERTScore گامی مهم در توسعه روشهای ارزیابی متن تولیدشده است، زیرا امکان در نظر گرفتن معادلسازی معنایی و نه فقط تطابق واژگانی را فراهم میکند. با وجود اینکه هیچ معیار خودکاری نمیتواند به طور کامل کیفیت متن را اندازهگیری کند، BERTScore به عنوان ابزاری قابل اعتماد جایگاه خود را یافته است که رویکردهای کلاسیک (مانند BLEU و ROUGE) را تکمیل میکند، نه اینکه آنها را به طور کامل جایگزین شود.
در عمل، BERTScore اغلب در ترکیب با بررسی دستی متخصصان و سایر معیارها استفاده میشود تا تصویری جامعتر و عمیقتر از میزان موفقیت مدلها در تولید متون منسجم و معنادار به دست آید[2].
پیوندها
- مخزن رسمی BERTScore در GitHub
یادداشتها
- ↑ 1.0 1.1 Zhang, Tianyi, et al. «BERTScore: Evaluating Text Generation with BERT». arXiv:1904.09675 [cs.CL], 22 апр. 2019 г. [۱]
- ↑ 2.0 2.1 2.2 «BERTScore: New Metrics for Language Models». Analytics Vidhya. [۲]
- ↑ 3.0 3.1 3.2 Sojasingarayar, Abonia. «BERTScore Explained in 5 minutes». Medium. [۳]
- ↑ Alakulju, D., et al. «Reproducibility of BERTScore». Theseus.fi. [۴]
- ↑ Peyrard, M., et al. «BERTScore is Unfair: On Social Bias in Language Model-Based Metrics for Text Generation». arXiv:2210.07626 [cs.CL], 14 окт. 2022 г. [۵]