BERTScore (metric) (FA)

From Systems analysis Wiki
Jump to navigation Jump to search

BERTScore — یک معیار خودکار برای ارزیابی کیفیت متن تولیدشده است که بر اساس اندازه‌گیری شباهت معنایی با استفاده از embedding‌های متنی از مدل‌های زبانی پیش‌آموزش‌دیده مانند BERT عمل می‌کند. این معیار در سال ۲۰۱۹ توسط گروهی از پژوهشگران به رهبری تیانیی ژانگ (Tianyi Zhang) در مقاله «BERTScore: Evaluating Text Generation with BERT» معرفی شد[1].

بر خلاف معیارهای سنتی مانند BLEU و ROUGE که بر تطابق دقیق n-gram استوارند، BERTScore حتی در صورت تفاوت در کلمات و عبارات، معادل‌سازی معنایی را شناسایی می‌کند و مترادف‌ها و parافراز‌ها را در نظر می‌گیرد[2].

روش محاسبه

روش BERTScore از چند مرحله تشکیل شده است:

  1. دریافت embedding‌های متنی: هر دو متن (مرجع و تولیدشده) به token تبدیل شده و از طریق یک مدل transformer پیش‌آموزش‌دیده (مانند BERT یا RoBERTa) عبور می‌کنند. برای هر token، بازنمایی برداری متنی (embedding) آن استخراج می‌شود.
  2. محاسبه شباهت کسینوسی: برای تمام جفت‌های token از دو متن، شباهت کسینوسی محاسبه شده و ماتریس شباهت token‌ها تشکیل می‌شود[3].
  3. محاسبه دقت، فراخوانی و F1: بر اساس ماتریس شباهت، برای هر token در متن تولیدشده، مشابه‌ترین token در متن مرجع یافته می‌شود که این امر محاسبه دقت (precision) را ممکن می‌سازد. به همین ترتیب، برای هر token مرجع، نزدیک‌ترین token در متن تولیدشده یافته می‌شود که فراخوانی (recall) را می‌دهد. مقدار نهایی BERTScore، F₁ متوازن است که دقت و فراخوانی را ترکیب می‌کند:
   RBERT=1|x|xixmaxyjyxiTyj(Recall)
   PBERT=1|y|yjymaxxixxiTyj(Precision)
   FBERT=2PBERTRBERTPBERT+RBERT

این معیار انعطاف‌پذیر است: می‌توان مدل‌های پیش‌آموزش‌دیده مختلف را انتخاب کرد، token‌ها را بر اساس اهمیتشان وزن‌دهی کرد (با استفاده از وزن‌های IDF) و امتیازها را برای تفسیرپذیری بهتر به‌صورت خطی تبدیل کرد[3].

کاربرد و اثربخشی

BERTScore برای ارزیابی کیفیت در وظایف مختلف تولید متن به کار می‌رود:

  • ترجمه ماشینی: حفظ معنا را حتی در صورتی که ساختارهای ترجمه با نمونه‌های مرجع متفاوت باشند، شناسایی می‌کند.
  • خلاصه‌سازی خودکار: قادر است تشخیص دهد که عبارات مختلف می‌توانند همان حقایق کلیدی را منتقل کنند، که آن را نسبت به ROUGE انعطاف‌پذیرتر می‌سازد.
  • سیستم‌های مکالمه: به اندازه‌گیری تناسب پاسخ از طریق مقایسه معنایی آن با پاسخ مرجع کمک می‌کند.

ارزیابی گسترده‌ای که توسط نویسندگان انجام شد نشان داد که ضریب همبستگی BERTScore با ارزیابی‌های انسانی به طور قابل توجهی بالاتر از معیارهایی مانند BLEU و ROUGE است. علاوه بر این، این معیار مقاومت بیشتری در برابر موارد دشوار parافراز‌ها نشان داد[1].

مزایا

  • در نظر گرفتن معناشناسی: متون را در سطح معنا مقایسه می‌کند و مترادف‌ها و parافراز‌ها را در نظر می‌گیرد.
  • همبستگی بالا با انسان: امتیازهای BERTScore نسبت به معیارهای سنتی با قضاوت‌های انسانی درباره کیفیت متن همخوانی بهتری دارند.
  • جامعیت و قابلیت انتقال: این معیار به زبان یا وظیفه خاصی وابسته نیست و کافی است مدل پیش‌آموزش‌دیده مناسب انتخاب شود.
  • عدم نیاز به آموزش: BERTScore یک معیار آموزش‌ناپذیر است، بر خلاف معیارهای پیچیده‌تر (مانند BLEURT) که نیاز به پیش‌آموزش روی مجموعه‌داده‌های ارزیابی دارند.
  • یکپارچه‌سازی مدل‌های مدرن: از توان transformer‌ها برای استخراج ویژگی‌های عمیق متنی استفاده می‌کند.

محدودیت‌ها و نقدها

  • هزینه محاسباتی بالا: محاسبه بر اساس embedding به منابع بسیار بیشتری نسبت به شمارش n-gram نیاز دارد و اغلب نیازمند استفاده از GPU است[2].
  • وابستگی به مدل: کیفیت ارزیابی مستقیماً با کیفیت مدل پیش‌آموزش‌دیده مرتبط است. انتخاب مدل و لایه برای استخراج embedding بر نتیجه تأثیر می‌گذارد که می‌تواند مشکلات بازتولیدپذیری ایجاد کند[4].
  • عدم توجه به حقایق و ساختار: BERTScore بر شباهت معنایی محلی تمرکز دارد و درک ساختار متن یا دقت واقعی را تضمین نمی‌کند. متنی با عبارات جابه‌جا شده یا خطاهای واقعی ممکن است امتیاز بالایی دریافت کند[3].
  • تفسیرپذیری پایین: بر خلاف BLEU/ROUGE، شاخص BERTScore شفافیت کمتری دارد که تحلیل خطا را دشوار می‌سازد.
  • سوگیری‌های اجتماعی (bias): این معیار کلیشه‌ها و سوگیری‌های موجود در مدل‌های پیش‌آموزش‌دیده را به ارث می‌برد. پژوهشی در سال ۲۰۲۲ نشان داد که معیارهای مبتنی بر LLM (از جمله BERTScore) bias اجتماعی بسیار بیشتری نسبت به معیارهای سنتی نشان می‌دهند[5].

اهمیت و نقش در ارزیابی

BERTScore گامی مهم در توسعه روش‌های ارزیابی متن تولیدشده است، زیرا امکان در نظر گرفتن معادل‌سازی معنایی و نه فقط تطابق واژگانی را فراهم می‌کند. با وجود اینکه هیچ معیار خودکاری نمی‌تواند به طور کامل کیفیت متن را اندازه‌گیری کند، BERTScore به عنوان ابزاری قابل اعتماد جایگاه خود را یافته است که رویکردهای کلاسیک (مانند BLEU و ROUGE) را تکمیل می‌کند، نه اینکه آن‌ها را به طور کامل جایگزین شود.

در عمل، BERTScore اغلب در ترکیب با بررسی دستی متخصصان و سایر معیارها استفاده می‌شود تا تصویری جامع‌تر و عمیق‌تر از میزان موفقیت مدل‌ها در تولید متون منسجم و معنادار به دست آید[2].

پیوندها

  • مخزن رسمی BERTScore در GitHub

یادداشت‌ها

  1. 1.0 1.1 Zhang, Tianyi, et al. «BERTScore: Evaluating Text Generation with BERT». arXiv:1904.09675 [cs.CL], 22 апр. 2019 г. [۱]
  2. 2.0 2.1 2.2 «BERTScore: New Metrics for Language Models». Analytics Vidhya. [۲]
  3. 3.0 3.1 3.2 Sojasingarayar, Abonia. «BERTScore Explained in 5 minutes». Medium. [۳]
  4. Alakulju, D., et al. «Reproducibility of BERTScore». Theseus.fi. [۴]
  5. Peyrard, M., et al. «BERTScore is Unfair: On Social Bias in Language Model-Based Metrics for Text Generation». arXiv:2210.07626 [cs.CL], 14 окт. 2022 г. [۵]