BLEU (Bilingual Evaluation Understudy) (FA)

From Systems analysis Wiki
Jump to navigation Jump to search

BLEU (مخفف انگلیسی Bilingual Evaluation Understudy — «ارزیاب جایگزین دوزبانه») — الگوریتمی برای ارزیابی خودکار کیفیت متن ترجمه‌شده توسط ماشین است. ارزیابی از طریق مقایسه ترجمه نامزد با یک یا چند ترجمه مرجع انسانی انجام می‌شود[1]. کیفیت بر اساس میزان شباهت واژگانی ترجمه ماشینی به ترجمه حرفه‌ای سنجیده می‌شود. همان‌طور که نویسندگان اشاره کردند، «هر چه ترجمه ماشینی به ترجمه یک انسان حرفه‌ای نزدیک‌تر باشد، بهتر است»[2].

این روش در سال ۲۰۰۲ توسط گروهی از پژوهشگران IBM به رهبری کیشور پاپینی پیشنهاد شد و به یکی از نخستین معیارهایی تبدیل گشت که همبستگی بالایی با ارزیابی‌های متخصصان ترجمه نشان داد. BLEU به سرعت به دلیل سادگی محاسبه، استقلال از زبان و تطابق خوب با ارزیابی انسانی در سطح پیکره متنی محبوبیت یافت[1].

روش محاسبه BLEU

BLEU ترجمه را از طریق شمارش تطابق n-گرام‌ها (دنباله‌هایی از n کلمه) میان ترجمه نامزد و ترجمه‌های مرجع ارزیابی می‌کند.

۱. دقت اصلاح‌شده n-گرام

ابتدا برای n-گرام‌های با طول‌های مختلف (معمولاً از ۱ تا ۴)، دقت آن‌ها (pn) محاسبه می‌شود — یعنی نسبت n-گرام‌های موجود در ترجمه نامزد که در ترجمه‌های مرجع نیز یافت می‌شوند[3]. در این فرآیند، تعداد تطابق‌ها برای هر n-گرام به حداکثر تعداد رخداد آن در هر یک از متون مرجع محدود می‌شود تا از بالا رفتن ناروای امتیاز به خاطر تکرار یک کلمه جلوگیری گردد.

۲. تجمیع و میانگین هندسی

برای به دست آوردن یک امتیاز واحد، دقت‌های ۱-گرام، ۲-گرام، ۳-گرام و ۴-گرام با استفاده از میانگین هندسی تجمیع می‌شوند. این کار به این دلیل انجام می‌شود که دقت پایین برای یک نوع n-گرام (مثلاً ۴-گرام) تأثیر قابل‌توجهی بر امتیاز نهایی بگذارد و کیفیت ضعیف عبارات بلند را منعکس کند. p1p2p3p44

۳. جریمه کوتاهی (Brevity Penalty)

برای جلوگیری از دریافت امتیازهای ناروا از طریق ترجمه‌های بسیار کوتاه اما دقیق، BLEU جریمه کوتاهی (Brevity Penalty، BP) را معرفی می‌کند. اگر طول ترجمه نامزد (c) به طور قابل‌توجهی کمتر از طول ترجمه مرجع (r) باشد، امتیاز نهایی BLEU کاهش می‌یابد. جریمه بر اساس فرمول زیر محاسبه می‌شود: BP={1if c>re1r/cif cr

۴. فرمول نهایی BLEU

امتیاز نهایی BLEU به عنوان حاصل‌ضرب جریمه کوتاهی در میانگین هندسی دقت‌های n-گرام محاسبه می‌شود[4]: BLEU=BPexp(n=1Nwnlogpn) که در آن N حداکثر طول n-گرام (معمولاً ۴) و wn وزن‌ها هستند (معمولاً 1/N).

مقدار BLEU در بازه ۰ تا ۱ قرار دارد (اغلب در ۱۰۰ ضرب شده و به صورت درصد بیان می‌شود). هر چه نتیجه به ۱ (۱۰۰٪) نزدیک‌تر باشد، ترجمه «نزدیک‌تر به ترجمه انسانی» محسوب می‌شود.

کاربرد و اهمیت

از زمان انتشار، معیار BLEU به استاندارد de facto برای ارزیابی سیستم‌های ترجمه ماشینی (MT) تبدیل شد. این معیار امکان عبور از «گلوگاه» توسعه سیستم‌های MT — یعنی زمان‌بر و پرهزینه بودن ارزیابی دستی — را فراهم کرد. توسعه‌دهندگان توانستند به سرعت تأثیر تغییرات در مدل‌ها را اندازه‌گیری کرده و راه‌حل‌های ناموفق را سریعاً حذف کنند[2].

BLEU همبستگی خوبی با ارزیابی‌های انسانی در سطح کل پیکره متنی دارد، اما برای ارزیابی جملات منفرد قابل اعتماد نیست[3]. به همین دلیل، این معیار به طور گسترده در مسابقات استاندارد MT (مانند NIST و WMT) برای مقایسه سیستم‌ها مورد استفاده قرار می‌گرفت.

محدودیت‌ها و انتقادات

علی‌رغم گستردگی استفاده، BLEU دارای چندین محدودیت اساسی است:

  • فقدان ارزیابی معنایی: BLEU تنها تطابق سطحی کلمات را اندازه می‌گیرد و قادر به ارزیابی صحت انتقال معنا متن مبدأ نیست. ترجمه‌ای ممکن است امتیاز بالایی کسب کند اما از نظر دستوری نادرست باشد یا معنا را تحریف کند[5].
  • نادیده گرفتن مترادف‌ها و بازنویسی: الگوریتم ترجمه‌هایی را که از مترادف‌ها یا عبارات متفاوت نسبت به مرجع استفاده می‌کنند جریمه می‌کند، حتی اگر کاملاً صحیح باشند. استفاده از چندین مرجع این مشکل را کاهش می‌دهد اما به طور کامل حل نمی‌کند.
  • حساسیت به توکن‌سازی: نتایج BLEU به شدت به روش تقسیم متن به token بستگی دارد. پیاده‌سازی‌های مختلف tokenizer می‌توانند مقادیر متفاوتی ایجاد کنند و مقایسه مدل‌ها را نادرست کنند. برای حل این مشکل، استاندارد SacreBLEU پیشنهاد شد که محاسبه معیار را یکپارچه می‌کند[1].
  • دشواری کاربرد برای برخی زبان‌ها: BLEU برای زبان‌هایی که جداکننده مشخصی برای کلمات ندارند (مثلاً چینی یا ژاپنی) بدون بخش‌بندی اولیه به خوبی عمل نمی‌کند.

جایگزین‌ها و رویکردهای نوین

با گذشت زمان، معیارهای خودکار جدیدی برای غلبه بر کاستی‌های BLEU پیشنهاد شدند:

  • METEOR: تطابق مترادف‌ها، stemming و ترتیب کلمات را در نظر می‌گیرد.
  • ROUGE: برای ارزیابی خلاصه‌سازی متن به کار می‌رود و بر جامعیت (recall) به جای دقت تمرکز دارد.
  • معیارهای آموخته‌شده (Learned Metrics): رویکردهای نوینی که از مدل‌های Machine Learning برای در نظر گرفتن شباهت معنایی استفاده می‌کنند. معیارهایی مانند BLEURT و COMET همبستگی به مراتب بیشتری با ارزیابی‌های انسانی نسبت به BLEU کلاسیک نشان می‌دهند[6].

تا دهه ۲۰۲۰، BLEU جایگاه خود را به عنوان استاندارد مطلق از دست داد و جای خود را به روش‌های دقیق‌تر سپرد[7]. با این حال، این معیار همچنان به عنوان نقطه عطف مهمی در تاریخ ارزیابی MT باقی مانده و به عنوان نقطه مرجع پایه در اندازه‌گیری پیشرفت مورد استفاده قرار می‌گیرد.

پیوندها

  • BLEU score چیست؟ — مستندات Microsoft Azure

یادداشت‌ها

  1. 1.0 1.1 1.2 «BLEU». Wikipedia. [۱]
  2. 2.0 2.1 Papineni, Kishore, et al. «Bleu: a Method for Automatic Evaluation of Machine Translation». Proceedings of the 40th Annual Meeting of the Association for Computational Linguistics, 2002. [۲]
  3. 3.0 3.1 «BLEU». MT Companion 4.0 documentation. [۳]
  4. Callison-Burch, Chris, et al. «BLEU: a Method for Automatic Evaluation of Machine Translation». Proceedings of the EACL 2006 Workshop on Statistical Machine Translation, 2006. [۴]
  5. Cardete, Jorge. «Beyond BLEU Score. When it comes to the nuanced world of...». The Deep Hub | Medium. [۵]
  6. «BLEURT: метрика для оценки моделей для генерации текста». Neurohive. [۶]
  7. «Chief Digital and Artificial Intelligence Office > Lexicon». ai.mil. [۷]