BLEU (Bilingual Evaluation Understudy) (FA)
BLEU (مخفف انگلیسی Bilingual Evaluation Understudy — «ارزیاب جایگزین دوزبانه») — الگوریتمی برای ارزیابی خودکار کیفیت متن ترجمهشده توسط ماشین است. ارزیابی از طریق مقایسه ترجمه نامزد با یک یا چند ترجمه مرجع انسانی انجام میشود[1]. کیفیت بر اساس میزان شباهت واژگانی ترجمه ماشینی به ترجمه حرفهای سنجیده میشود. همانطور که نویسندگان اشاره کردند، «هر چه ترجمه ماشینی به ترجمه یک انسان حرفهای نزدیکتر باشد، بهتر است»[2].
این روش در سال ۲۰۰۲ توسط گروهی از پژوهشگران IBM به رهبری کیشور پاپینی پیشنهاد شد و به یکی از نخستین معیارهایی تبدیل گشت که همبستگی بالایی با ارزیابیهای متخصصان ترجمه نشان داد. BLEU به سرعت به دلیل سادگی محاسبه، استقلال از زبان و تطابق خوب با ارزیابی انسانی در سطح پیکره متنی محبوبیت یافت[1].
روش محاسبه BLEU
BLEU ترجمه را از طریق شمارش تطابق n-گرامها (دنبالههایی از n کلمه) میان ترجمه نامزد و ترجمههای مرجع ارزیابی میکند.
۱. دقت اصلاحشده n-گرام
ابتدا برای n-گرامهای با طولهای مختلف (معمولاً از ۱ تا ۴)، دقت آنها () محاسبه میشود — یعنی نسبت n-گرامهای موجود در ترجمه نامزد که در ترجمههای مرجع نیز یافت میشوند[3]. در این فرآیند، تعداد تطابقها برای هر n-گرام به حداکثر تعداد رخداد آن در هر یک از متون مرجع محدود میشود تا از بالا رفتن ناروای امتیاز به خاطر تکرار یک کلمه جلوگیری گردد.
۲. تجمیع و میانگین هندسی
برای به دست آوردن یک امتیاز واحد، دقتهای ۱-گرام، ۲-گرام، ۳-گرام و ۴-گرام با استفاده از میانگین هندسی تجمیع میشوند. این کار به این دلیل انجام میشود که دقت پایین برای یک نوع n-گرام (مثلاً ۴-گرام) تأثیر قابلتوجهی بر امتیاز نهایی بگذارد و کیفیت ضعیف عبارات بلند را منعکس کند.
۳. جریمه کوتاهی (Brevity Penalty)
برای جلوگیری از دریافت امتیازهای ناروا از طریق ترجمههای بسیار کوتاه اما دقیق، BLEU جریمه کوتاهی (Brevity Penalty، BP) را معرفی میکند. اگر طول ترجمه نامزد (c) به طور قابلتوجهی کمتر از طول ترجمه مرجع (r) باشد، امتیاز نهایی BLEU کاهش مییابد. جریمه بر اساس فرمول زیر محاسبه میشود:
۴. فرمول نهایی BLEU
امتیاز نهایی BLEU به عنوان حاصلضرب جریمه کوتاهی در میانگین هندسی دقتهای n-گرام محاسبه میشود[4]: که در آن N حداکثر طول n-گرام (معمولاً ۴) و وزنها هستند (معمولاً ).
مقدار BLEU در بازه ۰ تا ۱ قرار دارد (اغلب در ۱۰۰ ضرب شده و به صورت درصد بیان میشود). هر چه نتیجه به ۱ (۱۰۰٪) نزدیکتر باشد، ترجمه «نزدیکتر به ترجمه انسانی» محسوب میشود.
کاربرد و اهمیت
از زمان انتشار، معیار BLEU به استاندارد de facto برای ارزیابی سیستمهای ترجمه ماشینی (MT) تبدیل شد. این معیار امکان عبور از «گلوگاه» توسعه سیستمهای MT — یعنی زمانبر و پرهزینه بودن ارزیابی دستی — را فراهم کرد. توسعهدهندگان توانستند به سرعت تأثیر تغییرات در مدلها را اندازهگیری کرده و راهحلهای ناموفق را سریعاً حذف کنند[2].
BLEU همبستگی خوبی با ارزیابیهای انسانی در سطح کل پیکره متنی دارد، اما برای ارزیابی جملات منفرد قابل اعتماد نیست[3]. به همین دلیل، این معیار به طور گسترده در مسابقات استاندارد MT (مانند NIST و WMT) برای مقایسه سیستمها مورد استفاده قرار میگرفت.
محدودیتها و انتقادات
علیرغم گستردگی استفاده، BLEU دارای چندین محدودیت اساسی است:
- فقدان ارزیابی معنایی: BLEU تنها تطابق سطحی کلمات را اندازه میگیرد و قادر به ارزیابی صحت انتقال معنا متن مبدأ نیست. ترجمهای ممکن است امتیاز بالایی کسب کند اما از نظر دستوری نادرست باشد یا معنا را تحریف کند[5].
- نادیده گرفتن مترادفها و بازنویسی: الگوریتم ترجمههایی را که از مترادفها یا عبارات متفاوت نسبت به مرجع استفاده میکنند جریمه میکند، حتی اگر کاملاً صحیح باشند. استفاده از چندین مرجع این مشکل را کاهش میدهد اما به طور کامل حل نمیکند.
- حساسیت به توکنسازی: نتایج BLEU به شدت به روش تقسیم متن به token بستگی دارد. پیادهسازیهای مختلف tokenizer میتوانند مقادیر متفاوتی ایجاد کنند و مقایسه مدلها را نادرست کنند. برای حل این مشکل، استاندارد SacreBLEU پیشنهاد شد که محاسبه معیار را یکپارچه میکند[1].
- دشواری کاربرد برای برخی زبانها: BLEU برای زبانهایی که جداکننده مشخصی برای کلمات ندارند (مثلاً چینی یا ژاپنی) بدون بخشبندی اولیه به خوبی عمل نمیکند.
جایگزینها و رویکردهای نوین
با گذشت زمان، معیارهای خودکار جدیدی برای غلبه بر کاستیهای BLEU پیشنهاد شدند:
- METEOR: تطابق مترادفها، stemming و ترتیب کلمات را در نظر میگیرد.
- ROUGE: برای ارزیابی خلاصهسازی متن به کار میرود و بر جامعیت (recall) به جای دقت تمرکز دارد.
- معیارهای آموختهشده (Learned Metrics): رویکردهای نوینی که از مدلهای Machine Learning برای در نظر گرفتن شباهت معنایی استفاده میکنند. معیارهایی مانند BLEURT و COMET همبستگی به مراتب بیشتری با ارزیابیهای انسانی نسبت به BLEU کلاسیک نشان میدهند[6].
تا دهه ۲۰۲۰، BLEU جایگاه خود را به عنوان استاندارد مطلق از دست داد و جای خود را به روشهای دقیقتر سپرد[7]. با این حال، این معیار همچنان به عنوان نقطه عطف مهمی در تاریخ ارزیابی MT باقی مانده و به عنوان نقطه مرجع پایه در اندازهگیری پیشرفت مورد استفاده قرار میگیرد.
پیوندها
- BLEU score چیست؟ — مستندات Microsoft Azure
یادداشتها
- ↑ 1.0 1.1 1.2 «BLEU». Wikipedia. [۱]
- ↑ 2.0 2.1 Papineni, Kishore, et al. «Bleu: a Method for Automatic Evaluation of Machine Translation». Proceedings of the 40th Annual Meeting of the Association for Computational Linguistics, 2002. [۲]
- ↑ 3.0 3.1 «BLEU». MT Companion 4.0 documentation. [۳]
- ↑ Callison-Burch, Chris, et al. «BLEU: a Method for Automatic Evaluation of Machine Translation». Proceedings of the EACL 2006 Workshop on Statistical Machine Translation, 2006. [۴]
- ↑ Cardete, Jorge. «Beyond BLEU Score. When it comes to the nuanced world of...». The Deep Hub | Medium. [۵]
- ↑ «BLEURT: метрика для оценки моделей для генерации текста». Neurohive. [۶]
- ↑ «Chief Digital and Artificial Intelligence Office > Lexicon». ai.mil. [۷]