BLEU (Bilingual Evaluation Understudy) (UR)

From Systems analysis Wiki
Jump to navigation Jump to search

BLEU (انگریزی: Bilingual Evaluation Understudy — «دو لسانی متبادل جائزہ کار») — یہ مشین کے ذریعے ترجمہ شدہ متن کے معیار کی خودکار جانچ کا ایک الگورتھم ہے۔ جانچ اس طرح کی جاتی ہے کہ امیدوار ترجمے کا موازنہ ایک یا ایک سے زیادہ معیاری (حوالہ جاتی) انسانی تراجم سے کیا جاتا ہے[1]۔ معیار کا تعین مشینی ترجمے اور پیشہ ورانہ ترجمے کے درمیان لفظی قُربت کی بنیاد پر ہوتا ہے۔ جیسا کہ مصنفین نے نوٹ کیا، «مشینی ترجمہ جتنا پیشہ ور انسانی ترجمے کے قریب ہوگا، اتنا ہی بہتر ہوگا»[2]۔

یہ طریقہ 2002 میں IBM کے محققین کی ایک ٹیم نے کشور پاپینی کی قیادت میں پیش کیا اور یہ پہلی metrics میں سے ایک بنی جس نے ترجمہ کے ماہرین کی رائے کے ساتھ اعلیٰ درجے کا ہم آہنگی ظاہر کی۔ BLEU نے حساب کی سادگی، زبانی غیر جانبداری اور متن کے مجموعے کی سطح پر انسانی جائزے سے اچھی مطابقت کی وجہ سے جلد مقبولیت حاصل کی[1]۔

BLEU کے حساب کا طریقہ کار

BLEU ترجمے کی جانچ امیدوار ترجمے اور معیاری تراجم کے درمیان n-gram (n الفاظ کی ترتیب) کی مطابقت گن کر کرتا ہے۔

1. n-gram کی ترمیم شدہ درستگی

پہلے مختلف لمبائی کی n-grams کے لیے (عموماً 1 سے 4 تک) ان کی درستگی (pn) حساب کی جاتی ہے — یعنی امیدوار ترجمے کی n-grams کا وہ حصہ جو معیاری تراجم میں پایا جاتا ہے[3]۔ اس دوران ہر n-gram کی مطابقت کی تعداد کو کسی بھی معیاری متن میں اس کے زیادہ سے زیادہ ظہور تک محدود کیا جاتا ہے تاکہ ایک ہی لفظ کے اعادے سے اسکور بڑھنے سے بچا جا سکے۔

2. اجتماع اور geometric mean

ایک واحد اسکور حاصل کرنے کے لیے، 1، 2، 3 اور 4-grams کی درستگیوں کو geometric mean کے ذریعے اجتماع کیا جاتا ہے۔ یہ اس لیے کیا جاتا ہے تاکہ کسی ایک قسم کی n-gram (مثلاً 4-grams) کی کم درستگی حتمی اسکور پر نمایاں اثر ڈالے اور طویل جملوں کے خراب معیار کو ظاہر کرے۔ p1p2p3p44

3. اختصار کا جرمانہ (Brevity Penalty)

بہت مختصر لیکن درست تراجم کی وجہ سے زیادہ اسکور حاصل ہونے سے روکنے کے لیے BLEU ایک اختصار کا جرمانہ (Brevity Penalty، BP) متعارف کراتا ہے۔ اگر امیدوار ترجمے کی لمبائی (c) معیاری ترجمے کی لمبائی (r) سے نمایاں طور پر کم ہو تو حتمی BLEU اسکور کم ہو جاتا ہے۔ جرمانہ اس فارمولے کے مطابق حساب کیا جاتا ہے: BP={1if c>re1r/cif cr

4. BLEU کا حتمی فارمولا

حتمی BLEU اسکور اختصار کے جرمانے اور n-gram درستگیوں کے geometric mean کے حاصلِ ضرب کے طور پر حساب کیا جاتا ہے[4]: BLEU=BPexp(n=1Nwnlogpn) جہاں N — n-grams کی زیادہ سے زیادہ لمبائی (عموماً 4)، اور wn — وزن (عموماً 1/N) ہے۔

BLEU کی قدر 0 سے 1 کے درمیان ہوتی ہے (اکثر 100 سے ضرب کر کے فیصد میں ظاہر کی جاتی ہے)۔ نتیجہ جتنا 1 (100%) کے قریب ہوگا، ترجمہ اتنا ہی «انسانی ترجمے کے قریب» سمجھا جاتا ہے۔

استعمال اور اہمیت

شائع ہونے کے بعد سے BLEU metric مشینی ترجمے (MT) کے نظاموں کی جانچ کے لیے ایک de facto معیار بن گئی۔ اس نے MT نظاموں کی ترقی میں ایک «رکاوٹ» — یعنی دستی جائزے کی طوالت اور مہنگائی — پر قابو پانے میں مدد کی۔ ڈویلپرز کو یہ موقع ملا کہ وہ ماڈلوں میں تبدیلیوں کے اثر کو تیزی سے ناپ سکیں اور ناکام حلوں کو فوری طور پر رد کر سکیں[2]۔

BLEU پورے corpus کی سطح پر انسانی جائزوں کے ساتھ اچھی طرح ہم آہنگ ہوتا ہے، لیکن انفرادی جملوں کی جانچ کے لیے قابلِ اعتماد نہیں ہے[3]۔ اس لیے یہ metric MT کے معیاری مقابلوں (مثلاً NIST اور WMT) میں نظاموں کے موازنے کے لیے وسیع پیمانے پر استعمال ہوتی رہی۔

حدود اور تنقید

وسیع پیمانے پر استعمال کے باوجود BLEU کی کچھ اہم حدود ہیں:

  • معنوی جانچ کا فقدان: BLEU صرف الفاظ کی سطحی مطابقت ناپتا ہے اور یہ جانچنے سے قاصر ہے کہ آیا اصل متن کا مفہوم درست طریقے سے ادا کیا گیا ہے۔ ترجمے کو اعلیٰ اسکور مل سکتا ہے لیکن وہ گرامری لحاظ سے غلط یا معنوی لحاظ سے مسخ شدہ ہو سکتا ہے[5]۔
  • مترادفات اور paraphrases کو نظرانداز کرنا: الگورتھم ان تراجم کو سزا دیتا ہے جو معیاری ترجمے سے مختلف الفاظ یا مترادفات استعمال کریں، چاہے وہ مکمل طور پر درست ہی کیوں نہ ہوں۔ متعدد معیاری تراجم کا استعمال اس مسئلے کو کم کرتا ہے لیکن مکمل طور پر حل نہیں کرتا۔
  • tokenization سے حساسیت: BLEU کے نتائج متن کو tokens میں تقسیم کرنے کے طریقے پر بہت زیادہ منحصر ہیں۔ مختلف tokenizer نافذ کاریاں مختلف قدریں پیدا کر سکتی ہیں جس سے ماڈلوں کا موازنہ غیر درست ہو جاتا ہے۔ اس مسئلے کے حل کے لیے SacreBLEU معیار پیش کیا گیا جو metric کے حساب کو یکساں بناتا ہے[1]۔
  • بعض زبانوں میں استعمال کی پیچیدگی: BLEU ان زبانوں کے ساتھ ٹھیک سے کام نہیں کرتا جن میں الفاظ کے درمیان واضح حد بندی نہیں ہوتی (مثلاً چینی یا جاپانی)، بغیر پیشگی تقسیم بندی کے۔

متبادل اور جدید طریقے

وقت گزرنے کے ساتھ BLEU کی خامیوں پر قابو پانے کے لیے نئی خودکار metrics پیش کی گئیں:

  • METEOR: مترادفات کی مطابقت، stemming اور الفاظ کی ترتیب کو مدنظر رکھتا ہے۔
  • ROUGE: متن کے خلاصے کی جانچ کے لیے استعمال ہوتا ہے اور درستگی کی بجائے مکمل پن (recall) پر توجہ مرکوز کرتا ہے۔
  • Learned Metrics (قابلِ تعلیم metrics): جدید طریقے جو معنوی قُربت کو مدنظر رکھنے کے لیے Machine Learning ماڈلوں کا استعمال کرتے ہیں۔ BLEURT اور COMET جیسی metrics انسانی جائزوں کے ساتھ کلاسک BLEU کی نسبت نمایاں طور پر زیادہ ہم آہنگی دکھاتی ہیں[6]۔

2020 کی دہائی تک BLEU نے اپنا غیر مشروط معیار کا درجہ کھو دیا اور زیادہ درست طریقوں کو جگہ دے دی[7]۔ تاہم، یہ MT کی جانچ کی تاریخ میں ایک اہم سنگِ میل کے طور پر باقی ہے اور پیش رفت کی پیمائش میں ایک بنیادی حوالہ نقطے کے طور پر استعمال ہوتا رہتا ہے۔

روابط

  • BLEU اسکور کیا ہے؟ — Microsoft Azure دستاویزات

حواشی

  1. 1.0 1.1 1.2 «BLEU». Wikipedia. [1]
  2. 2.0 2.1 Papineni, Kishore, et al. «Bleu: a Method for Automatic Evaluation of Machine Translation». Proceedings of the 40th Annual Meeting of the Association for Computational Linguistics, 2002. [2]
  3. 3.0 3.1 «BLEU». MT Companion 4.0 documentation. [3]
  4. Callison-Burch, Chris, et al. «BLEU: a Method for Automatic Evaluation of Machine Translation». Proceedings of the EACL 2006 Workshop on Statistical Machine Translation, 2006. [4]
  5. Cardete, Jorge. «Beyond BLEU Score. When it comes to the nuanced world of...». The Deep Hub | Medium. [5]
  6. «BLEURT: метрика для оценки моделей для генерации текста». Neurohive. [6]
  7. «Chief Digital and Artificial Intelligence Office > Lexicon». ai.mil. [7]