BLEU (Bilingual Evaluation Understudy) (HI)

From Systems analysis Wiki
Jump to navigation Jump to search

BLEU (अंग्रेज़ी Bilingual Evaluation Understudy — «द्विभाषी प्रतिस्थापन मूल्यांकक») — यह मशीन द्वारा अनुवादित पाठ की गुणवत्ता के स्वचालित मूल्यांकन के लिए एक एल्गोरिदम है। मूल्यांकन उम्मीदवार अनुवाद की एक या अधिक संदर्भ (reference) मानव अनुवादों से तुलना करके किया जाता है[1]। गुणवत्ता मशीनी अनुवाद की पेशेवर अनुवाद से शाब्दिक निकटता की मात्रा से निर्धारित होती है। जैसा कि लेखकों ने कहा था, «मशीनी अनुवाद जितना एक पेशेवर मानव अनुवाद के करीब होता है, वह उतना ही बेहतर होता है»[2]

यह विधि 2002 में किशोर पापिनेनी के नेतृत्व में IBM के शोधकर्ताओं के एक समूह द्वारा प्रस्तावित की गई थी और यह उन पहली metrics में से एक बन गई जिन्होंने अनुवाद विशेषज्ञों के मूल्यांकन के साथ उच्च सहसंबंध प्रदर्शित किया। BLEU ने गणना की सरलता, भाषाई स्वतंत्रता और पाठ corpus के स्तर पर मानव मूल्यांकन के साथ अच्छे मेल के कारण तेज़ी से लोकप्रियता हासिल की[1]

BLEU की गणना पद्धति

BLEU उम्मीदवार अनुवाद और संदर्भ अनुवादों के बीच n-gram (n शब्दों के अनुक्रम) मिलानों की गणना करके अनुवाद का मूल्यांकन करता है।

1. संशोधित n-gram परिशुद्धता

सबसे पहले विभिन्न लंबाई के n-gram (सामान्यतः 1 से 4 तक) के लिए उनकी परिशुद्धता (pn) की गणना की जाती है — उम्मीदवार अनुवाद के उन n-gram का अनुपात जो संदर्भ अनुवादों में पाए जाते हैं[3]। इस दौरान प्रत्येक n-gram के मिलान की संख्या किसी भी संदर्भ पाठ में उसकी अधिकतम उपस्थिति तक सीमित होती है, ताकि एक ही शब्द की पुनरावृत्ति से अंक बढ़ने से बचा जा सके।

2. एकत्रीकरण और ज्यामितीय माध्य

एकल मूल्यांकन प्राप्त करने के लिए, 1-, 2-, 3- और 4-gram की परिशुद्धताओं को ज्यामितीय माध्य की सहायता से एकत्रित किया जाता है। यह इसलिए किया जाता है ताकि किसी एक प्रकार के n-gram (जैसे 4-gram) की कम परिशुद्धता अंतिम स्कोर को प्रभावित करे, जो लंबे वाक्यांशों की खराब गुणवत्ता को दर्शाता है। p1p2p3p44

3. संक्षिप्तता दंड (Brevity Penalty)

अत्यधिक छोटे, किंतु सटीक अनुवादों के कारण अधिक अंक प्राप्त करने से रोकने के लिए, BLEU संक्षिप्तता दंड (Brevity Penalty, BP) लागू करता है। यदि उम्मीदवार अनुवाद की लंबाई (c) संदर्भ अनुवाद की लंबाई (r) से काफी कम है, तो BLEU का अंतिम स्कोर कम हो जाता है। दंड की गणना निम्न सूत्र से की जाती है: BP={1if c>re1r/cif cr

4. BLEU का अंतिम सूत्र

अंतिम BLEU स्कोर की गणना संक्षिप्तता दंड और n-gram परिशुद्धताओं के ज्यामितीय माध्य के गुणनफल के रूप में की जाती है[4]: BLEU=BPexp(n=1Nwnlogpn) जहाँ N — n-gram की अधिकतम लंबाई (सामान्यतः 4) है, और wn — भार हैं (सामान्यतः 1/N)।

BLEU का मान 0 से 1 के बीच होता है (अक्सर 100 से गुणा करके प्रतिशत में व्यक्त किया जाता है)। परिणाम जितना 1 (100%) के करीब होता है, अनुवाद उतना ही «मानव अनुवाद के समतुल्य» माना जाता है।

अनुप्रयोग और महत्व

प्रकाशन के समय से ही BLEU metric मशीनी अनुवाद (MT) प्रणालियों के मूल्यांकन के लिए वास्तविक मानक बन गई। इसने MT प्रणालियों के विकास में «अड़चन» को दूर करने में सहायता की — हस्तचालित मूल्यांकन की लंबी और महंगी प्रक्रिया को। डेवलपर्स को मॉडलों में बदलावों के प्रभाव को तेज़ी से मापने और असफल समाधानों को शीघ्रता से हटाने का अवसर मिला[2]

BLEU संपूर्ण corpus के स्तर पर मानव मूल्यांकनों के साथ अच्छा सहसंबंध प्रदर्शित करता है, किंतु व्यक्तिगत वाक्यों के मूल्यांकन के लिए यह अविश्वसनीय है[3]। इसलिए यह metric MT प्रतियोगिताओं (जैसे NIST और WMT) में प्रणालियों की तुलना के लिए व्यापक रूप से उपयोग की जाती रही।

सीमाएँ और आलोचना

व्यापक प्रसार के बावजूद, BLEU की कुछ महत्वपूर्ण सीमाएँ हैं:

  • अर्थगत मूल्यांकन का अभाव: BLEU केवल शब्दों का सतही मिलान मापता है और यह मूल्यांकन नहीं कर सकता कि मूल पाठ का अर्थ सही ढंग से व्यक्त हुआ है या नहीं। एक अनुवाद उच्च अंक प्राप्त कर सकता है, लेकिन व्याकरणिक रूप से गलत हो सकता है या अर्थ को विकृत कर सकता है[5]
  • पर्यायवाची शब्दों और paraphrase की अनदेखी: एल्गोरिदम उन अनुवादों को दंडित करता है जो संदर्भ से भिन्न पर्यायवाची शब्द या अन्य शब्दावली का उपयोग करते हैं, भले ही वे पूर्णतः सही हों। कई संदर्भों का उपयोग इस समस्या को कम करता है, लेकिन पूरी तरह हल नहीं करता।
  • tokenization के प्रति संवेदनशीलता: BLEU के परिणाम पाठ को tokens में विभाजित करने की विधि पर बहुत निर्भर करते हैं। tokenizer के विभिन्न कार्यान्वयन भिन्न मान उत्पन्न कर सकते हैं, जिससे मॉडलों की तुलना गलत हो जाती है। इस समस्या के समाधान के लिए SacreBLEU मानक प्रस्तावित किया गया, जो metric की गणना को एकीकृत करता है[1]
  • कुछ भाषाओं में अनुप्रयोग की कठिनाई: BLEU उन भाषाओं के साथ ठीक से काम नहीं करता जिनमें शब्दों के बीच स्पष्ट विभाजक नहीं होते (जैसे चीनी या जापानी), बिना पूर्व segmentation के।

विकल्प और आधुनिक दृष्टिकोण

समय के साथ BLEU की कमियों को दूर करने के लिए नई स्वचालित metrics प्रस्तावित की गईं:

  • METEOR: पर्यायवाची मिलान, stemming और शब्द क्रम को ध्यान में रखती है।
  • ROUGE: पाठ सारांशण के मूल्यांकन के लिए उपयोग की जाती है, परिशुद्धता के बजाय पूर्णता (recall) पर ध्यान केंद्रित करती है।
  • Learned Metrics (सीखी हुई metrics): आधुनिक दृष्टिकोण जो अर्थगत निकटता को ध्यान में रखने के लिए Machine Learning मॉडलों का उपयोग करते हैं। BLEURT और COMET जैसी metrics, शास्त्रीय BLEU की तुलना में मानव मूल्यांकन के साथ काफी अधिक सहसंबंध प्रदर्शित करती हैं[6]

2020 के दशक तक BLEU ने निर्विवाद मानक का दर्जा खो दिया और अधिक सटीक विधियों ने इसकी जगह ले ली[7]। फिर भी, यह MT मूल्यांकन के इतिहास में एक महत्वपूर्ण मील का पत्थर बना हुआ है और प्रगति मापते समय आधारभूत संदर्भ बिंदु के रूप में उपयोग में आता रहता है।

संदर्भ

  • BLEU मूल्यांकन क्या है? — Microsoft Azure प्रलेखन

टिप्पणियाँ

  1. 1.0 1.1 1.2 «BLEU». Wikipedia. [१]
  2. 2.0 2.1 Papineni, Kishore, et al. «Bleu: a Method for Automatic Evaluation of Machine Translation». Proceedings of the 40th Annual Meeting of the Association for Computational Linguistics, 2002. [२]
  3. 3.0 3.1 «BLEU». MT Companion 4.0 documentation. [३]
  4. Callison-Burch, Chris, et al. «BLEU: a Method for Automatic Evaluation of Machine Translation». Proceedings of the EACL 2006 Workshop on Statistical Machine Translation, 2006. [४]
  5. Cardete, Jorge. «Beyond BLEU Score. When it comes to the nuanced world of...». The Deep Hub | Medium. [५]
  6. «BLEURT: метрика для оценки моделей для генерации текста». Neurohive. [६]
  7. «Chief Digital and Artificial Intelligence Office > Lexicon». ai.mil. [७]