BERTScore (metric) (HI)
BERTScore — यह जेनरेट किए गए पाठ की गुणवत्ता मूल्यांकन के लिए एक स्वचालित मेट्रिक है, जो BERT जैसे पूर्व-प्रशिक्षित भाषा मॉडलों के contextual embeddings की सहायता से semantic similarity मापने पर आधारित है। यह मेट्रिक 2019 में Tianyi Zhang के नेतृत्व में शोधकर्ताओं के एक समूह द्वारा «BERTScore: Evaluating Text Generation with BERT» शोधपत्र में प्रस्तावित की गई थी[1]।
पारंपरिक मेट्रिक्स जैसे BLEU और ROUGE के विपरीत, जो n-gram के सटीक मिलान पर आधारित हैं, BERTScore शब्दों और वाक्यांशों में भिन्नता होने पर भी अर्थ की समानता को पहचानने में सक्षम है, क्योंकि यह पर्यायवाची शब्दों और paraphrases को ध्यान में रखता है[2]।
गणना की पद्धति
BERTScore की विधि में कई चरण होते हैं:
- Contextual Embeddings प्राप्त करना: दोनों पाठ (संदर्भ और जेनरेट किया गया) tokens में विभाजित किए जाते हैं और एक पूर्व-प्रशिक्षित transformer मॉडल (जैसे BERT या RoBERTa) से गुज़ारे जाते हैं। प्रत्येक token के लिए उसका contextual vector representation (embedding) निकाला जाता है।
- Cosine Similarity की गणना: दोनों पाठों के सभी token युग्मों के लिए cosine similarity की गणना की जाती है और tokens की समानता का एक matrix तैयार किया जाता है[3]।
- Precision, Recall और F1-measure की गणना: similarity matrix के आधार पर, जेनरेट किए गए पाठ के प्रत्येक token के लिए संदर्भ पाठ में सबसे समान token खोजा जाता है, जिससे precision की गणना होती है। इसी प्रकार, संदर्भ के प्रत्येक token के लिए जेनरेट किए गए पाठ में सबसे निकटतम token खोजा जाता है, जिससे recall प्राप्त होता है। BERTScore का अंतिम मान संतुलित F₁-measure होता है, जो precision और recall को मिलाता है:
यह मेट्रिक लचीली है: विभिन्न पूर्व-प्रशिक्षित मॉडल चुने जा सकते हैं, tokens को उनके महत्व के अनुसार IDF-weights से भारित किया जा सकता है, और बेहतर व्याख्या के लिए scores को रैखिक रूप से रूपांतरित किया जा सकता है[3]।
उपयोग और प्रभावशीलता
BERTScore पाठ जनरेशन के विभिन्न कार्यों में गुणवत्ता मूल्यांकन के लिए उपयोग किया जाता है:
- मशीन अनुवाद: अर्थ की सुरक्षा को पकड़ता है, भले ही अनुवाद की संरचनाएँ संदर्भ से भिन्न हों।
- स्वचालित सारांशीकरण: यह निर्धारित करने में सक्षम है कि अलग-अलग शब्दावलियाँ एक ही मुख्य तथ्यों को व्यक्त कर सकती हैं, जो इसे ROUGE से अधिक लचीला बनाता है।
- संवाद प्रणालियाँ: उत्तर की उपयुक्तता को अर्थ के स्तर पर संदर्भ से तुलना करके मापने में सहायता करता है।
लेखकों द्वारा किए गए व्यापक मूल्यांकन से पता चला कि मानवीय मूल्यांकन के साथ BERTScore का सहसंबंध गुणांक BLEU और ROUGE जैसी मेट्रिक्स की तुलना में उल्लेखनीय रूप से अधिक है। इसके अतिरिक्त, मेट्रिक ने paraphrasing के जटिल मामलों में बेहतर स्थिरता प्रदर्शित की[1]।
लाभ
- Semantics का ध्यान: पाठों की तुलना अर्थ के स्तर पर करता है, पर्यायवाची शब्दों और paraphrases को ध्यान में रखता है।
- मानव मूल्यांकन के साथ उच्च सहसंबंध: BERTScore के मूल्यांकन पारंपरिक मेट्रिक्स की तुलना में पाठ गुणवत्ता के मानवीय निर्णयों के साथ बेहतर मेल खाते हैं।
- सार्वभौमिकता और हस्तांतरणीयता: मेट्रिक किसी विशेष भाषा या कार्य से बंधी नहीं है; उपयुक्त पूर्व-प्रशिक्षित मॉडल चुनना पर्याप्त है।
- प्रशिक्षण की आवश्यकता नहीं: BERTScore एक गैर-प्रशिक्षणीय मेट्रिक है, उन अधिक जटिल मेट्रिक्स (जैसे BLEURT) के विपरीत जिन्हें मूल्यांकन corpus पर पूर्व-प्रशिक्षण की आवश्यकता होती है।
- आधुनिक मॉडलों का एकीकरण: गहरी contextual विशेषताएँ निकालने के लिए transformers की शक्ति का उपयोग करता है।
सीमाएँ और आलोचना
- उच्च कम्प्यूटेशनल लागत: embeddings पर आधारित गणना के लिए n-gram गिनती की तुलना में काफी अधिक संसाधनों की आवश्यकता होती है और अक्सर GPU के उपयोग की जरूरत पड़ती है[2]।
- मॉडल पर निर्भरता: मूल्यांकन की गुणवत्ता सीधे पूर्व-प्रशिक्षित मॉडल की गुणवत्ता से जुड़ी है। embeddings निकालने के लिए मॉडल और layer का चुनाव परिणाम को प्रभावित करता है, जिससे पुनरुत्पादन में समस्याएँ हो सकती हैं[4]।
- तथ्यों और संरचना का ध्यान नहीं: BERTScore स्थानीय semantic similarity पर ध्यान केंद्रित करता है और पाठ की संरचना या तथ्यात्मक सटीकता की समझ की गारंटी नहीं देता। वाक्यांशों की अदला-बदली या तथ्यात्मक त्रुटियों वाले पाठ को उच्च अंक मिल सकते हैं[3]।
- कम व्याख्यायोग्यता: BLEU/ROUGE के विपरीत, BERTScore का मान कम पारदर्शी है, जिससे त्रुटि विश्लेषण कठिन हो जाता है।
- सामाजिक bias: मेट्रिक पूर्व-प्रशिक्षित मॉडलों में निहित रूढ़िवादिता और bias को विरासत में लेती है। 2022 के एक अध्ययन से पता चला कि LLM-आधारित मेट्रिक्स (BERTScore सहित) पारंपरिक मेट्रिक्स की तुलना में काफी अधिक सामाजिक bias प्रदर्शित करती हैं[5]।
मूल्यांकन में महत्व और भूमिका
BERTScore जेनरेट किए गए पाठ के मूल्यांकन की विधियों के विकास में एक महत्वपूर्ण कदम है, क्योंकि यह केवल शाब्दिक मिलान के बजाय अर्थगत समानता को ध्यान में रखने की अनुमति देता है। यद्यपि कोई भी स्वचालित मेट्रिक पाठ की गुणवत्ता को पूरी तरह से नहीं माप सकती, BERTScore ने एक विश्वसनीय उपकरण के रूप में अपनी पहचान बनाई है जो पारंपरिक दृष्टिकोणों (जैसे BLEU और ROUGE) का पूरक है, न कि उन्हें पूरी तरह प्रतिस्थापित करता है।
व्यवहार में, BERTScore अक्सर मानव विशेषज्ञ मूल्यांकन और अन्य मेट्रिक्स के साथ संयोजन में उपयोग किया जाता है, ताकि यह अधिक पूर्ण और गहरी समझ प्राप्त हो सके कि मॉडल सुसंगत और अर्थपूर्ण पाठ उत्पन्न करने में कितने सफल हैं[2]।
सन्दर्भ
- GitHub पर BERTScore का आधिकारिक repository
टिप्पणियाँ
- ↑ 1.0 1.1 Zhang, Tianyi, et al. «BERTScore: Evaluating Text Generation with BERT». arXiv:1904.09675 [cs.CL], 22 апр. 2019 г. [१]
- ↑ 2.0 2.1 2.2 «BERTScore: New Metrics for Language Models». Analytics Vidhya. [२]
- ↑ 3.0 3.1 3.2 Sojasingarayar, Abonia. «BERTScore Explained in 5 minutes». Medium. [३]
- ↑ Alakulju, D., et al. «Reproducibility of BERTScore». Theseus.fi. [४]
- ↑ Peyrard, M., et al. «BERTScore is Unfair: On Social Bias in Language Model-Based Metrics for Text Generation». arXiv:2210.07626 [cs.CL], 14 окт. 2022 г. [५]