BERTScore (metric) (UR)
BERTScore — یہ تیار کردہ متن کے معیار کی جانچ کے لیے ایک خودکار میٹرک ہے، جو BERT جیسے پیش تربیت یافتہ زبان کے ماڈلز سے حاصل کردہ contextual embeddings کے ذریعے معنوی مماثلت کی پیمائش پر مبنی ہے۔ یہ میٹرک 2019 میں تیانی ژانگ (Tianyi Zhang) کی قیادت میں محققین کی ایک ٹیم نے «BERTScore: Evaluating Text Generation with BERT» کے عنوان سے پیش کی تھی[1]۔
روایتی میٹرکس جیسے BLEU اور ROUGE کے برعکس، جو n-gram کے عین مطابق ملاپ پر مبنی ہیں، BERTScore الفاظ اور عبارتوں کے فرق کے باوجود مفہوم کی مساوات کو تلاش کرنے کی صلاحیت رکھتی ہے، کیونکہ یہ مترادفات اور paraphrases کو بھی مدنظر رکھتی ہے[2]۔
حساب کا طریقہ کار
BERTScore کا طریقہ کار کئی مراحل پر مشتمل ہے:
- Contextual Embeddings کا حصول: دونوں متون (حوالہ جاتی اور تیار کردہ) کو tokens میں تقسیم کیا جاتا ہے اور پیش تربیت یافتہ transformer ماڈل (مثلاً BERT یا RoBERTa) سے گزارا جاتا ہے۔ ہر token کے لیے اس کی contextual vector representation (embedding) نکالی جاتی ہے۔
- Cosine Similarity کا حساب: دونوں متون کے tokens کے تمام جوڑوں کے درمیان cosine similarity کا حساب لگایا جاتا ہے اور tokens کی مماثلت کا ایک matrix تیار کیا جاتا ہے[3]۔
- Precision، Recall اور F1 کا حساب: مماثلت کے matrix کی بنیاد پر، تیار کردہ متن کے ہر token کے لیے حوالہ جاتی متن میں سب سے زیادہ مشابہ token تلاش کیا جاتا ہے، جس سے درستگی (precision) معلوم ہوتی ہے۔ اسی طرح، حوالہ جاتی متن کے ہر token کے لیے تیار کردہ متن میں قریب ترین token تلاش کیا جاتا ہے، جس سے استیعاب (recall) حاصل ہوتا ہے۔ BERTScore کی حتمی قدر متوازن F₁ ہے، جو precision اور recall کو یکجا کرتی ہے:
یہ میٹرک لچکدار ہے: مختلف پیش تربیت یافتہ ماڈلز کا انتخاب کیا جا سکتا ہے، tokens کو ان کی اہمیت کے مطابق وزن دیا جا سکتا ہے (IDF weights کے ذریعے) اور بہتر قابلِ تعبیر نتائج کے لیے اسکورز کو خطی طور پر تبدیل کیا جا سکتا ہے[3]۔
اطلاق اور اثر انگیزی
BERTScore متن کی تیاری کے مختلف کاموں میں معیار کی جانچ کے لیے استعمال ہوتی ہے:
- مشینی ترجمہ: مفہوم کی حفاظت کو ریکارڈ کرتی ہے، چاہے ترجمے کی ساختیں معیاری نمونوں سے مختلف ہوں۔
- خودکار خلاصہ نویسی: یہ معلوم کر سکتی ہے کہ مختلف عبارتیں ایک جیسے اہم حقائق بیان کر سکتی ہیں، جو اسے ROUGE سے زیادہ لچکدار بناتی ہے۔
- مکالماتی نظام: جواب کی مناسبت کو معنوی سطح پر معیاری جواب سے موازنہ کر کے ناپنے میں مدد کرتی ہے۔
مصنفین کی جانب سے کی گئی وسیع جانچ سے ظاہر ہوا کہ انسانی تشخیص کے ساتھ BERTScore کا correlation coefficient BLEU اور ROUGE جیسی میٹرکس کے مقابلے میں نمایاں طور پر زیادہ ہے۔ اس کے علاوہ، میٹرک نے پیچیدہ paraphrasing کی صورتوں میں بھی بہتر استحکام کا مظاہرہ کیا[1]۔
فوائد
- معنویات کا لحاظ: متون کا موازنہ مفہوم کی سطح پر کرتی ہے، مترادفات اور paraphrases کو بھی مدنظر رکھتے ہوئے۔
- انسانی رائے سے زیادہ مطابقت: BERTScore کے نتائج متن کے معیار کے بارے میں انسانی فیصلوں سے روایتی میٹرکس کی نسبت بہتر ہم آہنگ ہوتے ہیں۔
- عالمگیریت اور قابلِ منتقلی: یہ میٹرک کسی مخصوص زبان یا کام سے منسلک نہیں، بس مناسب پیش تربیت یافتہ ماڈل کا انتخاب کافی ہے۔
- تربیت کی ضرورت نہیں: BERTScore ایک غیر تربیت یافتہ میٹرک ہے، جو زیادہ پیچیدہ میٹرکس (مثلاً BLEURT) کے برعکس ہے جن کے لیے تشخیصی corpora پر پیشگی تربیت درکار ہوتی ہے۔
- جدید ماڈلز کا انضمام: گہری contextual خصوصیات نکالنے کے لیے transformers کی طاقت استعمال کرتی ہے۔
حدود اور تنقید
- زیادہ حسابی لاگت: Embeddings پر مبنی حساب کتاب کے لیے n-gram گنتی کی نسبت بہت زیادہ وسائل درکار ہوتے ہیں اور اکثر GPU کا استعمال ضروری ہوتا ہے[2]۔
- ماڈل پر انحصار: جانچ کا معیار براہِ راست پیش تربیت یافتہ ماڈل کے معیار سے جڑا ہے۔ embeddings نکالنے کے لیے ماڈل اور layer کا انتخاب نتیجے پر اثر ڈالتا ہے، جو دوبارہ پذیری میں مسائل پیدا کر سکتا ہے[4]۔
- حقائق اور ساخت کا لحاظ نہیں: BERTScore مقامی معنوی مماثلت پر توجہ مرکوز کرتی ہے اور متن کی ساخت یا حقیقی درستگی کی فہم کی ضمانت نہیں دیتی۔ الٹ پھیر جملوں یا حقیقی غلطیوں والا متن بھی اونچا اسکور حاصل کر سکتا ہے[3]۔
- کم قابلِ تعبیر: BLEU/ROUGE کے برعکس، BERTScore کا اشاریہ کم شفاف ہے، جو غلطیوں کے تجزیے کو مشکل بناتا ہے۔
- سماجی تعصبات (bias): یہ میٹرک پیش تربیت یافتہ ماڈلز میں موجود دقیانوسی تصورات اور تعصبات کو وراثت میں پاتی ہے۔ 2022 کی ایک تحقیق سے ظاہر ہوا کہ LLM پر مبنی میٹرکس (BERTScore سمیت) روایتی میٹرکس کی نسبت نمایاں طور پر زیادہ سماجی bias ظاہر کرتی ہیں[5]۔
اہمیت اور جانچ میں کردار
BERTScore تیار کردہ متن کی جانچ کے طریقوں کی ترقی میں ایک اہم قدم کی نمائندگی کرتی ہے، کیونکہ یہ محض لغوی ملاپ کے بجائے معنوی مساوات کو مدنظر رکھنے کی اجازت دیتی ہے۔ اس حقیقت کے باوجود کہ کوئی بھی خودکار میٹرک متن کے معیار کو بالکل ٹھیک نہیں ناپ سکتی، BERTScore نے خود کو ایک قابلِ اعتماد آلے کے طور پر ثابت کیا ہے جو کلاسیکی طریقوں (جیسے BLEU اور ROUGE) کی تکمیل کرتی ہے، نہ کہ انہیں مکمل طور پر متبادل کرتی ہے۔
عملی طور پر BERTScore کو اکثر دستی ماہرانہ جانچ اور دیگر میٹرکس کے ساتھ مل کر استعمال کیا جاتا ہے تاکہ اس بارے میں زیادہ مکمل اور گہرا تصور حاصل ہو سکے کہ ماڈلز منسجم اور معنوی طور پر موزوں متون کتنی کامیابی سے تیار کرتے ہیں[2]۔
حوالہ جات
- BERTScore کا سرکاری GitHub ذخیرہ
حواشی
- ↑ 1.0 1.1 Zhang, Tianyi, et al. «BERTScore: Evaluating Text Generation with BERT». arXiv:1904.09675 [cs.CL], 22 апр. 2019 г. [1]
- ↑ 2.0 2.1 2.2 «BERTScore: New Metrics for Language Models». Analytics Vidhya. [2]
- ↑ 3.0 3.1 3.2 Sojasingarayar, Abonia. «BERTScore Explained in 5 minutes». Medium. [3]
- ↑ Alakulju, D., et al. «Reproducibility of BERTScore». Theseus.fi. [4]
- ↑ Peyrard, M., et al. «BERTScore is Unfair: On Social Bias in Language Model-Based Metrics for Text Generation». arXiv:2210.07626 [cs.CL], 14 окт. 2022 г. [5]