BERTScore (metric) (BN)
BERTScore — এটি একটি স্বয়ংক্রিয় মেট্রিক যা BERT-এর মতো পূর্বপ্রশিক্ষিত ভাষা মডেল থেকে প্রাপ্ত প্রাসঙ্গিক embedding ব্যবহার করে শব্দার্থিক সাদৃশ্য পরিমাপের মাধ্যমে সৃজিত পাঠ্যের মান মূল্যায়ন করে। মেট্রিকটি ২০১৯ সালে তিয়ানয়ি ঝ্যাং (Tianyi Zhang)-এর নেতৃত্বে একদল গবেষক কর্তৃক «BERTScore: Evaluating Text Generation with BERT» গবেষণাপত্রে প্রস্তাবিত হয়েছিল[1]।
BLEU এবং ROUGE-এর মতো প্রচলিত মেট্রিকগুলি যেখানে n-gram-এর হুবহু মিলের উপর ভিত্তি করে কাজ করে, সেখানে BERTScore শব্দ ও প্রকাশভঙ্গিতে পার্থক্য থাকলেও প্রতিশব্দ ও paraphrase বিবেচনা করে অর্থের সমতুল্যতা শনাক্ত করতে সক্ষম[2]।
গণনার পদ্ধতি
BERTScore পদ্ধতিটি কয়েকটি ধাপে গঠিত:
- প্রাসঙ্গিক embedding সংগ্রহ: উভয় পাঠ্য (রেফারেন্স ও সৃজিত) token-এ বিভক্ত করে একটি পূর্বপ্রশিক্ষিত transformer মডেলের (যেমন BERT বা RoBERTa) মধ্য দিয়ে পাঠানো হয়। প্রতিটি token-এর জন্য তার প্রাসঙ্গিক ভেক্টর উপস্থাপনা (embedding) বের করা হয়।
- কোসাইন সাদৃশ্য গণনা: দুটি পাঠ্যের সকল token-জুটির জন্য কোসাইন সাদৃশ্য গণনা করা হয় এবং token সাদৃশ্যের একটি ম্যাট্রিক্স তৈরি করা হয়[3]।
- Precision, Recall ও F1-মান নির্ণয়: সাদৃশ্য ম্যাট্রিক্সের ভিত্তিতে সৃজিত পাঠ্যের প্রতিটি token-এর জন্য রেফারেন্স পাঠ্যের সবচেয়ে কাছের token খুঁজে বের করা হয়, যা থেকে precision গণনা করা যায়। একইভাবে, রেফারেন্সের প্রতিটি token-এর জন্য সৃজিত পাঠ্যের সবচেয়ে কাছের token খুঁজে recall নির্ণয় করা হয়। BERTScore-এর চূড়ান্ত মান হলো সুষম F₁-মান, যা precision ও recall-কে একত্রিত করে:
মেট্রিকটি নমনীয়: বিভিন্ন পূর্বপ্রশিক্ষিত মডেল বেছে নেওয়া যায়, IDF-ওজন দিয়ে token-গুলিকে তাদের গুরুত্ব অনুযায়ী ওজন দেওয়া যায় এবং আরও ভালো ব্যাখ্যাযোগ্যতার জন্য মানগুলিকে রৈখিকভাবে রূপান্তরিত করা যায়[3]।
প্রয়োগ ও কার্যকারিতা
BERTScore পাঠ্য সৃষ্টির বিভিন্ন কাজে মান মূল্যায়নে ব্যবহৃত হয়:
- মেশিন অনুবাদ: অনুবাদের কাঠামো রেফারেন্স থেকে আলাদা হলেও অর্থের সংরক্ষণ শনাক্ত করতে পারে।
- স্বয়ংক্রিয় সারসংক্ষেপ: ভিন্ন প্রকাশভঙ্গি একই মূল তথ্য বহন করছে কিনা তা নির্ধারণ করতে পারে, যা একে ROUGE-এর চেয়ে বেশি নমনীয় করে।
- কথোপকথন ব্যবস্থা: অর্থের স্তরে রেফারেন্সের সাথে তুলনা করে উত্তরের প্রাসঙ্গিকতা পরিমাপ করতে সাহায্য করে।
লেখকদের পরিচালিত বড় আকারের মূল্যায়নে দেখা গেছে যে মানব মূল্যায়নের সাথে BERTScore-এর সম্পর্ক সহগ BLEU ও ROUGE-এর মতো মেট্রিকের তুলনায় উল্লেখযোগ্যভাবে বেশি। এছাড়া, মেট্রিকটি জটিল paraphrase-এর ক্ষেত্রে উন্নত দৃঢ়তা প্রদর্শন করেছে[1]।
সুবিধাসমূহ
- শব্দার্থিকতার বিবেচনা: প্রতিশব্দ ও paraphrase বিবেচনা করে অর্থের স্তরে পাঠ্য তুলনা করে।
- মানবীয় রায়ের সাথে উচ্চ সম্পর্ক: BERTScore-এর মান পাঠ্যের মান সম্পর্কে মানবীয় রায়ের সাথে প্রচলিত মেট্রিকের চেয়ে ভালোভাবে সামঞ্জস্যপূর্ণ।
- সার্বজনীনতা ও বহনযোগ্যতা: মেট্রিকটি কোনো নির্দিষ্ট ভাষা বা কাজের সাথে আবদ্ধ নয়, উপযুক্ত পূর্বপ্রশিক্ষিত মডেল বেছে নেওয়াই যথেষ্ট।
- প্রশিক্ষণের প্রয়োজনীয়তার অনুপস্থিতি: BERTScore একটি অপ্রশিক্ষণযোগ্য মেট্রিক, যেখানে আরও জটিল মেট্রিক (যেমন BLEURT) মূল্যায়ন corpus-এ পূর্বপ্রশিক্ষণ প্রয়োজন করে।
- আধুনিক মডেলের একীভূতকরণ: গভীর প্রাসঙ্গিক বৈশিষ্ট্য বের করতে transformer-এর শক্তি ব্যবহার করে।
সীমাবদ্ধতা ও সমালোচনা
- উচ্চ গণনামূলক ব্যয়: Embedding-ভিত্তিক গণনা n-gram গণনার চেয়ে অনেক বেশি সম্পদ প্রয়োজন করে এবং প্রায়ই GPU ব্যবহারের প্রয়োজন হয়[2]।
- মডেলের উপর নির্ভরশীলতা: মূল্যায়নের মান সরাসরি পূর্বপ্রশিক্ষিত মডেলের মানের সাথে সম্পর্কিত। মডেল ও embedding বের করার স্তরের পছন্দ ফলাফলকে প্রভাবিত করে, যা পুনরুৎপাদনযোগ্যতার সমস্যা সৃষ্টি করতে পারে[4]।
- তথ্য ও কাঠামোর বিবেচনার অনুপস্থিতি: BERTScore স্থানীয় শব্দার্থিক সাদৃশ্যের উপর মনোনিবেশ করে এবং পাঠ্যের কাঠামো বা তথ্যগত নির্ভুলতার বোঝাপড়া নিশ্চিত করে না। পুনর্বিন্যস্ত বাক্যাংশ বা তথ্যগত ত্রুটিযুক্ত পাঠ্য উচ্চ স্কোর পেতে পারে[3]।
- কম ব্যাখ্যাযোগ্যতা: BLEU/ROUGE-এর বিপরীতে, BERTScore-এর সূচকটি কম স্বচ্ছ, যা ত্রুটি বিশ্লেষণকে কঠিন করে তোলে।
- সামাজিক পক্ষপাত (bias): মেট্রিকটি পূর্বপ্রশিক্ষিত মডেলে অন্তর্নিহিত ছাঁচ ও পক্ষপাত উত্তরাধিকারসূত্রে পায়। ২০২২ সালের একটি গবেষণায় দেখা গেছে যে LLM-ভিত্তিক মেট্রিক (BERTScore সহ) প্রচলিত মেট্রিকের তুলনায় উল্লেখযোগ্যভাবে বেশি সামাজিক bias প্রদর্শন করে[5]।
মূল্যায়নে তাৎপর্য ও ভূমিকা
BERTScore সৃজিত পাঠ্যের মূল্যায়ন পদ্ধতির বিকাশে একটি গুরুত্বপূর্ণ পদক্ষেপ প্রতিনিধিত্ব করে, কারণ এটি কেবল শাব্দিক মিলের পরিবর্তে অর্থগত সমতুল্যতা বিবেচনা করতে পারে। যদিও কোনো স্বয়ংক্রিয় মেট্রিকই পাঠ্যের মান নিখুঁতভাবে পরিমাপ করতে পারে না, BERTScore একটি নির্ভরযোগ্য হাতিয়ার হিসেবে নিজেকে প্রমাণ করেছে যা BLEU ও ROUGE-এর মতো ক্লাসিক পদ্ধতির পরিপূরক হিসেবে কাজ করে, তাদের সম্পূর্ণরূপে প্রতিস্থাপন না করে।
ব্যবহারিক ক্ষেত্রে BERTScore প্রায়ই হাতে-কলমে বিশেষজ্ঞ পর্যালোচনা ও অন্যান্য মেট্রিকের সাথে মিলিয়ে ব্যবহার করা হয়, যাতে মডেলগুলি কতটা সফলভাবে সংগতিপূর্ণ ও অর্থসামঞ্জস্যপূর্ণ পাঠ্য তৈরি করছে সে সম্পর্কে আরও সম্পূর্ণ ও গভীর ধারণা পাওয়া যায়[2]।
তথ্যসূত্র
- GitHub-এ BERTScore-এর অফিসিয়াল রিপোজিটরি
টীকা
- ↑ 1.0 1.1 Zhang, Tianyi, et al. «BERTScore: Evaluating Text Generation with BERT». arXiv:1904.09675 [cs.CL], 22 апр. 2019 г. [১]
- ↑ 2.0 2.1 2.2 «BERTScore: New Metrics for Language Models». Analytics Vidhya. [২]
- ↑ 3.0 3.1 3.2 Sojasingarayar, Abonia. «BERTScore Explained in 5 minutes». Medium. [৩]
- ↑ Alakulju, D., et al. «Reproducibility of BERTScore». Theseus.fi. [৪]
- ↑ Peyrard, M., et al. «BERTScore is Unfair: On Social Bias in Language Model-Based Metrics for Text Generation». arXiv:2210.07626 [cs.CL], 14 окт. 2022 г. [৫]