---
title: "BERTScore (metric) (BN)"
source: "https://systems-analysis.info/int/BERTScore_(metric)_(BN)"
wiki: "systems-analysis.info/int"
article: "BERTScore_(metric)_(BN)"
language: "bn"
categories:
  - "Category:Bengali"
  - "Category:Large language models"
  - "Category:LLM evaluation"
  - "Category:Machine learning"
revision_id: 541
wiki_created_at: 2026-09-06T22:35:20Z
wiki_modified_at: 2026-09-06T22:35:20Z
downloaded_at: 2026-09-07T22:40:53Z
---

# BERTScore (metric) (BN)

**BERTScore** — এটি একটি স্বয়ংক্রিয় মেট্রিক যা BERT-এর মতো পূর্বপ্রশিক্ষিত ভাষা মডেল থেকে প্রাপ্ত প্রাসঙ্গিক embedding ব্যবহার করে শব্দার্থিক সাদৃশ্য পরিমাপের মাধ্যমে সৃজিত পাঠ্যের মান মূল্যায়ন করে। মেট্রিকটি ২০১৯ সালে **তিয়ানয়ি ঝ্যাং** (Tianyi Zhang)-এর নেতৃত্বে একদল গবেষক কর্তৃক «BERTScore: Evaluating Text Generation with BERT» গবেষণাপত্রে প্রস্তাবিত হয়েছিল<sup>[\[1\]](https://systems-analysis.info/int/BERTScore_(metric)_(BN)#cite_note-bertscore_paper-1)</sup>।

BLEU এবং ROUGE-এর মতো প্রচলিত মেট্রিকগুলি যেখানে n-gram-এর হুবহু মিলের উপর ভিত্তি করে কাজ করে, সেখানে BERTScore শব্দ ও প্রকাশভঙ্গিতে পার্থক্য থাকলেও প্রতিশব্দ ও paraphrase বিবেচনা করে অর্থের সমতুল্যতা শনাক্ত করতে সক্ষম<sup>[\[2\]](https://systems-analysis.info/int/BERTScore_(metric)_(BN)#cite_note-analytics_vidhya-2)</sup>।

## গণনার পদ্ধতি

BERTScore পদ্ধতিটি কয়েকটি ধাপে গঠিত:

1.  **প্রাসঙ্গিক embedding সংগ্রহ**: উভয় পাঠ্য (রেফারেন্স ও সৃজিত) token-এ বিভক্ত করে একটি পূর্বপ্রশিক্ষিত transformer মডেলের (যেমন BERT বা RoBERTa) মধ্য দিয়ে পাঠানো হয়। প্রতিটি token-এর জন্য তার প্রাসঙ্গিক ভেক্টর উপস্থাপনা (embedding) বের করা হয়।
2.  **কোসাইন সাদৃশ্য গণনা**: দুটি পাঠ্যের সকল token-জুটির জন্য কোসাইন সাদৃশ্য গণনা করা হয় এবং token সাদৃশ্যের একটি ম্যাট্রিক্স তৈরি করা হয়<sup>[\[3\]](https://systems-analysis.info/int/BERTScore_(metric)_(BN)#cite_note-bertscore_explained-3)</sup>।
3.  **Precision, Recall ও F1-মান নির্ণয়**: সাদৃশ্য ম্যাট্রিক্সের ভিত্তিতে সৃজিত পাঠ্যের প্রতিটি token-এর জন্য রেফারেন্স পাঠ্যের সবচেয়ে কাছের token খুঁজে বের করা হয়, যা থেকে **precision** গণনা করা যায়। একইভাবে, রেফারেন্সের প্রতিটি token-এর জন্য সৃজিত পাঠ্যের সবচেয়ে কাছের token খুঁজে **recall** নির্ণয় করা হয়। BERTScore-এর চূড়ান্ত মান হলো সুষম F₁-মান, যা precision ও recall-কে একত্রিত করে:

<!-- -->

       RBERT=1|x|∑xi∈xmaxyj∈yxiTyj(Recall)
       PBERT=1|y|∑yj∈ymaxxi∈xxiTyj(Precision)
       FBERT=2PBERT⋅RBERTPBERT+RBERT

মেট্রিকটি নমনীয়: বিভিন্ন পূর্বপ্রশিক্ষিত মডেল বেছে নেওয়া যায়, IDF-ওজন দিয়ে token-গুলিকে তাদের গুরুত্ব অনুযায়ী ওজন দেওয়া যায় এবং আরও ভালো ব্যাখ্যাযোগ্যতার জন্য মানগুলিকে রৈখিকভাবে রূপান্তরিত করা যায়<sup>[\[3\]](https://systems-analysis.info/int/BERTScore_(metric)_(BN)#cite_note-bertscore_explained-3)</sup>।

## প্রয়োগ ও কার্যকারিতা

BERTScore পাঠ্য সৃষ্টির বিভিন্ন কাজে মান মূল্যায়নে ব্যবহৃত হয়:

- **মেশিন অনুবাদ**: অনুবাদের কাঠামো রেফারেন্স থেকে আলাদা হলেও অর্থের সংরক্ষণ শনাক্ত করতে পারে।
- **স্বয়ংক্রিয় সারসংক্ষেপ**: ভিন্ন প্রকাশভঙ্গি একই মূল তথ্য বহন করছে কিনা তা নির্ধারণ করতে পারে, যা একে ROUGE-এর চেয়ে বেশি নমনীয় করে।
- **কথোপকথন ব্যবস্থা**: অর্থের স্তরে রেফারেন্সের সাথে তুলনা করে উত্তরের প্রাসঙ্গিকতা পরিমাপ করতে সাহায্য করে।

লেখকদের পরিচালিত বড় আকারের মূল্যায়নে দেখা গেছে যে মানব মূল্যায়নের সাথে BERTScore-এর সম্পর্ক সহগ BLEU ও ROUGE-এর মতো মেট্রিকের তুলনায় **উল্লেখযোগ্যভাবে বেশি**। এছাড়া, মেট্রিকটি জটিল paraphrase-এর ক্ষেত্রে উন্নত দৃঢ়তা প্রদর্শন করেছে<sup>[\[1\]](https://systems-analysis.info/int/BERTScore_(metric)_(BN)#cite_note-bertscore_paper-1)</sup>।

## সুবিধাসমূহ

- **শব্দার্থিকতার বিবেচনা**: প্রতিশব্দ ও paraphrase বিবেচনা করে অর্থের স্তরে পাঠ্য তুলনা করে।
- **মানবীয় রায়ের সাথে উচ্চ সম্পর্ক**: BERTScore-এর মান পাঠ্যের মান সম্পর্কে মানবীয় রায়ের সাথে প্রচলিত মেট্রিকের চেয়ে ভালোভাবে সামঞ্জস্যপূর্ণ।
- **সার্বজনীনতা ও বহনযোগ্যতা**: মেট্রিকটি কোনো নির্দিষ্ট ভাষা বা কাজের সাথে আবদ্ধ নয়, উপযুক্ত পূর্বপ্রশিক্ষিত মডেল বেছে নেওয়াই যথেষ্ট।
- **প্রশিক্ষণের প্রয়োজনীয়তার অনুপস্থিতি**: BERTScore একটি **অপ্রশিক্ষণযোগ্য মেট্রিক**, যেখানে আরও জটিল মেট্রিক (যেমন BLEURT) মূল্যায়ন corpus-এ পূর্বপ্রশিক্ষণ প্রয়োজন করে।
- **আধুনিক মডেলের একীভূতকরণ**: গভীর প্রাসঙ্গিক বৈশিষ্ট্য বের করতে transformer-এর শক্তি ব্যবহার করে।

## সীমাবদ্ধতা ও সমালোচনা

- **উচ্চ গণনামূলক ব্যয়**: Embedding-ভিত্তিক গণনা n-gram গণনার চেয়ে অনেক বেশি সম্পদ প্রয়োজন করে এবং প্রায়ই GPU ব্যবহারের প্রয়োজন হয়<sup>[\[2\]](https://systems-analysis.info/int/BERTScore_(metric)_(BN)#cite_note-analytics_vidhya-2)</sup>।
- **মডেলের উপর নির্ভরশীলতা**: মূল্যায়নের মান সরাসরি পূর্বপ্রশিক্ষিত মডেলের মানের সাথে সম্পর্কিত। মডেল ও embedding বের করার স্তরের পছন্দ ফলাফলকে প্রভাবিত করে, যা পুনরুৎপাদনযোগ্যতার সমস্যা সৃষ্টি করতে পারে<sup>[\[4\]](https://systems-analysis.info/int/BERTScore_(metric)_(BN)#cite_note-theseus_fi-4)</sup>।
- **তথ্য ও কাঠামোর বিবেচনার অনুপস্থিতি**: BERTScore স্থানীয় শব্দার্থিক সাদৃশ্যের উপর মনোনিবেশ করে এবং পাঠ্যের কাঠামো বা তথ্যগত নির্ভুলতার বোঝাপড়া নিশ্চিত করে না। পুনর্বিন্যস্ত বাক্যাংশ বা তথ্যগত ত্রুটিযুক্ত পাঠ্য উচ্চ স্কোর পেতে পারে<sup>[\[3\]](https://systems-analysis.info/int/BERTScore_(metric)_(BN)#cite_note-bertscore_explained-3)</sup>।
- **কম ব্যাখ্যাযোগ্যতা**: BLEU/ROUGE-এর বিপরীতে, BERTScore-এর সূচকটি কম স্বচ্ছ, যা ত্রুটি বিশ্লেষণকে কঠিন করে তোলে।
- **সামাজিক পক্ষপাত (bias)**: মেট্রিকটি পূর্বপ্রশিক্ষিত মডেলে অন্তর্নিহিত ছাঁচ ও পক্ষপাত উত্তরাধিকারসূত্রে পায়। ২০২২ সালের একটি গবেষণায় দেখা গেছে যে LLM-ভিত্তিক মেট্রিক (BERTScore সহ) প্রচলিত মেট্রিকের তুলনায় উল্লেখযোগ্যভাবে বেশি সামাজিক bias প্রদর্শন করে<sup>[\[5\]](https://systems-analysis.info/int/BERTScore_(metric)_(BN)#cite_note-bertscore_unfair-5)</sup>।

## মূল্যায়নে তাৎপর্য ও ভূমিকা

BERTScore সৃজিত পাঠ্যের মূল্যায়ন পদ্ধতির বিকাশে একটি গুরুত্বপূর্ণ পদক্ষেপ প্রতিনিধিত্ব করে, কারণ এটি কেবল শাব্দিক মিলের পরিবর্তে অর্থগত সমতুল্যতা বিবেচনা করতে পারে। যদিও কোনো স্বয়ংক্রিয় মেট্রিকই পাঠ্যের মান নিখুঁতভাবে পরিমাপ করতে পারে না, BERTScore একটি নির্ভরযোগ্য হাতিয়ার হিসেবে নিজেকে প্রমাণ করেছে যা BLEU ও ROUGE-এর মতো ক্লাসিক পদ্ধতির পরিপূরক হিসেবে কাজ করে, তাদের সম্পূর্ণরূপে প্রতিস্থাপন না করে।

ব্যবহারিক ক্ষেত্রে BERTScore প্রায়ই হাতে-কলমে বিশেষজ্ঞ পর্যালোচনা ও অন্যান্য মেট্রিকের সাথে মিলিয়ে ব্যবহার করা হয়, যাতে মডেলগুলি কতটা সফলভাবে সংগতিপূর্ণ ও অর্থসামঞ্জস্যপূর্ণ পাঠ্য তৈরি করছে সে সম্পর্কে আরও সম্পূর্ণ ও গভীর ধারণা পাওয়া যায়<sup>[\[2\]](https://systems-analysis.info/int/BERTScore_(metric)_(BN)#cite_note-analytics_vidhya-2)</sup>।

## তথ্যসূত্র

- GitHub-এ BERTScore-এর অফিসিয়াল রিপোজিটরি

## টীকা

1.  <span id="cite_note-bertscore_paper-1">↑ <sup>[1.0](https://systems-analysis.info/int/BERTScore_(metric)_(BN)#cite_ref-bertscore_paper_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/BERTScore_(metric)_(BN)#cite_ref-bertscore_paper_1-1)</sup> Zhang, Tianyi, et al. «BERTScore: Evaluating Text Generation with BERT». *arXiv:1904.09675* \[cs.CL\], 22 апр. 2019 г. <a href="https://arxiv.org/abs/1904.09675" class="external autonumber" rel="nofollow">[১]</a></span>
2.  <span id="cite_note-analytics_vidhya-2">↑ <sup>[2.0](https://systems-analysis.info/int/BERTScore_(metric)_(BN)#cite_ref-analytics_vidhya_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/BERTScore_(metric)_(BN)#cite_ref-analytics_vidhya_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/BERTScore_(metric)_(BN)#cite_ref-analytics_vidhya_2-2)</sup> «BERTScore: New Metrics for Language Models». *Analytics Vidhya*. <a href="https://www.analyticsvidhya.com/blog/2025/04/bertscore-a-contextual-metric-for-llm-evaluation/" class="external autonumber" rel="nofollow">[২]</a></span>
3.  <span id="cite_note-bertscore_explained-3">↑ <sup>[3.0](https://systems-analysis.info/int/BERTScore_(metric)_(BN)#cite_ref-bertscore_explained_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/BERTScore_(metric)_(BN)#cite_ref-bertscore_explained_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/BERTScore_(metric)_(BN)#cite_ref-bertscore_explained_3-2)</sup> Sojasingarayar, Abonia. «BERTScore Explained in 5 minutes». *Medium*. <a href="https://medium.com/@abonia/bertscore-explained-in-5-minutes-0b98553bfb71" class="external autonumber" rel="nofollow">[৩]</a></span>
4.  <span id="cite_note-theseus_fi-4">[↑](https://systems-analysis.info/int/BERTScore_(metric)_(BN)#cite_ref-theseus_fi_4-0) Alakulju, D., et al. «Reproducibility of BERTScore». *Theseus.fi*. <a href="https://www.theseus.fi/bitstream/handle/10024/884189/Alakulju_Dkhili_Moufida.pdf?sequence=2&amp;isAllowed=y" class="external autonumber" rel="nofollow">[৪]</a></span>
5.  <span id="cite_note-bertscore_unfair-5">[↑](https://systems-analysis.info/int/BERTScore_(metric)_(BN)#cite_ref-bertscore_unfair_5-0) Peyrard, M., et al. «BERTScore is Unfair: On Social Bias in Language Model-Based Metrics for Text Generation». *arXiv:2210.07626* \[cs.CL\], 14 окт. 2022 г. <a href="https://arxiv.org/abs/2210.07626" class="external autonumber" rel="nofollow">[৫]</a></span>
