---
title: "BERTScore (metric) (HI)"
source: "https://systems-analysis.info/int/BERTScore_(metric)_(HI)"
wiki: "systems-analysis.info/int"
article: "BERTScore_(metric)_(HI)"
language: "hi"
categories:
  - "Category:Hindi"
  - "Category:Large language models"
  - "Category:LLM evaluation"
  - "Category:Machine learning"
revision_id: 549
wiki_created_at: 2026-09-06T22:35:27Z
wiki_modified_at: 2026-09-06T22:35:27Z
downloaded_at: 2026-09-07T22:40:56Z
---

# BERTScore (metric) (HI)

**BERTScore** — यह जेनरेट किए गए पाठ की गुणवत्ता मूल्यांकन के लिए एक स्वचालित मेट्रिक है, जो BERT जैसे पूर्व-प्रशिक्षित भाषा मॉडलों के contextual embeddings की सहायता से semantic similarity मापने पर आधारित है। यह मेट्रिक 2019 में **Tianyi Zhang** के नेतृत्व में शोधकर्ताओं के एक समूह द्वारा «BERTScore: Evaluating Text Generation with BERT» शोधपत्र में प्रस्तावित की गई थी<sup>[\[1\]](https://systems-analysis.info/int/BERTScore_(metric)_(HI)#cite_note-bertscore_paper-1)</sup>।

पारंपरिक मेट्रिक्स जैसे BLEU और ROUGE के विपरीत, जो n-gram के सटीक मिलान पर आधारित हैं, BERTScore शब्दों और वाक्यांशों में भिन्नता होने पर भी अर्थ की समानता को पहचानने में सक्षम है, क्योंकि यह पर्यायवाची शब्दों और paraphrases को ध्यान में रखता है<sup>[\[2\]](https://systems-analysis.info/int/BERTScore_(metric)_(HI)#cite_note-analytics_vidhya-2)</sup>।

## गणना की पद्धति

BERTScore की विधि में कई चरण होते हैं:

1.  **Contextual Embeddings प्राप्त करना**: दोनों पाठ (संदर्भ और जेनरेट किया गया) tokens में विभाजित किए जाते हैं और एक पूर्व-प्रशिक्षित transformer मॉडल (जैसे BERT या RoBERTa) से गुज़ारे जाते हैं। प्रत्येक token के लिए उसका contextual vector representation (embedding) निकाला जाता है।
2.  **Cosine Similarity की गणना**: दोनों पाठों के सभी token युग्मों के लिए cosine similarity की गणना की जाती है और tokens की समानता का एक matrix तैयार किया जाता है<sup>[\[3\]](https://systems-analysis.info/int/BERTScore_(metric)_(HI)#cite_note-bertscore_explained-3)</sup>।
3.  **Precision, Recall और F1-measure की गणना**: similarity matrix के आधार पर, जेनरेट किए गए पाठ के प्रत्येक token के लिए संदर्भ पाठ में सबसे समान token खोजा जाता है, जिससे **precision** की गणना होती है। इसी प्रकार, संदर्भ के प्रत्येक token के लिए जेनरेट किए गए पाठ में सबसे निकटतम token खोजा जाता है, जिससे **recall** प्राप्त होता है। BERTScore का अंतिम मान संतुलित F₁-measure होता है, जो precision और recall को मिलाता है:

<!-- -->

       RBERT=1|x|∑xi∈xmaxyj∈yxiTyj(Recall)
       PBERT=1|y|∑yj∈ymaxxi∈xxiTyj(Precision)
       FBERT=2PBERT⋅RBERTPBERT+RBERT

यह मेट्रिक लचीली है: विभिन्न पूर्व-प्रशिक्षित मॉडल चुने जा सकते हैं, tokens को उनके महत्व के अनुसार IDF-weights से भारित किया जा सकता है, और बेहतर व्याख्या के लिए scores को रैखिक रूप से रूपांतरित किया जा सकता है<sup>[\[3\]](https://systems-analysis.info/int/BERTScore_(metric)_(HI)#cite_note-bertscore_explained-3)</sup>।

## उपयोग और प्रभावशीलता

BERTScore पाठ जनरेशन के विभिन्न कार्यों में गुणवत्ता मूल्यांकन के लिए उपयोग किया जाता है:

- **मशीन अनुवाद**: अर्थ की सुरक्षा को पकड़ता है, भले ही अनुवाद की संरचनाएँ संदर्भ से भिन्न हों।
- **स्वचालित सारांशीकरण**: यह निर्धारित करने में सक्षम है कि अलग-अलग शब्दावलियाँ एक ही मुख्य तथ्यों को व्यक्त कर सकती हैं, जो इसे ROUGE से अधिक लचीला बनाता है।
- **संवाद प्रणालियाँ**: उत्तर की उपयुक्तता को अर्थ के स्तर पर संदर्भ से तुलना करके मापने में सहायता करता है।

लेखकों द्वारा किए गए व्यापक मूल्यांकन से पता चला कि मानवीय मूल्यांकन के साथ BERTScore का सहसंबंध गुणांक BLEU और ROUGE जैसी मेट्रिक्स की तुलना में **उल्लेखनीय रूप से अधिक** है। इसके अतिरिक्त, मेट्रिक ने paraphrasing के जटिल मामलों में बेहतर स्थिरता प्रदर्शित की<sup>[\[1\]](https://systems-analysis.info/int/BERTScore_(metric)_(HI)#cite_note-bertscore_paper-1)</sup>।

## लाभ

- **Semantics का ध्यान**: पाठों की तुलना अर्थ के स्तर पर करता है, पर्यायवाची शब्दों और paraphrases को ध्यान में रखता है।
- **मानव मूल्यांकन के साथ उच्च सहसंबंध**: BERTScore के मूल्यांकन पारंपरिक मेट्रिक्स की तुलना में पाठ गुणवत्ता के मानवीय निर्णयों के साथ बेहतर मेल खाते हैं।
- **सार्वभौमिकता और हस्तांतरणीयता**: मेट्रिक किसी विशेष भाषा या कार्य से बंधी नहीं है; उपयुक्त पूर्व-प्रशिक्षित मॉडल चुनना पर्याप्त है।
- **प्रशिक्षण की आवश्यकता नहीं**: BERTScore एक **गैर-प्रशिक्षणीय मेट्रिक** है, उन अधिक जटिल मेट्रिक्स (जैसे BLEURT) के विपरीत जिन्हें मूल्यांकन corpus पर पूर्व-प्रशिक्षण की आवश्यकता होती है।
- **आधुनिक मॉडलों का एकीकरण**: गहरी contextual विशेषताएँ निकालने के लिए transformers की शक्ति का उपयोग करता है।

## सीमाएँ और आलोचना

- **उच्च कम्प्यूटेशनल लागत**: embeddings पर आधारित गणना के लिए n-gram गिनती की तुलना में काफी अधिक संसाधनों की आवश्यकता होती है और अक्सर GPU के उपयोग की जरूरत पड़ती है<sup>[\[2\]](https://systems-analysis.info/int/BERTScore_(metric)_(HI)#cite_note-analytics_vidhya-2)</sup>।
- **मॉडल पर निर्भरता**: मूल्यांकन की गुणवत्ता सीधे पूर्व-प्रशिक्षित मॉडल की गुणवत्ता से जुड़ी है। embeddings निकालने के लिए मॉडल और layer का चुनाव परिणाम को प्रभावित करता है, जिससे पुनरुत्पादन में समस्याएँ हो सकती हैं<sup>[\[4\]](https://systems-analysis.info/int/BERTScore_(metric)_(HI)#cite_note-theseus_fi-4)</sup>।
- **तथ्यों और संरचना का ध्यान नहीं**: BERTScore स्थानीय semantic similarity पर ध्यान केंद्रित करता है और पाठ की संरचना या तथ्यात्मक सटीकता की समझ की गारंटी नहीं देता। वाक्यांशों की अदला-बदली या तथ्यात्मक त्रुटियों वाले पाठ को उच्च अंक मिल सकते हैं<sup>[\[3\]](https://systems-analysis.info/int/BERTScore_(metric)_(HI)#cite_note-bertscore_explained-3)</sup>।
- **कम व्याख्यायोग्यता**: BLEU/ROUGE के विपरीत, BERTScore का मान कम पारदर्शी है, जिससे त्रुटि विश्लेषण कठिन हो जाता है।
- **सामाजिक bias**: मेट्रिक पूर्व-प्रशिक्षित मॉडलों में निहित रूढ़िवादिता और bias को विरासत में लेती है। 2022 के एक अध्ययन से पता चला कि LLM-आधारित मेट्रिक्स (BERTScore सहित) पारंपरिक मेट्रिक्स की तुलना में काफी अधिक सामाजिक bias प्रदर्शित करती हैं<sup>[\[5\]](https://systems-analysis.info/int/BERTScore_(metric)_(HI)#cite_note-bertscore_unfair-5)</sup>।

## मूल्यांकन में महत्व और भूमिका

BERTScore जेनरेट किए गए पाठ के मूल्यांकन की विधियों के विकास में एक महत्वपूर्ण कदम है, क्योंकि यह केवल शाब्दिक मिलान के बजाय अर्थगत समानता को ध्यान में रखने की अनुमति देता है। यद्यपि कोई भी स्वचालित मेट्रिक पाठ की गुणवत्ता को पूरी तरह से नहीं माप सकती, BERTScore ने एक विश्वसनीय उपकरण के रूप में अपनी पहचान बनाई है जो पारंपरिक दृष्टिकोणों (जैसे BLEU और ROUGE) का पूरक है, न कि उन्हें पूरी तरह प्रतिस्थापित करता है।

व्यवहार में, BERTScore अक्सर मानव विशेषज्ञ मूल्यांकन और अन्य मेट्रिक्स के साथ संयोजन में उपयोग किया जाता है, ताकि यह अधिक पूर्ण और गहरी समझ प्राप्त हो सके कि मॉडल सुसंगत और अर्थपूर्ण पाठ उत्पन्न करने में कितने सफल हैं<sup>[\[2\]](https://systems-analysis.info/int/BERTScore_(metric)_(HI)#cite_note-analytics_vidhya-2)</sup>।

## सन्दर्भ

- GitHub पर BERTScore का आधिकारिक repository

## टिप्पणियाँ

1.  <span id="cite_note-bertscore_paper-1">↑ <sup>[1.0](https://systems-analysis.info/int/BERTScore_(metric)_(HI)#cite_ref-bertscore_paper_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/BERTScore_(metric)_(HI)#cite_ref-bertscore_paper_1-1)</sup> Zhang, Tianyi, et al. «BERTScore: Evaluating Text Generation with BERT». *arXiv:1904.09675* \[cs.CL\], 22 апр. 2019 г. <a href="https://arxiv.org/abs/1904.09675" class="external autonumber" rel="nofollow">[१]</a></span>
2.  <span id="cite_note-analytics_vidhya-2">↑ <sup>[2.0](https://systems-analysis.info/int/BERTScore_(metric)_(HI)#cite_ref-analytics_vidhya_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/BERTScore_(metric)_(HI)#cite_ref-analytics_vidhya_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/BERTScore_(metric)_(HI)#cite_ref-analytics_vidhya_2-2)</sup> «BERTScore: New Metrics for Language Models». *Analytics Vidhya*. <a href="https://www.analyticsvidhya.com/blog/2025/04/bertscore-a-contextual-metric-for-llm-evaluation/" class="external autonumber" rel="nofollow">[२]</a></span>
3.  <span id="cite_note-bertscore_explained-3">↑ <sup>[3.0](https://systems-analysis.info/int/BERTScore_(metric)_(HI)#cite_ref-bertscore_explained_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/BERTScore_(metric)_(HI)#cite_ref-bertscore_explained_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/BERTScore_(metric)_(HI)#cite_ref-bertscore_explained_3-2)</sup> Sojasingarayar, Abonia. «BERTScore Explained in 5 minutes». *Medium*. <a href="https://medium.com/@abonia/bertscore-explained-in-5-minutes-0b98553bfb71" class="external autonumber" rel="nofollow">[३]</a></span>
4.  <span id="cite_note-theseus_fi-4">[↑](https://systems-analysis.info/int/BERTScore_(metric)_(HI)#cite_ref-theseus_fi_4-0) Alakulju, D., et al. «Reproducibility of BERTScore». *Theseus.fi*. <a href="https://www.theseus.fi/bitstream/handle/10024/884189/Alakulju_Dkhili_Moufida.pdf?sequence=2&amp;isAllowed=y" class="external autonumber" rel="nofollow">[४]</a></span>
5.  <span id="cite_note-bertscore_unfair-5">[↑](https://systems-analysis.info/int/BERTScore_(metric)_(HI)#cite_ref-bertscore_unfair_5-0) Peyrard, M., et al. «BERTScore is Unfair: On Social Bias in Language Model-Based Metrics for Text Generation». *arXiv:2210.07626* \[cs.CL\], 14 окт. 2022 г. <a href="https://arxiv.org/abs/2210.07626" class="external autonumber" rel="nofollow">[५]</a></span>
