---
title: "BERTScore (metric) (BG)"
source: "https://systems-analysis.info/int/BERTScore_(metric)_(BG)"
wiki: "systems-analysis.info/int"
article: "BERTScore_(metric)_(BG)"
language: "bg"
categories:
  - "Category:Bulgarian"
  - "Category:Large language models"
  - "Category:LLM evaluation"
  - "Category:Machine learning"
revision_id: 540
wiki_created_at: 2026-09-06T22:35:19Z
wiki_modified_at: 2026-09-06T22:35:19Z
downloaded_at: 2026-09-07T22:40:53Z
---

# BERTScore (metric) (BG)

**BERTScore** — това е автоматична метрика за оценка на качеството на генериран текст, базирана на измерване на семантично сходство чрез контекстуални embedding-и от предобучени езикови модели като BERT. Метриката е предложена през 2019 година от група изследователи начело с **Тяньи Джан** (Tianyi Zhang) в работата „BERTScore: Evaluating Text Generation with BERT"<sup>[\[1\]](https://systems-analysis.info/int/BERTScore_(metric)_(BG)#cite_note-bertscore_paper-1)</sup>.

За разлика от традиционните метрики като BLEU и ROUGE, които се основават на точно съвпадение на n-грами, BERTScore позволява да се открива еквивалентност на смисъла дори при разлики в думите и формулировките, отчитайки синоними и парафрази<sup>[\[2\]](https://systems-analysis.info/int/BERTScore_(metric)_(BG)#cite_note-analytics_vidhya-2)</sup>.

## Методика на изчисление

Методът BERTScore се състои от няколко етапа:

1.  **Получаване на контекстуални embedding-и**: И двата текста (референсният и генерираният) се разбиват на token-и и се прекарват през предобучен transformer модел (например BERT или RoBERTa). За всеки token се извлича неговото контекстуално векторно представление (embedding).
2.  **Изчисляване на косинусното сходство**: За всички двойки token-и от двата текста се изчислява косинусното сходство и се формира матрица на сходство на token-ите<sup>[\[3\]](https://systems-analysis.info/int/BERTScore_(metric)_(BG)#cite_note-bertscore_explained-3)</sup>.
3.  **Изчисляване на точност, пълнота и F1-мярка**: Въз основа на матрицата на сходство за всеки token в генерирания текст се открива най-сходният token в референсния текст, което позволява да се изчисли **точност** (*precision*). По аналогия, за всеки token на референса се открива най-близкият token в генерирания текст, което дава **пълнота** (*recall*). Крайната стойност на BERTScore е балансираната F₁-мярка, която комбинира точността и пълнотата:

<!-- -->

       RextBERT=1|x|∑xi∈xmaxyj∈yxiTyj(extRecall)
       PextBERT=1|y|∑yj∈ymaxxi∈xxiTyj(extPrecision)
       FextBERT=2PextBERT⋅RextBERTPextBERT+RextBERT

Метриката е гъвкава: може да се избират различни предобучени модели, да се претеглят token-ите по тяхната важност (с помощта на IDF-тегла) и да се прилагат линейни трансформации на оценките за по-добра интерпретируемост<sup>[\[3\]](https://systems-analysis.info/int/BERTScore_(metric)_(BG)#cite_note-bertscore_explained-3)</sup>.

## Приложение и ефективност

BERTScore се прилага за оценка на качеството при различни задачи за генерация на текст:

- **Машинен превод**: Улавя запазването на смисъла, дори когато преводаческите конструкции се различават от еталонните.
- **Автоматично реферирване**: Способна е да установи, че различни формулировки могат да предават едни и същи ключови факти, което я прави по-гъвкава от ROUGE.
- **Диалогови системи**: Помага за измерване на уместността на отговора, като го сравнява с еталонния на ниво смисъл.

Мащабната оценка, проведена от авторите, показа, че коефициентът на корелация на BERTScore с човешките оценки е **значително по-висок**, отколкото при метрики от типа BLEU и ROUGE. Освен това метриката демонстрира повишена устойчивост към сложни случаи на перифразиране<sup>[\[1\]](https://systems-analysis.info/int/BERTScore_(metric)_(BG)#cite_note-bertscore_paper-1)</sup>.

## Предимства

- **Отчитане на семантиката**: Сравнява текстовете на ниво смисъл, отчитайки синоними и парафрази.
- **Висока корелация с човека**: Оценките на BERTScore се съгласуват по-добре с човешките преценки за качеството на текста, отколкото традиционните метрики.
- **Универсалност и преносимост**: Метриката не е обвързана с конкретен език или задача — достатъчно е да се избере подходящ предобучен модел.
- **Без необходимост от обучение**: BERTScore е **необучаема метрика**, за разлика от по-сложни метрики (например BLEURT), които изискват предварително обучение върху корпуси от оценки.
- **Интеграция на съвременни модели**: Използва мощта на transformer-ите за извличане на дълбоки контекстни признаци.

## Ограничения и критика

- **Високи изчислителни разходи**: Изчислението на базата на embedding-и изисква значително повече ресурси, отколкото преброяването на n-грами, и често налага използването на GPU<sup>[\[2\]](https://systems-analysis.info/int/BERTScore_(metric)_(BG)#cite_note-analytics_vidhya-2)</sup>.
- **Зависимост от модела**: Качеството на оценката е пряко свързано с качеството на предобучения модел. Изборът на модел и слой за извличане на embedding-и влияе върху резултата, което може да създаде проблеми с възпроизводимостта<sup>[\[4\]](https://systems-analysis.info/int/BERTScore_(metric)_(BG)#cite_note-theseus_fi-4)</sup>.
- **Липса на отчитане на факти и структура**: BERTScore се фокусира върху локалното семантично сходство и не гарантира разбиране на структурата на текста или фактическата точност. Текст с разменени фрази или фактически грешки може да получи висок резултат<sup>[\[3\]](https://systems-analysis.info/int/BERTScore_(metric)_(BG)#cite_note-bertscore_explained-3)</sup>.
- **Ниска интерпретируемост**: За разлика от BLEU/ROUGE, показателят BERTScore е по-малко прозрачен, което затруднява анализа на грешките.
- **Социални отклонения (bias)**: Метриката наследява стереотипите и отклоненията, заложени в предобучените модели. Изследване от 2022 година показа, че метриките на базата на LLM (включително BERTScore) проявяват значително по-голям социален bias от традиционните метрики<sup>[\[5\]](https://systems-analysis.info/int/BERTScore_(metric)_(BG)#cite_note-bertscore_unfair-5)</sup>.

## Значение и роля в оценяването

BERTScore представлява важна стъпка в развитието на методите за оценка на генериран текст, тъй като позволява да се отчита смисловата еквивалентност, а не само лексическите съвпадения. Въпреки че никоя автоматична метрика не е в състояние идеално да измери качеството на текста, BERTScore се е утвърдил като надежден инструмент, който допълва класическите подходи (като BLEU и ROUGE), а не ги замества изцяло.

На практика BERTScore често се използва в съчетание с ръчна експертиза и други метрики, за да се получи по-пълна и задълбочена представа за това, колко успешно моделите генерират свързани и смислово съответстващи текстове<sup>[\[2\]](https://systems-analysis.info/int/BERTScore_(metric)_(BG)#cite_note-analytics_vidhya-2)</sup>.

## Препратки

- Официално хранилище на BERTScore в GitHub

## Бележки

1.  <span id="cite_note-bertscore_paper-1">↑ <sup>[1.0](https://systems-analysis.info/int/BERTScore_(metric)_(BG)#cite_ref-bertscore_paper_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/BERTScore_(metric)_(BG)#cite_ref-bertscore_paper_1-1)</sup> Zhang, Tianyi, et al. «BERTScore: Evaluating Text Generation with BERT». *arXiv:1904.09675* \[cs.CL\], 22 апр. 2019 г. <a href="https://arxiv.org/abs/1904.09675" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-analytics_vidhya-2">↑ <sup>[2.0](https://systems-analysis.info/int/BERTScore_(metric)_(BG)#cite_ref-analytics_vidhya_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/BERTScore_(metric)_(BG)#cite_ref-analytics_vidhya_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/BERTScore_(metric)_(BG)#cite_ref-analytics_vidhya_2-2)</sup> «BERTScore: New Metrics for Language Models». *Analytics Vidhya*. <a href="https://www.analyticsvidhya.com/blog/2025/04/bertscore-a-contextual-metric-for-llm-evaluation/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-bertscore_explained-3">↑ <sup>[3.0](https://systems-analysis.info/int/BERTScore_(metric)_(BG)#cite_ref-bertscore_explained_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/BERTScore_(metric)_(BG)#cite_ref-bertscore_explained_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/BERTScore_(metric)_(BG)#cite_ref-bertscore_explained_3-2)</sup> Sojasingarayar, Abonia. «BERTScore Explained in 5 minutes». *Medium*. <a href="https://medium.com/@abonia/bertscore-explained-in-5-minutes-0b98553bfb71" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-theseus_fi-4">[↑](https://systems-analysis.info/int/BERTScore_(metric)_(BG)#cite_ref-theseus_fi_4-0) Alakulju, D., et al. «Reproducibility of BERTScore». *Theseus.fi*. <a href="https://www.theseus.fi/bitstream/handle/10024/884189/Alakulju_Dkhili_Moufida.pdf?sequence=2&amp;isAllowed=y" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-bertscore_unfair-5">[↑](https://systems-analysis.info/int/BERTScore_(metric)_(BG)#cite_ref-bertscore_unfair_5-0) Peyrard, M., et al. «BERTScore is Unfair: On Social Bias in Language Model-Based Metrics for Text Generation». *arXiv:2210.07626* \[cs.CL\], 14 окт. 2022 г. <a href="https://arxiv.org/abs/2210.07626" class="external autonumber" rel="nofollow">[5]</a></span>
