---
title: "BERTScore"
source: "https://systems-analysis.info/wiki/BERTScore"
wiki: "systems-analysis.info/wiki"
article: "BERTScore"
language: "ru"
categories:
  - "Категория:Russian"
  - "Категория:Большие языковые модели"
  - "Категория:Машинное обучение"
  - "Категория:Оценка LLM"
revision_id: 72
wiki_created_at: 2026-09-06T21:54:35Z
wiki_modified_at: 2026-09-06T21:54:35Z
downloaded_at: 2026-09-07T22:17:13Z
---

# BERTScore

**BERTScore** — это автоматическая метрика для оценки качества сгенерированного текста, основанная на измерении семантического сходства с помощью контекстуальных эмбеддингов из предобученных языковых моделей, таких как [BERT](https://systems-analysis.info/wiki/BERT "BERT"). Метрика была предложена в 2019 году группой исследователей во главе с **Тяньи Чжаном** (Tianyi Zhang) в работе «BERTScore: Evaluating Text Generation with BERT»<sup>[\[1\]](https://systems-analysis.info/wiki/BERTScore#cite_note-bertscore_paper-1)</sup>.

В отличие от традиционных метрик, таких как [BLEU](https://systems-analysis.info/wiki/BLEU "BLEU") и [ROUGE](https://systems-analysis.info/wiki/ROUGE "ROUGE"), которые основаны на точном совпадении n-грамм, BERTScore позволяет выявлять эквивалентность смысла даже при различии в словах и формулировках, учитывая синонимы и парафразы<sup>[\[2\]](https://systems-analysis.info/wiki/BERTScore#cite_note-analytics_vidhya-2)</sup>.

## Методика расчёта

Метод BERTScore состоит из нескольких этапов:

1.  **Получение контекстуальных эмбеддингов**: Оба текста (референсный и сгенерированный) разбиваются на [токены](https://systems-analysis.info/wiki/%D0%A2%D0%BE%D0%BA%D0%B5%D0%BD "Токен") и пропускаются через предобученную трансформерную модель (например, BERT или RoBERTa). Для каждого токена извлекается его контекстуальное векторное представление (эмбеддинг).
2.  **Вычисление косинусного сходства**: Для всех пар токенов из двух текстов вычисляется косинусное сходство, и формируется матрица подобия токенов<sup>[\[3\]](https://systems-analysis.info/wiki/BERTScore#cite_note-bertscore_explained-3)</sup>.
3.  **Расчёт точности, полноты и F1-меры**: На основе матрицы сходства для каждого токена в сгенерированном тексте находится наиболее похожий токен в референсном тексте, что позволяет вычислить **точность** (*precision*). Аналогично, для каждого токена референса находится самый близкий токен в сгенерированном тексте, что даёт **полноту** (*recall*). Итоговым значением BERTScore является сбалансированная F₁-мера, которая комбинирует точность и полноту:

<!-- -->

       RBERT=1|x|∑xi∈xmaxyj∈yxiTyj(Recall)
       PBERT=1|y|∑yj∈ymaxxi∈xxiTyj(Precision)
       FBERT=2PBERT⋅RBERTPBERT+RBERT

Метрика является гибкой: можно выбирать разные предобученные модели, взвешивать токены по их важности (с помощью IDF-весов) и линейно преобразовывать оценки для лучшей интерпретируемости<sup>[\[3\]](https://systems-analysis.info/wiki/BERTScore#cite_note-bertscore_explained-3)</sup>.

## Применение и эффективность

BERTScore применяется для оценки качества в различных задачах генерации текста:

- **Машинный перевод**: Фиксирует сохранение смысла, даже если переводческие конструкции отличаются от эталонных.
- **Автоматическое реферирование**: Способен определить, что разные формулировки могут передавать одни и те же ключевые факты, что делает его более гибким, чем ROUGE.
- **Диалоговые системы**: Помогает измерять уместность ответа, сравнивая его с эталонным на уровне смысла.

Масштабная оценка, проведённая авторами, показала, что коэффициент корреляции BERTScore с человеческими оценками **заметно выше**, чем у метрик типа BLEU и ROUGE. Кроме того, метрика продемонстрировала повышенную устойчивость к сложным случаям перефразирования<sup>[\[1\]](https://systems-analysis.info/wiki/BERTScore#cite_note-bertscore_paper-1)</sup>.

## Преимущества

- **Учёт семантики**: Сравнивает тексты на уровне смысла, учитывая синонимы и парафразы.
- **Высокая корреляция с человеком**: Оценки BERTScore лучше согласуются с человеческими суждениями о качестве текста, чем традиционные метрики.
- **Универсальность и переносимость**: Метрика не привязана к конкретному языку или задаче, достаточно выбрать соответствующую предобученную модель.
- **Отсутствие необходимости обучения**: BERTScore является **необучаемой метрикой**, в отличие от более сложных метрик (например, BLEURT), которые требуют предварительного обучения на корпусах оценок.
- **Интеграция современных моделей**: Использует мощь трансформеров для извлечения глубоких контекстных признаков.

## Ограничения и критика

- **Высокие вычислительные затраты**: Расчёт на основе эмбеддингов требует значительно больше ресурсов, чем подсчёт n-грамм, и часто требует использования GPU<sup>[\[2\]](https://systems-analysis.info/wiki/BERTScore#cite_note-analytics_vidhya-2)</sup>.
- **Зависимость от модели**: Качество оценки напрямую связано с качеством предобученной модели. Выбор модели и слоя для извлечения эмбеддингов влияет на результат, что может вызывать проблемы с воспроизводимостью<sup>[\[4\]](https://systems-analysis.info/wiki/BERTScore#cite_note-theseus_fi-4)</sup>.
- **Отсутствие учёта фактов и структуры**: BERTScore фокусируется на локальном семантическом сходстве и не гарантирует понимания структуры текста или фактической точности. Текст с переставленными фразами или фактическими ошибками может получить высокий балл<sup>[\[3\]](https://systems-analysis.info/wiki/BERTScore#cite_note-bertscore_explained-3)</sup>.
- **Низкая интерпретируемость**: В отличие от BLEU/ROUGE, показатель BERTScore является менее прозрачным, что затрудняет анализ ошибок.
- **Социальные смещения (bias)**: Метрика наследует стереотипы и смещения, заложенные в предобученных моделях. Исследование 2022 года показало, что метрики на базе LLM (включая BERTScore) проявляют значительно больший социальный bias, чем традиционные метрики<sup>[\[5\]](https://systems-analysis.info/wiki/BERTScore#cite_note-bertscore_unfair-5)</sup>.

## Значение и роль в оценке

BERTScore представляет собой важный шаг в развитии методов оценки сгенерированного текста, поскольку позволяет учитывать смысловую эквивалентность, а не только лексические совпадения. Несмотря на то, что ни одна автоматическая метрика не способна идеально измерить качество текста, BERTScore зарекомендовал себя как надёжный инструмент, который дополняет классические подходы (такие как BLEU и ROUGE), а не заменяет их полностью.

На практике BERTScore часто используется в сочетании с ручной экспертизой и другими метриками для получения более полного и глубокого представления о том, насколько успешно модели генерируют связные и смысло-соответствующие тексты<sup>[\[2\]](https://systems-analysis.info/wiki/BERTScore#cite_note-analytics_vidhya-2)</sup>.

## См. также

- [Метрики качества LLM](https://systems-analysis.info/wiki/%D0%9C%D0%B5%D1%82%D1%80%D0%B8%D0%BA%D0%B8_%D0%BA%D0%B0%D1%87%D0%B5%D1%81%D1%82%D0%B2%D0%B0_LLM "Метрики качества LLM")
- [Оценка LLM](https://systems-analysis.info/wiki/%D0%9E%D1%86%D0%B5%D0%BD%D0%BA%D0%B0_LLM "Оценка LLM")
- [ROUGE](https://systems-analysis.info/wiki/ROUGE "ROUGE")
- [BLEU](https://systems-analysis.info/wiki/BLEU "BLEU")
- [LLM‑as‑a‑Judge](https://systems-analysis.info/wiki/LLM%E2%80%91as%E2%80%91a%E2%80%91Judge "LLM‑as‑a‑Judge")

## Ссылки

- <a href="https://github.com/Tiiiger/bert_score" class="external text" rel="nofollow">Официальный репозиторий BERTScore на GitHub</a>

## Примечания

1.  <span id="cite_note-bertscore_paper-1">↑ <sup>[1,0](https://systems-analysis.info/wiki/BERTScore#cite_ref-bertscore_paper_1-0)</sup> <sup>[1,1](https://systems-analysis.info/wiki/BERTScore#cite_ref-bertscore_paper_1-1)</sup> Zhang, Tianyi, et al. «BERTScore: Evaluating Text Generation with BERT». *arXiv:1904.09675* \[cs.CL\], 22 апр. 2019 г. <a href="https://arxiv.org/abs/1904.09675" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-analytics_vidhya-2">↑ <sup>[2,0](https://systems-analysis.info/wiki/BERTScore#cite_ref-analytics_vidhya_2-0)</sup> <sup>[2,1](https://systems-analysis.info/wiki/BERTScore#cite_ref-analytics_vidhya_2-1)</sup> <sup>[2,2](https://systems-analysis.info/wiki/BERTScore#cite_ref-analytics_vidhya_2-2)</sup> «BERTScore: New Metrics for Language Models». *Analytics Vidhya*. <a href="https://www.analyticsvidhya.com/blog/2025/04/bertscore-a-contextual-metric-for-llm-evaluation/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-bertscore_explained-3">↑ <sup>[3,0](https://systems-analysis.info/wiki/BERTScore#cite_ref-bertscore_explained_3-0)</sup> <sup>[3,1](https://systems-analysis.info/wiki/BERTScore#cite_ref-bertscore_explained_3-1)</sup> <sup>[3,2](https://systems-analysis.info/wiki/BERTScore#cite_ref-bertscore_explained_3-2)</sup> Sojasingarayar, Abonia. «BERTScore Explained in 5 minutes». *Medium*. <a href="https://medium.com/@abonia/bertscore-explained-in-5-minutes-0b98553bfb71" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-theseus_fi-4">[↑](https://systems-analysis.info/wiki/BERTScore#cite_ref-theseus_fi_4-0) Alakulju, D., et al. «Reproducibility of BERTScore». *Theseus.fi*. <a href="https://www.theseus.fi/bitstream/handle/10024/884189/Alakulju_Dkhili_Moufida.pdf?sequence=2&amp;isAllowed=y" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-bertscore_unfair-5">[↑](https://systems-analysis.info/wiki/BERTScore#cite_ref-bertscore_unfair_5-0) Peyrard, M., et al. «BERTScore is Unfair: On Social Bias in Language Model-Based Metrics for Text Generation». *arXiv:2210.07626* \[cs.CL\], 14 окт. 2022 г. <a href="https://arxiv.org/abs/2210.07626" class="external autonumber" rel="nofollow">[5]</a></span>
