BERTScore

Материал из Systems analysis Wiki
Перейти к навигации Перейти к поиску

BERTScore — это автоматическая метрика для оценки качества сгенерированного текста, основанная на измерении семантического сходства с помощью контекстуальных эмбеддингов из предобученных языковых моделей, таких как BERT. Метрика была предложена в 2019 году группой исследователей во главе с Тяньи Чжаном (Tianyi Zhang) в работе «BERTScore: Evaluating Text Generation with BERT»[1].

В отличие от традиционных метрик, таких как BLEU и ROUGE, которые основаны на точном совпадении n-грамм, BERTScore позволяет выявлять эквивалентность смысла даже при различии в словах и формулировках, учитывая синонимы и парафразы[2].

Методика расчёта

Метод BERTScore состоит из нескольких этапов:

  1. Получение контекстуальных эмбеддингов: Оба текста (референсный и сгенерированный) разбиваются на токены и пропускаются через предобученную трансформерную модель (например, BERT или RoBERTa). Для каждого токена извлекается его контекстуальное векторное представление (эмбеддинг).
  2. Вычисление косинусного сходства: Для всех пар токенов из двух текстов вычисляется косинусное сходство, и формируется матрица подобия токенов[3].
  3. Расчёт точности, полноты и F1-меры: На основе матрицы сходства для каждого токена в сгенерированном тексте находится наиболее похожий токен в референсном тексте, что позволяет вычислить точность (precision). Аналогично, для каждого токена референса находится самый близкий токен в сгенерированном тексте, что даёт полноту (recall). Итоговым значением BERTScore является сбалансированная F₁-мера, которая комбинирует точность и полноту:
   RBERT=1|x|xixmaxyjyxiTyj(Recall)
   PBERT=1|y|yjymaxxixxiTyj(Precision)
   FBERT=2PBERTRBERTPBERT+RBERT

Метрика является гибкой: можно выбирать разные предобученные модели, взвешивать токены по их важности (с помощью IDF-весов) и линейно преобразовывать оценки для лучшей интерпретируемости[3].

Применение и эффективность

BERTScore применяется для оценки качества в различных задачах генерации текста:

  • Машинный перевод: Фиксирует сохранение смысла, даже если переводческие конструкции отличаются от эталонных.
  • Автоматическое реферирование: Способен определить, что разные формулировки могут передавать одни и те же ключевые факты, что делает его более гибким, чем ROUGE.
  • Диалоговые системы: Помогает измерять уместность ответа, сравнивая его с эталонным на уровне смысла.

Масштабная оценка, проведённая авторами, показала, что коэффициент корреляции BERTScore с человеческими оценками заметно выше, чем у метрик типа BLEU и ROUGE. Кроме того, метрика продемонстрировала повышенную устойчивость к сложным случаям перефразирования[1].

Преимущества

  • Учёт семантики: Сравнивает тексты на уровне смысла, учитывая синонимы и парафразы.
  • Высокая корреляция с человеком: Оценки BERTScore лучше согласуются с человеческими суждениями о качестве текста, чем традиционные метрики.
  • Универсальность и переносимость: Метрика не привязана к конкретному языку или задаче, достаточно выбрать соответствующую предобученную модель.
  • Отсутствие необходимости обучения: BERTScore является необучаемой метрикой, в отличие от более сложных метрик (например, BLEURT), которые требуют предварительного обучения на корпусах оценок.
  • Интеграция современных моделей: Использует мощь трансформеров для извлечения глубоких контекстных признаков.

Ограничения и критика

  • Высокие вычислительные затраты: Расчёт на основе эмбеддингов требует значительно больше ресурсов, чем подсчёт n-грамм, и часто требует использования GPU[2].
  • Зависимость от модели: Качество оценки напрямую связано с качеством предобученной модели. Выбор модели и слоя для извлечения эмбеддингов влияет на результат, что может вызывать проблемы с воспроизводимостью[4].
  • Отсутствие учёта фактов и структуры: BERTScore фокусируется на локальном семантическом сходстве и не гарантирует понимания структуры текста или фактической точности. Текст с переставленными фразами или фактическими ошибками может получить высокий балл[3].
  • Низкая интерпретируемость: В отличие от BLEU/ROUGE, показатель BERTScore является менее прозрачным, что затрудняет анализ ошибок.
  • Социальные смещения (bias): Метрика наследует стереотипы и смещения, заложенные в предобученных моделях. Исследование 2022 года показало, что метрики на базе LLM (включая BERTScore) проявляют значительно больший социальный bias, чем традиционные метрики[5].

Значение и роль в оценке

BERTScore представляет собой важный шаг в развитии методов оценки сгенерированного текста, поскольку позволяет учитывать смысловую эквивалентность, а не только лексические совпадения. Несмотря на то, что ни одна автоматическая метрика не способна идеально измерить качество текста, BERTScore зарекомендовал себя как надёжный инструмент, который дополняет классические подходы (такие как BLEU и ROUGE), а не заменяет их полностью.

На практике BERTScore часто используется в сочетании с ручной экспертизой и другими метриками для получения более полного и глубокого представления о том, насколько успешно модели генерируют связные и смысло-соответствующие тексты[2].

См. также

Ссылки

Примечания

  1. 1,0 1,1 Zhang, Tianyi, et al. «BERTScore: Evaluating Text Generation with BERT». arXiv:1904.09675 [cs.CL], 22 апр. 2019 г. [1]
  2. 2,0 2,1 2,2 «BERTScore: New Metrics for Language Models». Analytics Vidhya. [2]
  3. 3,0 3,1 3,2 Sojasingarayar, Abonia. «BERTScore Explained in 5 minutes». Medium. [3]
  4. Alakulju, D., et al. «Reproducibility of BERTScore». Theseus.fi. [4]
  5. Peyrard, M., et al. «BERTScore is Unfair: On Social Bias in Language Model-Based Metrics for Text Generation». arXiv:2210.07626 [cs.CL], 14 окт. 2022 г. [5]