BERTScore (metric) (BG)
BERTScore — това е автоматична метрика за оценка на качеството на генериран текст, базирана на измерване на семантично сходство чрез контекстуални embedding-и от предобучени езикови модели като BERT. Метриката е предложена през 2019 година от група изследователи начело с Тяньи Джан (Tianyi Zhang) в работата „BERTScore: Evaluating Text Generation with BERT"[1].
За разлика от традиционните метрики като BLEU и ROUGE, които се основават на точно съвпадение на n-грами, BERTScore позволява да се открива еквивалентност на смисъла дори при разлики в думите и формулировките, отчитайки синоними и парафрази[2].
Методика на изчисление
Методът BERTScore се състои от няколко етапа:
- Получаване на контекстуални embedding-и: И двата текста (референсният и генерираният) се разбиват на token-и и се прекарват през предобучен transformer модел (например BERT или RoBERTa). За всеки token се извлича неговото контекстуално векторно представление (embedding).
- Изчисляване на косинусното сходство: За всички двойки token-и от двата текста се изчислява косинусното сходство и се формира матрица на сходство на token-ите[3].
- Изчисляване на точност, пълнота и F1-мярка: Въз основа на матрицата на сходство за всеки token в генерирания текст се открива най-сходният token в референсния текст, което позволява да се изчисли точност (precision). По аналогия, за всеки token на референса се открива най-близкият token в генерирания текст, което дава пълнота (recall). Крайната стойност на BERTScore е балансираната F₁-мярка, която комбинира точността и пълнотата:
Метриката е гъвкава: може да се избират различни предобучени модели, да се претеглят token-ите по тяхната важност (с помощта на IDF-тегла) и да се прилагат линейни трансформации на оценките за по-добра интерпретируемост[3].
Приложение и ефективност
BERTScore се прилага за оценка на качеството при различни задачи за генерация на текст:
- Машинен превод: Улавя запазването на смисъла, дори когато преводаческите конструкции се различават от еталонните.
- Автоматично реферирване: Способна е да установи, че различни формулировки могат да предават едни и същи ключови факти, което я прави по-гъвкава от ROUGE.
- Диалогови системи: Помага за измерване на уместността на отговора, като го сравнява с еталонния на ниво смисъл.
Мащабната оценка, проведена от авторите, показа, че коефициентът на корелация на BERTScore с човешките оценки е значително по-висок, отколкото при метрики от типа BLEU и ROUGE. Освен това метриката демонстрира повишена устойчивост към сложни случаи на перифразиране[1].
Предимства
- Отчитане на семантиката: Сравнява текстовете на ниво смисъл, отчитайки синоними и парафрази.
- Висока корелация с човека: Оценките на BERTScore се съгласуват по-добре с човешките преценки за качеството на текста, отколкото традиционните метрики.
- Универсалност и преносимост: Метриката не е обвързана с конкретен език или задача — достатъчно е да се избере подходящ предобучен модел.
- Без необходимост от обучение: BERTScore е необучаема метрика, за разлика от по-сложни метрики (например BLEURT), които изискват предварително обучение върху корпуси от оценки.
- Интеграция на съвременни модели: Използва мощта на transformer-ите за извличане на дълбоки контекстни признаци.
Ограничения и критика
- Високи изчислителни разходи: Изчислението на базата на embedding-и изисква значително повече ресурси, отколкото преброяването на n-грами, и често налага използването на GPU[2].
- Зависимост от модела: Качеството на оценката е пряко свързано с качеството на предобучения модел. Изборът на модел и слой за извличане на embedding-и влияе върху резултата, което може да създаде проблеми с възпроизводимостта[4].
- Липса на отчитане на факти и структура: BERTScore се фокусира върху локалното семантично сходство и не гарантира разбиране на структурата на текста или фактическата точност. Текст с разменени фрази или фактически грешки може да получи висок резултат[3].
- Ниска интерпретируемост: За разлика от BLEU/ROUGE, показателят BERTScore е по-малко прозрачен, което затруднява анализа на грешките.
- Социални отклонения (bias): Метриката наследява стереотипите и отклоненията, заложени в предобучените модели. Изследване от 2022 година показа, че метриките на базата на LLM (включително BERTScore) проявяват значително по-голям социален bias от традиционните метрики[5].
Значение и роля в оценяването
BERTScore представлява важна стъпка в развитието на методите за оценка на генериран текст, тъй като позволява да се отчита смисловата еквивалентност, а не само лексическите съвпадения. Въпреки че никоя автоматична метрика не е в състояние идеално да измери качеството на текста, BERTScore се е утвърдил като надежден инструмент, който допълва класическите подходи (като BLEU и ROUGE), а не ги замества изцяло.
На практика BERTScore често се използва в съчетание с ръчна експертиза и други метрики, за да се получи по-пълна и задълбочена представа за това, колко успешно моделите генерират свързани и смислово съответстващи текстове[2].
Препратки
- Официално хранилище на BERTScore в GitHub
Бележки
- ↑ 1.0 1.1 Zhang, Tianyi, et al. «BERTScore: Evaluating Text Generation with BERT». arXiv:1904.09675 [cs.CL], 22 апр. 2019 г. [1]
- ↑ 2.0 2.1 2.2 «BERTScore: New Metrics for Language Models». Analytics Vidhya. [2]
- ↑ 3.0 3.1 3.2 Sojasingarayar, Abonia. «BERTScore Explained in 5 minutes». Medium. [3]
- ↑ Alakulju, D., et al. «Reproducibility of BERTScore». Theseus.fi. [4]
- ↑ Peyrard, M., et al. «BERTScore is Unfair: On Social Bias in Language Model-Based Metrics for Text Generation». arXiv:2210.07626 [cs.CL], 14 окт. 2022 г. [5]