BLEU (Bilingual Evaluation Understudy) (BG)

From Systems analysis Wiki
Jump to navigation Jump to search

BLEU (от англ. Bilingual Evaluation Understudy — „двуезичен заместващ оценител") — това е алгоритъм за автоматична оценка на качеството на текст, преведен от машина. Оценката се извършва чрез сравняване на превода-кандидат с един или повече еталонни (референтни) човешки превода[1]. Качеството се определя от степента на лексикална близост на машинния превод до професионалния. Както отбелязват авторите, „колкото по-близо е машинният превод до превода на професионален човек, толкова е по-добър"[2].

Методът е предложен през 2002 година от група изследователи от IBM под ръководството на Кишор Папинени и се превърна в една от първите метрики, показали висока корелация с оценките на експерти-преводачи. BLEU бързо спечели популярност благодарение на простотата на изчисление, езиковата независимост и доброто съответствие с човешката оценка на ниво корпус от текстове[1].

Методика на изчисляване на BLEU

BLEU оценява превода чрез преброяване на съвпаденията на n-грами (последователности от n думи) между превода-кандидат и еталонните преводи.

1. Модифицирана точност на n-грами

Най-напред за n-грами с различна дължина (обикновено от 1 до 4) се изчислява тяхната точност (pn) — делът на n-грамите от превода-кандидат, които се срещат в еталонните преводи[3]. При това броят на съвпаденията за всяка n-грама е ограничен до максималния брой на нейните срещания в кой да е от еталонните текстове, за да се избегне надценяване заради повторение на една и съща дума.

2. Агрегиране и геометрично средно

За да се получи единна оценка, точностите за 1-, 2-, 3- и 4-грами се агрегират чрез геометрично средно. Това се прави, за да може ниската точност за един вид n-грами (например 4-грами) да влияе силно върху крайния резултат, отразявайки лошото качество на дългите фрази. p1p2p3p44

3. Наказание за краткост (Brevity Penalty)

За да се предотврати получаването на завишени оценки за сметка на прекалено кратки, но точни преводи, BLEU въвежда наказание за краткост (Brevity Penalty, BP). Ако дължината на превода-кандидат (c) е значително по-малка от дължината на еталонния превод (r), крайният резултат BLEU се намалява. Наказанието се изчислява по формулата: extBP={1extifc>re1r/cextifcr

4. Крайна формула на BLEU

Окончателният BLEU-резултат се изчислява като произведение на наказанието за краткост и геометричното средно на точностите на n-грамите[4]: extBLEU=extBPexp(n=1Nwnlogpn) където N — максималната дължина на n-грамите (обикновено 4), а wn — тегла (обикновено 1/N).

Стойността на BLEU се намира в диапазона от 0 до 1 (често се умножава по 100 и се изразява в проценти). Колкото по-близо е резултатът до 1 (100%), толкова по-„близък до човешкия" се счита преводът.

Приложение и значение

От момента на публикуване метриката BLEU се превърна в де факто стандарт за оценка на системите за машинен превод (МП). Тя позволи да се преодолее „тесното място" в развитието на МП-системите — продължителността и скъпоструващността на ръчната оценка. Разработчиците получиха възможност бързо да измерват ефекта от промените в моделите и оперативно да отсяват неуспешните решения[2].

BLEU корелира добре с човешките оценки на ниво целия корпус от текстове, но е ненадежден за оценка на отделни изречения[3]. Затова метриката широко се използваше в стандартизирани състезания по МП (например NIST и WMT) за сравняване на системи.

Ограничения и критика

Въпреки широкото си разпространение, BLEU има редица съществени ограничения:

  • Липса на семантична оценка: BLEU измерва само повърхностното съвпадение на думи и не е в състояние да оцени дали смисълът на изходния текст е предаден правилно. Преводът може да получи висок резултат, но да бъде граматически неверен или да изкривява значението[5].
  • Игнориране на синоними и парафрази: Алгоритъмът наказва преводи, използващи синоними или различни формулировки от тези в еталона, дори ако те са напълно коректни. Използването на няколко еталона смекчава, но не решава напълно този проблем.
  • Чувствителност към токенизация: Резултатите от BLEU силно зависят от начина на разбиване на текста на token-и. Различните реализации на токенизатори могат да водят до различни стойности, правейки сравнението на модели некоректно. За решаването на този проблем бе предложен стандартът SacreBLEU, унифициращ изчисляването на метриката[1].
  • Трудност при прилагане към някои езици: BLEU работи зле с езици, нямащи ясни разделители на думите (например китайски или японски), без предварителна сегментация.

Алтернативи и съвременни подходи

С течение на времето за преодоляване на недостатъците на BLEU бяха предложени нови автоматични метрики:

  • METEOR: Отчита съвпаденията на синоними, stemming и реда на думите.
  • ROUGE: Прилага се за оценка на реферирането на текстове, фокусирайки се върху пълнотата (recall), а не върху точността.
  • Обучаеми метрики (Learned Metrics): Съвременни подходи, използващи модели за Machine Learning за отчитане на семантичната близост. Метрики като BLEURT и COMET показват значително по-висока корелация с оценките на хората, отколкото класическият BLEU[6].

Към 2020-те години BLEU загуби статута на безусловен стандарт, отстъпвайки място на по-точни методи[7]. Въпреки това той остава важна веха в историята на оценката на МП и продължава да се използва като базова отправна точка при измерване на напредъка.

Връзки

  • Какво представлява оценката BLEU? — Документация на Microsoft Azure

Бележки

  1. 1.0 1.1 1.2 «BLEU». Wikipedia. [1]
  2. 2.0 2.1 Papineni, Kishore, et al. «Bleu: a Method for Automatic Evaluation of Machine Translation». Proceedings of the 40th Annual Meeting of the Association for Computational Linguistics, 2002. [2]
  3. 3.0 3.1 «BLEU». MT Companion 4.0 documentation. [3]
  4. Callison-Burch, Chris, et al. «BLEU: a Method for Automatic Evaluation of Machine Translation». Proceedings of the EACL 2006 Workshop on Statistical Machine Translation, 2006. [4]
  5. Cardete, Jorge. «Beyond BLEU Score. When it comes to the nuanced world of...». The Deep Hub | Medium. [5]
  6. «BLEURT: метрика для оценки моделей для генерации текста». Neurohive. [6]
  7. «Chief Digital and Artificial Intelligence Office > Lexicon». ai.mil. [7]