BLEU (Bilingual Evaluation Understudy) (TL)
BLEU (mula sa Ingles na Bilingual Evaluation Understudy — «panghaliling tagasuri ng dalawang wika») — isang algorithm para sa awtomatikong pagtatasa ng kalidad ng tekstong isinalin ng makina. Ang pagtatasa ay isinasagawa sa pamamagitan ng paghahambing ng kandidatong salin sa isa o ilang sanggunian (reperensya) na salin ng tao[1]. Ang kalidad ay tinutukoy ng antas ng leksikal na pagkakatulad ng makina-salin sa propesyonal na salin. Tulad ng isinulat ng mga may-akda, «habang mas malapit ang makina-salin sa salin ng propesyonal na tao, mas mabuti ito»[2].
Ang pamamaraan ay iminungkahi noong 2002 ng isang pangkat ng mga mananaliksik mula sa IBM sa ilalim ng pamumuno ni Kishore Papineni at naging isa sa mga unang sukatan na nagpakita ng mataas na kaugnayan sa mga pagtatasa ng mga dalubhasang tagasalin. Mabilis na nakamit ng BLEU ang popularidad dahil sa pagiging simple ng pagkalkula, kalayaan sa wika, at mabuting pagkakatugma sa pagtatasa ng tao sa antas ng corpus ng mga teksto[1].
Pamamaraan ng pagkalkula ng BLEU
Sinusuri ng BLEU ang salin sa pamamagitan ng pagbibilang ng mga tugmang n-gram (mga pagkakasunod-sunod ng n salita) sa pagitan ng kandidatong salin at ng mga sangguniang salin.
1. Binagong katumpakan ng n-gram
Una, para sa mga n-gram ng iba't ibang haba (karaniwan mula 1 hanggang 4) kinakalkula ang kanilang katumpakan () — ang bahagi ng mga n-gram mula sa kandidatong salin na makikita sa mga sangguniang salin[3]. Притом ang bilang ng mga tugma para sa bawat n-gram ay nililimitahan ng pinakamataas na bilang ng mga pagkakataon nito sa alinman sa mga sangguniang teksto, upang maiwasan ang pagpapalaki ng marka dahil sa pag-ulit ng iisang salita.
2. Pag-agregate at geometric na karaniwang halaga
Upang makakuha ng iisang marka, ang mga katumpakan para sa 1-, 2-, 3- at 4-gram ay pinagsama gamit ang geometric na karaniwang halaga. Ginagawa ito upang ang mababang katumpakan para sa isang uri ng n-gram (halimbawa, 4-gram) ay lubos na makaapekto sa panghuling marka, na sumasalamin sa masamang kalidad ng mahahabang parirala.
3. Parusa sa kaiklian (Brevity Penalty)
Upang maiwasan ang pagkuha ng mataas na marka sa pamamagitan ng masyadong maikling ngunit tumpak na mga salin, nagpapakilala ang BLEU ng parusa sa kaiklian (Brevity Penalty, BP). Kung ang haba ng kandidatong salin (c) ay makabuluhang mas maikli kaysa sa haba ng sangguniang salin (r), ang panghuling BLEU na marka ay bumababa. Ang parusa ay kinakalkula ayon sa pormula:
4. Panghuling pormula ng BLEU
Ang panghuling BLEU score ay kinakalkula bilang produkto ng parusa sa kaiklian at ng geometric na karaniwang halaga ng mga katumpakan ng n-gram[4]: kung saan ang N — pinakamataas na haba ng n-gram (karaniwan ay 4), at — mga timbang (karaniwan ay ).
Ang halaga ng BLEU ay nasa saklaw mula 0 hanggang 1 (madalas na pinarami ng 100 at ipinapahayag sa porsyento). Habang mas malapit ang resulta sa 1 (100%), mas itinuturing na «malapit sa salin ng tao» ang pagsasalin.
Paggamit at kahalagahan
Mula nang malathala, ang sukatan ng BLEU ay naging de-facto na pamantayan para sa pagtatasa ng mga sistema ng makina-pagsasalin (MP). Nagbigay ito ng solusyon sa «bottleneck» sa pagpapaunlad ng mga MP sistema — ang tagal at gastos ng manu-manong pagtatasa. Nagkaroon ng kakayahan ang mga developer na mabilis na sukatin ang epekto ng mga pagbabago sa mga modelo at agad na alisin ang mga hindi matagumpay na solusyon[2].
Mabuting nag-uugnay ang BLEU sa mga pagtatasa ng tao sa antas ng buong corpus ng mga teksto, ngunit hindi maaasahan para sa pagtatasa ng mga indibidwal na pangungusap[3]. Kaya naman ang sukatan ay malawak na ginagamit sa mga standardisadong paligsahan sa MP (halimbawa, NIST at WMT) para sa paghahambing ng mga sistema.
Mga limitasyon at kritisismo
Sa kabila ng malawak na paggamit, ang BLEU ay may ilang mahahalagang limitasyon:
- Kawalan ng semantikong pagtatasa: Sinusukat lamang ng BLEU ang pangibabaw na pagkakatugma ng mga salita at hindi kayang tasahin kung tama bang naipahayag ang kahulugan ng pinagmulang teksto. Maaaring makakuha ng mataas na marka ang isang salin ngunit maging gramatikal na mali o makasalinsalin ng kahulugan[5].
- Pagwawalang-bahala sa mga sinonimo at parafrase: Ang algorithm ay nagpaparusa sa mga salin na gumagamit ng mga sinonimo o iba pang mga pagpapahayag kaysa sa sanggunian, kahit ganap na tama ang mga ito. Ang paggamit ng ilang sanggunian ay nagpapagaan ngunit hindi ganap na nailulutas ang problemang ito.
- Sensitivity sa tokenization: Lubos na nakasalalay ang mga resulta ng BLEU sa paraan ng paghahati ng teksto sa mga token. Ang iba't ibang implementasyon ng mga tokenizer ay maaaring humantong sa iba't ibang halaga, na nagpapadali ng maling paghahambing ng mga modelo. Upang malutas ang problemang ito, iminungkahi ang pamantayan ng SacreBLEU, na nag-uunipika ng pagkalkula ng sukatan[1].
- Kahirapan sa paggamit para sa ilang wika: Mahirap gamitin ang BLEU sa mga wikang walang malinaw na mga tagahiwalay ng salita (halimbawa, Intsik o Hapones), nang walang paunang segmentasyon.
Mga alternatibo at modernong pamamaraan
Sa paglipas ng panahon, upang malampasan ang mga kakulangan ng BLEU, iminungkahi ang mga bagong awtomatikong sukatan:
- METEOR: Isinasaalang-alang ang mga tugmang sinonimo, stemming at pagkakasunod-sunod ng mga salita.
- ROUGE: Ginagamit para sa pagtatasa ng pagbubuod ng teksto, nakatuon sa pagkakumpleto (recall) kaysa sa katumpakan.
- Mga Natutunan na Sukatan (Learned Metrics): Mga modernong pamamaraan na gumagamit ng mga modelo ng machine learning upang isaalang-alang ang semantikong pagkakahawig. Ang mga sukatan tulad ng BLEURT at COMET ay nagpapakita ng mas mataas na kaugnayan sa mga pagtatasa ng tao kaysa sa klasikong BLEU[6].
Sa mga taong 2020, nawala sa BLEU ang katayuan ng walang kondisyong pamantayan, na nagbigay-daan sa mas tumpak na mga pamamaraan[7]. Gayunpaman, nananatili itong mahalagang landmark sa kasaysayan ng pagtatasa ng MP at patuloy na ginagamit bilang pangunahing puntos ng sanggunian sa pagsukat ng pag-unlad.
Mga sanggunian
- Ano ang BLEU score? — Dokumentasyon ng Microsoft Azure
Mga tala
- ↑ 1.0 1.1 1.2 «BLEU». Wikipedia. [1]
- ↑ 2.0 2.1 Papineni, Kishore, et al. «Bleu: a Method for Automatic Evaluation of Machine Translation». Proceedings of the 40th Annual Meeting of the Association for Computational Linguistics, 2002. [2]
- ↑ 3.0 3.1 «BLEU». MT Companion 4.0 documentation. [3]
- ↑ Callison-Burch, Chris, et al. «BLEU: a Method for Automatic Evaluation of Machine Translation». Proceedings of the EACL 2006 Workshop on Statistical Machine Translation, 2006. [4]
- ↑ Cardete, Jorge. «Beyond BLEU Score. When it comes to the nuanced world of...». The Deep Hub | Medium. [5]
- ↑ «BLEURT: метрика для оценки моделей для генерации текста». Neurohive. [6]
- ↑ «Chief Digital and Artificial Intelligence Office > Lexicon». ai.mil. [7]