BLEU (Bilingual Evaluation Understudy) (EL)
BLEU (από τα αγγλικά Bilingual Evaluation Understudy — «δίγλωσσος αξιολογητής αντικατάστασης») — είναι αλγόριθμος για την αυτόματη αξιολόγηση της ποιότητας κειμένου που έχει μεταφραστεί από μηχανή. Η αξιολόγηση πραγματοποιείται με σύγκριση της υποψήφιας μετάφρασης με μία ή περισσότερες εκλεπτυσμένες (αναφοράς) ανθρώπινες μεταφράσεις[1]. Η ποιότητα ορίζεται από τον βαθμό λεξιλογικής ομοιότητας της μηχανικής μετάφρασης με την επαγγελματική. Όπως σημείωναν οι συγγραφείς, «όσο πιο κοντά είναι η μηχανική μετάφραση στη μετάφραση ενός επαγγελματία ανθρώπου, τόσο καλύτερη είναι»[2].
Η μέθοδος προτάθηκε το 2002 από ομάδα ερευνητών της IBM υπό την ηγεσία του Kishore Papineni και έγινε μία από τις πρώτες μετρικές που παρουσίασαν υψηλή συσχέτιση με τις αξιολογήσεις ειδικών μεταφραστών. Η BLEU κέρδισε γρήγορα δημοτικότητα χάρη στην απλότητα υπολογισμού, την γλωσσική ανεξαρτησία και την καλή αντιστοιχία με την ανθρώπινη αξιολόγηση σε επίπεδο corpus κειμένων[1].
Μεθοδολογία υπολογισμού BLEU
Η BLEU αξιολογεί τη μετάφραση μετρώντας τις συμπτώσεις n-gram (ακολουθιών n λέξεων) μεταξύ της υποψήφιας μετάφρασης και των μεταφράσεων αναφοράς.
1. Τροποποιημένη ακρίβεια n-gram
Αρχικά, για n-gram διαφόρων μηκών (συνήθως από 1 έως 4) υπολογίζεται η ακρίβειά τους () — το ποσοστό των n-gram από την υποψήφια μετάφραση που εμφανίζονται στις μεταφράσεις αναφοράς[3]. Ταυτόχρονα, ο αριθμός των συμπτώσεων για κάθε n-gram περιορίζεται στον μέγιστο αριθμό εμφανίσεών του σε οποιοδήποτε από τα κείμενα αναφοράς, ώστε να αποφευχθεί η υπερεκτίμηση της βαθμολογίας λόγω επανάληψης της ίδιας λέξης.
2. Συγκέντρωση και γεωμετρικός μέσος
Για να ληφθεί μια ενιαία βαθμολογία, οι ακρίβειες για 1-, 2-, 3- και 4-gram συγκεντρώνονται με τη χρήση γεωμετρικού μέσου. Αυτό γίνεται ώστε η χαμηλή ακρίβεια για έναν τύπο n-gram (π.χ. 4-gram) να επηρεάζει σημαντικά την τελική βαθμολογία, αντικατοπτρίζοντας την κακή ποιότητα μακρών φράσεων.
3. Ποινή συντομίας (Brevity Penalty)
Για να αποτραπεί η λήψη υπερβολικά υψηλών βαθμολογιών μέσω υπερβολικά σύντομων αλλά ακριβών μεταφράσεων, η BLEU εισάγει την ποινή συντομίας (Brevity Penalty, BP). Εάν το μήκος της υποψήφιας μετάφρασης (c) είναι σημαντικά μικρότερο από το μήκος της μετάφρασης αναφοράς (r), η τελική βαθμολογία BLEU μειώνεται. Η ποινή υπολογίζεται με τον τύπο:
4. Τελικός τύπος BLEU
Η τελική βαθμολογία BLEU υπολογίζεται ως γινόμενο της ποινής συντομίας επί τον γεωμετρικό μέσο των ακριβειών n-gram[4]: όπου N είναι το μέγιστο μήκος n-gram (συνήθως 4), και — βάρη (συνήθως ).
Η τιμή BLEU κυμαίνεται μεταξύ 0 και 1 (πολλές φορές πολλαπλασιάζεται επί 100 και εκφράζεται ως ποσοστό). Όσο πιο κοντά είναι το αποτέλεσμα στο 1 (100%), τόσο πιο «κοντά στο ανθρώπινο» θεωρείται η μετάφραση.
Εφαρμογή και σημασία
Από τη δημοσίευσή της, η μετρική BLEU έγινε de facto πρότυπο για την αξιολόγηση συστημάτων μηχανικής μετάφρασης (ΜΜ). Επέτρεψε να ξεπεραστεί το «στενό σημείο» στην ανάπτυξη συστημάτων ΜΜ — η χρονοβόρα και δαπανηρή χειροκίνητη αξιολόγηση. Οι προγραμματιστές απέκτησαν τη δυνατότητα να μετρούν γρήγορα την επίδραση των αλλαγών στα μοντέλα και να απορρίπτουν αποτελεσματικά τις ανεπιτυχείς λύσεις[2].
Η BLEU συσχετίζεται καλά με τις ανθρώπινες αξιολογήσεις σε επίπεδο ολόκληρου του corpus κειμένων, αλλά είναι αναξιόπιστη για την αξιολόγηση μεμονωμένων προτάσεων[3]. Γι' αυτό η μετρική χρησιμοποιήθηκε ευρέως σε τυποποιημένους διαγωνισμούς ΜΜ (π.χ. NIST και WMT) για σύγκριση συστημάτων.
Περιορισμοί και κριτική
Παρά την ευρεία διάδοσή της, η BLEU έχει μια σειρά από ουσιαστικούς περιορισμούς:
- Απουσία σημασιολογικής αξιολόγησης: Η BLEU μετράει μόνο την επιφανειακή αντιστοιχία λέξεων και δεν είναι σε θέση να αξιολογήσει αν αποδόθηκε σωστά το νόημα του πρωτότυπου κειμένου. Μια μετάφραση μπορεί να λάβει υψηλή βαθμολογία, αλλά να είναι γραμματικά λανθασμένη ή να παραμορφώνει το νόημα[5].
- Αγνόηση συνώνυμων και παραφράσεων: Ο αλγόριθμος τιμωρεί μεταφράσεις που χρησιμοποιούν συνώνυμα ή διαφορετικές διατυπώσεις από εκείνες της αναφοράς, ακόμα κι αν είναι απολύτως ορθές. Η χρήση πολλαπλών αναφορών μετριάζει αλλά δεν επιλύει πλήρως αυτό το πρόβλημα.
- Ευαισθησία στην tokenization: Τα αποτελέσματα BLEU εξαρτώνται σε μεγάλο βαθμό από τον τρόπο διαχωρισμού του κειμένου σε token. Διαφορετικές υλοποιήσεις tokenizer μπορούν να οδηγήσουν σε διαφορετικές τιμές, καθιστώντας τη σύγκριση μοντέλων εσφαλμένη. Για την αντιμετώπιση αυτού του προβλήματος προτάθηκε το πρότυπο SacreBLEU, που ενοποιεί τον υπολογισμό της μετρικής[1].
- Δυσκολία εφαρμογής σε ορισμένες γλώσσες: Η BLEU λειτουργεί άσχημα με γλώσσες που δεν έχουν σαφείς διαχωριστές λέξεων (π.χ. κινεζικά ή ιαπωνικά), χωρίς προηγούμενη κατάτμηση.
Εναλλακτικές προσεγγίσεις και σύγχρονες μέθοδοι
Με την πάροδο του χρόνου, για να ξεπεραστούν οι αδυναμίες της BLEU, προτάθηκαν νέες αυτόματες μετρικές:
- METEOR: Λαμβάνει υπόψη συμπτώσεις συνώνυμων, stemming και τη σειρά των λέξεων.
- ROUGE: Χρησιμοποιείται για την αξιολόγηση περίληψης κειμένων, εστιάζοντας στην πληρότητα (recall) και όχι στην ακρίβεια.
- Εκπαιδευόμενες Μετρικές (Learned Metrics): Σύγχρονες προσεγγίσεις που χρησιμοποιούν μοντέλα Machine Learning για να ληφθεί υπόψη η σημασιολογική εγγύτητα. Μετρικές όπως η BLEURT και η COMET παρουσιάζουν σημαντικά υψηλότερη συσχέτιση με τις αξιολογήσεις ανθρώπων σε σύγκριση με την κλασική BLEU[6].
Μέχρι τη δεκαετία του 2020, η BLEU έχασε την ιδιότητά της ως αδιαμφισβήτητο πρότυπο, παραχωρώντας τη θέση της σε πιο ακριβείς μεθόδους[7]. Ωστόσο, παραμένει ένα σημαντικό ορόσημο στην ιστορία της αξιολόγησης ΜΜ και συνεχίζει να χρησιμοποιείται ως βασικό σημείο αναφοράς για τη μέτρηση της προόδου.
Σύνδεσμοι
- Τι είναι η βαθμολογία BLEU; — Τεκμηρίωση Microsoft Azure
Παραπομπές
- ↑ 1.0 1.1 1.2 «BLEU». Wikipedia. [1]
- ↑ 2.0 2.1 Papineni, Kishore, et al. «Bleu: a Method for Automatic Evaluation of Machine Translation». Proceedings of the 40th Annual Meeting of the Association for Computational Linguistics, 2002. [2]
- ↑ 3.0 3.1 «BLEU». MT Companion 4.0 documentation. [3]
- ↑ Callison-Burch, Chris, et al. «BLEU: a Method for Automatic Evaluation of Machine Translation». Proceedings of the EACL 2006 Workshop on Statistical Machine Translation, 2006. [4]
- ↑ Cardete, Jorge. «Beyond BLEU Score. When it comes to the nuanced world of...». The Deep Hub | Medium. [5]
- ↑ «BLEURT: метрика для оценки моделей для генерации текста». Neurohive. [6]
- ↑ «Chief Digital and Artificial Intelligence Office > Lexicon». ai.mil. [7]