BERTScore (metric) (EL)
BERTScore — είναι μια αυτόματη μετρική για την αξιολόγηση της ποιότητας παραγόμενου κειμένου, βασισμένη στη μέτρηση σημασιολογικής ομοιότητας με τη βοήθεια contextual embeddings από προ-εκπαιδευμένα γλωσσικά μοντέλα, όπως το BERT. Η μετρική προτάθηκε το 2019 από μια ομάδα ερευνητών με επικεφαλής τον Tianyi Zhang στην εργασία «BERTScore: Evaluating Text Generation with BERT»[1].
Σε αντίθεση με τις παραδοσιακές μετρικές, όπως το BLEU και το ROUGE, που βασίζονται στην ακριβή αντιστοίχιση n-gram, το BERTScore επιτρέπει τον εντοπισμό σημασιολογικής ισοδυναμίας ακόμη και όταν οι λέξεις και οι διατυπώσεις διαφέρουν, λαμβάνοντας υπόψη συνώνυμα και παραφράσεις[2].
Μεθοδολογία υπολογισμού
Η μέθοδος BERTScore αποτελείται από αρκετά στάδια:
- Λήψη contextual embeddings: Και τα δύο κείμενα (το κείμενο αναφοράς και το παραγόμενο) χωρίζονται σε token και διέρχονται από ένα προ-εκπαιδευμένο transformer μοντέλο (π.χ. BERT ή RoBERTa). Για κάθε token εξάγεται η contextual διανυσματική αναπαράστασή του (embedding).
- Υπολογισμός cosine similarity: Για όλα τα ζεύγη token από τα δύο κείμενα υπολογίζεται η cosine similarity και σχηματίζεται ένας πίνακας ομοιότητας token[3].
- Υπολογισμός precision, recall και F1-μέτρου: Με βάση τον πίνακα ομοιότητας, για κάθε token στο παραγόμενο κείμενο βρίσκεται το πιο όμοιο token στο κείμενο αναφοράς, πράγμα που επιτρέπει τον υπολογισμό της ακρίβειας (precision). Ομοίως, για κάθε token του κειμένου αναφοράς βρίσκεται το πλησιέστερο token στο παραγόμενο κείμενο, κάτι που δίνει την ανάκληση (recall). Το τελικό αποτέλεσμα του BERTScore είναι το ισορροπημένο F₁-μέτρο, που συνδυάζει precision και recall:
Η μετρική είναι ευέλικτη: μπορεί κανείς να επιλέξει διαφορετικά προ-εκπαιδευμένα μοντέλα, να σταθμίσει τα token ανάλογα με τη σπουδαιότητά τους (με τη βοήθεια IDF-βαρών) και να μετασχηματίσει γραμμικά τις βαθμολογίες για καλύτερη ερμηνευσιμότητα[3].
Εφαρμογή και αποτελεσματικότητα
Το BERTScore εφαρμόζεται για την αξιολόγηση ποιότητας σε διάφορες εργασίες παραγωγής κειμένου:
- Αυτόματη μετάφραση: Καταγράφει τη διατήρηση του νοήματος, ακόμη και αν οι μεταφραστικές κατασκευές διαφέρουν από τις αναφορικές.
- Αυτόματη περίληψη: Είναι ικανό να εντοπίσει ότι διαφορετικές διατυπώσεις μπορούν να μεταφέρουν τα ίδια βασικά γεγονότα, γεγονός που το καθιστά πιο ευέλικτο από το ROUGE.
- Διαλογικά συστήματα: Βοηθά στη μέτρηση της καταλληλότητας μιας απόκρισης, συγκρίνοντάς την με την αναφορική σε επίπεδο νοήματος.
Η εκτεταμένη αξιολόγηση που πραγματοποίησαν οι συγγραφείς έδειξε ότι ο συντελεστής συσχέτισης του BERTScore με ανθρώπινες αξιολογήσεις είναι αισθητά υψηλότερος από εκείνον μετρικών όπως το BLEU και το ROUGE. Επιπλέον, η μετρική επέδειξε αυξημένη ανθεκτικότητα σε σύνθετες περιπτώσεις παράφρασης[1].
Πλεονεκτήματα
- Λήψη υπόψη της σημασιολογίας: Συγκρίνει κείμενα σε επίπεδο νοήματος, λαμβάνοντας υπόψη συνώνυμα και παραφράσεις.
- Υψηλή συσχέτιση με τον άνθρωπο: Οι βαθμολογίες BERTScore συμφωνούν καλύτερα με τις ανθρώπινες κρίσεις για την ποιότητα κειμένου από ό,τι οι παραδοσιακές μετρικές.
- Γενικευσιμότητα και μεταφερσιμότητα: Η μετρική δεν είναι δεσμευμένη σε συγκεκριμένη γλώσσα ή εργασία — αρκεί να επιλεγεί το κατάλληλο προ-εκπαιδευμένο μοντέλο.
- Απουσία ανάγκης εκπαίδευσης: Το BERTScore είναι μη-εκπαιδεύσιμη μετρική, σε αντίθεση με πιο σύνθετες μετρικές (π.χ. BLEURT) που απαιτούν προηγούμενη εκπαίδευση σε σώματα αξιολογήσεων.
- Ενσωμάτωση σύγχρονων μοντέλων: Αξιοποιεί τη δύναμη των transformer για την εξαγωγή βαθιών συμφραζόμενων χαρακτηριστικών.
Περιορισμοί και κριτική
- Υψηλό υπολογιστικό κόστος: Ο υπολογισμός βάσει embeddings απαιτεί σημαντικά περισσότερους πόρους από την καταμέτρηση n-gram και συχνά απαιτεί τη χρήση GPU[2].
- Εξάρτηση από το μοντέλο: Η ποιότητα της αξιολόγησης συνδέεται άμεσα με την ποιότητα του προ-εκπαιδευμένου μοντέλου. Η επιλογή μοντέλου και στρώματος για την εξαγωγή embeddings επηρεάζει το αποτέλεσμα, γεγονός που μπορεί να προκαλεί προβλήματα αναπαραγωγιμότητας[4].
- Απουσία λήψης υπόψη γεγονότων και δομής: Το BERTScore εστιάζει στην τοπική σημασιολογική ομοιότητα και δεν εγγυάται κατανόηση της δομής του κειμένου ή πραγματικής ακρίβειας. Ένα κείμενο με αναδιατεταγμένες φράσεις ή πραγματικά λάθη μπορεί να λάβει υψηλή βαθμολογία[3].
- Χαμηλή ερμηνευσιμότητα: Σε αντίθεση με το BLEU/ROUGE, ο δείκτης BERTScore είναι λιγότερο διαφανής, γεγονός που δυσχεραίνει την ανάλυση σφαλμάτων.
- Κοινωνικές μεροληψίες (bias): Η μετρική κληρονομεί στερεότυπα και μεροληψίες που ενσωματώνονται στα προ-εκπαιδευμένα μοντέλα. Μελέτη του 2022 έδειξε ότι μετρικές βασισμένες σε LLM (συμπεριλαμβανομένου του BERTScore) εμφανίζουν σημαντικά μεγαλύτερο κοινωνικό bias από ό,τι οι παραδοσιακές μετρικές[5].
Σημασία και ρόλος στην αξιολόγηση
Το BERTScore αποτελεί ένα σημαντικό βήμα στην ανάπτυξη μεθόδων αξιολόγησης παραγόμενου κειμένου, καθώς επιτρέπει τη λήψη υπόψη της σημασιολογικής ισοδυναμίας και όχι μόνο των λεξιλογικών συμπτώσεων. Παρά το γεγονός ότι καμία αυτόματη μετρική δεν μπορεί να μετρήσει τέλεια την ποιότητα κειμένου, το BERTScore έχει αποδειχθεί αξιόπιστο εργαλείο που συμπληρώνει τις κλασικές προσεγγίσεις (όπως το BLEU και το ROUGE), χωρίς να τις αντικαθιστά πλήρως.
Στην πράξη, το BERTScore χρησιμοποιείται συχνά σε συνδυασμό με χειροκίνητη εμπειρογνωμοσύνη και άλλες μετρικές για μια πιο πλήρη και βαθιά κατανόηση του πόσο επιτυχώς τα μοντέλα παράγουν συνεκτικά και σημασιολογικά κατάλληλα κείμενα[2].
Αναφορές
- Επίσημο αποθετήριο BERTScore στο GitHub
Σημειώσεις
- ↑ 1.0 1.1 Zhang, Tianyi, et al. «BERTScore: Evaluating Text Generation with BERT». arXiv:1904.09675 [cs.CL], 22 апр. 2019 г. [1]
- ↑ 2.0 2.1 2.2 «BERTScore: New Metrics for Language Models». Analytics Vidhya. [2]
- ↑ 3.0 3.1 3.2 Sojasingarayar, Abonia. «BERTScore Explained in 5 minutes». Medium. [3]
- ↑ Alakulju, D., et al. «Reproducibility of BERTScore». Theseus.fi. [4]
- ↑ Peyrard, M., et al. «BERTScore is Unfair: On Social Bias in Language Model-Based Metrics for Text Generation». arXiv:2210.07626 [cs.CL], 14 окт. 2022 г. [5]