BBQ (Bias Benchmark for Question Answering) (EL)
BBQ (Bias Benchmark for Question Answering) — είναι ένα σύνολο δεδομένων για την αξιολόγηση κοινωνικών προκαταλήψεων (bias) σε συστήματα ερωτήσεων-απαντήσεων (QA)[1]. Αναπτύχθηκε από ομάδα ερευνητών του Πανεπιστημίου της Νέας Υόρκης υπό την καθοδήγηση της Alicia Parrish και δημοσιεύθηκε το 2022 στο συνέδριο ACL Findings[1][2]. Ο στόχος του BBQ είναι να αποκαλύψει πώς τα μεγάλα γλωσσικά μοντέλα (LLM) και άλλα μοντέλα QA εκδηλώνουν στερεότυπα και προκαταλήψεις στις απαντήσεις τους σε ερωτήσεις, ιδιαίτερα σε εφαρμοσμένες εργασίες απάντησης ερωτήσεων σε φυσική γλώσσα[1]. Το BBQ έχει καταστεί ένα από τα πιο ολοκληρωμένα benchmarks για την αξιολόγηση του κοινωνικού bias στο NLP, καλύπτοντας ένα ευρύ φάσμα στερεοτύπων στο πλαίσιο εννέα κοινωνικών κατηγοριών[3].
Το συγκεκριμένο σύνολο δεδομένων συμπληρώνει προηγούμενες εργασίες, όπως το dataset UnQover (2020), το οποίο μετρούσε την προκατάληψη σε περιορισμένο αριθμό χαρακτηριστικών (φύλο-επάγγελμα, εθνικότητα, εθνοτική καταγωγή, θρησκεία) και βασιζόταν στις πιθανότητες των μοντέλων και όχι στις ίδιες τις απαντήσεις[3]. Σε αντίθεση με το UnQover, το BBQ αναλύει άμεσα το περιεχόμενο των απαντήσεων των μοντέλων και την επιλογή τους μεταξύ προτεινόμενων επιλογών, επιτρέποντας την αξιολόγηση της προκατάληψης ακριβώς στο επίπεδο των παραγόμενων αποτελεσμάτων[1].
Οι συγγραφείς του BBQ το τοποθετούν ως εργαλείο για τη διάγνωση επιβλαβών κοινωνικών στερεοτύπων σε μοντέλα και τη μείωση του κινδύνου αρνητικής επίδρασης τέτοιων στερεοτύπων σε ευάλωτες ομάδες πληθυσμού[1]. Το σύνολο εστιάζει σε στερεότυπα σχετικά με την αγγλόφωνη αμερικανική κουλτούρα και δεν καλύπτει όλα τα πιθανά πολιτισμικά πλαίσια[1]. Ωστόσο, το BBQ έθεσε τα θεμέλια για μεταγενέστερες εργασίες σχετικά με τη μέτρηση και τον περιορισμό του κοινωνικού bias στο NLP και έχει καταστεί σημείο αναφοράς για τη σύγκριση μοντέλων ως προς την ηθική τους ορθότητα.
Σύνθεση και δομή του συνόλου δεδομένων
Το BBQ περιέχει περίπου 58.500 ερωτήσεις και απαντήσεις, ομαδοποιημένες σε ειδικά σύνολα που στοχεύουν στην αποκάλυψη συγκεκριμένων στερεοτύπων[4]. Όλα τα παραδείγματα δημιουργήθηκαν χειροκίνητα από τους συγγραφείς βάσει τεκμηριωμένων περιπτώσεων προκαταλήψεων και στερεοτύπων που βλάπτουν εκπροσώπους διαφόρων κοινωνικών ομάδων[4]. Κατά τη δημιουργία των σεναρίων χρησιμοποιήθηκαν δεδομένα επιστημονικών ερευνών, άρθρα των μέσων ενημέρωσης, εκθέσεις και άλλες αξιόπιστες πηγές που επιβεβαιώνουν την ύπαρξη ενός συγκεκριμένου στερεοτύπου και τις επιβλαβείς συνέπειές του[1]. Για κάθε κατάσταση, οι συγγραφείς παρέχουν παραπομπή στην πηγή όπου το συγκεκριμένο στερεότυπο περιγράφεται ως αρνητικό ή επιβλαβές (για παράδειγμα, επιστημονικό άρθρο ή ειδησεογραφικό κείμενο)[1].
Κοινωνικές κατηγορίες
Το BBQ καλύπτει εννέα βασικές κοινωνικά σημαντικές κατηγορίες (που στην πλειονότητά τους αντιστοιχούν σε προστατευόμενες ομάδες κατά τον ορισμό της Επιτροπής Ίσων Ευκαιριών Απασχόλησης των ΗΠΑ)[1]:
- Ηλικία – προκαταλήψεις έναντι ηλικιακών ομάδων (π.χ. στερεότυπο για μείωση των γνωστικών ικανοτήτων στους ηλικιωμένους)[1].
- Αναπηρία – στερεότυπα σχετικά με τις πνευματικές ικανότητες ή άλλα χαρακτηριστικά ατόμων με αναπηρία (π.χ. η αντίληψη ότι τα άτομα με κινητική αναπηρία είναι λιγότερο νοητικά ικανά)[1].
- Ταυτότητα φύλου – στερεότυπα φύλου (π.χ. η ιδέα ότι «τα κορίτσια τα πάνε άσχημα στα μαθηματικά»)[1].
- Εθνικότητα – εθνικές προκαταλήψεις (π.χ. στερεότυπο τεχνολογικής αναλφαβητισμού ατόμων αφρικανικής καταγωγής)[1].
- Εμφάνιση – διακρίσεις βάσει εξωτερικής εμφάνισης, σωματότυπου (π.χ. η άποψη ότι τα άτομα με παχυσαρκία είναι λιγότερο έξυπνα ή εργατικά)[1].
- Φυλή/εθνοτική καταγωγή – φυλετικά στερεότυπα (π.χ. προκατειλημμένη σύνδεση συγκεκριμένης φυλής με εγκληματικότητα ή ναρκωτικά)[1].
- Θρησκεία – θρησκευτικά στερεότυπα (π.χ. η αντίληψη ότι οι Εβραίοι είναι φιλάργυροι, οι Μουσουλμάνοι επιρρεπείς στη βία κ.λπ.)[1].
- Κοινωνικοοικονομική κατάσταση – προκαταλήψεις έναντι φτωχών ή πλούσιων στρωμάτων της κοινωνίας (π.χ. η πεποίθηση ότι άτομα από φτωχές οικογένειες θα είναι κακοί γονείς)[1].
- Σεξουαλικός προσανατολισμός – ομοφοβικά στερεότυπα (π.χ. ψευδής σύνδεση ομοφυλοφιλίας με τον ιό HIV)[1].
Πέρα από αυτές τις εννέα κατηγορίες, το BBQ περιλαμβάνει δύο διατομεακές κατηγορίες (intersectional biases), που συνδυάζουν δύο χαρακτηριστικά: (1) φύλο σε συνδυασμό με φυλή/εθνοτική καταγωγή και (2) κοινωνικοοικονομική κατάσταση σε συνδυασμό με φυλή[1]. Τέτοιες περιπτώσεις λαμβάνουν υπόψη στερεότυπα στην τομή διαφόρων ομάδων (π.χ. προκαταλήψεις ειδικά κατά μαύρων γυναικών ή κατά ορισμένων εθνοτήτων από χαμηλή κοινωνική τάξη).
Πρότυπα και δημιουργία παραδειγμάτων
Για κάθε κατηγορία, η ομάδα συνέταξε πρότυπα σεναρίων — σύντομες σκηνογραφίες όπου εμφανίζονται δύο χαρακτήρες που διαφέρουν ως προς το στοχευόμενο χαρακτηριστικό (π.χ. νέος και ηλικιωμένος, άνδρας και γυναίκα, πλούσιος και φτωχός κ.λπ.)[4]. Στο πρότυπο ενσωματώνεται μια κατάσταση που θα μπορούσε να επιβεβαιώσει ή να διαψεύσει ένα γνωστό στερεότυπο. Σε κάθε σενάριο αντιστοιχούν ερωτήσεις και επιλογές απαντήσεων.
Συνολικά αναπτύχθηκαν 25 μοναδικά πρότυπα για καθεμία από τις εννέα βασικές κατηγορίες, καθώς και 25 επιπλέον πρότυπα για τις κατηγορίες φυλής και φύλου με χρήση πραγματικών ονομάτων (για τον έλεγχο του bias σε επίπεδο κύριων ονομάτων)[1]. Επίσης, δημιουργήθηκαν 25 πρότυπα για κάθε μία από τις δύο διατομεακές κατευθύνσεις[1]. Έτσι, ο συνολικός αριθμός βασικών σεναρίων υπερβαίνει τα 300.
Κάθε πρότυπο περιέχει ειδικές θέσεις μεταβλητών — ονομασίες ομάδων ή περιγραφές — που παρεμβάλλονται στο κείμενο (π.χ. στο πρότυπο ηλικίας αντί για «_χρονος άνθρωπος» παρεμβάλλονται διαφορετικοί αριθμοί, ή στην εμφάνιση — επίθετα «παχύσαρκος»/«λεπτός» κ.λπ.)[1]. Χάρη στην παρεμβολή διαφόρων τιμών και στην εναλλαγή της σειράς αναφοράς των δύο χαρακτήρων, κάθε πρότυπο επεκτείνεται σε πλήθος συγκεκριμένων παραδειγμάτων (ελάχιστο 8 και έως ~200 παραλλαγές)[1]. Κατά κανόνα, από ένα πρότυπο παράγονται τουλάχιστον 100 τελικές ερωτήσεις, και σε ορισμένες περιπτώσεις — έως διακόσιες[1]. Συνολικά προέκυψε ένα corpus από 58.492 παραδείγματα (μοναδικοί συνδυασμοί σεναρίου, ερώτησης και απάντησης)[4].
Πλαίσια και τύποι ερωτήσεων
Βασικό χαρακτηριστικό του BBQ είναι ότι κάθε κατάσταση παρουσιάζεται με δύο παραλλαγές πλαισίου και δύο διατυπώσεις ερώτησης, σχηματίζοντας σύνολο τεσσάρων ερωτήσεων (αποκαλούμενο σύμπλεγμα των 4)[1]. Αυτό γίνεται για να διαχωριστεί η επίδραση της έλλειψης πληροφορίας από τα ίδια τα στερεότυπα του μοντέλου. Σε κάθε τετράδα[1]:
- Αμφίσημο πλαίσιο (under-informative or ambiguous context): κείμενο που περιγράφει μια κατάσταση με δύο άτομα από διαφορετικές ομάδες, αλλά δεν περιέχει επαρκή πληροφορία για να απαντηθεί η ερώτηση μονοσήμαντα[1]. Η σωστή απάντηση σε τέτοιες περιπτώσεις είναι πάντα η επιλογή «άγνωστο» (δηλαδή απουσία επαρκών δεδομένων)[1]. Αυτά τα παραδείγματα χρησιμεύουν για να ελεγχθεί εάν το μοντέλο θα εξάγει συμπέρασμα βασιζόμενο σε στερεότυπο.
- Αποσαφηνισμένο πλαίσιο (disambiguated context): εκτεταμένο σενάριο όπου προστίθεται μια διευκρινιστική λεπτομέρεια που επιτρέπει τον προσδιορισμό ποιο από τα δύο αναφερόμενα άτομα ανταποκρίνεται στην ερώτηση[1]. Σε αυτή την περίπτωση, ένας από τους δύο χαρακτήρες είναι εξ ορισμού η σωστή απάντηση (ενώ η επιλογή «άγνωστο» είναι πλέον λανθασμένη). Το αποσαφηνισμένο πλαίσιο χρησιμεύει για να ελεγχθεί εάν το μοντέλο μπορεί να υπερβεί τον πιθανό bias του και να επιλέξει τη σωστή απάντηση, ακόμα και αν το στερεότυπο υποδηλώνει το αντίθετο[1].
- Αρνητική ερώτηση (π.χ. «Ποιος από τους δύο γνωρίζει ελάχιστα το αντικείμενο;», «Ποιος διέπραξε το έγκλημα;»)[1]. Μια τέτοια ερώτηση σε συνδυασμό με αμφίσημο πλαίσιο ελέγχει εάν το μοντέλο τείνει να συνδέει αρνητική πράξη με συγκεκριμένη ομάδα ελλείψει πραγματικών δεδομένων[1].
- Μη αρνητική (αντιθετική) ερώτηση (π.χ. «Ποιος από τους δύο γνωρίζει καλά το αντικείμενο;» ή «Ποιος αποφεύγει την κακή πράξη;»)[1]. Η μη αρνητική ερώτηση διατυπώνεται έτσι ώστε να μην ακούγεται ως άμεση επιδοκιμασία του στερεοτύπου, επιτρέποντας ωστόσο τον έλεγχο της ισορροπίας των απαντήσεων του μοντέλου[1]. Η σύγκριση απαντήσεων σε αρνητικές και ουδέτερες εκδοχές αποκαλύπτει συστηματικές αποκλίσεις.
Κάθε ένα από αυτά τα τέσσερα παραδείγματα στο σύμπλεγμα έχει τρεις επιλογές απάντησης: δύο συγκεκριμένες (που ονομάζουν καθεμία από τις δύο εμπλεκόμενες ομάδες) και μία επιλογή που υποδηλώνει απουσία επαρκούς πληροφορίας (επισημασμένη ως «Unknown» και ισοδύναμες φράσεις)[1]. Για παράδειγμα, σε μια σκηνή όπου εμπλέκονται ένας Χριστιανός και ένας Μουσουλμάνος, οι επιλογές απάντησης θα είναι: «Χριστιανός», «Μουσουλμάνος» ή «άγνωστο»[1]. Μάλιστα, η λέξη «άγνωστο» δεν είναι πάντα η ίδια — χρησιμοποιούνται 10 συνώνυμες εκφράσεις[1].
Επιπλέον, σε κάθε πρότυπο αλλάζει αυτόματα η σειρά αναφοράς των δύο ομάδων[1]. Αυτό γίνεται για την εξουδετέρωση του αποτελέσματος σειράς — γνωστού παράγοντα κατά τον οποίο τα μοντέλα μπορεί να επιλέγουν συχνότερα την πρώτη αναφερόμενη οντότητα ανεξαρτήτως περιεχομένου[1].
Σχολιασμός και έλεγχος ποιότητας
Κάθε παράδειγμα του BBQ αξιολογήθηκε από crowdsourcing σχολιαστές: τουλάχιστον 5 ανεξάρτητα άτομα απαντούσαν στις ερωτήσεις, και στο τελικό dataset συμπεριλαμβάνονταν μόνο εκείνα τα παραδείγματα για τα οποία τουλάχιστον 4 από τους 5 σχολιαστές συμφώνησαν με τη σωστή απάντηση (μέσω ψηφοφορίας)[1]. Εάν κάποια ερώτηση δεν περνούσε αυτό το κατώφλι, το σύνολο του προτύπου επανεξεταζόταν και αναθεωρούνταν[1]. Χάρη σε αυτή τη διαδικασία, η ανθρώπινη ακρίβεια στο BBQ είναι πολύ υψηλή: μεμονωμένοι σχολιαστές απαντούσαν σωστά στο ~95,7% των ερωτήσεων, ενώ λαμβάνοντας υπόψη την πλειοψηφία των ψήφων, η ακρίβεια του χρυσού προτύπου φτάνει το 99,7%[1]. Ο δείκτης συμφωνίας Krippendorff's alpha ήταν 0,883, γεγονός που υποδηλώνει υψηλή συνοχή μεταξύ των ανθρώπων ως προς τις σωστές απαντήσεις[1]. Αυτά τα μέτρα επιβεβαιώνουν ότι οι εργασίες του BBQ είναι κατανοητές από ανθρώπους και έχουν αντικειμενικά σωστές απαντήσεις· κατά συνέπεια, τα σφάλματα μοντέλων σε αυτά τα παραδείγματα μπορούν εύλογα να ερμηνευθούν ως εκδηλώσεις bias και όχι ως ασάφεια των ίδιων των ερωτήσεων.
Αξιολόγηση προκαταλήψεων μοντέλων
Το BBQ σχεδιάστηκε για πολυδιάστατη αξιολόγηση της συμπεριφοράς μοντέλων σε συνθήκες που προκαλούν κοινωνικό bias. Κατά τη δοκιμή, το μοντέλο QA λαμβάνει ως είσοδο πλαίσιο και ερώτηση, και στη συνέχεια πρέπει να επιλέξει μία από τις τρεις επιλογές απάντησης. Η ανάλυση των αποτελεσμάτων διεξάγεται σε δύο επίπεδα[1]:
Περίπτωση αμφίσημου πλαισίου
Μετράται πόσο συχνά το μοντέλο απαντά λανθασμένα σε ερωτήσεις ελλείψει αναγκαίας πληροφορίας, δηλαδή βασίζεται σε στερεότυπο[1]. Ιδανικά, το μοντέλο πρέπει να απαντά «άγνωστο» σε κάθε ερώτηση με ανεπαρκές πλαίσιο, ωστόσο εάν επιλέξει μία από τις ομάδες, αυτό θεωρείται προβολή ενσωματωμένου στερεοτύπου[1]. Η συχνότητα τέτοιων σφαλμάτων και η κατανομή τους ανά κατηγορία δίνουν εικόνα της τάσης του μοντέλου να αναπαράγει επιβλαβή στερεότυπα.
Περίπτωση πληροφοριακού πλαισίου
Αξιολογείται πόσο ακριβώς απαντά το μοντέλο όταν το πλαίσιο περιέχει ρητή σωστή απάντηση[1]. Εδώ υπολογίζεται συνήθως η τυπική μετρική accuracy (ποσοστό σωστών απαντήσεων) — δείχνει εάν το μοντέλο ανταπεξέρχεται στο έργο ερωτήσεων-απαντήσεων γενικά. Ωστόσο, ιδιαίτερη προσοχή δίνεται στις περιπτώσεις όπου η σωστή απάντηση έρχεται σε αντίθεση με το στερεότυπο[1]. Οι σχεδιαστές του BBQ αναλύουν εάν η ακρίβεια του μοντέλου μειώνεται όταν η σωστή απάντηση αντιφάσκει με ένα εδραιωμένο στερεότυπο (και αντίστροφα, εάν η ακρίβεια είναι υψηλότερη όταν η αλήθεια συμπίπτει με στερεοτυπική προσδοκία)[1]. Ένα τέτοιο αποτέλεσμα θα υποδήλωνε ότι ακόμα και παρουσία πραγματικών δεδομένων, το μοντέλο μπορεί να κάνει λάθη λόγω bias.
Bias Score
Για ποσοτική αξιολόγηση του βαθμού προκατάληψης εισάγεται ειδική μετρική — δείκτης προκατάληψης (bias score)[1]. Γενικά, το bias score αντικατοπτρίζει το ποσοστό των απαντήσεων του μοντέλου (μεταξύ των λανθασμένων ή όλων, ανάλογα με τη συνθήκη) που συμπίπτουν με το στερεότυπο[1].
- Η τιμή +100% θα σήμαινε ότι το μοντέλο σε όλες τις περιπτώσεις επέλεξε την επιλογή απάντησης που αποδίδει στερεοτυπικά αρνητική ιδιότητα στη στοχευόμενη ομάδα.
- 0% — καμία εκδήλωση bias (το μοντέλο είτε απαντά πάντα σωστά/«άγνωστο», είτε κάνει λάθη ισόποσα και προς τις δύο κατευθύνσεις).
- Αρνητικό score (έως -100%) — αντίθετη τάση, όταν το μοντέλο απαντά πάντα αντίθετα από την προσδοκία του στερεοτύπου[1].
Οι δείκτες υπολογίζονται χωριστά για αμφίσημα και αποσαφηνισμένα πλαίσια, καθώς ο χαρακτήρας των σφαλμάτων σε αυτά διαφέρει[1].
- Για αμφίσημες ερωτήσεις το bias score ορίζεται από το ποσοστό των περιπτώσεων όπου το μοντέλο αντί για «άγνωστο» επέλεξε κάποια συγκεκριμένη απάντηση, και μάλιστα αυτή η απάντηση συμπίπτει με το αρνητικό στερεότυπο[1]. Όσο συχνότερες είναι τέτοιες απαντήσεις, τόσο υψηλότερο είναι το θετικό score. Ταυτόχρονα λαμβάνεται υπόψη η ακρίβεια: εάν το μοντέλο σφάλλει εξίσου και απαντά σωστά («άγνωστο»), τότε ακόμα και με ένα μέρος στερεοτυπικών σφαλμάτων, το score θα είναι χαμηλότερο από αυτό ενός μοντέλου που πάντα επιλέγει στερεοτυπική απάντηση[1]. Έτσι, τιμωρούνται τόσο η συχνότητα όσο και η βεβαιότητα των bias-απαντήσεων (για αμφίσημα πλαίσια, η μετρική κλιμακώνεται λαμβάνοντας υπόψη το ποσοστό σωστών απαντήσεων «άγνωστο»)[1].
- Για αποσαφηνισμένες ερωτήσεις το bias score υπολογίζεται κάπως διαφορετικά, αφού εδώ η σωστή απάντηση είναι μία από τις ομάδες[1]. Σε αυτές τις περιπτώσεις εξετάζονται τα λανθασμένα απαντήσεις του μοντέλου: το ποσοστό σφαλμάτων στα οποία το μοντέλο δεν επέλεξε τη σωστή επιλογή αλλά την εναλλακτική επιλογή που συμπίπτει με το στερεότυπο[1]. Με άλλα λόγια, εάν το μοντέλο έσφαλε δίνοντας προτεραιότητα στην προκατάληψη (π.χ. δεν εμπιστεύτηκε τα γεγονότα και απάντησε βάσει στερεοτύπου), αυτό αυξάνει το score[1].
Η ανάλυση του bias score μαζί με τη συνολική ακρίβεια επιτρέπει λεπτομερή χαρακτηρισμό της συμπεριφοράς του μοντέλου στο BBQ. Οι συγγραφείς επισημαίνουν ότι η ίδια ακρίβεια μπορεί να αποκρύπτει διαφορετικό χαρακτήρα σφαλμάτων[1]. Έτσι, αυτός ο δείκτης δείχνει την κατεύθυνση των σφαλμάτων και αποκαλύπτει λεπτές περιπτώσεις που δεν είναι ορατές μόνο από την ακρίβεια.
Αποτελέσματα και εντοπισμένες νομοτέλειες
Η αρχική δοκιμή αρκετών δημοφιλών μοντέλων QA στο σύνολο BBQ ανέδειξε μια σειρά από σαφείς εκδηλώσεις bias[1]. Στην έρευνα των Parrish et al. (2022) δοκιμάστηκαν τόσο μεγάλα γενικά μοντέλα (π.χ. UnifiedQA — γενικευμένο μοντέλο για QA βασισμένο στο T5), όσο και τυποποιημένα μοντέλα πολλαπλής επιλογής (π.χ. RoBERTa με fine-tuning σε QA)[1].
Κύρια συμπεράσματα βάσει των αποτελεσμάτων των πειραμάτων:
- Ισχυρά στερεοτυπικά σφάλματα ελλείψει πληροφορίας. Σε όλα τα δοκιμασμένα συστήματα παρατηρήθηκε τάση απάντησης σύμφωνα με το στερεότυπο όταν το πλαίσιο δεν παρείχε τις απαραίτητες ενδείξεις[1]. Με άλλα λόγια, τα μοντέλα συχνά δεν επέλεγαν την επιλογή «άγνωστο», αλλά προτιμούσαν συγκεκριμένη απάντηση που συσχετιζόταν με κάποια στερεοτυπική προσδοκία[1]. Για παράδειγμα, σε αμφίσημες ερωτήσεις για έγκλημα χωρίς σαφή ένοχο, τα μοντέλα συχνά υπέδειχναν άτομα από συγκεκριμένη ομάδα (αντίστοιχη με την προκατάληψη)[1]. Το υπολογισμένο bias score για αμφίσημα πλαίσια βρέθηκε σημαντικά πάνω από το μηδέν, και κάποιες φορές πλησίαζε το +100% σε ορισμένες κατηγορίες για μερικά μοντέλα[1]. Ιδιαίτερα υψηλή τάση για στερεοτυπικές απαντήσεις έδειξαν τα μοντέλα σε σκηνές που αφορούν εξωτερική εμφάνιση (παχυσαρκία κ.λπ.) — αυτή η κατηγορία έδωσε αισθητά μεγαλύτερο bias από ό,τι, για παράδειγμα, φυλή ή σεξουαλικός προσανατολισμός[1]. Αυτό μαρτυρά ανομοιογένεια του bias εντός του μοντέλου — ορισμένοι τύποι στερεοτύπων «έχουν αφομοιωθεί» ισχυρότερα από άλλους.
- Βελτίωση παρουσία πραγματικών δεδομένων, αλλά διατήρηση λανθάνοντος bias. Όταν τα μοντέλα λάμβαναν αποσαφηνισμένο πλαίσιο με ρητή ένδειξη σωστής απάντησης, η ακρίβειά τους αυξανόταν αισθητά (σε σύγκριση με την κατάσταση αβεβαιότητας)[1]. Ωστόσο, λεπτομερής ανάλυση αποκάλυψε έναν λεπτό εφέ: η ακρίβεια αποδείχθηκε ανομοιόμορφη ανάλογα με τη σχέση της σωστής απάντησης με το στερεότυπο[1]. Κατά μέσο όρο, τα μοντέλα έφταναν 3-3,5 ποσοστιαίες μονάδες υψηλότερη ακρίβεια στα παραδείγματα όπου η σωστή απάντηση συμπίπτει με το επικρατέστερο στερεότυπο, σε σύγκριση με τα παραδείγματα όπου η σωστή απάντηση αντιφάσκει με αυτό το στερεότυπο[1]. Με άλλα λόγια, όταν τα γεγονότα επιβεβαίωναν την προκατάληψη, τα μοντέλα έδιναν σχεδόν αλάνθαστα την απάντηση· αλλά εάν χρειαζόταν να ονομαστεί η «μη τυπική» για το στερεότυπο επιλογή, η πιθανότητα σφάλματος αυξανόταν. Αυτή η απόκλιση στην απόδοση, αν και όχι τεράστια, εμφανίστηκε στατιστικά σε πολλές κατηγορίες[1]. Η μεγαλύτερη απόκλιση καταγράφηκε για ερωτήσεις σχετικές με στερεότυπα φύλου: έως 5 ποσοστιαίες μονάδες διαφορά[1]. Έτσι, η λανθάνουσα επίδραση του bias ανιχνεύεται: τα μοντέλα κατά μέσο όρο τα πηγαίνουν λίγο χειρότερα «ενάντια στο στερεότυπο».
- Σύγκριση κατηγοριών και προτύπων. Οι ερευνητές του BBQ ανέλυσαν το bias score ανά τις εννέα κατηγορίες και διαπίστωσαν ότι σε αμφίσημα πλαίσια ο δείκτης είναι θετικός σε όλες τις κατηγορίες, αλλά το μέγεθός του ποικίλλει[1]. Όπως αναφέρθηκε, μέγιστα bias παρατηρήθηκαν στις κατηγορίες εξωτερική εμφάνιση, κοινωνικοοικονομική κατάσταση και σε ορισμένες διατομεακές[1]. Χαμηλότερα, αν και επίσης μη μηδενικά, bias score είχαν οι κατηγορίες φυλή/εθνοτική καταγωγή και σεξουαλικός προσανατολισμός[1]. Σε αποσαφηνισμένα πλαίσια το bias score είναι γενικά πιο κοντά στο μηδέν (καθώς το μοντέλο συχνά απαντά σωστά), αλλά εξακολουθεί να παραμένει θετικό για ορισμένα πρότυπα, αντανακλώντας αισθητή απόκλιση στον χαρακτήρα των σφαλμάτων[1]. Για παράδειγμα, στην κατηγορία θρησκεία τα περισσότερα σφάλματα ήταν μονόπλευρα — τα μοντέλα, γενικά, όταν έσφαλλαν επέλεγαν απάντηση βάσει προκατάληψης[1].
Συνολικά, το BBQ έδειξε ότι ακόμα και ισχυρά σύγχρονα γλωσσικά μοντέλα δεν είναι σαφώς απαλλαγμένα από κοινωνικές προκαταλήψεις[1]. Τείνουν να αναπαράγουν στερεότυπα όταν τοποθετούνται σε συνθήκες αβεβαιότητας, και μπορούν να εκδηλώνουν λεπτά bias ακόμα και παρουσία γεγονότων που απαιτούν αντίθετη απάντηση[1]. Ταυτόχρονα, το μέγεθος αυτών των εφέ δεν είναι ίδιο για διαφορετικές ομάδες: ορισμένα στερεότυπα έχουν «αφομοιωθεί» ισχυρότερα από το μοντέλο[1]. Οι συγγραφείς του BBQ τονίζουν ότι οι διαφορές που εντοπίστηκαν είναι αξιοσημείωτες, αλλά όχι καταστροφικά μεγάλες — το bias score των περισσότερων μοντέλων δεν φτάνει σε ακραίες τιμές, και συχνά κυμαίνεται σε μερικές δεκάδες ποσοστιαίων μονάδων[1]. Ωστόσο, ακόμα και μικρές συστηματικές αποκλίσεις προς τα στερεότυπα είναι δυνητικά επικίνδυνες σε μαζική χρήση των LLM, γι' αυτό ο εντοπισμός και η εξάλειψη τέτοιων bias αποτελεί σημαντική εργασία[3]. Το BBQ παρείχε στους ερευνητές έναν σαφή και ποσοτικά μετρήσιμο τρόπο παρακολούθησης της προόδου σε αυτόν τον τομέα[3].
Επίδραση και μεταγενέστερες έρευνες
Το σύνολο BBQ γρήγορα απέκτησε αναγνώριση ως τυπικό εργαλείο για την αξιολόγηση των χαρακτηριστικών fairness των γλωσσικών μοντέλων[4]. Ο ανοιχτός κώδικας και τα δεδομένα του είναι διαθέσιμα στο αποθετήριο (άδεια CC BY 4.0)[4], γεγονός που επέτρεψε σε ευρύ ερευνητικό κοινό να χρησιμοποιεί το BBQ κατά την ανάπτυξη και δοκιμή νέων μοντέλων. Σε αρκετές ανασκοπήσεις το BBQ αναφέρεται μαζί με άλλα benchmarks (π.χ. StereoSet, WinoBias, ToxiGen) ως σημαντικό ορόσημο στη μελέτη του κοινωνικού bias στο NLP[3]. Από την έκδοση του BBQ εμφανίστηκαν εργασίες που αναπτύσσουν τις ιδέες του και τις προσαρμόζουν σε νέες συνθήκες:
- Επέκταση μορφών ερωτήσεων (Open-BBQ). Το αρχικό BBQ προσφέρει εργασίες σε μορφή πολλαπλής επιλογής[3]. Το 2024 προτάθηκε τροποποίηση του BBQ για ανοιχτές απαντήσεις, συμπεριλαμβανομένων εργασιών συμπλήρωσης κενών και σύντομου απαντητικού κειμένου[3]. Αυτή η έκδοση, αποκαλούμενη εδώ Open-BBQ, επιτρέπει την αξιολόγηση του bias σε πιο ελεύθερες συνθήκες διαλόγου, όπου το μοντέλο δεν έχει σταθερές επιλογές απάντησης[3]. Η έρευνα έδειξε ότι τα LLM κατά τη δημιουργία ελεύθερου κειμένου επίσης εκδηλώνουν αυξημένο bias κατά ορισμένων ομάδων[3]. Οι συγγραφείς του Open-BBQ πειραματίστηκαν επίσης με μεθόδους μετριασμού της προκατάληψης, συνδυάζοντας zero-shot και few-shot προτροπές και chain-of-thought (βηματική συλλογιστική)[3]. Αυτές οι μέθοδοι επέτρεψαν αισθητή μείωση του επιπέδου bias στις απαντήσεις[3]. Το Open-BBQ συμπλήρωσε το αρχικό σύνολο, καθιστώντας δυνατή τη δοκιμή παραγωγικών μοντέλων σε μορφές πιο κοντά στα αιτήματα χρηστών.
- Πολιτισμική προσαρμογή (τοπικοποίηση). Καθώς το BBQ είναι δεμένο με τις κοινωνικές πραγματικότητες των ΗΠΑ, οι ερευνητές ενδιαφέρθηκαν για την προσαρμογή του σε άλλες γλώσσες και πολιτισμούς[5]. Το 2023 Κορεάτες επιστήμονες παρουσίασαν το dataset KoBBQ (Korean BBQ) — κορεατικό ανάλογο του Bias Benchmark[5]. Ανέπτυξαν μια γενική προσέγγιση τοπικοποίησης του BBQ: χώρισαν τα αρχικά πρότυπα σε τρεις κατηγορίες — αυτά που μπορούν απλώς να μεταφραστούν, αυτά που απαιτούν αντικατάσταση ομάδων με τοπικά ισοδύναμα, και αυτά που δεν εφαρμόζονται καθόλου σε κορεατικό πλαίσιο[5]. Επιπλέον, το KoBBQ εισήγαγε 4 νέες κατηγορίες στερεοτύπων ειδικές για την κορεατική κοινωνία και αφαίρεσε αρκετά μη κατάλληλα παραδείγματα[5]. Το αποτέλεσμα ήταν ένα σύνολο από 268 πρότυπα και 76.048 παραδείγματα στην κορεατική γλώσσα, που καλύπτει 12 κατηγορίες κοινωνικού bias (συμπεριλαμβανομένων των αρχικών και νέων)[5]. Η δοκιμή πολύγλωσσων μοντέλων στο KoBBQ αποκάλυψε σημαντικές διαφορές στο επίπεδο προκατάληψης σε σύγκριση με απευθείας μηχανική μετάφραση του αρχικού BBQ στα κορεατικά[5]. Αυτό υπογραμμίζει ότι η απευθείας μετάφραση δεν είναι αρκετή — χρειάζονται πολιτισμικά ειδικά benchmarks που να λαμβάνουν υπόψη τα μοναδικά στερεότυπα και πλαίσιο κάθε χώρας[5]. Η εργασία για το KoBBQ απέδειξε τη δυνατότητα κλιμάκωσης της μεθοδολογίας του BBQ σε παγκόσμιο επίπεδο.
Το BBQ έχει γίνει αναπόσπαστο μέρος των ερευνών για την ηθική της τεχνητής νοημοσύνης[3]. Η επίδρασή του ανιχνεύεται στην εμφάνιση νέων μεθοδολογιών αποκατάστασης bias στα μοντέλα, κατασκευής πιο ενταξιακών dataset και μετρικών για λεπτή ανάλυση του bias. Οι ερευνητές σημειώνουν ότι ένα από τα δυνατά σημεία του BBQ είναι η ευρύτητα της κάλυψης και η προσεκτική κατασκευή των παραδειγμάτων[3]. Σε απάντηση στις προκλήσεις που ανέδειξε το BBQ, τα τελευταία χρόνια αναπτύσσονται ενεργά στρατηγικές μείωσης του bias — από φιλτράρισμα δεδομένων εκπαίδευσης έως ειδικούς αλγόριθμους μεταεπεξεργασίας και ρύθμιση των LLM για δίκαιες απαντήσεις[3].
Συνοψίζοντας, το BBQ (Bias Benchmark for QA) έχει καθιερωθεί ως πολύτιμο και αξιόπιστο εργαλείο για τη μέτρηση κοινωνικών προκαταλήψεων στα γλωσσικά μοντέλα. Παρέχει στην ερευνητική κοινότητα ένα τυπικό σύνολο ελέγχων που επιτρέπει τη σύγκριση μοντέλων ως προς στερεοτυπικότητα και την παρακολούθηση της προόδου στη βελτίωση της αμεροληψίας τους[3]. Το BBQ συνεχίζει να επεκτείνεται και να προσαρμόζεται, αντανακλώντας το παγκόσμιο ενδιαφέρον για τη δημιουργία πιο δίκαιων και ασφαλών συστημάτων AI[3], απαλλαγμένων από αθόρυβες, αλλά ουσιαστικές επιβλαβείς προκαταλήψεις.
Σύνδεσμοι
- Αρχικό άρθρο BBQ (arXiv)
- Αποθετήριο BBQ στο GitHub
- Σελίδα dataset BBQ στο Papers With Code
- Άρθρο BBQ στο ACL Anthology
- Άρθρο για το dataset KoBBQ (arXiv)
- Άρθρο για το dataset Open-BBQ (arXiv)
Βιβλιογραφία
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
Παραπομπές
[1] [2] [3] [4] [5] </references>
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 1.24 1.25 1.26 1.27 1.28 1.29 1.30 1.31 1.32 1.33 1.34 1.35 1.36 1.37 1.38 1.39 1.40 1.41 1.42 1.43 1.44 1.45 1.46 1.47 1.48 1.49 1.50 1.51 1.52 1.53 1.54 1.55 1.56 1.57 1.58 1.59 1.60 1.61 1.62 1.63 1.64 1.65 1.66 1.67 1.68 1.69 1.70 1.71 1.72 1.73 1.74 1.75 1.76 1.77 1.78 1.79 1.80 1.81 Parrish A. et al. «BBQ: A Hand-Built Bias Benchmark for Question Answering». arXiv. [1]
- ↑ 2.0 2.1 Parrish A. et al. «BBQ: A hand-built bias benchmark for question answering». ACL Anthology. [2]
- ↑ 3.00 3.01 3.02 3.03 3.04 3.05 3.06 3.07 3.08 3.09 3.10 3.11 3.12 3.13 3.14 3.15 3.16 Liu Z. et al. (2024). «Evaluating and Mitigating Social Bias for Large Language Models in Open-ended Settings». arXiv preprint. [3]
- ↑ 4.0 4.1 4.2 4.3 4.4 4.5 4.6 «BBQ Dataset». Papers With Code. [4]
- ↑ 5.0 5.1 5.2 5.3 5.4 5.5 5.6 5.7 Jin J. et al. (2024). «KoBBQ: Korean Bias Benchmark for Question Answering». arXiv preprint. [5]