---
title: "BBQ (Bias Benchmark for Question Answering) (PL)"
source: "https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)"
wiki: "systems-analysis.info/int"
article: "BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)"
language: "pl"
categories:
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
  - "Category:Polish"
revision_id: 528
wiki_created_at: 2026-09-06T22:35:06Z
wiki_modified_at: 2026-09-06T22:35:06Z
downloaded_at: 2026-09-07T22:40:46Z
---

# BBQ (Bias Benchmark for Question Answering) (PL)

**BBQ** (Bias Benchmark for Question Answering) — to **zbiór danych** służący do oceny **uprzedzeń społecznych** (bias) w systemach pytań i odpowiedzi (QA)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>. Został opracowany przez grupę badaczy z Uniwersytetu Nowojorskiego pod kierownictwem Alicii Parrish i opublikowany w 2022 roku na konferencji ACL Findings<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)[\[2\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-acl-anthology-2)</sup>. Celem BBQ jest ujawnienie, w jaki sposób duże modele językowe (LLM) i inne modele QA przejawiają stereotypy i uprzedzenia w odpowiedziach na pytania, szczególnie w praktycznych zadaniach odpowiadania na pytania w języku naturalnym<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>. BBQ stał się jednym z najbardziej kompleksowych benchmarków do oceny społecznego bias w NLP, obejmując szeroki zakres stereotypów w ramach dziewięciu kategorii społecznych<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-evaluating-mitigating-3)</sup>.

Niniejszy zbiór danych uzupełnia wcześniejsze prace, takie jak dataset UnQover (2020), który mierzył uprzedzenia według ograniczonej liczby cech (płeć–zawód, narodowość, przynależność etniczna, religia) i opierał się na prawdopodobieństwach modeli, a nie na samych odpowiedziach<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-evaluating-mitigating-3)</sup>. W odróżnieniu od UnQover, BBQ bezpośrednio analizuje treść odpowiedzi modeli i ich wybór spośród zaproponowanych opcji, co pozwala oceniać uprzedzenia właśnie na poziomie generowanych wyników<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>.

Autorzy BBQ pozycjonują go jako narzędzie do diagnozowania **szkodliwych stereotypów społecznych** w modelach i zmniejszania ryzyka negatywnego wpływu takich stereotypów na grupy narażone<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>. Zbiór skupia się na stereotypach aktualnych dla anglojęzycznej kultury Stanów Zjednoczonych i nie obejmuje wszystkich możliwych kontekstów kulturowych<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>. Niemniej jednak BBQ położył podwaliny pod kolejne prace dotyczące pomiaru i łagodzenia społecznego bias w NLP i stał się punktem odniesienia przy porównywaniu modeli pod względem ich etycznej poprawności.

## Skład i struktura zbioru danych

BBQ zawiera około **58,5 tysiąca pytań i odpowiedzi**, pogrupowanych w specjalne zestawy ukierunkowane na ujawnianie konkretnych stereotypów<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-paperswithcode-bbq-4)</sup>. Wszystkie przykłady zostały **ręcznie** opracowane przez autorów na podstawie udokumentowanych przypadków uprzedzeń i stereotypów wyrządzających szkodę przedstawicielom różnych grup społecznych<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-paperswithcode-bbq-4)</sup>. Przy tworzeniu scenariuszy wykorzystano dane z badań naukowych, artykuły medialne, raporty i inne wiarygodne źródła potwierdzające istnienie danego stereotypu oraz jego szkodliwe konsekwencje<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>. Dla każdej sytuacji autorzy podają odniesienie do źródła, w którym dany stereotyp opisywany jest jako negatywny lub szkodliwy (np. artykuł naukowy lub wzmianka prasowa)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>.

### Kategorie społeczne

BBQ obejmuje **dziewięć podstawowych kategorii istotnych społecznie** (w większości odpowiadających grupom chronionym w rozumieniu Komisji ds. Równych Szans Zatrudnienia USA)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>:

- **Wiek** – uprzedzenia wobec grup wiekowych (np. stereotyp o spadku sprawności poznawczej u osób starszych)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>.
- **Niepełnosprawność** – stereotypy dotyczące zdolności umysłowych lub innych cech osób z niepełnosprawnościami (np. przekonanie, że osoby z niepełnosprawnością fizyczną są mniej kompetentne intelektualnie)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>.
- **Tożsamość płciowa** – stereotypy płciowe (np. pogląd, że „dziewczynki słabo radzą sobie z matematyką")<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>.
- **Narodowość** – uprzedzenia narodowo-etniczne (np. stereotyp o technicznym analfabetyzmie osób pochodzących z Afryki)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>.
- **Wygląd zewnętrzny** – dyskryminacja ze względu na wygląd lub budowę ciała (np. przekonanie, że osoby z otyłością są mniej inteligentne lub pracowite)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>.
- **Rasa/przynależność etniczna** – stereotypy rasowe (np. stronnicze łączenie określonej rasy z przestępczością lub narkotykami)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>.
- **Religia** – stereotypy religijne (np. postrzeganie Żydów jako chciwych, muzułmanów jako skłonnych do przemocy itp.)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>.
- **Status społeczno-ekonomiczny** – uprzedzenia wobec biednych lub bogatych warstw społeczeństwa (np. przekonanie, że osoby pochodzące z ubogich rodzin będą złymi rodzicami)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>.
- **Orientacja seksualna** – stereotypy homofobiczne (np. fałszywe kojarzenie homoseksualności z zakażeniem HIV)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>.

Oprócz tych dziewięciu kategorii, BBQ zawiera dwie **kategorie przecięciowe** (intersectional biases), łączące jednocześnie dwie cechy: (1) płeć w połączeniu z rasą/etnicznością oraz (2) status społeczno-ekonomiczny w połączeniu z rasą<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>. Takie przypadki uwzględniają stereotypy na przecięciu różnych grup (np. uprzedzenia skierowane konkretnie przeciwko czarnoskórym kobietom lub przeciwko przedstawicielom określonych grup etnicznych z niższych klas społecznych).

### Szablony i generowanie przykładów

Dla każdej kategorii zespół opracował **szablony scenariuszy** — krótkie scenki, w których pojawiają się dwie postacie różniące się pod względem docelowej cechy (np. młody i starszy, mężczyzna i kobieta, bogaty i biedny itp.)<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-paperswithcode-bbq-4)</sup>. Szablon zawiera sytuację, która mogłaby potwierdzić lub obalić znany stereotyp. Do każdego scenariusza przypisane są pytania i warianty odpowiedzi.

Opracowano łącznie po 25 unikalnych szablonów dla każdej z dziewięciu głównych kategorii, a ponadto po 25 dodatkowych szablonów dla kategorii rasy i płci z wykorzystaniem prawdziwych imion i nazwisk (aby sprawdzić bias na poziomie nazw własnych)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>. Dla dwóch kierunków przecięciowych utworzono również po 25 szablonów<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>. W ten sposób łączna liczba bazowych scenariuszy przekracza 300.

Każdy szablon zawiera specjalne **sloty na zmienne** — nazwy grup lub opisy — które są wstawiane do tekstu (np. w szablonie dotyczącym wieku zamiast „\_-letnia osoba" podstawiane są różne liczby, a w szablonie dotyczącym wyglądu — przymiotniki „gruby"/„chudy" itp.)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>. Dzięki podstawianiu różnych wartości i zamianie kolejności wzmiankowania dwóch postaci, każdy szablon rozrasta się do wielu konkretnych przykładów (od minimum 8 do nawet ~200 wariantów)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>. Na ogół z jednego szablonu generuje się co najmniej 100 finalnych pytań, a w niektórych przypadkach nawet do dwustu<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>. W sumie powstał korpus złożony z 58 492 przykładów (unikalnych kombinacji scenariusza, pytania i odpowiedzi)<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-paperswithcode-bbq-4)</sup>.

### Konteksty i typy pytań

Kluczową cechą BBQ jest to, że każda sytuacja reprezentowana jest przez dwa warianty kontekstu i dwie formułowania pytania, tworząc zestaw **czterech pytań** (tzw. klaster z 4)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>. Zostało to zrobione w celu oddzielenia wpływu braku informacji od własnych stereotypów modelu. W każdym kwartecie<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>:

- **Kontekst niejednoznaczny** (under-informative or ambiguous context): tekst opisujący sytuację z udziałem dwóch osób z różnych grup, który nie zawiera wystarczających informacji, aby jednoznacznie odpowiedzieć na postawione pytanie<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>. Prawidłową odpowiedzią w takich przypadkach jest zawsze wariant „nieznane" (czyli brak wystarczających danych)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>. Te przykłady służą sprawdzeniu, czy model nie wyciąga wniosków opartych na stereotypie.
- **Kontekst jednoznaczny** (disambiguated context): rozszerzony scenariusz, w którym dodany jest szczegół uściślający pozwalający ustalić, która z dwóch wymienionych osób odpowiada pytaniu<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>. W tym przypadku jedna z dwóch postaci jest zdecydowanie poprawną odpowiedzią (a wariant „nieznane" jest już nieprawidłowy). Kontekst jednoznaczny służy sprawdzeniu, czy model jest w stanie pokonać własny potencjalny bias i wybrać właściwą odpowiedź, nawet jeśli stereotyp sugeruje coś innego<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>.
- **Pytanie negatywne** (np. „Kto z nich słabo zna przedmiot?", „Kto popełnił przestępstwo?")<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>. Takie pytanie w połączeniu z niejednoznacznym kontekstem sprawdza, czy model ma skłonność do kojarzenia negatywnego działania z określoną grupą przy braku faktów<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>.
- **Pytanie nienegatywne (kontrastowe)** (np. „Kto z nich dobrze zna przedmiot?" lub „Kto powstrzymuje się od złego czynu?")<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>. Pytanie nienegatywne sformułowane jest tak, aby nie brzmiało jak bezpośrednia akceptacja stereotypu, ale jednocześnie umożliwiało sprawdzenie równowagi odpowiedzi modelu<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>. Porównanie odpowiedzi na wersje negatywne i neutralne ujawnia systematyczne przekrzywienia.

Każdy z tych czterech przykładów w klastrze ma **trzy warianty odpowiedzi**: dwa konkretne (wymieniające każdą z dwóch figurujących grup) oraz jeden wariant wskazujący na brak wystarczających informacji (oznaczony jako „Unknown" i równoważne wyrażenia)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>. Na przykład w scenie, w której uczestniczą umowny chrześcijanin i muzułmanin, warianty odpowiedzi to: „chrześcijanin", „muzułmanin" lub „nieznane"<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>. Przy czym słowo „nieznane" nie zawsze jest takie samo — stosuje się 10 synonimicznych wyrażeń<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>.

Ponadto w każdym szablonie automatycznie zmienia się **kolejność wzmiankowania dwóch grup**<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>. Służy to niwelowaniu **efektu kolejności** — znanego czynnika, przy którym modele mogą częściej wybierać pierwszą wymienioną jednostkę niezależnie od treści<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>.

### Anotowanie i kontrola jakości

Każdy przykład BBQ był oceniany przez crowdsourcingowych anotatorów: co najmniej 5 niezależnych osób odpowiadało na pytania, a do finalnego datasetu włączano tylko te przykłady, co do których **co najmniej 4 z 5 anotatorów zgodziło się z poprawną odpowiedzią** (w drodze głosowania)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>. Jeśli jakiekolwiek pytanie nie osiągało tego progu, cały szablon był przeglądany i redagowany<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>. Dzięki temu procesowi ludzka dokładność na BBQ jest bardzo wysoka: indywidualni anotatorzy poprawnie odpowiadali na ~95,7% pytań, a uwzględniając większość głosów, dokładność złotego standardu osiąga 99,7%<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>. Współczynnik zgodności kappa (Krippendorff's alpha) wyniósł 0,883, co wskazuje na **wysoką zgodność** między ludźmi co do poprawnych odpowiedzi<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>. Środki te potwierdzają, że zadania BBQ są zrozumiałe dla ludzi i mają obiektywnie poprawne odpowiedzi; w konsekwencji błędy modeli na tych przykładach można zasadnie interpretować jako przejawy bias, a nie jako niejednoznaczność samych pytań.

## Ocena stronniczości modeli

BBQ zostało zaprojektowane do wieloaspektowej oceny zachowania modeli w warunkach prowokujących społeczny bias. Podczas testowania model QA otrzymuje na wejściu kontekst i pytanie, po czym musi wybrać jeden z trzech wariantów odpowiedzi. Analiza wyników prowadzona jest na dwóch poziomach<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>:

### Przypadek kontekstu niejednoznacznego

Mierzy się, jak często model odpowiada nieprawidłowo na pytania przy braku niezbędnych informacji, czyli **opiera się na stereotypie**<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>. W idealnym przypadku model powinien odpowiadać „nieznane" na każde pytanie z niewystarczającym kontekstem, jednak jeśli wybiera jedną z grup, jest to traktowane jako projekcja wbudowanego stereotypu<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>. Częstość takich błędów i ich rozkład według kategorii dają obraz skłonności modelu do powielania szkodliwych stereotypów.

### Przypadek kontekstu informatywnego

Ocenia się, jak dokładnie model odpowiada, gdy kontekst zawiera wyraźną poprawną odpowiedź<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>. Tutaj zazwyczaj oblicza się standardową metrykę **accuracy** (procent poprawnych odpowiedzi) — pokazuje, czy model radzi sobie z zadaniem pytanie–odpowiedź w ogóle. Szczególną uwagę zwraca się jednak na przypadki, gdy poprawna odpowiedź jest sprzeczna ze stereotypem<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>. Twórcy BBQ analizują, czy dokładność modelu nie spada, gdy właściwa odpowiedź przeczy utrwalonemu stereotypowi (i odwrotnie, czy nie jest wyższa, gdy prawda pokrywa się ze stereotypowym oczekiwaniem)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>. Taki efekt wskazywałby, że nawet przy dostępności faktów model może popełniać błędy z powodu bias.

### Bias Score

Do ilościowej oceny stopnia stronniczości wprowadza się specjalną metrykę — **wskaźnik stronniczości** (bias score)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>. Ogólnie rzecz biorąc, bias score odzwierciedla procent odpowiedzi modelu (spośród niepoprawnych lub wszystkich, w zależności od warunku), które są zgodne ze stereotypem<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>.

- Wartość **+100%** oznaczałaby, że model we wszystkich przypadkach wybrał wariant odpowiedzi stereotypowo przypisujący negatywną cechę docelowej grupie.
- **0%** — brak przejawów bias (model albo zawsze odpowiada poprawnie/„nieznane", albo myli się równomiernie w obie strony).
- **Ujemny score** (do -100%) — odwrotna tendencja, gdy model zawsze odpowiada wbrew oczekiwaniu stereotypu<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>.

Wskaźniki obliczane są oddzielnie dla kontekstów niejednoznacznych i jednoznacznych, ponieważ charakter błędów w nich jest różny<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>.

- Dla **pytań niejednoznacznych** bias score określany jest przez udział przypadków, w których model zamiast „nieznane" wybrał jakąś konkretną odpowiedź, przy czym odpowiedź ta pokrywała się z negatywnym stereotypem<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>. Im częstsze takie odpowiedzi, tym wyższy dodatni score. Uwzględniana jest przy tym dokładność: jeśli model w równym stopniu myli się i odpowiada prawidłowo („nieznane"), to nawet przy części stereotypowych błędów score będzie niższy niż u modelu, który zawsze wybiera stereotypową odpowiedź<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>. W ten sposób **karana jest zarówno częstotliwość, jak i pewność odpowiedzi bias** (dla niejednoznacznych kontekstów metrykę skaluje się z uwzględnieniem procentu poprawnych odpowiedzi „nieznane")<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>.
- Dla **pytań jednoznacznych** bias score obliczany jest nieco inaczej, gdyż tutaj poprawna odpowiedź to jedna z grup<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>. W tych przypadkach analizuje się **niepoprawne odpowiedzi** modelu: udział błędów, w których model wybrał nie właściwy wariant, lecz alternatywny wariant pokrywający się ze stereotypem<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>. Innymi słowy, jeśli model się mylił, preferując uprzedzenie (np. nie uwierzył faktom i odpowiedział zgodnie ze stereotypem), zwiększa to score<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>.

Analiza bias score obok ogólnej dokładności pozwala szczegółowo scharakteryzować zachowanie modelu na BBQ. Autorzy wskazują, że ta sama accuracy może ukrywać różny charakter błędów<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>. W ten sposób wskaźnik ten pokazuje **kierunek błędów** i ujawnia subtelne przypadki niewidoczne przy samej tylko dokładności.

## Wyniki i zaobserwowane prawidłowości

Pierwsze testy kilku popularnych modeli QA na zbiorze BBQ ujawniły szereg wyraźnych przejawów bias<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>. W badaniu Parrish i in. (2022) przetestowano zarówno duże modele ogólnego przeznaczenia (np. UnifiedQA — uogólniony model QA oparty na T5), jak i standardowe modele multiple-choice (np. RoBERTa z doustrojeniem na QA)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>.

Główne wnioski z wyników eksperymentów:

- **Silne błędy stereotypowe przy braku informacji**. We wszystkich przetestowanych systemach zaobserwowano tendencję do odpowiadania zgodnie ze stereotypem, gdy kontekst nie dostarczał potrzebnych wskazówek<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>. Innymi słowy, modele często nie wybierały wariantu „nieznane", lecz preferowały konkretną odpowiedź odpowiadającą temu lub innemu stereotypowemu oczekiwaniu<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>. Na przykład w niejednoznacznych pytaniach o przestępstwo bez wyraźnego sprawcy modele nierzadko wskazywały osoby z określonej grupy (odpowiadającej uprzedzeniu)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>. Obliczony bias score dla kontekstów niejednoznacznych okazał się znacznie wyższy od zera, a w niektórych kategoriach u pewnych modeli zbliżał się do +100%<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>. Szczególnie wysoką skłonność do stereotypowych odpowiedzi wykazały modele na scenkach związanych z **wyglądem zewnętrznym** (otyłość itp.) — ta kategoria dała zauważalnie wyższy bias niż np. rasa czy orientacja seksualna<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>. Świadczy to o niejednorodności bias wewnątrz modelu — jedne rodzaje stereotypów są przez niego „przyswojone" silniej niż inne.
- **Poprawa przy dostępności faktów, ale utrzymanie ukrytego bias**. Gdy modele otrzymywały jednoznaczny kontekst z wyraźnym wskazaniem poprawnej odpowiedzi, ich **dokładność wyraźnie rosła** (w porównaniu z sytuacją niepewności)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>. Jednak szczegółowa analiza ujawniła subtelny efekt: dokładność okazała się **nierównomierna w zależności od relacji między poprawną odpowiedzią a stereotypem**<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>. Średnio modele osiągały o 3–3,5 punktu procentowego wyższą dokładność w tych przykładach, gdzie poprawna odpowiedź pokrywała się z powszechnym stereotypem, w porównaniu z przykładami, gdzie właściwa odpowiedź temu stereotypowi przeczyła<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>. Innymi słowy, gdy fakty potwierdzały uprzedzenie, modele niemal bezbłędnie udzielały odpowiedzi; lecz gdy wymagane było wskazanie wariantu „niestereotypowego", prawdopodobieństwo błędu wzrastało. Choć ta rozbieżność w wynikach nie jest ogromna, ujawniła się statystycznie w wielu kategoriach<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>. Największa różnica została odnotowana w pytaniach związanych ze stereotypami płciowymi: do 5 punktów procentowych różnicy<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>. Tym samym prześledza się **ukryty wpływ bias**: modele przeciętnie nieco gorzej radzą sobie działając „wbrew stereotypowi".
- **Porównanie kategorii i szablonów**. Badacze BBQ przeanalizowali bias score w rozbiciu na wszystkie dziewięć kategorii i stwierdzili, że w niejednoznacznych kontekstach wskaźnik jest dodatni we wszystkich kategoriach, lecz jego wartość jest zróżnicowana<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>. Jak wspomniano, maksymalne bias odnotowano w kategoriach wygląd fizyczny, status społeczno-ekonomiczny oraz niektórych przecięciowych<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>. Niższe, choć wciąż niezerowe, bias score miały kategorie rasa/etniczność i orientacja seksualna<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>. W kontekstach jednoznacznych bias score jest ogólnie bliższy zeru (ponieważ model często odpowiada prawidłowo), lecz nadal dla niektórych szablonów pozostaje dodatni, odzwierciedlając zauważalne przekrzywienie w charakterze popełnianych błędów<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>. Na przykład w kategorii religia większość błędów była jednostronna — modele przy błędnym odpowiadaniu na ogół wybierały odpowiedź opartą na uprzedzeniu<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>.

Ogólnie BBQ wykazał, że nawet silne współczesne modele językowe **wyraźnie nie są wolne od uprzedzeń społecznych**<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>. Mają skłonność do powielania stereotypów, gdy znajdą się w warunkach niepewności, i mogą przejawiać subtelny bias nawet przy dostępności faktów wymagających odwrotnej odpowiedzi<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>. Przy tym skala tych efektów nie jest jednakowa dla różnych grup: niektóre stereotypy są przez model „przyswojone" silniej<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>. Autorzy BBQ podkreślają, że wykryte różnice, choć zauważalne, nie są katastroficznie duże — bias score większości modeli nie osiąga ekstremalnych wartości, a często mieści się w granicach kilkudziesięciu procent<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-bbq-main-1)</sup>. Niemniej jednak nawet niewielkie systematyczne odchylenia w kierunku stereotypów są potencjalnie niebezpieczne przy masowym stosowaniu LLM, dlatego identyfikowanie i usuwanie takich bias jest ważnym zadaniem<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-evaluating-mitigating-3)</sup>. BBQ dostarczył badaczom czytelnego i mierzalnego ilościowo sposobu śledzenia postępów w tej dziedzinie<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-evaluating-mitigating-3)</sup>.

## Wpływ i dalsze badania

Zbiór BBQ szybko zyskał uznanie jako standardowe narzędzie do oceny cech fairness modeli językowych<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-paperswithcode-bbq-4)</sup>. Jego **otwarty kod źródłowy i dane** dostępne są w repozytorium (licencja CC BY 4.0)<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-paperswithcode-bbq-4)</sup>, co pozwoliło szerokiemu środowisku badawczemu stosować BBQ przy tworzeniu i testowaniu nowych modeli. W szeregu przeglądów BBQ wymieniane jest obok innych benchmarków (np. StereoSet, WinoBias, ToxiGen) jako ważny punkt zwrotny w badaniu społecznego bias w NLP<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-evaluating-mitigating-3)</sup>. Od czasu publikacji BBQ pojawiły się prace rozwijające jego idee i adaptujące je do nowych warunków:

- **Rozszerzenie formatów pytań (Open-BBQ)**. Oryginalny BBQ oferuje zadania w formacie wielokrotnego wyboru<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-evaluating-mitigating-3)</sup>. W 2024 roku zaproponowano modyfikację BBQ dla **odpowiedzi otwartych**, obejmującą zadania uzupełniania luk i krótkich odpowiedzi tekstowych<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-evaluating-mitigating-3)</sup>. Ta wersja, umownie nazywana Open-BBQ, pozwala oceniać bias w swobodniejszych warunkach dialogu, gdzie model nie dysponuje stałymi wariantami odpowiedzi<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-evaluating-mitigating-3)</sup>. Badanie wykazało, że LLM przy generowaniu swobodnego tekstu również wykazują zwiększony bias wobec niektórych grup<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-evaluating-mitigating-3)</sup>. Autorzy Open-BBQ eksperymentowali także z metodami łagodzenia stronniczości, łącząc podpowiedzi zero-shot i few-shot oraz chain-of-thought (rozumowanie krok po kroku)<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-evaluating-mitigating-3)</sup>. Metody te pozwoliły znacząco obniżyć poziom bias w odpowiedziach<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-evaluating-mitigating-3)</sup>. Open-BBQ uzupełnił oryginalny zbiór, umożliwiając testowanie modeli generatywnych w formatach bliższych zapytaniom użytkowników.

<!-- -->

- **Adaptacja kulturowa (lokalizacja)**. Ponieważ BBQ osadzone jest w społecznych realiach USA, badacze zainteresowali się jego adaptacją do innych języków i kultur<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-kobbg-5)</sup>. W 2023 roku koreańscy naukowcy zaprezentowali dataset **KoBBQ** (Korean BBQ) — koreański odpowiednik Bias Benchmark<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-kobbg-5)</sup>. Opracowali ogólne podejście do lokalizacji BBQ, dzieląc oryginalne szablony na trzy kategorie — te, które można po prostu przetłumaczyć, te wymagające zastąpienia grup lokalnymi odpowiednikami, oraz te, które w ogóle nie mają zastosowania w kontekście koreańskim<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-kobbg-5)</sup>. Dodatkowo KoBBQ wprowadził 4 nowe kategorie stereotypów specyficzne dla społeczeństwa koreańskiego i usunął szereg nieodpowiadających przykładów<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-kobbg-5)</sup>. W rezultacie powstał zbiór 268 szablonów i 76 048 przykładów w języku koreańskim, obejmujący 12 kategorii społecznego bias (w tym oryginalne i nowe)<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-kobbg-5)</sup>. Testowanie wielojęzycznych modeli na KoBBQ ujawniło znaczące różnice w poziomie stronniczości w porównaniu z bezpośrednim maszynowym tłumaczeniem oryginalnego BBQ na koreański<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-kobbg-5)</sup>. Podkreśla to, że **samo tłumaczenie jest niewystarczające** — konieczne są kulturowo specyficzne benchmarki uwzględniające unikalne stereotypy i kontekst każdego kraju<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-kobbg-5)</sup>. Praca nad KoBBQ wykazała możliwość globalnego skalowania metodologii BBQ.

BBQ stało się nieodłączną częścią badań nad **etyką sztucznej inteligencji**<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-evaluating-mitigating-3)</sup>. Jego wpływ widoczny jest w pojawianiu się nowych metod debiasingu modeli, tworzeniu bardziej inkluzywnych datasetów i metryk do subtelnej analizy bias. Badacze zwracają uwagę, że jedną z mocnych stron BBQ jest szerokość zakresu i staranność konstrukcji przykładów<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-evaluating-mitigating-3)</sup>. W odpowiedzi na wyzwania wskazane przez BBQ aktywnie opracowywane są **strategie redukcji bias** — od filtrowania danych treningowych, przez specjalne algorytmy przetwarzania końcowego, aż po dostrajanie LLM pod kątem sprawiedliwych odpowiedzi<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-evaluating-mitigating-3)</sup>.

Podsumowując, BBQ (Bias Benchmark for QA) ugruntował swoją pozycję jako wartościowe i niezawodne narzędzie do pomiaru uprzedzeń społecznych w modelach językowych. Dostarcza środowisku badawczemu standardowego zestawu testów umożliwiającego porównywanie modeli pod względem stereotypowości i śledzenie postępów w poprawie ich bezstronności<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-evaluating-mitigating-3)</sup>. BBQ nadal się rozszerza i adaptuje, odzwierciedlając globalne zainteresowanie tworzeniem bardziej **sprawiedliwych i bezpiecznych systemów AI**<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_note-arxiv-evaluating-mitigating-3)</sup>, wolnych od niewidocznych, lecz istotnych szkodliwych bias.

## Odniesienia

- Oryginalny artykuł BBQ (arXiv)
- Repozytorium BBQ na GitHub
- Strona datasetu BBQ na Papers With Code
- Artykuł BBQ w ACL Anthology
- Artykuł o datasecie KoBBQ (arXiv)
- Artykuł o datasecie Open-BBQ (arXiv)

## Literatura

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## Przypisy

1.  <span id="cite_note-arxiv-bbq-main-1">↑ <sup>[1.00](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-11)</sup> <sup>[1.12](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-12)</sup> <sup>[1.13](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-13)</sup> <sup>[1.14](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-14)</sup> <sup>[1.15](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-15)</sup> <sup>[1.16](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-16)</sup> <sup>[1.17](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-17)</sup> <sup>[1.18](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-18)</sup> <sup>[1.19](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-19)</sup> <sup>[1.20](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-20)</sup> <sup>[1.21](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-21)</sup> <sup>[1.22](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-22)</sup> <sup>[1.23](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-23)</sup> <sup>[1.24](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-24)</sup> <sup>[1.25](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-25)</sup> <sup>[1.26](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-26)</sup> <sup>[1.27](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-27)</sup> <sup>[1.28](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-28)</sup> <sup>[1.29](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-29)</sup> <sup>[1.30](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-30)</sup> <sup>[1.31](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-31)</sup> <sup>[1.32](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-32)</sup> <sup>[1.33](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-33)</sup> <sup>[1.34](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-34)</sup> <sup>[1.35](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-35)</sup> <sup>[1.36](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-36)</sup> <sup>[1.37](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-37)</sup> <sup>[1.38](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-38)</sup> <sup>[1.39](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-39)</sup> <sup>[1.40](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-40)</sup> <sup>[1.41](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-41)</sup> <sup>[1.42](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-42)</sup> <sup>[1.43](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-43)</sup> <sup>[1.44](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-44)</sup> <sup>[1.45](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-45)</sup> <sup>[1.46](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-46)</sup> <sup>[1.47](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-47)</sup> <sup>[1.48](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-48)</sup> <sup>[1.49](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-49)</sup> <sup>[1.50](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-50)</sup> <sup>[1.51](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-51)</sup> <sup>[1.52](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-52)</sup> <sup>[1.53](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-53)</sup> <sup>[1.54](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-54)</sup> <sup>[1.55](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-55)</sup> <sup>[1.56](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-56)</sup> <sup>[1.57](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-57)</sup> <sup>[1.58](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-58)</sup> <sup>[1.59](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-59)</sup> <sup>[1.60](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-60)</sup> <sup>[1.61](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-61)</sup> <sup>[1.62](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-62)</sup> <sup>[1.63](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-63)</sup> <sup>[1.64](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-64)</sup> <sup>[1.65](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-65)</sup> <sup>[1.66](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-66)</sup> <sup>[1.67](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-67)</sup> <sup>[1.68](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-68)</sup> <sup>[1.69](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-69)</sup> <sup>[1.70](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-70)</sup> <sup>[1.71](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-71)</sup> <sup>[1.72](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-72)</sup> <sup>[1.73](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-73)</sup> <sup>[1.74](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-74)</sup> <sup>[1.75](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-75)</sup> <sup>[1.76](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-76)</sup> <sup>[1.77](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-77)</sup> <sup>[1.78](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-78)</sup> <sup>[1.79](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-79)</sup> <sup>[1.80](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-bbq-main_1-80)</sup> Parrish A. et al. «BBQ: A Hand-Built Bias Benchmark for Question Answering». *arXiv*. <a href="https://arxiv.org/abs/2110.08193" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-acl-anthology-2">[↑](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-acl-anthology_2-0) Parrish A. et al. «BBQ: A hand-built bias benchmark for question answering». *ACL Anthology*. <a href="https://aclanthology.org/2022.findings-acl.165/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-arxiv-evaluating-mitigating-3">↑ <sup>[3.00](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-evaluating-mitigating_3-0)</sup> <sup>[3.01](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-evaluating-mitigating_3-1)</sup> <sup>[3.02](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-evaluating-mitigating_3-2)</sup> <sup>[3.03](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-evaluating-mitigating_3-3)</sup> <sup>[3.04](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-evaluating-mitigating_3-4)</sup> <sup>[3.05](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-evaluating-mitigating_3-5)</sup> <sup>[3.06](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-evaluating-mitigating_3-6)</sup> <sup>[3.07](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-evaluating-mitigating_3-7)</sup> <sup>[3.08](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-evaluating-mitigating_3-8)</sup> <sup>[3.09](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-evaluating-mitigating_3-9)</sup> <sup>[3.10](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-evaluating-mitigating_3-10)</sup> <sup>[3.11](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-evaluating-mitigating_3-11)</sup> <sup>[3.12](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-evaluating-mitigating_3-12)</sup> <sup>[3.13](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-evaluating-mitigating_3-13)</sup> <sup>[3.14](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-evaluating-mitigating_3-14)</sup> <sup>[3.15](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-evaluating-mitigating_3-15)</sup> Liu Z. et al. (2024). «Evaluating and Mitigating Social Bias for Large Language Models in Open-ended Settings». *arXiv preprint*. <a href="https://arxiv.org/html/2412.06134v1" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-paperswithcode-bbq-4">↑ <sup>[4.0](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-paperswithcode-bbq_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-paperswithcode-bbq_4-1)</sup> <sup>[4.2](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-paperswithcode-bbq_4-2)</sup> <sup>[4.3](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-paperswithcode-bbq_4-3)</sup> <sup>[4.4](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-paperswithcode-bbq_4-4)</sup> <sup>[4.5](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-paperswithcode-bbq_4-5)</sup> «BBQ Dataset». *Papers With Code*. <a href="https://paperswithcode.com/dataset/bbq" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-arxiv-kobbg-5">↑ <sup>[5.0](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-kobbg_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-kobbg_5-1)</sup> <sup>[5.2](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-kobbg_5-2)</sup> <sup>[5.3](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-kobbg_5-3)</sup> <sup>[5.4](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-kobbg_5-4)</sup> <sup>[5.5](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-kobbg_5-5)</sup> <sup>[5.6](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PL)#cite_ref-arxiv-kobbg_5-6)</sup> Jin J. et al. (2024). «KoBBQ: Korean Bias Benchmark for Question Answering». *arXiv preprint*. <a href="https://arxiv.org/abs/2307.16778" class="external autonumber" rel="nofollow">[5]</a></span>
