---
title: "BBQ (Bias Benchmark for Question Answering) (CS)"
source: "https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)"
wiki: "systems-analysis.info/int"
article: "BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)"
language: "cs"
categories:
  - "Category:Czech"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 515
wiki_created_at: 2026-09-06T22:34:52Z
wiki_modified_at: 2026-09-06T22:34:52Z
downloaded_at: 2026-09-07T22:40:38Z
---

# BBQ (Bias Benchmark for Question Answering) (CS)

**BBQ** (Bias Benchmark for Question Answering) — je **datová sada** pro hodnocení **sociálních předsudků** (bias) v systémech typu otázka-odpověď (QA)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>. Byla vyvinuta skupinou výzkumníků Newyorské univerzity pod vedením Alicie Parrish (Alicia Parrish) a publikována v roce 2022 na konferenci ACL Findings<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)[\[2\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-acl-anthology-2)</sup>. Cílem BBQ je odhalit, jak velké jazykové modely (LLM) a jiné QA modely projevují stereotypy a předsudky v odpovědích na otázky, zejména v aplikovaných úlohách odpovídání na otázky v přirozeném jazyce<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>. BBQ se stal jedním z nejkomplexnějších benchmarků pro hodnocení sociálního biasu v NLP, pokrývajícím široké spektrum stereotypů v rámci devíti sociálních kategorií<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-evaluating-mitigating-3)</sup>.

Tato datová sada doplňuje předchozí práce, jako je dataset UnQover (2020), který měřil předpojatost podle omezeného počtu znaků (pohlaví-profese, národnost, etnická příslušnost, náboženství) a opíral se o pravděpodobnosti modelů, nikoli o samotné odpovědi<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-evaluating-mitigating-3)</sup>. Na rozdíl od UnQover BBQ přímo analyzuje obsah odpovědí modelů a jejich volbu mezi nabízenými možnostmi, což umožňuje hodnotit předpojatost právě na úrovni produkovaných výsledků<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>.

Autoři BBQ jej prezentují jako nástroj pro diagnostiku **škodlivých sociálních stereotypů** v modelech a snížení rizika negativního vlivu takových stereotypů na zranitelné skupiny obyvatelstva<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>. Sada je zaměřena na stereotypy relevantní pro anglosaskou kulturu USA a nepokrývá všechny možné kulturní kontexty<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>. Přesto BBQ položil základ pro následné práce zaměřené na měření a zmírňování sociálního biasu v NLP a stal se referenčním bodem při srovnávání modelů z hlediska jejich etické korektnosti.

## Složení a struktura datové sady

BBQ obsahuje přibližně **58 500 otázek a odpovědí**, seskupených do specializovaných sad zaměřených na odhalování konkrétních stereotypů<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-paperswithcode-bbq-4)</sup>. Všechny příklady byly **ručně** sestaveny autory na základě zdokumentovaných případů předsudků a stereotypů, které poškozují představitele různých sociálních skupin<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-paperswithcode-bbq-4)</sup>. Při vytváření scénářů byly využity údaje z vědeckých studií, mediálních článků, zpráv a dalších spolehlivých zdrojů potvrzujících existenci daného stereotypu a jeho škodlivé následky<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>. Pro každou situaci autoři uvádějí odkaz na zdroj, kde je daný stereotyp popsán jako negativní nebo škodlivý (například vědecký článek nebo zpravodajská poznámka)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>.

### Sociální kategorie

BBQ pokrývá **devět základních sociálně významných kategorií** (ve většině odpovídajících chráněným skupinám ve smyslu definice Komise pro rovné pracovní příležitosti USA)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>:

- **Věk** – předsudky vůči věkovým skupinám (například stereotyp o snižování kognitivních schopností u starších lidí)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>.
- **Zdravotní postižení** – stereotypy o duševních schopnostech nebo jiných vlastnostech osob se zdravotním postižením (například představa, že fyzicky omezené osoby jsou méně intelektuálně kompetentní)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>.
- **Genderová identita** – genderové stereotypy (například idea, že „dívky jsou špatné v matematice")<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>.
- **Národnost** – národnostně-etnické předsudky (například stereotyp o technické negramotnosti lidí pocházejících z Afriky)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>.
- **Vzhled** – diskriminace na základě vzhledu a tělesné stavby (například názor, že lidé s obezitou jsou méně inteligentní nebo pracovití)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>.
- **Rasa/etnická příslušnost** – rasové stereotypy (například předpojaté spojování určité rasy s kriminalitou nebo drogovou závislostí)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>.
- **Náboženství** – náboženské stereotypy (například představa o Židech jako lakomých, o muslimech jako násilnických apod.)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>.
- **Socioekonomický status** – předsudky vůči chudým nebo bohatým vrstvám společnosti (například přesvědčení, že lidé z chudých rodin budou špatnými rodiči)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>.
- **Sexuální orientace** – homofobní stereotypy (například nepravdivé spojování homosexuality s HIV infekcí)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>.

Kromě těchto devíti kategorií jsou v BBQ zastoupeny dvě **průřezové kategorie** (intersectional biases), kombinující hned dva znaky: (1) pohlaví v kombinaci s rasou/etnicitou a (2) socioekonomický status v kombinaci s rasou<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>. Takovéto případy zohledňují stereotypy na průsečíku různých skupin (například předsudky konkrétně vůči černošským ženám nebo vůči určitým etnickým skupinám z nižší sociální třídy).

### Šablony a generování příkladů

Pro každou kategorii tým sestavil **šablony scénářů** — krátké náčrty, v nichž vystupují dvě postavy lišící se cílovým znakem (například mladý a starý, muž a žena, bohatý a chudý atd.)<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-paperswithcode-bbq-4)</sup>. Šablona zahrnuje situaci, která by mohla potvrdit nebo vyvrátit známý stereotyp. Ke každému scénáři jsou přiřazeny otázky a varianty odpovědí.

Celkem bylo vytvořeno 25 unikátních šablon pro každou z devíti základních kategorií, plus 25 dalších šablon pro kategorie rasy a pohlaví s použitím skutečných jmen (za účelem ověření biasu na úrovni vlastních jmen)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>. Rovněž pro dva průřezové směry bylo vytvořeno po 25 šablonách<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>. Celkový počet základních scénářů tak přesahuje 300.

Každá šablona obsahuje speciální **sloty pro proměnné** — názvy skupin nebo popisné výrazy — které jsou dosazovány do textu (například v šabloně o věku jsou místo „\_letý člověk" dosazována různá čísla, nebo u vzhledu přídavná jména „tlustý"/„hubený" apod.)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>. Díky dosazování různých hodnot a přehazování pořadí zmínek dvou postav se každá šablona rozrůstá do mnoha konkrétních příkladů (minimálně 8 až přibližně ~200 variací)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>. Zpravidla z jedné šablony vzniká nejméně 100 finálních otázek, v některých případech až dvě stě<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>. V součtu vznikl korpus 58 492 příkladů (unikátních kombinací scénáře, otázky a odpovědi)<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-paperswithcode-bbq-4)</sup>.

### Kontexty a typy otázek

Klíčovou vlastností BBQ je, že každá situace je prezentována ve dvou variantách kontextu a dvou formulacích otázky, čímž vzniká sada **čtyř otázek** (tzv. shluk čtyř)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>. Cílem je oddělit vliv nedostatku informací od vlastních stereotypů modelu. V každém kvartetu<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>:

- **Nejednoznačný kontext** (under-informative or ambiguous context): text popisující situaci se dvěma osobami z různých skupin, avšak neobsahující dostatek informací k jednoznačné odpovědi na položenou otázku<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>. Správnou odpovědí v takovýchto případech je vždy varianta „nevím" (tedy absence dostatečných údajů)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>. Tyto příklady slouží k ověření, zda model nebude vyvozovat závěry na základě stereotypu.
- **Jednoznačný kontext** (disambiguated context): rozšířený scénář, v němž je doplněn upřesňující detail umožňující určit, která ze dvou zmíněných osob odpovídá otázce<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>. V tomto případě je jedna ze dvou postav jednoznačně správnou odpovědí (a varianta „nevím" je již nesprávná). Jednoznačný kontext slouží k ověření, zda je model schopen překonat případný bias a zvolit správnou odpověď, i když stereotyp napovídá opak<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>.
- **Negativní otázka** (např. „Kdo z nich špatně zná předmět?", „Kdo spáchal zločin?")<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>. Taková otázka v kombinaci s nejednoznačným kontextem prověřuje, zda má model sklon spojovat negativní jednání s určitou skupinou při absenci faktů<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>.
- **Nenegativní (kontrastní) otázka** (např. „Kdo z nich dobře zná předmět?" nebo „Kdo se zdržuje špatného činu?")<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>. Nenegativní otázka je formulována tak, aby nezněla jako přímé schválení stereotypu, přičemž zároveň umožňuje ověřit vyvážení odpovědí modelu<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>. Porovnání odpovědí na negativní a neutrální verze odhaluje systematické odchylky.

Každý z těchto čtyř příkladů ve shluku má **tři varianty odpovědi**: dvě konkrétní (jmenující každou z obou figurujících skupin) a jednu variantu poukazující na nedostatek informací (označenou jako „Unknown" a ekvivalentní fráze)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>. Například ve scéně, v níž vystupují fiktivní křesťan a muslim, budou varianty odpovědi: „křesťan", „muslim" nebo „nevím"<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>. Přičemž slovo „nevím" není vždy stejné — používá se 10 synonymních výrazů<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>.

Navíc je v každé šabloně automaticky měněno **pořadí, v němž jsou zmíněny obě skupiny**<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>. Je to provedeno za účelem eliminace **efektu pořadí** — známého faktoru, při němž modely mohou preferovat první zmíněnou entitu bez ohledu na obsah<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>.

### Anotace a kontrola kvality

Každý příklad BBQ byl hodnocen crowdsourcingovými anotátory: nejméně 5 nezávislých osob odpovídalo na otázky a do finálního datasetu byly zařazeny pouze ty příklady, u nichž **minimálně 4 z 5 anotátorů souhlasily se správnou odpovědí** (hlasováním)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>. Pokud nějaká otázka nepřekročila tento práh, celá šablona byla přepracována a upravena<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>. Díky tomuto procesu je lidská přesnost na BBQ velmi vysoká: individuální anotátoři správně odpovídali na ~95,7 % otázek, a s přihlédnutím k většinovému hlasování dosahuje přesnost zlatého standardu 99,7 %<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>. Kappův koeficient shody (Krippendorffova alfa) dosáhl hodnoty 0,883, což ukazuje na **vysokou míru shody** mezi lidmi ohledně správných odpovědí<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>. Tato opatření potvrzují, že úlohy BBQ jsou pro lidi srozumitelné a mají objektivně správné odpovědi; chyby modelů na těchto příkladech lze tudíž oprávněně interpretovat jako projevy biasu, nikoli jako nejednoznačnost samotných otázek.

## Hodnocení předpojatosti modelů

BBQ je navržen pro vícerozměrné hodnocení chování modelů v podmínkách, které provokují sociální bias. Při testování obdrží QA model na vstup kontext a otázku, načež musí vybrat jednu ze tří variant odpovědi. Analýza výsledků probíhá na dvou úrovních<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>:

### Případ nejednoznačného kontextu

Měří se, jak často model nesprávně odpovídá na otázky při absenci potřebných informací, tedy **opírá se o stereotyp**<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>. V ideálním případě by model měl odpovídat „nevím" na každou otázku s nedostatečným kontextem, avšak pokud zvolí jednu ze skupin, je to považováno za projekci zabudovaného stereotypu<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>. Četnost takovýchto chyb a jejich rozložení podle kategorií poskytují představu o sklonu modelu reprodukovat škodlivé stereotypy.

### Případ informativního kontextu

Hodnotí se, jak přesně model odpovídá, když kontext obsahuje jednoznačnou správnou odpověď<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>. Zde se obvykle počítá standardní metrika **accuracy** (procento správných odpovědí) — ukazuje, zda model s úlohou otázka-odpověď vůbec dokáže pracovat. Zvláštní pozornost je však věnována případům, kdy správná odpověď jde proti stereotypu<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>. Vývojáři BBQ analyzují, zda přesnost modelu neklesá, pokud správná odpověď odporuje zakořeněnému stereotypu (a naopak, zda není přesnost vyšší, když pravda odpovídá stereotypnímu očekávání)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>. Takový efekt by naznačoval, že i při existenci faktů může model chybovat z důvodu biasu.

### Bias Score

Pro kvantitativní hodnocení míry předpojatosti je zavedena speciální metrika — **skóre předpojatosti** (bias score)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>. V obecném vyjádření bias score odráží procento odpovědí modelu (z nesprávných nebo všech, v závislosti na podmínce), které se shodují se stereotypem<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>.

- Hodnota **+100 %** by znamenala, že model ve všech případech zvolil variantu odpovědi stereotypně přisuzující negativní vlastnost cílové skupině.
- **0 %** — žádné projevy biasu (model buď vždy odpovídá správně/„nevím", nebo chybuje rovnoměrně oběma směry).
- **Záporné skóre** (až -100 %) — opačná tendence, kdy model vždy odpovídá proti očekávání stereotypu<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>.

Ukazatele jsou počítány odděleně pro nejednoznačné a jednoznačné kontexty, neboť charakter chyb se v nich liší<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>.

- Pro **nejednoznačné otázky** je bias score určen podílem případů, kdy model místo „nevím" zvolil konkrétní odpověď, přičemž tato odpověď se shodovala s negativním stereotypem<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>. Čím častěji k takovým odpovědím dochází, tím vyšší je kladné skóre. Přitom se zohledňuje přesnost: pokud model chybuje rovnoměrně a část odpovídá správně („nevím"), bude skóre nižší než u modelu, který vždy volí stereotypní odpověď<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>. Tím jsou **penalizovány jak četnost, tak jistota bias-odpovědí** (pro nejednoznačné kontexty je metrika škálována s přihlédnutím k procentu správných odpovědí „nevím")<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>.
- Pro **jednoznačné otázky** je bias score počítán poněkud jinak, neboť zde je správnou odpovědí jedna z konkrétních skupin<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>. V těchto případech se sledují **nesprávné odpovědi** modelu: podíl chyb, v nichž model nezvolil správnou variantu, ale alternativní variantu shodující se se stereotypem<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>. Jinými slovy, pokud model chyboval ve prospěch předsudku (například neuvěřil faktům a odpověděl podle stereotypu), skóre se zvyšuje<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>.

Analýza bias score spolu s celkovou přesností umožňuje detailně charakterizovat chování modelu na BBQ. Autoři uvádějí, že stejné hodnoty accuracy mohou skrývat odlišný charakter chyb<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>. Tento ukazatel tak ukazuje **směřování chyb** a odhaluje jemné případy, které nejsou patrné z pouhé přesnosti.

## Výsledky a zjištěné zákonitosti

Prvotní testování několika populárních QA modelů na sadě BBQ prokázalo řadu zřetelných projevů biasu<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>. Ve studii Parrish a kol. (2022) byly testovány jak velké univerzální modely (například UnifiedQA — obecný model pro QA na bázi T5), tak standardizované modely s výběrem z více možností (např. RoBERTa s doladěním na QA)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>.

Hlavní závěry z výsledků experimentů:

- **Silné stereotypní chyby při nedostatku informací**. Ve všech testovaných systémech byla pozorována tendence odpovídat v duchu stereotypu, když kontext neposkytoval potřebné vodítko<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>. Jinými slovy, modely často nezvolily variantu „nevím", ale preferovaly konkrétní odpověď korespondující s tím či oním stereotypním očekáváním<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>. Například v nejednoznačných otázkách o zločinu bez jasného viníka modely nezřídka ukazovaly na osoby z určité skupiny (odpovídající předsudku)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>. Vypočtené bias score pro nejednoznačné kontexty bylo výrazně vyšší než nula, a v některých kategoriích u některých modelů se přibližovalo k +100 %<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>. Zvláště vysokou sklon ke stereotypním odpovědím vykazovaly modely ve scénách spojených s **fyzickým vzhledem** (obezita a podobně) — tato kategorie dosáhla znatelně vyššího biasu než například rasa nebo sexuální orientace<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>. To svědčí o nehomogenitě biasu uvnitř modelu — některé druhy stereotypů jsou jím „vstřebány" silněji než jiné.
- **Zlepšení při existenci faktů, ale přetrvávající skrytý bias**. Když modely obdržely jednoznačný kontext s jasným určením správné odpovědi, jejich **přesnost výrazně vzrostla** (ve srovnání se situací nejistoty)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>. Detailní analýza však odhalila jemný efekt: přesnost se ukázala být **nerovnoměrná v závislosti na vztahu správné odpovědi ke stereotypu**<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>. V průměru dosahovaly modely o 3–3,5 procentních bodů vyšší přesnosti v těch příkladech, kde správná odpověď odpovídala rozšířenému stereotypu, ve srovnání s příklady, kde správná odpověď tomuto stereotypu odporovala<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>. Jinými slovy, když fakta potvrzovala předsudek, modely odpovídaly téměř bezchybně; pokud bylo však třeba uvést variantu „atypickou" pro stereotyp, pravděpodobnost chyby se zvyšovala. Tento rozdíl ve výkonnosti, ačkoli ne obrovský, se statisticky projevil v mnoha kategoriích<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>. Největší odchylka byla zaznamenána u otázek spojených s genderovými stereotypy: až 5 procentních bodů rozdílu<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>. Tím pádem je **skrytý vliv biasu** patrný: modely v průměru pracují o něco hůře „proti stereotypu".
- **Srovnání kategorií a šablon**. Výzkumníci BBQ analyzovali bias score v rozložení podle všech devíti kategorií a zjistili, že v nejednoznačných kontextech je ukazatel kladný ve všech kategoriích, avšak jeho hodnota se liší<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>. Jak bylo zmíněno, maximální bias byl zaznamenán v kategoriích fyzický vzhled, socioekonomický status a některých průřezových<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>. Nižší, avšak rovněž nenulové bias score měly kategorie rasa/etnicita a sexuální orientace<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>. V jednoznačných kontextech je bias score celkově blíže nule (protože model odpovídá správně), ale přesto u některých šablon zůstává kladný, odrážeje patrnou odchylku v charakteru spáchaných chyb<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>. Například v kategorii náboženství byla většina chyb jednostranná — modely zpravidla při chybě volily odpověď na základě předsudku<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>.

Celkově BBQ prokázal, že ani silné moderní jazykové modely **zjevně nejsou prosty sociálních předsudků**<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>. Mají tendenci reprodukovat stereotypy, pokud jsou postaveny do podmínek nejistoty, a mohou projevovat jemný bias i při existenci faktů vyžadujících opačnou odpověď<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>. Přitom rozsah těchto efektů není stejný pro různé skupiny: některé stereotypy jsou modelem „vstřebány" silněji<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>. Autoři BBQ zdůrazňují, že zjištěné rozdíly, ačkoli jsou patrné, nejsou katastrofálně velké — bias score většiny modelů nedosahuje extrémních hodnot a zpravidla se pohybuje v oblasti několika desítek procent<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-bbq-main-1)</sup>. Přesto i malé systematické odchylky ve směru stereotypů jsou při masovém využívání LLM potenciálně nebezpečné, a proto je odhalování a odstraňování takového biasu důležitým úkolem<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-evaluating-mitigating-3)</sup>. BBQ poskytl výzkumníkům jasný a kvantitativně měřitelný způsob, jak sledovat pokrok v této oblasti<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-evaluating-mitigating-3)</sup>.

## Vliv a další výzkum

Sada BBQ rychle získala uznání jako standardní nástroj pro hodnocení charakteristik fairness jazykových modelů<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-paperswithcode-bbq-4)</sup>. Její **otevřený zdrojový kód a data** jsou dostupné v repozitáři (licence CC BY 4.0)<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-paperswithcode-bbq-4)</sup>, což umožnilo širší výzkumné komunitě využívat BBQ při vývoji a testování nových modelů. V řadě přehledů je BBQ zmiňován spolu s dalšími benchmarky (například StereoSet, WinoBias, ToxiGen) jako důležitý mezník ve studiu sociálního biasu v NLP<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-evaluating-mitigating-3)</sup>. Od publikace BBQ se objevily práce rozvíjející jeho myšlenky a adaptující je pro nové podmínky:

- **Rozšíření formátů otázek (Open-BBQ)**. Originální BBQ nabízí úlohy ve formátu výběru z více možností<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-evaluating-mitigating-3)</sup>. V roce 2024 byla navržena modifikace BBQ pro **otevřené odpovědi**, zahrnující úlohy doplňování mezer a krátkého textového odpovídání<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-evaluating-mitigating-3)</sup>. Tato verze, označovaná jako Open-BBQ, umožňuje hodnotit bias ve volnějších podmínkách dialogu, kde model nemá pevně dané varianty odpovědi<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-evaluating-mitigating-3)</sup>. Výzkum ukázal, že LLM při generování volného textu rovněž vykazují zvýšený bias vůči řadě skupin<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-evaluating-mitigating-3)</sup>. Autoři Open-BBQ také experimentovali s metodami zmírnění předpojatosti, kombinujíce zero-shot a few-shot podněty a chain-of-thought (postupné uvažování)<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-evaluating-mitigating-3)</sup>. Tyto metody umožnily výrazně snížit úroveň biasu v odpovědích<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-evaluating-mitigating-3)</sup>. Open-BBQ doplnil originální sadu, čímž umožnil testování generativních modelů ve formátech bližších uživatelským dotazům.

<!-- -->

- **Kulturní adaptace (lokalizace)**. Jelikož BBQ je vázán na sociální realitu USA, výzkumníci se zajímali o jeho adaptaci pro jiné jazyky a kultury<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-kobbg-5)</sup>. V roce 2023 korejští vědci představili dataset **KoBBQ** (Korean BBQ) — korejský ekvivalent Bias Benchmark<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-kobbg-5)</sup>. Vypracovali obecný přístup k lokalizaci BBQ: rozdělili původní šablony do tří kategorií — ty, které lze jednoduše přeložit, ty, které vyžadují nahrazení skupin lokálními ekvivalenty, a ty, jež v korejském kontextu vůbec nelze uplatnit<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-kobbg-5)</sup>. KoBBQ navíc zavedl 4 nové kategorie stereotypů specifické pro korejskou společnost a odstranil řadu neodpovídajících příkladů<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-kobbg-5)</sup>. Výsledkem je sada 268 šablon a 76 048 příkladů v korejském jazyce, pokrývající 12 kategorií sociálního biasu (včetně původních i nových)<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-kobbg-5)</sup>. Testování vícejazykových modelů na KoBBQ odhalilo výrazné rozdíly v úrovni předpojatosti ve srovnání s přímým strojovým překladem originálního BBQ do korejštiny<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-kobbg-5)</sup>. To zdůrazňuje, že **pouhý překlad nestačí** — jsou zapotřebí kulturně specifické benchmarky zohledňující jedinečné stereotypy a kontext každé země<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-kobbg-5)</sup>. Práce na KoBBQ prokázala možnost škálovat metodologii BBQ globálně.

BBQ se stal nedílnou součástí výzkumu **etičnosti umělé inteligence**<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-evaluating-mitigating-3)</sup>. Jeho vliv je patrný v rozvoji nových metodik odstraňování biasu z modelů, vytváření inkluzivnějších datasetů a metrik pro jemnou analýzu biasu. Výzkumníci poznamenávají, že jednou ze silných stránek BBQ je šíře záběru a pečlivost konstrukce příkladů<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-evaluating-mitigating-3)</sup>. V reakci na výzvy vymezené BBQ jsou v poslední době aktivně vyvíjeny **strategie snižování biasu** od filtrování trénovacích dat po speciální algoritmy post-processingu a dolaďování LLM pro spravedlivé odpovědi<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-evaluating-mitigating-3)</sup>.

Shrneme-li to, BBQ (Bias Benchmark for QA) se osvědčil jako cenný a spolehlivý nástroj pro měření sociálních předsudků v jazykových modelech. Poskytuje výzkumné komunitě standardní sadu ověření umožňujících porovnávat modely z hlediska stereotypnosti a sledovat pokrok ve zlepšování jejich nestrannosti<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-evaluating-mitigating-3)</sup>. BBQ se nadále rozšiřuje a adaptuje, odrážejíce globální zájem o vytváření **spravedlivějších a bezpečnějších systémů AI**<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_note-arxiv-evaluating-mitigating-3)</sup>, prosté nenápadných, avšak výrazných škodlivých biasů.

## Odkazy

- Původní článek BBQ (arXiv)
- Repozitář BBQ na GitHubu
- Stránka datasetu BBQ na Papers With Code
- Článek BBQ na ACL Anthology
- Článek o datasetu KoBBQ (arXiv)
- Článek o datasetu Open-BBQ (arXiv)

## Literatura

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## Poznámky

1.  <span id="cite_note-arxiv-bbq-main-1">↑ <sup>[1.00](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-11)</sup> <sup>[1.12](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-12)</sup> <sup>[1.13](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-13)</sup> <sup>[1.14](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-14)</sup> <sup>[1.15](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-15)</sup> <sup>[1.16](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-16)</sup> <sup>[1.17](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-17)</sup> <sup>[1.18](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-18)</sup> <sup>[1.19](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-19)</sup> <sup>[1.20](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-20)</sup> <sup>[1.21](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-21)</sup> <sup>[1.22](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-22)</sup> <sup>[1.23](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-23)</sup> <sup>[1.24](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-24)</sup> <sup>[1.25](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-25)</sup> <sup>[1.26](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-26)</sup> <sup>[1.27](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-27)</sup> <sup>[1.28](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-28)</sup> <sup>[1.29](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-29)</sup> <sup>[1.30](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-30)</sup> <sup>[1.31](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-31)</sup> <sup>[1.32](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-32)</sup> <sup>[1.33](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-33)</sup> <sup>[1.34](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-34)</sup> <sup>[1.35](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-35)</sup> <sup>[1.36](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-36)</sup> <sup>[1.37](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-37)</sup> <sup>[1.38](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-38)</sup> <sup>[1.39](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-39)</sup> <sup>[1.40](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-40)</sup> <sup>[1.41](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-41)</sup> <sup>[1.42](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-42)</sup> <sup>[1.43](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-43)</sup> <sup>[1.44](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-44)</sup> <sup>[1.45](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-45)</sup> <sup>[1.46](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-46)</sup> <sup>[1.47](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-47)</sup> <sup>[1.48](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-48)</sup> <sup>[1.49](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-49)</sup> <sup>[1.50](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-50)</sup> <sup>[1.51](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-51)</sup> <sup>[1.52](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-52)</sup> <sup>[1.53](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-53)</sup> <sup>[1.54](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-54)</sup> <sup>[1.55](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-55)</sup> <sup>[1.56](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-56)</sup> <sup>[1.57](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-57)</sup> <sup>[1.58](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-58)</sup> <sup>[1.59](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-59)</sup> <sup>[1.60](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-60)</sup> <sup>[1.61](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-61)</sup> <sup>[1.62](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-62)</sup> <sup>[1.63](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-63)</sup> <sup>[1.64](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-64)</sup> <sup>[1.65](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-65)</sup> <sup>[1.66](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-66)</sup> <sup>[1.67](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-67)</sup> <sup>[1.68](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-68)</sup> <sup>[1.69](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-69)</sup> <sup>[1.70](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-70)</sup> <sup>[1.71](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-71)</sup> <sup>[1.72](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-72)</sup> <sup>[1.73](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-73)</sup> <sup>[1.74](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-74)</sup> <sup>[1.75](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-75)</sup> <sup>[1.76](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-76)</sup> <sup>[1.77](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-77)</sup> <sup>[1.78](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-78)</sup> <sup>[1.79](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-79)</sup> <sup>[1.80](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-bbq-main_1-80)</sup> Parrish A. et al. «BBQ: A Hand-Built Bias Benchmark for Question Answering». *arXiv*. <a href="https://arxiv.org/abs/2110.08193" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-acl-anthology-2">[↑](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-acl-anthology_2-0) Parrish A. et al. «BBQ: A hand-built bias benchmark for question answering». *ACL Anthology*. <a href="https://aclanthology.org/2022.findings-acl.165/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-arxiv-evaluating-mitigating-3">↑ <sup>[3.00](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-evaluating-mitigating_3-0)</sup> <sup>[3.01](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-evaluating-mitigating_3-1)</sup> <sup>[3.02](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-evaluating-mitigating_3-2)</sup> <sup>[3.03](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-evaluating-mitigating_3-3)</sup> <sup>[3.04](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-evaluating-mitigating_3-4)</sup> <sup>[3.05](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-evaluating-mitigating_3-5)</sup> <sup>[3.06](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-evaluating-mitigating_3-6)</sup> <sup>[3.07](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-evaluating-mitigating_3-7)</sup> <sup>[3.08](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-evaluating-mitigating_3-8)</sup> <sup>[3.09](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-evaluating-mitigating_3-9)</sup> <sup>[3.10](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-evaluating-mitigating_3-10)</sup> <sup>[3.11](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-evaluating-mitigating_3-11)</sup> <sup>[3.12](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-evaluating-mitigating_3-12)</sup> <sup>[3.13](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-evaluating-mitigating_3-13)</sup> <sup>[3.14](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-evaluating-mitigating_3-14)</sup> <sup>[3.15](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-evaluating-mitigating_3-15)</sup> Liu Z. et al. (2024). «Evaluating and Mitigating Social Bias for Large Language Models in Open-ended Settings». *arXiv preprint*. <a href="https://arxiv.org/html/2412.06134v1" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-paperswithcode-bbq-4">↑ <sup>[4.0](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-paperswithcode-bbq_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-paperswithcode-bbq_4-1)</sup> <sup>[4.2](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-paperswithcode-bbq_4-2)</sup> <sup>[4.3](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-paperswithcode-bbq_4-3)</sup> <sup>[4.4](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-paperswithcode-bbq_4-4)</sup> <sup>[4.5](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-paperswithcode-bbq_4-5)</sup> «BBQ Dataset». *Papers With Code*. <a href="https://paperswithcode.com/dataset/bbq" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-arxiv-kobbg-5">↑ <sup>[5.0](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-kobbg_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-kobbg_5-1)</sup> <sup>[5.2](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-kobbg_5-2)</sup> <sup>[5.3](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-kobbg_5-3)</sup> <sup>[5.4](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-kobbg_5-4)</sup> <sup>[5.5](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-kobbg_5-5)</sup> <sup>[5.6](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(CS)#cite_ref-arxiv-kobbg_5-6)</sup> Jin J. et al. (2024). «KoBBQ: Korean Bias Benchmark for Question Answering». *arXiv preprint*. <a href="https://arxiv.org/abs/2307.16778" class="external autonumber" rel="nofollow">[5]</a></span>
