---
title: "BBQ (Bias Benchmark for Question Answering) (NL)"
source: "https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)"
wiki: "systems-analysis.info/int"
article: "BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)"
language: "nl"
categories:
  - "Category:Dutch"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 527
wiki_created_at: 2026-09-06T22:35:05Z
wiki_modified_at: 2026-09-06T22:35:05Z
downloaded_at: 2026-09-07T22:40:45Z
---

# BBQ (Bias Benchmark for Question Answering) (NL)

**BBQ** (Bias Benchmark for Question Answering) — een **dataset** voor het evalueren van **sociale vooroordelen** (bias) in vraag-antwoordsystemen (QA)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>. Het werd ontwikkeld door een groep onderzoekers van de New York University onder leiding van Alicia Parrish en gepubliceerd in 2022 op de conferentie ACL Findings<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)[\[2\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-acl-anthology-2)</sup>. Het doel van BBQ is te onderzoeken hoe grote taalmodellen (LLM's) en andere QA-modellen stereotypen en vooroordelen tonen in hun antwoorden op vragen, met name bij toepassingen van vraag-antwoord in natuurlijke taal<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>. BBQ is uitgegroeid tot een van de meest uitgebreide benchmarks voor het evalueren van sociale bias in NLP, met een breed spectrum aan stereotypen binnen negen sociale categorieën<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-evaluating-mitigating-3)</sup>.

Deze dataset vult eerder werk aan, zoals de UnQover-dataset (2020), die bias mat voor een beperkt aantal kenmerken (gender-beroep, nationaliteit, etniciteit, religie) en zich baseerde op modelkansen in plaats van op de antwoorden zelf<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-evaluating-mitigating-3)</sup>. In tegenstelling tot UnQover analyseert BBQ rechtstreeks de inhoud van modelantwoorden en de keuze uit de aangeboden opties, waardoor bias kan worden beoordeeld op het niveau van de geproduceerde resultaten<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>.

De auteurs van BBQ positioneren het als een instrument voor het diagnosticeren van **schadelijke sociale stereotypen** in modellen en het verminderen van het risico op negatieve invloed van zulke stereotypen op kwetsbare bevolkingsgroepen<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>. De dataset is gericht op stereotypen die relevant zijn voor de Engelstalige cultuur van de Verenigde Staten en dekt niet alle mogelijke culturele contexten<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>. Desalniettemin heeft BBQ de basis gelegd voor vervolgwerk op het gebied van het meten en verminderen van sociale bias in NLP en is het een referentiepunt geworden bij het vergelijken van modellen op ethische correctheid.

## Samenstelling en structuur van de dataset

BBQ bevat ongeveer **58.500 vragen en antwoorden**, gegroepeerd in speciale sets die gericht zijn op het blootleggen van specifieke stereotypen<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-paperswithcode-bbq-4)</sup>. Alle voorbeelden zijn **handmatig** samengesteld door de auteurs op basis van gedocumenteerde gevallen van vooroordelen en stereotypen die schadelijk zijn voor leden van verschillende sociale groepen<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-paperswithcode-bbq-4)</sup>. Bij het opstellen van de scenario's is gebruik gemaakt van wetenschappelijk onderzoek, mediaartikelen, rapporten en andere betrouwbare bronnen die het bestaan van een bepaald stereotiep en de schadelijke gevolgen ervan bevestigen<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>. Voor elk scenario verwijzen de auteurs naar een bron waarin het betreffende stereotiep wordt beschreven als negatief of schadelijk (bijvoorbeeld een wetenschappelijk artikel of een nieuwsbericht)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>.

### Sociale categorieën

BBQ dekt **negen belangrijke sociaal relevante categorieën** (die grotendeels overeenkomen met beschermde groepen zoals gedefinieerd door de Equal Employment Opportunity Commission van de VS)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>:

- **Leeftijd** – vooroordelen jegens leeftijdsgroepen (bijvoorbeeld het stereotiep dat cognitieve vermogens afnemen bij ouderen)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>.
- **Handicap** – stereotypen over de mentale vermogens of andere eigenschappen van mensen met een handicap (bijvoorbeeld de opvatting dat fysiek beperkten intellectueel minder bekwaam zijn)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>.
- **Genderidentiteit** – genderstereotypen (bijvoorbeeld het idee dat "meisjes slecht zijn in wiskunde")<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>.
- **Nationaliteit** – nationale en etnische vooroordelen (bijvoorbeeld het stereotiep van technische ongeletterdheid bij mensen afkomstig uit Afrika)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>.
- **Uiterlijk** – discriminatie op grond van uiterlijk of lichaamsbouw (bijvoorbeeld de opvatting dat mensen met obesitas minder intelligent of hardwerkend zijn)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>.
- **Ras/etniciteit** – raciale stereotypen (bijvoorbeeld de bevooroordeelde koppeling van een bepaald ras aan criminaliteit of drugsgebruik)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>.
- **Religie** – religieuze stereotypen (bijvoorbeeld de voorstelling van joden als hebzuchtig, van moslims als gewelddadig, enzovoort)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>.
- **Sociaaleconomische status** – vooroordelen jegens arme of rijke bevolkingslagen (bijvoorbeeld de overtuiging dat mensen uit arme gezinnen slechte ouders zullen zijn)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>.
- **Seksuele oriëntatie** – homofobe stereotypen (bijvoorbeeld de onjuiste associatie van homoseksualiteit met hiv-infectie)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>.

Naast deze negen categorieën bevat BBQ twee **intersectionele categorieën** (intersectional biases) die twee kenmerken combineren: (1) gender in combinatie met ras/etniciteit en (2) sociaaleconomische status in combinatie met ras<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>. Dergelijke gevallen houden rekening met stereotypen op het snijvlak van verschillende groepen (bijvoorbeeld vooroordelen specifiek tegen zwarte vrouwen of tegen bepaalde etnische groepen uit een lage sociale klasse).

### Sjablonen en generatie van voorbeelden

Voor elke categorie schreef het team **scenario-sjablonen** — korte schetsen met twee personages die van elkaar verschillen op het doelkenmerk (bijvoorbeeld jong en oud, man en vrouw, rijk en arm, enzovoort)<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-paperswithcode-bbq-4)</sup>. Het sjabloon bevat een situatie die een bekend stereotiep zou kunnen bevestigen of weerleggen. Aan elk scenario zijn vragen en antwoordopties gekoppeld.

In totaal werden 25 unieke sjablonen ontwikkeld voor elk van de negen hoofdcategorieën, plus 25 aanvullende sjablonen voor de categorieën ras en gender met behulp van echte namen (om bias op het niveau van eigennamen te testen)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>. Ook voor de twee intersectionele richtingen werden 25 sjablonen aangemaakt<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>. Het totale aantal basisscenario's bedraagt daarmee meer dan 300.

Elk sjabloon bevat speciale **sleuven voor variabelen** — groepsnamen of beschrijvingen — die in de tekst worden ingevoegd (bijvoorbeeld worden in een leeftijdssjabloon verschillende getallen ingevuld voor "\_-jarige persoon", of bij uiterlijk worden bijvoeglijke naamwoorden als "dik"/"slank" gebruikt, enzovoort)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>. Door verschillende waarden in te vullen en de volgorde van vermelding van de twee figuren te wisselen, wordt elk sjabloon uitgebreid tot een groot aantal concrete voorbeelden (minimaal 8 en tot circa 200 variaties)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>. Doorgaans genereert één sjabloon ten minste 100 definitieve vragen, in sommige gevallen tot tweehonderd<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>. Het resultaat is een corpus van 58.492 voorbeelden (unieke combinaties van scenario, vraag en antwoord)<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-paperswithcode-bbq-4)</sup>.

### Contexten en typen vragen

Een belangrijk kenmerk van BBQ is dat elke situatie wordt gepresenteerd in twee contextvarianten en twee vraagformuleringen, wat een set van **vier vragen** oplevert (een zogeheten cluster van 4)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>. Dit is bedoeld om het effect van een gebrek aan informatie te scheiden van de eigen stereotypen van het model. In elk kwartet<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>:

- **Dubbelzinnige context** (under-informative or ambiguous context): een tekst waarin een situatie wordt beschreven met twee personen uit verschillende groepen, maar die onvoldoende informatie bevat om de gestelde vraag eenduidig te beantwoorden<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>. Het juiste antwoord in dergelijke gevallen is altijd "onbekend" (dat wil zeggen: onvoldoende gegevens)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>. Deze voorbeelden zijn bedoeld om te controleren of het model geen conclusies trekt op basis van een stereotiep.
- **Ondubbelzinnige context** (disambiguated context): een uitgebreider scenario met een verduidelijkend detail waarmee kan worden bepaald welke van de twee genoemde personen overeenkomt met de vraag<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>. In dit geval is een van de twee personages duidelijk het juiste antwoord (en is "onbekend" onjuist). De ondubbelzinnige context dient om te controleren of het model zijn eventuele bias kan overwinnen en het juiste antwoord kan kiezen, zelfs als het stereotiep het tegendeel suggereert<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>.
- **Negatieve vraag** (bijv. "Wie kent het onderwerp slecht?", "Wie heeft het misdrijf gepleegd?")<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>. Een dergelijke vraag in combinatie met een dubbelzinnige context test of het model geneigd is negatieve handelingen te koppelen aan een bepaalde groep bij gebrek aan feiten<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>.
- **Niet-negatieve (contrastieve) vraag** (bijv. "Wie kent het onderwerp goed?" of "Wie onthoudt zich van een slechte handeling?")<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>. De niet-negatieve vraag is zo geformuleerd dat ze niet klinkt als een directe bevestiging van het stereotiep, maar toch toelaat het evenwicht in de antwoorden van het model te controleren<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>. Vergelijking van antwoorden op negatieve en neutrale versies onthult systematische vertekeningen.

Elk van deze vier voorbeelden in het cluster heeft **drie antwoordopties**: twee concrete opties (die elk van de twee aanwezige groepen noemen) en één optie die aangeeft dat er onvoldoende informatie is (aangeduid als "Unknown" en equivalente uitdrukkingen)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>. Bijvoorbeeld, in een scène met een christelijke en een moslimfiguur zijn de antwoordopties: "christen", "moslim" of "onbekend"<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>. Daarbij wordt het woord "onbekend" niet altijd op dezelfde manier geformuleerd — er worden 10 synoniemuitdrukkingen gebruikt<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>.

Bovendien wordt in elk sjabloon automatisch de **volgorde van vermelding van de twee groepen** gewisseld<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>. Dit is bedoeld om het **positie-effect** te neutraliseren — een bekend fenomeen waarbij modellen vaker de als eerste genoemde entiteit kiezen, ongeacht de inhoud<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>.

### Annotatie en kwaliteitscontrole

Elk voorbeeld in BBQ werd beoordeeld door crowdsource-annotators: ten minste 5 onafhankelijke personen beantwoordden de vragen, en alleen die voorbeelden werden in de definitieve dataset opgenomen waarvoor **minimaal 4 van de 5 annotators het eens waren over het juiste antwoord** (via stemming)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>. Als een vraag deze drempel niet haalde, werd het hele sjabloon herzien en bewerkt<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>. Dankzij dit proces is de menselijke nauwkeurigheid op BBQ zeer hoog: individuele annotators beantwoordden ~95,7% van de vragen correct, en met meerderheidsstemming bereikt de nauwkeurigheid van de gouden standaard 99,7%<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>. De interbeoordelaarsbetrouwbaarheid (Krippendorff's alpha) bedroeg 0,883, wat wijst op **hoge overeenstemming** tussen mensen over de juiste antwoorden<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>. Deze maatregelen bevestigen dat de BBQ-taken begrijpelijk zijn voor mensen en objectief correcte antwoorden hebben; fouten van modellen op deze voorbeelden kunnen dan ook terecht worden geïnterpreteerd als uitingen van bias, en niet als dubbelzinnigheid van de vragen zelf.

## Evaluatie van modelvooroordelen

BBQ is ontworpen voor een meervoudige evaluatie van het gedrag van modellen in omstandigheden die sociale bias uitlokken. Bij het testen ontvangt een QA-model een context en een vraag, waarna het een van de drie antwoordopties moet kiezen. De resultaten worden op twee niveaus geanalyseerd<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>:

### Geval van dubbelzinnige context

Gemeten wordt hoe vaak het model vragen onjuist beantwoordt bij gebrek aan de benodigde informatie, dat wil zeggen **steunt op een stereotiep**<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>. In het ideale geval antwoordt het model "onbekend" op elke vraag met een ontoereikende context, maar als het een van de groepen kiest, wordt dit beschouwd als projectie van een ingebakken stereotiep<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>. De frequentie van dergelijke fouten en de verdeling ervan over categorieën geven inzicht in de neiging van het model om schadelijke stereotypen te reproduceren.

### Geval van informatieve context

Beoordeeld wordt hoe nauwkeurig het model antwoordt wanneer de context een duidelijk juist antwoord bevat<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>. Hier wordt doorgaans de standaardmaatstaf **accuracy** (percentage juiste antwoorden) berekend — die aangeeft of het model de vraag-antwoordtaak in het algemeen aankan. Bijzondere aandacht gaat echter uit naar gevallen waarin het juiste antwoord ingaat tegen het stereotiep<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>. De ontwikkelaars van BBQ analyseren of de nauwkeurigheid van het model daalt wanneer het juiste antwoord in strijd is met een diepgeworteld stereotiep (en omgekeerd, of de nauwkeurigheid hoger is wanneer de waarheid overeenkomt met de stereotiepe verwachting)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>. Een dergelijk effect zou erop wijzen dat het model zelfs bij aanwezigheid van feiten fouten kan maken door bias.

### Bias Score

Voor de kwantitatieve meting van de mate van vooringenomenheid wordt een speciale maatstaf geïntroduceerd — de **bias score**<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>. In algemene zin geeft de bias score het percentage modelantwoorden weer (onder de onjuiste of alle antwoorden, afhankelijk van de conditie) dat overeenkomt met het stereotiep<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>.

- Een waarde van **+100%** zou betekenen dat het model in alle gevallen de antwoordoptie kiest die het negatieve kenmerk stereotiep toeschrijft aan de doelgroep.
- **0%** — geen enkele uiting van bias (het model antwoordt altijd correct/"onbekend", of maakt gelijkmatig fouten in beide richtingen).
- Een **negatieve score** (tot -100%) — de omgekeerde tendens, waarbij het model altijd in de richting antwoordt die ingaat tegen het stereotiep<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>.

De scores worden afzonderlijk berekend voor dubbelzinnige en ondubbelzinnige contexten, omdat de aard van de fouten daarin verschilt<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>.

- Voor **dubbelzinnige vragen** wordt de bias score bepaald door het aandeel gevallen waarin het model in plaats van "onbekend" een specifiek antwoord kiest dat overeenkomt met het negatieve stereotiep<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>. Hoe vaker dergelijke antwoorden, hoe hoger de positieve score. Daarbij wordt rekening gehouden met de nauwkeurigheid: als het model in gelijke mate fouten maakt en correct antwoordt ("onbekend"), zal de score — zelfs bij een deel stereotiepe fouten — lager zijn dan bij een model dat altijd het stereotiepe antwoord kiest<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>. Op deze manier worden **zowel de frequentie als de uitgesprokenheid van bias-antwoorden bestraft** (voor dubbelzinnige contexten wordt de maatstaf geschaald op basis van het percentage juiste antwoorden "onbekend")<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>.
- Voor **ondubbelzinnige vragen** wordt de bias score iets anders berekend, omdat het juiste antwoord hier een van de groepen is<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>. In deze gevallen wordt gekeken naar de **onjuiste antwoorden** van het model: het aandeel fouten waarbij het model niet de juiste optie kiest, maar de alternatieve optie die overeenkomt met het stereotiep<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>. Met andere woorden, als het model een fout maakt ten gunste van het vooroordeel (bijvoorbeeld de feiten niet gelooft en antwoordt op basis van het stereotiep), verhoogt dit de score<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>.

De analyse van de bias score naast de algemene nauwkeurigheid maakt een gedetailleerde karakterisering van het modelgedrag op BBQ mogelijk. De auteurs wijzen erop dat dezelfde nauwkeurigheidswaarden een verschillend karakter van fouten kunnen verbergen<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>. De maatstaf toont dus de **richting van de fouten** en onthult subtiele gevallen die niet zichtbaar zijn op basis van nauwkeurigheid alleen.

## Resultaten en gevonden patronen

Het eerste testen van meerdere populaire QA-modellen op de BBQ-dataset bracht een aantal duidelijke uitingen van bias aan het licht<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>. In het onderzoek van Parrish et al. (2022) werden zowel grote universele modellen (zoals UnifiedQA — een algemeen QA-model op basis van T5) als gestandaardiseerde multiple-choice-modellen (zoals RoBERTa met fine-tuning op QA) getest<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>.

Belangrijkste bevindingen uit de experimenten:

- **Sterke stereotiepe fouten bij gebrek aan informatie**. In alle geteste systemen was een tendens waarneembaar om in de geest van het stereotiep te antwoorden wanneer de context geen relevante aanwijzingen gaf<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>. Met andere woorden kozen modellen vaak niet voor "onbekend", maar gaven de voorkeur aan een specifiek antwoord dat overeenkwam met een bepaalde stereotiepe verwachting<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>. Zo wezen modellen bij dubbelzinnige vragen over een misdrijf zonder duidelijke dader er regelmatig personen uit een bepaalde groep aan (overeenkomstig het vooroordeel)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>. De berekende bias score voor dubbelzinnige contexten lag significant boven nul, en benaderde soms +100% in afzonderlijke categorieën bij sommige modellen<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>. Een bijzonder hoge neiging tot stereotiepe antwoorden toonden modellen in scenario's gerelateerd aan **uiterlijk** (obesitas e.d.) — deze categorie leverde merkbaar grotere bias op dan bijvoorbeeld ras of seksuele oriëntatie<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>. Dit wijst op de heterogeniteit van bias binnen een model — sommige soorten stereotypen zijn er sterker in "opgenomen" dan andere.
- **Verbetering bij aanwezigheid van feiten, maar voortbestaan van verborgen bias**. Wanneer modellen een ondubbelzinnige context ontvingen met een duidelijke aanwijzing voor het juiste antwoord, nam hun **nauwkeurigheid merkbaar toe** (vergeleken met de situatie van onzekerheid)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>. Gedetailleerde analyse onthulde echter een subtiel effect: de nauwkeurigheid bleek **ongelijk te zijn afhankelijk van de verhouding van het juiste antwoord tot het stereotiep**<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>. Gemiddeld bereikten modellen een 3 tot 3,5 procentpunt hogere nauwkeurigheid bij voorbeelden waarbij het juiste antwoord overeenkwam met een gangbaar stereotiep, vergeleken met voorbeelden waarbij het juiste antwoord dat stereotiep tegensprak<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>. Met andere woorden: wanneer feiten het vooroordeel bevestigden, antwoordden modellen vrijwel foutloos; maar als een "atypisch" antwoord voor het stereotiep vereist was, nam de kans op een fout toe. Deze kloof in prestaties is weliswaar niet enorm, maar manifesteerde zich statistisch in veel categorieën<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>. Het grootste verschil werd vastgesteld voor vragen gerelateerd aan genderstereotypen: tot 5 procentpunt verschil<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>. **De verborgen invloed van bias** is daarmee aantoonbaar: modellen presteren gemiddeld iets slechter "tegen het stereotiep in".
- **Vergelijking van categorieën en sjablonen**. De BBQ-onderzoekers analyseerden de bias score uitgesplitst naar alle negen categorieën en stelden vast dat de score in dubbelzinnige contexten positief was in alle categorieën, maar dat de grootte varieerde<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>. Zoals vermeld werden de maximale bias-waarden waargenomen in de categorieën fysiek uiterlijk, sociaaleconomische status en enkele intersectionele categorieën<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>. Lagere, maar ook niet-nulwaarden, voor de bias score werden gevonden bij de categorieën ras/etniciteit en seksuele oriëntatie<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>. In ondubbelzinnige contexten ligt de bias score over het algemeen dichter bij nul (omdat het model vaak correct antwoordt), maar voor sommige sjablonen blijft deze positief, wat een merkbare scheefheid in de aard van de gemaakte fouten weerspiegelt<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>. Zo lagen in de categorie religie de meeste fouten in één richting — modellen kozen bij een fout doorgaans het antwoord op basis van het vooroordeel<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>.

Over het geheel genomen heeft BBQ aangetoond dat zelfs krachtige moderne taalmodellen **duidelijk niet vrij zijn van sociale vooroordelen**<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>. Ze zijn geneigd stereotypen te reproduceren wanneer ze in omstandigheden van onzekerheid worden geplaatst, en kunnen subtiele bias vertonen zelfs bij aanwezigheid van feiten die een tegengesteld antwoord vereisen<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>. De omvang van deze effecten is daarbij niet gelijk voor alle groepen: sommige stereotypen zijn sterker "opgenomen" in het model<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>. De auteurs van BBQ benadrukken dat de gevonden verschillen weliswaar merkbaar zijn, maar niet catastrofaal groot — de bias scores van de meeste modellen bereiken geen extreme waarden, en bevinden zich vaak in het bereik van enkele tientallen procenten<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup>. Zelfs kleine systematische afwijkingen in de richting van stereotypen zijn echter potentieel gevaarlijk bij grootschalig gebruik van LLM's, waardoor het identificeren en wegnemen van dergelijke bias een belangrijke taak is<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-evaluating-mitigating-3)</sup>. BBQ heeft onderzoekers een duidelijke en kwantitatief meetbare manier geboden om vooruitgang op dit gebied te volgen<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-evaluating-mitigating-3)</sup>.

## Invloed en vervolgonderzoek

De BBQ-dataset werd snel erkend als een standaardinstrument voor het evalueren van fairness-eigenschappen van taalmodellen<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-paperswithcode-bbq-4)</sup>. De **open broncode en data** zijn beschikbaar in een repository (licentie CC BY 4.0)<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-paperswithcode-bbq-4)</sup>, waardoor een breed onderzoekspubliek BBQ kan toepassen bij de ontwikkeling en het testen van nieuwe modellen. In diverse overzichten wordt BBQ samen met andere benchmarks (zoals StereoSet, WinoBias, ToxiGen) genoemd als een belangrijke mijlpaal in het onderzoek naar sociale bias in NLP<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-evaluating-mitigating-3)</sup>. Sinds de publicatie van BBQ zijn er werken verschenen die de ideeën ervan verder ontwikkelen en aanpassen aan nieuwe omstandigheden:

- **Uitbreiding van vraagformaten (Open-BBQ)**. De originele BBQ biedt taken in multiple-choice-formaat<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-evaluating-mitigating-3)</sup>. In 2024 werd een modificatie van BBQ voor **open antwoorden** voorgesteld, met taken voor het invullen van lege plekken en korte antwoordteksten<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-evaluating-mitigating-3)</sup>. Deze versie, informeel Open-BBQ genoemd, maakt het mogelijk bias te evalueren in meer open dialoogsituaties, waarbij het model geen vaste antwoordopties heeft<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-evaluating-mitigating-3)</sup>. Onderzoek toonde aan dat LLM's bij het genereren van vrije tekst ook verhoogde bias vertonen tegen bepaalde groepen<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-evaluating-mitigating-3)</sup>. De auteurs van Open-BBQ experimenteerden ook met methoden om bias te verminderen, door zero-shot en few-shot prompts te combineren met chain-of-thought (stapsgewijze redenering)<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-evaluating-mitigating-3)</sup>. Deze methoden maakten het mogelijk het niveau van bias in de antwoorden merkbaar te verlagen<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-evaluating-mitigating-3)</sup>. Open-BBQ vulde de originele dataset aan door het testen van generatieve modellen mogelijk te maken in formaten die dichter bij gebruikersverzoeken liggen.

<!-- -->

- **Culturele aanpassing (lokalisatie)**. Omdat BBQ is gebaseerd op de sociale realiteit van de VS, raakten onderzoekers geïnteresseerd in aanpassing voor andere talen en culturen<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-kobbg-5)</sup>. In 2023 presenteerden Koreaanse wetenschappers de dataset **KoBBQ** (Korean BBQ) — het Koreaanse equivalent van de Bias Benchmark<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-kobbg-5)</sup>. Zij ontwikkelden een algemene aanpak voor de lokalisatie van BBQ: de originele sjablonen werden onderverdeeld in drie categorieën — die eenvoudig vertaald kunnen worden, die vervanging van groepen door lokale equivalenten vereisen, en die helemaal niet toepasbaar zijn in een Koreaanse context<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-kobbg-5)</sup>. Aanvullend introduceerde KoBBQ 4 nieuwe categorieën van stereotypen die specifiek zijn voor de Koreaanse samenleving, en verwijderde een aantal niet-toepasselijke voorbeelden<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-kobbg-5)</sup>. Het resultaat was een dataset van 268 sjablonen en 76.048 voorbeelden in het Koreaans, met 12 categorieën van sociale bias (inclusief de originele en nieuwe)<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-kobbg-5)</sup>. Het testen van meertalige modellen op KoBBQ bracht aanzienlijke verschillen in het niveau van vooringenomenheid aan het licht in vergelijking met directe machinale vertaling van de originele BBQ naar het Koreaans<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-kobbg-5)</sup>. Dit onderstreept dat **directe vertaling onvoldoende is** — cultuurspecifieke benchmarks zijn nodig die rekening houden met de unieke stereotypen en context van elk land<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-kobbg-5)</sup>. Het werk aan KoBBQ heeft aangetoond dat de BBQ-methodologie wereldwijd kan worden opgeschaald.

BBQ is een onmisbaar onderdeel geworden van onderzoek naar **ethiek van kunstmatige intelligentie**<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-evaluating-mitigating-3)</sup>. De invloed ervan is zichtbaar in de opkomst van nieuwe methoden voor het debiasen van modellen, het opbouwen van inclusievere datasets en maatstaven voor fijnmazige bias-analyse. Onderzoekers merken op dat een van de sterke punten van BBQ de breedte van de dekking en de zorgvuldigheid van de opbouw van de voorbeelden is<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-evaluating-mitigating-3)</sup>. Als reactie op de uitdagingen die BBQ heeft blootgelegd, worden tegenwoordig actief **strategieën voor het verminderen van bias** ontwikkeld, van het filteren van trainingsdata tot speciale algoritmen voor naverwerking en het fine-tunen van LLM's op eerlijke antwoorden<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-evaluating-mitigating-3)</sup>.

Samenvattend heeft BBQ (Bias Benchmark for QA) zich bewezen als een waardevol en betrouwbaar instrument voor het meten van sociale vooroordelen in taalmodellen. Het biedt de onderzoeksgemeenschap een standaard set van controles waarmee modellen kunnen worden vergeleken op stereotypering en waarmee vooruitgang in het verbeteren van hun onpartijdigheid kan worden gevolgd<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-evaluating-mitigating-3)</sup>. BBQ blijft zich uitbreiden en aanpassen, wat de wereldwijde belangstelling weerspiegelt voor de ontwikkeling van **eerlijkere en veiligere AI-systemen**<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-evaluating-mitigating-3)</sup>, vrij van onopvallende maar wezenlijke schadelijke bias.

## Verwijzingen

- Origineel BBQ-artikel (arXiv)
- BBQ-repository op GitHub
- BBQ-datasetpagina op Papers With Code
- BBQ-artikel op ACL Anthology
- Artikel over de KoBBQ-dataset (arXiv)
- Artikel over de Open-BBQ-dataset (arXiv)

## Literatuur

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## Noten

<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-bbq-main-1)</sup> <sup>[\[2\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-acl-anthology-2)</sup> <sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-evaluating-mitigating-3)</sup> <sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-paperswithcode-bbq-4)</sup> <sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_note-arxiv-kobbg-5)</sup> \</references\>

1.  <span id="cite_note-arxiv-bbq-main-1">↑ <sup>[1.00](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-11)</sup> <sup>[1.12](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-12)</sup> <sup>[1.13](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-13)</sup> <sup>[1.14](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-14)</sup> <sup>[1.15](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-15)</sup> <sup>[1.16](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-16)</sup> <sup>[1.17](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-17)</sup> <sup>[1.18](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-18)</sup> <sup>[1.19](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-19)</sup> <sup>[1.20](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-20)</sup> <sup>[1.21](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-21)</sup> <sup>[1.22](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-22)</sup> <sup>[1.23](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-23)</sup> <sup>[1.24](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-24)</sup> <sup>[1.25](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-25)</sup> <sup>[1.26](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-26)</sup> <sup>[1.27](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-27)</sup> <sup>[1.28](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-28)</sup> <sup>[1.29](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-29)</sup> <sup>[1.30](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-30)</sup> <sup>[1.31](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-31)</sup> <sup>[1.32](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-32)</sup> <sup>[1.33](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-33)</sup> <sup>[1.34](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-34)</sup> <sup>[1.35](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-35)</sup> <sup>[1.36](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-36)</sup> <sup>[1.37](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-37)</sup> <sup>[1.38](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-38)</sup> <sup>[1.39](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-39)</sup> <sup>[1.40](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-40)</sup> <sup>[1.41](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-41)</sup> <sup>[1.42](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-42)</sup> <sup>[1.43](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-43)</sup> <sup>[1.44](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-44)</sup> <sup>[1.45](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-45)</sup> <sup>[1.46](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-46)</sup> <sup>[1.47](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-47)</sup> <sup>[1.48](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-48)</sup> <sup>[1.49](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-49)</sup> <sup>[1.50](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-50)</sup> <sup>[1.51](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-51)</sup> <sup>[1.52](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-52)</sup> <sup>[1.53](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-53)</sup> <sup>[1.54](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-54)</sup> <sup>[1.55](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-55)</sup> <sup>[1.56](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-56)</sup> <sup>[1.57](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-57)</sup> <sup>[1.58](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-58)</sup> <sup>[1.59](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-59)</sup> <sup>[1.60](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-60)</sup> <sup>[1.61](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-61)</sup> <sup>[1.62](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-62)</sup> <sup>[1.63](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-63)</sup> <sup>[1.64](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-64)</sup> <sup>[1.65](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-65)</sup> <sup>[1.66](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-66)</sup> <sup>[1.67](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-67)</sup> <sup>[1.68](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-68)</sup> <sup>[1.69](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-69)</sup> <sup>[1.70](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-70)</sup> <sup>[1.71](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-71)</sup> <sup>[1.72](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-72)</sup> <sup>[1.73](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-73)</sup> <sup>[1.74](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-74)</sup> <sup>[1.75](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-75)</sup> <sup>[1.76](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-76)</sup> <sup>[1.77](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-77)</sup> <sup>[1.78](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-78)</sup> <sup>[1.79](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-79)</sup> <sup>[1.80](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-80)</sup> <sup>[1.81](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-bbq-main_1-81)</sup> Parrish A. et al. «BBQ: A Hand-Built Bias Benchmark for Question Answering». *arXiv*. <a href="https://arxiv.org/abs/2110.08193" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-acl-anthology-2">↑ <sup>[2.0](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-acl-anthology_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-acl-anthology_2-1)</sup> Parrish A. et al. «BBQ: A hand-built bias benchmark for question answering». *ACL Anthology*. <a href="https://aclanthology.org/2022.findings-acl.165/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-arxiv-evaluating-mitigating-3">↑ <sup>[3.00](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-evaluating-mitigating_3-0)</sup> <sup>[3.01](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-evaluating-mitigating_3-1)</sup> <sup>[3.02](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-evaluating-mitigating_3-2)</sup> <sup>[3.03](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-evaluating-mitigating_3-3)</sup> <sup>[3.04](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-evaluating-mitigating_3-4)</sup> <sup>[3.05](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-evaluating-mitigating_3-5)</sup> <sup>[3.06](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-evaluating-mitigating_3-6)</sup> <sup>[3.07](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-evaluating-mitigating_3-7)</sup> <sup>[3.08](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-evaluating-mitigating_3-8)</sup> <sup>[3.09](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-evaluating-mitigating_3-9)</sup> <sup>[3.10](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-evaluating-mitigating_3-10)</sup> <sup>[3.11](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-evaluating-mitigating_3-11)</sup> <sup>[3.12](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-evaluating-mitigating_3-12)</sup> <sup>[3.13](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-evaluating-mitigating_3-13)</sup> <sup>[3.14](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-evaluating-mitigating_3-14)</sup> <sup>[3.15](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-evaluating-mitigating_3-15)</sup> <sup>[3.16](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-evaluating-mitigating_3-16)</sup> Liu Z. et al. (2024). «Evaluating and Mitigating Social Bias for Large Language Models in Open-ended Settings». *arXiv preprint*. <a href="https://arxiv.org/html/2412.06134v1" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-paperswithcode-bbq-4">↑ <sup>[4.0](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-paperswithcode-bbq_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-paperswithcode-bbq_4-1)</sup> <sup>[4.2](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-paperswithcode-bbq_4-2)</sup> <sup>[4.3](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-paperswithcode-bbq_4-3)</sup> <sup>[4.4](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-paperswithcode-bbq_4-4)</sup> <sup>[4.5](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-paperswithcode-bbq_4-5)</sup> <sup>[4.6](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-paperswithcode-bbq_4-6)</sup> «BBQ Dataset». *Papers With Code*. <a href="https://paperswithcode.com/dataset/bbq" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-arxiv-kobbg-5">↑ <sup>[5.0](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-kobbg_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-kobbg_5-1)</sup> <sup>[5.2](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-kobbg_5-2)</sup> <sup>[5.3](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-kobbg_5-3)</sup> <sup>[5.4](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-kobbg_5-4)</sup> <sup>[5.5](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-kobbg_5-5)</sup> <sup>[5.6](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-kobbg_5-6)</sup> <sup>[5.7](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(NL)#cite_ref-arxiv-kobbg_5-7)</sup> Jin J. et al. (2024). «KoBBQ: Korean Bias Benchmark for Question Answering». *arXiv preprint*. <a href="https://arxiv.org/abs/2307.16778" class="external autonumber" rel="nofollow">[5]</a></span>
