---
title: "BBQ (Bias Benchmark for Question Answering) (HU)"
source: "https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)"
wiki: "systems-analysis.info/int"
article: "BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)"
language: "hu"
categories:
  - "Category:Hungarian"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 523
wiki_created_at: 2026-09-06T22:35:00Z
wiki_modified_at: 2026-09-06T22:35:00Z
downloaded_at: 2026-09-07T22:40:43Z
---

# BBQ (Bias Benchmark for Question Answering) (HU)

**BBQ** (Bias Benchmark for Question Answering) — ez egy **adatkészlet** a **társadalmi előítéletek** (bias) értékelésére kérdés-válasz típusú (QA) rendszerekben<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>. A New York-i Egyetem kutatócsoportja fejlesztette Alicia Parrish vezetésével, és 2022-ben jelent meg az ACL Findings konferencián<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)[\[2\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-acl-anthology-2)</sup>. A BBQ célja annak feltárása, hogy a nagy nyelvi modellek (BNM) és más QA-modellek miként mutatnak sztereotípiákat és előítéleteket a kérdésekre adott válaszokban, különösen a természetes nyelvű kérdésmegválaszolás alkalmazott feladataiban<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>. A BBQ az NLP területén a társadalmi bias értékelésének egyik legátfogóbb benchmark-jává vált, kilenc társadalmi kategória keretében a sztereotípiák széles spektrumát lefedve<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-evaluating-mitigating-3)</sup>.

Ez az adatkészlet kiegészíti a korábbi munkákat, mint például az UnQover adatkészletet (2020), amely korlátozott számú jellemző (nem-szakma, nemzetiség, etnikai hovatartozás, vallás) mentén mérte az előítéletességet, és a modellek valószínűségeire támaszkodott, nem magukra a válaszokra<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-evaluating-mitigating-3)</sup>. Az UnQover-rel ellentétben a BBQ közvetlenül a modellek válaszainak tartalmát és a felkínált lehetőségek közötti választást elemzi, ami lehetővé teszi az előítéletesség értékelését pontosan a kimenetelt szintjén<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>.

A BBQ szerzői az eszközt a modellek **káros társadalmi sztereotípiáinak** diagnosztizálására és az ilyen sztereotípiák sérülékeny társadalmi csoportokra gyakorolt negatív hatásának csökkentésére szánt eszközként pozícionálják<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>. A készlet az amerikai angol kultúrára jellemző sztereotípiákra fókuszál, és nem fed le minden lehetséges kulturális kontextust<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>. Mindazonáltal a BBQ alapot teremtett a társadalmi bias mérésére és enyhítésére irányuló későbbi munkáknak az NLP területén, és referenciaponttá vált a modellek etikai helyességének összehasonlításában.

## Состав и структура набора данных - Az adatkészlet összetétele és szerkezete

A BBQ körülbelül **58 500 kérdés-válasz párt** tartalmaz, amelyek specifikus sztereotípiák feltárására irányuló speciális készletekbe vannak csoportosítva<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-paperswithcode-bbq-4)</sup>. Az összes példát a szerzők **kézzel** állították össze dokumentált előítéletek és sztereotípiák alapján, amelyek különböző társadalmi csoportok képviselőinek ártanak<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-paperswithcode-bbq-4)</sup>. A forgatókönyvek létrehozásához tudományos kutatások adatait, médiás cikkeket, jelentéseket és más megbízható forrásokat használtak fel, amelyek igazolják az adott sztereotípia létezését és káros következményeit<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>. Minden helyzethez a szerzők megjelölik azt a forrást, ahol az adott sztereotípiát negatívnak vagy károsnak írják le (például tudományos cikk vagy hírközlemény)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>.

### Társadalmi kategóriák

A BBQ **kilenc fő, társadalmilag fontos kategóriát** fed le (amelyek többsége megfelel az USA Egyenlő Foglalkoztatási Esélyek Bizottságának meghatározása szerinti védett csoportoknak)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>:

- **Kor** – korcsoportokkal szembeni előítéletek (például az idősek kognitív képességeinek csökkenéséről szóló sztereotípia)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>.
- **Fogyatékosság** – fogyatékossággal élők szellemi képességeire vagy egyéb tulajdonságaira vonatkozó sztereotípiák (például az a nézet, hogy a fizikailag korlátozott személyek intellektuálisan kevésbé kompetensek)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>.
- **Nemi identitás** – nemi sztereotípiák (például az az elképzelés, hogy „a lányok rosszak matematikából")<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>.
- **Nemzetiség** – nemzeti-etnikai előítéletek (például az afrikai származásúak technikai analfabétizmusáról szóló sztereotípia)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>.
- **Megjelenés** – külső megjelenés, testalkat alapján való megkülönböztetés (például az a nézet, hogy az elhízott emberek kevésbé okosak vagy szorgalmasak)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>.
- **Faj/etnikai hovatartozás** – faji sztereotípiák (például bizonyos faj bűnözéssel vagy kábítószer-fogyasztással való előítéletes összekapcsolása)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>.
- **Vallás** – vallási sztereotípiák (például a zsidókról mint kapzsiakról, a muzulmánokról mint erőszakra hajlamosakról alkotott kép stb.)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>.
- **Szocioökonómiai státusz** – szegény vagy gazdag társadalmi rétegekkel szembeni előítéletek (például az a meggyőződés, hogy szegény családból származók rossz szülők lesznek)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>.
- **Szexuális orientáció** – homofób sztereotípiák (például a homoszexualitás hamis összekapcsolása a HIV-fertőzéssel)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>.

Ezen kilenc kategórián kívül a BBQ két **metszésponti kategóriát** (intersectional biases) is tartalmaz, amelyek egyszerre két jellemzőt kombinálnak: (1) nem és faj/etnikum kombinációja, illetve (2) szocioökonómiai státusz és faj kombinációja<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>. Az ilyen esetek különböző csoportok metszéspontján lévő sztereotípiákat vesznek figyelembe (például kifejezetten fekete nőkkel vagy bizonyos alacsony társadalmi osztályba tartozó etnikumokkal szembeni előítéletek).

### Sablonok és példák generálása

Minden kategóriához a csapat **forgatókönyv-sablonokat** írt – rövid jeleneteket, amelyekben két, a célzott jellemző szerint különböző szereplő szerepel (például fiatal és idős, férfi és nő, gazdag és szegény stb.)<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-paperswithcode-bbq-4)</sup>. A sablonba olyan helyzet van beépítve, amely megerősíthet vagy megcáfolhat egy ismert sztereotípiát. Minden forgatókönyvhöz kérdések és válaszlehetőségek tartoznak.

Összesen 25 egyedi sablont dolgoztak ki a kilenc fő kategória mindegyikéhez, plusz 25 további sablont a faj és nem kategóriákhoz valódi nevekkel (hogy a tulajdonnevek szintjén is ellenőrizhető legyen a bias)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>. A két metszésponti irányhoz szintén 25-25 sablont hoztak létre<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>. Így az alapszcenáriók száma meghaladja a 300-at.

Minden sablon speciális **változóhelyeket** tartalmaz – csoportneveket vagy leírásokat –, amelyeket a szövegbe helyettesítenek (például a kor-sablonban a „\_éves személy" helyére különböző számokat, a megjelenés-sablonban a „kövér"/„sovány" jelzőket stb. helyettesítik)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>. A különböző értékek behelyettesítésével és a két szereplő megemlítési sorrendjének felcserélésével minden sablon számos konkrét példányra bővül (legalább 8, de akár ~200 variációra)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>. Általában egy sablonból legalább 100 végleges kérdés generálódik, egyes esetekben akár kétszáz is<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>. Összesítve 58 492 példából (forgatókönyv, kérdés és válasz egyedi kombinációjából) álló korpusz jött létre<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-paperswithcode-bbq-4)</sup>.

### Kontextusok és kérdéstípusok

A BBQ legfontosabb jellemzője, hogy minden helyzet kétféle kontextusvariánsban és kétféle kérdésmegfogalmazásban jelenik meg, így **négy kérdésből** álló készletet alkotva (az úgynevezett 4-es klaszter)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>. Ezt azért tették, hogy elkülönítsék az információhiány hatását a modell saját sztereotípiáitól. Minden kvartettben<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>:

- **Kétértelmű kontextus** (under-informative or ambiguous context): olyan szöveg, amely két különböző csoportból származó személy részvételével leír egy helyzetet, de nem tartalmaz elegendő információt a feltett kérdés egyértelmű megválaszolásához<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>. Az ilyen esetekben a helyes válasz mindig az „ismeretlen" (azaz elegendő adat hiánya)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>. Ezek a példák azt ellenőrzik, hogy a modell nem von-e le következtetéseket sztereotípia alapján.
- **Egyértelmű kontextus** (disambiguated context): kibővített forgatókönyv, amelybe egy pontosító részlet került, lehetővé téve annak meghatározását, hogy a két említett személy közül melyik felel meg a kérdésnek<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>. Ebben az esetben a két szereplő egyike egyértelműen a helyes válasz (az „ismeretlen" lehetőség ekkor már helytelen). Az egyértelmű kontextus azt vizsgálja, hogy a modell képes-e legyőzni esetleges bias-át és a helyes választ adni, még akkor is, ha a sztereotípia mást sugall<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>.
- **Negatív kérdés** (pl. „Melyikük nem ismeri jól a tantárgyat?", „Ki követte el a bűncselekményt?")<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>. Az ilyen kérdés kétértelmű kontextussal kombinálva azt vizsgálja, hogy a modell hajlamos-e a negatív cselekedetet egy bizonyos csoporthoz kötni tények hiányában<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>.
- **Nem negatív (kontrasztos) kérdés** (pl. „Melyikük ismeri jól a tantárgyat?" vagy „Ki tartózkodik a rossz cselekedettől?")<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>. A nem negatív kérdést úgy fogalmazzák meg, hogy ne hangozzon a sztereotípia közvetlen megerősítéseként, ugyanakkor lehetővé tegye a modell válaszainak egyensúlyát ellenőrizni<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>. A negatív és semleges változatokra adott válaszok összehasonlítása szisztematikus torzulásokat tár fel.

A klaszter mind a négy példájának **három válaszlehetősége** van: két konkrét (a két szereplőcsoport mindegyikét megnevező) és egy, amely elegendő információ hiányát jelzi (\\Unknown\\ és ezzel egyenértékű kifejezések jelölésével)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>. Például egy olyan jelenetben, ahol egy keresztény és egy muszlim szerepel, a válaszlehetőségek: „keresztény", „muszlim" vagy „ismeretlen"<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>. Az „ismeretlen" szó sem mindig ugyanaz – 10 szinonim kifejezést használnak<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>.

Ezenkívül minden sablonban automatikusan változik a **két csoport megemlítési sorrendje**<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>. Ezt a **sorrendhatás** semlegesítésére tették – ez egy ismert jelenség, amelynél a modellek az elsőként említett entitást hajlamosak gyakrabban választani a tartalomtól függetlenül<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>.

### Annotálás és minőség-ellenőrzés

Minden BBQ-példát crowdsourcing útján toboroztak annotátorok értékeltek: legalább 5 független személy válaszolt a kérdésekre, és a végleges adatkészletbe csak azok a példák kerültek be, amelyeknél **legalább 5-ből 4 annotátor egyetértett a helyes válaszban** (szavazással)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>. Ha bármelyik kérdés nem érte el ezt a küszöböt, az egész sablont felülvizsgálták és átszerkesztették<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>. Ennek a folyamatnak köszönhetően az emberi pontosság a BBQ-n meglehetősen magas: az egyéni annotátorok a kérdések ~95,7%-ára válaszoltak helyesen, a többségi szavazást figyelembe véve a gold standard pontossága eléri a 99,7%-ot<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>. Az egyetértési mutató (Krippendorff-alfa) 0,883 volt, ami **magas összhangot** jelez az emberek között a helyes válaszokat illetően<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>. Ezek az intézkedések megerősítik, hogy a BBQ feladatai az emberek számára érthetők és objektívan helyes válaszokkal rendelkeznek; következésképpen a modellek hibái ezeken a példákon megalapozottan értelmezhetők bias megnyilvánulásaként, nem pedig maguk a kérdések kétértelműségeként.

## Оценка предвзятости моделей - Modellek előítéletességének értékelése

A BBQ a modellek viselkedésének többszempontú értékelésére lett kifejlesztve társadalmi bias-t kiváltó körülmények között. A tesztelés során a QA-modell kontextust és kérdést kap bemenetként, majd háromféle válaszlehetőség közül egyet kell kiválasztania. Az eredmények elemzése két szinten történik<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>:

### A kétértelmű kontextus esete

Azt mérik, hogy a modell milyen gyakran válaszol helytelenül a szükséges információ hiányában, azaz **sztereotípiára támaszkodik-e**<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>. Ideális esetben a modellnek „ismeretlen"-t kellene válaszolnia minden olyan kérdésre, amelynek kontextusa elégtelen, azonban ha valamelyik csoportot választja, azt a beépített sztereotípia kivetítéseként értékelik<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>. Az ilyen hibák gyakorisága és azok kategóriánkénti eloszlása képet ad arról, hogy a modell mennyire hajlamos káros sztereotípiákat reprodukálni.

### Az informatív kontextus esete

Azt értékelik, hogy a modell milyen pontosan válaszol, amikor a kontextus egyértelmű helyes választ tartalmaz<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>. Itt általában a standard **accuracy** metrikát számítják (a helyes válaszok százalékát) – ez mutatja meg, hogy a modell alapvetően képes-e megoldani a kérdés-válasz feladatot. Különös figyelmet fordítanak azonban azokra az esetekre, ahol a helyes válasz ellentmond a sztereotípiának<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>. A BBQ fejlesztői elemzik, hogy csökken-e a modell pontossága, ha a helyes válasz ellentmond egy bevett sztereotípiának (és fordítva: nem lesz-e magasabb a pontosság, ha az igazság egybeesik a sztereotip elvárással)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>. Egy ilyen hatás azt jelezné, hogy a modell még tények jelenlétében is hibázhat bias miatt.

### Bias Score

Az előítéletesség mértékének számszerű értékelésére egy speciális metrika kerül bevezetésre – az **előítéletességi mutató** (bias score)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>. Általánosságban a bias score a modell válaszainak azt a százalékát tükrözi (a helytelenek vagy az összes közül, a feltételtől függően), amelyek egybeesnek a sztereotípiával<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>.

- A **+100%** érték azt jelenti, hogy a modell minden esetben azt a válaszlehetőséget választotta, amely sztereotip módon negatív tulajdonságot tulajdonít a célcsoportnak.
- **0%** – nincs bias megnyilvánulás (a modell vagy mindig helyesen/„ismeretlen"-nel válaszol, vagy mindkét irányban egyenlő arányban hibázik).
- **Negatív score** (akár -100%-ig) – ellentétes tendencia, amikor a modell mindig a sztereotípia elvárásával ellentétesen válaszol<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>.

A mutatókat külön számítják a kétértelmű és az egyértelmű kontextusokra, mivel a bennük lévő hibák jellege eltérő<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>.

- **Kétértelmű kérdések** esetén a bias score-t az esetek azon arányaként határozzák meg, amikor a modell az „ismeretlen" helyett valamilyen konkrét választ adott, és ez a válasz egybeesett a negatív sztereotípiával<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>. Minél gyakoribbak az ilyen válaszok, annál magasabb a pozitív score. Eközben figyelembe veszik a pontosságot: ha a modell egyenlő arányban hibázik és válaszol helyesen („ismeretlen"), akkor még néhány sztereotip hiba esetén is alacsonyabb lesz a score, mint azon modellnél, amely mindig sztereotip választ ad<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>. Így **mind a bias-válaszok gyakorisága, mind az azokban való magabiztosság büntetésre kerül** (a kétértelmű kontextusok esetén a metrikát az „ismeretlen" helyes válaszok százalékának figyelembevételével skálázzák)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>.
- **Egyértelmű kérdések** esetén a bias score-t kissé eltérően számítják, mivel itt a helyes válasz az egyik csoport<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>. Ezekben az esetekben a modell **helytelen válaszait** vizsgálják: a hibák azon arányát, amelyekben a modell nem a helyes lehetőséget, hanem a sztereotípiával egybeeső alternatív lehetőséget választotta<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>. Más szóval, ha a modell hibázott, előnyt adva az előítéletnek (például nem hitt a tényeknek és sztereotípia alapján válaszolt), ez növeli a score-t<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>.

A bias score elemzése az általános pontossággal együtt lehetővé teszi a modell BBQ-n való viselkedésének részletes jellemzését. A szerzők rámutatnak, hogy azonos accuracy mögött eltérő jellegű hibák rejtőzhetnek<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>. Így ez a mutató a **hibák irányultságát** mutatja meg, és feltárja azokat a finom eseteket, amelyek pusztán a pontosság alapján nem láthatók.

## Результаты и выявленные закономерности - Eredmények és azonosított minták

Néhány népszerű QA-modell kezdeti tesztelése a BBQ-n a bias számos egyértelmű megnyilvánulását mutatta<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>. Parrish és mtsai (2022) tanulmányában nagy, általános célú modelleket (például UnifiedQA – általánosított QA-modell T5 alapon) és szabványosított multiple-choice modelleket (pl. ROBERTA QA-ra finomhangolva) egyaránt teszteltek<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>.

A kísérletek főbb megállapításai:

- **Erős sztereotip hibák információhiány esetén**. Az összes tesztelt rendszerben megfigyelhető volt az a tendencia, hogy sztereotípia szellemében válaszolnak, ha a kontextus nem nyújtott szükséges támpontokat<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>. Más szóval a modellek gyakran nem az „ismeretlen" lehetőséget választották, hanem egy konkrét választ, amely valamilyen sztereotip elváráshoz kapcsolódott<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>. Például a kétértelmű bűncselekmény-kérdéseknél, ahol nem volt egyértelmű tettes, a modellek gyakran egy bizonyos csoporthoz tartozó személyeket jelöltek meg (az előítéletnek megfelelően)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>. A kétértelmű kontextusok számított bias score-ja szignifikánsan nulla felett volt, egyes modelleknél bizonyos kategóriákban közel járt a +100%-hoz<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>. A sztereotip válaszokra való különösen nagy hajlamot a **megjelenéssel** (elhízás stb.) kapcsolatos jelenetekben mutatták a modellek – ez a kategória jóval nagyobb bias-t eredményezett, mint például a faj vagy a szexuális orientáció<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>. Ez a modellen belüli bias heterogenitására utal – egyes típusú sztereotípiák „erősebben be vannak programozva", mint mások.
- **Javulás tények jelenlétében, de rejtett bias fennmaradása**. Amikor a modellek egyértelmű kontextust kaptak a helyes válasz explicit megjelölésével, **pontosságuk érezhetően megnőtt** (a bizonytalansági helyzethez képest)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>. A részletes elemzés azonban egy finom hatást tárt fel: a pontosság **egyenetlen volt attól függően, hogy a helyes válasz hogyan viszonyult a sztereotípiához**<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>. Átlagosan a modellek 3-3,5 százalékponttal magasabb pontosságot értek el azokban a példákban, ahol a helyes válasz egybeesett az elterjedt sztereotípiával, azokhoz képest, ahol a helyes válasz ellentmondott a sztereotípiának<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>. Más szóval, ha a tények megerősítették az előítéletet, a modellek szinte hibátlanul adták a választ; de ha a sztereotípiával „atipikus" lehetőséget kellett megnevezni, a hibázás valószínűsége megnőtt. Ez a teljesítménybeli különbség, bár nem hatalmas, statisztikailag sok kategóriában megmutatkozott<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>. A legnagyobb eltérést a nemi sztereotípiákhoz kapcsolódó kérdéseknél rögzítették: akár 5 százalékpontos különbséggel<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>. Így a **rejtett bias-hatás** nyomon követhető: a modellek átlagosan kissé gyengébben teljesítenek „a sztereotípiával szemben".
- **Kategóriák és sablonok összehasonlítása**. A BBQ kutatói elemezték a bias score-t mind a kilenc kategória bontásában, és megállapították, hogy a kétértelmű kontextusokban a mutató minden kategóriában pozitív, de nagysága változó<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>. Ahogy már szó esett róla, a legnagyobb bias a fizikai megjelenés, a szocioökonómiai státusz és néhány metszésponti kategóriánál volt megfigyelhető<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>. „Alacsonyabb", bár szintén nem nulla bias score-t mutattak a faj/etnikum és a szexuális orientáció kategóriák<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>. Az egyértelmű kontextusokban a bias score összességében közelebb volt a nullához (mivel a modell gyakran helyesen válaszol), de egyes sablonok esetén pozitív maradt, tükrözve az elkövetett hibák jellegének jelentős torzulását<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>. Például a vallás kategóriájában a legtöbb hiba egy irányba mutatott – a modellek hiba esetén általában előítélet alapján adták a választ<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>.

Egészében véve a BBQ megmutatta, hogy még az erős, modern nyelvi modellek is **egyértelműen nem mentesek a társadalmi előítéletektől**<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>. Hajlamosak sztereotípiákat reprodukálni, ha bizonytalansági körülmények közé kerülnek, és finom bias-t mutathatnak még tények jelenlétében is, ha az ellentétes választ követel<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>. Eközben ezek a hatások nem egyformák a különböző csoportok esetén: egyes sztereotípiák „erősebben be vannak programozva" a modellbe<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>. A BBQ szerzői hangsúlyozzák, hogy a feltárt különbségek, bár észrevehetők, nem katasztrofálisan nagyok – a legtöbb modell bias score-ja nem ér el szélsőséges értékeket, és gyakran néhány tíz százalék körül mozog<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-bbq-main-1)</sup>. Mindazonáltal még kis szisztematikus sztereotípia irányú eltérések is potenciálisan veszélyesek a BNM-ek nagyléptékű alkalmazásánál, ezért az ilyen bias-ok feltárása és megszüntetése fontos feladat<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-evaluating-mitigating-3)</sup>. A BBQ a kutatók számára egyértelmű és számszerűen mérhető módszert biztosított a fejlődés nyomon követéséhez ezen a területen<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-evaluating-mitigating-3)</sup>.

## Влияние и дальнейшие исследования - Hatás és további kutatások

A BBQ gyorsan elismerést szerzett mint a nyelvi modellek fairness jellemzőinek értékelésére szolgáló szabványos eszköz<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-paperswithcode-bbq-4)</sup>. **Nyílt forráskódjú adatai és kódja** elérhetők egy adattárban (CC BY 4.0 licenc)<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-paperswithcode-bbq-4)</sup>, ami lehetővé tette a széles kutatói közönség számára a BBQ alkalmazását új modellek fejlesztésénél és tesztelésénél. Számos áttekintő tanulmányban a BBQ más benchmark-ok (például StereoSet, WinoBias, ToxiGen) mellett fontos mérföldkőként kerül megemlítésre az NLP területén a társadalmi bias vizsgálatában<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-evaluating-mitigating-3)</sup>. A BBQ közzététele óta megjelentek az ötleteit továbbfejlesztő és új feltételekhez adaptáló munkák:

- **Kérdésformátumok bővítése (Open-BBQ)**. Az eredeti BBQ multiple choice formátumban kínál feladatokat<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-evaluating-mitigating-3)</sup>. 2024-ben javaslatot tettek a BBQ **nyílt végű válaszokra** adaptálált változatára, amely hiányos mondatok kiegészítését és rövid válaszos szöveges feladatokat tartalmaz<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-evaluating-mitigating-3)</sup>. Ez a változat, amelyet Open-BBQ-nak hívnak, lehetővé teszi a bias értékelését szabadabb párbeszédi körülmények között, ahol a modellnek nincsenek rögzített válaszlehetőségei<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-evaluating-mitigating-3)</sup>. A kutatás kimutatta, hogy a BNM-ek szabad szöveg generálásakor szintén fokozott bias-t mutatnak egyes csoportokkal szemben<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-evaluating-mitigating-3)</sup>. Az Open-BBQ szerzői szintén kísérleteztek az előítéletesség csökkentési módszereivel, zero-shot és few-shot promptokat, valamint chain-of-thought (lépésenkénti gondolkodást) kombinálva<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-evaluating-mitigating-3)</sup>. Ezek a módszerek érzékelhetően csökkentették a válaszokban lévő bias szintjét<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-evaluating-mitigating-3)</sup>. Az Open-BBQ kiegészítette az eredeti készletet, lehetővé téve a generatív modellek tesztelését a felhasználói kérésekhez közelebb álló formátumokban.

<!-- -->

- **Kulturális adaptáció (lokalizáció)**. Mivel a BBQ az USA társadalmi valóságára épül, a kutatók érdeklődtek más nyelvekhez és kultúrákhoz való adaptálása iránt<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-kobbg-5)</sup>. 2023-ban koreai tudósok bemutatták a **KoBBQ** (Korean BBQ) adatkészletet – a Bias Benchmark koreai megfelelőjét<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-kobbg-5)</sup>. Kidolgoztak egy általános megközelítést a BBQ lokalizálásához: az eredeti sablonokat három kategóriára osztották – olyanokra, amelyek egyszerűen lefordíthatók, olyanokra, amelyeknél a csoportokat helyi megfelelőkre kell cserélni, és olyanokra, amelyek egyáltalán nem alkalmazhatók a koreai kontextusban<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-kobbg-5)</sup>. Emellett a KoBBQ 4 új, a koreai társadalomra jellemző sztereotípia-kategóriát vezetett be, és eltávolított néhány nem odaillő példát<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-kobbg-5)</sup>. Az eredmény egy 268 sablonból és 76 048 koreai nyelvű példából álló készlet lett, amely 12 társadalmi bias-kategóriát fed le (az eredeti és az új kategóriákat is beleértve)<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-kobbg-5)</sup>. A többnyelvű modellek KoBBQ-n való tesztelése jelentős eltéréseket mutatott az előítéletesség szintjében az eredeti BBQ koreai gépi fordításával összehasonlítva<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-kobbg-5)</sup>. Ez aláhúzza, hogy **a közvetlen fordítás nem elegendő** – kulturálisan specifikus benchmark-okra van szükség, amelyek figyelembe veszik az egyes országok egyedi sztereotípiáit és kontextusát<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-kobbg-5)</sup>. A KoBBQ-n végzett munka demonstrálta a BBQ-módszertan globális méretű skálázhatóságát.

A BBQ a **mesterséges intelligencia etikájával** kapcsolatos kutatások szerves részévé vált<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-evaluating-mitigating-3)</sup>. Hatása nyomon követhető a modellek debiasing módszertanainak megjelenésében, befogadóbb adatkészletek és a bias finomabb elemzésére alkalmas metrikák kidolgozásában. A kutatók megjegyzik, hogy a BBQ egyik erőssége a lefedettség széleskörűsége és a példák gondos megkonstruáltsága<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-evaluating-mitigating-3)</sup>. A BBQ által jelzett kihívásokra válaszul manapság aktívan fejlesztenek **bias-csökkentési stratégiákat** a tanítási adatok szűrésétől egészen a speciális utólagos feldolgozási algoritmusokig és a BNM-ek méltányos válaszokra való hangolásáig<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-evaluating-mitigating-3)</sup>.

Összegezve: a BBQ (Bias Benchmark for QA) értékes és megbízható eszközként igazolta magát a nyelvi modellekben lévő társadalmi előítéletek mérésére. Szabványos ellenőrzési készletet biztosít a kutatói közösség számára, amely lehetővé teszi a modellek sztereotipizálás szempontjából való összehasonlítását és az elfogulatlanságuk javításában elért haladás nyomon követését<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-evaluating-mitigating-3)</sup>. A BBQ tovább bővül és adaptálódik, tükrözve a globális érdeklődést **igazságosabb és biztonságosabb MI-rendszerek** létrehozása iránt<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_note-arxiv-evaluating-mitigating-3)</sup>, amelyek mentesek a nem szembetűnő, de lényegesen káros bias-októl.

## Hivatkozások

- Az eredeti BBQ cikk (arXiv)
- A BBQ adattár GitHubon
- A BBQ adatkészlet oldala a Papers With Code-on
- A BBQ cikk az ACL Anthology-ban
- A KoBBQ adatkészletről szóló cikk (arXiv)
- Az Open-BBQ adatkészletről szóló cikk (arXiv)

## Irodalom

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## Megjegyzések

1.  <span id="cite_note-arxiv-bbq-main-1">↑ <sup>[1.00](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-11)</sup> <sup>[1.12](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-12)</sup> <sup>[1.13](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-13)</sup> <sup>[1.14](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-14)</sup> <sup>[1.15](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-15)</sup> <sup>[1.16](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-16)</sup> <sup>[1.17](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-17)</sup> <sup>[1.18](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-18)</sup> <sup>[1.19](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-19)</sup> <sup>[1.20](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-20)</sup> <sup>[1.21](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-21)</sup> <sup>[1.22](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-22)</sup> <sup>[1.23](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-23)</sup> <sup>[1.24](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-24)</sup> <sup>[1.25](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-25)</sup> <sup>[1.26](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-26)</sup> <sup>[1.27](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-27)</sup> <sup>[1.28](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-28)</sup> <sup>[1.29](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-29)</sup> <sup>[1.30](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-30)</sup> <sup>[1.31](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-31)</sup> <sup>[1.32](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-32)</sup> <sup>[1.33](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-33)</sup> <sup>[1.34](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-34)</sup> <sup>[1.35](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-35)</sup> <sup>[1.36](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-36)</sup> <sup>[1.37](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-37)</sup> <sup>[1.38](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-38)</sup> <sup>[1.39](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-39)</sup> <sup>[1.40](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-40)</sup> <sup>[1.41](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-41)</sup> <sup>[1.42](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-42)</sup> <sup>[1.43](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-43)</sup> <sup>[1.44](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-44)</sup> <sup>[1.45](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-45)</sup> <sup>[1.46](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-46)</sup> <sup>[1.47](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-47)</sup> <sup>[1.48](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-48)</sup> <sup>[1.49](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-49)</sup> <sup>[1.50](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-50)</sup> <sup>[1.51](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-51)</sup> <sup>[1.52](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-52)</sup> <sup>[1.53](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-53)</sup> <sup>[1.54](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-54)</sup> <sup>[1.55](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-55)</sup> <sup>[1.56](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-56)</sup> <sup>[1.57](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-57)</sup> <sup>[1.58](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-58)</sup> <sup>[1.59](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-59)</sup> <sup>[1.60](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-60)</sup> <sup>[1.61](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-61)</sup> <sup>[1.62](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-62)</sup> <sup>[1.63](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-63)</sup> <sup>[1.64](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-64)</sup> <sup>[1.65](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-65)</sup> <sup>[1.66](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-66)</sup> <sup>[1.67](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-67)</sup> <sup>[1.68](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-68)</sup> <sup>[1.69](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-69)</sup> <sup>[1.70](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-70)</sup> <sup>[1.71](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-71)</sup> <sup>[1.72](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-72)</sup> <sup>[1.73](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-73)</sup> <sup>[1.74](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-74)</sup> <sup>[1.75](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-75)</sup> <sup>[1.76](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-76)</sup> <sup>[1.77](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-77)</sup> <sup>[1.78](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-78)</sup> <sup>[1.79](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-79)</sup> <sup>[1.80](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-bbq-main_1-80)</sup> Parrish A. et al. «BBQ: A Hand-Built Bias Benchmark for Question Answering». *arXiv*. <a href="https://arxiv.org/abs/2110.08193" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-acl-anthology-2">[↑](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-acl-anthology_2-0) Parrish A. et al. «BBQ: A hand-built bias benchmark for question answering». *ACL Anthology*. <a href="https://aclanthology.org/2022.findings-acl.165/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-arxiv-evaluating-mitigating-3">↑ <sup>[3.00](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-evaluating-mitigating_3-0)</sup> <sup>[3.01](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-evaluating-mitigating_3-1)</sup> <sup>[3.02](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-evaluating-mitigating_3-2)</sup> <sup>[3.03](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-evaluating-mitigating_3-3)</sup> <sup>[3.04](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-evaluating-mitigating_3-4)</sup> <sup>[3.05](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-evaluating-mitigating_3-5)</sup> <sup>[3.06](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-evaluating-mitigating_3-6)</sup> <sup>[3.07](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-evaluating-mitigating_3-7)</sup> <sup>[3.08](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-evaluating-mitigating_3-8)</sup> <sup>[3.09](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-evaluating-mitigating_3-9)</sup> <sup>[3.10](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-evaluating-mitigating_3-10)</sup> <sup>[3.11](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-evaluating-mitigating_3-11)</sup> <sup>[3.12](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-evaluating-mitigating_3-12)</sup> <sup>[3.13](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-evaluating-mitigating_3-13)</sup> <sup>[3.14](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-evaluating-mitigating_3-14)</sup> <sup>[3.15](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-evaluating-mitigating_3-15)</sup> Liu Z. et al. (2024). «Evaluating and Mitigating Social Bias for Large Language Models in Open-ended Settings». *arXiv preprint*. <a href="https://arxiv.org/html/2412.06134v1" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-paperswithcode-bbq-4">↑ <sup>[4.0](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-paperswithcode-bbq_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-paperswithcode-bbq_4-1)</sup> <sup>[4.2](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-paperswithcode-bbq_4-2)</sup> <sup>[4.3](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-paperswithcode-bbq_4-3)</sup> <sup>[4.4](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-paperswithcode-bbq_4-4)</sup> <sup>[4.5](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-paperswithcode-bbq_4-5)</sup> «BBQ Dataset». *Papers With Code*. <a href="https://paperswithcode.com/dataset/bbq" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-arxiv-kobbg-5">↑ <sup>[5.0](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-kobbg_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-kobbg_5-1)</sup> <sup>[5.2](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-kobbg_5-2)</sup> <sup>[5.3](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-kobbg_5-3)</sup> <sup>[5.4](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-kobbg_5-4)</sup> <sup>[5.5](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-kobbg_5-5)</sup> <sup>[5.6](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HU)#cite_ref-arxiv-kobbg_5-6)</sup> Jin J. et al. (2024). «KoBBQ: Korean Bias Benchmark for Question Answering». *arXiv preprint*. <a href="https://arxiv.org/abs/2307.16778" class="external autonumber" rel="nofollow">[5]</a></span>
