---
title: "BBQ (Bias Benchmark for Question Answering) (RO)"
source: "https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)"
wiki: "systems-analysis.info/int"
article: "BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)"
language: "ro"
categories:
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
  - "Category:Romanian"
revision_id: 530
wiki_created_at: 2026-09-06T22:35:08Z
wiki_modified_at: 2026-09-06T22:35:08Z
downloaded_at: 2026-09-07T22:40:47Z
---

# BBQ (Bias Benchmark for Question Answering) (RO)

**BBQ** (Bias Benchmark for Question Answering) — este un **set de date** pentru evaluarea **prejudecăților sociale** (bias) în sistemele de tip întrebare-răspuns (QA)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>. A fost dezvoltat de un grup de cercetători de la Universitatea din New York, sub conducerea lui Alicia Parrish, și publicat în 2022 la conferința ACL Findings<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)[\[2\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-acl-anthology-2)</sup>. Scopul BBQ este de a identifica modul în care modelele lingvistice mari (LLM) și alte modele QA manifestă stereotipuri și prejudecăți în răspunsurile la întrebări, în special în sarcinile aplicate de răspuns la întrebări în limbaj natural<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>. BBQ a devenit unul dintre cele mai cuprinzătoare benchmark-uri pentru evaluarea bias-ului social în NLP, acoperind un spectru larg de stereotipuri în cadrul a nouă categorii sociale<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-evaluating-mitigating-3)</sup>.

Acest set de date completează lucrările anterioare, precum dataset-ul UnQover (2020), care măsura prejudecata după un număr limitat de caracteristici (gen-profesie, naționalitate, etnie, religie) și se baza pe probabilitățile modelelor, nu pe răspunsurile propriu-zise<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-evaluating-mitigating-3)</sup>. Spre deosebire de UnQover, BBQ analizează direct conținutul răspunsurilor modelelor și alegerea acestora dintre opțiunile oferite, ceea ce permite evaluarea prejudecății tocmai la nivelul rezultatelor produse<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>.

Autorii BBQ îl prezintă ca pe un instrument de diagnosticare a **stereotipurilor sociale dăunătoare** din modele și de reducere a riscului de influență negativă a unor astfel de stereotipuri asupra grupurilor vulnerabile ale populației<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>. Setul este concentrat pe stereotipurile relevante pentru cultura anglofonă a SUA și nu acoperă toate contextele culturale posibile<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>. Cu toate acestea, BBQ a pus bazele lucrărilor ulterioare privind măsurarea și atenuarea bias-ului social în NLP și a devenit un punct de referință în compararea modelelor din perspectiva corectitudinii etice.

## Componența și structura setului de date

BBQ conține aproximativ **58.500 de întrebări și răspunsuri**, grupate în seturi speciale destinate identificării unor stereotipuri concrete<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-paperswithcode-bbq-4)</sup>. Toate exemplele au fost **elaborate manual** de autori pe baza cazurilor documentate de prejudecăți și stereotipuri care aduc prejudicii reprezentanților diverselor grupuri sociale<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-paperswithcode-bbq-4)</sup>. La crearea scenariilor au fost utilizate date din cercetări științifice, articole din mass-media, rapoarte și alte surse de încredere care confirmă existența unui anumit stereotip și consecințele sale dăunătoare<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>. Pentru fiecare situație, autorii indică o referință la sursa în care stereotipul respectiv este descris ca negativ sau dăunător (de exemplu, un articol științific sau o știre)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>.

### Categorii sociale

BBQ acoperă **nouă categorii sociale majore de importanță** (corespunzând în mare parte grupurilor protejate în definiția Comisiei pentru Egalitatea Oportunităților de Angajare din SUA)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>:

- **Vârsta** – prejudecăți față de grupele de vârstă (de exemplu, stereotipul privind declinul capacităților cognitive la persoanele în vârstă)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>.
- **Dizabilitatea** – stereotipuri despre capacitățile mentale sau alte calități ale persoanelor cu dizabilități (de exemplu, percepția că persoanele cu limitări fizice sunt mai puțin competente intelectual)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>.
- **Identitatea de gen** – stereotipuri de gen (de exemplu, ideea că „fetele se descurcă prost la matematică")<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>.
- **Naționalitatea** – prejudecăți naționale și etnice (de exemplu, stereotipul privind analfabetismul tehnic al persoanelor originare din Africa)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>.
- **Aspectul fizic** – discriminarea pe baza înfățișării, a constituției fizice (de exemplu, opinia că persoanele obeze sunt mai puțin inteligente sau muncitoare)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>.
- **Rasa/apartenența etnică** – stereotipuri rasiale (de exemplu, asocierea preconcepută a unei anumite rase cu infracționalitatea sau consumul de droguri)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>.
- **Religia** – stereotipuri religioase (de exemplu, percepția că evreii sunt avari, că musulmanii sunt predispuși la violență etc.)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>.
- **Statutul socioeconomic** – prejudecăți față de păturile sărace sau bogate ale societății (de exemplu, convingerea că persoanele provenite din familii sărace vor fi părinți răi)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>.
- **Orientarea sexuală** – stereotipuri homofobe (de exemplu, asocierea falsă a homosexualității cu infecția HIV)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>.

Pe lângă aceste nouă categorii, BBQ include două **categorii intersecționale** (intersectional biases), combinând câte două caracteristici: (1) genul în combinație cu rasa/etnicitatea și (2) statutul socioeconomic în combinație cu rasa<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>. Astfel de cazuri iau în considerare stereotipurile la intersecția diferitelor grupuri (de exemplu, prejudecăți specifice față de femeile de culoare sau față de anumite etnii din clasa socială inferioară).

### Șabloane și generarea exemplelor

Pentru fiecare categorie, echipa a redactat **șabloane de scenarii** — schițe scurte în care apar doi personaje care diferă printr-o caracteristică-țintă (de exemplu, tânăr și bătrân, bărbat și femeie, bogat și sărac etc.)<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-paperswithcode-bbq-4)</sup>. Șablonul conține o situație care ar putea confirma sau infirma un stereotip cunoscut. Fiecărui scenariu îi sunt asociate întrebări și variante de răspuns.

În total au fost dezvoltate câte 25 de șabloane unice pentru fiecare dintre cele nouă categorii principale, plus câte 25 de șabloane suplimentare pentru categoriile de rasă și gen cu utilizarea de nume reale (pentru a verifica bias-ul la nivelul numelor proprii)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>. De asemenea, pentru cele două direcții intersecționale au fost create câte 25 de șabloane<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>. Astfel, numărul total de scenarii de bază depășește 300.

Fiecare șablon conține **sloturi speciale pentru variabile** — denumiri de grupuri sau descrieri — care sunt substituite în text (de exemplu, în șablonul privind vârsta, în locul „persoană de \_ani" se introduc cifre diferite, iar în cel privind aspectul fizic — adjectivele „gras"/„slab" etc.)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>. Prin substituirea diferitelor valori și schimbarea ordinii de menționare a celor două personaje, fiecare șablon se extinde la un număr mare de exemple concrete (minimum 8 și până la ~200 de variații)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>. De regulă, dintr-un singur șablon se generează cel puțin 100 de întrebări finale, iar în unele cazuri — până la două sute<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>. În total a rezultat un corpus de 58.492 de exemple (combinații unice de scenariu, întrebare și răspuns)<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-paperswithcode-bbq-4)</sup>.

### Contexte și tipuri de întrebări

Caracteristica cheie a BBQ este că fiecare situație este prezentată în două variante de context și două formulări ale întrebării, formând un set de **patru întrebări** (numit cluster de 4)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>. Acest lucru a fost realizat pentru a separa influența lipsei de informație de stereotipurile propriu-zise ale modelului. În fiecare cuartet<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>:

- **Context ambiguu** (under-informative or ambiguous context): text în care este descrisă o situație cu participarea a două persoane din grupuri diferite, dar care nu conține suficiente informații pentru a răspunde în mod univoc la întrebarea pusă<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>. Răspunsul corect în astfel de cazuri este întotdeauna varianta „necunoscut" (adică absența datelor suficiente)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>. Aceste exemple sunt necesare pentru a verifica dacă modelul va trage concluzii bazându-se pe stereotip.
- **Context neambiguu** (disambiguated context): scenariu extins în care se adaugă un detaliu clarificator, permițând identificarea care dintre cele două persoane menționate corespunde întrebării<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>. În acest caz, unul dintre cele două personaje este în mod cert răspunsul corect (iar varianta „necunoscut" este deja incorectă). Contextul neambiguu servește pentru a verifica dacă modelul poate depăși eventualul său bias și alege răspunsul corect, chiar dacă stereotipul sugerează contrariul<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>.
- **Întrebare negativă** (de ex., „Cine dintre ei cunoaște slab subiectul?", „Cine a comis infracțiunea?")<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>. O astfel de întrebare, combinată cu un context ambiguu, verifică dacă modelul este predispus să asocieze o acțiune negativă cu un anumit grup în absența faptelor<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>.
- **Întrebare non-negativă (de contrast)** (de ex., „Cine dintre ei cunoaște bine subiectul?" sau „Cine se abține de la fapta rea?")<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>. Întrebarea non-negativă este formulată astfel încât să nu sune ca o aprobare directă a stereotipului, dar să permită verificarea echilibrului răspunsurilor modelului<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>. Compararea răspunsurilor la versiunile negative și neutre relevă distorsiunile sistematice.

Fiecare dintre aceste patru exemple dintr-un cluster are **trei variante de răspuns**: două concrete (numind fiecare dintre cele două grupuri prezente) și una care indică lipsa informațiilor suficiente (marcată ca „Unknown" și expresii echivalente)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>. De exemplu, într-o scenă în care participă un creștin și un musulman, variantele de răspuns vor fi: „creștinul", „musulmanul" sau „necunoscut"<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>. Mai mult, cuvântul „necunoscut" nu este mereu același — sunt utilizate 10 expresii sinonimice<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>.

De asemenea, în fiecare șablon se modifică automat **ordinea de menționare a celor două grupuri**<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>. Aceasta se face pentru a neutraliza **efectul de ordine** — un factor cunoscut prin care modelele pot selecta mai frecvent prima entitate numită, indiferent de conținut<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>.

### Adnotare și verificarea calității

Fiecare exemplu BBQ a fost evaluat de adnotatori prin crowdsourcing: cel puțin 5 persoane independente au răspuns la întrebări, iar în dataset-ul final au fost incluse doar exemplele pentru care **minimum 4 din 5 adnotatori au fost de acord cu răspunsul corect** (prin vot)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>. Dacă vreo întrebare nu trecea acest prag, întregul șablon era revizuit și editat<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>. Datorită acestui proces, acuratețea umană pe BBQ este foarte ridicată: adnotatorii individuali răspundeau corect la ~95,7% dintre întrebări, iar cu luarea în considerare a majorității voturilor, acuratețea standardului de aur atinge 99,7%<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>. Coeficientul kappa de concordanță (Krippendorff's alpha) a fost de 0,883, indicând o **concordanță ridicată** între participanți privind răspunsurile corecte<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>. Aceste măsuri confirmă că sarcinile BBQ sunt inteligibile pentru oameni și au răspunsuri obiectiv corecte; prin urmare, erorile modelelor pe aceste exemple pot fi interpretate în mod justificat ca manifestări ale bias-ului, nu ca ambiguitate a întrebărilor.

## Evaluarea prejudecăților modelelor

BBQ este conceput pentru evaluarea multidimensională a comportamentului modelelor în condiții care provoacă bias social. La testare, modelul QA primește la intrare un context și o întrebare, după care trebuie să aleagă una dintre cele trei variante de răspuns. Analiza rezultatelor se realizează pe două niveluri<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>:

### Cazul contextului ambiguu

Se măsoară cât de frecvent modelul răspunde greșit la întrebări în absența informației necesare, adică **se bazează pe stereotip**<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>. În mod ideal, modelul ar trebui să răspundă „necunoscut" la orice întrebare cu context insuficient, însă dacă alege unul dintre grupuri, aceasta este considerată o proiecție a stereotipului internalizat<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>. Frecvența unor astfel de erori și distribuția lor pe categorii oferă o imagine a tendinței modelului de a reproduce stereotipuri dăunătoare.

### Cazul contextului informativ

Se evaluează cât de precis răspunde modelul atunci când contextul conține un răspuns corect explicit<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>. Aici se calculează de obicei metrica standard **accuracy** (procentul răspunsurilor corecte) — arată dacă modelul face față în principiu sarcinii de întrebare-răspuns. Totuși, o atenție deosebită este acordată cazurilor în care răspunsul corect contrazice stereotipul<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>. Dezvoltatorii BBQ analizează dacă acuratețea modelului scade atunci când răspunsul corect contravine unui stereotip înrădăcinat (și, invers, dacă acuratețea este mai ridicată atunci când adevărul coincide cu așteptarea stereotipă)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>. Un astfel de efect ar indica că, chiar și în prezența faptelor, modelul poate comite erori din cauza bias-ului.

### Bias Score

Pentru cuantificarea gradului de prejudecată se introduce o metrică specială — **scorul de prejudecată** (bias score)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>. În linii generale, bias score reflectă procentul răspunsurilor modelului (dintre cele greșite sau dintre toate, în funcție de condiție) care coincid cu stereotipul<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>.

- O valoare de **+100%** ar însemna că modelul a ales în toate cazurile varianta de răspuns care atribuie stereotipic o calitate negativă grupului-țintă.
- **0%** — nicio manifestare de bias (modelul fie răspunde întotdeauna corect/„necunoscut", fie greșește în proporție egală în ambele direcții).
- **Scor negativ** (până la -100%) — tendința opusă, când modelul răspunde mereu împotriva așteptării stereotipului<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>.

Indicatorii sunt calculați separat pentru contextele ambigue și cele neambigue, deoarece natura erorilor este diferită în fiecare caz<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>.

- Pentru **întrebările ambigue**, bias score este determinat de ponderea cazurilor în care modelul, în loc de „necunoscut", a ales un răspuns concret, iar acel răspuns a coincis cu stereotipul negativ<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>. Cu cât astfel de răspunsuri sunt mai frecvente, cu atât scorul pozitiv este mai mare. Totodată, se ia în considerare acuratețea: dacă modelul greșește în proporție egală și răspunde corect („necunoscut"), atunci chiar și la o parte dintre erorile stereotipice scorul va fi mai mic decât al unui model care alege întotdeauna răspunsul stereotip<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>. Astfel, **sunt penalizate atât frecvența, cât și certitudinea răspunsurilor cu bias** (pentru contextele ambigue, metrica este scalată ținând cont de procentul răspunsurilor corecte „necunoscut")<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>.
- Pentru **întrebările neambigue**, bias score se calculează oarecum diferit, deoarece aici răspunsul corect este unul dintre grupuri<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>. În aceste cazuri se urmăresc **răspunsurile greșite** ale modelului: ponderea erorilor în care modelul nu a ales varianta corectă, ci varianta alternativă care coincide cu stereotipul<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>. Cu alte cuvinte, dacă modelul a greșit cedând prejudecății (de exemplu, nu a acordat credit faptelor și a răspuns pe baza stereotipului), acest lucru mărește scorul<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>.

Analiza bias score alături de acuratețea generală permite caracterizarea detaliată a comportamentului modelului pe BBQ. Autorii subliniază că aceleași valori de accuracy pot ascunde tipare de erori diferite<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>. Astfel, acest indicator arată **direcționalitatea erorilor** și relevă cazuri subtile, invizibile prin simpla acuratețe.

## Rezultate și tipare identificate

Testarea inițială a mai multor modele QA populare pe setul BBQ a demonstrat o serie de manifestări clare de bias<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>. În cercetarea Parrish et al. (2022) au fost testate atât modele universale mari (de exemplu, UnifiedQA — un model generalist pentru QA bazat pe T5), cât și modele standardizate de tip multiple-choice (de ex. RoBERTa cu fine-tuning pe QA)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>.

Principalele concluzii din rezultatele experimentelor:

- **Erori stereotipice puternice în condiții de lipsă de informații**. În toate sistemele testate s-a observat tendința de a răspunde în spiritul stereotipului atunci când contextul nu oferea indicii necesare<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>. Cu alte cuvinte, modelele nu alegeau adesea varianta „necunoscut", preferând un răspuns concret corelat cu o așteptare stereotipă sau alta<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>. De exemplu, în întrebările ambigue despre o infracțiune fără un vinovat evident, modelele indicau frecvent persoane dintr-un anumit grup (corespunzând prejudecății)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>. Bias score calculat pentru contextele ambigue a fost semnificativ mai mare decât zero, uneori apropiindu-se de +100% în anumite categorii la unele modele<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>. O predispoziție deosebit de ridicată spre răspunsuri stereotipice au arătat modelele în scenele legate de **aspectul fizic** (obezitate etc.) — această categorie a generat un bias considerabil mai mare decât, de exemplu, rasa sau orientarea sexuală<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>. Aceasta indică neomogenitatea bias-ului în interiorul modelului — unele tipuri de stereotipuri sunt „asimilate" mai puternic decât altele.
- **Îmbunătățire în prezența faptelor, dar menținerea unui bias ascuns**. Atunci când modelele primeau un context neambiguu cu o indicație explicită a răspunsului corect, **acuratețea lor creștea semnificativ** (față de situația de incertitudine)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>. Totuși, analiza detaliată a relevat un efect subtil: acuratețea s-a dovedit a fi **inegală în funcție de relația dintre răspunsul corect și stereotip**<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>. În medie, modelele atingeau o acuratețe cu 3-3,5 puncte procentuale mai ridicată în exemplele în care răspunsul corect coincidea cu stereotipul predominant, față de exemplele în care răspunsul corect contrazicea acel stereotip<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>. Cu alte cuvinte, atunci când faptele confirmau prejudecata, modelele răspundeau aproape fără greșeală; dar dacă era necesar să se numească varianta „atipică" pentru stereotip, probabilitatea de eroare creștea. Această diferență de performanță, deși nu uriașă, s-a manifestat statistic în multe categorii<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>. Cea mai mare discrepanță a fost înregistrată pentru întrebările legate de stereotipurile de gen: până la 5 puncte procentuale diferență<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>. Astfel, **influența ascunsă a bias-ului** este perceptibilă: modelele funcționează în medie ușor mai slab „împotriva stereotipului".
- **Compararea categoriilor și șabloanelor**. Cercetătorii BBQ au analizat bias score împărțit pe toate cele nouă categorii și au constatat că în contextele ambigue indicatorul este pozitiv în toate categoriile, însă magnitudinea sa variază<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>. Cum s-a menționat, bias-urile maxime au fost observate în categoriile aspectul fizic, statut socioeconomic și unele intersecționale<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>. Scoruri de bias „mai mici", deși și ele nenule, au fost înregistrate pentru categoriile rasă/etnie și orientare sexuală<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>. În contextele neambigue, bias score este în general mai aproape de zero (deoarece modelul răspunde adesea corect), dar rămâne totuși pozitiv pentru unele șabloane, reflectând o distorsiune notabilă în tiparul erorilor comise<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>. De exemplu, în categoria religie, majoritatea erorilor au mers într-o singură direcție — modelele, atunci când greșeau, alegeau de regulă răspunsul bazat pe prejudecată<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>.

În ansamblu, BBQ a demonstrat că inclusiv modelele lingvistice moderne puternice **nu sunt în mod evident libere de prejudecăți sociale**<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>. Ele tind să reproducă stereotipuri atunci când sunt plasate în condiții de incertitudine și pot manifesta bias subtil chiar și în prezența faptelor care impun răspunsul opus<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>. Totodată, magnitudinea acestor efecte nu este uniformă pentru diferite grupuri: unele stereotipuri sunt „asimilate" mai puternic de model<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>. Autorii BBQ subliniază că diferențele identificate, deși perceptibile, nu sunt catastrofal de mari — bias score al majorității modelelor nu atinge valori extreme, aflându-se adesea în domeniul câtorva zeci de procente<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-bbq-main-1)</sup>. Cu toate acestea, chiar și devierile sistematice mici în direcția stereotipurilor sunt potențial periculoase la utilizarea la scară largă a LLM-urilor, de aceea identificarea și eliminarea unor astfel de bias-uri reprezintă o sarcină importantă<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-evaluating-mitigating-3)</sup>. BBQ a oferit cercetătorilor o modalitate clară și cuantificabilă de a urmări progresul în acest domeniu<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-evaluating-mitigating-3)</sup>.

## Influență și cercetări ulterioare

Setul BBQ a dobândit rapid recunoaștere ca instrument standard pentru evaluarea caracteristicilor de fairness ale modelelor lingvistice<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-paperswithcode-bbq-4)</sup>. **Codul sursă și datele deschise** sunt disponibile în repository (licența CC BY 4.0)<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-paperswithcode-bbq-4)</sup>, ceea ce a permis unui public larg de cercetători să utilizeze BBQ la dezvoltarea și testarea de noi modele. În mai multe recenzii, BBQ este menționat alături de alte benchmark-uri (de exemplu, StereoSet, WinoBias, ToxiGen) ca o etapă importantă în studiul bias-ului social în NLP<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-evaluating-mitigating-3)</sup>. De la publicarea BBQ au apărut lucrări care dezvoltă ideile sale și le adaptează la noi condiții:

- **Extinderea formatelor de întrebări (Open-BBQ)**. BBQ original propune sarcini în format cu alegere multiplă<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-evaluating-mitigating-3)</sup>. În 2024 a fost propusă o modificare a BBQ pentru **răspunsuri deschise**, incluzând sarcini de completare a spațiilor libere și text de răspuns scurt<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-evaluating-mitigating-3)</sup>. Această versiune, numită convențional Open-BBQ, permite evaluarea bias-ului în condiții de dialog mai libere, în care modelul nu are variante de răspuns fixe<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-evaluating-mitigating-3)</sup>. Cercetarea a arătat că LLM-urile, la generarea de text liber, manifestă de asemenea un bias sporit față de anumite grupuri<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-evaluating-mitigating-3)</sup>. Autorii Open-BBQ au experimentat și cu metode de atenuare a prejudecăților, combinând prompturi zero-shot și few-shot cu chain-of-thought (raționament pas cu pas)<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-evaluating-mitigating-3)</sup>. Aceste metode au permis reducerea semnificativă a nivelului de bias din răspunsuri<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-evaluating-mitigating-3)</sup>. Open-BBQ a completat setul original, făcând posibilă testarea modelelor generative în formate mai apropiate de solicitările utilizatorilor.

<!-- -->

- **Adaptare culturală (localizare)**. Deoarece BBQ este ancorat în realitățile sociale ale SUA, cercetătorii au manifestat interes pentru adaptarea sa la alte limbi și culturi<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-kobbg-5)</sup>. În 2023, cercetători coreeni au prezentat dataset-ul **KoBBQ** (Korean BBQ) — analogul coreean al Bias Benchmark<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-kobbg-5)</sup>. Aceștia au dezvoltat o abordare generală de localizare a BBQ: au împărțit șabloanele originale în trei categorii — cele care pot fi pur și simplu traduse, cele care necesită înlocuirea grupurilor cu echivalente locale și cele care nu sunt aplicabile deloc în contextul coreean<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-kobbg-5)</sup>. Suplimentar, KoBBQ a introdus 4 categorii noi de stereotipuri specifice societății coreene și a eliminat o serie de exemple necorespunzătoare<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-kobbg-5)</sup>. Ca rezultat, a fost obținut un set de 268 de șabloane și 76.048 de exemple în limba coreeană, acoperind 12 categorii de bias social (inclusiv cele originale și cele noi)<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-kobbg-5)</sup>. Testarea modelelor multilingve pe KoBBQ a relevat diferențe semnificative ale nivelului de prejudecată față de traducerea automată directă a BBQ original în coreeană<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-kobbg-5)</sup>. Aceasta subliniază că **traducerea directă este insuficientă** — sunt necesare benchmark-uri specifice fiecărei culturi, care să țină cont de stereotipurile și contextul unic al fiecărei țări<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-kobbg-5)</sup>. Lucrarea privind KoBBQ a demonstrat posibilitatea scalării globale a metodologiei BBQ.

BBQ a devenit o parte integrantă a cercetărilor privind **etica inteligenței artificiale**<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-evaluating-mitigating-3)</sup>. Influența sa se regăsește în apariția unor noi metode de debiasing al modelelor, de construire a unor dataset-uri mai incluzive și a unor metrici pentru analiza fină a bias-ului. Cercetătorii notează că una dintre punctele forte ale BBQ este amploarea acoperirii și rigoarea construcției exemplelor<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-evaluating-mitigating-3)</sup>. Ca răspuns la provocările semnalate de BBQ, în ultimul timp sunt dezvoltate activ **strategii de reducere a bias-ului** — de la filtrarea datelor de antrenament până la algoritmi speciali de postprocesare și ajustarea LLM-urilor pentru răspunsuri echitabile<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-evaluating-mitigating-3)</sup>.

În concluzie, BBQ (Bias Benchmark for QA) s-a afirmat ca un instrument valoros și fiabil pentru măsurarea prejudecăților sociale în modelele lingvistice. El oferă comunității de cercetare un set standard de verificări care permite compararea modelelor din perspectiva stereotipurilor și urmărirea progresului în îmbunătățirea imparțialității acestora<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-evaluating-mitigating-3)</sup>. BBQ continuă să se extindă și să se adapteze, reflectând interesul global pentru crearea unor **sisteme AI mai echitabile și mai sigure**<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_note-arxiv-evaluating-mitigating-3)</sup>, libere de bias-uri dăunătoare subtile, dar semnificative.

## Referințe

- Articolul original BBQ (arXiv)
- Repository-ul BBQ pe GitHub
- Pagina dataset-ului BBQ pe Papers With Code
- Articolul BBQ pe ACL Anthology
- Articolul despre dataset-ul KoBBQ (arXiv)
- Articolul despre dataset-ul Open-BBQ (arXiv)

## Bibliografie

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## Note

1.  <span id="cite_note-arxiv-bbq-main-1">↑ <sup>[1.00](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-11)</sup> <sup>[1.12](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-12)</sup> <sup>[1.13](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-13)</sup> <sup>[1.14](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-14)</sup> <sup>[1.15](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-15)</sup> <sup>[1.16](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-16)</sup> <sup>[1.17](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-17)</sup> <sup>[1.18](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-18)</sup> <sup>[1.19](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-19)</sup> <sup>[1.20](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-20)</sup> <sup>[1.21](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-21)</sup> <sup>[1.22](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-22)</sup> <sup>[1.23](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-23)</sup> <sup>[1.24](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-24)</sup> <sup>[1.25](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-25)</sup> <sup>[1.26](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-26)</sup> <sup>[1.27](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-27)</sup> <sup>[1.28](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-28)</sup> <sup>[1.29](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-29)</sup> <sup>[1.30](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-30)</sup> <sup>[1.31](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-31)</sup> <sup>[1.32](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-32)</sup> <sup>[1.33](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-33)</sup> <sup>[1.34](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-34)</sup> <sup>[1.35](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-35)</sup> <sup>[1.36](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-36)</sup> <sup>[1.37](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-37)</sup> <sup>[1.38](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-38)</sup> <sup>[1.39](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-39)</sup> <sup>[1.40](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-40)</sup> <sup>[1.41](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-41)</sup> <sup>[1.42](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-42)</sup> <sup>[1.43](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-43)</sup> <sup>[1.44](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-44)</sup> <sup>[1.45](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-45)</sup> <sup>[1.46](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-46)</sup> <sup>[1.47](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-47)</sup> <sup>[1.48](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-48)</sup> <sup>[1.49](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-49)</sup> <sup>[1.50](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-50)</sup> <sup>[1.51](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-51)</sup> <sup>[1.52](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-52)</sup> <sup>[1.53](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-53)</sup> <sup>[1.54](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-54)</sup> <sup>[1.55](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-55)</sup> <sup>[1.56](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-56)</sup> <sup>[1.57](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-57)</sup> <sup>[1.58](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-58)</sup> <sup>[1.59](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-59)</sup> <sup>[1.60](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-60)</sup> <sup>[1.61](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-61)</sup> <sup>[1.62](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-62)</sup> <sup>[1.63](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-63)</sup> <sup>[1.64](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-64)</sup> <sup>[1.65](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-65)</sup> <sup>[1.66](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-66)</sup> <sup>[1.67](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-67)</sup> <sup>[1.68](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-68)</sup> <sup>[1.69](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-69)</sup> <sup>[1.70](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-70)</sup> <sup>[1.71](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-71)</sup> <sup>[1.72](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-72)</sup> <sup>[1.73](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-73)</sup> <sup>[1.74](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-74)</sup> <sup>[1.75](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-75)</sup> <sup>[1.76](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-76)</sup> <sup>[1.77](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-77)</sup> <sup>[1.78](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-78)</sup> <sup>[1.79](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-79)</sup> <sup>[1.80](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-bbq-main_1-80)</sup> Parrish A. et al. «BBQ: A Hand-Built Bias Benchmark for Question Answering». *arXiv*. <a href="https://arxiv.org/abs/2110.08193" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-acl-anthology-2">[↑](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-acl-anthology_2-0) Parrish A. et al. «BBQ: A hand-built bias benchmark for question answering». *ACL Anthology*. <a href="https://aclanthology.org/2022.findings-acl.165/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-arxiv-evaluating-mitigating-3">↑ <sup>[3.00](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-evaluating-mitigating_3-0)</sup> <sup>[3.01](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-evaluating-mitigating_3-1)</sup> <sup>[3.02](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-evaluating-mitigating_3-2)</sup> <sup>[3.03](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-evaluating-mitigating_3-3)</sup> <sup>[3.04](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-evaluating-mitigating_3-4)</sup> <sup>[3.05](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-evaluating-mitigating_3-5)</sup> <sup>[3.06](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-evaluating-mitigating_3-6)</sup> <sup>[3.07](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-evaluating-mitigating_3-7)</sup> <sup>[3.08](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-evaluating-mitigating_3-8)</sup> <sup>[3.09](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-evaluating-mitigating_3-9)</sup> <sup>[3.10](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-evaluating-mitigating_3-10)</sup> <sup>[3.11](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-evaluating-mitigating_3-11)</sup> <sup>[3.12](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-evaluating-mitigating_3-12)</sup> <sup>[3.13](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-evaluating-mitigating_3-13)</sup> <sup>[3.14](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-evaluating-mitigating_3-14)</sup> <sup>[3.15](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-evaluating-mitigating_3-15)</sup> Liu Z. et al. (2024). «Evaluating and Mitigating Social Bias for Large Language Models in Open-ended Settings». *arXiv preprint*. <a href="https://arxiv.org/html/2412.06134v1" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-paperswithcode-bbq-4">↑ <sup>[4.0](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-paperswithcode-bbq_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-paperswithcode-bbq_4-1)</sup> <sup>[4.2](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-paperswithcode-bbq_4-2)</sup> <sup>[4.3](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-paperswithcode-bbq_4-3)</sup> <sup>[4.4](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-paperswithcode-bbq_4-4)</sup> <sup>[4.5](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-paperswithcode-bbq_4-5)</sup> «BBQ Dataset». *Papers With Code*. <a href="https://paperswithcode.com/dataset/bbq" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-arxiv-kobbg-5">↑ <sup>[5.0](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-kobbg_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-kobbg_5-1)</sup> <sup>[5.2](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-kobbg_5-2)</sup> <sup>[5.3](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-kobbg_5-3)</sup> <sup>[5.4](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-kobbg_5-4)</sup> <sup>[5.5](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-kobbg_5-5)</sup> <sup>[5.6](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(RO)#cite_ref-arxiv-kobbg_5-6)</sup> Jin J. et al. (2024). «KoBBQ: Korean Bias Benchmark for Question Answering». *arXiv preprint*. <a href="https://arxiv.org/abs/2307.16778" class="external autonumber" rel="nofollow">[5]</a></span>
