---
title: "BBQ (Bias Benchmark for Question Answering) (BG)"
source: "https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)"
wiki: "systems-analysis.info/int"
article: "BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)"
language: "bg"
categories:
  - "Category:Bulgarian"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 513
wiki_created_at: 2026-09-06T22:34:50Z
wiki_modified_at: 2026-09-06T22:34:50Z
downloaded_at: 2026-09-07T22:40:37Z
---

# BBQ (Bias Benchmark for Question Answering) (BG)

**BBQ** (Bias Benchmark for Question Answering) — това е **набор от данни** за оценка на **социалните предразсъдъци** (bias) в системи от тип въпрос-отговор (QA)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>. Той е разработен от група изследователи на Нюйоркския университет под ръководството на Алиша Париш (Alicia Parrish) и публикуван през 2022 година на конференцията ACL Findings<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)[\[2\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-acl-anthology-2)</sup>. Целта на BBQ е да установи как големите езикови модели (ГЕМ) и другите QA-модели проявяват стереотипи и предубеждения в отговорите си на въпроси, особено в приложните задачи за отговаряне на въпроси на естествен език<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>. BBQ се превърна в един от най-всеобхватните benchmark-ове за оценка на социалния bias в NLP, обхващащ широк спектър от стереотипи в рамките на девет социални категории<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-evaluating-mitigating-3)</sup>.

Този набор от данни допълва предишни работи, като например dataset-а UnQover (2020), който измерваше предубедеността по ограничен брой признаци (пол-професия, националност, етническа принадлежност, религия) и се основаваше на вероятностите на моделите, а не на самите отговори<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-evaluating-mitigating-3)</sup>. За разлика от UnQover, BBQ директно анализира съдържанието на отговорите на моделите и техния избор сред предложените опции, което позволява оценяване на предубедеността именно на ниво генерирани резултати<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>.

Авторите на BBQ го позиционират като инструмент за диагностициране на **вредни социални стереотипи** в моделите и за намаляване на риска от негативното влияние на такива стереотипи върху уязвими групи от населението<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>. Наборът е съсредоточен върху стереотипи, актуални за англоезичната култура на САЩ, и не обхваща всички възможни културни контексти<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>. Въпреки това BBQ постави основите за последващи работи по измерване и смекчаване на социалния bias в NLP и се превърна в ориентир при сравняване на модели по отношение на тяхната етична коректност.

## Състав и структура на набора от данни

BBQ съдържа около **58,5 хиляди въпроса и отговора**, групирани в специални набори, насочени към разкриване на конкретни стереотипи<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-paperswithcode-bbq-4)</sup>. Всички примери са **ръчно** съставени от авторите въз основа на документирани случаи на предубеждения и стереотипи, наносящи вреда на представители на различни социални групи<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-paperswithcode-bbq-4)</sup>. При създаването на сценариите са използвани данни от научни изследвания, статии в медиите, доклади и други надеждни източници, потвърждаващи съществуването на даден стереотип и вредните му последствия<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>. За всяка ситуация авторите посочват препратка към източник, в който даденият стереотип е описан като негативен или вреден (например научна статия или новинарска бележка)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>.

### Социални категории

BBQ обхваща **девет основни социално значими категории** (в по-голямата си част съответстващи на защитени групи по определението на Комисията за равни възможности при заетостта на САЩ)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>:

- **Възраст** – предубеждения спрямо възрастови групи (например стереотипът за намаляване на когнитивните способности при по-възрастните хора)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>.
- **Увреждания** – стереотипи за умствените способности или други качества на хора с увреждания (например представата, че физически ограничените лица са по-малко интелектуално компетентни)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>.
- **Полова идентичност** – полови стереотипи (например идеята, че „момичетата се справят зле с математиката")<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>.
- **Националност** – национално-етнически предубеждения (например стереотипът за технологична неграмотност на хора с произход от Африка)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>.
- **Външен вид** – дискриминация въз основа на външния вид, телосложението (например мнението, че хората с затлъстяване са по-малко умни или трудолюбиви)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>.
- **Раса/етническа принадлежност** – расови стереотипи (например предубеденото свързване на определена раса с престъпност или наркомания)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>.
- **Религия** – религиозни стереотипи (например представата за евреите като скъперници, за мюсюлманите като склонни към насилие и т.н.)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>.
- **Социално-икономически статус** – предубеждения спрямо бедните или богатите слоеве на обществото (например убеждението, че хората от бедни семейства ще бъдат лоши родители)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>.
- **Сексуална ориентация** – хомофобски стереотипи (например фалшивата асоциация на хомосексуалността с ХИВ-инфекция)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>.

Освен тези девет категории, в BBQ са представени две **интерсекционални категории** (intersectional biases), обединяващи два признака едновременно: (1) пол в съчетание с раса/етничност и (2) социално-икономически статус в съчетание с раса<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>. Тези случаи отчитат стереотипи на пресечната точка на различни групи (например предубеждения конкретно срещу чернокожи жени или срещу определени етноси от нисш социален клас).

### Шаблони и генериране на примери

За всяка категория екипът е написал **шаблони на сценарии** — кратки зарисовки, в които фигурират два персонажа, различаващи се по целевия признак (например млад и възрастен, мъж и жена, богат и беден и т.н.)<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-paperswithcode-bbq-4)</sup>. В шаблона е заложена ситуация, която би могла да потвърди или опровергае известен стереотип. Към всеки сценарий са прикрепени въпроси и варианти за отговор.

Общо са разработени по 25 уникални шаблона за всяка от деветте основни категории, плюс по 25 допълнителни шаблона за категориите раса и пол с използване на реални имена (за да се провери bias на ниво собствени имена)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>. Също така за двете интерсекционални направления са създадени по 25 шаблона<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>. По този начин общият брой на базовите сценарии надхвърля 300.

Всеки шаблон съдържа специални **слотове за променливи** — названия на групи или описания, — които се подставят в текста (например в шаблона по възраст вместо „\_годишен човек" се подставят различни числа, или при външния вид — прилагателни „пълен"/„слаб" и т.н.)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>. Чрез подставяне на различни стойности и разбъркване на реда на споменаване на двете фигури, всеки шаблон се разширява до множество конкретни примери (минимум 8 и до ~200 вариации)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>. По правило от един шаблон се генерират не по-малко от 100 финални въпроса, а в някои случаи — до двеста<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>. В сбор се получава корпус от 58 492 примера (уникални комбинации от сценарий, въпрос и отговор)<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-paperswithcode-bbq-4)</sup>.

### Контексти и типове въпроси

Ключова особеност на BBQ е, че всяка ситуация е представена с два варианта на контекст и две формулировки на въпроса, образувайки набор от **четири въпроса** (така нареченият клъстер от 4)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>. Това е направено, за да се отдели влиянието на липсата на информация от собствените стереотипи на модела. Във всеки квартет<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>:

- **Неопределен контекст** (under-informative or ambiguous context): текст, в който е описана ситуация с участието на две лица от различни групи, но не се съдържа достатъчно информация, за да се отговори еднозначно на поставения въпрос<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>. Правилният отговор в подобни случаи е винаги вариантът „неизвестно" (т.е. липса на достатъчно данни)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>. Тези примери са необходими, за да се провери дали моделът няма да прави извод, опирайки се на стереотип.
- **Еднозначен контекст** (disambiguated context): разширен сценарий, в който е добавена уточняваща подробност, позволяваща да се определи кое от двете споменати лица отговаря на въпроса<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>. В този случай единият от двамата персонажи заведомо е правилният отговор (а вариантът „неизвестно" вече е грешен). Еднозначният контекст служи за проверка дали моделът ще успее да преодолее евентуалния си bias и да избере верния отговор, дори ако стереотипът подсказва обратното<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>.
- **Негативен въпрос** (напр. „Кой от тях не познава добре предмета?", „Кой е извършил престъплението?")<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>. Такъв въпрос в съчетание с неопределен контекст проверява дали моделът е склонен да свързва негативното действие с определена група при липса на факти<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>.
- **Ненегативен (контрастен) въпрос** (напр. „Кой от тях познава добре предмета?" или „Кой се въздържа от лошата постъпка?")<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>. Ненегативният въпрос е формулиран така, че да не звучи като пряко одобрение на стереотипа, но същевременно да позволява проверка на баланса в отговорите на модела<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>. Сравнението на отговорите на негативните и неутралните версии разкрива систематични отклонения.

Всеки от тези четири примера в клъстера има **три варианта за отговор**: два конкретни (назоваващи всяка от двете фигуриращи групи) и един вариант, указващ липса на достатъчна информация (обозначен като „Unknown" и еквивалентни изрази)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>. Например в сцена, в която участват условен християнин и мюсюлманин, вариантите за отговор ще бъдат: „християнин", „мюсюлманин" или „неизвестно"<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>. При това думата „неизвестно" не е винаги едно и също — използват се 10 синонимни изрази<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>.

Освен това, в всеки шаблон автоматично се сменя **редът на споменаване на двете групи**<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>. Това е направено за неутрализиране на **ефекта на позицията** — известен фактор, при който моделите могат по-често да избират първата спомената единица независимо от съдържанието<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>.

### Анотиране и проверка на качеството

Всеки пример от BBQ е оценен от краудсорсингови анотатори: не по-малко от 5 независими лица отговаряха на въпросите, като в крайния dataset се включваха само онези примери, по които **минимум 4 от 5 анотатори са се съгласили с правилния отговор** (чрез гласуване)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>. Ако даден въпрос не преминаваше този праг, целият шаблон биваше преразглеждан и редактиран<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>. Благодарение на този процес човешката точност при BBQ е много висока: отделните анотатори отговаряха правилно на ~95,7% от въпросите, а като се вземе предвид мнозинството от гласовете, точността на златния стандарт достига 99,7%<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>. Коефициентът на съгласие Krippendorff's alpha е 0,883, което указва **висока съгласуваност** между хората относно правилните отговори<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>. Тези мерки потвърждават, че задачите в BBQ са разбираеми за хората и имат обективно верни отговори; следователно грешките на моделите по тези примери могат основателно да се интерпретират като проявления на bias, а не като неяснота на самите въпроси.

## Оценка на предубедеността на моделите

BBQ е разработен за многоаспектна оценка на поведението на моделите в условия, провокиращи социален bias. При тестване QA-моделът получава на входа контекст и въпрос, след което трябва да избере един от трите варианта за отговор. Анализът на резултатите се провежда на две нива<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>:

### Случай на неопределен контекст

Измерва се колко често моделът отговаря неправилно на въпросите при липса на необходимата информация, т.е. **разчита на стереотип**<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>. В идеалния случай моделът трябва да отговори „неизвестно" на всеки въпрос с недостатъчен контекст, но ако е избрал една от групите, това се приема като проекция на заложения стереотип<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>. Честотата на такива грешки и тяхното разпределение по категории дават представа за склонността на модела да възпроизвежда вредни стереотипи.

### Случай на информативен контекст

Оценява се колко точно моделът отговаря, когато контекстът съдържа явен правилен отговор<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>. Тук обикновено се изчислява стандартната метрика **accuracy** (процент правилни отговори) — показва дали моделът се справя с въпросно-отговорната задача по принцип. Специално внимание обаче се обръща на случаите, в които правилният отговор противоречи на стереотипа<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>. Разработчиците на BBQ анализират дали точността на модела ще спадне, ако верният отговор противоречи на утвърден стереотип (и обратно — дали точността ще е по-висока, когато истината съвпада със стереотипното очакване)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>. Такъв ефект би указвал, че дори при наличие на факти моделът може да допуска грешки поради bias.

### Bias Score

За количествена оценка на степента на предубеденост се въвежда специална метрика — **показател за предубеденост** (bias score)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>. В общ вид bias score отразява процента от отговорите на модела (сред неверните или всички, в зависимост от условието), които съвпадат със стереотипа<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>.

- Стойност **+100%** би означавала, че моделът е избрал стереотипно приписващия негативно качество на целевата група вариант на отговор във всички случаи.
- **0%** — никакви прояви на bias (моделът или винаги отговаря правилно/„неизвестно", или греши поравно в двете посоки).
- **Отрицателен score** (до -100%) — противоположна тенденция, при която моделът винаги отговаря срещу очакването на стереотипа<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>.

Показателите се изчисляват отделно за неопределени и еднозначни контексти, тъй като характерът на грешките в тях е различен<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>.

- За **неопределените въпроси** bias score се определя от дела на случаите, при които моделът вместо „неизвестно" е избрал конкретен отговор, и при това този отговор е съвпаднал с негативния стереотип<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>. Колкото по-чести са такива отговори, толкова по-висок е положителният score. При това се отчита точността: ако моделът греши поравно и отговаря вярно („неизвестно"), тогава дори при наличие на стереотипни грешки score-ът ще е по-нисък, отколкото при модел, който винаги избира стереотипния отговор<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>. По този начин **се наказват и честотата, и увереността на bias-отговорите** (за неопределени контексти метриката се мащабира с отчитане на процента правилни отговори „неизвестно")<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>.
- За **еднозначните въпроси** bias score се изчислява малко по-различно, тъй като тук правилният отговор е една от групите<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>. В тези случаи се разглеждат **грешните отговори** на модела: делът на грешките, при които моделът е избрал не верния вариант, а алтернативния вариант, съвпадащ със стереотипа<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>. С други думи, ако моделът е сгрешил, давайки предпочитание на предубеждението (например не е повярвал на фактите и е отговорил по стереотипа), това увеличава score-а<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>.

Анализът на bias score наред с общата точност позволява детайлно охарактеризиране на поведението на модела при BBQ. Авторите посочват, че еднаква accuracy може да крие различен характер на грешките<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>. По този начин даденият показател разкрива **насочеността на грешките** и идентифицира тънки случаи, невидими само по точността.

## Резултати и установени закономерности

Първоначалното тестване на няколко популярни QA-модела на набора BBQ демонстрира редица отчетливи прояви на bias<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>. В изследването на Parrish и др. (2022) са тествани както големи универсални модели (например UnifiedQA — обобщен модел за QA на базата на T5), така и стандартизирани модели за multiple-choice (напр. RoBERTa с дообучение за QA)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>.

Основни изводи от резултатите на експериментите:

- **Силни стереотипни грешки при липса на информация**. Във всички тествани системи се наблюдаваше тенденция да се отговаря в духа на стереотипа, когато контекстът не предоставяше необходимите указания<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>. С други думи, моделите често не избираха вариант „неизвестно", а предпочитаха конкретен отговор, съответстващ на едно или друго стереотипно очакване<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>. Например в неопределени въпроси за престъпление без явен виновник моделите нерядко посочваха лица от определена група (съответстваща на предубеждението)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>. Изчисленият bias score за ambiguous контексти се оказа значително по-висок от нула, а понякога се доближаваше до +100% в отделни категории при някои модели<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>. Особено висока склонност към стереотипни отговори показаха моделите в сцени, свързани с **външния вид** (затлъстяване и др.) — тази категория даде забележимо по-голям bias в сравнение например с раса или сексуална ориентация<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>. Това говори за нееднородност на bias в рамките на модела — едни видове стереотипи са „усвоени" от него по-силно от другите.
- **Подобрение при наличие на факти, но запазване на скрит bias**. Когато моделите получаваха еднозначен контекст с явно указание за правилния отговор, тяхната **точност нарастваше забележимо** (в сравнение с ситуацията на неизвестност)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>. Детайлният анализ обаче разкри тънък ефект: точността се оказа **неравномерна в зависимост от отношението на правилния отговор към стереотипа**<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>. Средно моделите постигаха с 3-3,5 процентни пункта по-висока точност в онези примери, при които правилният отговор съвпадаше с разпространения стереотип, в сравнение с примерите, в които верният отговор на стереотипа противоречеше<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>. С други думи, когато фактите потвърждаваха предубеждението, моделите почти безгрешно даваха отговор; но когато се изискваше да бъде посочен „нетипичен" за стереотипа вариант, вероятността от грешка нарастваше. Тази разлика в производителността, макар и да не е огромна, се проявяваше статистически в много категории<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>. Най-голямото разминаване е фиксирано при въпроси, свързани с полови стереотипи: до 5 процентни пункта разлика<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>. По този начин **скритото влияние на bias** се проследява: моделите средно работят малко по-слабо „срещу стереотипа".
- **Сравнение на категории и шаблони**. Изследователите на BBQ анализираха bias score в разбивка по всичките девет категории и установиха, че при неопределени контексти показателят е положителен във всички категории, но неговата величина варира<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>. Както беше споменато, максималните bias са отчетени в категориите физически външен вид, социално-икономически статус и някои интерсекционални<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>. По-„ниски", макар и ненулеви, bias score са характерни за категориите раса/етничност и сексуална ориентация<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>. При еднозначни контексти bias score като цяло е по-близо до нула (тъй като моделът отговаря правилно по-често), но все пак за някои шаблони остава положителен, отразявайки забележим перекос в характера на допуснатите грешки<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>. Например в категорията религия повечето грешки бяха в едната посока — моделите, като правило, при грешка избираха отговор въз основа на предубеждение<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>.

В общи линии BBQ демонстрира, че дори силните съвременни езикови модели **очевидно не са свободни от социални предразсъдъци**<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>. Те са склонни да възпроизвеждат стереотипи, ако са поставени в условия на неопределеност, и могат да проявяват тънки bias дори при наличие на факти, изискващи противоположен отговор<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>. При това величината на тези ефекти не е еднаква за различните групи: някои стереотипи са „усвоени" от модела по-силно<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>. Авторите на BBQ подчертават, че установените различия, макар и забележими, не са катастрофално големи — bias score на повечето модели не достигат екстремни стойности, а нерядко се намират в диапазона от няколко десетки процента<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-bbq-main-1)</sup>. Въпреки това дори малки систематични отклонения в посока на стереотипите са потенциално опасни при мащабното използване на ГЕМ, поэтому установяването и отстраняването на такива bias е важна задача<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-evaluating-mitigating-3)</sup>. BBQ предостави на изследователите ясен и количествено измерим начин за проследяване на напредъка в тази област<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-evaluating-mitigating-3)</sup>.

## Влияние и по-нататъшни изследвания

Наборът BBQ бързо получи признание като стандартен инструмент за оценка на характеристиките за fairness на езиковите модели<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-paperswithcode-bbq-4)</sup>. Неговият **отворен изходен код и данни** са достъпни в хранилището (лиценз CC BY 4.0)<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-paperswithcode-bbq-4)</sup>, което позволи на широката изследователска аудитория да прилага BBQ при разработката и тестването на нови модели. В редица прегледи BBQ се споменава наред с други benchmark-ове (например StereoSet, WinoBias, ToxiGen) като важна крайъгълна точка в изучаването на социалния bias в NLP<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-evaluating-mitigating-3)</sup>. След публикуването на BBQ се появиха работи, развиващи неговите идеи и адаптиращи ги към нови условия:

- **Разширяване на форматите на въпросите (Open-BBQ)**. Оригиналният BBQ предлага задачи в multiple-choice формат<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-evaluating-mitigating-3)</sup>. През 2024 година беше предложена модификация на BBQ за **отворени отговори**, включваща задачи за попълване на пропуски и кратък отговорен текст<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-evaluating-mitigating-3)</sup>. Тази версия, условно наречена Open-BBQ, позволява оценяване на bias в по-свободни условия на диалог, при които моделът не разполага с фиксирани варианти за отговор<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-evaluating-mitigating-3)</sup>. Изследването показа, че ГЕМ при генериране на свободен текст също демонстрират повишен bias срещу редица групи<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-evaluating-mitigating-3)</sup>. Авторите на Open-BBQ също така експериментираха с методи за смекчаване на предубедеността, комбинирайки zero-shot и few-shot подсказки и chain-of-thought (поетапни разсъждения)<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-evaluating-mitigating-3)</sup>. Тези методи позволиха забележимо намаляване на нивото на bias в отговорите<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-evaluating-mitigating-3)</sup>. Open-BBQ допълни оригиналния набор, като направи възможно тестването на генеративни модели във формати, по-близки до потребителските заявки.

<!-- -->

- **Културна адаптация (локализация)**. Тъй като BBQ е обвързан с обществените реалности на САЩ, изследователите проявиха интерес към адаптацията му за други езици и култури<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-kobbg-5)</sup>. През 2023 година корейски учени представиха dataset-а **KoBBQ** (Korean BBQ) — корейски аналог на Bias Benchmark<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-kobbg-5)</sup>. Те разработиха общ подход за локализация на BBQ: разделиха изходните шаблони на три категории — такива, които могат просто да се преведат, такива, които изискват замяна на групите с местни еквиваленти, и такива, които изобщо не са приложими в корейски контекст<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-kobbg-5)</sup>. Допълнително KoBBQ въведе 4 нови категории стереотипи, специфични за корейското общество, и премахна редица неподходящи примери<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-kobbg-5)</sup>. В резултат се получи набор от 268 шаблона и 76 048 примера на корейски език, обхващащ 12 категории социален bias (включително оригиналните и новите)<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-kobbg-5)</sup>. Тестването на мултиезичните модели върху KoBBQ разкри значителни различия в нивото на предубеденост в сравнение с прякото машинно превеждане на оригиналния BBQ на корейски<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-kobbg-5)</sup>. Това подчертава, че **прякото превеждане не е достатъчно** — необходими са културно-специфични benchmark-ове, отчитащи уникалните стереотипи и контекста на всяка страна<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-kobbg-5)</sup>. Работата по KoBBQ демонстрира възможността за мащабиране на методологията на BBQ в глобален мащаб.

BBQ се превърна в неотделима част от изследванията в областта на **етичността на изкуствения интелект**<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-evaluating-mitigating-3)</sup>. Неговото влияние се проследява в появата на нови методики за дебайсиране на моделите, изграждане на по-инклузивни dataset-и и метрики за фин анализ на bias. Изследователите отбелязват, че едно от силните страни на BBQ е широтата на обхвата и щателността на конструкцията на примерите<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-evaluating-mitigating-3)</sup>. В отговор на предизвикателствата, очертани от BBQ, напоследък активно се разработват **стратегии за намаляване на bias** — от филтриране на обучителните данни до специални алгоритми за постобработка и настройка на ГЕМ за справедливи отговори<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-evaluating-mitigating-3)</sup>.

В заключение, BBQ (Bias Benchmark for QA) се утвърди като ценен и надежден инструмент за измерване на социалните предразсъдъци в езиковите модели. Той предоставя на изследователската общност стандартен набор от проверки, позволяващ сравняване на модели по отношение на стереотипността и проследяване на напредъка в подобряването на тяхната безпристрастност<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-evaluating-mitigating-3)</sup>. BBQ продължава да се разширява и адаптира, отразявайки глобалния интерес към създаването на по-**справедливи и безопасни AI системи**<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_note-arxiv-evaluating-mitigating-3)</sup>, свободни от незабележими, но съществени вредни bias.

## Препратки

- Оригинална статия BBQ (arXiv)
- Хранилище BBQ в GitHub
- Страница на dataset-а BBQ в Papers With Code
- Статия BBQ в ACL Anthology
- Статия за dataset-а KoBBQ (arXiv)
- Статия за dataset-а Open-BBQ (arXiv)

## Литература

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## Бележки

1.  <span id="cite_note-arxiv-bbq-main-1">↑ <sup>[1.00](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-11)</sup> <sup>[1.12](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-12)</sup> <sup>[1.13](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-13)</sup> <sup>[1.14](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-14)</sup> <sup>[1.15](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-15)</sup> <sup>[1.16](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-16)</sup> <sup>[1.17](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-17)</sup> <sup>[1.18](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-18)</sup> <sup>[1.19](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-19)</sup> <sup>[1.20](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-20)</sup> <sup>[1.21](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-21)</sup> <sup>[1.22](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-22)</sup> <sup>[1.23](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-23)</sup> <sup>[1.24](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-24)</sup> <sup>[1.25](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-25)</sup> <sup>[1.26](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-26)</sup> <sup>[1.27](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-27)</sup> <sup>[1.28](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-28)</sup> <sup>[1.29](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-29)</sup> <sup>[1.30](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-30)</sup> <sup>[1.31](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-31)</sup> <sup>[1.32](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-32)</sup> <sup>[1.33](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-33)</sup> <sup>[1.34](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-34)</sup> <sup>[1.35](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-35)</sup> <sup>[1.36](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-36)</sup> <sup>[1.37](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-37)</sup> <sup>[1.38](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-38)</sup> <sup>[1.39](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-39)</sup> <sup>[1.40](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-40)</sup> <sup>[1.41](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-41)</sup> <sup>[1.42](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-42)</sup> <sup>[1.43](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-43)</sup> <sup>[1.44](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-44)</sup> <sup>[1.45](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-45)</sup> <sup>[1.46](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-46)</sup> <sup>[1.47](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-47)</sup> <sup>[1.48](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-48)</sup> <sup>[1.49](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-49)</sup> <sup>[1.50](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-50)</sup> <sup>[1.51](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-51)</sup> <sup>[1.52](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-52)</sup> <sup>[1.53](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-53)</sup> <sup>[1.54](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-54)</sup> <sup>[1.55](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-55)</sup> <sup>[1.56](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-56)</sup> <sup>[1.57](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-57)</sup> <sup>[1.58](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-58)</sup> <sup>[1.59](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-59)</sup> <sup>[1.60](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-60)</sup> <sup>[1.61](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-61)</sup> <sup>[1.62](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-62)</sup> <sup>[1.63](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-63)</sup> <sup>[1.64](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-64)</sup> <sup>[1.65](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-65)</sup> <sup>[1.66](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-66)</sup> <sup>[1.67](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-67)</sup> <sup>[1.68](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-68)</sup> <sup>[1.69](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-69)</sup> <sup>[1.70](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-70)</sup> <sup>[1.71](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-71)</sup> <sup>[1.72](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-72)</sup> <sup>[1.73](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-73)</sup> <sup>[1.74](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-74)</sup> <sup>[1.75](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-75)</sup> <sup>[1.76](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-76)</sup> <sup>[1.77](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-77)</sup> <sup>[1.78](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-78)</sup> <sup>[1.79](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-79)</sup> <sup>[1.80](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-bbq-main_1-80)</sup> Parrish A. et al. «BBQ: A Hand-Built Bias Benchmark for Question Answering». *arXiv*. <a href="https://arxiv.org/abs/2110.08193" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-acl-anthology-2">[↑](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-acl-anthology_2-0) Parrish A. et al. «BBQ: A hand-built bias benchmark for question answering». *ACL Anthology*. <a href="https://aclanthology.org/2022.findings-acl.165/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-arxiv-evaluating-mitigating-3">↑ <sup>[3.00](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-evaluating-mitigating_3-0)</sup> <sup>[3.01](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-evaluating-mitigating_3-1)</sup> <sup>[3.02](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-evaluating-mitigating_3-2)</sup> <sup>[3.03](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-evaluating-mitigating_3-3)</sup> <sup>[3.04](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-evaluating-mitigating_3-4)</sup> <sup>[3.05](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-evaluating-mitigating_3-5)</sup> <sup>[3.06](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-evaluating-mitigating_3-6)</sup> <sup>[3.07](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-evaluating-mitigating_3-7)</sup> <sup>[3.08](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-evaluating-mitigating_3-8)</sup> <sup>[3.09](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-evaluating-mitigating_3-9)</sup> <sup>[3.10](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-evaluating-mitigating_3-10)</sup> <sup>[3.11](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-evaluating-mitigating_3-11)</sup> <sup>[3.12](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-evaluating-mitigating_3-12)</sup> <sup>[3.13](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-evaluating-mitigating_3-13)</sup> <sup>[3.14](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-evaluating-mitigating_3-14)</sup> <sup>[3.15](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-evaluating-mitigating_3-15)</sup> Liu Z. et al. (2024). «Evaluating and Mitigating Social Bias for Large Language Models in Open-ended Settings». *arXiv preprint*. <a href="https://arxiv.org/html/2412.06134v1" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-paperswithcode-bbq-4">↑ <sup>[4.0](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-paperswithcode-bbq_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-paperswithcode-bbq_4-1)</sup> <sup>[4.2](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-paperswithcode-bbq_4-2)</sup> <sup>[4.3](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-paperswithcode-bbq_4-3)</sup> <sup>[4.4](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-paperswithcode-bbq_4-4)</sup> <sup>[4.5](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-paperswithcode-bbq_4-5)</sup> «BBQ Dataset». *Papers With Code*. <a href="https://paperswithcode.com/dataset/bbq" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-arxiv-kobbg-5">↑ <sup>[5.0](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-kobbg_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-kobbg_5-1)</sup> <sup>[5.2](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-kobbg_5-2)</sup> <sup>[5.3](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-kobbg_5-3)</sup> <sup>[5.4](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-kobbg_5-4)</sup> <sup>[5.5](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-kobbg_5-5)</sup> <sup>[5.6](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(BG)#cite_ref-arxiv-kobbg_5-6)</sup> Jin J. et al. (2024). «KoBBQ: Korean Bias Benchmark for Question Answering». *arXiv preprint*. <a href="https://arxiv.org/abs/2307.16778" class="external autonumber" rel="nofollow">[5]</a></span>
