---
title: "BBQ"
source: "https://systems-analysis.info/wiki/BBQ"
wiki: "systems-analysis.info/wiki"
article: "BBQ"
language: "ru"
categories:
  - "Категория:Russian"
  - "Категория:Бенчмарки LLM"
  - "Категория:Большие языковые модели"
  - "Категория:Машинное обучение"
revision_id: 70
wiki_created_at: 2026-09-06T21:54:33Z
wiki_modified_at: 2026-09-06T21:54:33Z
downloaded_at: 2026-09-07T22:17:12Z
---

# BBQ

**BBQ** (Bias Benchmark for Question Answering) — это **набор данных** для оценки **социальных предубеждений** (bias) в системах вопросно-ответного типа (QA)<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>. Он был разработан группой исследователей Нью-Йоркского университета под руководством Алиши Парриш (Alicia Parrish) и опубликован в 2022 году на конференции ACL Findings<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)[\[2\]](https://systems-analysis.info/wiki/BBQ#cite_note-acl-anthology-2)</sup>. Цель BBQ — выявить, как [большие языковые модели](https://systems-analysis.info/wiki/%D0%91%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D0%B5_%D1%8F%D0%B7%D1%8B%D0%BA%D0%BE%D0%B2%D1%8B%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8 "Большие языковые модели") (БЯМ) и другие QA-модели проявляют стереотипы и предвзятости в ответах на вопросы, особенно в прикладных задачах ответа на вопросы на естественном языке<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>. BBQ стал одним из наиболее всеобъемлющих бенчмарков для оценки социального bias в NLP, охватывая широкий спектр стереотипов в рамках девяти социальных категорий<sup>[\[3\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-evaluating-mitigating-3)</sup>.

Данный набор данных дополняет предыдущие работы, такие как датасет UnQover (2020), который измерял предвзятость по ограниченному числу признаков (гендер-профессия, национальность, этническая принадлежность, религия) и опирался на вероятности моделей, а не на сами ответы<sup>[\[3\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-evaluating-mitigating-3)</sup>. В отличие от UnQover, BBQ напрямую анализирует содержимое ответов моделей и их выбор среди предложенных опций, что позволяет оценивать предвзятость именно на уровне выдаваемых результатов<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>.

Авторы BBQ позиционируют его как инструмент для диагностирования **вредных социальных стереотипов** в моделях и снижения риска негативного влияния таких стереотипов на уязвимые группы населения<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>. Набор сфокусирован на стереотипах, актуальных для англоязычной культуры США, и не охватывает всех возможных культурных контекстов<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>. Тем не менее, BBQ заложил основу для последующих работ по измерению и смягчению социального bias в NLP и стал ориентиром при сравнении моделей на предмет их этической корректности.

## Состав и структура набора данных

BBQ содержит около **58,5 тысяч вопросов и ответов**, сгруппированных в специальные наборы, нацеленные на выявление конкретных стереотипов<sup>[\[4\]](https://systems-analysis.info/wiki/BBQ#cite_note-paperswithcode-bbq-4)</sup>. Все примеры были **ручным образом** составлены авторами на основе документированных случаев предубеждений и стереотипов, наносящих вред представителям различных социальных групп<sup>[\[4\]](https://systems-analysis.info/wiki/BBQ#cite_note-paperswithcode-bbq-4)</sup>. При создании сценариев использованы данные научных исследований, статьи СМИ, отчёты и другие надёжные источники, подтверждающие существование того или иного стереотипа и его вредные последствия<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>. Для каждой ситуации авторы указывают ссылку на источник, где данный стереотип описывается как негативный или вредоносный (например, научная статья или новостная заметка)<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>.

### Социальные категории

BBQ охватывает **девять основных социально значимых категорий** (в большинстве соответствующих защищённым группам в определении Комиссии по равным возможностям трудоустройства США)<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>:

- **Возраст** – предубеждения по отношению к возрастным группам (например, стереотип о снижении когнитивных способностей у пожилых людей)<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>.
- **Инвалидность** – стереотипы об умственных способностях или других качествах людей с инвалидностью (например, представление, что физически ограниченные лица менее компетентны интеллектуально)<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>.
- **Гендерная идентичность** – гендерные стереотипы (например, идея, что «девочки плохо справляются с математикой»)<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>.
- **Национальность** – национально-этнические предубеждения (например, стереотип о технической неграмотности выходцев из Африки)<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>.
- **Внешность** – дискриминация по признаку внешнего вида, телосложения (например, мнение, что люди с ожирением менее умны или трудолюбивы)<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>.
- **Раса/этническая принадлежность** – расовые стереотипы (например, предвзятое связывание определённой расы с преступностью или наркоманией)<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>.
- **Религия** – религиозные стереотипы (например, представление о евреях как жадных, о мусульманах как склонных к насилию и т.п.)<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>.
- **Социально-экономический статус** – предубеждения в отношении бедных или богатых слоёв общества (например, убеждение, что выходцы из бедных семей будут плохими родителями)<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>.
- **Сексуальная ориентация** – гомофобные стереотипы (например, ложная ассоциация гомосексуальности с ВИЧ-инфекцией)<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>.

Помимо этих девяти категорий, в BBQ представлены две **межсекционные категории** (intersectional biases), объединяющие сразу два признака: (1) гендер в сочетании с расой/этничностью и (2) социально-экономический статус в сочетании с расой<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>. Такие случаи учитывают стереотипы на пересечении разных групп (например, предубеждения конкретно против чернокожих женщин или против определённых этносов из низкого социального класса).

### Шаблоны и генерация примеров

Для каждой категории команда написала **шаблоны сценариев** — короткие зарисовки, в которых фигурируют два персонажа, различающиеся по целевому признаку (например, молодой и пожилой, мужчина и женщина, богатый и бедный и т.д.)<sup>[\[4\]](https://systems-analysis.info/wiki/BBQ#cite_note-paperswithcode-bbq-4)</sup>. В шаблон заложена ситуация, которая могла бы подтвердить или опровергнуть известный стереотип. К каждому сценарию привязаны вопросы и варианты ответов.

Всего было разработано по 25 уникальных шаблонов на каждую из девяти основных категорий, плюс по 25 дополнительных шаблонов для категорий расы и гендера с использованием реальных имён (чтобы проверить bias на уровне имён собственных)<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>. Также для двух межсекционных направлений создано по 25 шаблонов<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>. Таким образом, общее число базовых сценариев превышает 300.

Каждый шаблон содержит особые **слоты для переменных** — названий групп или описаний, — которые подставляются в текст (например, в шаблоне по возрасту вместо «\_летний человек» подставляются разные числа, или во внешности — прилагательные «полный»/«худой» и т.п.)<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>. За счёт подстановки различных значений и перетасовки порядка упоминания двух фигур, каждый шаблон расширяется до множества конкретных примеров (минимум 8 и вплоть до ~200 вариаций)<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>. Как правило, из одного шаблона генерируется не менее 100 финальных вопросов, а в некоторых случаях – до двух сотен<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>. В сумме получился корпус из 58 492 примеров (уникальных комбинаций сценария, вопроса и ответа)<sup>[\[4\]](https://systems-analysis.info/wiki/BBQ#cite_note-paperswithcode-bbq-4)</sup>.

### Контексты и типы вопросов

Ключевая особенность BBQ — каждая ситуация представлена двумя вариантами контекста и двумя формулировками вопроса, образуя набор из **четырёх вопросов** (так называемый кластер из 4)<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>. Это сделано для того, чтобы отделить влияние недостатка информации от собственно стереотипов модели. В каждом квартете<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>:

- **Неоднозначный контекст** (under-informative or ambiguous context): текст, в котором описана ситуация с участием двух лиц из разных групп, но не содержится достаточной информации, чтобы однозначно ответить на поставленный вопрос<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>. Правильным ответом в подобных случаях всегда является вариант «неизвестно» (то есть отсутствие достаточных данных)<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>. Эти примеры нужны, чтобы проверить, не будет ли модель делать вывод, опираясь на стереотип.
- **Однозначный контекст** (disambiguated context): расширенный сценарий, где добавлена уточняющая деталь, позволяющая определить, кто из двух упомянутых людей соответствует вопросу<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>. В этом случае один из двух персонажей заведомо является правильным ответом (а вариант «неизвестно» уже неверен). Однозначный контекст служит для проверки, сможет ли модель преодолеть свой возможный bias и выбрать корректный ответ, даже если стереотип подсказывает обратное<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>.
- **Негативный вопрос** (e.g., «Кто из них плохо знает предмет?», «Кто совершил преступление?»)<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>. Такой вопрос в сочетании с неоднозначным контекстом проверяет, склонна ли модель связывать негативное действие с определённой группой в отсутствие фактов<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>.
- **Ненегативный (контрастный) вопрос** (e.g., «Кто из них хорошо знает предмет?» или «Кто воздерживается от плохого поступка?»)<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>. Ненегативный вопрос составлен так, чтобы не звучать как прямое одобрение стереотипа, но при этом позволять проверить баланс ответов модели<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>. Сравнение ответов на негативные и нейтральные версии выявляет систематические перекосы.

Каждый из этих четырех примеров в кластере имеет **три варианта ответа**: два конкретных (называющих каждую из двух фигурирующих групп) и один вариант, указывающий на отсутствие достаточной информации (помеченный как «Unknown» и эквивалентные фразы)<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>. Например, в сцене, где участвуют условный христианин и мусульманин, варианты ответа будут: «христианин», «мусульманин» или «неизвестно»<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>. Причём слово «неизвестно» не всегда одно и то же — используется 10 синонимичных выражений<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>.

Кроме того, в каждом шаблоне автоматически меняется **порядок упоминания двух групп**<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>. Это сделано для нивелирования **порядкового эффекта** — известного фактора, при котором модели могут чаще выбирать первую названную сущность независимо от содержания<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>.

### Аннотирование и проверка качества

Каждый пример BBQ был оценен краудсорсинговыми аннотаторами: не менее 5 независимых людей отвечали на вопросы, и в финальный датасет включались только те примеры, по которым **минимум 4 из 5 аннотаторов согласились с правильным ответом** (голосованием)<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>. Если какой-либо вопрос не проходил этот порог, весь шаблон пересматривался и редактировался<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>. Благодаря этому процессу, человеческая точность на BBQ весьма высока: индивидуальные аннотаторы верно отвечали ~95,7% вопросов, а с учётом большинства голосов точность золотого стандарта достигает 99,7%<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>. Каппа-критерий согласия (Krippendorff's alpha) составил 0,883, что указывает на **высокую согласованность** между людьми относительно правильных ответов<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>. Эти меры подтверждают, что задания BBQ понятны людям и имеют объективно верные ответы; следовательно, ошибки моделей на этих примерах могут обоснованно интерпретироваться как проявления bias, а не как двусмысленность самих вопросов.

## Оценка предвзятости моделей

BBQ разработан для многоаспектной оценки поведения моделей в условиях, провоцирующих социальный bias. При тестировании QA-модель получает на вход контекст и вопрос, после чего должна выбрать один из трёх вариантов ответа. Анализ результатов проводится на двух уровнях<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>:

### Случай неоднозначного контекста

Измеряется, насколько часто модель неправильно отвечает на вопросы при отсутствии необходимой информации, то есть **опирается на стереотип**<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>. В идеале модель должна отвечать «неизвестно» на любой вопрос с недостаточным контекстом, однако если она выбрала одну из групп, это расценивается как проекция заложенного стереотипа<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>. Частота таких ошибок и их распределение по категориям дают представление о склонности модели воспроизводить вредные стереотипы.

### Случай информативного контекста

Оценивается, насколько точно модель отвечает, когда контекст содержит явный правильный ответ<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>. Здесь обычно рассчитывают стандартную метрику **accuracy** (процент правильных ответов) – показывает, справляется ли модель с задачей вопрос-ответ в принципе. Однако особое внимание уделяется тем случаям, когда правильный ответ идёт вразрез со стереотипом<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>. Разработчики BBQ анализируют, не снизится ли точность модели, если верный ответ противоречит укорененному стереотипу (и, наоборот, не будет ли выше точность, когда истина совпадает со стереотипным ожиданием)<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>. Такой эффект указывал бы, что даже при наличии фактов модель может допускать ошибки из-за bias.

### Bias Score

Для количественной оценки степени предвзятости вводится специальная метрика — **показатель предвзятости** (bias score)<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>. В общем виде bias score отражает процент ответов модели (среди неверных или всех, в зависимости от условия), которые совпадают со стереотипом<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>.

- Значение **+100%** означало бы, что модель во всех случаях выбрала вариант ответа, стереотипно приписывающий негативное качество целевой группе.
- **0%** — никаких проявлений bias (модель либо всегда отвечает правильно/«неизвестно», либо ошибается поровну в обе стороны).
- **Отрицательный score** (до -100%) — противоположная тенденция, когда модель всегда отвечает против ожидания стереотипа<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>.

Показатели вычисляются раздельно для неоднозначных и однозначных контекстов, поскольку характер ошибок в них разный<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>.

- Для **неоднозначных вопросов** bias score определяется долей случаев, когда модель вместо «неизвестно» выбрала какой-то конкретный ответ, притом этот ответ совпал с негативным стереотипом<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>. Чем чаще такие ответы, тем выше положительный score. При этом учитывается точность: если модель поровну ошибается и отвечает верно («неизвестно»), то даже при части стереотипных ошибок score будет ниже, чем у модели, которая всегда выбирает стереотипный ответ<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>. Таким образом, **наказуются и частота, и уверенность bias-ответов** (для неоднозначных контекстов метрику масштабируют с учётом процента правильных ответов «неизвестно»)<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>.
- Для **однозначных вопросов** bias score вычисляется несколько иначе, ведь тут правильный ответ — одна из групп<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>. В этих случаях смотрят на **неправильные ответы** модели: доля ошибок, в которых модель выбрала не верный вариант, а альтернативный вариант, совпадающий со стереотипом<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>. Иными словами, если модель ошиблась, отдавая предпочтение предубеждению (например, не поверила фактам и ответила по стереотипу), это увеличивает score<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>.

Анализ bias score наряду с общей точностью позволяет детально охарактеризовать поведение модели на BBQ. Авторы указывают, что одни и те же accuracy могут скрывать разный характер ошибок<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>. Таким образом, данный показатель показывает **направленность ошибок** и выявляет тонкие случаи, не видимые по одной лишь точности.

## Результаты и выявленные закономерности

Первичное тестирование нескольких популярных QA-моделей на наборе BBQ продемонстрировало ряд отчетливых проявлений bias<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>. В исследовании Parrish и др. (2022) были протестированы как большие универсальные модели (например, UnifiedQA – обобщённая модель для QA на основе Т5), так и стандартизованные модели multiple-choice (напр. ROBERTA с дообучением на QA)<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>.

Основные выводы по результатам экспериментов:

- **Сильные стереотипные ошибки при нехватке информации**. Во всех протестированных системах наблюдалась тенденция отвечать в духе стереотипа, когда контекст не давал нужных подсказок<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>. Иначе говоря, модели часто не выбрали вариант «неизвестно», а предпочитали конкретный ответ, соотносящийся с тем или иным стереотипным ожиданием<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>. Например, в неоднозначных вопросах про преступление без явного виновника модели нередко указывали лиц из определённой группы (соответствующей предубеждению)<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>. Подсчитанный bias score для ambiguous-контекстов оказался значительно выше нуля, а иногда приближался к +100% в отдельных категориях у некоторых моделей<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>. Особенно высокую склонность к стереотипным ответам показали модели на сценах, связанных с **внешним видом** (ожирение и др.) — эта категория дала заметно больший bias, чем, например, раса или сексуальная ориентация<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>. Это говорит о неоднородности bias внутри модели — одни виды стереотипов «усвоены» ею сильнее, чем другие.
- **Улучшение при наличии фактов, но сохранение скрытого bias**. Когда модели получали однозначный контекст с явным указанием правильного ответа, их **точность заметно возрастала** (по сравнению с ситуацией неизвестности)<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>. Однако детальный анализ выявил тонкий эффект: точность оказалась **неравномерной в зависимости от отношения правильного ответа к стереотипу**<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>. В среднем, модели достигали на 3-3,5 процентных пункта более высокой точности в тех примерах, где правильный ответ совпадал с распространённым стереотипом, по сравнению с примерами, где верный ответ этому стереотипу противоречил<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>. Другими словами, когда факты подтверждали предубеждение, модели почти безошибочно давали ответ; но если требовалось назвать «нетипичный» для стереотипа вариант, вероятность ошибки повышалась. Этот разрыв в производительности хотя и не огромный, статистически проявился во многих категориях<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>. Наибольшее расхождение зафиксировано для вопросов, связанных с гендерными стереотипами: до 5 процентных пунктов разницы<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>. Таким образом, **скрытое влияние bias** прослеживается: модели в среднем чуть хуже работают «против стереотипа».
- **Сравнение категорий и шаблонов**. Исследователи BBQ проанализировали bias score в разбивке по всем девяти категориям и обнаружили, что в неоднозначных контекстах показатель положителен во всех категориях, но его величина варьируется<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>. Как упоминалось, максимальные bias замечены в категориях физическая внешность, социально-экономический статус и некоторых пересекающихся<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>. Более «низкие», хотя тоже ненулевые, bias score были у категорий раса/этничность и сексуальная ориентация<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>. В однозначных контекстах bias score в целом ближе к нулю (поскольку модель часто отвечает правильно), но всё же для некоторых шаблонов остаётся положительным, отражая заметный перекос в характере допущенных ошибок<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>. Например, в категории религия большинство ошибок были в одну сторону — модели, как правило, при ошибке выбирали ответ на основе предубеждения<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>.

В целом BBQ продемонстрировал, что даже сильные современные языковые модели **явно не свободны от социальных предубеждений**<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>. Они склонны воспроизводить стереотипы, если поставлены в условия неопределённости, и могут проявлять тонкие bias даже при наличии фактов, требующих обратного ответа<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>. При этом величина этих эффектов не одинакова для разных групп: некоторые стереотипы «усвоены» моделью сильнее<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>. Авторы BBQ подчёркивают, что обнаруженные различия хотя и заметны, но не катастрофически велики – bias score большинства моделей не достигают экстремальных значений, а зачастую находятся в области нескольких десятков процентов<sup>[\[1\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-bbq-main-1)</sup>. Тем не менее, даже небольшие систематические отклонения в сторону стереотипов потенциально опасны при масштабном использовании БЯМ, поэтому выявление и устранение таких bias — важная задача<sup>[\[3\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-evaluating-mitigating-3)</sup>. BBQ предоставил исследователям чёткий и количественно измеримый способ отслеживать прогресс в этой области<sup>[\[3\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-evaluating-mitigating-3)</sup>.

## Влияние и дальнейшие исследования

Набор BBQ быстро получил признание как стандартный инструмент для оценки fairness характеристик языковых моделей<sup>[\[4\]](https://systems-analysis.info/wiki/BBQ#cite_note-paperswithcode-bbq-4)</sup>. Его **открытый исходный код и данные** доступны в репозитории (лицензия СC BY 4.0)<sup>[\[4\]](https://systems-analysis.info/wiki/BBQ#cite_note-paperswithcode-bbq-4)</sup>, что позволило широкой исследовательской аудитории применять BBQ при разработке и тестировании новых моделей. В ряде обзоров BBQ упоминается наряду с другими бенчмарками (например, StereoSet, WinoBias, ToxiGen) как важная веха в изучении социального bias в NLP<sup>[\[3\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-evaluating-mitigating-3)</sup>. С момента публикации BBQ появились работы, развивающие его идеи и адаптирующие под новые условия:

- **Расширение форматов вопросов (Open-BBQ)**. Оригинальный BBQ предлагает задачи в формате множественного выбора<sup>[\[3\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-evaluating-mitigating-3)</sup>. В 2024 году была предложена модификация BBQ для **открытых ответов**, включающая задачи заполнения пропусков и короткого ответного текста<sup>[\[3\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-evaluating-mitigating-3)</sup>. Эта версия, условно называемая Open-BBQ, позволяет оценивать bias в более свободных условиях диалога, где у модели нет фиксированных вариантов ответа<sup>[\[3\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-evaluating-mitigating-3)</sup>. Исследование показало, что БЯМ при генерации свободного текста также демонстрируют повышенный bias против ряда групп<sup>[\[3\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-evaluating-mitigating-3)</sup>. Авторы Open-BBQ также экспериментировали с методами смягчения предвзятости, комбинируя zero-shot и few-shot подсказки и chain-of-thought (пошаговые рассуждения)<sup>[\[3\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-evaluating-mitigating-3)</sup>. Эти методы позволили заметно снизить уровень bias в ответах<sup>[\[3\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-evaluating-mitigating-3)</sup>. Open-BBQ дополнил оригинальный набор, сделав возможным тестирование генеративных моделей в форматах, ближе к пользовательским запросам.

<!-- -->

- **Культурная адаптация (локализация)**. Поскольку BBQ завязан на социальные реалии США, исследователи заинтересовались его адаптацией под другие языки и культуры<sup>[\[5\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-kobbg-5)</sup>. В 2023 году корейскими учёными был представлен датасет **KoBBQ** (Korean BBQ) — корейский аналог Bias Benchmark<sup>[\[5\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-kobbg-5)</sup>. Они разработали общий подход к локализации BBQ: разделили исходные шаблоны на три категории – те, что можно просто перевести, те, что требуют замены групп на локальные эквиваленты, и те, что вовсе не применимы в корейском контексте<sup>[\[5\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-kobbg-5)</sup>. Дополнительно KoBBQ ввёл 4 новые категории стереотипов, специфичные для корейского общества, и удалил ряд несоответствующих примеров<sup>[\[5\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-kobbg-5)</sup>. В результате получился набор из 268 шаблонов и 76 048 примеров на корейском языке, охватывающий 12 категорий социального bias (включая оригинальные и новые)<sup>[\[5\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-kobbg-5)</sup>. Тестирование мультиязыковых моделей на KoBBQ выявило значительные отличия в уровне предвзятости по сравнению с прямым машинным переводом оригинального BBQ на корейский<sup>[\[5\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-kobbg-5)</sup>. Это подчёркивает, что **прямого перевода недостаточно** – необходимы культурно-специфические бенчмарки, учитывающие уникальные стереотипы и контекст каждой страны<sup>[\[5\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-kobbg-5)</sup>. Работа над KoBBQ продемонстрировала возможность масштабировать методологию BBQ глобально.

BBQ стал неотъемлемой частью исследований по **этичности искусственного интеллекта**<sup>[\[3\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-evaluating-mitigating-3)</sup>. Его влияние прослеживается в появлении новых методик дебайсинга моделей, построения более инклюзивных датасетов и метрик для тонкого анализа bias. Исследователи отмечают, что одной из сильных сторон BBQ является широта охвата и тщательность конструкции примеров<sup>[\[3\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-evaluating-mitigating-3)</sup>. В ответ на вызовы, обозначенные BBQ, в последнее время активно разрабатываются **стратегии снижения bias** от фильтрации обучающих данных до специальных алгоритмов постобработки и настройки БЯМ на справедливые ответы<sup>[\[3\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-evaluating-mitigating-3)</sup>.

Подводя итог, BBQ (Bias Benchmark for QA) зарекомендовал себя как ценный и надёжный инструмент для измерения социальных предубеждений в языковых моделях. Он предоставляет исследовательскому сообществу стандартный набор проверок, позволяющий сравнивать модели на предмет стереотипности и следить за прогрессом в улучшении их беспристрастности<sup>[\[3\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-evaluating-mitigating-3)</sup>. BBQ продолжает расширяться и адаптироваться, отражая глобальный интерес к созданию более **справедливых и безопасных систем ИИ**<sup>[\[3\]](https://systems-analysis.info/wiki/BBQ#cite_note-arxiv-evaluating-mitigating-3)</sup>, свободных от незаметных, но существенных вредных bias.

## См. также

- [Оценка LLM](https://systems-analysis.info/wiki/%D0%9E%D1%86%D0%B5%D0%BD%D0%BA%D0%B0_LLM "Оценка LLM")
- [Большие языковые модели](https://systems-analysis.info/wiki/%D0%91%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D0%B5_%D1%8F%D0%B7%D1%8B%D0%BA%D0%BE%D0%B2%D1%8B%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8 "Большие языковые модели")
- [BIG-bench](https://systems-analysis.info/wiki/BIG-bench "BIG-bench")
- [BOLD](https://systems-analysis.info/wiki/BOLD "BOLD")
- [ELO‑ранжирование моделей](https://systems-analysis.info/wiki/ELO%E2%80%91%D1%80%D0%B0%D0%BD%D0%B6%D0%B8%D1%80%D0%BE%D0%B2%D0%B0%D0%BD%D0%B8%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B5%D0%B9 "ELO‑ранжирование моделей")

## Ссылки

- <a href="https://arxiv.org/abs/2110.08193" class="external text" rel="nofollow">Оригинальная статья BBQ (arXiv)</a>
- <a href="https://github.com/nyu-mll/BBQ" class="external text" rel="nofollow">Репозиторий BBQ на GitHub</a>
- <a href="https://paperswithcode.com/dataset/bbq" class="external text" rel="nofollow">Страница датасета BBQ на Papers With Code</a>
- <a href="https://aclanthology.org/2022.findings-acl.165/" class="external text" rel="nofollow">Статья BBQ на ACL Anthology</a>
- <a href="https://arxiv.org/abs/2307.16778" class="external text" rel="nofollow">Статья о датасете KoBBQ (arXiv)</a>
- <a href="https://arxiv.org/html/2412.06134v1" class="external text" rel="nofollow">Статья о датасете Open-BBQ (arXiv)</a>

## Литература

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. <a href="https://arxiv.org/abs/2211.09110" class="external text" rel="nofollow">arXiv:2211.09110</a>.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. <a href="https://arxiv.org/abs/2307.03109" class="external text" rel="nofollow">arXiv:2307.03109</a>.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. <a href="https://arxiv.org/abs/2508.15361" class="external text" rel="nofollow">arXiv:2508.15361</a>.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. <a href="https://arxiv.org/abs/2405.14782" class="external text" rel="nofollow">arXiv:2405.14782</a>.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. <a href="https://arxiv.org/abs/2104.14337" class="external text" rel="nofollow">arXiv:2104.14337</a>.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. <a href="https://arxiv.org/abs/2106.06052" class="external text" rel="nofollow">arXiv:2106.06052</a>.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. <a href="https://arxiv.org/abs/2101.04840" class="external text" rel="nofollow">arXiv:2101.04840</a>.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. <a href="https://arxiv.org/abs/2406.04244" class="external text" rel="nofollow">arXiv:2406.04244</a>.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. <a href="https://arxiv.org/abs/2506.11094" class="external text" rel="nofollow">arXiv:2506.11094</a>.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. <a href="https://arxiv.org/abs/2403.04132" class="external text" rel="nofollow">arXiv:2403.04132</a>.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. <a href="https://arxiv.org/abs/2311.17295" class="external text" rel="nofollow">arXiv:2311.17295</a>.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. <a href="https://arxiv.org/abs/2311.05232" class="external text" rel="nofollow">arXiv:2311.05232</a>.

## Примечания

1.  <span id="cite_note-arxiv-bbq-main-1">↑ <sup>[1,00](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-0)</sup> <sup>[1,01](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-1)</sup> <sup>[1,02](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-2)</sup> <sup>[1,03](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-3)</sup> <sup>[1,04](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-4)</sup> <sup>[1,05](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-5)</sup> <sup>[1,06](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-6)</sup> <sup>[1,07](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-7)</sup> <sup>[1,08](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-8)</sup> <sup>[1,09](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-9)</sup> <sup>[1,10](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-10)</sup> <sup>[1,11](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-11)</sup> <sup>[1,12](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-12)</sup> <sup>[1,13](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-13)</sup> <sup>[1,14](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-14)</sup> <sup>[1,15](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-15)</sup> <sup>[1,16](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-16)</sup> <sup>[1,17](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-17)</sup> <sup>[1,18](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-18)</sup> <sup>[1,19](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-19)</sup> <sup>[1,20](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-20)</sup> <sup>[1,21](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-21)</sup> <sup>[1,22](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-22)</sup> <sup>[1,23](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-23)</sup> <sup>[1,24](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-24)</sup> <sup>[1,25](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-25)</sup> <sup>[1,26](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-26)</sup> <sup>[1,27](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-27)</sup> <sup>[1,28](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-28)</sup> <sup>[1,29](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-29)</sup> <sup>[1,30](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-30)</sup> <sup>[1,31](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-31)</sup> <sup>[1,32](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-32)</sup> <sup>[1,33](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-33)</sup> <sup>[1,34](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-34)</sup> <sup>[1,35](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-35)</sup> <sup>[1,36](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-36)</sup> <sup>[1,37](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-37)</sup> <sup>[1,38](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-38)</sup> <sup>[1,39](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-39)</sup> <sup>[1,40](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-40)</sup> <sup>[1,41](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-41)</sup> <sup>[1,42](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-42)</sup> <sup>[1,43](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-43)</sup> <sup>[1,44](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-44)</sup> <sup>[1,45](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-45)</sup> <sup>[1,46](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-46)</sup> <sup>[1,47](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-47)</sup> <sup>[1,48](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-48)</sup> <sup>[1,49](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-49)</sup> <sup>[1,50](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-50)</sup> <sup>[1,51](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-51)</sup> <sup>[1,52](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-52)</sup> <sup>[1,53](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-53)</sup> <sup>[1,54](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-54)</sup> <sup>[1,55](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-55)</sup> <sup>[1,56](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-56)</sup> <sup>[1,57](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-57)</sup> <sup>[1,58](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-58)</sup> <sup>[1,59](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-59)</sup> <sup>[1,60](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-60)</sup> <sup>[1,61](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-61)</sup> <sup>[1,62](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-62)</sup> <sup>[1,63](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-63)</sup> <sup>[1,64](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-64)</sup> <sup>[1,65](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-65)</sup> <sup>[1,66](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-66)</sup> <sup>[1,67](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-67)</sup> <sup>[1,68](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-68)</sup> <sup>[1,69](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-69)</sup> <sup>[1,70](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-70)</sup> <sup>[1,71](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-71)</sup> <sup>[1,72](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-72)</sup> <sup>[1,73](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-73)</sup> <sup>[1,74](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-74)</sup> <sup>[1,75](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-75)</sup> <sup>[1,76](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-76)</sup> <sup>[1,77](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-77)</sup> <sup>[1,78](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-78)</sup> <sup>[1,79](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-79)</sup> <sup>[1,80](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-bbq-main_1-80)</sup> Parrish A. et al. «BBQ: A Hand-Built Bias Benchmark for Question Answering». *arXiv*. <a href="https://arxiv.org/abs/2110.08193" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-acl-anthology-2">[↑](https://systems-analysis.info/wiki/BBQ#cite_ref-acl-anthology_2-0) Parrish A. et al. «BBQ: A hand-built bias benchmark for question answering». *ACL Anthology*. <a href="https://aclanthology.org/2022.findings-acl.165/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-arxiv-evaluating-mitigating-3">↑ <sup>[3,00](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-evaluating-mitigating_3-0)</sup> <sup>[3,01](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-evaluating-mitigating_3-1)</sup> <sup>[3,02](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-evaluating-mitigating_3-2)</sup> <sup>[3,03](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-evaluating-mitigating_3-3)</sup> <sup>[3,04](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-evaluating-mitigating_3-4)</sup> <sup>[3,05](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-evaluating-mitigating_3-5)</sup> <sup>[3,06](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-evaluating-mitigating_3-6)</sup> <sup>[3,07](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-evaluating-mitigating_3-7)</sup> <sup>[3,08](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-evaluating-mitigating_3-8)</sup> <sup>[3,09](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-evaluating-mitigating_3-9)</sup> <sup>[3,10](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-evaluating-mitigating_3-10)</sup> <sup>[3,11](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-evaluating-mitigating_3-11)</sup> <sup>[3,12](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-evaluating-mitigating_3-12)</sup> <sup>[3,13](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-evaluating-mitigating_3-13)</sup> <sup>[3,14](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-evaluating-mitigating_3-14)</sup> <sup>[3,15](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-evaluating-mitigating_3-15)</sup> Liu Z. et al. (2024). «Evaluating and Mitigating Social Bias for Large Language Models in Open-ended Settings». *arXiv preprint*. <a href="https://arxiv.org/html/2412.06134v1" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-paperswithcode-bbq-4">↑ <sup>[4,0](https://systems-analysis.info/wiki/BBQ#cite_ref-paperswithcode-bbq_4-0)</sup> <sup>[4,1](https://systems-analysis.info/wiki/BBQ#cite_ref-paperswithcode-bbq_4-1)</sup> <sup>[4,2](https://systems-analysis.info/wiki/BBQ#cite_ref-paperswithcode-bbq_4-2)</sup> <sup>[4,3](https://systems-analysis.info/wiki/BBQ#cite_ref-paperswithcode-bbq_4-3)</sup> <sup>[4,4](https://systems-analysis.info/wiki/BBQ#cite_ref-paperswithcode-bbq_4-4)</sup> <sup>[4,5](https://systems-analysis.info/wiki/BBQ#cite_ref-paperswithcode-bbq_4-5)</sup> «BBQ Dataset». *Papers With Code*. <a href="https://paperswithcode.com/dataset/bbq" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-arxiv-kobbg-5">↑ <sup>[5,0](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-kobbg_5-0)</sup> <sup>[5,1](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-kobbg_5-1)</sup> <sup>[5,2](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-kobbg_5-2)</sup> <sup>[5,3](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-kobbg_5-3)</sup> <sup>[5,4](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-kobbg_5-4)</sup> <sup>[5,5](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-kobbg_5-5)</sup> <sup>[5,6](https://systems-analysis.info/wiki/BBQ#cite_ref-arxiv-kobbg_5-6)</sup> Jin J. et al. (2024). «KoBBQ: Korean Bias Benchmark for Question Answering». *arXiv preprint*. <a href="https://arxiv.org/abs/2307.16778" class="external autonumber" rel="nofollow">[5]</a></span>
