BBQ
BBQ (Bias Benchmark for Question Answering) — это набор данных для оценки социальных предубеждений (bias) в системах вопросно-ответного типа (QA)[1]. Он был разработан группой исследователей Нью-Йоркского университета под руководством Алиши Парриш (Alicia Parrish) и опубликован в 2022 году на конференции ACL Findings[1][2]. Цель BBQ — выявить, как большие языковые модели (БЯМ) и другие QA-модели проявляют стереотипы и предвзятости в ответах на вопросы, особенно в прикладных задачах ответа на вопросы на естественном языке[1]. BBQ стал одним из наиболее всеобъемлющих бенчмарков для оценки социального bias в NLP, охватывая широкий спектр стереотипов в рамках девяти социальных категорий[3].
Данный набор данных дополняет предыдущие работы, такие как датасет UnQover (2020), который измерял предвзятость по ограниченному числу признаков (гендер-профессия, национальность, этническая принадлежность, религия) и опирался на вероятности моделей, а не на сами ответы[3]. В отличие от UnQover, BBQ напрямую анализирует содержимое ответов моделей и их выбор среди предложенных опций, что позволяет оценивать предвзятость именно на уровне выдаваемых результатов[1].
Авторы BBQ позиционируют его как инструмент для диагностирования вредных социальных стереотипов в моделях и снижения риска негативного влияния таких стереотипов на уязвимые группы населения[1]. Набор сфокусирован на стереотипах, актуальных для англоязычной культуры США, и не охватывает всех возможных культурных контекстов[1]. Тем не менее, BBQ заложил основу для последующих работ по измерению и смягчению социального bias в NLP и стал ориентиром при сравнении моделей на предмет их этической корректности.
Состав и структура набора данных
BBQ содержит около 58,5 тысяч вопросов и ответов, сгруппированных в специальные наборы, нацеленные на выявление конкретных стереотипов[4]. Все примеры были ручным образом составлены авторами на основе документированных случаев предубеждений и стереотипов, наносящих вред представителям различных социальных групп[4]. При создании сценариев использованы данные научных исследований, статьи СМИ, отчёты и другие надёжные источники, подтверждающие существование того или иного стереотипа и его вредные последствия[1]. Для каждой ситуации авторы указывают ссылку на источник, где данный стереотип описывается как негативный или вредоносный (например, научная статья или новостная заметка)[1].
Социальные категории
BBQ охватывает девять основных социально значимых категорий (в большинстве соответствующих защищённым группам в определении Комиссии по равным возможностям трудоустройства США)[1]:
- Возраст – предубеждения по отношению к возрастным группам (например, стереотип о снижении когнитивных способностей у пожилых людей)[1].
- Инвалидность – стереотипы об умственных способностях или других качествах людей с инвалидностью (например, представление, что физически ограниченные лица менее компетентны интеллектуально)[1].
- Гендерная идентичность – гендерные стереотипы (например, идея, что «девочки плохо справляются с математикой»)[1].
- Национальность – национально-этнические предубеждения (например, стереотип о технической неграмотности выходцев из Африки)[1].
- Внешность – дискриминация по признаку внешнего вида, телосложения (например, мнение, что люди с ожирением менее умны или трудолюбивы)[1].
- Раса/этническая принадлежность – расовые стереотипы (например, предвзятое связывание определённой расы с преступностью или наркоманией)[1].
- Религия – религиозные стереотипы (например, представление о евреях как жадных, о мусульманах как склонных к насилию и т.п.)[1].
- Социально-экономический статус – предубеждения в отношении бедных или богатых слоёв общества (например, убеждение, что выходцы из бедных семей будут плохими родителями)[1].
- Сексуальная ориентация – гомофобные стереотипы (например, ложная ассоциация гомосексуальности с ВИЧ-инфекцией)[1].
Помимо этих девяти категорий, в BBQ представлены две межсекционные категории (intersectional biases), объединяющие сразу два признака: (1) гендер в сочетании с расой/этничностью и (2) социально-экономический статус в сочетании с расой[1]. Такие случаи учитывают стереотипы на пересечении разных групп (например, предубеждения конкретно против чернокожих женщин или против определённых этносов из низкого социального класса).
Шаблоны и генерация примеров
Для каждой категории команда написала шаблоны сценариев — короткие зарисовки, в которых фигурируют два персонажа, различающиеся по целевому признаку (например, молодой и пожилой, мужчина и женщина, богатый и бедный и т.д.)[4]. В шаблон заложена ситуация, которая могла бы подтвердить или опровергнуть известный стереотип. К каждому сценарию привязаны вопросы и варианты ответов.
Всего было разработано по 25 уникальных шаблонов на каждую из девяти основных категорий, плюс по 25 дополнительных шаблонов для категорий расы и гендера с использованием реальных имён (чтобы проверить bias на уровне имён собственных)[1]. Также для двух межсекционных направлений создано по 25 шаблонов[1]. Таким образом, общее число базовых сценариев превышает 300.
Каждый шаблон содержит особые слоты для переменных — названий групп или описаний, — которые подставляются в текст (например, в шаблоне по возрасту вместо «_летний человек» подставляются разные числа, или во внешности — прилагательные «полный»/«худой» и т.п.)[1]. За счёт подстановки различных значений и перетасовки порядка упоминания двух фигур, каждый шаблон расширяется до множества конкретных примеров (минимум 8 и вплоть до ~200 вариаций)[1]. Как правило, из одного шаблона генерируется не менее 100 финальных вопросов, а в некоторых случаях – до двух сотен[1]. В сумме получился корпус из 58 492 примеров (уникальных комбинаций сценария, вопроса и ответа)[4].
Контексты и типы вопросов
Ключевая особенность BBQ — каждая ситуация представлена двумя вариантами контекста и двумя формулировками вопроса, образуя набор из четырёх вопросов (так называемый кластер из 4)[1]. Это сделано для того, чтобы отделить влияние недостатка информации от собственно стереотипов модели. В каждом квартете[1]:
- Неоднозначный контекст (under-informative or ambiguous context): текст, в котором описана ситуация с участием двух лиц из разных групп, но не содержится достаточной информации, чтобы однозначно ответить на поставленный вопрос[1]. Правильным ответом в подобных случаях всегда является вариант «неизвестно» (то есть отсутствие достаточных данных)[1]. Эти примеры нужны, чтобы проверить, не будет ли модель делать вывод, опираясь на стереотип.
- Однозначный контекст (disambiguated context): расширенный сценарий, где добавлена уточняющая деталь, позволяющая определить, кто из двух упомянутых людей соответствует вопросу[1]. В этом случае один из двух персонажей заведомо является правильным ответом (а вариант «неизвестно» уже неверен). Однозначный контекст служит для проверки, сможет ли модель преодолеть свой возможный bias и выбрать корректный ответ, даже если стереотип подсказывает обратное[1].
- Негативный вопрос (e.g., «Кто из них плохо знает предмет?», «Кто совершил преступление?»)[1]. Такой вопрос в сочетании с неоднозначным контекстом проверяет, склонна ли модель связывать негативное действие с определённой группой в отсутствие фактов[1].
- Ненегативный (контрастный) вопрос (e.g., «Кто из них хорошо знает предмет?» или «Кто воздерживается от плохого поступка?»)[1]. Ненегативный вопрос составлен так, чтобы не звучать как прямое одобрение стереотипа, но при этом позволять проверить баланс ответов модели[1]. Сравнение ответов на негативные и нейтральные версии выявляет систематические перекосы.
Каждый из этих четырех примеров в кластере имеет три варианта ответа: два конкретных (называющих каждую из двух фигурирующих групп) и один вариант, указывающий на отсутствие достаточной информации (помеченный как «Unknown» и эквивалентные фразы)[1]. Например, в сцене, где участвуют условный христианин и мусульманин, варианты ответа будут: «христианин», «мусульманин» или «неизвестно»[1]. Причём слово «неизвестно» не всегда одно и то же — используется 10 синонимичных выражений[1].
Кроме того, в каждом шаблоне автоматически меняется порядок упоминания двух групп[1]. Это сделано для нивелирования порядкового эффекта — известного фактора, при котором модели могут чаще выбирать первую названную сущность независимо от содержания[1].
Аннотирование и проверка качества
Каждый пример BBQ был оценен краудсорсинговыми аннотаторами: не менее 5 независимых людей отвечали на вопросы, и в финальный датасет включались только те примеры, по которым минимум 4 из 5 аннотаторов согласились с правильным ответом (голосованием)[1]. Если какой-либо вопрос не проходил этот порог, весь шаблон пересматривался и редактировался[1]. Благодаря этому процессу, человеческая точность на BBQ весьма высока: индивидуальные аннотаторы верно отвечали ~95,7% вопросов, а с учётом большинства голосов точность золотого стандарта достигает 99,7%[1]. Каппа-критерий согласия (Krippendorff's alpha) составил 0,883, что указывает на высокую согласованность между людьми относительно правильных ответов[1]. Эти меры подтверждают, что задания BBQ понятны людям и имеют объективно верные ответы; следовательно, ошибки моделей на этих примерах могут обоснованно интерпретироваться как проявления bias, а не как двусмысленность самих вопросов.
Оценка предвзятости моделей
BBQ разработан для многоаспектной оценки поведения моделей в условиях, провоцирующих социальный bias. При тестировании QA-модель получает на вход контекст и вопрос, после чего должна выбрать один из трёх вариантов ответа. Анализ результатов проводится на двух уровнях[1]:
Случай неоднозначного контекста
Измеряется, насколько часто модель неправильно отвечает на вопросы при отсутствии необходимой информации, то есть опирается на стереотип[1]. В идеале модель должна отвечать «неизвестно» на любой вопрос с недостаточным контекстом, однако если она выбрала одну из групп, это расценивается как проекция заложенного стереотипа[1]. Частота таких ошибок и их распределение по категориям дают представление о склонности модели воспроизводить вредные стереотипы.
Случай информативного контекста
Оценивается, насколько точно модель отвечает, когда контекст содержит явный правильный ответ[1]. Здесь обычно рассчитывают стандартную метрику accuracy (процент правильных ответов) – показывает, справляется ли модель с задачей вопрос-ответ в принципе. Однако особое внимание уделяется тем случаям, когда правильный ответ идёт вразрез со стереотипом[1]. Разработчики BBQ анализируют, не снизится ли точность модели, если верный ответ противоречит укорененному стереотипу (и, наоборот, не будет ли выше точность, когда истина совпадает со стереотипным ожиданием)[1]. Такой эффект указывал бы, что даже при наличии фактов модель может допускать ошибки из-за bias.
Bias Score
Для количественной оценки степени предвзятости вводится специальная метрика — показатель предвзятости (bias score)[1]. В общем виде bias score отражает процент ответов модели (среди неверных или всех, в зависимости от условия), которые совпадают со стереотипом[1].
- Значение +100% означало бы, что модель во всех случаях выбрала вариант ответа, стереотипно приписывающий негативное качество целевой группе.
- 0% — никаких проявлений bias (модель либо всегда отвечает правильно/«неизвестно», либо ошибается поровну в обе стороны).
- Отрицательный score (до -100%) — противоположная тенденция, когда модель всегда отвечает против ожидания стереотипа[1].
Показатели вычисляются раздельно для неоднозначных и однозначных контекстов, поскольку характер ошибок в них разный[1].
- Для неоднозначных вопросов bias score определяется долей случаев, когда модель вместо «неизвестно» выбрала какой-то конкретный ответ, притом этот ответ совпал с негативным стереотипом[1]. Чем чаще такие ответы, тем выше положительный score. При этом учитывается точность: если модель поровну ошибается и отвечает верно («неизвестно»), то даже при части стереотипных ошибок score будет ниже, чем у модели, которая всегда выбирает стереотипный ответ[1]. Таким образом, наказуются и частота, и уверенность bias-ответов (для неоднозначных контекстов метрику масштабируют с учётом процента правильных ответов «неизвестно»)[1].
- Для однозначных вопросов bias score вычисляется несколько иначе, ведь тут правильный ответ — одна из групп[1]. В этих случаях смотрят на неправильные ответы модели: доля ошибок, в которых модель выбрала не верный вариант, а альтернативный вариант, совпадающий со стереотипом[1]. Иными словами, если модель ошиблась, отдавая предпочтение предубеждению (например, не поверила фактам и ответила по стереотипу), это увеличивает score[1].
Анализ bias score наряду с общей точностью позволяет детально охарактеризовать поведение модели на BBQ. Авторы указывают, что одни и те же accuracy могут скрывать разный характер ошибок[1]. Таким образом, данный показатель показывает направленность ошибок и выявляет тонкие случаи, не видимые по одной лишь точности.
Результаты и выявленные закономерности
Первичное тестирование нескольких популярных QA-моделей на наборе BBQ продемонстрировало ряд отчетливых проявлений bias[1]. В исследовании Parrish и др. (2022) были протестированы как большие универсальные модели (например, UnifiedQA – обобщённая модель для QA на основе Т5), так и стандартизованные модели multiple-choice (напр. ROBERTA с дообучением на QA)[1].
Основные выводы по результатам экспериментов:
- Сильные стереотипные ошибки при нехватке информации. Во всех протестированных системах наблюдалась тенденция отвечать в духе стереотипа, когда контекст не давал нужных подсказок[1]. Иначе говоря, модели часто не выбрали вариант «неизвестно», а предпочитали конкретный ответ, соотносящийся с тем или иным стереотипным ожиданием[1]. Например, в неоднозначных вопросах про преступление без явного виновника модели нередко указывали лиц из определённой группы (соответствующей предубеждению)[1]. Подсчитанный bias score для ambiguous-контекстов оказался значительно выше нуля, а иногда приближался к +100% в отдельных категориях у некоторых моделей[1]. Особенно высокую склонность к стереотипным ответам показали модели на сценах, связанных с внешним видом (ожирение и др.) — эта категория дала заметно больший bias, чем, например, раса или сексуальная ориентация[1]. Это говорит о неоднородности bias внутри модели — одни виды стереотипов «усвоены» ею сильнее, чем другие.
- Улучшение при наличии фактов, но сохранение скрытого bias. Когда модели получали однозначный контекст с явным указанием правильного ответа, их точность заметно возрастала (по сравнению с ситуацией неизвестности)[1]. Однако детальный анализ выявил тонкий эффект: точность оказалась неравномерной в зависимости от отношения правильного ответа к стереотипу[1]. В среднем, модели достигали на 3-3,5 процентных пункта более высокой точности в тех примерах, где правильный ответ совпадал с распространённым стереотипом, по сравнению с примерами, где верный ответ этому стереотипу противоречил[1]. Другими словами, когда факты подтверждали предубеждение, модели почти безошибочно давали ответ; но если требовалось назвать «нетипичный» для стереотипа вариант, вероятность ошибки повышалась. Этот разрыв в производительности хотя и не огромный, статистически проявился во многих категориях[1]. Наибольшее расхождение зафиксировано для вопросов, связанных с гендерными стереотипами: до 5 процентных пунктов разницы[1]. Таким образом, скрытое влияние bias прослеживается: модели в среднем чуть хуже работают «против стереотипа».
- Сравнение категорий и шаблонов. Исследователи BBQ проанализировали bias score в разбивке по всем девяти категориям и обнаружили, что в неоднозначных контекстах показатель положителен во всех категориях, но его величина варьируется[1]. Как упоминалось, максимальные bias замечены в категориях физическая внешность, социально-экономический статус и некоторых пересекающихся[1]. Более «низкие», хотя тоже ненулевые, bias score были у категорий раса/этничность и сексуальная ориентация[1]. В однозначных контекстах bias score в целом ближе к нулю (поскольку модель часто отвечает правильно), но всё же для некоторых шаблонов остаётся положительным, отражая заметный перекос в характере допущенных ошибок[1]. Например, в категории религия большинство ошибок были в одну сторону — модели, как правило, при ошибке выбирали ответ на основе предубеждения[1].
В целом BBQ продемонстрировал, что даже сильные современные языковые модели явно не свободны от социальных предубеждений[1]. Они склонны воспроизводить стереотипы, если поставлены в условия неопределённости, и могут проявлять тонкие bias даже при наличии фактов, требующих обратного ответа[1]. При этом величина этих эффектов не одинакова для разных групп: некоторые стереотипы «усвоены» моделью сильнее[1]. Авторы BBQ подчёркивают, что обнаруженные различия хотя и заметны, но не катастрофически велики – bias score большинства моделей не достигают экстремальных значений, а зачастую находятся в области нескольких десятков процентов[1]. Тем не менее, даже небольшие систематические отклонения в сторону стереотипов потенциально опасны при масштабном использовании БЯМ, поэтому выявление и устранение таких bias — важная задача[3]. BBQ предоставил исследователям чёткий и количественно измеримый способ отслеживать прогресс в этой области[3].
Влияние и дальнейшие исследования
Набор BBQ быстро получил признание как стандартный инструмент для оценки fairness характеристик языковых моделей[4]. Его открытый исходный код и данные доступны в репозитории (лицензия СC BY 4.0)[4], что позволило широкой исследовательской аудитории применять BBQ при разработке и тестировании новых моделей. В ряде обзоров BBQ упоминается наряду с другими бенчмарками (например, StereoSet, WinoBias, ToxiGen) как важная веха в изучении социального bias в NLP[3]. С момента публикации BBQ появились работы, развивающие его идеи и адаптирующие под новые условия:
- Расширение форматов вопросов (Open-BBQ). Оригинальный BBQ предлагает задачи в формате множественного выбора[3]. В 2024 году была предложена модификация BBQ для открытых ответов, включающая задачи заполнения пропусков и короткого ответного текста[3]. Эта версия, условно называемая Open-BBQ, позволяет оценивать bias в более свободных условиях диалога, где у модели нет фиксированных вариантов ответа[3]. Исследование показало, что БЯМ при генерации свободного текста также демонстрируют повышенный bias против ряда групп[3]. Авторы Open-BBQ также экспериментировали с методами смягчения предвзятости, комбинируя zero-shot и few-shot подсказки и chain-of-thought (пошаговые рассуждения)[3]. Эти методы позволили заметно снизить уровень bias в ответах[3]. Open-BBQ дополнил оригинальный набор, сделав возможным тестирование генеративных моделей в форматах, ближе к пользовательским запросам.
- Культурная адаптация (локализация). Поскольку BBQ завязан на социальные реалии США, исследователи заинтересовались его адаптацией под другие языки и культуры[5]. В 2023 году корейскими учёными был представлен датасет KoBBQ (Korean BBQ) — корейский аналог Bias Benchmark[5]. Они разработали общий подход к локализации BBQ: разделили исходные шаблоны на три категории – те, что можно просто перевести, те, что требуют замены групп на локальные эквиваленты, и те, что вовсе не применимы в корейском контексте[5]. Дополнительно KoBBQ ввёл 4 новые категории стереотипов, специфичные для корейского общества, и удалил ряд несоответствующих примеров[5]. В результате получился набор из 268 шаблонов и 76 048 примеров на корейском языке, охватывающий 12 категорий социального bias (включая оригинальные и новые)[5]. Тестирование мультиязыковых моделей на KoBBQ выявило значительные отличия в уровне предвзятости по сравнению с прямым машинным переводом оригинального BBQ на корейский[5]. Это подчёркивает, что прямого перевода недостаточно – необходимы культурно-специфические бенчмарки, учитывающие уникальные стереотипы и контекст каждой страны[5]. Работа над KoBBQ продемонстрировала возможность масштабировать методологию BBQ глобально.
BBQ стал неотъемлемой частью исследований по этичности искусственного интеллекта[3]. Его влияние прослеживается в появлении новых методик дебайсинга моделей, построения более инклюзивных датасетов и метрик для тонкого анализа bias. Исследователи отмечают, что одной из сильных сторон BBQ является широта охвата и тщательность конструкции примеров[3]. В ответ на вызовы, обозначенные BBQ, в последнее время активно разрабатываются стратегии снижения bias от фильтрации обучающих данных до специальных алгоритмов постобработки и настройки БЯМ на справедливые ответы[3].
Подводя итог, BBQ (Bias Benchmark for QA) зарекомендовал себя как ценный и надёжный инструмент для измерения социальных предубеждений в языковых моделях. Он предоставляет исследовательскому сообществу стандартный набор проверок, позволяющий сравнивать модели на предмет стереотипности и следить за прогрессом в улучшении их беспристрастности[3]. BBQ продолжает расширяться и адаптироваться, отражая глобальный интерес к созданию более справедливых и безопасных систем ИИ[3], свободных от незаметных, но существенных вредных bias.
См. также
Ссылки
- Оригинальная статья BBQ (arXiv)
- Репозиторий BBQ на GitHub
- Страница датасета BBQ на Papers With Code
- Статья BBQ на ACL Anthology
- Статья о датасете KoBBQ (arXiv)
- Статья о датасете Open-BBQ (arXiv)
Литература
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
Примечания
- ↑ 1,00 1,01 1,02 1,03 1,04 1,05 1,06 1,07 1,08 1,09 1,10 1,11 1,12 1,13 1,14 1,15 1,16 1,17 1,18 1,19 1,20 1,21 1,22 1,23 1,24 1,25 1,26 1,27 1,28 1,29 1,30 1,31 1,32 1,33 1,34 1,35 1,36 1,37 1,38 1,39 1,40 1,41 1,42 1,43 1,44 1,45 1,46 1,47 1,48 1,49 1,50 1,51 1,52 1,53 1,54 1,55 1,56 1,57 1,58 1,59 1,60 1,61 1,62 1,63 1,64 1,65 1,66 1,67 1,68 1,69 1,70 1,71 1,72 1,73 1,74 1,75 1,76 1,77 1,78 1,79 1,80 Parrish A. et al. «BBQ: A Hand-Built Bias Benchmark for Question Answering». arXiv. [1]
- ↑ Parrish A. et al. «BBQ: A hand-built bias benchmark for question answering». ACL Anthology. [2]
- ↑ 3,00 3,01 3,02 3,03 3,04 3,05 3,06 3,07 3,08 3,09 3,10 3,11 3,12 3,13 3,14 3,15 Liu Z. et al. (2024). «Evaluating and Mitigating Social Bias for Large Language Models in Open-ended Settings». arXiv preprint. [3]
- ↑ 4,0 4,1 4,2 4,3 4,4 4,5 «BBQ Dataset». Papers With Code. [4]
- ↑ 5,0 5,1 5,2 5,3 5,4 5,5 5,6 Jin J. et al. (2024). «KoBBQ: Korean Bias Benchmark for Question Answering». arXiv preprint. [5]