BBQ

Материал из Systems analysis Wiki
Перейти к навигации Перейти к поиску

BBQ (Bias Benchmark for Question Answering) — это набор данных для оценки социальных предубеждений (bias) в системах вопросно-ответного типа (QA)[1]. Он был разработан группой исследователей Нью-Йоркского университета под руководством Алиши Парриш (Alicia Parrish) и опубликован в 2022 году на конференции ACL Findings[1][2]. Цель BBQ — выявить, как большие языковые модели (БЯМ) и другие QA-модели проявляют стереотипы и предвзятости в ответах на вопросы, особенно в прикладных задачах ответа на вопросы на естественном языке[1]. BBQ стал одним из наиболее всеобъемлющих бенчмарков для оценки социального bias в NLP, охватывая широкий спектр стереотипов в рамках девяти социальных категорий[3].

Данный набор данных дополняет предыдущие работы, такие как датасет UnQover (2020), который измерял предвзятость по ограниченному числу признаков (гендер-профессия, национальность, этническая принадлежность, религия) и опирался на вероятности моделей, а не на сами ответы[3]. В отличие от UnQover, BBQ напрямую анализирует содержимое ответов моделей и их выбор среди предложенных опций, что позволяет оценивать предвзятость именно на уровне выдаваемых результатов[1].

Авторы BBQ позиционируют его как инструмент для диагностирования вредных социальных стереотипов в моделях и снижения риска негативного влияния таких стереотипов на уязвимые группы населения[1]. Набор сфокусирован на стереотипах, актуальных для англоязычной культуры США, и не охватывает всех возможных культурных контекстов[1]. Тем не менее, BBQ заложил основу для последующих работ по измерению и смягчению социального bias в NLP и стал ориентиром при сравнении моделей на предмет их этической корректности.

Состав и структура набора данных

BBQ содержит около 58,5 тысяч вопросов и ответов, сгруппированных в специальные наборы, нацеленные на выявление конкретных стереотипов[4]. Все примеры были ручным образом составлены авторами на основе документированных случаев предубеждений и стереотипов, наносящих вред представителям различных социальных групп[4]. При создании сценариев использованы данные научных исследований, статьи СМИ, отчёты и другие надёжные источники, подтверждающие существование того или иного стереотипа и его вредные последствия[1]. Для каждой ситуации авторы указывают ссылку на источник, где данный стереотип описывается как негативный или вредоносный (например, научная статья или новостная заметка)[1].

Социальные категории

BBQ охватывает девять основных социально значимых категорий (в большинстве соответствующих защищённым группам в определении Комиссии по равным возможностям трудоустройства США)[1]:

  • Возраст – предубеждения по отношению к возрастным группам (например, стереотип о снижении когнитивных способностей у пожилых людей)[1].
  • Инвалидность – стереотипы об умственных способностях или других качествах людей с инвалидностью (например, представление, что физически ограниченные лица менее компетентны интеллектуально)[1].
  • Гендерная идентичность – гендерные стереотипы (например, идея, что «девочки плохо справляются с математикой»)[1].
  • Национальность – национально-этнические предубеждения (например, стереотип о технической неграмотности выходцев из Африки)[1].
  • Внешность – дискриминация по признаку внешнего вида, телосложения (например, мнение, что люди с ожирением менее умны или трудолюбивы)[1].
  • Раса/этническая принадлежность – расовые стереотипы (например, предвзятое связывание определённой расы с преступностью или наркоманией)[1].
  • Религия – религиозные стереотипы (например, представление о евреях как жадных, о мусульманах как склонных к насилию и т.п.)[1].
  • Социально-экономический статус – предубеждения в отношении бедных или богатых слоёв общества (например, убеждение, что выходцы из бедных семей будут плохими родителями)[1].
  • Сексуальная ориентация – гомофобные стереотипы (например, ложная ассоциация гомосексуальности с ВИЧ-инфекцией)[1].

Помимо этих девяти категорий, в BBQ представлены две межсекционные категории (intersectional biases), объединяющие сразу два признака: (1) гендер в сочетании с расой/этничностью и (2) социально-экономический статус в сочетании с расой[1]. Такие случаи учитывают стереотипы на пересечении разных групп (например, предубеждения конкретно против чернокожих женщин или против определённых этносов из низкого социального класса).

Шаблоны и генерация примеров

Для каждой категории команда написала шаблоны сценариев — короткие зарисовки, в которых фигурируют два персонажа, различающиеся по целевому признаку (например, молодой и пожилой, мужчина и женщина, богатый и бедный и т.д.)[4]. В шаблон заложена ситуация, которая могла бы подтвердить или опровергнуть известный стереотип. К каждому сценарию привязаны вопросы и варианты ответов.

Всего было разработано по 25 уникальных шаблонов на каждую из девяти основных категорий, плюс по 25 дополнительных шаблонов для категорий расы и гендера с использованием реальных имён (чтобы проверить bias на уровне имён собственных)[1]. Также для двух межсекционных направлений создано по 25 шаблонов[1]. Таким образом, общее число базовых сценариев превышает 300.

Каждый шаблон содержит особые слоты для переменных — названий групп или описаний, — которые подставляются в текст (например, в шаблоне по возрасту вместо «_летний человек» подставляются разные числа, или во внешности — прилагательные «полный»/«худой» и т.п.)[1]. За счёт подстановки различных значений и перетасовки порядка упоминания двух фигур, каждый шаблон расширяется до множества конкретных примеров (минимум 8 и вплоть до ~200 вариаций)[1]. Как правило, из одного шаблона генерируется не менее 100 финальных вопросов, а в некоторых случаях – до двух сотен[1]. В сумме получился корпус из 58 492 примеров (уникальных комбинаций сценария, вопроса и ответа)[4].

Контексты и типы вопросов

Ключевая особенность BBQ — каждая ситуация представлена двумя вариантами контекста и двумя формулировками вопроса, образуя набор из четырёх вопросов (так называемый кластер из 4)[1]. Это сделано для того, чтобы отделить влияние недостатка информации от собственно стереотипов модели. В каждом квартете[1]:

  • Неоднозначный контекст (under-informative or ambiguous context): текст, в котором описана ситуация с участием двух лиц из разных групп, но не содержится достаточной информации, чтобы однозначно ответить на поставленный вопрос[1]. Правильным ответом в подобных случаях всегда является вариант «неизвестно» (то есть отсутствие достаточных данных)[1]. Эти примеры нужны, чтобы проверить, не будет ли модель делать вывод, опираясь на стереотип.
  • Однозначный контекст (disambiguated context): расширенный сценарий, где добавлена уточняющая деталь, позволяющая определить, кто из двух упомянутых людей соответствует вопросу[1]. В этом случае один из двух персонажей заведомо является правильным ответом (а вариант «неизвестно» уже неверен). Однозначный контекст служит для проверки, сможет ли модель преодолеть свой возможный bias и выбрать корректный ответ, даже если стереотип подсказывает обратное[1].
  • Негативный вопрос (e.g., «Кто из них плохо знает предмет?», «Кто совершил преступление?»)[1]. Такой вопрос в сочетании с неоднозначным контекстом проверяет, склонна ли модель связывать негативное действие с определённой группой в отсутствие фактов[1].
  • Ненегативный (контрастный) вопрос (e.g., «Кто из них хорошо знает предмет?» или «Кто воздерживается от плохого поступка?»)[1]. Ненегативный вопрос составлен так, чтобы не звучать как прямое одобрение стереотипа, но при этом позволять проверить баланс ответов модели[1]. Сравнение ответов на негативные и нейтральные версии выявляет систематические перекосы.

Каждый из этих четырех примеров в кластере имеет три варианта ответа: два конкретных (называющих каждую из двух фигурирующих групп) и один вариант, указывающий на отсутствие достаточной информации (помеченный как «Unknown» и эквивалентные фразы)[1]. Например, в сцене, где участвуют условный христианин и мусульманин, варианты ответа будут: «христианин», «мусульманин» или «неизвестно»[1]. Причём слово «неизвестно» не всегда одно и то же — используется 10 синонимичных выражений[1].

Кроме того, в каждом шаблоне автоматически меняется порядок упоминания двух групп[1]. Это сделано для нивелирования порядкового эффекта — известного фактора, при котором модели могут чаще выбирать первую названную сущность независимо от содержания[1].

Аннотирование и проверка качества

Каждый пример BBQ был оценен краудсорсинговыми аннотаторами: не менее 5 независимых людей отвечали на вопросы, и в финальный датасет включались только те примеры, по которым минимум 4 из 5 аннотаторов согласились с правильным ответом (голосованием)[1]. Если какой-либо вопрос не проходил этот порог, весь шаблон пересматривался и редактировался[1]. Благодаря этому процессу, человеческая точность на BBQ весьма высока: индивидуальные аннотаторы верно отвечали ~95,7% вопросов, а с учётом большинства голосов точность золотого стандарта достигает 99,7%[1]. Каппа-критерий согласия (Krippendorff's alpha) составил 0,883, что указывает на высокую согласованность между людьми относительно правильных ответов[1]. Эти меры подтверждают, что задания BBQ понятны людям и имеют объективно верные ответы; следовательно, ошибки моделей на этих примерах могут обоснованно интерпретироваться как проявления bias, а не как двусмысленность самих вопросов.

Оценка предвзятости моделей

BBQ разработан для многоаспектной оценки поведения моделей в условиях, провоцирующих социальный bias. При тестировании QA-модель получает на вход контекст и вопрос, после чего должна выбрать один из трёх вариантов ответа. Анализ результатов проводится на двух уровнях[1]:

Случай неоднозначного контекста

Измеряется, насколько часто модель неправильно отвечает на вопросы при отсутствии необходимой информации, то есть опирается на стереотип[1]. В идеале модель должна отвечать «неизвестно» на любой вопрос с недостаточным контекстом, однако если она выбрала одну из групп, это расценивается как проекция заложенного стереотипа[1]. Частота таких ошибок и их распределение по категориям дают представление о склонности модели воспроизводить вредные стереотипы.

Случай информативного контекста

Оценивается, насколько точно модель отвечает, когда контекст содержит явный правильный ответ[1]. Здесь обычно рассчитывают стандартную метрику accuracy (процент правильных ответов) – показывает, справляется ли модель с задачей вопрос-ответ в принципе. Однако особое внимание уделяется тем случаям, когда правильный ответ идёт вразрез со стереотипом[1]. Разработчики BBQ анализируют, не снизится ли точность модели, если верный ответ противоречит укорененному стереотипу (и, наоборот, не будет ли выше точность, когда истина совпадает со стереотипным ожиданием)[1]. Такой эффект указывал бы, что даже при наличии фактов модель может допускать ошибки из-за bias.

Bias Score

Для количественной оценки степени предвзятости вводится специальная метрика — показатель предвзятости (bias score)[1]. В общем виде bias score отражает процент ответов модели (среди неверных или всех, в зависимости от условия), которые совпадают со стереотипом[1].

  • Значение +100% означало бы, что модель во всех случаях выбрала вариант ответа, стереотипно приписывающий негативное качество целевой группе.
  • 0% — никаких проявлений bias (модель либо всегда отвечает правильно/«неизвестно», либо ошибается поровну в обе стороны).
  • Отрицательный score (до -100%) — противоположная тенденция, когда модель всегда отвечает против ожидания стереотипа[1].

Показатели вычисляются раздельно для неоднозначных и однозначных контекстов, поскольку характер ошибок в них разный[1].

  • Для неоднозначных вопросов bias score определяется долей случаев, когда модель вместо «неизвестно» выбрала какой-то конкретный ответ, притом этот ответ совпал с негативным стереотипом[1]. Чем чаще такие ответы, тем выше положительный score. При этом учитывается точность: если модель поровну ошибается и отвечает верно («неизвестно»), то даже при части стереотипных ошибок score будет ниже, чем у модели, которая всегда выбирает стереотипный ответ[1]. Таким образом, наказуются и частота, и уверенность bias-ответов (для неоднозначных контекстов метрику масштабируют с учётом процента правильных ответов «неизвестно»)[1].
  • Для однозначных вопросов bias score вычисляется несколько иначе, ведь тут правильный ответ — одна из групп[1]. В этих случаях смотрят на неправильные ответы модели: доля ошибок, в которых модель выбрала не верный вариант, а альтернативный вариант, совпадающий со стереотипом[1]. Иными словами, если модель ошиблась, отдавая предпочтение предубеждению (например, не поверила фактам и ответила по стереотипу), это увеличивает score[1].

Анализ bias score наряду с общей точностью позволяет детально охарактеризовать поведение модели на BBQ. Авторы указывают, что одни и те же accuracy могут скрывать разный характер ошибок[1]. Таким образом, данный показатель показывает направленность ошибок и выявляет тонкие случаи, не видимые по одной лишь точности.

Результаты и выявленные закономерности

Первичное тестирование нескольких популярных QA-моделей на наборе BBQ продемонстрировало ряд отчетливых проявлений bias[1]. В исследовании Parrish и др. (2022) были протестированы как большие универсальные модели (например, UnifiedQA – обобщённая модель для QA на основе Т5), так и стандартизованные модели multiple-choice (напр. ROBERTA с дообучением на QA)[1].

Основные выводы по результатам экспериментов:

  • Сильные стереотипные ошибки при нехватке информации. Во всех протестированных системах наблюдалась тенденция отвечать в духе стереотипа, когда контекст не давал нужных подсказок[1]. Иначе говоря, модели часто не выбрали вариант «неизвестно», а предпочитали конкретный ответ, соотносящийся с тем или иным стереотипным ожиданием[1]. Например, в неоднозначных вопросах про преступление без явного виновника модели нередко указывали лиц из определённой группы (соответствующей предубеждению)[1]. Подсчитанный bias score для ambiguous-контекстов оказался значительно выше нуля, а иногда приближался к +100% в отдельных категориях у некоторых моделей[1]. Особенно высокую склонность к стереотипным ответам показали модели на сценах, связанных с внешним видом (ожирение и др.) — эта категория дала заметно больший bias, чем, например, раса или сексуальная ориентация[1]. Это говорит о неоднородности bias внутри модели — одни виды стереотипов «усвоены» ею сильнее, чем другие.
  • Улучшение при наличии фактов, но сохранение скрытого bias. Когда модели получали однозначный контекст с явным указанием правильного ответа, их точность заметно возрастала (по сравнению с ситуацией неизвестности)[1]. Однако детальный анализ выявил тонкий эффект: точность оказалась неравномерной в зависимости от отношения правильного ответа к стереотипу[1]. В среднем, модели достигали на 3-3,5 процентных пункта более высокой точности в тех примерах, где правильный ответ совпадал с распространённым стереотипом, по сравнению с примерами, где верный ответ этому стереотипу противоречил[1]. Другими словами, когда факты подтверждали предубеждение, модели почти безошибочно давали ответ; но если требовалось назвать «нетипичный» для стереотипа вариант, вероятность ошибки повышалась. Этот разрыв в производительности хотя и не огромный, статистически проявился во многих категориях[1]. Наибольшее расхождение зафиксировано для вопросов, связанных с гендерными стереотипами: до 5 процентных пунктов разницы[1]. Таким образом, скрытое влияние bias прослеживается: модели в среднем чуть хуже работают «против стереотипа».
  • Сравнение категорий и шаблонов. Исследователи BBQ проанализировали bias score в разбивке по всем девяти категориям и обнаружили, что в неоднозначных контекстах показатель положителен во всех категориях, но его величина варьируется[1]. Как упоминалось, максимальные bias замечены в категориях физическая внешность, социально-экономический статус и некоторых пересекающихся[1]. Более «низкие», хотя тоже ненулевые, bias score были у категорий раса/этничность и сексуальная ориентация[1]. В однозначных контекстах bias score в целом ближе к нулю (поскольку модель часто отвечает правильно), но всё же для некоторых шаблонов остаётся положительным, отражая заметный перекос в характере допущенных ошибок[1]. Например, в категории религия большинство ошибок были в одну сторону — модели, как правило, при ошибке выбирали ответ на основе предубеждения[1].

В целом BBQ продемонстрировал, что даже сильные современные языковые модели явно не свободны от социальных предубеждений[1]. Они склонны воспроизводить стереотипы, если поставлены в условия неопределённости, и могут проявлять тонкие bias даже при наличии фактов, требующих обратного ответа[1]. При этом величина этих эффектов не одинакова для разных групп: некоторые стереотипы «усвоены» моделью сильнее[1]. Авторы BBQ подчёркивают, что обнаруженные различия хотя и заметны, но не катастрофически велики – bias score большинства моделей не достигают экстремальных значений, а зачастую находятся в области нескольких десятков процентов[1]. Тем не менее, даже небольшие систематические отклонения в сторону стереотипов потенциально опасны при масштабном использовании БЯМ, поэтому выявление и устранение таких bias — важная задача[3]. BBQ предоставил исследователям чёткий и количественно измеримый способ отслеживать прогресс в этой области[3].

Влияние и дальнейшие исследования

Набор BBQ быстро получил признание как стандартный инструмент для оценки fairness характеристик языковых моделей[4]. Его открытый исходный код и данные доступны в репозитории (лицензия СC BY 4.0)[4], что позволило широкой исследовательской аудитории применять BBQ при разработке и тестировании новых моделей. В ряде обзоров BBQ упоминается наряду с другими бенчмарками (например, StereoSet, WinoBias, ToxiGen) как важная веха в изучении социального bias в NLP[3]. С момента публикации BBQ появились работы, развивающие его идеи и адаптирующие под новые условия:

  • Расширение форматов вопросов (Open-BBQ). Оригинальный BBQ предлагает задачи в формате множественного выбора[3]. В 2024 году была предложена модификация BBQ для открытых ответов, включающая задачи заполнения пропусков и короткого ответного текста[3]. Эта версия, условно называемая Open-BBQ, позволяет оценивать bias в более свободных условиях диалога, где у модели нет фиксированных вариантов ответа[3]. Исследование показало, что БЯМ при генерации свободного текста также демонстрируют повышенный bias против ряда групп[3]. Авторы Open-BBQ также экспериментировали с методами смягчения предвзятости, комбинируя zero-shot и few-shot подсказки и chain-of-thought (пошаговые рассуждения)[3]. Эти методы позволили заметно снизить уровень bias в ответах[3]. Open-BBQ дополнил оригинальный набор, сделав возможным тестирование генеративных моделей в форматах, ближе к пользовательским запросам.
  • Культурная адаптация (локализация). Поскольку BBQ завязан на социальные реалии США, исследователи заинтересовались его адаптацией под другие языки и культуры[5]. В 2023 году корейскими учёными был представлен датасет KoBBQ (Korean BBQ) — корейский аналог Bias Benchmark[5]. Они разработали общий подход к локализации BBQ: разделили исходные шаблоны на три категории – те, что можно просто перевести, те, что требуют замены групп на локальные эквиваленты, и те, что вовсе не применимы в корейском контексте[5]. Дополнительно KoBBQ ввёл 4 новые категории стереотипов, специфичные для корейского общества, и удалил ряд несоответствующих примеров[5]. В результате получился набор из 268 шаблонов и 76 048 примеров на корейском языке, охватывающий 12 категорий социального bias (включая оригинальные и новые)[5]. Тестирование мультиязыковых моделей на KoBBQ выявило значительные отличия в уровне предвзятости по сравнению с прямым машинным переводом оригинального BBQ на корейский[5]. Это подчёркивает, что прямого перевода недостаточно – необходимы культурно-специфические бенчмарки, учитывающие уникальные стереотипы и контекст каждой страны[5]. Работа над KoBBQ продемонстрировала возможность масштабировать методологию BBQ глобально.

BBQ стал неотъемлемой частью исследований по этичности искусственного интеллекта[3]. Его влияние прослеживается в появлении новых методик дебайсинга моделей, построения более инклюзивных датасетов и метрик для тонкого анализа bias. Исследователи отмечают, что одной из сильных сторон BBQ является широта охвата и тщательность конструкции примеров[3]. В ответ на вызовы, обозначенные BBQ, в последнее время активно разрабатываются стратегии снижения bias от фильтрации обучающих данных до специальных алгоритмов постобработки и настройки БЯМ на справедливые ответы[3].

Подводя итог, BBQ (Bias Benchmark for QA) зарекомендовал себя как ценный и надёжный инструмент для измерения социальных предубеждений в языковых моделях. Он предоставляет исследовательскому сообществу стандартный набор проверок, позволяющий сравнивать модели на предмет стереотипности и следить за прогрессом в улучшении их беспристрастности[3]. BBQ продолжает расширяться и адаптироваться, отражая глобальный интерес к созданию более справедливых и безопасных систем ИИ[3], свободных от незаметных, но существенных вредных bias.

См. также

Ссылки

Литература

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

Примечания

  1. 1,00 1,01 1,02 1,03 1,04 1,05 1,06 1,07 1,08 1,09 1,10 1,11 1,12 1,13 1,14 1,15 1,16 1,17 1,18 1,19 1,20 1,21 1,22 1,23 1,24 1,25 1,26 1,27 1,28 1,29 1,30 1,31 1,32 1,33 1,34 1,35 1,36 1,37 1,38 1,39 1,40 1,41 1,42 1,43 1,44 1,45 1,46 1,47 1,48 1,49 1,50 1,51 1,52 1,53 1,54 1,55 1,56 1,57 1,58 1,59 1,60 1,61 1,62 1,63 1,64 1,65 1,66 1,67 1,68 1,69 1,70 1,71 1,72 1,73 1,74 1,75 1,76 1,77 1,78 1,79 1,80 Parrish A. et al. «BBQ: A Hand-Built Bias Benchmark for Question Answering». arXiv. [1]
  2. Parrish A. et al. «BBQ: A hand-built bias benchmark for question answering». ACL Anthology. [2]
  3. 3,00 3,01 3,02 3,03 3,04 3,05 3,06 3,07 3,08 3,09 3,10 3,11 3,12 3,13 3,14 3,15 Liu Z. et al. (2024). «Evaluating and Mitigating Social Bias for Large Language Models in Open-ended Settings». arXiv preprint. [3]
  4. 4,0 4,1 4,2 4,3 4,4 4,5 «BBQ Dataset». Papers With Code. [4]
  5. 5,0 5,1 5,2 5,3 5,4 5,5 5,6 Jin J. et al. (2024). «KoBBQ: Korean Bias Benchmark for Question Answering». arXiv preprint. [5]