---
title: "BBQ (Bias Benchmark for Question Answering) (PT)"
source: "https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)"
wiki: "systems-analysis.info/int"
article: "BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)"
language: "pt"
categories:
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
  - "Category:Portuguese"
revision_id: 529
wiki_created_at: 2026-09-06T22:35:07Z
wiki_modified_at: 2026-09-06T22:35:07Z
downloaded_at: 2026-09-07T22:40:47Z
---

# BBQ (Bias Benchmark for Question Answering) (PT)

**BBQ** (Bias Benchmark for Question Answering) é um **conjunto de dados** para avaliar **vieses sociais** (bias) em sistemas de perguntas e respostas (QA)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>. Foi desenvolvido por um grupo de pesquisadores da Universidade de Nova York, liderado por Alicia Parrish, e publicado em 2022 na conferência ACL Findings<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)[\[2\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-acl-anthology-2)</sup>. O objetivo do BBQ é identificar como grandes modelos de linguagem (LLMs) e outros modelos de QA manifestam estereótipos e preconceitos em suas respostas, especialmente em tarefas aplicadas de resposta a perguntas em linguagem natural<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>. O BBQ tornou-se um dos benchmarks mais abrangentes para a avaliação de viés social em PLN, cobrindo um amplo espectro de estereótipos em nove categorias sociais<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-evaluating-mitigating-3)</sup>.

Este conjunto de dados complementa trabalhos anteriores, como o dataset UnQover (2020), que media o viés em um número limitado de características (gênero-profissão, nacionalidade, etnia, religião) e se baseava nas probabilidades dos modelos, em vez das respostas em si<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-evaluating-mitigating-3)</sup>. Diferentemente do UnQover, o BBQ analisa diretamente o conteúdo das respostas dos modelos e suas escolhas entre as opções oferecidas, o que permite avaliar o viés no nível dos resultados gerados<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>.

Os autores do BBQ o posicionam como uma ferramenta para diagnosticar **estereótipos sociais prejudiciais** em modelos e reduzir o risco do impacto negativo de tais estereótipos em grupos vulneráveis da população<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>. O conjunto foca em estereótipos relevantes para a cultura anglófona dos EUA e não abrange todos os contextos culturais possíveis<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>. No entanto, o BBQ estabeleceu a base para trabalhos subsequentes na medição e mitigação do viés social em PLN e se tornou uma referência na comparação de modelos quanto à sua correção ética.

## Composição e estrutura do conjunto de dados

O BBQ contém cerca de **58,5 mil perguntas e respostas**, agrupadas em conjuntos especiais destinados a identificar estereótipos específicos<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-paperswithcode-bbq-4)</sup>. Todos os exemplos foram elaborados **manualmente** pelos autores com base em casos documentados de preconceitos e estereótipos que prejudicam representantes de diversos grupos sociais<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-paperswithcode-bbq-4)</sup>. Para a criação dos cenários, foram utilizados dados de pesquisas científicas, artigos da mídia, relatórios e outras fontes confiáveis que confirmam a existência de um determinado estereótipo e suas consequências prejudiciais<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>. Para cada situação, os autores indicam uma referência à fonte onde o estereótipo é descrito como negativo ou danoso (por exemplo, um artigo científico ou uma notícia)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>.

### Categorias sociais

O BBQ abrange **nove categorias sociais principais** (a maioria correspondendo a grupos protegidos conforme a definição da Comissão de Igualdade de Oportunidades de Emprego dos EUA)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>:

- **Idade** – preconceitos em relação a faixas etárias (por exemplo, o estereótipo de que as capacidades cognitivas diminuem em pessoas idosas)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>.
- **Deficiência** – estereótipos sobre as capacidades mentais ou outras qualidades de pessoas com deficiência (por exemplo, a ideia de que indivíduos com limitações físicas são menos competentes intelectualmente)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>.
- **Identidade de gênero** – estereótipos de gênero (por exemplo, a ideia de que "meninas não são boas em matemática")<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>.
- **Nacionalidade** – preconceitos étnico-nacionais (por exemplo, o estereótipo da falta de conhecimento técnico de pessoas de origem africana)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>.
- **Aparência física** – discriminação com base na aparência ou tipo físico (por exemplo, a opinião de que pessoas com obesidade são menos inteligentes ou trabalhadoras)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>.
- **Raça/Etnia** – estereótipos raciais (por exemplo, a associação preconceituosa de uma determinada raça com criminalidade ou uso de drogas)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>.
- **Religião** – estereótipos religiosos (por exemplo, a representação de judeus como avarentos ou de muçulmanos como propensos à violência)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>.
- **Status socioeconômico** – preconceitos em relação a camadas pobres ou ricas da sociedade (por exemplo, a crença de que pessoas de famílias pobres serão maus pais)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>.
- **Orientação sexual** – estereótipos homofóbicos (por exemplo, a falsa associação da homossexualidade com a infecção por HIV)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>.

Além dessas nove categorias, o BBQ apresenta duas **categorias interseccionais** (intersectional biases), que combinam duas características: (1) gênero em conjunto com raça/etnia e (2) status socioeconômico em conjunto com raça<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>. Tais casos consideram estereótipos na intersecção de diferentes grupos (por exemplo, preconceitos especificamente contra mulheres negras ou contra certas etnias de baixa classe social).

### Templates e geração de exemplos

Para cada categoria, a equipe escreveu **templates de cenários** — pequenas vinhetas com dois personagens que diferem na característica-alvo (por exemplo, jovem e idoso, homem e mulher, rico e pobre, etc.)<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-paperswithcode-bbq-4)</sup>. O template estabelece uma situação que poderia confirmar ou refutar um estereótipo conhecido. A cada cenário estão associadas perguntas e opções de resposta.

Ao todo, foram desenvolvidos 25 templates únicos para cada uma das nove categorias principais, mais 25 templates adicionais para as categorias de raça e gênero usando nomes reais (para testar o viés no nível de nomes próprios)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>. Também foram criados 25 templates para cada uma das duas direções interseccionais<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>. Assim, o número total de cenários base ultrapassa 300.

Cada template contém **slots para variáveis** — nomes de grupos ou descrições — que são inseridos no texto (por exemplo, em um template sobre idade, em vez de "uma pessoa de \_ anos", são inseridos números diferentes, ou em aparência, adjetivos como "gordo"/"magro", etc.)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>. Através da substituição de diferentes valores e da alteração da ordem de menção das duas figuras, cada template é expandido para múltiplos exemplos concretos (no mínimo 8 e até ~200 variações)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>. Geralmente, de um template são geradas pelo menos 100 perguntas finais e, em alguns casos, até duzentas<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>. No total, foi criado um corpus de 58.492 exemplos (combinações únicas de cenário, pergunta e resposta)<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-paperswithcode-bbq-4)</sup>.

### Contextos e tipos de perguntas

Uma característica fundamental do BBQ é que cada situação é apresentada com duas variantes de contexto e duas formulações de pergunta, formando um conjunto de **quatro perguntas** (o chamado cluster de 4)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>. Isso é feito para separar a influência da falta de informação dos estereótipos do modelo em si. Em cada quarteto<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>:

- **Contexto ambíguo** (under-informative or ambiguous context): um texto que descreve uma situação envolvendo duas pessoas de grupos diferentes, mas não contém informações suficientes para responder à pergunta de forma inequívoca<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>. A resposta correta nesses casos é sempre a opção "desconhecido" (ou seja, ausência de dados suficientes)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>. Esses exemplos são necessários para verificar se o modelo fará uma inferência baseada em um estereótipo.
- **Contexto desambiguado** (disambiguated context): um cenário estendido onde é adicionado um detalhe esclarecedor que permite determinar qual das duas pessoas mencionadas corresponde à pergunta<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>. Neste caso, um dos dois personagens é declaradamente a resposta correta (e a opção "desconhecido" já está incorreta). O contexto desambiguado serve para verificar se o modelo consegue superar seu possível viés e escolher a resposta correta, mesmo que o estereótipo sugira o contrário<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>.
- **Pergunta negativa** (por exemplo, "Qual deles não conhece bem o assunto?", "Quem cometeu o crime?")<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>. Essa pergunta, combinada com um contexto ambíguo, verifica se o modelo tende a associar uma ação negativa a um grupo específico na ausência de fatos<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>.
- **Pergunta não negativa (contrastiva)** (por exemplo, "Qual deles conhece bem o assunto?" ou "Quem se abstém de uma má ação?")<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>. A pergunta não negativa é formulada de modo a não soar como uma aprovação direta do estereótipo, mas ainda assim permite verificar o equilíbrio das respostas do modelo<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>. A comparação das respostas às versões negativas e neutras revela distorções sistemáticas.

Cada um desses quatro exemplos no cluster tem **três opções de resposta**: duas específicas (nomeando cada um dos dois grupos em questão) e uma opção que indica a falta de informação suficiente (marcada como "Unknown" e frases equivalentes)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>. Por exemplo, em uma cena envolvendo um cristão e um muçulmano hipotéticos, as opções de resposta seriam: "o cristão", "o muçulmano" ou "desconhecido"<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>. Além disso, a palavra "desconhecido" não é sempre a mesma — são usadas 10 expressões sinônimas<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>.

Adicionalmente, em cada template, a **ordem de menção dos dois grupos** é alterada automaticamente<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>. Isso é feito para neutralizar o **efeito de ordem** — um fator conhecido em que os modelos podem escolher com mais frequência a primeira entidade mencionada, independentemente do conteúdo<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>.

### Anotação e verificação de qualidade

Cada exemplo do BBQ foi avaliado por anotadores de crowdsourcing: pelo menos 5 pessoas independentes responderam às perguntas, e apenas os exemplos nos quais **pelo menos 4 de 5 anotadores concordaram com a resposta correta** (por votação) foram incluídos no dataset final<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>. Se alguma pergunta não atingisse esse limiar, todo o template era revisado e editado<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>. Graças a esse processo, a precisão humana no BBQ é muito alta: anotadores individuais responderam corretamente a ~95,7% das perguntas, e, considerando o voto da maioria, a precisão do padrão-ouro atinge 99,7%<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>. O coeficiente de concordância alfa de Krippendorff foi de 0,883, o que indica uma **alta consistência** entre os humanos em relação às respostas corretas<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>. Essas medidas confirmam que as tarefas do BBQ são compreensíveis para os humanos e têm respostas objetivamente corretas; consequentemente, os erros dos modelos nesses exemplos podem ser interpretados de forma justificada como manifestações de viés, e não como ambiguidade das próprias perguntas.

## Avaliação do viés dos modelos

O BBQ foi projetado para uma avaliação multifacetada do comportamento dos modelos em condições que provocam viés social. Ao ser testado, um modelo de QA recebe um contexto e uma pergunta, e deve escolher uma das três opções de resposta. A análise dos resultados é realizada em dois níveis<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>:

### Caso de contexto ambíguo

Mede-se a frequência com que o modelo responde incorretamente às perguntas na ausência de informações necessárias, ou seja, **se baseia em um estereótipo**<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>. Idealmente, o modelo deveria responder "desconhecido" a qualquer pergunta com contexto insuficiente. No entanto, se ele escolhe um dos grupos, isso é considerado uma projeção do estereótipo subjacente<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>. A frequência desses erros e sua distribuição por categorias fornecem uma visão da tendência do modelo de reproduzir estereótipos prejudiciais.

### Caso de contexto informativo

Avalia-se a precisão com que o modelo responde quando o contexto contém uma resposta correta explícita<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>. Aqui, geralmente se calcula a métrica padrão de **acurácia** (percentual de respostas corretas) – que mostra se o modelo consegue realizar a tarefa de pergunta-resposta em princípio. No entanto, uma atenção especial é dada aos casos em que a resposta correta vai contra o estereótipo<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>. Os desenvolvedores do BBQ analisam se a acurácia do modelo diminui quando a resposta correta contradiz um estereótipo arraigado (e, inversamente, se a acurácia é maior quando a verdade coincide com a expectativa estereotipada)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>. Tal efeito indicaria que, mesmo com fatos disponíveis, o modelo pode cometer erros devido ao viés.

### Bias Score

Para uma avaliação quantitativa do grau de viés, é introduzida uma métrica especial — a **pontuação de viés** (bias score)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>. De forma geral, o bias score reflete a porcentagem de respostas do modelo (entre as incorretas ou todas, dependendo da condição) que coincidem com o estereótipo<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>.

- Um valor de **+100%** significaria que o modelo, em todos os casos, escolheu a opção de resposta que atribui estereotipadamente uma qualidade negativa ao grupo-alvo.
- **0%** — nenhuma manifestação de viés (o modelo sempre responde corretamente/"desconhecido" ou erra igualmente em ambas as direções).
- **Pontuação negativa** (até -100%) — uma tendência oposta, quando o modelo sempre responde contra a expectativa do estereótipo<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>.

As pontuações são calculadas separadamente para contextos ambíguos e desambiguados, pois a natureza dos erros é diferente em cada caso<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>.

- Para **perguntas ambíguas**, o bias score é determinado pela proporção de casos em que o modelo, em vez de "desconhecido", escolheu uma resposta específica, e essa resposta coincidiu com um estereótipo negativo<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>. Quanto mais frequentes essas respostas, maior a pontuação positiva. A acurácia também é levada em conta: se o modelo erra e acerta ("desconhecido") na mesma proporção, a pontuação será menor do que a de um modelo que sempre escolhe a resposta estereotipada<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>. Assim, **tanto a frequência quanto a confiança das respostas com viés são penalizadas** (para contextos ambíguos, a métrica é escalonada com base na porcentagem de respostas corretas "desconhecido")<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>.
- Para **perguntas desambiguadas**, o bias score é calculado de forma um pouco diferente, pois a resposta correta é um dos grupos<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>. Nesses casos, analisam-se as **respostas incorretas** do modelo: a proporção de erros em que o modelo escolheu não a opção correta, mas uma alternativa que coincide com o estereótipo<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>. Em outras palavras, se o modelo errou ao dar preferência a um preconceito (por exemplo, não acreditou nos fatos e respondeu com base no estereótipo), isso aumenta a pontuação<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>.

A análise do bias score, juntamente com a acurácia geral, permite caracterizar detalhadamente o comportamento do modelo no BBQ. Os autores apontam que a mesma acurácia pode esconder diferentes tipos de erros<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>. Assim, essa métrica revela a **direcionalidade dos erros** e identifica casos sutis que não são visíveis apenas pela acurácia.

## Resultados e padrões identificados

Os testes iniciais de vários modelos de QA populares no conjunto BBQ demonstraram uma série de manifestações claras de viés<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>. No estudo de Parrish et al. (2022), foram testados tanto modelos universais de grande porte (como o UnifiedQA – um modelo generalizado para QA baseado no T5) quanto modelos padronizados de múltipla escolha (como o ROBERTA com ajuste fino em QA)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>.

As principais conclusões dos experimentos foram:

- **Fortes erros estereotipados na falta de informação**. Em todos os sistemas testados, observou-se uma tendência de responder de acordo com estereótipos quando o contexto não fornecia as pistas necessárias<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>. Ou seja, os modelos frequentemente não escolhiam a opção "desconhecido", preferindo uma resposta específica que se alinhasse a alguma expectativa estereotipada<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>. Por exemplo, em perguntas ambíguas sobre um crime sem um culpado claro, os modelos frequentemente apontavam para indivíduos de um grupo específico (correspondente ao preconceito)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>. O bias score calculado para contextos ambíguos foi significativamente maior que zero, às vezes se aproximando de +100% em certas categorias para alguns modelos<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>. Os modelos mostraram uma tendência particularmente alta para respostas estereotipadas em cenários relacionados à **aparência física** (obesidade, etc.) — essa categoria gerou um viés notavelmente maior do que, por exemplo, raça ou orientação sexual<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>. Isso indica a não uniformidade do viés dentro de um modelo — alguns tipos de estereótipos são "assimilados" mais fortemente do que outros.
- **Melhora com a presença de fatos, mas persistência de viés oculto**. Quando os modelos recebiam um contexto desambiguado com uma indicação clara da resposta correta, sua **acurácia aumentava notavelmente** (em comparação com a situação de incerteza)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>. No entanto, uma análise detalhada revelou um efeito sutil: a acurácia era **desigual dependendo da relação da resposta correta com o estereótipo**<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>. Em média, os modelos alcançaram uma acurácia de 3 a 3,5 pontos percentuais maior nos exemplos em que a resposta correta coincidia com um estereótipo comum, em comparação com exemplos onde a resposta correta contradizia esse estereótipo<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>. Em outras palavras, quando os fatos confirmavam o preconceito, os modelos respondiam quase sem erros; mas se era necessário nomear uma opção "atípica" para o estereótipo, a probabilidade de erro aumentava. Embora essa diferença de desempenho não seja enorme, ela se manifestou estatisticamente em muitas categorias<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>. A maior discrepância foi registrada em perguntas relacionadas a estereótipos de gênero: até 5 pontos percentuais de diferença<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>. Assim, a **influência oculta do viés** é evidente: os modelos, em média, têm um desempenho ligeiramente pior "contra o estereótipo".
- **Comparação de categorias e templates**. Os pesquisadores do BBQ analisaram o bias score por cada uma das nove categorias e descobriram que, em contextos ambíguos, a pontuação é positiva em todas as categorias, mas sua magnitude varia<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>. Como mencionado, os maiores vieses foram observados nas categorias de aparência física, status socioeconômico e algumas categorias interseccionais<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>. Scores de viés mais baixos, embora ainda não nulos, foram encontrados nas categorias de raça/etnia e orientação sexual<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>. Em contextos desambiguados, o bias score geralmente está mais próximo de zero (pois o modelo frequentemente responde corretamente), mas para alguns templates, permanece positivo, refletindo uma distorção notável na natureza dos erros cometidos<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>. Por exemplo, na categoria de religião, a maioria dos erros foi em uma única direção — os modelos, ao errarem, tendiam a escolher a resposta baseada no preconceito<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>.

No geral, o BBQ demonstrou que mesmo os modelos de linguagem modernos e poderosos **claramente não estão livres de vieses sociais**<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>. Eles tendem a reproduzir estereótipos quando colocados em condições de incerteza e podem exibir vieses sutis mesmo na presença de fatos que exigem uma resposta contrária<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>. Além disso, a magnitude desses efeitos não é a mesma para diferentes grupos: alguns estereótipos são "assimilados" mais fortemente pelo modelo<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>. Os autores do BBQ ressaltam que as diferenças encontradas, embora notáveis, não são catastroficamente grandes — o bias score da maioria dos modelos não atinge valores extremos, muitas vezes ficando na casa de algumas dezenas de por cento<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-bbq-main-1)</sup>. No entanto, mesmo pequenos desvios sistemáticos em direção a estereótipos são potencialmente perigosos no uso em larga escala de LLMs, tornando a identificação e eliminação de tais vieses uma tarefa importante<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-evaluating-mitigating-3)</sup>. O BBQ forneceu aos pesquisadores uma maneira clara e quantitativamente mensurável de acompanhar o progresso nessa área<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-evaluating-mitigating-3)</sup>.

## Impacto e pesquisas futuras

O conjunto BBQ rapidamente ganhou reconhecimento como uma ferramenta padrão para avaliar as características de equidade (fairness) dos modelos de linguagem<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-paperswithcode-bbq-4)</sup>. Seu **código-fonte e dados abertos** estão disponíveis em um repositório (licença CC BY 4.0)<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-paperswithcode-bbq-4)</sup>, o que permitiu que uma ampla comunidade de pesquisadores aplicasse o BBQ no desenvolvimento e teste de novos modelos. Em várias revisões, o BBQ é mencionado juntamente com outros benchmarks (como StereoSet, WinoBias, ToxiGen) como um marco importante no estudo do viés social em PLN<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-evaluating-mitigating-3)</sup>. Desde a publicação do BBQ, surgiram trabalhos que desenvolvem suas ideias e as adaptam a novas condições:

- **Expansão dos formatos de perguntas (Open-BBQ)**. O BBQ original oferece tarefas no formato de múltipla escolha<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-evaluating-mitigating-3)</sup>. Em 2024, foi proposta uma modificação do BBQ para **respostas abertas**, incluindo tarefas de preenchimento de lacunas e texto de resposta curta<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-evaluating-mitigating-3)</sup>. Essa versão, convencionalmente chamada de Open-BBQ, permite avaliar o viés em condições de diálogo mais livres, onde o modelo não tem opções de resposta fixas<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-evaluating-mitigating-3)</sup>. O estudo mostrou que os LLMs, ao gerar texto livre, também demonstram um viés elevado contra vários grupos<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-evaluating-mitigating-3)</sup>. Os autores do Open-BBQ também experimentaram métodos de mitigação de viés, combinando prompts de zero-shot e few-shot e chain-of-thought (raciocínio passo a passo)<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-evaluating-mitigating-3)</sup>. Esses métodos permitiram reduzir significativamente o nível de viés nas respostas<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-evaluating-mitigating-3)</sup>. O Open-BBQ complementou o conjunto original, tornando possível testar modelos geradores em formatos mais próximos às consultas dos usuários.

<!-- -->

- **Adaptação cultural (localização)**. Como o BBQ está ligado às realidades sociais dos EUA, pesquisadores se interessaram em adaptá-lo para outros idiomas e culturas<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-kobbg-5)</sup>. Em 2023, cientistas coreanos apresentaram o dataset **KoBBQ** (Korean BBQ) — um análogo coreano do Bias Benchmark<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-kobbg-5)</sup>. Eles desenvolveram uma abordagem geral para a localização do BBQ: dividiram os templates originais em três categorias – aqueles que podiam ser simplesmente traduzidos, aqueles que exigiam a substituição de grupos por equivalentes locais e aqueles que não eram aplicáveis no contexto coreano<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-kobbg-5)</sup>. Adicionalmente, o KoBBQ introduziu 4 novas categorias de estereótipos específicos da sociedade coreana e removeu vários exemplos inadequados<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-kobbg-5)</sup>. O resultado foi um conjunto de 268 templates e 76.048 exemplos em coreano, abrangendo 12 categorias de viés social (incluindo as originais e novas)<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-kobbg-5)</sup>. Testes de modelos multilíngues no KoBBQ revelaram diferenças significativas no nível de viés em comparação com a tradução automática direta do BBQ original para o coreano<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-kobbg-5)</sup>. Isso destaca que **a tradução direta não é suficiente** – são necessários benchmarks culturalmente específicos que levem em conta os estereótipos e o contexto únicos de cada país<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-kobbg-5)</sup>. O trabalho no KoBBQ demonstrou a possibilidade de escalar a metodologia do BBQ globalmente.

O BBQ tornou-se parte integrante da pesquisa sobre a **ética da inteligência artificial**<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-evaluating-mitigating-3)</sup>. Sua influência pode ser vista no surgimento de novas técnicas de debiasing de modelos, na construção de datasets mais inclusivos e em métricas para a análise sutil de viés. Pesquisadores observam que um dos pontos fortes do BBQ é a amplitude de sua cobertura e o cuidado na construção dos exemplos<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-evaluating-mitigating-3)</sup>. Em resposta aos desafios apontados pelo BBQ, recentemente têm sido desenvolvidas ativamente **estratégias de mitigação de viés**, desde a filtragem de dados de treinamento até algoritmos especiais de pós-processamento e ajuste fino de LLMs para respostas justas<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-evaluating-mitigating-3)</sup>.

Em resumo, o BBQ (Bias Benchmark for QA) se estabeleceu como uma ferramenta valiosa e confiável para medir vieses sociais em modelos de linguagem. Ele fornece à comunidade de pesquisa um conjunto padrão de testes que permite comparar modelos quanto à estereotipia e acompanhar o progresso na melhoria de sua imparcialidade<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-evaluating-mitigating-3)</sup>. O BBQ continua a se expandir e adaptar, refletindo o interesse global na criação de **sistemas de IA mais justos e seguros**<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_note-arxiv-evaluating-mitigating-3)</sup>, livres de vieses prejudiciais, sutis mas significativos.

## Ligações externas

- <a href="https://arxiv.org/abs/2110.08193" class="external text" rel="nofollow">Artigo original do BBQ (arXiv)</a>
- <a href="https://github.com/nyu-mll/BBQ" class="external text" rel="nofollow">Repositório do BBQ no GitHub</a>
- <a href="https://paperswithcode.com/dataset/bbq" class="external text" rel="nofollow">Página do dataset BBQ no Papers With Code</a>
- <a href="https://aclanthology.org/2022.findings-acl.165/" class="external text" rel="nofollow">Artigo do BBQ na ACL Anthology</a>
- <a href="https://arxiv.org/abs/2307.16778" class="external text" rel="nofollow">Artigo sobre o dataset KoBBQ (arXiv)</a>
- <a href="https://arxiv.org/html/2412.06134v1" class="external text" rel="nofollow">Artigo sobre o dataset Open-BBQ (arXiv)</a>

## Literatura

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. <a href="https://arxiv.org/abs/2211.09110" class="external text" rel="nofollow">arXiv:2211.09110</a>.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. <a href="https://arxiv.org/abs/2307.03109" class="external text" rel="nofollow">arXiv:2307.03109</a>.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. <a href="https://arxiv.org/abs/2508.15361" class="external text" rel="nofollow">arXiv:2508.15361</a>.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. <a href="https://arxiv.org/abs/2405.14782" class="external text" rel="nofollow">arXiv:2405.14782</a>.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. <a href="https://arxiv.org/abs/2104.14337" class="external text" rel="nofollow">arXiv:2104.14337</a>.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. <a href="https://arxiv.org/abs/2106.06052" class="external text" rel="nofollow">arXiv:2106.06052</a>.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. <a href="https://arxiv.org/abs/2101.04840" class="external text" rel="nofollow">arXiv:2101.04840</a>.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. <a href="https://arxiv.org/abs/2406.04244" class="external text" rel="nofollow">arXiv:2406.04244</a>.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. <a href="https://arxiv.org/abs/2506.11094" class="external text" rel="nofollow">arXiv:2506.11094</a>.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. <a href="https://arxiv.org/abs/2403.04132" class="external text" rel="nofollow">arXiv:2403.04132</a>.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. <a href="https://arxiv.org/abs/2311.17295" class="external text" rel="nofollow">arXiv:2311.17295</a>.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. <a href="https://arxiv.org/abs/2311.05232" class="external text" rel="nofollow">arXiv:2311.05232</a>.

## Notas

1.  <span id="cite_note-arxiv-bbq-main-1">↑ <sup>[1.00](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-11)</sup> <sup>[1.12](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-12)</sup> <sup>[1.13](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-13)</sup> <sup>[1.14](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-14)</sup> <sup>[1.15](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-15)</sup> <sup>[1.16](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-16)</sup> <sup>[1.17](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-17)</sup> <sup>[1.18](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-18)</sup> <sup>[1.19](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-19)</sup> <sup>[1.20](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-20)</sup> <sup>[1.21](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-21)</sup> <sup>[1.22](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-22)</sup> <sup>[1.23](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-23)</sup> <sup>[1.24](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-24)</sup> <sup>[1.25](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-25)</sup> <sup>[1.26](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-26)</sup> <sup>[1.27](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-27)</sup> <sup>[1.28](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-28)</sup> <sup>[1.29](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-29)</sup> <sup>[1.30](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-30)</sup> <sup>[1.31](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-31)</sup> <sup>[1.32](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-32)</sup> <sup>[1.33](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-33)</sup> <sup>[1.34](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-34)</sup> <sup>[1.35](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-35)</sup> <sup>[1.36](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-36)</sup> <sup>[1.37](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-37)</sup> <sup>[1.38](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-38)</sup> <sup>[1.39](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-39)</sup> <sup>[1.40](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-40)</sup> <sup>[1.41](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-41)</sup> <sup>[1.42](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-42)</sup> <sup>[1.43](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-43)</sup> <sup>[1.44](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-44)</sup> <sup>[1.45](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-45)</sup> <sup>[1.46](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-46)</sup> <sup>[1.47](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-47)</sup> <sup>[1.48](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-48)</sup> <sup>[1.49](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-49)</sup> <sup>[1.50](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-50)</sup> <sup>[1.51](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-51)</sup> <sup>[1.52](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-52)</sup> <sup>[1.53](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-53)</sup> <sup>[1.54](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-54)</sup> <sup>[1.55](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-55)</sup> <sup>[1.56](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-56)</sup> <sup>[1.57](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-57)</sup> <sup>[1.58](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-58)</sup> <sup>[1.59](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-59)</sup> <sup>[1.60](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-60)</sup> <sup>[1.61](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-61)</sup> <sup>[1.62](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-62)</sup> <sup>[1.63](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-63)</sup> <sup>[1.64](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-64)</sup> <sup>[1.65](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-65)</sup> <sup>[1.66](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-66)</sup> <sup>[1.67](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-67)</sup> <sup>[1.68](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-68)</sup> <sup>[1.69](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-69)</sup> <sup>[1.70](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-70)</sup> <sup>[1.71](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-71)</sup> <sup>[1.72](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-72)</sup> <sup>[1.73](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-73)</sup> <sup>[1.74](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-74)</sup> <sup>[1.75](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-75)</sup> <sup>[1.76](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-76)</sup> <sup>[1.77](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-77)</sup> <sup>[1.78](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-78)</sup> <sup>[1.79](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-79)</sup> <sup>[1.80](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-bbq-main_1-80)</sup> Parrish A. et al. "BBQ: A Hand-Built Bias Benchmark for Question Answering". *arXiv*. <a href="https://arxiv.org/abs/2110.08193" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-acl-anthology-2">[↑](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-acl-anthology_2-0) Parrish A. et al. "BBQ: A hand-built bias benchmark for question answering". *ACL Anthology*. <a href="https://aclanthology.org/2022.findings-acl.165/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-arxiv-evaluating-mitigating-3">↑ <sup>[3.00](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-evaluating-mitigating_3-0)</sup> <sup>[3.01](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-evaluating-mitigating_3-1)</sup> <sup>[3.02](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-evaluating-mitigating_3-2)</sup> <sup>[3.03](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-evaluating-mitigating_3-3)</sup> <sup>[3.04](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-evaluating-mitigating_3-4)</sup> <sup>[3.05](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-evaluating-mitigating_3-5)</sup> <sup>[3.06](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-evaluating-mitigating_3-6)</sup> <sup>[3.07](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-evaluating-mitigating_3-7)</sup> <sup>[3.08](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-evaluating-mitigating_3-8)</sup> <sup>[3.09](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-evaluating-mitigating_3-9)</sup> <sup>[3.10](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-evaluating-mitigating_3-10)</sup> <sup>[3.11](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-evaluating-mitigating_3-11)</sup> <sup>[3.12](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-evaluating-mitigating_3-12)</sup> <sup>[3.13](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-evaluating-mitigating_3-13)</sup> <sup>[3.14](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-evaluating-mitigating_3-14)</sup> <sup>[3.15](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-evaluating-mitigating_3-15)</sup> Liu Z. et al. (2024). "Evaluating and Mitigating Social Bias for Large Language Models in Open-ended Settings". *arXiv preprint*. <a href="https://arxiv.org/html/2412.06134v1" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-paperswithcode-bbq-4">↑ <sup>[4.0](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-paperswithcode-bbq_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-paperswithcode-bbq_4-1)</sup> <sup>[4.2](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-paperswithcode-bbq_4-2)</sup> <sup>[4.3](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-paperswithcode-bbq_4-3)</sup> <sup>[4.4](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-paperswithcode-bbq_4-4)</sup> <sup>[4.5](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-paperswithcode-bbq_4-5)</sup> "BBQ Dataset". *Papers With Code*. <a href="https://paperswithcode.com/dataset/bbq" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-arxiv-kobbg-5">↑ <sup>[5.0](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-kobbg_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-kobbg_5-1)</sup> <sup>[5.2](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-kobbg_5-2)</sup> <sup>[5.3](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-kobbg_5-3)</sup> <sup>[5.4](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-kobbg_5-4)</sup> <sup>[5.5](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-kobbg_5-5)</sup> <sup>[5.6](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(PT)#cite_ref-arxiv-kobbg_5-6)</sup> Jin J. et al. (2024). "KoBBQ: Korean Bias Benchmark for Question Answering". *arXiv preprint*. <a href="https://arxiv.org/abs/2307.16778" class="external autonumber" rel="nofollow">[5]</a></span>
