---
title: "BBQ (Bias Benchmark for Question Answering) (ES)"
source: "https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)"
wiki: "systems-analysis.info/int"
article: "BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)"
language: "es"
categories:
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
  - "Category:Spanish"
revision_id: 518
wiki_created_at: 2026-09-06T22:34:55Z
wiki_modified_at: 2026-09-06T22:34:55Z
downloaded_at: 2026-09-07T22:40:40Z
---

# BBQ (Bias Benchmark for Question Answering) (ES)

**BBQ** (Bias Benchmark for Question Answering) es un **conjunto de datos** para evaluar **sesgos sociales** (*bias*) en sistemas de respuesta a preguntas (QA)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>. Fue desarrollado por un grupo de investigadores de la Universidad de Nueva York, liderado por Alicia Parrish, y publicado en 2022 en la conferencia ACL Findings<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)[\[2\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-acl-anthology-2)</sup>. El objetivo de BBQ es identificar cómo los grandes modelos lingüísticos (LLM) y otros modelos de QA manifiestan estereotipos y sesgos en sus respuestas a preguntas, especialmente en tareas aplicadas de respuesta a preguntas en lenguaje natural<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>. BBQ se ha convertido en uno de los benchmarks más completos para evaluar el sesgo social en PNL, abarcando una amplia gama de estereotipos en nueve categorías sociales<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-evaluating-mitigating-3)</sup>.

Este conjunto de datos complementa trabajos anteriores, como el dataset UnQover (2020), que medía el sesgo en un número limitado de características (género-profesión, nacionalidad, etnia, religión) y se basaba en las probabilidades de los modelos en lugar de en las respuestas mismas<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-evaluating-mitigating-3)</sup>. A diferencia de UnQover, BBQ analiza directamente el contenido de las respuestas de los modelos y su elección entre las opciones propuestas, lo que permite evaluar el sesgo a nivel de los resultados generados<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>.

Los autores de BBQ lo posicionan como una herramienta para diagnosticar **estereotipos sociales dañinos** en los modelos y reducir el riesgo del impacto negativo de dichos estereotipos en grupos vulnerables de la población<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>. El conjunto se enfoca en estereotipos relevantes para la cultura angloparlante de Estados Unidos y no abarca todos los contextos culturales posibles<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>. No obstante, BBQ sentó las bases para trabajos posteriores sobre la medición y mitigación del sesgo social en PNL y se convirtió en un punto de referencia para comparar modelos en cuanto a su corrección ética.

## Composición y estructura del conjunto de datos

BBQ contiene aproximadamente **58,500 preguntas y respuestas**, agrupadas en conjuntos especiales diseñados para identificar estereotipos específicos<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-paperswithcode-bbq-4)</sup>. Todos los ejemplos fueron compilados **manualmente** por los autores basándose en casos documentados de prejuicios y estereotipos que perjudican a representantes de diversos grupos sociales<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-paperswithcode-bbq-4)</sup>. Para la creación de los escenarios se utilizaron datos de investigaciones científicas, artículos de medios, informes y otras fuentes fiables que confirman la existencia de un estereotipo particular y sus consecuencias dañinas<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>. Para cada situación, los autores proporcionan una referencia a la fuente donde se describe dicho estereotipo como negativo o perjudicial (por ejemplo, un artículo científico o una noticia)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>.

### Categorías sociales

BBQ abarca **nueve categorías sociales principales** (en su mayoría correspondientes a grupos protegidos según la definición de la Comisión para la Igualdad de Oportunidades en el Empleo de EE. UU.)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>:

- **Edad** – prejuicios hacia grupos de edad (por ejemplo, el estereotipo sobre la disminución de las capacidades cognitivas en las personas mayores)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>.
- **Discapacidad** – estereotipos sobre las capacidades mentales u otras cualidades de las personas con discapacidad (por ejemplo, la idea de que las personas con limitaciones físicas son menos competentes intelectualmente)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>.
- **Identidad de género** – estereotipos de género (por ejemplo, la idea de que «las niñas son malas en matemáticas»)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>.
- **Nacionalidad** – prejuicios étnico-nacionales (por ejemplo, el estereotipo sobre la incompetencia técnica de las personas de origen africano)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>.
- **Apariencia física** – discriminación basada en la apariencia o la constitución física (por ejemplo, la opinión de que las personas con obesidad son menos inteligentes o trabajadoras)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>.
- **Raza/etnia** – estereotipos raciales (por ejemplo, la asociación prejuiciosa de una raza particular con la delincuencia o la drogadicción)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>.
- **Religión** – estereotipos religiosos (por ejemplo, la percepción de los judíos como avaros, o de los musulmanes como propensos a la violencia, etc.)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>.
- **Estatus socioeconómico** – prejuicios hacia las clases sociales pobres o ricas (por ejemplo, la creencia de que las personas de familias pobres serán malos padres)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>.
- **Orientación sexual** – estereotipos homofóbicos (por ejemplo, la falsa asociación de la homosexualidad con la infección por VIH)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>.

Además de estas nueve categorías, BBQ presenta dos **categorías interseccionales** (*intersectional biases*), que combinan dos características a la vez: (1) género en combinación con raza/etnia y (2) estatus socioeconómico en combinación con raza<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>. Estos casos tienen en cuenta los estereotipos en la intersección de diferentes grupos (por ejemplo, prejuicios específicos contra las mujeres negras o contra ciertos grupos étnicos de clase social baja).

### Plantillas y generación de ejemplos

Para cada categoría, el equipo escribió **plantillas de escenarios** —breves viñetas en las que aparecen dos personajes que difieren en la característica objetivo (por ejemplo, joven y anciano, hombre y mujer, rico y pobre, etc.)<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-paperswithcode-bbq-4)</sup>. La plantilla establece una situación que podría confirmar o refutar un estereotipo conocido. A cada escenario se le asocian preguntas y opciones de respuesta.

En total, se desarrollaron 25 plantillas únicas para cada una de las nueve categorías principales, más 25 plantillas adicionales para las categorías de raza y género utilizando nombres reales (para verificar el sesgo a nivel de nombres propios)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>. También se crearon 25 plantillas para cada una de las dos áreas interseccionales<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>. Así, el número total de escenarios base supera los 300.

Cada plantilla contiene **espacios para variables** —nombres de grupos o descripciones— que se insertan en el texto (por ejemplo, en la plantilla de edad, en lugar de «persona de \_ años», se insertan diferentes números, o en la de apariencia, los adjetivos «gordo»/«delgado», etc.)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>. Mediante la sustitución de diferentes valores y la reorganización del orden de mención de las dos figuras, cada plantilla se expande en una multitud de ejemplos concretos (un mínimo de 8 y hasta ~200 variaciones)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>. Generalmente, de una plantilla se generan al menos 100 preguntas finales, y en algunos casos, hasta doscientas<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>. En total, se obtuvo un corpus de 58,492 ejemplos (combinaciones únicas de escenario, pregunta y respuesta)<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-paperswithcode-bbq-4)</sup>.

### Contextos y tipos de preguntas

Una característica clave de BBQ es que cada situación se presenta con dos variantes de contexto y dos formulaciones de pregunta, formando un conjunto de **cuatro preguntas** (conocido como un clúster de 4)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>. Esto se hace para separar la influencia de la falta de información de los estereotipos propios del modelo. En cada cuarteto<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>:

- **Contexto ambiguo** (*under-informative or ambiguous context*): un texto que describe una situación con dos personas de diferentes grupos, pero que no contiene suficiente información para responder de manera inequívoca a la pregunta planteada<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>. La respuesta correcta en tales casos es siempre la opción «desconocido» (es decir, la falta de datos suficientes)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>. Estos ejemplos son necesarios para verificar si el modelo llegará a una conclusión basándose en un estereotipo.
- **Contexto desambiguado** (*disambiguated context*): un escenario ampliado donde se añade un detalle clarificador que permite determinar cuál de las dos personas mencionadas corresponde a la pregunta<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>. En este caso, uno de los dos personajes es la respuesta correcta (y la opción «desconocido» ya es incorrecta). El contexto desambiguado sirve para comprobar si el modelo puede superar su posible sesgo y elegir la respuesta correcta, incluso si el estereotipo sugiere lo contrario<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>.
- **Pregunta negativa** (p. ej., «¿Quién de ellos no conoce bien el tema?», «¿Quién cometió el crimen?»)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>. Esta pregunta, combinada con un contexto ambiguo, verifica si el modelo tiende a asociar una acción negativa con un grupo determinado en ausencia de hechos<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>.
- **Pregunta no negativa (contrastante)** (p. ej., «¿Quién de ellos conoce bien el tema?» o «¿Quién se abstiene de una mala acción?»)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>. La pregunta no negativa está formulada para no sonar como una aprobación directa del estereotipo, pero permite verificar el equilibrio de las respuestas del modelo<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>. La comparación de las respuestas a las versiones negativas y neutrales revela sesgos sistemáticos.

Cada uno de estos cuatro ejemplos en el clúster tiene **tres opciones de respuesta**: dos específicas (nombrando a cada uno de los dos grupos involucrados) y una opción que indica la falta de información suficiente (etiquetada como «Unknown» y frases equivalentes)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>. Por ejemplo, en una escena con un cristiano y un musulmán hipotéticos, las opciones de respuesta serían: «el cristiano», «el musulmán» o «desconocido»<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>. Además, la palabra «desconocido» no es siempre la misma; se utilizan 10 expresiones sinónimas<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>.

Adicionalmente, en cada plantilla se cambia automáticamente el **orden de mención de los dos grupos**<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>. Esto se hace para neutralizar el **efecto de orden** —un factor conocido por el cual los modelos pueden elegir más a menudo la primera entidad mencionada, independientemente del contenido<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>.

### Anotación y control de calidad

Cada ejemplo de BBQ fue evaluado por anotadores de *crowdsourcing*: al menos 5 personas independientes respondieron a las preguntas, y solo se incluyeron en el conjunto de datos final aquellos ejemplos en los que **al menos 4 de cada 5 anotadores estuvieron de acuerdo con la respuesta correcta** (por votación)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>. Si alguna pregunta no superaba este umbral, toda la plantilla se revisaba y editaba<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>. Gracias a este proceso, la precisión humana en BBQ es muy alta: los anotadores individuales respondieron correctamente al ~95.7% de las preguntas, y teniendo en cuenta el voto mayoritario, la precisión del estándar de oro alcanza el 99.7%<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>. El alfa de Krippendorff fue de 0.883, lo que indica una **alta consistencia** entre los humanos con respecto a las respuestas correctas<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>. Estas medidas confirman que las tareas de BBQ son comprensibles para las personas y tienen respuestas objetivamente correctas; por lo tanto, los errores de los modelos en estos ejemplos pueden interpretarse razonablemente como manifestaciones de sesgo, y no como ambigüedad en las propias preguntas.

## Evaluación del sesgo de los modelos

BBQ está diseñado para una evaluación multifacética del comportamiento de los modelos en condiciones que provocan sesgos sociales. Al ser probado, un modelo de QA recibe un contexto y una pregunta, y debe elegir una de las tres opciones de respuesta. El análisis de los resultados se realiza en dos niveles<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>:

### Caso de contexto ambiguo

Se mide con qué frecuencia el modelo responde incorrectamente a las preguntas en ausencia de la información necesaria, es decir, **se basa en un estereotipo**<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>. Idealmente, el modelo debería responder «desconocido» a cualquier pregunta con un contexto insuficiente; sin embargo, si elige uno de los grupos, se considera una proyección del estereotipo subyacente<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>. La frecuencia de tales errores y su distribución por categorías dan una idea de la tendencia del modelo a reproducir estereotipos dañinos.

### Caso de contexto informativo

Se evalúa la precisión con la que el modelo responde cuando el contexto contiene una respuesta correcta explícita<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>. Aquí se suele calcular la métrica estándar de **accuracy** (porcentaje de respuestas correctas), que muestra si el modelo es capaz de realizar la tarea de pregunta-respuesta en general. Sin embargo, se presta especial atención a los casos en los que la respuesta correcta va en contra del estereotipo<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>. Los desarrolladores de BBQ analizan si la precisión del modelo disminuye cuando la respuesta correcta contradice un estereotipo arraigado (y, a la inversa, si la precisión es mayor cuando la verdad coincide con la expectativa estereotipada)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>. Tal efecto indicaría que, incluso con hechos, el modelo puede cometer errores debido a un sesgo.

### Bias Score

Para cuantificar el grado de sesgo, se introduce una métrica especial: la **puntuación de sesgo** (*bias score*)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>. En términos generales, el *bias score* refleja el porcentaje de respuestas del modelo (entre las incorrectas o todas, dependiendo de la condición) que coinciden con el estereotipo<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>.

- Un valor de **+100%** significaría que el modelo, en todos los casos, eligió la opción de respuesta que atribuye estereotípicamente una cualidad negativa al grupo objetivo.
- **0%** — sin manifestaciones de sesgo (el modelo siempre responde correctamente/«desconocido», o se equivoca por igual en ambas direcciones).
- Una **puntuación negativa** (hasta -100%) — una tendencia opuesta, donde el modelo siempre responde en contra de la expectativa del estereotipo<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>.

Las puntuaciones se calculan por separado para los contextos ambiguos y desambiguados, ya que la naturaleza de los errores es diferente en cada caso<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>.

- Para las **preguntas ambiguas**, el *bias score* se determina por la proporción de casos en los que el modelo, en lugar de «desconocido», eligió una respuesta específica, y esa respuesta coincidió con un estereotipo negativo<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>. Cuanto más frecuentes sean esas respuestas, mayor será la puntuación positiva. Al mismo tiempo, se tiene en cuenta la precisión: si un modelo se equivoca y acierta («desconocido») en igual medida, incluso con algunos errores estereotipados, la puntuación será menor que la de un modelo que siempre elige la respuesta estereotipada<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>. De este modo, **se penalizan tanto la frecuencia como la confianza de las respuestas sesgadas** (para contextos ambiguos, la métrica se escala teniendo en cuenta el porcentaje de respuestas correctas «desconocido»)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>.
- Para las **preguntas desambiguadas**, el *bias score* se calcula de manera algo diferente, ya que la respuesta correcta es uno de los grupos<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>. En estos casos, se examinan las **respuestas incorrectas** del modelo: la proporción de errores en los que el modelo eligió no la opción correcta, sino una alternativa que coincide con el estereotipo<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>. En otras palabras, si el modelo se equivocó al dar preferencia a un prejuicio (por ejemplo, no creyó en los hechos y respondió según el estereotipo), esto aumenta la puntuación<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>.

El análisis del *bias score* junto con la precisión general permite caracterizar detalladamente el comportamiento del modelo en BBQ. Los autores señalan que una misma *accuracy* puede ocultar diferentes tipos de errores<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>. Por lo tanto, este indicador muestra la **direccionalidad de los errores** y revela casos sutiles que no son visibles solo con la precisión.

## Resultados y patrones identificados

Las pruebas iniciales de varios modelos de QA populares en el conjunto de datos BBQ demostraron una serie de manifestaciones claras de sesgo<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>. En el estudio de Parrish et al. (2022), se probaron tanto modelos grandes y universales (como UnifiedQA, un modelo generalizado para QA basado en T5) como modelos estandarizados de opción múltiple (como RoBERTa con ajuste fino para QA)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>.

Las principales conclusiones de los experimentos fueron:

- **Errores estereotipados fuertes ante la falta de información**. En todos los sistemas probados, se observó una tendencia a responder en línea con el estereotipo cuando el contexto no proporcionaba las pistas necesarias<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>. En otras palabras, los modelos a menudo no elegían la opción «desconocido», sino que preferían una respuesta específica que se correspondía con una expectativa estereotipada<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>. Por ejemplo, en preguntas ambiguas sobre un crimen sin un culpable claro, los modelos a menudo señalaban a personas de un grupo determinado (correspondiente al prejuicio)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>. El *bias score* calculado para los contextos ambiguos resultó ser significativamente superior a cero, y en ocasiones se acercaba a +100% en algunas categorías para ciertos modelos<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>. Los modelos mostraron una propensión especialmente alta a respuestas estereotipadas en escenas relacionadas con la **apariencia física** (obesidad, etc.); esta categoría generó un sesgo notablemente mayor que, por ejemplo, la raza o la orientación sexual<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>. Esto indica una heterogeneidad del sesgo dentro del modelo: algunos tipos de estereotipos son «asimilados» más fuertemente que otros.
- **Mejora con la presencia de hechos, pero persistencia de un sesgo oculto**. Cuando los modelos recibían un contexto desambiguado con una indicación clara de la respuesta correcta, su **precisión aumentaba notablemente** (en comparación con la situación de incertidumbre)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>. Sin embargo, un análisis detallado reveló un efecto sutil: la precisión era **desigual dependiendo de la relación de la respuesta correcta con el estereotipo**<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>. En promedio, los modelos alcanzaron una precisión entre 3 y 3,5 puntos porcentuales mayor en los ejemplos donde la respuesta correcta coincidía con un estereotipo común, en comparación con los ejemplos donde la respuesta correcta contradecía dicho estereotipo<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>. En otras palabras, cuando los hechos confirmaban el prejuicio, los modelos respondían casi sin errores; pero si se requería nombrar una opción «atípica» para el estereotipo, la probabilidad de error aumentaba. Aunque esta brecha de rendimiento no es enorme, se manifestó estadísticamente en muchas categorías<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>. La mayor discrepancia se registró en preguntas relacionadas con estereotipos de género: hasta 5 puntos porcentuales de diferencia<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>. Por lo tanto, se observa una **influencia oculta del sesgo**: los modelos, en promedio, funcionan ligeramente peor «en contra del estereotipo».
- **Comparación de categorías y plantillas**. Los investigadores de BBQ analizaron el *bias score* desglosado por las nueve categorías y descubrieron que, en contextos ambiguos, el indicador es positivo en todas ellas, pero su magnitud varía<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>. Como se mencionó, los mayores sesgos se observaron en las categorías de apariencia física, estatus socioeconómico y algunas interseccionales<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>. Las puntuaciones de sesgo más «bajas», aunque también no nulas, se encontraron en las categorías de raza/etnia y orientación sexual<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>. En contextos desambiguados, el *bias score* es generalmente más cercano a cero (ya que el modelo suele responder correctamente), pero para algunas plantillas sigue siendo positivo, reflejando un sesgo notable en la naturaleza de los errores cometidos<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>. Por ejemplo, en la categoría de religión, la mayoría de los errores iban en una dirección: los modelos, al equivocarse, tendían a elegir la respuesta basada en el prejuicio<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>.

En general, BBQ demostró que incluso los modelos de lenguaje modernos y potentes **claramente no están libres de sesgos sociales**<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>. Tienden a reproducir estereotipos si se les sitúa en condiciones de incertidumbre y pueden mostrar sesgos sutiles incluso en presencia de hechos que exigen una respuesta contraria<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>. Además, la magnitud de estos efectos no es la misma para diferentes grupos: algunos estereotipos son «asimilados» más fuertemente por el modelo<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>. Los autores de BBQ subrayan que, aunque las diferencias encontradas son notables, no son catastróficamente grandes: el *bias score* de la mayoría de los modelos no alcanza valores extremos y a menudo se sitúa en el rango de unas pocas decenas de puntos porcentuales<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-bbq-main-1)</sup>. No obstante, incluso pequeñas desviaciones sistemáticas hacia los estereotipos son potencialmente peligrosas en el uso a gran escala de los LLM, por lo que identificar y eliminar tales sesgos es una tarea importante<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-evaluating-mitigating-3)</sup>. BBQ ha proporcionado a los investigadores una forma clara y cuantitativamente medible de seguir el progreso en esta área<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-evaluating-mitigating-3)</sup>.

## Influencia e investigaciones futuras

El conjunto de datos BBQ rápidamente ganó reconocimiento como una herramienta estándar para evaluar las características de equidad (*fairness*) de los modelos de lenguaje<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-paperswithcode-bbq-4)</sup>. Su **código fuente y datos abiertos** están disponibles en un repositorio (bajo licencia CC BY 4.0)<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-paperswithcode-bbq-4)</sup>, lo que ha permitido a una amplia comunidad de investigadores aplicar BBQ en el desarrollo y prueba de nuevos modelos. En varias revisiones, BBQ se menciona junto con otros benchmarks (como StereoSet, WinoBias, ToxiGen) como un hito importante en el estudio del sesgo social en PNL<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-evaluating-mitigating-3)</sup>. Desde la publicación de BBQ, han surgido trabajos que desarrollan sus ideas y las adaptan a nuevas condiciones:

- **Ampliación de los formatos de pregunta (Open-BBQ)**. El BBQ original propone tareas en formato de opción múltiple<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-evaluating-mitigating-3)</sup>. En 2024, se propuso una modificación de BBQ para **respuestas abiertas**, que incluye tareas de rellenar espacios en blanco y respuestas de texto corto<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-evaluating-mitigating-3)</sup>. Esta versión, llamada provisionalmente Open-BBQ, permite evaluar el sesgo en condiciones de diálogo más libres, donde el modelo no tiene opciones de respuesta fijas<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-evaluating-mitigating-3)</sup>. La investigación demostró que los LLM, al generar texto libre, también muestran un mayor sesgo contra ciertos grupos<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-evaluating-mitigating-3)</sup>. Los autores de Open-BBQ también experimentaron con métodos para mitigar el sesgo, combinando *prompts* *zero-shot* y *few-shot* y *chain-of-thought* (razonamiento paso a paso)<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-evaluating-mitigating-3)</sup>. Estos métodos permitieron reducir notablemente el nivel de sesgo en las respuestas<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-evaluating-mitigating-3)</sup>. Open-BBQ complementó el conjunto de datos original, haciendo posible probar modelos generativos en formatos más cercanos a las consultas de los usuarios.

<!-- -->

- **Adaptación cultural (localización)**. Dado que BBQ está ligado a las realidades sociales de EE. UU., los investigadores se interesaron en adaptarlo a otros idiomas y culturas<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-kobbg-5)</sup>. En 2023, científicos coreanos presentaron el conjunto de datos **KoBBQ** (Korean BBQ), un análogo coreano del Bias Benchmark<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-kobbg-5)</sup>. Desarrollaron un enfoque general para la localización de BBQ: dividieron las plantillas originales en tres categorías: las que se pueden traducir directamente, las que requieren reemplazar grupos con equivalentes locales y las que no son aplicables en el contexto coreano<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-kobbg-5)</sup>. Además, KoBBQ introdujo 4 nuevas categorías de estereotipos específicos de la sociedad coreana y eliminó una serie de ejemplos no pertinentes<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-kobbg-5)</sup>. El resultado fue un conjunto de 268 plantillas y 76,048 ejemplos en coreano, que abarca 12 categorías de sesgo social (incluidas las originales y las nuevas)<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-kobbg-5)</sup>. Las pruebas de modelos multilingües en KoBBQ revelaron diferencias significativas en el nivel de sesgo en comparación con la traducción automática directa del BBQ original al coreano<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-kobbg-5)</sup>. Esto subraya que **la traducción directa no es suficiente**: se necesitan benchmarks culturalmente específicos que tengan en cuenta los estereotipos y el contexto únicos de cada país<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-kobbg-5)</sup>. El trabajo en KoBBQ demostró la viabilidad de escalar la metodología de BBQ a nivel mundial.

BBQ se ha convertido en una parte integral de la investigación sobre la **ética de la inteligencia artificial**<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-evaluating-mitigating-3)</sup>. Su influencia se observa en la aparición de nuevas técnicas de eliminación de sesgos (*debiasing*) en los modelos, la construcción de conjuntos de datos más inclusivos y métricas para el análisis detallado del sesgo. Los investigadores señalan que una de las fortalezas de BBQ es la amplitud de su cobertura y el esmero en la construcción de los ejemplos<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-evaluating-mitigating-3)</sup>. En respuesta a los desafíos planteados por BBQ, recientemente se han desarrollado activamente **estrategias para mitigar el sesgo**, desde el filtrado de datos de entrenamiento hasta algoritmos especiales de post-procesamiento y ajuste fino de los LLM para obtener respuestas justas<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-evaluating-mitigating-3)</sup>.

En resumen, BBQ (Bias Benchmark for QA) se ha consolidado como una herramienta valiosa y fiable para medir los sesgos sociales en los modelos de lenguaje. Proporciona a la comunidad investigadora un conjunto estándar de pruebas que permite comparar modelos en cuanto a su estereotipia y seguir el progreso en la mejora de su imparcialidad<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-evaluating-mitigating-3)</sup>. BBQ continúa expandiéndose y adaptándose, reflejando el interés global en la creación de **sistemas de IA más justos y seguros**<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_note-arxiv-evaluating-mitigating-3)</sup>, libres de sesgos dañinos, sutiles pero significativos.

## Enlaces externos

- <a href="https://arxiv.org/abs/2110.08193" class="external text" rel="nofollow">Artículo original de BBQ (arXiv)</a>
- <a href="https://github.com/nyu-mll/BBQ" class="external text" rel="nofollow">Repositorio de BBQ en GitHub</a>
- <a href="https://paperswithcode.com/dataset/bbq" class="external text" rel="nofollow">Página del dataset BBQ en Papers With Code</a>
- <a href="https://aclanthology.org/2022.findings-acl.165/" class="external text" rel="nofollow">Artículo de BBQ en ACL Anthology</a>
- <a href="https://arxiv.org/abs/2307.16778" class="external text" rel="nofollow">Artículo sobre el dataset KoBBQ (arXiv)</a>
- <a href="https://arxiv.org/html/2412.06134v1" class="external text" rel="nofollow">Artículo sobre el dataset Open-BBQ (arXiv)</a>

## Literatura

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. <a href="https://arxiv.org/abs/2211.09110" class="external text" rel="nofollow">arXiv:2211.09110</a>.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. <a href="https://arxiv.org/abs/2307.03109" class="external text" rel="nofollow">arXiv:2307.03109</a>.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. <a href="https://arxiv.org/abs/2508.15361" class="external text" rel="nofollow">arXiv:2508.15361</a>.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. <a href="https://arxiv.org/abs/2405.14782" class="external text" rel="nofollow">arXiv:2405.14782</a>.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. <a href="https://arxiv.org/abs/2104.14337" class="external text" rel="nofollow">arXiv:2104.14337</a>.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. <a href="https://arxiv.org/abs/2106.06052" class="external text" rel="nofollow">arXiv:2106.06052</a>.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. <a href="https://arxiv.org/abs/2101.04840" class="external text" rel="nofollow">arXiv:2101.04840</a>.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. <a href="https://arxiv.org/abs/2406.04244" class="external text" rel="nofollow">arXiv:2406.04244</a>.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. <a href="https://arxiv.org/abs/2506.11094" class="external text" rel="nofollow">arXiv:2506.11094</a>.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. <a href="https://arxiv.org/abs/2403.04132" class="external text" rel="nofollow">arXiv:2403.04132</a>.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. <a href="https://arxiv.org/abs/2311.17295" class="external text" rel="nofollow">arXiv:2311.17295</a>.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. <a href="https://arxiv.org/abs/2311.05232" class="external text" rel="nofollow">arXiv:2311.05232</a>.

## Referencias

1.  <span id="cite_note-arxiv-bbq-main-1">↑ <sup>[1.00](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-11)</sup> <sup>[1.12](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-12)</sup> <sup>[1.13](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-13)</sup> <sup>[1.14](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-14)</sup> <sup>[1.15](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-15)</sup> <sup>[1.16](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-16)</sup> <sup>[1.17](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-17)</sup> <sup>[1.18](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-18)</sup> <sup>[1.19](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-19)</sup> <sup>[1.20](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-20)</sup> <sup>[1.21](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-21)</sup> <sup>[1.22](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-22)</sup> <sup>[1.23](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-23)</sup> <sup>[1.24](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-24)</sup> <sup>[1.25](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-25)</sup> <sup>[1.26](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-26)</sup> <sup>[1.27](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-27)</sup> <sup>[1.28](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-28)</sup> <sup>[1.29](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-29)</sup> <sup>[1.30](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-30)</sup> <sup>[1.31](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-31)</sup> <sup>[1.32](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-32)</sup> <sup>[1.33](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-33)</sup> <sup>[1.34](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-34)</sup> <sup>[1.35](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-35)</sup> <sup>[1.36](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-36)</sup> <sup>[1.37](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-37)</sup> <sup>[1.38](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-38)</sup> <sup>[1.39](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-39)</sup> <sup>[1.40](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-40)</sup> <sup>[1.41](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-41)</sup> <sup>[1.42](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-42)</sup> <sup>[1.43](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-43)</sup> <sup>[1.44](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-44)</sup> <sup>[1.45](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-45)</sup> <sup>[1.46](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-46)</sup> <sup>[1.47](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-47)</sup> <sup>[1.48](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-48)</sup> <sup>[1.49](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-49)</sup> <sup>[1.50](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-50)</sup> <sup>[1.51](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-51)</sup> <sup>[1.52](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-52)</sup> <sup>[1.53](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-53)</sup> <sup>[1.54](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-54)</sup> <sup>[1.55](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-55)</sup> <sup>[1.56](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-56)</sup> <sup>[1.57](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-57)</sup> <sup>[1.58](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-58)</sup> <sup>[1.59](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-59)</sup> <sup>[1.60](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-60)</sup> <sup>[1.61](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-61)</sup> <sup>[1.62](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-62)</sup> <sup>[1.63](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-63)</sup> <sup>[1.64](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-64)</sup> <sup>[1.65](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-65)</sup> <sup>[1.66](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-66)</sup> <sup>[1.67](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-67)</sup> <sup>[1.68](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-68)</sup> <sup>[1.69](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-69)</sup> <sup>[1.70](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-70)</sup> <sup>[1.71](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-71)</sup> <sup>[1.72](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-72)</sup> <sup>[1.73](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-73)</sup> <sup>[1.74](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-74)</sup> <sup>[1.75](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-75)</sup> <sup>[1.76](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-76)</sup> <sup>[1.77](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-77)</sup> <sup>[1.78](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-78)</sup> <sup>[1.79](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-79)</sup> <sup>[1.80](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-bbq-main_1-80)</sup> Parrish A. et al. «BBQ: A Hand-Built Bias Benchmark for Question Answering». *arXiv*. <a href="https://arxiv.org/abs/2110.08193" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-acl-anthology-2">[↑](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-acl-anthology_2-0) Parrish A. et al. «BBQ: A hand-built bias benchmark for question answering». *ACL Anthology*. <a href="https://aclanthology.org/2022.findings-acl.165/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-arxiv-evaluating-mitigating-3">↑ <sup>[3.00](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-evaluating-mitigating_3-0)</sup> <sup>[3.01](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-evaluating-mitigating_3-1)</sup> <sup>[3.02](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-evaluating-mitigating_3-2)</sup> <sup>[3.03](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-evaluating-mitigating_3-3)</sup> <sup>[3.04](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-evaluating-mitigating_3-4)</sup> <sup>[3.05](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-evaluating-mitigating_3-5)</sup> <sup>[3.06](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-evaluating-mitigating_3-6)</sup> <sup>[3.07](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-evaluating-mitigating_3-7)</sup> <sup>[3.08](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-evaluating-mitigating_3-8)</sup> <sup>[3.09](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-evaluating-mitigating_3-9)</sup> <sup>[3.10](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-evaluating-mitigating_3-10)</sup> <sup>[3.11](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-evaluating-mitigating_3-11)</sup> <sup>[3.12](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-evaluating-mitigating_3-12)</sup> <sup>[3.13](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-evaluating-mitigating_3-13)</sup> <sup>[3.14](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-evaluating-mitigating_3-14)</sup> <sup>[3.15](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-evaluating-mitigating_3-15)</sup> Liu Z. et al. (2024). «Evaluating and Mitigating Social Bias for Large Language Models in Open-ended Settings». *arXiv preprint*. <a href="https://arxiv.org/html/2412.06134v1" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-paperswithcode-bbq-4">↑ <sup>[4.0](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-paperswithcode-bbq_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-paperswithcode-bbq_4-1)</sup> <sup>[4.2](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-paperswithcode-bbq_4-2)</sup> <sup>[4.3](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-paperswithcode-bbq_4-3)</sup> <sup>[4.4](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-paperswithcode-bbq_4-4)</sup> <sup>[4.5](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-paperswithcode-bbq_4-5)</sup> «BBQ Dataset». *Papers With Code*. <a href="https://paperswithcode.com/dataset/bbq" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-arxiv-kobbg-5">↑ <sup>[5.0](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-kobbg_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-kobbg_5-1)</sup> <sup>[5.2](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-kobbg_5-2)</sup> <sup>[5.3](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-kobbg_5-3)</sup> <sup>[5.4](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-kobbg_5-4)</sup> <sup>[5.5](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-kobbg_5-5)</sup> <sup>[5.6](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(ES)#cite_ref-arxiv-kobbg_5-6)</sup> Jin J. et al. (2024). «KoBBQ: Korean Bias Benchmark for Question Answering». *arXiv preprint*. <a href="https://arxiv.org/abs/2307.16778" class="external autonumber" rel="nofollow">[5]</a></span>
