---
title: "BBQ (Bias Benchmark for Question Answering) (FA)"
source: "https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)"
wiki: "systems-analysis.info/int"
article: "BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)"
language: "fa"
categories:
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
  - "Category:Persian"
revision_id: 519
wiki_created_at: 2026-09-06T22:34:56Z
wiki_modified_at: 2026-09-06T22:34:56Z
downloaded_at: 2026-09-07T22:40:41Z
---

# BBQ (Bias Benchmark for Question Answering) (FA)

**BBQ** (Bias Benchmark for Question Answering) یک **مجموعه داده** برای ارزیابی **تعصبات اجتماعی** (bias) در سیستم‌های پرسش و پاسخ (QA) است<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>. این مجموعه توسط گروهی از پژوهشگران دانشگاه نیویورک به سرپرستی الیشا پریش (Alicia Parrish) توسعه یافته و در سال ۲۰۲۲ در کنفرانس ACL Findings منتشر شده است<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)[\[2\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-acl-anthology-2)</sup>. هدف BBQ شناسایی این است که چگونه مدل‌های زبانی بزرگ (LLM) و سایر مدل‌های QA در پاسخ به سؤالات، به‌ویژه در وظایف کاربردی پاسخ به سؤال به زبان طبیعی، کلیشه‌ها و تعصبات را بروز می‌دهند<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>. BBQ به یکی از جامع‌ترین benchmark‌ها برای ارزیابی تعصب اجتماعی در NLP تبدیل شده و طیف گسترده‌ای از کلیشه‌ها را در قالب نه دسته اجتماعی پوشش می‌دهد<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-evaluating-mitigating-3)</sup>.

این مجموعه داده کارهای پیشین مانند dataset UnQover (2020) را تکمیل می‌کند که تعصب را برای تعداد محدودی از ویژگی‌ها (جنسیت-حرفه، ملیت، قومیت، مذهب) اندازه‌گیری می‌کرد و بر احتمالات مدل‌ها، نه خود پاسخ‌ها، متکی بود<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-evaluating-mitigating-3)</sup>. برخلاف UnQover، BBQ مستقیماً محتوای پاسخ‌های مدل‌ها و انتخاب آن‌ها از میان گزینه‌های پیشنهادی را تحلیل می‌کند و این امکان را می‌دهد که تعصب دقیقاً در سطح نتایج تولیدشده ارزیابی شود<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>.

نویسندگان BBQ آن را به‌عنوان ابزاری برای تشخیص **کلیشه‌های اجتماعی مضر** در مدل‌ها و کاهش خطر تأثیر منفی چنین کلیشه‌هایی بر گروه‌های آسیب‌پذیر جامعه معرفی می‌کنند<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>. این مجموعه بر کلیشه‌های مرتبط با فرهنگ انگلیسی‌زبان آمریکا متمرکز است و همه زمینه‌های فرهنگی ممکن را پوشش نمی‌دهد<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>. با این حال، BBQ پایه‌ای برای پژوهش‌های بعدی در زمینه اندازه‌گیری و کاهش تعصب اجتماعی در NLP گذاشته و به معیاری برای مقایسه مدل‌ها از نظر انطباق اخلاقی تبدیل شده است.

## ترکیب و ساختار مجموعه داده

BBQ حاوی حدود **۵۸٫۵ هزار پرسش و پاسخ** است که در مجموعه‌های ویژه‌ای برای شناسایی کلیشه‌های خاص دسته‌بندی شده‌اند<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-paperswithcode-bbq-4)</sup>. تمام نمونه‌ها **به‌صورت دستی** توسط نویسندگان بر اساس موارد مستند از تعصبات و کلیشه‌هایی که به اعضای گروه‌های مختلف اجتماعی آسیب می‌رسانند، تهیه شده‌اند<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-paperswithcode-bbq-4)</sup>. در ساخت سناریوها از داده‌های پژوهش‌های علمی، مقالات رسانه‌ای، گزارش‌ها و سایر منابع معتبری که وجود یک کلیشه خاص و پیامدهای مضر آن را تأیید می‌کنند استفاده شده است<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>. برای هر موقعیت، نویسندگان ارجاعی به منبعی ارائه می‌دهند که کلیشه مورد نظر در آن به‌عنوان منفی یا مضر توصیف شده است (مانند مقاله علمی یا خبر)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>.

### دسته‌های اجتماعی

BBQ **نه دسته اجتماعی اصلی** را پوشش می‌دهد (که بیشتر با گروه‌های تحت حمایت در تعریف کمیسیون فرصت‌های شغلی برابر ایالات متحده مطابقت دارند)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>:

- **سن** – تعصب نسبت به گروه‌های سنی (برای مثال، کلیشه کاهش توانایی‌های شناختی در افراد مسن)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>.
- **معلولیت** – کلیشه‌هایی درباره توانایی‌های ذهنی یا سایر ویژگی‌های افراد دارای معلولیت (برای مثال، تصور اینکه افراد دارای محدودیت جسمی از نظر فکری کمتر شایسته‌اند)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>.
- **هویت جنسیتی** – کلیشه‌های جنسیتی (برای مثال، این ایده که «دختران در ریاضی ضعیف هستند»)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>.
- **ملیت** – تعصبات ملی-قومی (برای مثال، کلیشه بی‌سوادی فناورانه در مورد افراد آفریقایی)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>.
- **ظاهر** – تبعیض بر اساس ظاهر و اندام (برای مثال، این باور که افراد چاق کمتر باهوش یا سخت‌کوش هستند)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>.
- **نژاد/قومیت** – کلیشه‌های نژادی (برای مثال، ربط دادن مغرضانه نژاد خاصی با جرم یا اعتیاد)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>.
- **مذهب** – کلیشه‌های مذهبی (برای مثال، تصور یهودیان به‌عنوان حریص یا مسلمانان به‌عنوان مستعد خشونت و غیره)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>.
- **وضعیت اجتماعی-اقتصادی** – تعصب نسبت به اقشار فقیر یا ثروتمند جامعه (برای مثال، این باور که افراد برخاسته از خانواده‌های فقیر والدین بدی خواهند بود)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>.
- **گرایش جنسی** – کلیشه‌های هموفوبیک (برای مثال، ارتباط دادن نادرست همجنس‌گرایی با بیماری HIV)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>.

علاوه بر این نه دسته، BBQ دو **دسته بین‌بخشی** (intersectional biases) را نیز دربر می‌گیرد که دو ویژگی را با هم ترکیب می‌کنند: (۱) جنسیت در ترکیب با نژاد/قومیت و (۲) وضعیت اجتماعی-اقتصادی در ترکیب با نژاد<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>. این موارد، کلیشه‌هایی را در نقطه تلاقی گروه‌های مختلف در نظر می‌گیرند (برای مثال، تعصب خاص علیه زنان سیاه‌پوست یا علیه اقوام خاصی از طبقات اجتماعی پایین).

### قالب‌ها و تولید نمونه‌ها

برای هر دسته، تیم تحقیق **قالب‌های سناریو** نوشت — طرح‌های کوتاهی که در آن‌ها دو شخصیت که از نظر ویژگی هدف متفاوت هستند حضور دارند (برای مثال، جوان و پیر، مرد و زن، ثروتمند و فقیر و غیره)<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-paperswithcode-bbq-4)</sup>. در قالب، موقعیتی گنجانده شده که می‌توانست کلیشه‌ای شناخته‌شده را تأیید یا رد کند. به هر سناریو سؤال‌ها و گزینه‌های پاسخ مرتبط است.

در مجموع ۲۵ قالب منحصر به فرد برای هر یک از نه دسته اصلی تهیه شده، به‌علاوه ۲۵ قالب اضافی برای دسته‌های نژاد و جنسیت با استفاده از اسامی واقعی (برای بررسی تعصب در سطح اسامی خاص)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>. همچنین برای دو جهت بین‌بخشی، ۲۵ قالب ایجاد شده است<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>. بدین ترتیب، تعداد کل سناریوهای پایه از ۳۰۰ فراتر می‌رود.

هر قالب دارای **جای‌خالی‌هایی برای متغیرها** است — نام گروه‌ها یا توصیفاتی که در متن جایگذاری می‌شوند (برای مثال، در قالب مربوط به سن، اعداد مختلف به‌جای «\_ساله» گذاشته می‌شوند، یا در ظاهر — صفاتی مانند «چاق»/«لاغر» و غیره)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>. از طریق جایگذاری مقادیر مختلف و تغییر ترتیب ذکر دو شخصیت، هر قالب به مجموعه‌ای از نمونه‌های مشخص (حداقل ۸ و تا حدود ۲۰۰ تغییر) گسترش می‌یابد<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>. معمولاً از یک قالب حداقل ۱۰۰ سؤال نهایی تولید می‌شود و در برخی موارد تا دویست سؤال<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>. در مجموع، پیکره‌ای متشکل از ۵۸٬۴۹۲ نمونه (ترکیب‌های منحصر به فرد سناریو، سؤال و پاسخ) به دست آمد<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-paperswithcode-bbq-4)</sup>.

### زمینه‌ها و انواع سؤالات

ویژگی کلیدی BBQ این است که هر موقعیت در دو نسخه زمینه و دو صورت‌بندی سؤال ارائه می‌شود و مجموعه‌ای از **چهار سؤال** (به اصطلاح خوشه ۴تایی) تشکیل می‌دهد<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>. این کار برای جداسازی تأثیر کمبود اطلاعات از کلیشه‌های خود مدل انجام می‌شود. در هر چهارتایی<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>:

- **زمینه مبهم** (under-informative or ambiguous context): متنی که در آن موقعیتی با حضور دو نفر از گروه‌های متفاوت توصیف شده، اما اطلاعات کافی برای پاسخ قطعی به سؤال مطرح‌شده وجود ندارد<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>. پاسخ صحیح در چنین مواردی همیشه گزینه «نامشخص» است (یعنی فقدان داده‌های کافی)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>. این نمونه‌ها برای بررسی اینکه آیا مدل بر اساس کلیشه نتیجه‌گیری می‌کند یا نه، طراحی شده‌اند.
- **زمینه صریح** (disambiguated context): سناریوی توسعه‌یافته‌ای که در آن جزئیات روشن‌کننده‌ای اضافه شده و مشخص می‌کند کدام یک از دو نفر ذکرشده پاسخ سؤال است<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>. در این حالت، یکی از دو شخصیت قطعاً پاسخ صحیح است (و گزینه «نامشخص» دیگر درست نیست). زمینه صریح برای بررسی این است که آیا مدل می‌تواند بر تعصب احتمالی خود غلبه کند و پاسخ صحیح را انتخاب کند، حتی اگر کلیشه چیز دیگری را القا کند<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>.
- **سؤال منفی** (مثلاً «کدام‌یک از آن‌ها موضوع را بد بلد است؟»، «چه کسی مرتکب جرم شد؟»)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>. چنین سؤالی در ترکیب با زمینه مبهم بررسی می‌کند که آیا مدل تمایل دارد در غیاب واقعیت، عمل منفی را با گروه خاصی مرتبط کند<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>.
- **سؤال غیرمنفی (متضاد)** (مثلاً «کدام‌یک از آن‌ها موضوع را خوب بلد است؟» یا «چه کسی از انجام عمل بد خودداری می‌کند؟»)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>. سؤال غیرمنفی به گونه‌ای تنظیم شده که به‌طور مستقیم کلیشه را تأیید نکند، اما در عین حال امکان بررسی تعادل پاسخ‌های مدل را فراهم کند<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>. مقایسه پاسخ‌ها به نسخه‌های منفی و خنثی، انحرافات سیستماتیک را آشکار می‌سازد.

هر یک از این چهار نمونه در خوشه دارای **سه گزینه پاسخ** است: دو گزینه مشخص (که هر یک از دو گروه حاضر در صحنه را نام می‌برند) و یک گزینه که بر فقدان اطلاعات کافی دلالت دارد (با برچسب «Unknown» و عبارات معادل)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>. برای مثال، در صحنه‌ای که یک مسیحی فرضی و یک مسلمان در آن حضور دارند، گزینه‌های پاسخ عبارتند از: «مسیحی»، «مسلمان» یا «نامشخص»<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>. ضمناً واژه «نامشخص» همیشه یکسان نیست — از ۱۰ عبارت مترادف استفاده می‌شود<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>.

علاوه بر این، در هر قالب **ترتیب ذکر دو گروه** به‌طور خودکار تغییر می‌کند<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>. این کار برای از بین بردن **اثر ترتیب** انجام می‌شود — عاملی شناخته‌شده که در آن مدل‌ها ممکن است صرف‌نظر از محتوا، موجودیت نخست ذکرشده را بیشتر انتخاب کنند<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>.

### حاشیه‌نویسی و کنترل کیفیت

هر نمونه BBQ توسط حاشیه‌نویسان برون‌سپاری‌شده ارزیابی شد: حداقل ۵ نفر مستقل به سؤالات پاسخ دادند و تنها نمونه‌هایی که **حداقل ۴ نفر از ۵ حاشیه‌نویس با پاسخ صحیح آن توافق داشتند** (از طریق رأی‌گیری) در dataset نهایی گنجانده شدند<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>. اگر سؤالی از این آستانه نمی‌گذشت، کل قالب بازبینی و ویرایش می‌شد<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>. به لطف این فرایند، دقت انسانی در BBQ بسیار بالاست: حاشیه‌نویسان انفرادی به‌درستی به حدود ۹۵٫۷٪ سؤالات پاسخ دادند، و با احتساب اکثریت آرا، دقت استاندارد طلایی به ۹۹٫۷٪ می‌رسد<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>. ضریب کاپا توافق (Krippendorff's alpha) برابر ۰٫۸۸۳ است که نشان‌دهنده **توافق بالا** میان افراد درباره پاسخ‌های صحیح است<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>. این اقدامات تأیید می‌کنند که وظایف BBQ برای انسان‌ها قابل فهم بوده و پاسخ‌های عینی درستی دارند؛ بنابراین، خطاهای مدل‌ها در این نمونه‌ها را می‌توان به‌طور موجهی به‌عنوان نشانه‌های تعصب تفسیر کرد، نه ابهام خود سؤالات.

## ارزیابی تعصب مدل‌ها

BBQ برای ارزیابی چندبُعدی رفتار مدل‌ها در شرایطی که تعصب اجتماعی را تحریک می‌کنند طراحی شده است. در هنگام آزمایش، مدل QA زمینه و سؤال را دریافت می‌کند و باید یکی از سه گزینه پاسخ را انتخاب کند. تحلیل نتایج در دو سطح انجام می‌شود<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>:

### حالت زمینه مبهم

اندازه‌گیری می‌شود که مدل چند بار در غیاب اطلاعات لازم به‌درستی پاسخ نمی‌دهد، یعنی **بر کلیشه تکیه می‌کند**<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>. در حالت ایده‌آل، مدل باید به هر سؤال با زمینه ناکافی «نامشخص» پاسخ دهد، اما اگر یکی از گروه‌ها را انتخاب کند، این به‌عنوان بازتاب کلیشه نهفته تلقی می‌شود<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>. فراوانی چنین خطاهایی و توزیع آن‌ها در دسته‌ها، تصویری از تمایل مدل به بازتولید کلیشه‌های مضر ارائه می‌دهد.

### حالت زمینه اطلاعاتی

ارزیابی می‌شود که مدل چقدر دقیق پاسخ می‌دهد، وقتی زمینه حاوی پاسخ صحیح صریح است<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>. در اینجا معمولاً معیار استاندارد **accuracy** (درصد پاسخ‌های صحیح) محاسبه می‌شود — نشان می‌دهد که آیا مدل اصولاً با وظیفه پرسش و پاسخ کنار می‌آید. اما توجه ویژه به مواردی معطوف است که پاسخ صحیح با کلیشه در تضاد است<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>. توسعه‌دهندگان BBQ تحلیل می‌کنند که آیا دقت مدل کاهش می‌یابد وقتی پاسخ درست با کلیشه رسوخ‌یافته‌ای مغایرت دارد (و برعکس، آیا دقت بالاتر است وقتی حقیقت با انتظار کلیشه‌ای مطابقت دارد)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>. چنین اثری نشان می‌دهد که حتی در حضور واقعیت‌ها، مدل ممکن است به دلیل تعصب اشتباه کند.

### Bias Score

برای ارزیابی کمی میزان تعصب، معیار ویژه‌ای معرفی می‌شود — **امتیاز تعصب** (bias score)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>. به‌طور کلی، bias score درصد پاسخ‌های مدل (در میان پاسخ‌های نادرست یا همه پاسخ‌ها، بسته به شرط) را نشان می‌دهد که با کلیشه مطابقت دارند<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>.

- مقدار **+۱۰۰٪** به این معناست که مدل در همه موارد گزینه‌ای را انتخاب کرده که به‌صورت کلیشه‌ای ویژگی منفی را به گروه هدف نسبت می‌دهد.
- **۰٪** — هیچ تعصبی وجود ندارد (مدل یا همیشه پاسخ صحیح/«نامشخص» می‌دهد، یا به‌یکسان در هر دو جهت اشتباه می‌کند).
- **امتیاز منفی** (تا -۱۰۰٪) — گرایش معکوس، وقتی مدل همیشه برخلاف انتظار کلیشه پاسخ می‌دهد<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>.

امتیازها به‌صورت جداگانه برای زمینه‌های مبهم و صریح محاسبه می‌شوند، زیرا ماهیت خطاها در آن‌ها متفاوت است<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>.

- برای **سؤالات مبهم**، bias score بر اساس نسبت مواردی تعیین می‌شود که مدل به‌جای «نامشخص» پاسخ مشخصی انتخاب کرده و آن پاسخ با کلیشه منفی مطابقت داشته<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>. هرچه چنین پاسخ‌هایی بیشتر باشد، امتیاز مثبت بالاتر است. در این میان، دقت در نظر گرفته می‌شود: اگر مدل به‌یکسان اشتباه کند و پاسخ صحیح («نامشخص») بدهد، حتی با وجود بخشی از خطاهای کلیشه‌ای، امتیاز پایین‌تر از مدلی خواهد بود که همیشه پاسخ کلیشه‌ای می‌دهد<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>. بدین ترتیب، **هم فراوانی و هم اطمینان پاسخ‌های bias جریمه می‌شوند** (برای زمینه‌های مبهم، معیار با در نظر گرفتن درصد پاسخ‌های صحیح «نامشخص» مقیاس‌بندی می‌شود)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>.
- برای **سؤالات صریح**، bias score به‌گونه‌ای متفاوت محاسبه می‌شود، زیرا اینجا پاسخ صحیح یکی از گروه‌هاست<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>. در این موارد، **پاسخ‌های نادرست** مدل بررسی می‌شوند: نسبت خطاهایی که مدل در آن‌ها نه گزینه صحیح، بلکه گزینه جایگزین منطبق با کلیشه را انتخاب کرده<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>. به‌بیان دیگر، اگر مدل با دادن اولویت به تعصب اشتباه کند (مثلاً به واقعیت اعتماد نکرده و بر اساس کلیشه پاسخ دهد)، این امر امتیاز را افزایش می‌دهد<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>.

تحلیل bias score به‌همراه دقت کلی امکان توصیف دقیق رفتار مدل در BBQ را فراهم می‌کند. نویسندگان اشاره می‌کنند که accuracy یکسان ممکن است ماهیت متفاوتی از خطاها را پنهان کند<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>. بنابراین، این معیار **جهت‌گیری خطاها** را نشان داده و موارد ظریفی را که با دقت تنها قابل مشاهده نیستند آشکار می‌سازد.

## نتایج و الگوهای کشف‌شده

آزمایش اولیه چند مدل QA محبوب بر روی مجموعه BBQ تعدادی از نشانه‌های آشکار تعصب را نمایان ساخت<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>. در پژوهش Parrish و همکاران (2022) هم مدل‌های بزرگ عمومی (مانند UnifiedQA — مدل تعمیم‌یافته برای QA بر پایه T5) و هم مدل‌های استانداردشده انتخاب چندگانه (مانند RoBERTa با fine-tuning بر QA) آزمایش شدند<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>.

نتیجه‌گیری‌های اصلی از نتایج آزمایش‌ها:

- **خطاهای کلیشه‌ای قوی در کمبود اطلاعات**. در تمام سیستم‌های آزمایش‌شده، گرایشی به پاسخ دادن در قالب کلیشه مشاهده شد، وقتی زمینه سرنخ‌های لازم را نمی‌داد<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>. به‌بیان دیگر، مدل‌ها اغلب گزینه «نامشخص» را انتخاب نکرده و پاسخ مشخصی را که با انتظار کلیشه‌ای خاصی مطابقت داشت ترجیح می‌دادند<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>. برای مثال، در سؤالات مبهم درباره جرمی بدون مقصر مشخص، مدل‌ها اغلب به افرادی از گروه خاصی (مطابق با تعصب) اشاره می‌کردند<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>. bias score محاسبه‌شده برای زمینه‌های مبهم به‌طور قابل توجهی بالاتر از صفر بود و گاهی در برخی دسته‌ها و برخی مدل‌ها به +۱۰۰٪ نزدیک می‌شد<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>. مدل‌ها به‌ویژه در صحنه‌های مرتبط با **ظاهر** (چاقی و غیره) تمایل بیشتری به پاسخ‌های کلیشه‌ای نشان دادند — این دسته تعصب بارزتری نسبت به، مثلاً، نژاد یا گرایش جنسی نشان داد<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>. این نشان‌دهنده ناهمگونی تعصب در درون مدل است — برخی انواع کلیشه‌ها را قوی‌تر «فراگرفته» است.
- **بهبود در حضور واقعیت‌ها، اما حفظ تعصب پنهان**. وقتی مدل‌ها زمینه صریحی با نشانه‌گذاری آشکار پاسخ صحیح دریافت کردند، **دقت آن‌ها به‌طور قابل توجهی افزایش یافت** (در مقایسه با حالت نامشخص)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>. اما تحلیل دقیق اثر ظریفی را آشکار کرد: دقت بسته به رابطه پاسخ صحیح با کلیشه **ناهمگون بود**<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>. به‌طور میانگین، مدل‌ها در نمونه‌هایی که پاسخ صحیح با کلیشه رایج مطابقت داشت حدود ۳-۳٫۵ درصد دقت بالاتری داشتند در مقایسه با نمونه‌هایی که پاسخ درست با آن کلیشه در تضاد بود<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>. به‌بیان دیگر، وقتی واقعیت‌ها تعصب را تأیید می‌کردند، مدل‌ها تقریباً بی‌خطا پاسخ می‌دادند؛ اما اگر لازم بود گزینه‌ای «غیرمعمول» برای کلیشه نام برده شود، احتمال خطا افزایش می‌یافت. این شکاف در عملکرد هرچند بزرگ نیست، در بسیاری از دسته‌ها به‌صورت آماری ظاهر شد<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>. بیشترین تفاوت برای سؤالات مرتبط با کلیشه‌های جنسیتی ثبت شد: تا ۵ درصد تفاوت<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>. بنابراین، **تأثیر پنهان تعصب** قابل ردیابی است: مدل‌ها به‌طور میانگین کمی بدتر «برخلاف کلیشه» کار می‌کنند.
- **مقایسه دسته‌ها و قالب‌ها**. پژوهشگران BBQ، bias score را در تمام نه دسته تجزیه‌وتحلیل کردند و دریافتند که در زمینه‌های مبهم، این امتیاز در همه دسته‌ها مثبت است، اما اندازه آن متغیر است<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>. همان‌طور که گفته شد، بیشترین تعصب در دسته‌های ظاهر جسمانی، وضعیت اجتماعی-اقتصادی و برخی از دسته‌های تقاطعی مشاهده شد<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>. bias score «پایین‌تر»، هرچند باز هم غیرصفر، در دسته‌های نژاد/قومیت و گرایش جنسی مشاهده شد<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>. در زمینه‌های صریح، bias score به‌طور کلی به صفر نزدیک‌تر است (چون مدل اغلب درست پاسخ می‌دهد)، اما برای برخی قالب‌ها همچنان مثبت باقی می‌ماند که انحراف قابل توجهی در ماهیت خطاهای رخ‌داده را نشان می‌دهد<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>. برای مثال، در دسته مذهب اکثر خطاها یک‌سویه بودند — مدل‌ها معمولاً هنگام اشتباه، پاسخ مبتنی بر تعصب را انتخاب می‌کردند<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>.

به‌طور کلی، BBQ نشان داد که حتی مدل‌های زبانی مدرن قدرتمند **آشکارا از تعصبات اجتماعی مبرا نیستند**<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>. آن‌ها تمایل دارند در شرایط عدم قطعیت کلیشه‌ها را بازتولید کنند و حتی در حضور واقعیت‌هایی که پاسخ معکوس را می‌طلبند، ممکن است تعصبات ظریفی نشان دهند<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>. در عین حال، اندازه این اثرات برای گروه‌های مختلف یکسان نیست: برخی کلیشه‌ها قوی‌تر توسط مدل «فراگرفته» شده‌اند<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>. نویسندگان BBQ تأکید می‌کنند که تفاوت‌های کشف‌شده هرچند قابل توجه‌اند، اما فاجعه‌بار نیستند — bias score اکثر مدل‌ها به مقادیر افراطی نمی‌رسد و اغلب در حوزه چند ده درصد قرار دارد<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup>. با این حال، حتی انحرافات سیستماتیک کوچک در جهت کلیشه‌ها هنگام استفاده گسترده از LLMها بالقوه خطرناک است، بنابراین شناسایی و رفع چنین تعصباتی وظیفه‌ای مهم است<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-evaluating-mitigating-3)</sup>. BBQ به پژوهشگران روشی واضح و قابل اندازه‌گیری کمی برای ردیابی پیشرفت در این حوزه ارائه داده است<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-evaluating-mitigating-3)</sup>.

## تأثیر و پژوهش‌های آینده

مجموعه BBQ به‌سرعت به‌عنوان ابزار استانداردی برای ارزیابی ویژگی‌های fairness مدل‌های زبانی شناخته شد<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-paperswithcode-bbq-4)</sup>. **کد منبع باز و داده‌های** آن در مخزن موجود است (مجوز CC BY 4.0)<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-paperswithcode-bbq-4)</sup>، که به مخاطبان گسترده پژوهشی اجازه داده BBQ را در توسعه و آزمایش مدل‌های جدید به‌کار گیرند. در برخی مرورها، BBQ در کنار سایر benchmark‌ها (مانند StereoSet، WinoBias، ToxiGen) به‌عنوان نقطه عطف مهمی در مطالعه تعصب اجتماعی در NLP ذکر شده است<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-evaluating-mitigating-3)</sup>. از زمان انتشار BBQ، آثاری ظهور کرده‌اند که ایده‌های آن را توسعه داده و به شرایط جدید تطبیق می‌دهند:

- **گسترش فرمت‌های سؤال (Open-BBQ)**. BBQ اصلی وظایف را در قالب انتخاب چندگانه ارائه می‌دهد<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-evaluating-mitigating-3)</sup>. در سال ۲۰۲۴ یک نسخه اصلاح‌شده BBQ برای **پاسخ‌های باز** پیشنهاد شد که شامل وظایف پرکردن جاهای خالی و متن پاسخ کوتاه است<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-evaluating-mitigating-3)</sup>. این نسخه که به‌اصطلاح Open-BBQ نامیده می‌شود، امکان ارزیابی تعصب در شرایط گفتگوی آزادتر را فراهم می‌کند، جایی که مدل گزینه‌های پاسخ ثابت ندارد<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-evaluating-mitigating-3)</sup>. پژوهش نشان داد که LLMها در تولید متن آزاد نیز تعصب افزایش‌یافته‌ای علیه برخی گروه‌ها نشان می‌دهند<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-evaluating-mitigating-3)</sup>. نویسندگان Open-BBQ همچنین با روش‌های کاهش تعصب آزمایش کردند و prompt‌های zero-shot و few-shot و chain-of-thought (استدلال گام‌به‌گام) را ترکیب کردند<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-evaluating-mitigating-3)</sup>. این روش‌ها امکان کاهش قابل توجه سطح تعصب در پاسخ‌ها را فراهم کردند<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-evaluating-mitigating-3)</sup>. Open-BBQ مجموعه اصلی را تکمیل کرد و آزمایش مدل‌های مولد را در فرمت‌هایی نزدیک‌تر به درخواست‌های کاربران ممکن ساخت.

<!-- -->

- **تطبیق فرهنگی (بومی‌سازی)**. از آنجا که BBQ به واقعیت‌های اجتماعی آمریکا گره خورده، پژوهشگران به تطبیق آن برای زبان‌ها و فرهنگ‌های دیگر علاقه‌مند شدند<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-kobbg-5)</sup>. در سال ۲۰۲۳، دانشمندان کره‌ای dataset **KoBBQ** (Korean BBQ) — معادل کره‌ای Bias Benchmark — را معرفی کردند<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-kobbg-5)</sup>. آن‌ها رویکردی کلی برای بومی‌سازی BBQ توسعه دادند: قالب‌های اصلی را به سه دسته تقسیم کردند — آن‌هایی که می‌توان ترجمه کرد، آن‌هایی که نیاز به جایگزینی گروه‌ها با معادل‌های محلی دارند، و آن‌هایی که در زمینه کره‌ای اصلاً قابل استفاده نیستند<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-kobbg-5)</sup>. علاوه بر این، KoBBQ چهار دسته جدید کلیشه خاص جامعه کره را معرفی کرد و تعدادی از نمونه‌های نامناسب را حذف نمود<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-kobbg-5)</sup>. در نتیجه، مجموعه‌ای متشکل از ۲۶۸ قالب و ۷۶٬۰۴۸ نمونه به زبان کره‌ای به دست آمد که ۱۲ دسته تعصب اجتماعی (شامل دسته‌های اصلی و جدید) را پوشش می‌دهد<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-kobbg-5)</sup>. آزمایش مدل‌های چندزبانه بر روی KoBBQ تفاوت‌های قابل توجهی در سطح تعصب در مقایسه با ترجمه ماشینی مستقیم BBQ اصلی به کره‌ای آشکار کرد<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-kobbg-5)</sup>. این موضوع تأکید می‌کند که **ترجمه مستقیم کافی نیست** — benchmark‌های فرهنگی-ویژه‌ای لازم است که کلیشه‌ها و زمینه منحصر به فرد هر کشور را در نظر بگیرند<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-kobbg-5)</sup>. کار روی KoBBQ امکان مقیاس‌پذیری روش‌شناسی BBQ در سطح جهانی را نشان داد.

BBQ به بخشی جدایی‌ناپذیر از پژوهش‌های مربوط به **اخلاق هوش مصنوعی** تبدیل شده است<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-evaluating-mitigating-3)</sup>. تأثیر آن در ظهور روش‌شناسی‌های جدید برای از بین بردن تعصب در مدل‌ها، ساخت dataset‌های فراگیرتر و معیارهایی برای تحلیل ظریف تعصب قابل ردیابی است. پژوهشگران اشاره می‌کنند که یکی از نقاط قوت BBQ گستردگی پوشش و دقت ساختار نمونه‌هاست<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-evaluating-mitigating-3)</sup>. در پاسخ به چالش‌هایی که BBQ مطرح کرده، اخیراً **استراتژی‌های کاهش تعصب** از فیلتر کردن داده‌های آموزشی گرفته تا الگوریتم‌های خاص پس‌پردازش و تنظیم دقیق LLMها برای پاسخ‌های منصفانه به‌طور فعال در حال توسعه هستند<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-evaluating-mitigating-3)</sup>.

در جمع‌بندی، BBQ (Bias Benchmark for QA) به‌عنوان ابزاری ارزشمند و قابل اعتماد برای اندازه‌گیری تعصبات اجتماعی در مدل‌های زبانی اثبات شده است. این مجموعه به جامعه پژوهشی مجموعه استانداردی از آزمون‌ها ارائه می‌دهد که امکان مقایسه مدل‌ها از نظر کلیشه‌ای بودن و پیگیری پیشرفت در بهبود بی‌طرفی آن‌ها را فراهم می‌کند<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-evaluating-mitigating-3)</sup>. BBQ همچنان در حال گسترش و تطبیق است و علاقه جهانی به ساخت **سیستم‌های هوش مصنوعی منصفانه‌تر و امن‌تر**<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-evaluating-mitigating-3)</sup> که از تعصبات مضر پنهان اما قابل توجه مبرا باشند را منعکس می‌کند.

## پیوندها

- مقاله اصلی BBQ (arXiv)
- مخزن BBQ در GitHub
- صفحه dataset BBQ در Papers With Code
- مقاله BBQ در ACL Anthology
- مقاله درباره dataset KoBBQ (arXiv)
- مقاله درباره dataset Open-BBQ (arXiv)

## منابع

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## یادداشت‌ها

<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-bbq-main-1)</sup> <sup>[\[2\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-acl-anthology-2)</sup> <sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-evaluating-mitigating-3)</sup> <sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-paperswithcode-bbq-4)</sup> <sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_note-arxiv-kobbg-5)</sup> \</references\>

1.  <span id="cite_note-arxiv-bbq-main-1">↑ <sup>[1.00](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-11)</sup> <sup>[1.12](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-12)</sup> <sup>[1.13](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-13)</sup> <sup>[1.14](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-14)</sup> <sup>[1.15](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-15)</sup> <sup>[1.16](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-16)</sup> <sup>[1.17](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-17)</sup> <sup>[1.18](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-18)</sup> <sup>[1.19](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-19)</sup> <sup>[1.20](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-20)</sup> <sup>[1.21](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-21)</sup> <sup>[1.22](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-22)</sup> <sup>[1.23](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-23)</sup> <sup>[1.24](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-24)</sup> <sup>[1.25](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-25)</sup> <sup>[1.26](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-26)</sup> <sup>[1.27](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-27)</sup> <sup>[1.28](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-28)</sup> <sup>[1.29](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-29)</sup> <sup>[1.30](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-30)</sup> <sup>[1.31](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-31)</sup> <sup>[1.32](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-32)</sup> <sup>[1.33](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-33)</sup> <sup>[1.34](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-34)</sup> <sup>[1.35](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-35)</sup> <sup>[1.36](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-36)</sup> <sup>[1.37](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-37)</sup> <sup>[1.38](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-38)</sup> <sup>[1.39](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-39)</sup> <sup>[1.40](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-40)</sup> <sup>[1.41](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-41)</sup> <sup>[1.42](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-42)</sup> <sup>[1.43](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-43)</sup> <sup>[1.44](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-44)</sup> <sup>[1.45](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-45)</sup> <sup>[1.46](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-46)</sup> <sup>[1.47](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-47)</sup> <sup>[1.48](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-48)</sup> <sup>[1.49](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-49)</sup> <sup>[1.50](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-50)</sup> <sup>[1.51](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-51)</sup> <sup>[1.52](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-52)</sup> <sup>[1.53](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-53)</sup> <sup>[1.54](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-54)</sup> <sup>[1.55](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-55)</sup> <sup>[1.56](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-56)</sup> <sup>[1.57](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-57)</sup> <sup>[1.58](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-58)</sup> <sup>[1.59](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-59)</sup> <sup>[1.60](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-60)</sup> <sup>[1.61](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-61)</sup> <sup>[1.62](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-62)</sup> <sup>[1.63](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-63)</sup> <sup>[1.64](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-64)</sup> <sup>[1.65](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-65)</sup> <sup>[1.66](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-66)</sup> <sup>[1.67](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-67)</sup> <sup>[1.68](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-68)</sup> <sup>[1.69](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-69)</sup> <sup>[1.70](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-70)</sup> <sup>[1.71](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-71)</sup> <sup>[1.72](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-72)</sup> <sup>[1.73](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-73)</sup> <sup>[1.74](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-74)</sup> <sup>[1.75](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-75)</sup> <sup>[1.76](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-76)</sup> <sup>[1.77](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-77)</sup> <sup>[1.78](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-78)</sup> <sup>[1.79](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-79)</sup> <sup>[1.80](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-80)</sup> <sup>[1.81](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-bbq-main_1-81)</sup> Parrish A. et al. «BBQ: A Hand-Built Bias Benchmark for Question Answering». *arXiv*. <a href="https://arxiv.org/abs/2110.08193" class="external autonumber" rel="nofollow">[۱]</a></span>
2.  <span id="cite_note-acl-anthology-2">↑ <sup>[2.0](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-acl-anthology_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-acl-anthology_2-1)</sup> Parrish A. et al. «BBQ: A hand-built bias benchmark for question answering». *ACL Anthology*. <a href="https://aclanthology.org/2022.findings-acl.165/" class="external autonumber" rel="nofollow">[۲]</a></span>
3.  <span id="cite_note-arxiv-evaluating-mitigating-3">↑ <sup>[3.00](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-evaluating-mitigating_3-0)</sup> <sup>[3.01](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-evaluating-mitigating_3-1)</sup> <sup>[3.02](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-evaluating-mitigating_3-2)</sup> <sup>[3.03](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-evaluating-mitigating_3-3)</sup> <sup>[3.04](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-evaluating-mitigating_3-4)</sup> <sup>[3.05](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-evaluating-mitigating_3-5)</sup> <sup>[3.06](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-evaluating-mitigating_3-6)</sup> <sup>[3.07](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-evaluating-mitigating_3-7)</sup> <sup>[3.08](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-evaluating-mitigating_3-8)</sup> <sup>[3.09](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-evaluating-mitigating_3-9)</sup> <sup>[3.10](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-evaluating-mitigating_3-10)</sup> <sup>[3.11](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-evaluating-mitigating_3-11)</sup> <sup>[3.12](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-evaluating-mitigating_3-12)</sup> <sup>[3.13](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-evaluating-mitigating_3-13)</sup> <sup>[3.14](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-evaluating-mitigating_3-14)</sup> <sup>[3.15](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-evaluating-mitigating_3-15)</sup> <sup>[3.16](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-evaluating-mitigating_3-16)</sup> Liu Z. et al. (2024). «Evaluating and Mitigating Social Bias for Large Language Models in Open-ended Settings». *arXiv preprint*. <a href="https://arxiv.org/html/2412.06134v1" class="external autonumber" rel="nofollow">[۳]</a></span>
4.  <span id="cite_note-paperswithcode-bbq-4">↑ <sup>[4.0](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-paperswithcode-bbq_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-paperswithcode-bbq_4-1)</sup> <sup>[4.2](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-paperswithcode-bbq_4-2)</sup> <sup>[4.3](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-paperswithcode-bbq_4-3)</sup> <sup>[4.4](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-paperswithcode-bbq_4-4)</sup> <sup>[4.5](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-paperswithcode-bbq_4-5)</sup> <sup>[4.6](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-paperswithcode-bbq_4-6)</sup> «BBQ Dataset». *Papers With Code*. <a href="https://paperswithcode.com/dataset/bbq" class="external autonumber" rel="nofollow">[۴]</a></span>
5.  <span id="cite_note-arxiv-kobbg-5">↑ <sup>[5.0](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-kobbg_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-kobbg_5-1)</sup> <sup>[5.2](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-kobbg_5-2)</sup> <sup>[5.3](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-kobbg_5-3)</sup> <sup>[5.4](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-kobbg_5-4)</sup> <sup>[5.5](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-kobbg_5-5)</sup> <sup>[5.6](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-kobbg_5-6)</sup> <sup>[5.7](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(FA)#cite_ref-arxiv-kobbg_5-7)</sup> Jin J. et al. (2024). «KoBBQ: Korean Bias Benchmark for Question Answering». *arXiv preprint*. <a href="https://arxiv.org/abs/2307.16778" class="external autonumber" rel="nofollow">[۵]</a></span>
