BBQ (Bias Benchmark for Question Answering) (FA)
BBQ (Bias Benchmark for Question Answering) یک مجموعه داده برای ارزیابی تعصبات اجتماعی (bias) در سیستمهای پرسش و پاسخ (QA) است[1]. این مجموعه توسط گروهی از پژوهشگران دانشگاه نیویورک به سرپرستی الیشا پریش (Alicia Parrish) توسعه یافته و در سال ۲۰۲۲ در کنفرانس ACL Findings منتشر شده است[1][2]. هدف BBQ شناسایی این است که چگونه مدلهای زبانی بزرگ (LLM) و سایر مدلهای QA در پاسخ به سؤالات، بهویژه در وظایف کاربردی پاسخ به سؤال به زبان طبیعی، کلیشهها و تعصبات را بروز میدهند[1]. BBQ به یکی از جامعترین benchmarkها برای ارزیابی تعصب اجتماعی در NLP تبدیل شده و طیف گستردهای از کلیشهها را در قالب نه دسته اجتماعی پوشش میدهد[3].
این مجموعه داده کارهای پیشین مانند dataset UnQover (2020) را تکمیل میکند که تعصب را برای تعداد محدودی از ویژگیها (جنسیت-حرفه، ملیت، قومیت، مذهب) اندازهگیری میکرد و بر احتمالات مدلها، نه خود پاسخها، متکی بود[3]. برخلاف UnQover، BBQ مستقیماً محتوای پاسخهای مدلها و انتخاب آنها از میان گزینههای پیشنهادی را تحلیل میکند و این امکان را میدهد که تعصب دقیقاً در سطح نتایج تولیدشده ارزیابی شود[1].
نویسندگان BBQ آن را بهعنوان ابزاری برای تشخیص کلیشههای اجتماعی مضر در مدلها و کاهش خطر تأثیر منفی چنین کلیشههایی بر گروههای آسیبپذیر جامعه معرفی میکنند[1]. این مجموعه بر کلیشههای مرتبط با فرهنگ انگلیسیزبان آمریکا متمرکز است و همه زمینههای فرهنگی ممکن را پوشش نمیدهد[1]. با این حال، BBQ پایهای برای پژوهشهای بعدی در زمینه اندازهگیری و کاهش تعصب اجتماعی در NLP گذاشته و به معیاری برای مقایسه مدلها از نظر انطباق اخلاقی تبدیل شده است.
ترکیب و ساختار مجموعه داده
BBQ حاوی حدود ۵۸٫۵ هزار پرسش و پاسخ است که در مجموعههای ویژهای برای شناسایی کلیشههای خاص دستهبندی شدهاند[4]. تمام نمونهها بهصورت دستی توسط نویسندگان بر اساس موارد مستند از تعصبات و کلیشههایی که به اعضای گروههای مختلف اجتماعی آسیب میرسانند، تهیه شدهاند[4]. در ساخت سناریوها از دادههای پژوهشهای علمی، مقالات رسانهای، گزارشها و سایر منابع معتبری که وجود یک کلیشه خاص و پیامدهای مضر آن را تأیید میکنند استفاده شده است[1]. برای هر موقعیت، نویسندگان ارجاعی به منبعی ارائه میدهند که کلیشه مورد نظر در آن بهعنوان منفی یا مضر توصیف شده است (مانند مقاله علمی یا خبر)[1].
دستههای اجتماعی
BBQ نه دسته اجتماعی اصلی را پوشش میدهد (که بیشتر با گروههای تحت حمایت در تعریف کمیسیون فرصتهای شغلی برابر ایالات متحده مطابقت دارند)[1]:
- سن – تعصب نسبت به گروههای سنی (برای مثال، کلیشه کاهش تواناییهای شناختی در افراد مسن)[1].
- معلولیت – کلیشههایی درباره تواناییهای ذهنی یا سایر ویژگیهای افراد دارای معلولیت (برای مثال، تصور اینکه افراد دارای محدودیت جسمی از نظر فکری کمتر شایستهاند)[1].
- هویت جنسیتی – کلیشههای جنسیتی (برای مثال، این ایده که «دختران در ریاضی ضعیف هستند»)[1].
- ملیت – تعصبات ملی-قومی (برای مثال، کلیشه بیسوادی فناورانه در مورد افراد آفریقایی)[1].
- ظاهر – تبعیض بر اساس ظاهر و اندام (برای مثال، این باور که افراد چاق کمتر باهوش یا سختکوش هستند)[1].
- نژاد/قومیت – کلیشههای نژادی (برای مثال، ربط دادن مغرضانه نژاد خاصی با جرم یا اعتیاد)[1].
- مذهب – کلیشههای مذهبی (برای مثال، تصور یهودیان بهعنوان حریص یا مسلمانان بهعنوان مستعد خشونت و غیره)[1].
- وضعیت اجتماعی-اقتصادی – تعصب نسبت به اقشار فقیر یا ثروتمند جامعه (برای مثال، این باور که افراد برخاسته از خانوادههای فقیر والدین بدی خواهند بود)[1].
- گرایش جنسی – کلیشههای هموفوبیک (برای مثال، ارتباط دادن نادرست همجنسگرایی با بیماری HIV)[1].
علاوه بر این نه دسته، BBQ دو دسته بینبخشی (intersectional biases) را نیز دربر میگیرد که دو ویژگی را با هم ترکیب میکنند: (۱) جنسیت در ترکیب با نژاد/قومیت و (۲) وضعیت اجتماعی-اقتصادی در ترکیب با نژاد[1]. این موارد، کلیشههایی را در نقطه تلاقی گروههای مختلف در نظر میگیرند (برای مثال، تعصب خاص علیه زنان سیاهپوست یا علیه اقوام خاصی از طبقات اجتماعی پایین).
قالبها و تولید نمونهها
برای هر دسته، تیم تحقیق قالبهای سناریو نوشت — طرحهای کوتاهی که در آنها دو شخصیت که از نظر ویژگی هدف متفاوت هستند حضور دارند (برای مثال، جوان و پیر، مرد و زن، ثروتمند و فقیر و غیره)[4]. در قالب، موقعیتی گنجانده شده که میتوانست کلیشهای شناختهشده را تأیید یا رد کند. به هر سناریو سؤالها و گزینههای پاسخ مرتبط است.
در مجموع ۲۵ قالب منحصر به فرد برای هر یک از نه دسته اصلی تهیه شده، بهعلاوه ۲۵ قالب اضافی برای دستههای نژاد و جنسیت با استفاده از اسامی واقعی (برای بررسی تعصب در سطح اسامی خاص)[1]. همچنین برای دو جهت بینبخشی، ۲۵ قالب ایجاد شده است[1]. بدین ترتیب، تعداد کل سناریوهای پایه از ۳۰۰ فراتر میرود.
هر قالب دارای جایخالیهایی برای متغیرها است — نام گروهها یا توصیفاتی که در متن جایگذاری میشوند (برای مثال، در قالب مربوط به سن، اعداد مختلف بهجای «_ساله» گذاشته میشوند، یا در ظاهر — صفاتی مانند «چاق»/«لاغر» و غیره)[1]. از طریق جایگذاری مقادیر مختلف و تغییر ترتیب ذکر دو شخصیت، هر قالب به مجموعهای از نمونههای مشخص (حداقل ۸ و تا حدود ۲۰۰ تغییر) گسترش مییابد[1]. معمولاً از یک قالب حداقل ۱۰۰ سؤال نهایی تولید میشود و در برخی موارد تا دویست سؤال[1]. در مجموع، پیکرهای متشکل از ۵۸٬۴۹۲ نمونه (ترکیبهای منحصر به فرد سناریو، سؤال و پاسخ) به دست آمد[4].
زمینهها و انواع سؤالات
ویژگی کلیدی BBQ این است که هر موقعیت در دو نسخه زمینه و دو صورتبندی سؤال ارائه میشود و مجموعهای از چهار سؤال (به اصطلاح خوشه ۴تایی) تشکیل میدهد[1]. این کار برای جداسازی تأثیر کمبود اطلاعات از کلیشههای خود مدل انجام میشود. در هر چهارتایی[1]:
- زمینه مبهم (under-informative or ambiguous context): متنی که در آن موقعیتی با حضور دو نفر از گروههای متفاوت توصیف شده، اما اطلاعات کافی برای پاسخ قطعی به سؤال مطرحشده وجود ندارد[1]. پاسخ صحیح در چنین مواردی همیشه گزینه «نامشخص» است (یعنی فقدان دادههای کافی)[1]. این نمونهها برای بررسی اینکه آیا مدل بر اساس کلیشه نتیجهگیری میکند یا نه، طراحی شدهاند.
- زمینه صریح (disambiguated context): سناریوی توسعهیافتهای که در آن جزئیات روشنکنندهای اضافه شده و مشخص میکند کدام یک از دو نفر ذکرشده پاسخ سؤال است[1]. در این حالت، یکی از دو شخصیت قطعاً پاسخ صحیح است (و گزینه «نامشخص» دیگر درست نیست). زمینه صریح برای بررسی این است که آیا مدل میتواند بر تعصب احتمالی خود غلبه کند و پاسخ صحیح را انتخاب کند، حتی اگر کلیشه چیز دیگری را القا کند[1].
- سؤال منفی (مثلاً «کدامیک از آنها موضوع را بد بلد است؟»، «چه کسی مرتکب جرم شد؟»)[1]. چنین سؤالی در ترکیب با زمینه مبهم بررسی میکند که آیا مدل تمایل دارد در غیاب واقعیت، عمل منفی را با گروه خاصی مرتبط کند[1].
- سؤال غیرمنفی (متضاد) (مثلاً «کدامیک از آنها موضوع را خوب بلد است؟» یا «چه کسی از انجام عمل بد خودداری میکند؟»)[1]. سؤال غیرمنفی به گونهای تنظیم شده که بهطور مستقیم کلیشه را تأیید نکند، اما در عین حال امکان بررسی تعادل پاسخهای مدل را فراهم کند[1]. مقایسه پاسخها به نسخههای منفی و خنثی، انحرافات سیستماتیک را آشکار میسازد.
هر یک از این چهار نمونه در خوشه دارای سه گزینه پاسخ است: دو گزینه مشخص (که هر یک از دو گروه حاضر در صحنه را نام میبرند) و یک گزینه که بر فقدان اطلاعات کافی دلالت دارد (با برچسب «Unknown» و عبارات معادل)[1]. برای مثال، در صحنهای که یک مسیحی فرضی و یک مسلمان در آن حضور دارند، گزینههای پاسخ عبارتند از: «مسیحی»، «مسلمان» یا «نامشخص»[1]. ضمناً واژه «نامشخص» همیشه یکسان نیست — از ۱۰ عبارت مترادف استفاده میشود[1].
علاوه بر این، در هر قالب ترتیب ذکر دو گروه بهطور خودکار تغییر میکند[1]. این کار برای از بین بردن اثر ترتیب انجام میشود — عاملی شناختهشده که در آن مدلها ممکن است صرفنظر از محتوا، موجودیت نخست ذکرشده را بیشتر انتخاب کنند[1].
حاشیهنویسی و کنترل کیفیت
هر نمونه BBQ توسط حاشیهنویسان برونسپاریشده ارزیابی شد: حداقل ۵ نفر مستقل به سؤالات پاسخ دادند و تنها نمونههایی که حداقل ۴ نفر از ۵ حاشیهنویس با پاسخ صحیح آن توافق داشتند (از طریق رأیگیری) در dataset نهایی گنجانده شدند[1]. اگر سؤالی از این آستانه نمیگذشت، کل قالب بازبینی و ویرایش میشد[1]. به لطف این فرایند، دقت انسانی در BBQ بسیار بالاست: حاشیهنویسان انفرادی بهدرستی به حدود ۹۵٫۷٪ سؤالات پاسخ دادند، و با احتساب اکثریت آرا، دقت استاندارد طلایی به ۹۹٫۷٪ میرسد[1]. ضریب کاپا توافق (Krippendorff's alpha) برابر ۰٫۸۸۳ است که نشاندهنده توافق بالا میان افراد درباره پاسخهای صحیح است[1]. این اقدامات تأیید میکنند که وظایف BBQ برای انسانها قابل فهم بوده و پاسخهای عینی درستی دارند؛ بنابراین، خطاهای مدلها در این نمونهها را میتوان بهطور موجهی بهعنوان نشانههای تعصب تفسیر کرد، نه ابهام خود سؤالات.
ارزیابی تعصب مدلها
BBQ برای ارزیابی چندبُعدی رفتار مدلها در شرایطی که تعصب اجتماعی را تحریک میکنند طراحی شده است. در هنگام آزمایش، مدل QA زمینه و سؤال را دریافت میکند و باید یکی از سه گزینه پاسخ را انتخاب کند. تحلیل نتایج در دو سطح انجام میشود[1]:
حالت زمینه مبهم
اندازهگیری میشود که مدل چند بار در غیاب اطلاعات لازم بهدرستی پاسخ نمیدهد، یعنی بر کلیشه تکیه میکند[1]. در حالت ایدهآل، مدل باید به هر سؤال با زمینه ناکافی «نامشخص» پاسخ دهد، اما اگر یکی از گروهها را انتخاب کند، این بهعنوان بازتاب کلیشه نهفته تلقی میشود[1]. فراوانی چنین خطاهایی و توزیع آنها در دستهها، تصویری از تمایل مدل به بازتولید کلیشههای مضر ارائه میدهد.
حالت زمینه اطلاعاتی
ارزیابی میشود که مدل چقدر دقیق پاسخ میدهد، وقتی زمینه حاوی پاسخ صحیح صریح است[1]. در اینجا معمولاً معیار استاندارد accuracy (درصد پاسخهای صحیح) محاسبه میشود — نشان میدهد که آیا مدل اصولاً با وظیفه پرسش و پاسخ کنار میآید. اما توجه ویژه به مواردی معطوف است که پاسخ صحیح با کلیشه در تضاد است[1]. توسعهدهندگان BBQ تحلیل میکنند که آیا دقت مدل کاهش مییابد وقتی پاسخ درست با کلیشه رسوخیافتهای مغایرت دارد (و برعکس، آیا دقت بالاتر است وقتی حقیقت با انتظار کلیشهای مطابقت دارد)[1]. چنین اثری نشان میدهد که حتی در حضور واقعیتها، مدل ممکن است به دلیل تعصب اشتباه کند.
Bias Score
برای ارزیابی کمی میزان تعصب، معیار ویژهای معرفی میشود — امتیاز تعصب (bias score)[1]. بهطور کلی، bias score درصد پاسخهای مدل (در میان پاسخهای نادرست یا همه پاسخها، بسته به شرط) را نشان میدهد که با کلیشه مطابقت دارند[1].
- مقدار +۱۰۰٪ به این معناست که مدل در همه موارد گزینهای را انتخاب کرده که بهصورت کلیشهای ویژگی منفی را به گروه هدف نسبت میدهد.
- ۰٪ — هیچ تعصبی وجود ندارد (مدل یا همیشه پاسخ صحیح/«نامشخص» میدهد، یا بهیکسان در هر دو جهت اشتباه میکند).
- امتیاز منفی (تا -۱۰۰٪) — گرایش معکوس، وقتی مدل همیشه برخلاف انتظار کلیشه پاسخ میدهد[1].
امتیازها بهصورت جداگانه برای زمینههای مبهم و صریح محاسبه میشوند، زیرا ماهیت خطاها در آنها متفاوت است[1].
- برای سؤالات مبهم، bias score بر اساس نسبت مواردی تعیین میشود که مدل بهجای «نامشخص» پاسخ مشخصی انتخاب کرده و آن پاسخ با کلیشه منفی مطابقت داشته[1]. هرچه چنین پاسخهایی بیشتر باشد، امتیاز مثبت بالاتر است. در این میان، دقت در نظر گرفته میشود: اگر مدل بهیکسان اشتباه کند و پاسخ صحیح («نامشخص») بدهد، حتی با وجود بخشی از خطاهای کلیشهای، امتیاز پایینتر از مدلی خواهد بود که همیشه پاسخ کلیشهای میدهد[1]. بدین ترتیب، هم فراوانی و هم اطمینان پاسخهای bias جریمه میشوند (برای زمینههای مبهم، معیار با در نظر گرفتن درصد پاسخهای صحیح «نامشخص» مقیاسبندی میشود)[1].
- برای سؤالات صریح، bias score بهگونهای متفاوت محاسبه میشود، زیرا اینجا پاسخ صحیح یکی از گروههاست[1]. در این موارد، پاسخهای نادرست مدل بررسی میشوند: نسبت خطاهایی که مدل در آنها نه گزینه صحیح، بلکه گزینه جایگزین منطبق با کلیشه را انتخاب کرده[1]. بهبیان دیگر، اگر مدل با دادن اولویت به تعصب اشتباه کند (مثلاً به واقعیت اعتماد نکرده و بر اساس کلیشه پاسخ دهد)، این امر امتیاز را افزایش میدهد[1].
تحلیل bias score بههمراه دقت کلی امکان توصیف دقیق رفتار مدل در BBQ را فراهم میکند. نویسندگان اشاره میکنند که accuracy یکسان ممکن است ماهیت متفاوتی از خطاها را پنهان کند[1]. بنابراین، این معیار جهتگیری خطاها را نشان داده و موارد ظریفی را که با دقت تنها قابل مشاهده نیستند آشکار میسازد.
نتایج و الگوهای کشفشده
آزمایش اولیه چند مدل QA محبوب بر روی مجموعه BBQ تعدادی از نشانههای آشکار تعصب را نمایان ساخت[1]. در پژوهش Parrish و همکاران (2022) هم مدلهای بزرگ عمومی (مانند UnifiedQA — مدل تعمیمیافته برای QA بر پایه T5) و هم مدلهای استانداردشده انتخاب چندگانه (مانند RoBERTa با fine-tuning بر QA) آزمایش شدند[1].
نتیجهگیریهای اصلی از نتایج آزمایشها:
- خطاهای کلیشهای قوی در کمبود اطلاعات. در تمام سیستمهای آزمایششده، گرایشی به پاسخ دادن در قالب کلیشه مشاهده شد، وقتی زمینه سرنخهای لازم را نمیداد[1]. بهبیان دیگر، مدلها اغلب گزینه «نامشخص» را انتخاب نکرده و پاسخ مشخصی را که با انتظار کلیشهای خاصی مطابقت داشت ترجیح میدادند[1]. برای مثال، در سؤالات مبهم درباره جرمی بدون مقصر مشخص، مدلها اغلب به افرادی از گروه خاصی (مطابق با تعصب) اشاره میکردند[1]. bias score محاسبهشده برای زمینههای مبهم بهطور قابل توجهی بالاتر از صفر بود و گاهی در برخی دستهها و برخی مدلها به +۱۰۰٪ نزدیک میشد[1]. مدلها بهویژه در صحنههای مرتبط با ظاهر (چاقی و غیره) تمایل بیشتری به پاسخهای کلیشهای نشان دادند — این دسته تعصب بارزتری نسبت به، مثلاً، نژاد یا گرایش جنسی نشان داد[1]. این نشاندهنده ناهمگونی تعصب در درون مدل است — برخی انواع کلیشهها را قویتر «فراگرفته» است.
- بهبود در حضور واقعیتها، اما حفظ تعصب پنهان. وقتی مدلها زمینه صریحی با نشانهگذاری آشکار پاسخ صحیح دریافت کردند، دقت آنها بهطور قابل توجهی افزایش یافت (در مقایسه با حالت نامشخص)[1]. اما تحلیل دقیق اثر ظریفی را آشکار کرد: دقت بسته به رابطه پاسخ صحیح با کلیشه ناهمگون بود[1]. بهطور میانگین، مدلها در نمونههایی که پاسخ صحیح با کلیشه رایج مطابقت داشت حدود ۳-۳٫۵ درصد دقت بالاتری داشتند در مقایسه با نمونههایی که پاسخ درست با آن کلیشه در تضاد بود[1]. بهبیان دیگر، وقتی واقعیتها تعصب را تأیید میکردند، مدلها تقریباً بیخطا پاسخ میدادند؛ اما اگر لازم بود گزینهای «غیرمعمول» برای کلیشه نام برده شود، احتمال خطا افزایش مییافت. این شکاف در عملکرد هرچند بزرگ نیست، در بسیاری از دستهها بهصورت آماری ظاهر شد[1]. بیشترین تفاوت برای سؤالات مرتبط با کلیشههای جنسیتی ثبت شد: تا ۵ درصد تفاوت[1]. بنابراین، تأثیر پنهان تعصب قابل ردیابی است: مدلها بهطور میانگین کمی بدتر «برخلاف کلیشه» کار میکنند.
- مقایسه دستهها و قالبها. پژوهشگران BBQ، bias score را در تمام نه دسته تجزیهوتحلیل کردند و دریافتند که در زمینههای مبهم، این امتیاز در همه دستهها مثبت است، اما اندازه آن متغیر است[1]. همانطور که گفته شد، بیشترین تعصب در دستههای ظاهر جسمانی، وضعیت اجتماعی-اقتصادی و برخی از دستههای تقاطعی مشاهده شد[1]. bias score «پایینتر»، هرچند باز هم غیرصفر، در دستههای نژاد/قومیت و گرایش جنسی مشاهده شد[1]. در زمینههای صریح، bias score بهطور کلی به صفر نزدیکتر است (چون مدل اغلب درست پاسخ میدهد)، اما برای برخی قالبها همچنان مثبت باقی میماند که انحراف قابل توجهی در ماهیت خطاهای رخداده را نشان میدهد[1]. برای مثال، در دسته مذهب اکثر خطاها یکسویه بودند — مدلها معمولاً هنگام اشتباه، پاسخ مبتنی بر تعصب را انتخاب میکردند[1].
بهطور کلی، BBQ نشان داد که حتی مدلهای زبانی مدرن قدرتمند آشکارا از تعصبات اجتماعی مبرا نیستند[1]. آنها تمایل دارند در شرایط عدم قطعیت کلیشهها را بازتولید کنند و حتی در حضور واقعیتهایی که پاسخ معکوس را میطلبند، ممکن است تعصبات ظریفی نشان دهند[1]. در عین حال، اندازه این اثرات برای گروههای مختلف یکسان نیست: برخی کلیشهها قویتر توسط مدل «فراگرفته» شدهاند[1]. نویسندگان BBQ تأکید میکنند که تفاوتهای کشفشده هرچند قابل توجهاند، اما فاجعهبار نیستند — bias score اکثر مدلها به مقادیر افراطی نمیرسد و اغلب در حوزه چند ده درصد قرار دارد[1]. با این حال، حتی انحرافات سیستماتیک کوچک در جهت کلیشهها هنگام استفاده گسترده از LLMها بالقوه خطرناک است، بنابراین شناسایی و رفع چنین تعصباتی وظیفهای مهم است[3]. BBQ به پژوهشگران روشی واضح و قابل اندازهگیری کمی برای ردیابی پیشرفت در این حوزه ارائه داده است[3].
تأثیر و پژوهشهای آینده
مجموعه BBQ بهسرعت بهعنوان ابزار استانداردی برای ارزیابی ویژگیهای fairness مدلهای زبانی شناخته شد[4]. کد منبع باز و دادههای آن در مخزن موجود است (مجوز CC BY 4.0)[4]، که به مخاطبان گسترده پژوهشی اجازه داده BBQ را در توسعه و آزمایش مدلهای جدید بهکار گیرند. در برخی مرورها، BBQ در کنار سایر benchmarkها (مانند StereoSet، WinoBias، ToxiGen) بهعنوان نقطه عطف مهمی در مطالعه تعصب اجتماعی در NLP ذکر شده است[3]. از زمان انتشار BBQ، آثاری ظهور کردهاند که ایدههای آن را توسعه داده و به شرایط جدید تطبیق میدهند:
- گسترش فرمتهای سؤال (Open-BBQ). BBQ اصلی وظایف را در قالب انتخاب چندگانه ارائه میدهد[3]. در سال ۲۰۲۴ یک نسخه اصلاحشده BBQ برای پاسخهای باز پیشنهاد شد که شامل وظایف پرکردن جاهای خالی و متن پاسخ کوتاه است[3]. این نسخه که بهاصطلاح Open-BBQ نامیده میشود، امکان ارزیابی تعصب در شرایط گفتگوی آزادتر را فراهم میکند، جایی که مدل گزینههای پاسخ ثابت ندارد[3]. پژوهش نشان داد که LLMها در تولید متن آزاد نیز تعصب افزایشیافتهای علیه برخی گروهها نشان میدهند[3]. نویسندگان Open-BBQ همچنین با روشهای کاهش تعصب آزمایش کردند و promptهای zero-shot و few-shot و chain-of-thought (استدلال گامبهگام) را ترکیب کردند[3]. این روشها امکان کاهش قابل توجه سطح تعصب در پاسخها را فراهم کردند[3]. Open-BBQ مجموعه اصلی را تکمیل کرد و آزمایش مدلهای مولد را در فرمتهایی نزدیکتر به درخواستهای کاربران ممکن ساخت.
- تطبیق فرهنگی (بومیسازی). از آنجا که BBQ به واقعیتهای اجتماعی آمریکا گره خورده، پژوهشگران به تطبیق آن برای زبانها و فرهنگهای دیگر علاقهمند شدند[5]. در سال ۲۰۲۳، دانشمندان کرهای dataset KoBBQ (Korean BBQ) — معادل کرهای Bias Benchmark — را معرفی کردند[5]. آنها رویکردی کلی برای بومیسازی BBQ توسعه دادند: قالبهای اصلی را به سه دسته تقسیم کردند — آنهایی که میتوان ترجمه کرد، آنهایی که نیاز به جایگزینی گروهها با معادلهای محلی دارند، و آنهایی که در زمینه کرهای اصلاً قابل استفاده نیستند[5]. علاوه بر این، KoBBQ چهار دسته جدید کلیشه خاص جامعه کره را معرفی کرد و تعدادی از نمونههای نامناسب را حذف نمود[5]. در نتیجه، مجموعهای متشکل از ۲۶۸ قالب و ۷۶٬۰۴۸ نمونه به زبان کرهای به دست آمد که ۱۲ دسته تعصب اجتماعی (شامل دستههای اصلی و جدید) را پوشش میدهد[5]. آزمایش مدلهای چندزبانه بر روی KoBBQ تفاوتهای قابل توجهی در سطح تعصب در مقایسه با ترجمه ماشینی مستقیم BBQ اصلی به کرهای آشکار کرد[5]. این موضوع تأکید میکند که ترجمه مستقیم کافی نیست — benchmarkهای فرهنگی-ویژهای لازم است که کلیشهها و زمینه منحصر به فرد هر کشور را در نظر بگیرند[5]. کار روی KoBBQ امکان مقیاسپذیری روششناسی BBQ در سطح جهانی را نشان داد.
BBQ به بخشی جداییناپذیر از پژوهشهای مربوط به اخلاق هوش مصنوعی تبدیل شده است[3]. تأثیر آن در ظهور روششناسیهای جدید برای از بین بردن تعصب در مدلها، ساخت datasetهای فراگیرتر و معیارهایی برای تحلیل ظریف تعصب قابل ردیابی است. پژوهشگران اشاره میکنند که یکی از نقاط قوت BBQ گستردگی پوشش و دقت ساختار نمونههاست[3]. در پاسخ به چالشهایی که BBQ مطرح کرده، اخیراً استراتژیهای کاهش تعصب از فیلتر کردن دادههای آموزشی گرفته تا الگوریتمهای خاص پسپردازش و تنظیم دقیق LLMها برای پاسخهای منصفانه بهطور فعال در حال توسعه هستند[3].
در جمعبندی، BBQ (Bias Benchmark for QA) بهعنوان ابزاری ارزشمند و قابل اعتماد برای اندازهگیری تعصبات اجتماعی در مدلهای زبانی اثبات شده است. این مجموعه به جامعه پژوهشی مجموعه استانداردی از آزمونها ارائه میدهد که امکان مقایسه مدلها از نظر کلیشهای بودن و پیگیری پیشرفت در بهبود بیطرفی آنها را فراهم میکند[3]. BBQ همچنان در حال گسترش و تطبیق است و علاقه جهانی به ساخت سیستمهای هوش مصنوعی منصفانهتر و امنتر[3] که از تعصبات مضر پنهان اما قابل توجه مبرا باشند را منعکس میکند.
پیوندها
- مقاله اصلی BBQ (arXiv)
- مخزن BBQ در GitHub
- صفحه dataset BBQ در Papers With Code
- مقاله BBQ در ACL Anthology
- مقاله درباره dataset KoBBQ (arXiv)
- مقاله درباره dataset Open-BBQ (arXiv)
منابع
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
یادداشتها
[1] [2] [3] [4] [5] </references>
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 1.24 1.25 1.26 1.27 1.28 1.29 1.30 1.31 1.32 1.33 1.34 1.35 1.36 1.37 1.38 1.39 1.40 1.41 1.42 1.43 1.44 1.45 1.46 1.47 1.48 1.49 1.50 1.51 1.52 1.53 1.54 1.55 1.56 1.57 1.58 1.59 1.60 1.61 1.62 1.63 1.64 1.65 1.66 1.67 1.68 1.69 1.70 1.71 1.72 1.73 1.74 1.75 1.76 1.77 1.78 1.79 1.80 1.81 Parrish A. et al. «BBQ: A Hand-Built Bias Benchmark for Question Answering». arXiv. [۱]
- ↑ 2.0 2.1 Parrish A. et al. «BBQ: A hand-built bias benchmark for question answering». ACL Anthology. [۲]
- ↑ 3.00 3.01 3.02 3.03 3.04 3.05 3.06 3.07 3.08 3.09 3.10 3.11 3.12 3.13 3.14 3.15 3.16 Liu Z. et al. (2024). «Evaluating and Mitigating Social Bias for Large Language Models in Open-ended Settings». arXiv preprint. [۳]
- ↑ 4.0 4.1 4.2 4.3 4.4 4.5 4.6 «BBQ Dataset». Papers With Code. [۴]
- ↑ 5.0 5.1 5.2 5.3 5.4 5.5 5.6 5.7 Jin J. et al. (2024). «KoBBQ: Korean Bias Benchmark for Question Answering». arXiv preprint. [۵]