BBQ (Bias Benchmark for Question Answering) (UR)

From Systems analysis Wiki
Jump to navigation Jump to search

BBQ (Bias Benchmark for Question Answering) — یہ سوال و جواب (QA) کے نظاموں میں سماجی تعصبات (bias) کی جانچ کے لیے ایک dataset ہے[1]۔ اسے نیویارک یونیورسٹی کے محققین کی ایک ٹیم نے الیشا پیریش (Alicia Parrish) کی قیادت میں تیار کیا اور 2022 میں ACL Findings کانفرنس میں شائع کیا گیا[1][2]۔ BBQ کا مقصد یہ ظاہر کرنا ہے کہ بڑے لسانی ماڈل (LLM) اور دیگر QA ماڈل سوالات کے جوابات میں، خصوصاً قدرتی زبان میں سوال و جواب کے عملی کاموں میں، کس طرح دقیانوسی تصورات اور تعصبات ظاہر کرتے ہیں[1]۔ BBQ، NLP میں سماجی bias کی جانچ کے لیے سب سے جامع benchmark میں سے ایک بن گیا ہے، جو نو سماجی زمروں کے دائرے میں دقیانوسی تصورات کے وسیع دائرے کا احاطہ کرتا ہے[3]۔

یہ dataset پچھلے کاموں کی تکمیل کرتا ہے، جیسے کہ UnQover dataset (2020)، جو محدود خصوصیات (صنف-پیشہ، قومیت، نسلی تعلق، مذہب) کی بنیاد پر تعصب کی پیمائش کرتا تھا اور خود جوابات کی بجائے ماڈلوں کے احتمالات پر انحصار کرتا تھا[3]۔ UnQover کے برخلاف، BBQ براہ راست ماڈلوں کے جوابات کے مواد اور پیش کردہ اختیارات میں سے ان کے انتخاب کا تجزیہ کرتا ہے، جو نتائج کی سطح پر ہی تعصب کا جائزہ لینے کی اجازت دیتا ہے[1]۔

BBQ کے مصنفین اسے ماڈلوں میں نقصاندہ سماجی دقیانوسی تصورات کی تشخیص اور ایسے تصورات کے کمزور طبقات پر منفی اثرات کا خطرہ کم کرنے کے آلے کے طور پر پیش کرتے ہیں[1]۔ یہ dataset امریکی انگریزی ثقافت سے متعلق دقیانوسی تصورات پر مرکوز ہے اور تمام ممکنہ ثقافتی تناظر کا احاطہ نہیں کرتا[1]۔ تاہم، BBQ نے NLP میں سماجی bias کی پیمائش اور تخفیف سے متعلق بعد کے کاموں کی بنیاد رکھی اور ماڈلوں کی اخلاقی درستگی کے تقابلی مطالعے میں ایک معیار بن گیا۔

ڈیٹاسیٹ کی ساخت اور تشکیل

BBQ میں تقریباً 58.5 ہزار سوال و جواب شامل ہیں جو خصوصی مجموعوں میں ترتیب دیے گئے ہیں، جن کا مقصد مخصوص دقیانوسی تصورات کی نشاندہی کرنا ہے[4]۔ تمام مثالیں مصنفین نے دستی طور پر دستاویز شدہ تعصبات اور دقیانوسی تصورات کی بنیاد پر تیار کیں جو مختلف سماجی گروہوں کے افراد کو نقصان پہنچاتے ہیں[4]۔ سیناریوز بناتے وقت سائنسی تحقیق کے اعداد و شمار، میڈیا مضامین، رپورٹیں اور دیگر قابل اعتماد ذرائع استعمال کیے گئے جو کسی مخصوص دقیانوسی تصور کے وجود اور اس کے نقصاندہ نتائج کی تصدیق کرتے ہیں[1]۔ ہر صورتحال کے لیے مصنفین نے اس ماخذ کا حوالہ درج کیا جہاں اس دقیانوسی تصور کو منفی یا نقصاندہ قرار دیا گیا ہے (مثلاً کوئی سائنسی مضمون یا خبر)[1]۔

سماجی زمرے

BBQ نو بنیادی سماجی اہمیت کے حامل زمروں کا احاطہ کرتا ہے (جن میں سے اکثر امریکی مساوی روزگار کے مواقع کمیشن کی تعریف میں محفوظ گروہوں سے مطابقت رکھتے ہیں)[1]:

  • عمر – عمر کے گروہوں کے بارے میں تعصبات (مثلاً بزرگ افراد میں ذہنی صلاحیتوں میں کمی کا دقیانوسی تصور)[1]۔
  • معذوری – معذور افراد کی ذہنی صلاحیتوں یا دیگر خصوصیات کے بارے میں دقیانوسی تصورات (مثلاً یہ تصور کہ جسمانی معذور افراد فکری طور پر کم قابل ہوتے ہیں)[1]۔
  • صنفی شناخت – صنفی دقیانوسی تصورات (مثلاً یہ خیال کہ لڑکیاں ریاضی میں کمزور ہوتی ہیں)[1]۔
  • قومیت – قومی و نسلی تعصبات (مثلاً افریقہ سے تعلق رکھنے والوں کی تکنیکی ناخواندگی کا دقیانوسی تصور)[1]۔
  • ظاہری شکل – جسمانی ظاہری شکل یا جسامت کی بنیاد پر امتیاز (مثلاً یہ رائے کہ موٹے افراد کم ذہین یا کم محنتی ہوتے ہیں)[1]۔
  • نسل/نسلی تعلق – نسلی دقیانوسی تصورات (مثلاً کسی مخصوص نسل کو جرم یا منشیات سے جوڑنا)[1]۔
  • مذہب – مذہبی دقیانوسی تصورات (مثلاً یہودیوں کو کنجوس، مسلمانوں کو تشدد پسند سمجھنا وغیرہ)[1]۔
  • سماجی و اقتصادی حیثیت – غریب یا امیر طبقات کے بارے میں تعصبات (مثلاً یہ یقین کہ غریب خاندانوں سے تعلق رکھنے والے برے والدین ثابت ہوں گے)[1]۔
  • جنسی رجحان – ہم جنس پرستی کے خلاف دقیانوسی تصورات (مثلاً ہم جنس پرستی کو HIV انفیکشن سے جھوٹی طور پر جوڑنا)[1]۔

ان نو زمروں کے علاوہ، BBQ میں دو بین المقاطع زمرے (intersectional biases) بھی شامل ہیں جو ایک ساتھ دو خصوصیات کو یکجا کرتے ہیں: (1) نسل/نسلی تعلق کے ساتھ صنف اور (2) نسل کے ساتھ سماجی و اقتصادی حیثیت[1]۔ ایسے معاملات مختلف گروہوں کے تقاطع پر دقیانوسی تصورات کو مدنظر رکھتے ہیں (مثلاً سیاہ فام خواتین کے خلاف یا کسی کم سماجی طبقے سے تعلق رکھنے والے مخصوص نسلی گروہ کے خلاف تعصبات)۔

سانچے اور مثالوں کی تخلیق

ہر زمرے کے لیے ٹیم نے سیناریو کے سانچے لکھے — مختصر خاکے جن میں دو کردار شامل ہوتے ہیں جو ہدف خصوصیت کے لحاظ سے مختلف ہوتے ہیں (مثلاً جوان اور بوڑھا، مرد اور عورت، امیر اور غریب وغیرہ)[4]۔ سانچے میں ایک ایسی صورتحال رکھی گئی ہے جو کسی معروف دقیانوسی تصور کی تصدیق یا تردید کر سکتی ہے۔ ہر سیناریو سے سوالات اور جوابات کے اختیارات منسلک ہیں۔

نو بنیادی زمروں میں سے ہر ایک کے لیے 25 منفرد سانچے تیار کیے گئے، اس کے علاوہ نسل اور صنف کے زمروں کے لیے حقیقی ناموں کے استعمال کے ساتھ 25 اضافی سانچے (اسماء کی سطح پر bias جانچنے کے لیے)[1]۔ دو بین المقاطع سمتوں کے لیے بھی 25 سانچے بنائے گئے[1]۔ اس طرح بنیادی سیناریوز کی کل تعداد 300 سے تجاوز کرتی ہے۔

ہر سانچے میں خاص متغیر slots ہوتے ہیں — گروہوں کے نام یا تفصیل — جو متن میں داخل کیے جاتے ہیں (مثلاً عمر کے سانچے میں _سالہ شخص کی جگہ مختلف اعداد داخل کیے جاتے ہیں، یا ظاہری شکل میں موٹا/دبلا جیسی صفتیں وغیرہ)[1]۔ مختلف قدروں کے اندراج اور دو کرداروں کے ذکر کی ترتیب بدلنے کے ذریعے، ہر سانچہ متعدد مخصوص مثالوں میں پھیل جاتا ہے (کم از کم 8 اور تقریباً ~200 تبدیلیوں تک)[1]۔ عموماً ایک سانچے سے کم از کم 100 حتمی سوالات تیار ہوتے ہیں، اور بعض صورتوں میں دو سو تک[1]۔ مجموعی طور پر 58,492 مثالوں (سیناریو، سوال اور جواب کے منفرد مجموعوں) پر مشتمل ایک corpus تیار ہوا[4]۔

تناظر اور سوالات کی اقسام

BBQ کی کلیدی خصوصیت یہ ہے کہ ہر صورتحال کو تناظر کی دو شکلوں اور سوال کی دو صورتوں میں پیش کیا گیا ہے، جس سے چار سوالات کا ایک مجموعہ بنتا ہے (جسے 4 کا cluster کہا جاتا ہے)[1]۔ یہ اس لیے کیا گیا تاکہ معلومات کی کمی کے اثر کو ماڈل کے اپنے دقیانوسی تصورات سے الگ کیا جا سکے۔ ہر چوکڑی میں[1]:

  • مبہم تناظر (under-informative or ambiguous context): وہ متن جس میں دو مختلف گروہوں سے تعلق رکھنے والے دو افراد کی صورتحال بیان ہو، لیکن پوچھے گئے سوال کا یکسر درست جواب دینے کے لیے کافی معلومات موجود نہ ہوں[1]۔ ایسے معاملات میں درست جواب ہمیشہ معلوم نہیں (یعنی کافی ڈیٹا کا نہ ہونا) ہوتا ہے[1]۔ یہ مثالیں اس بات کی جانچ کے لیے ہیں کہ آیا ماڈل دقیانوسی تصور پر انحصار کر کے نتیجہ اخذ نہیں کرے گا۔
  • واضح تناظر (disambiguated context): ایک توسیعی سیناریو جس میں ایک واضح کرنے والی تفصیل شامل ہوتی ہے جس سے یہ طے کیا جا سکتا ہے کہ دو مذکور افراد میں سے کون سوال سے مطابقت رکھتا ہے[1]۔ اس صورت میں دو کرداروں میں سے ایک یقیناً درست جواب ہے (اور معلوم نہیں کا اختیار غلط ہو جاتا ہے)۔ واضح تناظر اس بات کی جانچ کے لیے ہے کہ آیا ماڈل اپنے ممکنہ bias پر قابو پا کر درست جواب دے سکتا ہے، چاہے دقیانوسی تصور کچھ اور ہی بتائے[1]۔
  • منفی سوال (مثلاً ان میں سے کسے مضمون کی کم معلومات ہے؟، جرم کس نے کیا؟)[1]۔ مبہم تناظر کے ساتھ ایسا سوال اس بات کی جانچ کرتا ہے کہ آیا ماڈل حقائق کی غیر موجودگی میں کسی منفی عمل کو کسی مخصوص گروہ سے جوڑنے کا رجحان رکھتا ہے[1]۔
  • غیر منفی (متقابل) سوال (مثلاً ان میں سے کسے مضمون کی اچھی معلومات ہے؟ یا کون برے کام سے گریز کرتا ہے؟)[1]۔ غیر منفی سوال اس طرح بنایا گیا ہے کہ وہ دقیانوسی تصور کی براہ راست توثیق نہ لگے، لیکن ساتھ ہی ماڈل کے جوابات کے توازن کی جانچ کی اجازت دے[1]۔ منفی اور غیر جانبدار ورژنوں کے جوابات کا تقابل منظم انحراف کو ظاہر کرتا ہے۔

cluster میں ان چار مثالوں میں سے ہر ایک کے لیے تین جوابی اختیارات ہوتے ہیں: دو مخصوص (دونوں فریقین میں سے ہر ایک کا نام لینے والے) اور ایک اختیار جو کافی معلومات کی غیر موجودگی کی نشاندہی کرتا ہے (جسے Unknown اور مترادف جملوں سے ظاہر کیا گیا ہے)[1]۔ مثلاً ایک ایسے منظر میں جہاں ایک مفروضی عیسائی اور مسلمان موجود ہوں، جوابات یہ ہوں گے: عیسائی، مسلمان یا معلوم نہیں[1]۔ نیز معلوم نہیں کا لفظ ہمیشہ ایک جیسا نہیں ہوتا — 10 مترادف تعبیرات استعمال کی جاتی ہیں[1]۔

اس کے علاوہ، ہر سانچے میں خودکار طریقے سے دو گروہوں کے ذکر کی ترتیب بدلی جاتی ہے[1]۔ یہ ترتیبی اثر کو کم کرنے کے لیے کیا گیا ہے — ایک معروف عامل جس کی وجہ سے ماڈل مواد سے قطع نظر پہلی ذکر کردہ چیز کا زیادہ کثرت سے انتخاب کر سکتے ہیں[1]۔

تشریح اور معیار کی جانچ

BBQ کی ہر مثال کو crowd-sourcing annotators نے جانچا: کم از کم 5 آزاد افراد نے سوالات کے جواب دیے، اور حتمی dataset میں صرف وہی مثالیں شامل کی گئیں جن پر کم از کم 5 میں سے 4 annotators نے (ووٹنگ کے ذریعے) درست جواب پر اتفاق کیا[1]۔ اگر کوئی سوال اس حد کو عبور نہ کرتا تو پورے سانچے پر نظرثانی اور ترمیم کی جاتی تھی[1]۔ اس عمل کی بدولت BBQ پر انسانی درستگی کافی زیادہ ہے: انفرادی annotators نے ~95.7% سوالات کے درست جوابات دیے، اور اکثریتی ووٹنگ کو مدنظر رکھا جائے تو سونے کے معیار کی درستگی 99.7% تک پہنچتی ہے[1]۔ Krippendorff's alpha اتفاق معیار 0.883 رہا، جو درست جوابات کے بارے میں افراد کے درمیان اعلیٰ درجے کی ہم آہنگی کی نشاندہی کرتا ہے[1]۔ یہ اقدامات تصدیق کرتے ہیں کہ BBQ کے کام انسانوں کے لیے قابل فہم ہیں اور ان کے معروضی طور پر درست جوابات موجود ہیں؛ نتیجتاً ان مثالوں پر ماڈلوں کی غلطیوں کو bias کے اظہار کے طور پر معقول طریقے سے تعبیر کیا جا سکتا ہے، نہ کہ سوالات کی ابہام کے باعث۔

ماڈلوں کے تعصب کا جائزہ

BBQ سماجی bias کو ہوا دینے والے حالات میں ماڈلوں کے رویے کی کثیر الجہتی جانچ کے لیے تیار کیا گیا ہے۔ جانچ کے دوران QA ماڈل کو ان پٹ کے طور پر تناظر اور سوال ملتا ہے، جس کے بعد اسے تین جوابی اختیارات میں سے ایک کا انتخاب کرنا ہوتا ہے۔ نتائج کا تجزیہ دو سطحوں پر کیا جاتا ہے[1]:

مبہم تناظر کا معاملہ

یہ پیمائش کی جاتی ہے کہ ماڈل ضروری معلومات کی غیر موجودگی میں سوالات کے غلط جوابات کتنی بار دیتا ہے، یعنی دقیانوسی تصور پر انحصار کرتا ہے[1]۔ مثالی طور پر ماڈل کو ناکافی تناظر والے کسی بھی سوال کا جواب معلوم نہیں دینا چاہیے، لیکن اگر اس نے کسی گروہ کا انتخاب کیا تو اسے جڑے ہوئے دقیانوسی تصور کا اظہار سمجھا جاتا ہے[1]۔ ایسی غلطیوں کی تعدد اور زمروں میں ان کی تقسیم ماڈل کی نقصاندہ دقیانوسی تصورات کو دوہرانے کے رجحان کا احساس دیتی ہے۔

معلوماتی تناظر کا معاملہ

یہ جائزہ لیا جاتا ہے کہ جب تناظر میں صریح درست جواب موجود ہو تو ماڈل کتنی درستگی سے جواب دیتا ہے[1]۔ یہاں عموماً معیاری میٹرک accuracy (درست جوابات کا فیصد) شمار کی جاتی ہے — یہ ظاہر کرتا ہے کہ آیا ماڈل بنیادی طور پر سوال و جواب کے کام کو سنبھال سکتا ہے۔ تاہم خصوصی توجہ ان معاملات پر دی جاتی ہے جہاں درست جواب دقیانوسی تصور کے خلاف جاتا ہو[1]۔ BBQ کے ڈویلپرز اس بات کا تجزیہ کرتے ہیں کہ آیا ماڈل کی درستگی کم نہ ہو جائے جب درست جواب کسی راسخ دقیانوسی تصور سے متضاد ہو (اور اس کے برعکس، کیا درستگی اس وقت زیادہ نہ ہو جب حقیقت دقیانوسی توقع سے ہم آہنگ ہو)[1]۔ ایسا اثر اس بات کی نشاندہی کرے گا کہ حقائق کی موجودگی میں بھی ماڈل bias کی وجہ سے غلطیاں کر سکتا ہے۔

Bias Score

تعصب کی ڈگری کو مقداری طور پر جانچنے کے لیے ایک خصوصی میٹرک متعارف کرائی گئی ہے — تعصب کا اشاریہ (bias score)[1]۔ عمومی صورت میں bias score ماڈل کے ان جوابات کا فیصد ظاہر کرتا ہے (شرط کے مطابق غلط یا کل میں سے) جو دقیانوسی تصور سے مطابقت رکھتے ہیں[1]۔

  • +100% کی قدر کا مطلب ہوگا کہ ماڈل نے تمام معاملات میں وہ جوابی اختیار چنا جو منفی خصوصیت کو ہدف گروہ سے دقیانوسی طور پر منسوب کرتا ہے۔
  • 0% — bias کا کوئی اظہار نہیں (ماڈل یا تو ہمیشہ درست/معلوم نہیں جواب دیتا ہے، یا دونوں اطراف میں برابر غلطی کرتا ہے)۔
  • منفی score (-100% تک) — مخالف رجحان، جب ماڈل ہمیشہ دقیانوسی توقع کے خلاف جواب دیتا ہے[1]۔

اشاریے مبہم اور واضح تناظر کے لیے الگ الگ شمار کیے جاتے ہیں، کیونکہ ان میں غلطیوں کی نوعیت مختلف ہوتی ہے[1]۔

  • مبہم سوالات کے لیے bias score ان معاملات کا تناسب ہے جب ماڈل نے معلوم نہیں کی بجائے کوئی مخصوص جواب چنا، اور وہ جواب منفی دقیانوسی تصور سے مطابقت رکھتا تھا[1]۔ ایسے جوابات جتنے زیادہ ہوں گے، مثبت score اتنا ہی زیادہ ہوگا۔ اس میں درستگی کو مدنظر رکھا جاتا ہے: اگر ماڈل برابر غلطی کرے اور معلوم نہیں کا صحیح جواب بھی دے، تو دقیانوسی غلطیوں کا کچھ حصہ ہونے کے باوجود اس کا score اس ماڈل سے کم ہوگا جو ہمیشہ دقیانوسی جواب چنتا ہو[1]۔ اس طرح bias جوابات کی تعدد اور یقین دہانی دونوں کو سزا دی جاتی ہے (مبہم تناظر کے لیے میٹرک کو معلوم نہیں کے درست جوابات کے فیصد کو مدنظر رکھ کر ہموار کیا جاتا ہے)[1]۔
  • واضح سوالات کے لیے bias score قدرے مختلف طریقے سے شمار ہوتی ہے، کیونکہ یہاں درست جواب گروہوں میں سے ایک ہے[1]۔ ان معاملات میں ماڈل کی غلط جوابات پر نظر رکھی جاتی ہے: غلطیوں کا وہ تناسب جن میں ماڈل نے درست اختیار کی بجائے وہ متبادل اختیار چنا جو دقیانوسی تصور سے مطابقت رکھتا ہو[1]۔ دوسرے لفظوں میں، اگر ماڈل نے تعصب کو ترجیح دیتے ہوئے غلطی کی (مثلاً حقائق پر یقین نہ کیا اور دقیانوسی تصور کے مطابق جواب دیا)، تو اس سے score بڑھتا ہے[1]۔

بیاس score کا تجزیہ مجموعی درستگی کے ساتھ مل کر BBQ پر ماڈل کے رویے کی تفصیلی تصویر کشی کرتا ہے۔ مصنفین بتاتے ہیں کہ ایک جیسی accuracy مختلف نوعیت کی غلطیوں کو چھپا سکتی ہے[1]۔ اس طرح یہ اشاریہ غلطیوں کا رخ ظاہر کرتا ہے اور وہ باریک معاملات آشکار کرتا ہے جو صرف درستگی سے ظاہر نہیں ہوتے۔

نتائج اور دریافت شدہ قانونیتیں

BBQ پر کئی مشہور QA ماڈلوں کی ابتدائی جانچ نے bias کے واضح اظہار کی ایک سلسلہ ظاہر کی[1]۔ Parrish وغیرہ (2022) کی تحقیق میں بڑے عالمگیر ماڈل (مثلاً UnifiedQA — T5 پر مبنی QA کے لیے عمومی ماڈل) اور معیاری multiple-choice ماڈل (مثلاً QA پر fine-tuning کے ساتھ ROBERTA) دونوں کا تجربہ کیا گیا[1]۔

تجربات کے نتائج سے اہم نتائج:

  • معلومات کی قلت میں شدید دقیانوسی غلطیاں۔ تمام جانچی گئی نظاموں میں یہ رجحان دیکھا گیا کہ جب تناظر ضروری اشارے نہ دیتا تو وہ دقیانوسی تصور کے مطابق جواب دیتے[1]۔ دوسرے لفظوں میں، ماڈلوں نے اکثر معلوم نہیں کا اختیار نہیں چنا، بلکہ وہ مخصوص جواب پسند کیا جو کسی نہ کسی دقیانوسی توقع سے ہم آہنگ تھا[1]۔ مثلاً مبہم سوالوں میں واضح مجرم کے بغیر جرم کے بارے میں ماڈلوں نے اکثر کسی مخصوص گروہ کے افراد کی طرف اشارہ کیا (تعصب کے مطابق)[1]۔ مبہم تناظر کے لیے شمار کردہ bias score صفر سے نمایاں طور پر زیادہ نکلی، اور کچھ ماڈلوں میں بعض زمروں میں +100% کے قریب پہنچ گئی[1]۔ خاص طور پر ظاہری شکل (موٹاپا وغیرہ) سے متعلق مناظر پر ماڈلوں نے زیادہ دقیانوسی جوابات کا رجحان ظاہر کیا — اس زمرے نے مثلاً نسل یا جنسی رجحان کے مقابلے میں نمایاں طور پر زیادہ bias دکھائی[1]۔ یہ ماڈل کے اندر bias کی غیر یکسانیت کی نشاندہی کرتا ہے — کچھ قسم کے دقیانوسی تصورات اس نے زیادہ مضبوطی سے سیکھے ہیں۔
  • حقائق کی موجودگی میں بہتری، لیکن پوشیدہ bias کا باقی رہنا۔ جب ماڈلوں کو درست جواب کے واضح اشارے کے ساتھ واضح تناظر ملا تو ان کی درستگی نمایاں طور پر بڑھ گئی (نامعلومیت کی صورت کے مقابلے میں)[1]۔ تاہم تفصیلی تجزیے سے ایک باریک اثر سامنے آیا: درستگی دقیانوسی تصور سے درست جواب کے تعلق کے لحاظ سے غیر یکساں نکلی[1]۔ اوسطاً، ماڈلوں نے ان مثالوں میں 3-3.5 فیصد زیادہ درستگی حاصل کی جہاں درست جواب رائج دقیانوسی تصور سے مطابقت رکھتا تھا، ان مثالوں کے مقابلے میں جہاں درست جواب اس دقیانوسی تصور کے خلاف جاتا تھا[1]۔ دوسرے لفظوں میں، جب حقائق تعصب کی تصدیق کرتے تھے تو ماڈل تقریباً بلا غلطی جواب دیتے؛ لیکن اگر غیر دقیانوسی اختیار کا نام لینا ضروری تھا تو غلطی کا امکان بڑھ جاتا تھا۔ کارکردگی میں یہ فرق اگرچہ بہت بڑا نہیں، پھر بھی بہت سے زمروں میں شماریاتی طور پر ظاہر ہوا[1]۔ صنفی دقیانوسی تصورات سے متعلق سوالات میں سب سے زیادہ تفاوت ریکارڈ کیا گیا: 5 فیصد پوائنٹس تک کا فرق[1]۔ اس طرح bias کا پوشیدہ اثر نمایاں ہوتا ہے: ماڈل اوسطاً دقیانوسی تصور کے خلاف جانے پر قدرے کمزور کارکردگی دکھاتے ہیں۔
  • زمروں اور سانچوں کا تقابل۔ BBQ محققین نے تمام نو زمروں میں bias score کا تجزیہ کیا اور پایا کہ مبہم تناظر میں تمام زمروں کا اشاریہ مثبت ہے، لیکن اس کی قدر مختلف ہے[1]۔ جیسا کہ ذکر ہوا، جسمانی ظاہری شکل، سماجی و اقتصادی حیثیت اور بعض بین المقاطع زمروں میں سب سے زیادہ bias ریکارڈ ہوئی[1]۔ نسل/نسلی تعلق اور جنسی رجحان کے زمروں میں bias score نسبتاً کم، اگرچہ صفر نہیں، رہے[1]۔ واضح تناظر میں bias score مجموعی طور پر صفر کے قریب ہے (کیونکہ ماڈل اکثر درست جواب دیتا ہے)، لیکن پھر بھی کچھ سانچوں میں مثبت رہتا ہے، جو کی گئی غلطیوں کی نوعیت میں نمایاں انحراف کی عکاسی کرتا ہے[1]۔ مثلاً مذہب کے زمرے میں زیادہ تر غلطیاں ایک ہی سمت میں تھیں — ماڈل عموماً غلطی کرتے وقت تعصب کی بنیاد پر جواب چنتے تھے[1]۔

مجموعی طور پر BBQ نے ظاہر کیا کہ یہاں تک کہ طاقتور جدید لسانی ماڈل بھی واضح طور پر سماجی تعصبات سے آزاد نہیں ہیں[1]۔ وہ دقیانوسی تصورات کو دوہرانے کا رجحان رکھتے ہیں اگر انہیں غیر یقینی صورتحال میں ڈالا جائے، اور حقائق کی موجودگی میں بھی باریک bias ظاہر کر سکتے ہیں جب مخالف جواب درکار ہو[1]۔ نیز ان اثرات کی شدت مختلف گروہوں میں یکساں نہیں: کچھ دقیانوسی تصورات ماڈل نے زیادہ مضبوطی سے سیکھے ہیں[1]۔ BBQ کے مصنفین اس بات پر زور دیتے ہیں کہ دریافت شدہ فرق اگرچہ قابل ذکر ہیں، لیکن بہت زیادہ تشویشناک نہیں — زیادہ تر ماڈلوں کے bias score انتہائی قدروں تک نہیں پہنچتے، اور اکثر چند درجن فیصد کے دائرے میں رہتے ہیں[1]۔ تاہم، دقیانوسی تصورات کی طرف معمولی منظم انحراف بھی LLM کے بڑے پیمانے پر استعمال میں ممکنہ طور پر خطرناک ہے، اس لیے ایسے bias کی نشاندہی اور ازالہ ایک اہم کام ہے[3]۔ BBQ نے محققین کو اس شعبے میں پیش رفت کو ٹریک کرنے کا ایک واضح اور مقداری طور پر قابل پیمائش طریقہ فراہم کیا[3]۔

اثر اور آگے کی تحقیق

BBQ dataset نے لسانی ماڈلوں کی fairness خصوصیات کی جانچ کے معیاری آلے کے طور پر جلد پہچان حاصل کر لی[4]۔ اس کا کھلا سورس کوڈ اور ڈیٹا repository میں دستیاب ہے (لائسنس CC BY 4.0)[4]، جس نے وسیع تحقیقاتی حلقے کو نئے ماڈلوں کی تیاری اور جانچ میں BBQ استعمال کرنے کی اجازت دی۔ کئی جائزوں میں BBQ کا ذکر دیگر benchmark کے ساتھ (مثلاً StereoSet، WinoBias، ToxiGen) NLP میں سماجی bias کے مطالعے میں ایک اہم سنگ میل کے طور پر کیا جاتا ہے[3]۔ BBQ کی اشاعت کے بعد سے ایسے کام سامنے آئے ہیں جو اس کے خیالات کو آگے بڑھاتے اور نئے حالات کے مطابق ڈھالتے ہیں:

  • سوالات کے فارمیٹ کی توسیع (Open-BBQ)۔ اصلی BBQ multiple-choice فارمیٹ میں کام پیش کرتا ہے[3]۔ 2024 میں BBQ کی کھلے جوابات کے لیے ترمیم تجویز کی گئی، جس میں blank بھرنے اور مختصر جوابی متن کے کام شامل ہیں[3]۔ یہ ورژن، جسے بالعموم Open-BBQ کہا جاتا ہے، زیادہ آزاد مکالماتی حالات میں bias کا جائزہ لینے کی اجازت دیتا ہے جہاں ماڈل کے پاس مقررہ جوابی اختیارات نہیں ہوتے[3]۔ تحقیق سے ظاہر ہوا کہ LLM آزاد متن تیار کرتے وقت بھی کچھ گروہوں کے خلاف بڑھی ہوئی bias ظاہر کرتے ہیں[3]۔ Open-BBQ کے مصنفین نے zero-shot اور few-shot prompts اور chain-of-thought (مرحلہ وار استدلال) کو ملا کر تعصب کم کرنے کے طریقوں کا بھی تجربہ کیا[3]۔ ان طریقوں سے جوابات میں bias کی سطح نمایاں طور پر کم ہوئی[3]۔ Open-BBQ نے اصلی dataset کی تکمیل کی، جس سے generative ماڈلوں کو صارف کی درخواستوں کے قریب فارمیٹس میں جانچنا ممکن ہوا۔
  • ثقافتی موافقت (localization)۔ چونکہ BBQ امریکی سماجی حقیقتوں سے جڑا ہے، محققین نے اسے دوسری زبانوں اور ثقافتوں کے مطابق ڈھالنے میں دلچسپی ظاہر کی[5]۔ 2023 میں کورین سائنسدانوں نے KoBBQ (Korean BBQ) dataset پیش کیا — Bias Benchmark کا کورین ہم منصب[5]۔ انہوں نے BBQ کی localization کا ایک عمومی طریقہ کار وضع کیا: انہوں نے اصلی سانچوں کو تین زمروں میں تقسیم کیا — وہ جنہیں محض ترجمہ کیا جا سکتا ہے، وہ جن میں گروہوں کو مقامی ہم منصبوں سے بدلنا ضروری ہے، اور وہ جو کورین تناظر میں بالکل قابل اطلاق نہیں[5]۔ اضافی طور پر KoBBQ نے کورین معاشرے کے لیے مخصوص 4 نئے دقیانوسی تصور زمرے متعارف کرائے اور کچھ غیر متعلق مثالیں حذف کر دیں[5]۔ نتیجتاً کورین زبان میں 268 سانچوں اور 76,048 مثالوں پر مشتمل ایک dataset تیار ہوا، جو 12 سماجی bias زمروں (اصلی اور نئے سمیت) کا احاطہ کرتا ہے[5]۔ KoBBQ پر کثیر اللسانی ماڈلوں کی جانچ سے اصلی BBQ کے براہ راست مشینی ترجمے کے مقابلے میں تعصب کی سطح میں نمایاں فرق سامنے آئے[5]۔ یہ اس بات پر زور دیتا ہے کہ براہ راست ترجمہ کافی نہیں — ثقافتی طور پر مخصوص benchmark ضروری ہیں جو ہر ملک کے منفرد دقیانوسی تصورات اور تناظر کو مدنظر رکھیں[5]۔ KoBBQ پر کام نے BBQ کے طریقہ کار کو عالمی سطح پر پھیلانے کا امکان ظاہر کیا۔

BBQ مصنوعی ذہانت کی اخلاقیات کی تحقیق کا لازمی حصہ بن گیا ہے[3]۔ اس کا اثر ماڈل debasing کے نئے طریقوں، زیادہ جامع datasets کی تعمیر اور bias کے باریک تجزیے کے لیے میٹرکس کی ظہور میں دیکھا جا سکتا ہے۔ محققین نوٹ کرتے ہیں کہ BBQ کی ایک مضبوط خوبی مثالوں کی تعمیر کی وسعت اور باریکی ہے[3]۔ BBQ کی طرف سے اجاگر کردہ چیلنجوں کے جواب میں حال ہی میں تربیتی ڈیٹا کی فلٹریشن سے لے کر خصوصی post-processing الگورتھم اور LLM کو منصفانہ جوابات کے لیے fine-tuning تک bias کم کرنے کی حکمت عملیاں فعال طور پر تیار ہو رہی ہیں[3]۔

خلاصہ کرتے ہوئے، BBQ (Bias Benchmark for QA) نے لسانی ماڈلوں میں سماجی تعصبات کی پیمائش کے ایک قیمتی اور قابل اعتماد آلے کے طور پر اپنی پوزیشن مستحکم کی ہے۔ یہ تحقیقاتی برادری کو معیاری جانچوں کا ایک مجموعہ فراہم کرتا ہے جو ماڈلوں کا دقیانوسی تصورات کے لحاظ سے تقابل اور ان کی غیر جانبداری میں پیش رفت کو ٹریک کرنے کی اجازت دیتا ہے[3]۔ BBQ پھیلتا اور ڈھلتا رہتا ہے، جو زیادہ منصفانہ اور محفوظ AI نظام بنانے میں عالمی دلچسپی کی عکاسی کرتا ہے[3] — ایسے نظام جو غیر محسوس لیکن نمایاں نقصاندہ bias سے آزاد ہوں۔

حوالہ جات

  • BBQ کا اصلی مضمون (arXiv)
  • GitHub پر BBQ کی repository
  • Papers With Code پر BBQ dataset کا صفحہ
  • ACL Anthology پر BBQ کا مضمون
  • KoBBQ dataset کا مضمون (arXiv)
  • Open-BBQ dataset کا مضمون (arXiv)

ادبیات

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

حواشی

[1] [2] [3] [4] [5] </references>

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 1.24 1.25 1.26 1.27 1.28 1.29 1.30 1.31 1.32 1.33 1.34 1.35 1.36 1.37 1.38 1.39 1.40 1.41 1.42 1.43 1.44 1.45 1.46 1.47 1.48 1.49 1.50 1.51 1.52 1.53 1.54 1.55 1.56 1.57 1.58 1.59 1.60 1.61 1.62 1.63 1.64 1.65 1.66 1.67 1.68 1.69 1.70 1.71 1.72 1.73 1.74 1.75 1.76 1.77 1.78 1.79 1.80 1.81 Parrish A. et al. «BBQ: A Hand-Built Bias Benchmark for Question Answering». arXiv. [1]
  2. 2.0 2.1 Parrish A. et al. «BBQ: A hand-built bias benchmark for question answering». ACL Anthology. [2]
  3. 3.00 3.01 3.02 3.03 3.04 3.05 3.06 3.07 3.08 3.09 3.10 3.11 3.12 3.13 3.14 3.15 3.16 Liu Z. et al. (2024). «Evaluating and Mitigating Social Bias for Large Language Models in Open-ended Settings». arXiv preprint. [3]
  4. 4.0 4.1 4.2 4.3 4.4 4.5 4.6 «BBQ Dataset». Papers With Code. [4]
  5. 5.0 5.1 5.2 5.3 5.4 5.5 5.6 5.7 Jin J. et al. (2024). «KoBBQ: Korean Bias Benchmark for Question Answering». arXiv preprint. [5]