BBQ (Bias Benchmark for Question Answering) (HI)
BBQ (Bias Benchmark for Question Answering) — यह प्रश्न-उत्तर प्रणालियों (QA) में सामाजिक पूर्वाग्रहों (bias) के मूल्यांकन के लिए एक dataset है[1]। इसे न्यूयॉर्क विश्वविद्यालय के शोधकर्ताओं के एक समूह ने Alicia Parrish के नेतृत्व में विकसित किया था और 2022 में ACL Findings सम्मेलन में प्रकाशित किया गया था[1][2]। BBQ का उद्देश्य यह पता लगाना है कि बड़े भाषा मॉडल (Large Language Models) और अन्य QA-मॉडल प्रश्नों के उत्तर देते समय, विशेष रूप से प्राकृतिक भाषा में प्रश्न-उत्तर के व्यावहारिक कार्यों में, किस प्रकार रूढ़िवादिता और पूर्वाग्रह प्रकट करते हैं[1]। BBQ, NLP में सामाजिक bias के मूल्यांकन के लिए सबसे व्यापक benchmark में से एक बन गया है, जो नौ सामाजिक श्रेणियों के अंतर्गत रूढ़िवादिताओं के एक विस्तृत स्पेक्ट्रम को कवर करता है[3]।
यह dataset पूर्ववर्ती कार्यों का पूरक है, जैसे कि UnQover dataset (2020), जो सीमित संख्या में विशेषताओं (लिंग-पेशा, राष्ट्रीयता, जातीयता, धर्म) के आधार पर पूर्वाग्रह को मापता था और मॉडल के उत्तरों की बजाय उनकी संभाव्यताओं पर निर्भर करता था[3]। UnQover के विपरीत, BBQ मॉडल के उत्तरों की सामग्री और प्रस्तावित विकल्पों में से उनके चयन का सीधे विश्लेषण करता है, जिससे परिणाम के स्तर पर ही पूर्वाग्रह का आकलन करना संभव होता है[1]।
BBQ के लेखक इसे मॉडलों में हानिकारक सामाजिक रूढ़िवादिताओं के निदान और कमजोर सामाजिक समूहों पर ऐसी रूढ़िवादिताओं के नकारात्मक प्रभाव के जोखिम को कम करने के उपकरण के रूप में प्रस्तुत करते हैं[1]। यह dataset अमेरिकी अंग्रेजी भाषी संस्कृति के लिए प्रासंगिक रूढ़िवादिताओं पर केंद्रित है और सभी संभावित सांस्कृतिक संदर्भों को कवर नहीं करता[1]। फिर भी, BBQ ने NLP में सामाजिक bias को मापने और कम करने पर बाद के शोध कार्यों की नींव रखी और मॉडलों की नैतिक शुद्धता के तुलनात्मक मूल्यांकन में एक मानक बन गया।
Dataset की संरचना और विन्यास
BBQ में लगभग 58,500 प्रश्न और उत्तर हैं, जो विशिष्ट रूढ़िवादिताओं की पहचान के लिए लक्षित विशेष समूहों में संगठित हैं[4]। सभी उदाहरण विभिन्न सामाजिक समूहों के प्रतिनिधियों को नुकसान पहुँचाने वाले पूर्वाग्रहों और रूढ़िवादिताओं के प्रलेखित मामलों के आधार पर लेखकों द्वारा हाथ से तैयार किए गए थे[4]। परिदृश्य बनाते समय वैज्ञानिक शोध के आंकड़ों, मीडिया लेखों, रिपोर्टों और अन्य विश्वसनीय स्रोतों का उपयोग किया गया, जो किसी विशेष रूढ़िवादिता के अस्तित्व और उसके हानिकारक परिणामों की पुष्टि करते हैं[1]। प्रत्येक स्थिति के लिए लेखकों ने उस स्रोत का संदर्भ दिया है जहाँ इस रूढ़िवादिता को नकारात्मक या हानिकारक के रूप में वर्णित किया गया है (उदाहरण के लिए, कोई वैज्ञानिक लेख या समाचार नोट)[1]।
सामाजिक श्रेणियाँ
BBQ नौ मुख्य सामाजिक रूप से महत्वपूर्ण श्रेणियों को कवर करता है (जिनमें से अधिकांश अमेरिकी समान रोजगार अवसर आयोग की परिभाषा में संरक्षित समूहों के अनुरूप हैं)[1]:
- आयु – आयु समूहों के प्रति पूर्वाग्रह (उदाहरण के लिए, वृद्ध लोगों में संज्ञानात्मक क्षमताओं में गिरावट की रूढ़िवादिता)[1]।
- विकलांगता – विकलांग लोगों की मानसिक क्षमताओं या अन्य गुणों के बारे में रूढ़िवादिताएँ (उदाहरण के लिए, यह धारणा कि शारीरिक रूप से सीमित व्यक्ति बौद्धिक रूप से कम सक्षम हैं)[1]।
- लैंगिक पहचान – लैंगिक रूढ़िवादिताएँ (उदाहरण के लिए, यह विचार कि «लड़कियाँ गणित में कमजोर होती हैं»)[1]।
- राष्ट्रीयता – राष्ट्रीय-जातीय पूर्वाग्रह (उदाहरण के लिए, अफ्रीकी मूल के लोगों की तकनीकी अनपढ़ता की रूढ़िवादिता)[1]।
- शारीरिक बनावट – शारीरिक रूप-रंग या बनावट के आधार पर भेदभाव (उदाहरण के लिए, यह राय कि मोटे लोग कम बुद्धिमान या मेहनती होते हैं)[1]।
- नस्ल/जातीयता – नस्लीय रूढ़िवादिताएँ (उदाहरण के लिए, किसी विशेष नस्ल को अपराध या नशे से जोड़ने का पूर्वाग्रह)[1]।
- धर्म – धार्मिक रूढ़िवादिताएँ (उदाहरण के लिए, यहूदियों को लालची, मुसलमानों को हिंसा-प्रवण मानने जैसी धारणाएँ आदि)[1]।
- सामाजिक-आर्थिक स्थिति – गरीब या अमीर तबकों के प्रति पूर्वाग्रह (उदाहरण के लिए, यह विश्वास कि गरीब परिवारों से आने वाले लोग बुरे माता-पिता होंगे)[1]।
- यौन अभिविन्यास – समलैंगिकता-विरोधी रूढ़िवादिताएँ (उदाहरण के लिए, समलैंगिकता का HIV संक्रमण से झूठा जुड़ाव)[1]।
इन नौ श्रेणियों के अलावा, BBQ में दो अंतरखंडीय श्रेणियाँ (intersectional biases) भी हैं, जो एक साथ दो विशेषताओं को जोड़ती हैं: (1) लिंग के साथ नस्ल/जातीयता का संयोजन और (2) सामाजिक-आर्थिक स्थिति के साथ नस्ल का संयोजन[1]। ऐसे मामले विभिन्न समूहों के चौराहे पर रूढ़िवादिताओं को ध्यान में रखते हैं (उदाहरण के लिए, विशेष रूप से अश्वेत महिलाओं के विरुद्ध या निम्न सामाजिक वर्ग के कुछ जातीय समूहों के विरुद्ध पूर्वाग्रह)।
टेम्पलेट और उदाहरणों का निर्माण
प्रत्येक श्रेणी के लिए टीम ने परिदृश्य टेम्पलेट लिखे — छोटे-छोटे चित्रण, जिनमें दो पात्र होते हैं, जो लक्षित विशेषता के आधार पर भिन्न होते हैं (उदाहरण के लिए, युवा और वृद्ध, पुरुष और महिला, अमीर और गरीब आदि)[4]। टेम्पलेट में एक ऐसी स्थिति होती है जो किसी ज्ञात रूढ़िवादिता की पुष्टि या खंडन कर सकती है। प्रत्येक परिदृश्य से प्रश्न और उत्तर विकल्प जुड़े होते हैं।
कुल मिलाकर नौ मुख्य श्रेणियों में से प्रत्येक के लिए 25 अद्वितीय टेम्पलेट विकसित किए गए, साथ ही नस्ल और लिंग श्रेणियों के लिए वास्तविक नामों का उपयोग करते हुए 25 अतिरिक्त टेम्पलेट (उचित नामों के स्तर पर bias की जाँच के लिए)[1]। दो अंतरखंडीय दिशाओं के लिए भी 25-25 टेम्पलेट बनाए गए[1]। इस प्रकार, आधार परिदृश्यों की कुल संख्या 300 से अधिक है।
प्रत्येक टेम्पलेट में चर के लिए विशेष स्लॉट होते हैं — समूहों के नाम या विवरण — जो पाठ में प्रतिस्थापित किए जाते हैं (उदाहरण के लिए, आयु टेम्पलेट में «_वर्षीय व्यक्ति» की जगह अलग-अलग संख्याएँ भरी जाती हैं, या शारीरिक बनावट में «मोटा»/«पतला» जैसे विशेषण)[1]। विभिन्न मूल्यों की प्रतिस्थापना और दो पात्रों के उल्लेख के क्रम में फेरबदल के कारण, प्रत्येक टेम्पलेट अनेक विशिष्ट उदाहरणों तक विस्तारित होता है (न्यूनतम 8 से लेकर ~200 भिन्नताओं तक)[1]। सामान्यतः एक टेम्पलेट से कम से कम 100 अंतिम प्रश्न उत्पन्न होते हैं, और कुछ मामलों में — दो सौ तक[1]। कुल मिलाकर 58,492 उदाहरणों (परिदृश्य, प्रश्न और उत्तर के अद्वितीय संयोजन) का एक संग्रह बना[4]।
संदर्भ और प्रश्नों के प्रकार
BBQ की मुख्य विशेषता यह है कि प्रत्येक स्थिति को दो प्रकार के संदर्भ और दो प्रश्न-शैलियों में प्रस्तुत किया जाता है, जो चार प्रश्नों का एक समूह बनाते हैं (जिसे 4 का क्लस्टर कहा जाता है)[1]। यह जानकारी की कमी के प्रभाव को मॉडल की अपनी रूढ़िवादिताओं से अलग करने के लिए किया गया है। प्रत्येक चतुष्टय में[1]:
- अस्पष्ट संदर्भ (under-informative or ambiguous context): ऐसा पाठ जिसमें दो अलग-अलग समूहों के दो व्यक्तियों की भागीदारी वाली स्थिति का वर्णन है, लेकिन पूछे गए प्रश्न का स्पष्ट उत्तर देने के लिए पर्याप्त जानकारी नहीं है[1]। ऐसे मामलों में सही उत्तर हमेशा «अज्ञात» विकल्प होता है (अर्थात पर्याप्त डेटा का अभाव)[1]। ये उदाहरण यह जाँचने के लिए आवश्यक हैं कि मॉडल रूढ़िवादिता के आधार पर निष्कर्ष तो नहीं निकाल रहा।
- स्पष्ट संदर्भ (disambiguated context): एक विस्तारित परिदृश्य, जिसमें एक स्पष्ट करने वाला विवरण जोड़ा गया है, जिससे यह निर्धारित किया जा सके कि दो उल्लिखित व्यक्तियों में से कौन प्रश्न के अनुरूप है[1]। इस मामले में दो पात्रों में से एक निश्चित रूप से सही उत्तर है (और «अज्ञात» विकल्प अब गलत है)। स्पष्ट संदर्भ यह जाँचने के लिए है कि क्या मॉडल अपने संभावित bias को पार कर सही उत्तर चुन सकता है, भले ही रूढ़िवादिता इसके विपरीत संकेत दे[1]।
- नकारात्मक प्रश्न (e.g., «इनमें से कौन विषय को कम जानता है?», «किसने अपराध किया?»)[1]। ऐसा प्रश्न अस्पष्ट संदर्भ के साथ मिलकर यह जाँचता है कि क्या मॉडल तथ्यों के अभाव में किसी नकारात्मक कृत्य को किसी विशेष समूह से जोड़ने की प्रवृत्ति रखता है[1]।
- गैर-नकारात्मक (विपरीत) प्रश्न (e.g., «इनमें से कौन विषय को अच्छी तरह जानता है?» या «कौन बुरे कार्य से परहेज करता है?»)[1]। गैर-नकारात्मक प्रश्न इस प्रकार तैयार किया गया है कि वह सीधे रूढ़िवादिता का समर्थन न करे, लेकिन साथ ही मॉडल के उत्तरों के संतुलन की जाँच करने की अनुमति दे[1]। नकारात्मक और तटस्थ संस्करणों के उत्तरों की तुलना से व्यवस्थित विचलन सामने आते हैं।
क्लस्टर में इन चारों उदाहरणों में से प्रत्येक के लिए तीन उत्तर विकल्प होते हैं: दो विशिष्ट (दोनों समूहों में से प्रत्येक का नाम लेते हुए) और एक विकल्प जो पर्याप्त जानकारी के अभाव को इंगित करता है («Unknown» और समकक्ष वाक्यांशों के रूप में चिह्नित)[1]। उदाहरण के लिए, एक ऐसे दृश्य में जहाँ एक काल्पनिक ईसाई और मुसलमान शामिल हैं, उत्तर विकल्प होंगे: «ईसाई», «मुसलमान» या «अज्ञात»[1]। साथ ही, «अज्ञात» शब्द हमेशा एक जैसा नहीं होता — 10 समानार्थी अभिव्यक्तियों का उपयोग किया जाता है[1]।
इसके अलावा, प्रत्येक टेम्पलेट में दो समूहों के उल्लेख का क्रम स्वचालित रूप से बदलता है[1]। यह क्रम-प्रभाव को निष्प्रभावी करने के लिए किया गया है — एक ज्ञात कारक, जिसमें मॉडल सामग्री की परवाह किए बिना पहले नामित इकाई को अधिक बार चुन सकते हैं[1]।
एनोटेशन और गुणवत्ता जाँच
BBQ के प्रत्येक उदाहरण का मूल्यांकन crowd-sourcing एनोटेटर्स द्वारा किया गया था: कम से कम 5 स्वतंत्र लोगों ने प्रश्नों का उत्तर दिया, और अंतिम dataset में केवल वे उदाहरण शामिल किए गए जिन पर 5 में से कम से कम 4 एनोटेटर सही उत्तर पर सहमत हुए (मतदान द्वारा)[1]। यदि कोई प्रश्न इस सीमा को पार नहीं करता था, तो पूरे टेम्पलेट की समीक्षा की जाती और उसे संपादित किया जाता था[1]। इस प्रक्रिया की बदौलत, BBQ पर मानवीय सटीकता काफी अधिक है: व्यक्तिगत एनोटेटर ~95.7% प्रश्नों का सही उत्तर देते थे, और बहुमत के मतों को ध्यान में रखते हुए स्वर्ण मानक सटीकता 99.7% तक पहुँच जाती है[1]। सहमति का कप्पा-मानदंड (Krippendorff's alpha) 0.883 था, जो सही उत्तरों के बारे में लोगों के बीच उच्च सहमति को इंगित करता है[1]। ये उपाय पुष्टि करते हैं कि BBQ के कार्य लोगों को समझ में आते हैं और उनके वस्तुनिष्ठ सही उत्तर हैं; परिणामस्वरूप, इन उदाहरणों पर मॉडल की गलतियों को bias की अभिव्यक्ति के रूप में उचित रूप से व्याख्यायित किया जा सकता है, न कि स्वयं प्रश्नों की अस्पष्टता के रूप में।
मॉडलों के पूर्वाग्रह का मूल्यांकन
BBQ को सामाजिक bias को उकसाने वाली परिस्थितियों में मॉडल के व्यवहार के बहु-आयामी मूल्यांकन के लिए विकसित किया गया है। QA-मॉडल के परीक्षण में मॉडल को संदर्भ और प्रश्न इनपुट के रूप में दिए जाते हैं, जिसके बाद उसे तीन उत्तर विकल्पों में से एक चुनना होता है। परिणामों का विश्लेषण दो स्तरों पर किया जाता है[1]:
अस्पष्ट संदर्भ का मामला
यह मापा जाता है कि मॉडल कितनी बार आवश्यक जानकारी के अभाव में प्रश्नों का गलत उत्तर देता है, अर्थात रूढ़िवादिता पर निर्भर करता है[1]। आदर्श रूप से, मॉडल को अपर्याप्त संदर्भ वाले किसी भी प्रश्न का उत्तर «अज्ञात» देना चाहिए, लेकिन यदि उसने किसी एक समूह को चुना, तो इसे अंतर्निहित रूढ़िवादिता के प्रक्षेपण के रूप में देखा जाता है[1]। ऐसी गलतियों की आवृत्ति और श्रेणियों में उनका वितरण मॉडल की हानिकारक रूढ़िवादिताओं को पुन: उत्पन्न करने की प्रवृत्ति का अंदाजा देता है।
सूचनाप्रद संदर्भ का मामला
यह आकलन किया जाता है कि मॉडल कितनी सटीकता से उत्तर देता है जब संदर्भ में स्पष्ट सही उत्तर मौजूद हो[1]। यहाँ आमतौर पर मानक मेट्रिक accuracy (सही उत्तरों का प्रतिशत) की गणना की जाती है — यह दर्शाती है कि मॉडल प्रश्न-उत्तर कार्य को सामान्यतः हल कर पाता है या नहीं। हालाँकि, विशेष ध्यान उन मामलों पर दिया जाता है जहाँ सही उत्तर रूढ़िवादिता के विरुद्ध जाता है[1]। BBQ के डेवलपर विश्लेषण करते हैं कि यदि सही उत्तर किसी गहरी जड़ें जमाई रूढ़िवादिता का खंडन करता है तो क्या मॉडल की सटीकता गिर जाती है (और इसके विपरीत, क्या सटीकता तब अधिक होती है जब सत्य रूढ़िवादी अपेक्षा से मेल खाता है)[1]। ऐसा प्रभाव इंगित करेगा कि तथ्यों की उपस्थिति में भी मॉडल bias के कारण गलतियाँ कर सकता है।
Bias Score
पूर्वाग्रह की मात्रा को मापने के लिए एक विशेष मेट्रिक — पूर्वाग्रह संकेतक (bias score) — प्रस्तुत की जाती है[1]। सामान्य रूप में, bias score उन मॉडल उत्तरों का प्रतिशत दर्शाता है (शर्त के अनुसार गलत या सभी उत्तरों में से) जो रूढ़िवादिता के अनुरूप हैं[1]।
- +100% का मान इंगित करेगा कि मॉडल ने सभी मामलों में वह उत्तर विकल्प चुना जो रूढ़िवादी रूप से लक्षित समूह को नकारात्मक गुण देता है।
- 0% — bias का कोई प्रकटन नहीं (मॉडल या तो हमेशा सही/«अज्ञात» उत्तर देता है, या दोनों दिशाओं में बराबर गलतियाँ करता है)।
- नकारात्मक score (-100% तक) — विपरीत प्रवृत्ति, जब मॉडल हमेशा रूढ़िवादिता की अपेक्षा के विरुद्ध उत्तर देता है[1]।
संकेतकों की गणना अस्पष्ट और स्पष्ट संदर्भों के लिए अलग-अलग की जाती है, क्योंकि उनमें गलतियों की प्रकृति भिन्न होती है[1]।
- अस्पष्ट प्रश्नों के लिए bias score उन मामलों के अनुपात से निर्धारित होता है, जब मॉडल ने «अज्ञात» की बजाय कोई विशिष्ट उत्तर चुना, और वह उत्तर नकारात्मक रूढ़िवादिता से मेल खाया[1]। ऐसे उत्तर जितने अधिक होंगे, धनात्मक score उतना ही अधिक होगा। इसमें सटीकता को भी ध्यान में रखा जाता है: यदि मॉडल बराबर-बराबर गलतियाँ करता है और सही उत्तर («अज्ञात») देता है, तो रूढ़िवादी गलतियों के एक हिस्से के बावजूद score उस मॉडल की तुलना में कम होगा जो हमेशा रूढ़िवादी उत्तर चुनता है[1]। इस प्रकार, bias-उत्तरों की आवृत्ति और निश्चितता दोनों को दंडित किया जाता है (अस्पष्ट संदर्भों के लिए मेट्रिक को «अज्ञात» सही उत्तरों के प्रतिशत को ध्यान में रखते हुए स्केल किया जाता है)[1]।
- स्पष्ट प्रश्नों के लिए bias score की गणना थोड़ी अलग तरह से की जाती है, क्योंकि यहाँ सही उत्तर समूहों में से एक है[1]। इन मामलों में मॉडल की गलत उत्तरों पर ध्यान दिया जाता है: वे गलतियाँ जिनमें मॉडल ने सही विकल्प नहीं चुना, बल्कि रूढ़िवादिता के अनुरूप वैकल्पिक विकल्प चुना[1]। दूसरे शब्दों में, यदि मॉडल ने पूर्वाग्रह को प्राथमिकता देते हुए गलती की (उदाहरण के लिए, तथ्यों पर विश्वास नहीं किया और रूढ़िवादिता के अनुसार उत्तर दिया), तो यह score को बढ़ाता है[1]।
समग्र सटीकता के साथ bias score का विश्लेषण BBQ पर मॉडल के व्यवहार की विस्तृत विशेषता प्रदान करता है। लेखक बताते हैं कि समान accuracy गलतियों की अलग-अलग प्रकृति छुपा सकती है[1]। इस प्रकार, यह संकेतक गलतियों की दिशा दर्शाता है और ऐसे सूक्ष्म मामलों को उजागर करता है जो केवल सटीकता से नहीं दिखते।
परिणाम और पहचाने गए पैटर्न
BBQ पर कई लोकप्रिय QA-मॉडलों के प्रारंभिक परीक्षण ने bias की कई स्पष्ट अभिव्यक्तियाँ प्रदर्शित कीं[1]। Parrish et al. (2022) के शोध में बड़े सार्वभौमिक मॉडल (उदाहरण के लिए, UnifiedQA — T5 पर आधारित QA के लिए एक सामान्यीकृत मॉडल) और मानक multiple-choice मॉडल (जैसे QA पर fine-tuning के साथ ROBERTA) दोनों का परीक्षण किया गया[1]।
प्रयोगों के परिणामों पर मुख्य निष्कर्ष:
- जानकारी की कमी में प्रबल रूढ़िवादी गलतियाँ। सभी परीक्षित प्रणालियों में, जब संदर्भ आवश्यक संकेत नहीं देता था, तो रूढ़िवादिता के अनुरूप उत्तर देने की प्रवृत्ति देखी गई[1]। दूसरे शब्दों में, मॉडल अक्सर «अज्ञात» विकल्प नहीं चुनते थे, बल्कि किसी विशेष रूढ़िवादी अपेक्षा से जुड़े विशिष्ट उत्तर को प्राथमिकता देते थे[1]। उदाहरण के लिए, किसी स्पष्ट अपराधी के बिना अपराध के बारे में अस्पष्ट प्रश्नों में, मॉडल अक्सर किसी विशेष समूह के व्यक्तियों की ओर इशारा करते थे (पूर्वाग्रह के अनुरूप)[1]। ambiguous-संदर्भों के लिए गणना किया गया bias score शून्य से काफी अधिक था, और कुछ मॉडलों में कुछ श्रेणियों में +100% के करीब पहुँच गया[1]। शारीरिक बनावट (मोटापा आदि) से संबंधित दृश्यों में मॉडलों ने विशेष रूप से उच्च रूढ़िवादी प्रवृत्ति दिखाई — इस श्रेणी ने उदाहरण के लिए नस्ल या यौन अभिविन्यास की तुलना में उल्लेखनीय रूप से अधिक bias दिया[1]। यह मॉडल के भीतर bias की विषमता को दर्शाता है — कुछ प्रकार की रूढ़िवादिताएँ उसके द्वारा अन्य की तुलना में अधिक «आत्मसात» की गई हैं।
- तथ्यों की उपस्थिति में सुधार, लेकिन छिपे bias का बने रहना। जब मॉडलों को स्पष्ट सही उत्तर के संकेत के साथ स्पष्ट संदर्भ मिला, तो उनकी सटीकता उल्लेखनीय रूप से बढ़ गई (अनिश्चितता की स्थिति की तुलना में)[1]। हालाँकि, विस्तृत विश्लेषण ने एक सूक्ष्म प्रभाव उजागर किया: सटीकता रूढ़िवादिता के प्रति सही उत्तर के संबंध के आधार पर असमान निकली[1]। औसतन, मॉडलों ने उन उदाहरणों में 3-3.5 प्रतिशत अंक अधिक सटीकता हासिल की जहाँ सही उत्तर प्रचलित रूढ़िवादिता से मेल खाता था, उन उदाहरणों की तुलना में जहाँ सही उत्तर उस रूढ़िवादिता का खंडन करता था[1]। दूसरे शब्दों में, जब तथ्य पूर्वाग्रह की पुष्टि करते थे, मॉडल लगभग बिना किसी गलती के उत्तर देते थे; लेकिन यदि रूढ़िवादिता के लिए «असामान्य» विकल्प को नाम देना आवश्यक था, तो गलती की संभावना बढ़ जाती थी। प्रदर्शन में यह अंतर, हालांकि बहुत बड़ा नहीं, सांख्यिकीय रूप से कई श्रेणियों में प्रकट हुआ[1]। लैंगिक रूढ़िवादिताओं से जुड़े प्रश्नों के लिए सबसे बड़ा अंतर दर्ज किया गया: 5 प्रतिशत अंक तक[1]। इस प्रकार, bias का छिपा हुआ प्रभाव स्पष्ट है: मॉडल औसतन «रूढ़िवादिता के विरुद्ध» थोड़ा कमतर प्रदर्शन करते हैं।
- श्रेणियों और टेम्पलेटों की तुलना। BBQ के शोधकर्ताओं ने सभी नौ श्रेणियों में bias score का विश्लेषण किया और पाया कि अस्पष्ट संदर्भों में संकेतक सभी श्रेणियों में धनात्मक है, लेकिन इसका परिमाण भिन्न होता है[1]। जैसा कि उल्लेख किया गया, अधिकतम bias शारीरिक बनावट, सामाजिक-आर्थिक स्थिति और कुछ अंतरखंडीय श्रेणियों में देखा गया[1]। नस्ल/जातीयता और यौन अभिविन्यास श्रेणियों में bias score अपेक्षाकृत «कम», हालाँकि फिर भी शून्य से अधिक थे[1]। स्पष्ट संदर्भों में bias score सामान्यतः शून्य के करीब है (क्योंकि मॉडल अक्सर सही उत्तर देता है), लेकिन कुछ टेम्पलेटों के लिए यह फिर भी धनात्मक रहता है, जो की गई गलतियों की प्रकृति में ध्यान देने योग्य विचलन को दर्शाता है[1]। उदाहरण के लिए, धर्म श्रेणी में अधिकांश गलतियाँ एक ही दिशा में थीं — मॉडल, गलती करते समय, आमतौर पर पूर्वाग्रह के आधार पर उत्तर चुनते थे[1]।
समग्र रूप से BBQ ने प्रदर्शित किया कि यहाँ तक कि शक्तिशाली आधुनिक भाषा मॉडल भी स्पष्ट रूप से सामाजिक पूर्वाग्रहों से मुक्त नहीं हैं[1]। वे रूढ़िवादिताओं को पुन: उत्पन्न करने की प्रवृत्ति रखते हैं, यदि उन्हें अनिश्चितता की स्थिति में रखा जाए, और तथ्यों की उपस्थिति में भी सूक्ष्म bias प्रदर्शित कर सकते हैं, जिनके लिए विपरीत उत्तर की आवश्यकता होती है[1]। साथ ही, इन प्रभावों का परिमाण विभिन्न समूहों के लिए समान नहीं है: कुछ रूढ़िवादिताएँ मॉडल द्वारा अधिक «आत्मसात» की गई हैं[1]। BBQ के लेखक जोर देते हैं कि खोजे गए अंतर, हालांकि ध्यान देने योग्य हैं, लेकिन विनाशकारी रूप से बड़े नहीं हैं — अधिकांश मॉडलों के bias score चरम मूल्यों तक नहीं पहुँचते, और अक्सर कुछ दर्जन प्रतिशत के क्षेत्र में होते हैं[1]। फिर भी, LLM के बड़े पैमाने पर उपयोग में रूढ़िवादिताओं की दिशा में छोटे व्यवस्थित विचलन भी संभावित रूप से खतरनाक हैं, इसलिए ऐसे bias की पहचान और उन्मूलन एक महत्वपूर्ण कार्य है[3]। BBQ ने शोधकर्ताओं को इस क्षेत्र में प्रगति को ट्रैक करने का एक स्पष्ट और मात्रात्मक रूप से मापने योग्य तरीका प्रदान किया[3]।
प्रभाव और आगे का शोध
BBQ dataset को जल्द ही भाषा मॉडलों की fairness विशेषताओं के मूल्यांकन के लिए एक मानक उपकरण के रूप में मान्यता मिली[4]। इसका खुला स्रोत कोड और डेटा रिपॉजिटरी में उपलब्ध है (CC BY 4.0 लाइसेंस)[4], जिसने व्यापक शोध समुदाय को नए मॉडलों के विकास और परीक्षण में BBQ का उपयोग करने की अनुमति दी। कई समीक्षाओं में BBQ का उल्लेख NLP में सामाजिक bias के अध्ययन में एक महत्वपूर्ण मील के पत्थर के रूप में अन्य benchmark के साथ (जैसे StereoSet, WinoBias, ToxiGen) किया गया है[3]। BBQ के प्रकाशन के बाद से ऐसे कार्य सामने आए हैं जो इसके विचारों को विकसित करते हैं और नई परिस्थितियों के अनुकूल बनाते हैं:
- प्रश्न प्रारूपों का विस्तार (Open-BBQ)। मूल BBQ multiple choice प्रारूप में कार्य प्रस्तुत करता है[3]। 2024 में खुले उत्तरों के लिए BBQ का एक संशोधन प्रस्तावित किया गया, जिसमें रिक्त स्थान भरने और छोटे उत्तर पाठ के कार्य शामिल हैं[3]। Open-BBQ नाम से जानी जाने वाली यह संस्करण संवाद की अधिक स्वतंत्र परिस्थितियों में bias का मूल्यांकन करने की अनुमति देती है, जहाँ मॉडल के पास निश्चित उत्तर विकल्प नहीं होते[3]। शोध ने दिखाया कि LLM स्वतंत्र पाठ उत्पन्न करते समय भी कई समूहों के विरुद्ध बढ़ा हुआ bias प्रदर्शित करते हैं[3]। Open-BBQ के लेखकों ने पूर्वाग्रह को कम करने के तरीकों के साथ प्रयोग भी किए, zero-shot और few-shot संकेतों तथा chain-of-thought (चरण-दर-चरण तर्क) को मिलाते हुए[3]। इन तरीकों ने उत्तरों में bias के स्तर को उल्लेखनीय रूप से कम करने की अनुमति दी[3]। Open-BBQ ने मूल dataset को पूरक बनाया, जिससे उपयोगकर्ता अनुरोधों के करीब के प्रारूपों में generative मॉडलों का परीक्षण संभव हो सका।
- सांस्कृतिक अनुकूलन (स्थानीयकरण)। चूँकि BBQ अमेरिकी सामाजिक वास्तविकताओं से जुड़ा है, शोधकर्ताओं ने इसे अन्य भाषाओं और संस्कृतियों के अनुकूल बनाने में रुचि ली[5]। 2023 में कोरियाई वैज्ञानिकों द्वारा KoBBQ (Korean BBQ) dataset प्रस्तुत किया गया — Bias Benchmark का कोरियाई संस्करण[5]। उन्होंने BBQ के स्थानीयकरण के लिए एक सामान्य दृष्टिकोण विकसित किया: मूल टेम्पलेटों को तीन श्रेणियों में विभाजित किया — जिन्हें केवल अनुवाद किया जा सकता है, जिनके लिए समूहों को स्थानीय समकक्षों से बदलने की आवश्यकता है, और जो कोरियाई संदर्भ में बिल्कुल लागू नहीं हैं[5]। इसके अतिरिक्त, KoBBQ ने कोरियाई समाज के लिए विशिष्ट रूढ़िवादिताओं की 4 नई श्रेणियाँ पेश कीं और कई अनुपयुक्त उदाहरण हटाए[5]। परिणामस्वरूप कोरियाई भाषा में 268 टेम्पलेटों और 76,048 उदाहरणों का एक dataset बना, जिसमें 12 सामाजिक bias श्रेणियाँ शामिल हैं (मूल और नई दोनों)[5]। KoBBQ पर बहुभाषी मॉडलों के परीक्षण ने मूल BBQ के कोरियाई में सीधे मशीन अनुवाद की तुलना में पूर्वाग्रह के स्तर में महत्वपूर्ण अंतर प्रकट किया[5]। यह रेखांकित करता है कि सीधा अनुवाद पर्याप्त नहीं है — सांस्कृतिक रूप से विशिष्ट benchmark आवश्यक हैं, जो प्रत्येक देश की अनूठी रूढ़िवादिताओं और संदर्भ को ध्यान में रखते हों[5]। KoBBQ पर कार्य ने BBQ की पद्धति को वैश्विक स्तर पर बढ़ाने की संभावना प्रदर्शित की।
BBQ कृत्रिम बुद्धिमत्ता की नैतिकता पर शोध का एक अभिन्न अंग बन गया है[3]। इसका प्रभाव मॉडलों को de-bias करने की नई विधियों, अधिक समावेशी dataset के निर्माण और bias के सूक्ष्म विश्लेषण के लिए मेट्रिक्स के उद्भव में देखा जाता है। शोधकर्ताओं ने नोट किया कि BBQ की एक मजबूत पक्ष उसकी व्यापक कवरेज और उदाहरणों के निर्माण की सावधानी है[3]। BBQ द्वारा उठाई गई चुनौतियों के जवाब में, हाल ही में प्रशिक्षण डेटा फ़िल्टरिंग से लेकर विशेष post-processing एल्गोरिदम और LLM को उचित उत्तर देने के लिए fine-tuning तक, bias कम करने की रणनीतियाँ सक्रिय रूप से विकसित की जा रही हैं[3]।
सारांश में, BBQ (Bias Benchmark for QA) ने भाषा मॉडलों में सामाजिक पूर्वाग्रहों को मापने के लिए एक मूल्यवान और विश्वसनीय उपकरण के रूप में अपनी पहचान बनाई है। यह शोध समुदाय को जाँचों का एक मानक सेट प्रदान करता है, जो मॉडलों की रूढ़िवादिता के संदर्भ में तुलना करने और उनकी निष्पक्षता में सुधार की प्रगति को ट्रैक करने की अनुमति देता है[3]। BBQ का विस्तार और अनुकूलन जारी है, जो अधिक निष्पक्ष और सुरक्षित AI प्रणालियों के निर्माण[3] में वैश्विक रुचि को दर्शाता है, जो अदृश्य लेकिन महत्वपूर्ण हानिकारक bias से मुक्त हों।
संदर्भ
- BBQ का मूल लेख (arXiv)
- GitHub पर BBQ रिपॉजिटरी
- Papers With Code पर BBQ dataset का पृष्ठ
- ACL Anthology पर BBQ लेख
- KoBBQ dataset पर लेख (arXiv)
- Open-BBQ dataset पर लेख (arXiv)
साहित्य
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
टिप्पणियाँ
[1] [2] [3] [4] [5] </references>
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 1.24 1.25 1.26 1.27 1.28 1.29 1.30 1.31 1.32 1.33 1.34 1.35 1.36 1.37 1.38 1.39 1.40 1.41 1.42 1.43 1.44 1.45 1.46 1.47 1.48 1.49 1.50 1.51 1.52 1.53 1.54 1.55 1.56 1.57 1.58 1.59 1.60 1.61 1.62 1.63 1.64 1.65 1.66 1.67 1.68 1.69 1.70 1.71 1.72 1.73 1.74 1.75 1.76 1.77 1.78 1.79 1.80 1.81 Parrish A. et al. «BBQ: A Hand-Built Bias Benchmark for Question Answering». arXiv. [१]
- ↑ 2.0 2.1 Parrish A. et al. «BBQ: A hand-built bias benchmark for question answering». ACL Anthology. [२]
- ↑ 3.00 3.01 3.02 3.03 3.04 3.05 3.06 3.07 3.08 3.09 3.10 3.11 3.12 3.13 3.14 3.15 3.16 Liu Z. et al. (2024). «Evaluating and Mitigating Social Bias for Large Language Models in Open-ended Settings». arXiv preprint. [३]
- ↑ 4.0 4.1 4.2 4.3 4.4 4.5 4.6 «BBQ Dataset». Papers With Code. [४]
- ↑ 5.0 5.1 5.2 5.3 5.4 5.5 5.6 5.7 Jin J. et al. (2024). «KoBBQ: Korean Bias Benchmark for Question Answering». arXiv preprint. [५]