---
title: "BBQ (Bias Benchmark for Question Answering) (HI)"
source: "https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)"
wiki: "systems-analysis.info/int"
article: "BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)"
language: "hi"
categories:
  - "Category:Hindi"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 522
wiki_created_at: 2026-09-06T22:34:59Z
wiki_modified_at: 2026-09-06T22:34:59Z
downloaded_at: 2026-09-07T22:40:42Z
---

# BBQ (Bias Benchmark for Question Answering) (HI)

**BBQ** (Bias Benchmark for Question Answering) — यह **प्रश्न-उत्तर प्रणालियों** (QA) में **सामाजिक पूर्वाग्रहों** (bias) के मूल्यांकन के लिए एक **dataset** है<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>। इसे न्यूयॉर्क विश्वविद्यालय के शोधकर्ताओं के एक समूह ने Alicia Parrish के नेतृत्व में विकसित किया था और 2022 में ACL Findings सम्मेलन में प्रकाशित किया गया था<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)[\[2\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-acl-anthology-2)</sup>। BBQ का उद्देश्य यह पता लगाना है कि बड़े भाषा मॉडल (Large Language Models) और अन्य QA-मॉडल प्रश्नों के उत्तर देते समय, विशेष रूप से प्राकृतिक भाषा में प्रश्न-उत्तर के व्यावहारिक कार्यों में, किस प्रकार रूढ़िवादिता और पूर्वाग्रह प्रकट करते हैं<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>। BBQ, NLP में सामाजिक bias के मूल्यांकन के लिए सबसे व्यापक benchmark में से एक बन गया है, जो नौ सामाजिक श्रेणियों के अंतर्गत रूढ़िवादिताओं के एक विस्तृत स्पेक्ट्रम को कवर करता है<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-evaluating-mitigating-3)</sup>।

यह dataset पूर्ववर्ती कार्यों का पूरक है, जैसे कि UnQover dataset (2020), जो सीमित संख्या में विशेषताओं (लिंग-पेशा, राष्ट्रीयता, जातीयता, धर्म) के आधार पर पूर्वाग्रह को मापता था और मॉडल के उत्तरों की बजाय उनकी संभाव्यताओं पर निर्भर करता था<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-evaluating-mitigating-3)</sup>। UnQover के विपरीत, BBQ मॉडल के उत्तरों की सामग्री और प्रस्तावित विकल्पों में से उनके चयन का सीधे विश्लेषण करता है, जिससे परिणाम के स्तर पर ही पूर्वाग्रह का आकलन करना संभव होता है<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>।

BBQ के लेखक इसे मॉडलों में **हानिकारक सामाजिक रूढ़िवादिताओं** के निदान और कमजोर सामाजिक समूहों पर ऐसी रूढ़िवादिताओं के नकारात्मक प्रभाव के जोखिम को कम करने के उपकरण के रूप में प्रस्तुत करते हैं<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>। यह dataset अमेरिकी अंग्रेजी भाषी संस्कृति के लिए प्रासंगिक रूढ़िवादिताओं पर केंद्रित है और सभी संभावित सांस्कृतिक संदर्भों को कवर नहीं करता<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>। फिर भी, BBQ ने NLP में सामाजिक bias को मापने और कम करने पर बाद के शोध कार्यों की नींव रखी और मॉडलों की नैतिक शुद्धता के तुलनात्मक मूल्यांकन में एक मानक बन गया।

## Dataset की संरचना और विन्यास

BBQ में लगभग **58,500 प्रश्न और उत्तर** हैं, जो विशिष्ट रूढ़िवादिताओं की पहचान के लिए लक्षित विशेष समूहों में संगठित हैं<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-paperswithcode-bbq-4)</sup>। सभी उदाहरण विभिन्न सामाजिक समूहों के प्रतिनिधियों को नुकसान पहुँचाने वाले पूर्वाग्रहों और रूढ़िवादिताओं के प्रलेखित मामलों के आधार पर लेखकों द्वारा **हाथ से** तैयार किए गए थे<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-paperswithcode-bbq-4)</sup>। परिदृश्य बनाते समय वैज्ञानिक शोध के आंकड़ों, मीडिया लेखों, रिपोर्टों और अन्य विश्वसनीय स्रोतों का उपयोग किया गया, जो किसी विशेष रूढ़िवादिता के अस्तित्व और उसके हानिकारक परिणामों की पुष्टि करते हैं<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>। प्रत्येक स्थिति के लिए लेखकों ने उस स्रोत का संदर्भ दिया है जहाँ इस रूढ़िवादिता को नकारात्मक या हानिकारक के रूप में वर्णित किया गया है (उदाहरण के लिए, कोई वैज्ञानिक लेख या समाचार नोट)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>।

### सामाजिक श्रेणियाँ

BBQ **नौ मुख्य सामाजिक रूप से महत्वपूर्ण श्रेणियों** को कवर करता है (जिनमें से अधिकांश अमेरिकी समान रोजगार अवसर आयोग की परिभाषा में संरक्षित समूहों के अनुरूप हैं)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>:

- **आयु** – आयु समूहों के प्रति पूर्वाग्रह (उदाहरण के लिए, वृद्ध लोगों में संज्ञानात्मक क्षमताओं में गिरावट की रूढ़िवादिता)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>।
- **विकलांगता** – विकलांग लोगों की मानसिक क्षमताओं या अन्य गुणों के बारे में रूढ़िवादिताएँ (उदाहरण के लिए, यह धारणा कि शारीरिक रूप से सीमित व्यक्ति बौद्धिक रूप से कम सक्षम हैं)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>।
- **लैंगिक पहचान** – लैंगिक रूढ़िवादिताएँ (उदाहरण के लिए, यह विचार कि «लड़कियाँ गणित में कमजोर होती हैं»)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>।
- **राष्ट्रीयता** – राष्ट्रीय-जातीय पूर्वाग्रह (उदाहरण के लिए, अफ्रीकी मूल के लोगों की तकनीकी अनपढ़ता की रूढ़िवादिता)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>।
- **शारीरिक बनावट** – शारीरिक रूप-रंग या बनावट के आधार पर भेदभाव (उदाहरण के लिए, यह राय कि मोटे लोग कम बुद्धिमान या मेहनती होते हैं)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>।
- **नस्ल/जातीयता** – नस्लीय रूढ़िवादिताएँ (उदाहरण के लिए, किसी विशेष नस्ल को अपराध या नशे से जोड़ने का पूर्वाग्रह)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>।
- **धर्म** – धार्मिक रूढ़िवादिताएँ (उदाहरण के लिए, यहूदियों को लालची, मुसलमानों को हिंसा-प्रवण मानने जैसी धारणाएँ आदि)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>।
- **सामाजिक-आर्थिक स्थिति** – गरीब या अमीर तबकों के प्रति पूर्वाग्रह (उदाहरण के लिए, यह विश्वास कि गरीब परिवारों से आने वाले लोग बुरे माता-पिता होंगे)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>।
- **यौन अभिविन्यास** – समलैंगिकता-विरोधी रूढ़िवादिताएँ (उदाहरण के लिए, समलैंगिकता का HIV संक्रमण से झूठा जुड़ाव)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>।

इन नौ श्रेणियों के अलावा, BBQ में दो **अंतरखंडीय श्रेणियाँ** (intersectional biases) भी हैं, जो एक साथ दो विशेषताओं को जोड़ती हैं: (1) लिंग के साथ नस्ल/जातीयता का संयोजन और (2) सामाजिक-आर्थिक स्थिति के साथ नस्ल का संयोजन<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>। ऐसे मामले विभिन्न समूहों के चौराहे पर रूढ़िवादिताओं को ध्यान में रखते हैं (उदाहरण के लिए, विशेष रूप से अश्वेत महिलाओं के विरुद्ध या निम्न सामाजिक वर्ग के कुछ जातीय समूहों के विरुद्ध पूर्वाग्रह)।

### टेम्पलेट और उदाहरणों का निर्माण

प्रत्येक श्रेणी के लिए टीम ने **परिदृश्य टेम्पलेट** लिखे — छोटे-छोटे चित्रण, जिनमें दो पात्र होते हैं, जो लक्षित विशेषता के आधार पर भिन्न होते हैं (उदाहरण के लिए, युवा और वृद्ध, पुरुष और महिला, अमीर और गरीब आदि)<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-paperswithcode-bbq-4)</sup>। टेम्पलेट में एक ऐसी स्थिति होती है जो किसी ज्ञात रूढ़िवादिता की पुष्टि या खंडन कर सकती है। प्रत्येक परिदृश्य से प्रश्न और उत्तर विकल्प जुड़े होते हैं।

कुल मिलाकर नौ मुख्य श्रेणियों में से प्रत्येक के लिए 25 अद्वितीय टेम्पलेट विकसित किए गए, साथ ही नस्ल और लिंग श्रेणियों के लिए वास्तविक नामों का उपयोग करते हुए 25 अतिरिक्त टेम्पलेट (उचित नामों के स्तर पर bias की जाँच के लिए)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>। दो अंतरखंडीय दिशाओं के लिए भी 25-25 टेम्पलेट बनाए गए<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>। इस प्रकार, आधार परिदृश्यों की कुल संख्या 300 से अधिक है।

प्रत्येक टेम्पलेट में **चर के लिए विशेष स्लॉट** होते हैं — समूहों के नाम या विवरण — जो पाठ में प्रतिस्थापित किए जाते हैं (उदाहरण के लिए, आयु टेम्पलेट में «\_वर्षीय व्यक्ति» की जगह अलग-अलग संख्याएँ भरी जाती हैं, या शारीरिक बनावट में «मोटा»/«पतला» जैसे विशेषण)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>। विभिन्न मूल्यों की प्रतिस्थापना और दो पात्रों के उल्लेख के क्रम में फेरबदल के कारण, प्रत्येक टेम्पलेट अनेक विशिष्ट उदाहरणों तक विस्तारित होता है (न्यूनतम 8 से लेकर ~200 भिन्नताओं तक)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>। सामान्यतः एक टेम्पलेट से कम से कम 100 अंतिम प्रश्न उत्पन्न होते हैं, और कुछ मामलों में — दो सौ तक<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>। कुल मिलाकर 58,492 उदाहरणों (परिदृश्य, प्रश्न और उत्तर के अद्वितीय संयोजन) का एक संग्रह बना<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-paperswithcode-bbq-4)</sup>।

### संदर्भ और प्रश्नों के प्रकार

BBQ की मुख्य विशेषता यह है कि प्रत्येक स्थिति को दो प्रकार के संदर्भ और दो प्रश्न-शैलियों में प्रस्तुत किया जाता है, जो **चार प्रश्नों** का एक समूह बनाते हैं (जिसे 4 का क्लस्टर कहा जाता है)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>। यह जानकारी की कमी के प्रभाव को मॉडल की अपनी रूढ़िवादिताओं से अलग करने के लिए किया गया है। प्रत्येक चतुष्टय में<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>:

- **अस्पष्ट संदर्भ** (under-informative or ambiguous context): ऐसा पाठ जिसमें दो अलग-अलग समूहों के दो व्यक्तियों की भागीदारी वाली स्थिति का वर्णन है, लेकिन पूछे गए प्रश्न का स्पष्ट उत्तर देने के लिए पर्याप्त जानकारी नहीं है<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>। ऐसे मामलों में सही उत्तर हमेशा «अज्ञात» विकल्प होता है (अर्थात पर्याप्त डेटा का अभाव)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>। ये उदाहरण यह जाँचने के लिए आवश्यक हैं कि मॉडल रूढ़िवादिता के आधार पर निष्कर्ष तो नहीं निकाल रहा।
- **स्पष्ट संदर्भ** (disambiguated context): एक विस्तारित परिदृश्य, जिसमें एक स्पष्ट करने वाला विवरण जोड़ा गया है, जिससे यह निर्धारित किया जा सके कि दो उल्लिखित व्यक्तियों में से कौन प्रश्न के अनुरूप है<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>। इस मामले में दो पात्रों में से एक निश्चित रूप से सही उत्तर है (और «अज्ञात» विकल्प अब गलत है)। स्पष्ट संदर्भ यह जाँचने के लिए है कि क्या मॉडल अपने संभावित bias को पार कर सही उत्तर चुन सकता है, भले ही रूढ़िवादिता इसके विपरीत संकेत दे<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>।
- **नकारात्मक प्रश्न** (e.g., «इनमें से कौन विषय को कम जानता है?», «किसने अपराध किया?»)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>। ऐसा प्रश्न अस्पष्ट संदर्भ के साथ मिलकर यह जाँचता है कि क्या मॉडल तथ्यों के अभाव में किसी नकारात्मक कृत्य को किसी विशेष समूह से जोड़ने की प्रवृत्ति रखता है<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>।
- **गैर-नकारात्मक (विपरीत) प्रश्न** (e.g., «इनमें से कौन विषय को अच्छी तरह जानता है?» या «कौन बुरे कार्य से परहेज करता है?»)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>। गैर-नकारात्मक प्रश्न इस प्रकार तैयार किया गया है कि वह सीधे रूढ़िवादिता का समर्थन न करे, लेकिन साथ ही मॉडल के उत्तरों के संतुलन की जाँच करने की अनुमति दे<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>। नकारात्मक और तटस्थ संस्करणों के उत्तरों की तुलना से व्यवस्थित विचलन सामने आते हैं।

क्लस्टर में इन चारों उदाहरणों में से प्रत्येक के लिए **तीन उत्तर विकल्प** होते हैं: दो विशिष्ट (दोनों समूहों में से प्रत्येक का नाम लेते हुए) और एक विकल्प जो पर्याप्त जानकारी के अभाव को इंगित करता है («Unknown» और समकक्ष वाक्यांशों के रूप में चिह्नित)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>। उदाहरण के लिए, एक ऐसे दृश्य में जहाँ एक काल्पनिक ईसाई और मुसलमान शामिल हैं, उत्तर विकल्प होंगे: «ईसाई», «मुसलमान» या «अज्ञात»<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>। साथ ही, «अज्ञात» शब्द हमेशा एक जैसा नहीं होता — 10 समानार्थी अभिव्यक्तियों का उपयोग किया जाता है<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>।

इसके अलावा, प्रत्येक टेम्पलेट में **दो समूहों के उल्लेख का क्रम** स्वचालित रूप से बदलता है<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>। यह **क्रम-प्रभाव** को निष्प्रभावी करने के लिए किया गया है — एक ज्ञात कारक, जिसमें मॉडल सामग्री की परवाह किए बिना पहले नामित इकाई को अधिक बार चुन सकते हैं<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>।

### एनोटेशन और गुणवत्ता जाँच

BBQ के प्रत्येक उदाहरण का मूल्यांकन crowd-sourcing एनोटेटर्स द्वारा किया गया था: कम से कम 5 स्वतंत्र लोगों ने प्रश्नों का उत्तर दिया, और अंतिम dataset में केवल वे उदाहरण शामिल किए गए जिन पर **5 में से कम से कम 4 एनोटेटर सही उत्तर पर सहमत हुए** (मतदान द्वारा)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>। यदि कोई प्रश्न इस सीमा को पार नहीं करता था, तो पूरे टेम्पलेट की समीक्षा की जाती और उसे संपादित किया जाता था<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>। इस प्रक्रिया की बदौलत, BBQ पर मानवीय सटीकता काफी अधिक है: व्यक्तिगत एनोटेटर ~95.7% प्रश्नों का सही उत्तर देते थे, और बहुमत के मतों को ध्यान में रखते हुए स्वर्ण मानक सटीकता 99.7% तक पहुँच जाती है<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>। सहमति का कप्पा-मानदंड (Krippendorff's alpha) 0.883 था, जो सही उत्तरों के बारे में लोगों के बीच **उच्च सहमति** को इंगित करता है<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>। ये उपाय पुष्टि करते हैं कि BBQ के कार्य लोगों को समझ में आते हैं और उनके वस्तुनिष्ठ सही उत्तर हैं; परिणामस्वरूप, इन उदाहरणों पर मॉडल की गलतियों को bias की अभिव्यक्ति के रूप में उचित रूप से व्याख्यायित किया जा सकता है, न कि स्वयं प्रश्नों की अस्पष्टता के रूप में।

## मॉडलों के पूर्वाग्रह का मूल्यांकन

BBQ को सामाजिक bias को उकसाने वाली परिस्थितियों में मॉडल के व्यवहार के बहु-आयामी मूल्यांकन के लिए विकसित किया गया है। QA-मॉडल के परीक्षण में मॉडल को संदर्भ और प्रश्न इनपुट के रूप में दिए जाते हैं, जिसके बाद उसे तीन उत्तर विकल्पों में से एक चुनना होता है। परिणामों का विश्लेषण दो स्तरों पर किया जाता है<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>:

### अस्पष्ट संदर्भ का मामला

यह मापा जाता है कि मॉडल कितनी बार आवश्यक जानकारी के अभाव में प्रश्नों का गलत उत्तर देता है, अर्थात **रूढ़िवादिता पर निर्भर करता है**<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>। आदर्श रूप से, मॉडल को अपर्याप्त संदर्भ वाले किसी भी प्रश्न का उत्तर «अज्ञात» देना चाहिए, लेकिन यदि उसने किसी एक समूह को चुना, तो इसे अंतर्निहित रूढ़िवादिता के प्रक्षेपण के रूप में देखा जाता है<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>। ऐसी गलतियों की आवृत्ति और श्रेणियों में उनका वितरण मॉडल की हानिकारक रूढ़िवादिताओं को पुन: उत्पन्न करने की प्रवृत्ति का अंदाजा देता है।

### सूचनाप्रद संदर्भ का मामला

यह आकलन किया जाता है कि मॉडल कितनी सटीकता से उत्तर देता है जब संदर्भ में स्पष्ट सही उत्तर मौजूद हो<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>। यहाँ आमतौर पर मानक मेट्रिक **accuracy** (सही उत्तरों का प्रतिशत) की गणना की जाती है — यह दर्शाती है कि मॉडल प्रश्न-उत्तर कार्य को सामान्यतः हल कर पाता है या नहीं। हालाँकि, विशेष ध्यान उन मामलों पर दिया जाता है जहाँ सही उत्तर रूढ़िवादिता के विरुद्ध जाता है<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>। BBQ के डेवलपर विश्लेषण करते हैं कि यदि सही उत्तर किसी गहरी जड़ें जमाई रूढ़िवादिता का खंडन करता है तो क्या मॉडल की सटीकता गिर जाती है (और इसके विपरीत, क्या सटीकता तब अधिक होती है जब सत्य रूढ़िवादी अपेक्षा से मेल खाता है)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>। ऐसा प्रभाव इंगित करेगा कि तथ्यों की उपस्थिति में भी मॉडल bias के कारण गलतियाँ कर सकता है।

### Bias Score

पूर्वाग्रह की मात्रा को मापने के लिए एक विशेष मेट्रिक — **पूर्वाग्रह संकेतक** (bias score) — प्रस्तुत की जाती है<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>। सामान्य रूप में, bias score उन मॉडल उत्तरों का प्रतिशत दर्शाता है (शर्त के अनुसार गलत या सभी उत्तरों में से) जो रूढ़िवादिता के अनुरूप हैं<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>।

- **+100%** का मान इंगित करेगा कि मॉडल ने सभी मामलों में वह उत्तर विकल्प चुना जो रूढ़िवादी रूप से लक्षित समूह को नकारात्मक गुण देता है।
- **0%** — bias का कोई प्रकटन नहीं (मॉडल या तो हमेशा सही/«अज्ञात» उत्तर देता है, या दोनों दिशाओं में बराबर गलतियाँ करता है)।
- **नकारात्मक score** (-100% तक) — विपरीत प्रवृत्ति, जब मॉडल हमेशा रूढ़िवादिता की अपेक्षा के विरुद्ध उत्तर देता है<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>।

संकेतकों की गणना अस्पष्ट और स्पष्ट संदर्भों के लिए अलग-अलग की जाती है, क्योंकि उनमें गलतियों की प्रकृति भिन्न होती है<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>।

- **अस्पष्ट प्रश्नों** के लिए bias score उन मामलों के अनुपात से निर्धारित होता है, जब मॉडल ने «अज्ञात» की बजाय कोई विशिष्ट उत्तर चुना, और वह उत्तर नकारात्मक रूढ़िवादिता से मेल खाया<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>। ऐसे उत्तर जितने अधिक होंगे, धनात्मक score उतना ही अधिक होगा। इसमें सटीकता को भी ध्यान में रखा जाता है: यदि मॉडल बराबर-बराबर गलतियाँ करता है और सही उत्तर («अज्ञात») देता है, तो रूढ़िवादी गलतियों के एक हिस्से के बावजूद score उस मॉडल की तुलना में कम होगा जो हमेशा रूढ़िवादी उत्तर चुनता है<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>। इस प्रकार, **bias-उत्तरों की आवृत्ति और निश्चितता दोनों को दंडित किया जाता है** (अस्पष्ट संदर्भों के लिए मेट्रिक को «अज्ञात» सही उत्तरों के प्रतिशत को ध्यान में रखते हुए स्केल किया जाता है)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>।
- **स्पष्ट प्रश्नों** के लिए bias score की गणना थोड़ी अलग तरह से की जाती है, क्योंकि यहाँ सही उत्तर समूहों में से एक है<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>। इन मामलों में मॉडल की **गलत उत्तरों** पर ध्यान दिया जाता है: वे गलतियाँ जिनमें मॉडल ने सही विकल्प नहीं चुना, बल्कि रूढ़िवादिता के अनुरूप वैकल्पिक विकल्प चुना<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>। दूसरे शब्दों में, यदि मॉडल ने पूर्वाग्रह को प्राथमिकता देते हुए गलती की (उदाहरण के लिए, तथ्यों पर विश्वास नहीं किया और रूढ़िवादिता के अनुसार उत्तर दिया), तो यह score को बढ़ाता है<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>।

समग्र सटीकता के साथ bias score का विश्लेषण BBQ पर मॉडल के व्यवहार की विस्तृत विशेषता प्रदान करता है। लेखक बताते हैं कि समान accuracy गलतियों की अलग-अलग प्रकृति छुपा सकती है<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>। इस प्रकार, यह संकेतक **गलतियों की दिशा** दर्शाता है और ऐसे सूक्ष्म मामलों को उजागर करता है जो केवल सटीकता से नहीं दिखते।

## परिणाम और पहचाने गए पैटर्न

BBQ पर कई लोकप्रिय QA-मॉडलों के प्रारंभिक परीक्षण ने bias की कई स्पष्ट अभिव्यक्तियाँ प्रदर्शित कीं<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>। Parrish et al. (2022) के शोध में बड़े सार्वभौमिक मॉडल (उदाहरण के लिए, UnifiedQA — T5 पर आधारित QA के लिए एक सामान्यीकृत मॉडल) और मानक multiple-choice मॉडल (जैसे QA पर fine-tuning के साथ ROBERTA) दोनों का परीक्षण किया गया<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>।

प्रयोगों के परिणामों पर मुख्य निष्कर्ष:

- **जानकारी की कमी में प्रबल रूढ़िवादी गलतियाँ**। सभी परीक्षित प्रणालियों में, जब संदर्भ आवश्यक संकेत नहीं देता था, तो रूढ़िवादिता के अनुरूप उत्तर देने की प्रवृत्ति देखी गई<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>। दूसरे शब्दों में, मॉडल अक्सर «अज्ञात» विकल्प नहीं चुनते थे, बल्कि किसी विशेष रूढ़िवादी अपेक्षा से जुड़े विशिष्ट उत्तर को प्राथमिकता देते थे<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>। उदाहरण के लिए, किसी स्पष्ट अपराधी के बिना अपराध के बारे में अस्पष्ट प्रश्नों में, मॉडल अक्सर किसी विशेष समूह के व्यक्तियों की ओर इशारा करते थे (पूर्वाग्रह के अनुरूप)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>। ambiguous-संदर्भों के लिए गणना किया गया bias score शून्य से काफी अधिक था, और कुछ मॉडलों में कुछ श्रेणियों में +100% के करीब पहुँच गया<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>। **शारीरिक बनावट** (मोटापा आदि) से संबंधित दृश्यों में मॉडलों ने विशेष रूप से उच्च रूढ़िवादी प्रवृत्ति दिखाई — इस श्रेणी ने उदाहरण के लिए नस्ल या यौन अभिविन्यास की तुलना में उल्लेखनीय रूप से अधिक bias दिया<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>। यह मॉडल के भीतर bias की विषमता को दर्शाता है — कुछ प्रकार की रूढ़िवादिताएँ उसके द्वारा अन्य की तुलना में अधिक «आत्मसात» की गई हैं।
- **तथ्यों की उपस्थिति में सुधार, लेकिन छिपे bias का बने रहना**। जब मॉडलों को स्पष्ट सही उत्तर के संकेत के साथ स्पष्ट संदर्भ मिला, तो उनकी **सटीकता उल्लेखनीय रूप से बढ़ गई** (अनिश्चितता की स्थिति की तुलना में)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>। हालाँकि, विस्तृत विश्लेषण ने एक सूक्ष्म प्रभाव उजागर किया: सटीकता **रूढ़िवादिता के प्रति सही उत्तर के संबंध के आधार पर असमान निकली**<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>। औसतन, मॉडलों ने उन उदाहरणों में 3-3.5 प्रतिशत अंक अधिक सटीकता हासिल की जहाँ सही उत्तर प्रचलित रूढ़िवादिता से मेल खाता था, उन उदाहरणों की तुलना में जहाँ सही उत्तर उस रूढ़िवादिता का खंडन करता था<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>। दूसरे शब्दों में, जब तथ्य पूर्वाग्रह की पुष्टि करते थे, मॉडल लगभग बिना किसी गलती के उत्तर देते थे; लेकिन यदि रूढ़िवादिता के लिए «असामान्य» विकल्प को नाम देना आवश्यक था, तो गलती की संभावना बढ़ जाती थी। प्रदर्शन में यह अंतर, हालांकि बहुत बड़ा नहीं, सांख्यिकीय रूप से कई श्रेणियों में प्रकट हुआ<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>। लैंगिक रूढ़िवादिताओं से जुड़े प्रश्नों के लिए सबसे बड़ा अंतर दर्ज किया गया: 5 प्रतिशत अंक तक<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>। इस प्रकार, **bias का छिपा हुआ प्रभाव** स्पष्ट है: मॉडल औसतन «रूढ़िवादिता के विरुद्ध» थोड़ा कमतर प्रदर्शन करते हैं।
- **श्रेणियों और टेम्पलेटों की तुलना**। BBQ के शोधकर्ताओं ने सभी नौ श्रेणियों में bias score का विश्लेषण किया और पाया कि अस्पष्ट संदर्भों में संकेतक सभी श्रेणियों में धनात्मक है, लेकिन इसका परिमाण भिन्न होता है<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>। जैसा कि उल्लेख किया गया, अधिकतम bias शारीरिक बनावट, सामाजिक-आर्थिक स्थिति और कुछ अंतरखंडीय श्रेणियों में देखा गया<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>। नस्ल/जातीयता और यौन अभिविन्यास श्रेणियों में bias score अपेक्षाकृत «कम», हालाँकि फिर भी शून्य से अधिक थे<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>। स्पष्ट संदर्भों में bias score सामान्यतः शून्य के करीब है (क्योंकि मॉडल अक्सर सही उत्तर देता है), लेकिन कुछ टेम्पलेटों के लिए यह फिर भी धनात्मक रहता है, जो की गई गलतियों की प्रकृति में ध्यान देने योग्य विचलन को दर्शाता है<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>। उदाहरण के लिए, धर्म श्रेणी में अधिकांश गलतियाँ एक ही दिशा में थीं — मॉडल, गलती करते समय, आमतौर पर पूर्वाग्रह के आधार पर उत्तर चुनते थे<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>।

समग्र रूप से BBQ ने प्रदर्शित किया कि यहाँ तक कि शक्तिशाली आधुनिक भाषा मॉडल भी **स्पष्ट रूप से सामाजिक पूर्वाग्रहों से मुक्त नहीं हैं**<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>। वे रूढ़िवादिताओं को पुन: उत्पन्न करने की प्रवृत्ति रखते हैं, यदि उन्हें अनिश्चितता की स्थिति में रखा जाए, और तथ्यों की उपस्थिति में भी सूक्ष्म bias प्रदर्शित कर सकते हैं, जिनके लिए विपरीत उत्तर की आवश्यकता होती है<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>। साथ ही, इन प्रभावों का परिमाण विभिन्न समूहों के लिए समान नहीं है: कुछ रूढ़िवादिताएँ मॉडल द्वारा अधिक «आत्मसात» की गई हैं<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>। BBQ के लेखक जोर देते हैं कि खोजे गए अंतर, हालांकि ध्यान देने योग्य हैं, लेकिन विनाशकारी रूप से बड़े नहीं हैं — अधिकांश मॉडलों के bias score चरम मूल्यों तक नहीं पहुँचते, और अक्सर कुछ दर्जन प्रतिशत के क्षेत्र में होते हैं<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup>। फिर भी, LLM के बड़े पैमाने पर उपयोग में रूढ़िवादिताओं की दिशा में छोटे व्यवस्थित विचलन भी संभावित रूप से खतरनाक हैं, इसलिए ऐसे bias की पहचान और उन्मूलन एक महत्वपूर्ण कार्य है<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-evaluating-mitigating-3)</sup>। BBQ ने शोधकर्ताओं को इस क्षेत्र में प्रगति को ट्रैक करने का एक स्पष्ट और मात्रात्मक रूप से मापने योग्य तरीका प्रदान किया<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-evaluating-mitigating-3)</sup>।

## प्रभाव और आगे का शोध

BBQ dataset को जल्द ही भाषा मॉडलों की fairness विशेषताओं के मूल्यांकन के लिए एक मानक उपकरण के रूप में मान्यता मिली<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-paperswithcode-bbq-4)</sup>। इसका **खुला स्रोत कोड और डेटा** रिपॉजिटरी में उपलब्ध है (CC BY 4.0 लाइसेंस)<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-paperswithcode-bbq-4)</sup>, जिसने व्यापक शोध समुदाय को नए मॉडलों के विकास और परीक्षण में BBQ का उपयोग करने की अनुमति दी। कई समीक्षाओं में BBQ का उल्लेख NLP में सामाजिक bias के अध्ययन में एक महत्वपूर्ण मील के पत्थर के रूप में अन्य benchmark के साथ (जैसे StereoSet, WinoBias, ToxiGen) किया गया है<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-evaluating-mitigating-3)</sup>। BBQ के प्रकाशन के बाद से ऐसे कार्य सामने आए हैं जो इसके विचारों को विकसित करते हैं और नई परिस्थितियों के अनुकूल बनाते हैं:

- **प्रश्न प्रारूपों का विस्तार (Open-BBQ)**। मूल BBQ multiple choice प्रारूप में कार्य प्रस्तुत करता है<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-evaluating-mitigating-3)</sup>। 2024 में **खुले उत्तरों** के लिए BBQ का एक संशोधन प्रस्तावित किया गया, जिसमें रिक्त स्थान भरने और छोटे उत्तर पाठ के कार्य शामिल हैं<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-evaluating-mitigating-3)</sup>। Open-BBQ नाम से जानी जाने वाली यह संस्करण संवाद की अधिक स्वतंत्र परिस्थितियों में bias का मूल्यांकन करने की अनुमति देती है, जहाँ मॉडल के पास निश्चित उत्तर विकल्प नहीं होते<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-evaluating-mitigating-3)</sup>। शोध ने दिखाया कि LLM स्वतंत्र पाठ उत्पन्न करते समय भी कई समूहों के विरुद्ध बढ़ा हुआ bias प्रदर्शित करते हैं<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-evaluating-mitigating-3)</sup>। Open-BBQ के लेखकों ने पूर्वाग्रह को कम करने के तरीकों के साथ प्रयोग भी किए, zero-shot और few-shot संकेतों तथा chain-of-thought (चरण-दर-चरण तर्क) को मिलाते हुए<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-evaluating-mitigating-3)</sup>। इन तरीकों ने उत्तरों में bias के स्तर को उल्लेखनीय रूप से कम करने की अनुमति दी<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-evaluating-mitigating-3)</sup>। Open-BBQ ने मूल dataset को पूरक बनाया, जिससे उपयोगकर्ता अनुरोधों के करीब के प्रारूपों में generative मॉडलों का परीक्षण संभव हो सका।

<!-- -->

- **सांस्कृतिक अनुकूलन (स्थानीयकरण)**। चूँकि BBQ अमेरिकी सामाजिक वास्तविकताओं से जुड़ा है, शोधकर्ताओं ने इसे अन्य भाषाओं और संस्कृतियों के अनुकूल बनाने में रुचि ली<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-kobbg-5)</sup>। 2023 में कोरियाई वैज्ञानिकों द्वारा **KoBBQ** (Korean BBQ) dataset प्रस्तुत किया गया — Bias Benchmark का कोरियाई संस्करण<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-kobbg-5)</sup>। उन्होंने BBQ के स्थानीयकरण के लिए एक सामान्य दृष्टिकोण विकसित किया: मूल टेम्पलेटों को तीन श्रेणियों में विभाजित किया — जिन्हें केवल अनुवाद किया जा सकता है, जिनके लिए समूहों को स्थानीय समकक्षों से बदलने की आवश्यकता है, और जो कोरियाई संदर्भ में बिल्कुल लागू नहीं हैं<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-kobbg-5)</sup>। इसके अतिरिक्त, KoBBQ ने कोरियाई समाज के लिए विशिष्ट रूढ़िवादिताओं की 4 नई श्रेणियाँ पेश कीं और कई अनुपयुक्त उदाहरण हटाए<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-kobbg-5)</sup>। परिणामस्वरूप कोरियाई भाषा में 268 टेम्पलेटों और 76,048 उदाहरणों का एक dataset बना, जिसमें 12 सामाजिक bias श्रेणियाँ शामिल हैं (मूल और नई दोनों)<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-kobbg-5)</sup>। KoBBQ पर बहुभाषी मॉडलों के परीक्षण ने मूल BBQ के कोरियाई में सीधे मशीन अनुवाद की तुलना में पूर्वाग्रह के स्तर में महत्वपूर्ण अंतर प्रकट किया<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-kobbg-5)</sup>। यह रेखांकित करता है कि **सीधा अनुवाद पर्याप्त नहीं है** — सांस्कृतिक रूप से विशिष्ट benchmark आवश्यक हैं, जो प्रत्येक देश की अनूठी रूढ़िवादिताओं और संदर्भ को ध्यान में रखते हों<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-kobbg-5)</sup>। KoBBQ पर कार्य ने BBQ की पद्धति को वैश्विक स्तर पर बढ़ाने की संभावना प्रदर्शित की।

BBQ **कृत्रिम बुद्धिमत्ता की नैतिकता** पर शोध का एक अभिन्न अंग बन गया है<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-evaluating-mitigating-3)</sup>। इसका प्रभाव मॉडलों को de-bias करने की नई विधियों, अधिक समावेशी dataset के निर्माण और bias के सूक्ष्म विश्लेषण के लिए मेट्रिक्स के उद्भव में देखा जाता है। शोधकर्ताओं ने नोट किया कि BBQ की एक मजबूत पक्ष उसकी व्यापक कवरेज और उदाहरणों के निर्माण की सावधानी है<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-evaluating-mitigating-3)</sup>। BBQ द्वारा उठाई गई चुनौतियों के जवाब में, हाल ही में प्रशिक्षण डेटा फ़िल्टरिंग से लेकर विशेष post-processing एल्गोरिदम और LLM को उचित उत्तर देने के लिए fine-tuning तक, **bias कम करने की रणनीतियाँ** सक्रिय रूप से विकसित की जा रही हैं<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-evaluating-mitigating-3)</sup>।

सारांश में, BBQ (Bias Benchmark for QA) ने भाषा मॉडलों में सामाजिक पूर्वाग्रहों को मापने के लिए एक मूल्यवान और विश्वसनीय उपकरण के रूप में अपनी पहचान बनाई है। यह शोध समुदाय को जाँचों का एक मानक सेट प्रदान करता है, जो मॉडलों की रूढ़िवादिता के संदर्भ में तुलना करने और उनकी निष्पक्षता में सुधार की प्रगति को ट्रैक करने की अनुमति देता है<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-evaluating-mitigating-3)</sup>। BBQ का विस्तार और अनुकूलन जारी है, जो **अधिक निष्पक्ष और सुरक्षित AI प्रणालियों** के निर्माण<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-evaluating-mitigating-3)</sup> में वैश्विक रुचि को दर्शाता है, जो अदृश्य लेकिन महत्वपूर्ण हानिकारक bias से मुक्त हों।

## संदर्भ

- BBQ का मूल लेख (arXiv)
- GitHub पर BBQ रिपॉजिटरी
- Papers With Code पर BBQ dataset का पृष्ठ
- ACL Anthology पर BBQ लेख
- KoBBQ dataset पर लेख (arXiv)
- Open-BBQ dataset पर लेख (arXiv)

## साहित्य

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## टिप्पणियाँ

<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-bbq-main-1)</sup> <sup>[\[2\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-acl-anthology-2)</sup> <sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-evaluating-mitigating-3)</sup> <sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-paperswithcode-bbq-4)</sup> <sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_note-arxiv-kobbg-5)</sup> \</references\>

1.  <span id="cite_note-arxiv-bbq-main-1">↑ <sup>[1.00](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-11)</sup> <sup>[1.12](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-12)</sup> <sup>[1.13](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-13)</sup> <sup>[1.14](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-14)</sup> <sup>[1.15](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-15)</sup> <sup>[1.16](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-16)</sup> <sup>[1.17](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-17)</sup> <sup>[1.18](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-18)</sup> <sup>[1.19](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-19)</sup> <sup>[1.20](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-20)</sup> <sup>[1.21](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-21)</sup> <sup>[1.22](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-22)</sup> <sup>[1.23](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-23)</sup> <sup>[1.24](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-24)</sup> <sup>[1.25](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-25)</sup> <sup>[1.26](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-26)</sup> <sup>[1.27](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-27)</sup> <sup>[1.28](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-28)</sup> <sup>[1.29](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-29)</sup> <sup>[1.30](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-30)</sup> <sup>[1.31](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-31)</sup> <sup>[1.32](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-32)</sup> <sup>[1.33](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-33)</sup> <sup>[1.34](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-34)</sup> <sup>[1.35](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-35)</sup> <sup>[1.36](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-36)</sup> <sup>[1.37](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-37)</sup> <sup>[1.38](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-38)</sup> <sup>[1.39](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-39)</sup> <sup>[1.40](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-40)</sup> <sup>[1.41](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-41)</sup> <sup>[1.42](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-42)</sup> <sup>[1.43](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-43)</sup> <sup>[1.44](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-44)</sup> <sup>[1.45](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-45)</sup> <sup>[1.46](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-46)</sup> <sup>[1.47](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-47)</sup> <sup>[1.48](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-48)</sup> <sup>[1.49](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-49)</sup> <sup>[1.50](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-50)</sup> <sup>[1.51](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-51)</sup> <sup>[1.52](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-52)</sup> <sup>[1.53](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-53)</sup> <sup>[1.54](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-54)</sup> <sup>[1.55](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-55)</sup> <sup>[1.56](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-56)</sup> <sup>[1.57](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-57)</sup> <sup>[1.58](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-58)</sup> <sup>[1.59](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-59)</sup> <sup>[1.60](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-60)</sup> <sup>[1.61](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-61)</sup> <sup>[1.62](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-62)</sup> <sup>[1.63](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-63)</sup> <sup>[1.64](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-64)</sup> <sup>[1.65](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-65)</sup> <sup>[1.66](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-66)</sup> <sup>[1.67](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-67)</sup> <sup>[1.68](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-68)</sup> <sup>[1.69](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-69)</sup> <sup>[1.70](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-70)</sup> <sup>[1.71](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-71)</sup> <sup>[1.72](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-72)</sup> <sup>[1.73](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-73)</sup> <sup>[1.74](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-74)</sup> <sup>[1.75](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-75)</sup> <sup>[1.76](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-76)</sup> <sup>[1.77](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-77)</sup> <sup>[1.78](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-78)</sup> <sup>[1.79](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-79)</sup> <sup>[1.80](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-80)</sup> <sup>[1.81](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-bbq-main_1-81)</sup> Parrish A. et al. «BBQ: A Hand-Built Bias Benchmark for Question Answering». *arXiv*. <a href="https://arxiv.org/abs/2110.08193" class="external autonumber" rel="nofollow">[१]</a></span>
2.  <span id="cite_note-acl-anthology-2">↑ <sup>[2.0](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-acl-anthology_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-acl-anthology_2-1)</sup> Parrish A. et al. «BBQ: A hand-built bias benchmark for question answering». *ACL Anthology*. <a href="https://aclanthology.org/2022.findings-acl.165/" class="external autonumber" rel="nofollow">[२]</a></span>
3.  <span id="cite_note-arxiv-evaluating-mitigating-3">↑ <sup>[3.00](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-evaluating-mitigating_3-0)</sup> <sup>[3.01](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-evaluating-mitigating_3-1)</sup> <sup>[3.02](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-evaluating-mitigating_3-2)</sup> <sup>[3.03](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-evaluating-mitigating_3-3)</sup> <sup>[3.04](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-evaluating-mitigating_3-4)</sup> <sup>[3.05](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-evaluating-mitigating_3-5)</sup> <sup>[3.06](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-evaluating-mitigating_3-6)</sup> <sup>[3.07](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-evaluating-mitigating_3-7)</sup> <sup>[3.08](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-evaluating-mitigating_3-8)</sup> <sup>[3.09](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-evaluating-mitigating_3-9)</sup> <sup>[3.10](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-evaluating-mitigating_3-10)</sup> <sup>[3.11](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-evaluating-mitigating_3-11)</sup> <sup>[3.12](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-evaluating-mitigating_3-12)</sup> <sup>[3.13](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-evaluating-mitigating_3-13)</sup> <sup>[3.14](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-evaluating-mitigating_3-14)</sup> <sup>[3.15](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-evaluating-mitigating_3-15)</sup> <sup>[3.16](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-evaluating-mitigating_3-16)</sup> Liu Z. et al. (2024). «Evaluating and Mitigating Social Bias for Large Language Models in Open-ended Settings». *arXiv preprint*. <a href="https://arxiv.org/html/2412.06134v1" class="external autonumber" rel="nofollow">[३]</a></span>
4.  <span id="cite_note-paperswithcode-bbq-4">↑ <sup>[4.0](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-paperswithcode-bbq_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-paperswithcode-bbq_4-1)</sup> <sup>[4.2](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-paperswithcode-bbq_4-2)</sup> <sup>[4.3](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-paperswithcode-bbq_4-3)</sup> <sup>[4.4](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-paperswithcode-bbq_4-4)</sup> <sup>[4.5](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-paperswithcode-bbq_4-5)</sup> <sup>[4.6](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-paperswithcode-bbq_4-6)</sup> «BBQ Dataset». *Papers With Code*. <a href="https://paperswithcode.com/dataset/bbq" class="external autonumber" rel="nofollow">[४]</a></span>
5.  <span id="cite_note-arxiv-kobbg-5">↑ <sup>[5.0](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-kobbg_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-kobbg_5-1)</sup> <sup>[5.2](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-kobbg_5-2)</sup> <sup>[5.3](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-kobbg_5-3)</sup> <sup>[5.4](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-kobbg_5-4)</sup> <sup>[5.5](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-kobbg_5-5)</sup> <sup>[5.6](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-kobbg_5-6)</sup> <sup>[5.7](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(HI)#cite_ref-arxiv-kobbg_5-7)</sup> Jin J. et al. (2024). «KoBBQ: Korean Bias Benchmark for Question Answering». *arXiv preprint*. <a href="https://arxiv.org/abs/2307.16778" class="external autonumber" rel="nofollow">[५]</a></span>
