BBQ (Bias Benchmark for Question Answering) (BN)
BBQ (Bias Benchmark for Question Answering) — এটি প্রশ্নোত্তর-ধরনের (QA) সিস্টেমে সামাজিক পক্ষপাত (bias) মূল্যায়নের জন্য একটি dataset[1]। এটি নিউ ইয়র্ক বিশ্ববিদ্যালয়ের গবেষকদের একটি দল অ্যালিশিয়া প্যারিশ (Alicia Parrish)-এর নেতৃত্বে তৈরি করেছেন এবং ২০২২ সালে ACL Findings সম্মেলনে প্রকাশিত হয়েছে[1][2]। BBQ-এর লক্ষ্য হলো বড় ভাষা মডেল (Large Language Model, LLM) এবং অন্যান্য QA-মডেলগুলো কীভাবে প্রশ্নের উত্তরে স্টেরিওটাইপ ও পক্ষপাত প্রকাশ করে তা চিহ্নিত করা, বিশেষত প্রাকৃতিক ভাষায় প্রশ্নোত্তরের ব্যবহারিক কাজে[1]। BBQ NLP-তে সামাজিক bias মূল্যায়নের অন্যতম সর্বাঙ্গীণ benchmark হিসেবে পরিচিতি লাভ করেছে, যা নয়টি সামাজিক বিভাগের আওতায় বিস্তৃত পরিসরের স্টেরিওটাইপ অন্তর্ভুক্ত করে[3]।
এই dataset-টি পূর্ববর্তী কাজগুলোর পরিপূরক, যেমন UnQover dataset (২০২০), যা সীমিত সংখ্যক বৈশিষ্ট্যে (লিঙ্গ-পেশা, জাতীয়তা, জাতিসত্তা, ধর্ম) পক্ষপাত পরিমাপ করত এবং উত্তরের পরিবর্তে মডেলের সম্ভাব্যতার উপর নির্ভর করত[3]। UnQover-এর বিপরীতে, BBQ সরাসরি মডেলের উত্তরের বিষয়বস্তু এবং প্রস্তাবিত বিকল্পগুলোর মধ্যে তার পছন্দ বিশ্লেষণ করে, যা ফলাফলের স্তরে পক্ষপাত মূল্যায়ন করতে সক্ষম করে[1]।
BBQ-এর লেখকরা এটিকে মডেলে ক্ষতিকর সামাজিক স্টেরিওটাইপ নির্ণয় এবং ঝুঁকিপূর্ণ জনগোষ্ঠীর উপর এই স্টেরিওটাইপগুলোর নেতিবাচক প্রভাবের ঝুঁকি কমানোর হাতিয়ার হিসেবে উপস্থাপন করেন[1]। এই dataset-টি মার্কিন যুক্তরাষ্ট্রের ইংরেজিভাষী সংস্কৃতির জন্য প্রাসঙ্গিক স্টেরিওটাইপগুলোর উপর দৃষ্টি নিবদ্ধ করে এবং সমস্ত সম্ভাব্য সাংস্কৃতিক প্রেক্ষাপট অন্তর্ভুক্ত করে না[1]। তবুও BBQ NLP-তে সামাজিক bias পরিমাপ ও প্রশমনের পরবর্তী গবেষণার ভিত্তি স্থাপন করেছে এবং মডেলগুলোর নৈতিক সঠিকতার তুলনামূলক মানদণ্ড হিসেবে পরিণত হয়েছে।
Dataset-এর গঠন ও কাঠামো
BBQ-তে প্রায় ৫৮,৫০০টি প্রশ্নোত্তর রয়েছে, যা নির্দিষ্ট স্টেরিওটাইপ শনাক্তকরণের লক্ষ্যে বিশেষ সেটে একত্রিত করা হয়েছে[4]। সমস্ত উদাহরণ লেখকরা হাতে তৈরি করেছেন, বিভিন্ন সামাজিক গোষ্ঠীর প্রতিনিধিদের ক্ষতি করে এমন পূর্বনির্ধারিত ক্ষতিকর পক্ষপাত ও স্টেরিওটাইপের নথিভুক্ত ঘটনার ভিত্তিতে[4]। পরিস্থিতি তৈরিতে বৈজ্ঞানিক গবেষণার তথ্য, সংবাদমাধ্যমের নিবন্ধ, প্রতিবেদন এবং অন্যান্য নির্ভরযোগ্য উৎস ব্যবহার করা হয়েছে, যা নির্দিষ্ট স্টেরিওটাইপের অস্তিত্ব ও এর ক্ষতিকর পরিণতি নিশ্চিত করে[1]। প্রতিটি পরিস্থিতির জন্য লেখকরা সেই উৎসের রেফারেন্স উল্লেখ করেন যেখানে এই স্টেরিওটাইপটিকে নেতিবাচক বা ক্ষতিকর হিসেবে বর্ণনা করা হয়েছে (যেমন কোনো বৈজ্ঞানিক নিবন্ধ বা সংবাদ প্রতিবেদন)[1]।
সামাজিক বিভাগসমূহ
BBQ নয়টি প্রধান সামাজিক বিভাগ অন্তর্ভুক্ত করে (যার অধিকাংশ মার্কিন সমান কর্মসংস্থান সুযোগ কমিশনের সংজ্ঞায় সুরক্ষিত গোষ্ঠীর অনুরূপ)[1]:
- বয়স – বয়স-গোষ্ঠীর প্রতি পক্ষপাত (যেমন, বয়স্ক মানুষের জ্ঞানীয় ক্ষমতা হ্রাস পায় এই স্টেরিওটাইপ)[1]।
- প্রতিবন্ধিতা – প্রতিবন্ধী ব্যক্তিদের মানসিক সক্ষমতা বা অন্যান্য গুণাবলী সম্পর্কে স্টেরিওটাইপ (যেমন, শারীরিকভাবে সীমাবদ্ধ ব্যক্তিরা বুদ্ধিগতভাবে কম দক্ষ এই ধারণা)[1]।
- লিঙ্গ পরিচয় – লিঙ্গ-সংক্রান্ত স্টেরিওটাইপ (যেমন, «মেয়েরা গণিতে দুর্বল» এই ধারণা)[1]।
- জাতীয়তা – জাতীয়-জাতিগত পক্ষপাত (যেমন, আফ্রিকা থেকে আসা মানুষেরা প্রযুক্তিগতভাবে অজ্ঞ এই স্টেরিওটাইপ)[1]।
- চেহারা – বাহ্যিক চেহারা ও শরীরের গড়নের ভিত্তিতে বৈষম্য (যেমন, স্থূল মানুষেরা কম বুদ্ধিমান বা কম পরিশ্রমী এই মত)[1]।
- বর্ণ/জাতিসত্তা – বর্ণগত স্টেরিওটাইপ (যেমন, নির্দিষ্ট বর্ণকে অপরাধ বা মাদকাসক্তির সাথে পক্ষপাতদুষ্টভাবে যুক্ত করা)[1]।
- ধর্ম – ধর্মীয় স্টেরিওটাইপ (যেমন, ইহুদিদের লোভী বা মুসলমানদের সহিংস হিসেবে চিত্রিত করার ধারণা ইত্যাদি)[1]।
- আর্থ-সামাজিক মর্যাদা – দরিদ্র বা ধনী শ্রেণীর প্রতি পক্ষপাত (যেমন, দরিদ্র পরিবার থেকে আসা ব্যক্তিরা খারাপ অভিভাবক হবে এই বিশ্বাস)[1]।
- যৌন অভিমুখীতা – সমকামভীতিমূলক স্টেরিওটাইপ (যেমন, সমকামিতাকে এইচআইভি সংক্রমণের সাথে মিথ্যাভাবে যুক্ত করা)[1]।
এই নয়টি বিভাগের পাশাপাশি BBQ-তে দুটি আন্তঃবিভাগীয় বিভাগ (intersectional biases) রয়েছে, যা একসাথে দুটি বৈশিষ্ট্য একত্রিত করে: (১) বর্ণ/জাতিসত্তার সাথে লিঙ্গ এবং (২) বর্ণের সাথে আর্থ-সামাজিক মর্যাদা[1]। এই ক্ষেত্রগুলো বিভিন্ন গোষ্ঠীর ছেদবিন্দুতে স্টেরিওটাইপ বিবেচনা করে (যেমন, কৃষ্ণাঙ্গ নারীদের বিরুদ্ধে বা নিম্ন সামাজিক শ্রেণীর নির্দিষ্ট জাতিগোষ্ঠীর বিরুদ্ধে পক্ষপাত)।
টেমপ্লেট ও উদাহরণ তৈরি
প্রতিটি বিভাগের জন্য দলটি পরিস্থিতির টেমপ্লেট তৈরি করেছে — সংক্ষিপ্ত দৃশ্যকল্প যেখানে দুজন চরিত্র থাকে, যারা লক্ষ্যমাত্রার বৈশিষ্ট্যে পৃথক (যেমন তরুণ ও বয়স্ক, পুরুষ ও নারী, ধনী ও দরিদ্র ইত্যাদি)[4]। টেমপ্লেটে এমন একটি পরিস্থিতি থাকে যা একটি পরিচিত স্টেরিওটাইপকে নিশ্চিত বা খণ্ডন করতে পারে। প্রতিটি পরিস্থিতির সাথে প্রশ্ন ও উত্তরের বিকল্প যুক্ত থাকে।
মোট নয়টি প্রধান বিভাগের প্রতিটির জন্য ২৫টি অনন্য টেমপ্লেট তৈরি করা হয়েছে, এছাড়া বর্ণ ও লিঙ্গের বিভাগে বাস্তব নাম ব্যবহার করে অতিরিক্ত ২৫টি টেমপ্লেট রয়েছে (নামের স্তরে bias পরীক্ষার জন্য)[1]। দুটি আন্তঃবিভাগীয় দিকের জন্যও ২৫টি করে টেমপ্লেট তৈরি করা হয়েছে[1]। ফলে মোট মৌলিক পরিস্থিতির সংখ্যা ৩০০-এর বেশি।
প্রতিটি টেমপ্লেটে বিশেষ পরিবর্তনশীল স্লট রয়েছে — গোষ্ঠীর নাম বা বিবরণের জন্য — যা পাঠ্যে প্রতিস্থাপিত হয় (যেমন বয়স-সংক্রান্ত টেমপ্লেটে «_বছর বয়সী ব্যক্তি»-র জায়গায় বিভিন্ন সংখ্যা বসানো হয়, বা চেহারার ক্ষেত্রে «মোটা»/«রোগা» বিশেষণ ইত্যাদি)[1]। বিভিন্ন মান প্রতিস্থাপন এবং দুই চরিত্রের উল্লেখের ক্রম পরিবর্তন করার মাধ্যমে, প্রতিটি টেমপ্লেট বহু নির্দিষ্ট উদাহরণে প্রসারিত হয় (ন্যূনতম ৮ থেকে প্রায় ~২০০টি বৈচিত্র্য পর্যন্ত)[1]। সাধারণত একটি টেমপ্লেট থেকে কমপক্ষে ১০০টি চূড়ান্ত প্রশ্ন তৈরি হয়, এবং কিছু ক্ষেত্রে দুইশো পর্যন্ত[1]। সর্বমিলিয়ে ৫৮,৪৯২টি উদাহরণের (পরিস্থিতি, প্রশ্ন ও উত্তরের অনন্য সমন্বয়) একটি সংকলন তৈরি হয়েছে[4]।
প্রসঙ্গ ও প্রশ্নের ধরন
BBQ-এর মূল বৈশিষ্ট্য হলো প্রতিটি পরিস্থিতি দুটি প্রসঙ্গ রূপান্তর এবং দুটি প্রশ্নের প্রণয়নে উপস্থাপিত হয়, যা চারটি প্রশ্নের একটি সেট তৈরি করে (তথাকথিত ৪-এর ক্লাস্টার)[1]। এটি তথ্যের অভাবের প্রভাব থেকে মডেলের নিজস্ব স্টেরিওটাইপকে আলাদা করার জন্য করা হয়েছে। প্রতিটি চতুষ্কে[1]:
- অস্পষ্ট প্রসঙ্গ (under-informative or ambiguous context): এমন পাঠ্য যেখানে বিভিন্ন গোষ্ঠীর দুজন ব্যক্তির অংশগ্রহণের পরিস্থিতি বর্ণনা করা হয়েছে, কিন্তু প্রশ্নের সুনির্দিষ্ট উত্তর দেওয়ার জন্য যথেষ্ট তথ্য নেই[1]। এই ক্ষেত্রে সঠিক উত্তর সর্বদা «অজানা» বিকল্পটি (অর্থাৎ পর্যাপ্ত তথ্যের অভাব)[1]। এই উদাহরণগুলো পরীক্ষার জন্য তৈরি যে মডেল স্টেরিওটাইপের উপর ভিত্তি করে সিদ্ধান্তে পৌঁছাবে কিনা।
- দ্ব্যর্থহীন প্রসঙ্গ (disambiguated context): বিস্তারিত পরিস্থিতি যেখানে একটি স্পষ্টকারী বিবরণ যোগ করা হয়েছে, যা নির্ধারণ করতে দেয় যে উল্লিখিত দুজন ব্যক্তির মধ্যে কোনটি প্রশ্নের সাথে সংগতিপূর্ণ[1]। এক্ষেত্রে দুজন চরিত্রের একজন স্পষ্টতই সঠিক উত্তর (এবং «অজানা» বিকল্পটি আর সঠিক নয়)। দ্ব্যর্থহীন প্রসঙ্গ পরীক্ষা করে যে মডেল তার সম্ভাব্য bias অতিক্রম করে সঠিক উত্তর বেছে নিতে পারে কিনা, এমনকি যদি স্টেরিওটাইপ বিপরীত ইঙ্গিত দেয়[1]।
- নেতিবাচক প্রশ্ন (e.g., «তাদের মধ্যে কে বিষয়টি ভালো জানে না?», «কে অপরাধ করেছে?»)[1]। অস্পষ্ট প্রসঙ্গের সাথে এই ধরনের প্রশ্ন পরীক্ষা করে যে তথ্যের অভাবে মডেল নির্দিষ্ট গোষ্ঠীর সাথে নেতিবাচক কাজ যুক্ত করতে প্রবণ কিনা[1]।
- অনেতিবাচক (বিপরীত) প্রশ্ন (e.g., «তাদের মধ্যে কে বিষয়টি ভালো জানে?» বা «কে খারাপ কাজ থেকে বিরত থাকে?»)[1]। অনেতিবাচক প্রশ্নটি এমনভাবে তৈরি করা হয়েছে যাতে এটি সরাসরি স্টেরিওটাইপ সমর্থন না করে, তবুও মডেলের উত্তরের ভারসাম্য পরীক্ষা করতে পারে[1]। নেতিবাচক ও নিরপেক্ষ সংস্করণের উত্তর তুলনা করলে পদ্ধতিগত বিকৃতি ধরা পড়ে।
ক্লাস্টারের এই চারটি উদাহরণের প্রতিটিতে তিনটি উত্তরের বিকল্প রয়েছে: দুটি নির্দিষ্ট (প্রতিটি চরিত্রের গোষ্ঠীর নাম উল্লেখ করে) এবং একটি বিকল্প যা পর্যাপ্ত তথ্যের অভাব নির্দেশ করে («Unknown» এবং সমতুল্য বাক্যাংশ হিসেবে চিহ্নিত)[1]। উদাহরণস্বরূপ, একটি দৃশ্যে যেখানে একজন খ্রিস্টান এবং একজন মুসলমান উপস্থিত, উত্তরের বিকল্পগুলো হবে: «খ্রিস্টান», «মুসলমান» বা «অজানা»[1]। এছাড়া «অজানা» শব্দটি সবসময় একই থাকে না — ১০টি সমার্থক প্রকাশ ব্যবহার করা হয়[1]।
পাশাপাশি, প্রতিটি টেমপ্লেটে স্বয়ংক্রিয়ভাবে দুটি গোষ্ঠীর উল্লেখের ক্রম পরিবর্তন করা হয়[1]। এটি ক্রম প্রভাব প্রশমিত করার জন্য করা হয় — একটি পরিচিত উপাদান যেখানে মডেলগুলো বিষয়বস্তু নির্বিশেষে প্রথমে উল্লিখিত সত্তাটি বেশি বেছে নিতে পারে[1]।
টীকা ও গুণমান যাচাই
BBQ-এর প্রতিটি উদাহরণ ক্রাউডসোর্সিং টীকাকারীদের দ্বারা মূল্যায়িত হয়েছে: কমপক্ষে ৫ জন স্বাধীন ব্যক্তি প্রশ্নের উত্তর দিয়েছেন এবং চূড়ান্ত dataset-এ শুধুমাত্র সেই উদাহরণগুলো অন্তর্ভুক্ত করা হয়েছে যেখানে ৫ জনের মধ্যে কমপক্ষে ৪ জন টীকাকারী সঠিক উত্তরে একমত হয়েছেন (ভোটের মাধ্যমে)[1]। কোনো প্রশ্ন এই সীমা অতিক্রম না করলে পুরো টেমপ্লেটটি পুনর্বিবেচনা করা হতো এবং সম্পাদনা করা হতো[1]। এই প্রক্রিয়ার কারণে BBQ-তে মানুষের নির্ভুলতা বেশ উচ্চ: স্বতন্ত্র টীকাকারীরা ~৯৫.৭% প্রশ্নের সঠিক উত্তর দিয়েছেন, এবং সংখ্যাগরিষ্ঠতার ভোট বিবেচনায় স্বর্ণ মানের নির্ভুলতা ৯৯.৭% পৌঁছে[1]। সম্মতির Krippendorff's alpha মান ০.৮৮৩ ছিল, যা সঠিক উত্তর সম্পর্কে মানুষের মধ্যে উচ্চ মাত্রার সহমত নির্দেশ করে[1]। এই পদক্ষেপগুলো নিশ্চিত করে যে BBQ-এর কাজগুলো মানুষের কাছে বোধগম্য এবং এগুলোর বস্তুনিষ্ঠভাবে সঠিক উত্তর আছে; ফলে এই উদাহরণগুলোতে মডেলের ত্রুটিগুলোকে যুক্তিসংগতভাবে bias-এর প্রকাশ হিসেবে ব্যাখ্যা করা যায়, প্রশ্নের অস্পষ্টতা হিসেবে নয়।
মডেলের পক্ষপাত মূল্যায়ন
BBQ সামাজিক bias উস্কে দেওয়ার মতো পরিস্থিতিতে মডেলের আচরণের বহুমাত্রিক মূল্যায়নের জন্য তৈরি। পরীক্ষার সময় QA-মডেল প্রসঙ্গ ও প্রশ্ন ইনপুট হিসেবে পায়, তারপর তিনটি উত্তর বিকল্পের মধ্যে একটি বেছে নিতে হয়। ফলাফল বিশ্লেষণ দুটি স্তরে পরিচালিত হয়[1]:
অস্পষ্ট প্রসঙ্গের ক্ষেত্রে
পরিমাপ করা হয় যে প্রয়োজনীয় তথ্যের অনুপস্থিতিতে মডেল কতবার ভুলভাবে উত্তর দেয়, অর্থাৎ স্টেরিওটাইপের উপর নির্ভর করে[1]। আদর্শভাবে মডেলের উচিত অপর্যাপ্ত প্রসঙ্গ সহ যেকোনো প্রশ্নে «অজানা» উত্তর দেওয়া, কিন্তু যদি এটি একটি নির্দিষ্ট গোষ্ঠী বেছে নেয়, তবে এটিকে অন্তর্নিহিত স্টেরিওটাইপের প্রক্ষেপণ হিসেবে বিবেচনা করা হয়[1]। এই ত্রুটিগুলোর হার এবং বিভাগ অনুযায়ী তাদের বিতরণ মডেলের ক্ষতিকর স্টেরিওটাইপ পুনরুৎপাদনের প্রবণতার একটি ধারণা দেয়।
তথ্যসমৃদ্ধ প্রসঙ্গের ক্ষেত্রে
প্রসঙ্গে স্পষ্ট সঠিক উত্তর থাকলে মডেল কতটা নির্ভুলভাবে উত্তর দেয় তা মূল্যায়ন করা হয়[1]। এখানে সাধারণত মানক accuracy মেট্রিক (সঠিক উত্তরের শতাংশ) গণনা করা হয় — মডেল মূলত প্রশ্নোত্তরের কাজ পরিচালনা করতে পারে কিনা তা দেখায়। তবে বিশেষ মনোযোগ দেওয়া হয় সেই ক্ষেত্রগুলোতে যেখানে সঠিক উত্তর স্টেরিওটাইপের বিরুদ্ধে যায়[1]। BBQ-এর নির্মাতারা বিশ্লেষণ করেন যে সঠিক উত্তর গভীরে প্রোথিত স্টেরিওটাইপের বিরোধী হলে মডেলের নির্ভুলতা কমে যায় কিনা (এবং বিপরীতভাবে, সত্য স্টেরিওটাইপিক প্রত্যাশার সাথে মিলে গেলে নির্ভুলতা বেশি হয় কিনা)[1]। এই ধরনের প্রভাব ইঙ্গিত করবে যে তথ্যের উপস্থিতিতেও মডেল bias-এর কারণে ভুল করতে পারে।
Bias Score
পক্ষপাতের মাত্রার পরিমাণগত মূল্যায়নের জন্য একটি বিশেষ মেট্রিক চালু করা হয়েছে — পক্ষপাত স্কোর (bias score)[1]। সাধারণভাবে bias score মডেলের উত্তরের সেই শতাংশ প্রতিফলিত করে (শর্তের উপর নির্ভর করে ভুল বা সমস্ত উত্তরের মধ্যে) যা স্টেরিওটাইপের সাথে মিলে যায়[1]।
- +100% মানে হবে যে মডেল সব ক্ষেত্রে সেই উত্তর বিকল্পটি বেছে নিয়েছে যা স্টেরিওটাইপিকভাবে লক্ষ্য গোষ্ঠীর সাথে নেতিবাচক গুণ যুক্ত করে।
- ০% — কোনো bias-এর প্রকাশ নেই (মডেল সবসময় সঠিক/«অজানা» উত্তর দেয়, বা উভয় দিকে সমানভাবে ভুল করে)।
- নেতিবাচক স্কোর (-১০০% পর্যন্ত) — বিপরীত প্রবণতা, যখন মডেল সবসময় স্টেরিওটাইপ প্রত্যাশার বিরুদ্ধে উত্তর দেয়[1]।
অস্পষ্ট ও দ্ব্যর্থহীন প্রসঙ্গের জন্য পৃথকভাবে স্কোর গণনা করা হয়, কারণ এগুলোতে ত্রুটির প্রকৃতি ভিন্ন[1]।
- অস্পষ্ট প্রশ্নের জন্য bias score নির্ধারিত হয় সেই ক্ষেত্রগুলোর অনুপাত দিয়ে যেখানে মডেল «অজানা»-র পরিবর্তে কোনো নির্দিষ্ট উত্তর বেছে নিয়েছে এবং সেই উত্তর নেতিবাচক স্টেরিওটাইপের সাথে মিলে গেছে[1]। এই ধরনের উত্তর যত বেশি, ইতিবাচক স্কোর তত বেশি। এক্ষেত্রে নির্ভুলতা বিবেচনা করা হয়: যদি মডেল সমানভাবে ভুল করে এবং সঠিক উত্তর দেয় («অজানা»), তাহলে কিছু স্টেরিওটাইপিক ত্রুটি থাকলেও স্কোর সেই মডেলের চেয়ে কম হবে যে সবসময় স্টেরিওটাইপিক উত্তর বেছে নেয়[1]। এইভাবে, bias উত্তরের ঘনত্ব ও আস্থা উভয়ই শাস্তিযোগ্য (অস্পষ্ট প্রসঙ্গের জন্য মেট্রিকটি «অজানা» সঠিক উত্তরের শতাংশ বিবেচনায় স্কেল করা হয়)[1]।
- দ্ব্যর্থহীন প্রশ্নের জন্য bias score কিছুটা ভিন্নভাবে গণনা করা হয়, কারণ এখানে সঠিক উত্তর একটি গোষ্ঠী[1]। এই ক্ষেত্রগুলোতে মডেলের ভুল উত্তর দেখা হয়: ভুলগুলোর সেই অনুপাত যেখানে মডেল সঠিক বিকল্পটি নয়, বরং স্টেরিওটাইপের সাথে মিলে যাওয়া বিকল্পটি বেছে নিয়েছে[1]। অন্যভাবে বলতে গেলে, যদি মডেল পক্ষপাতের পক্ষে ভুল করে (যেমন তথ্যকে বিশ্বাস না করে স্টেরিওটাইপ অনুযায়ী উত্তর দেয়), তাহলে স্কোর বাড়ে[1]।
সামগ্রিক নির্ভুলতার পাশাপাশি bias score বিশ্লেষণ BBQ-তে মডেলের আচরণ বিস্তারিতভাবে চিহ্নিত করতে দেয়। লেখকরা উল্লেখ করেন যে একই accuracy বিভিন্ন প্রকৃতির ত্রুটি আড়াল করতে পারে[1]। এইভাবে, এই সূচকটি ত্রুটির দিকনির্দেশনা দেখায় এবং সেই সূক্ষ্ম ক্ষেত্রগুলো উন্মোচন করে যা কেবল নির্ভুলতা দিয়ে দেখা যায় না।
ফলাফল ও চিহ্নিত নিদর্শন
BBQ dataset-এ বেশ কয়েকটি জনপ্রিয় QA-মডেলের প্রাথমিক পরীক্ষা bias-এর কিছু স্পষ্ট প্রকাশ প্রদর্শন করেছে[1]। Parrish ও অন্যান্য (২০২২)-এর গবেষণায় বড় সার্বজনীন মডেল (যেমন UnifiedQA — T5-এর উপর ভিত্তি করে QA-এর জন্য একটি সাধারণীকৃত মডেল) এবং মানক multiple-choice মডেল (যেমন ROBERTA QA-তে fine-tuning সহ) উভয়ই পরীক্ষা করা হয়েছিল[1]।
পরীক্ষার ফলাফলের মূল উপসংহার:
- তথ্যের অভাবে শক্তিশালী স্টেরিওটাইপিক ত্রুটি। সমস্ত পরীক্ষিত সিস্টেমে প্রসঙ্গ প্রয়োজনীয় সংকেত না দিলে স্টেরিওটাইপ অনুযায়ী উত্তর দেওয়ার প্রবণতা লক্ষ্য করা গেছে[1]। অর্থাৎ মডেলগুলো প্রায়ই «অজানা» বিকল্পটি না বেছে নির্দিষ্ট কোনো একটি স্টেরিওটাইপিক প্রত্যাশার সাথে সংগতিপূর্ণ উত্তর পছন্দ করেছে[1]। উদাহরণস্বরূপ, স্পষ্ট অপরাধীহীন অপরাধ সম্পর্কিত অস্পষ্ট প্রশ্নে মডেলগুলো প্রায়ই একটি নির্দিষ্ট গোষ্ঠীর (পক্ষপাতের সাথে সামঞ্জস্যপূর্ণ) ব্যক্তিদের নির্দেশ করেছে[1]। ambiguous প্রসঙ্গের জন্য গণনা করা bias score শূন্যের চেয়ে উল্লেখযোগ্যভাবে বেশি ছিল, এবং কিছু মডেলে নির্দিষ্ট বিভাগে কখনো কখনো +১০০%-এর কাছাকাছি পৌঁছেছিল[1]। বাহ্যিক চেহারা (স্থূলতা ইত্যাদি) সম্পর্কিত দৃশ্যকল্পে মডেলগুলো বিশেষভাবে উচ্চ স্টেরিওটাইপিক উত্তরের প্রবণতা দেখিয়েছে — এই বিভাগটি যেমন বর্ণ বা যৌন অভিমুখীতার তুলনায় উল্লেখযোগ্যভাবে বেশি bias দেখিয়েছে[1]। এটি মডেলের ভেতরে bias-এর অসমতার কথা বলে — কিছু ধরনের স্টেরিওটাইপ এটির দ্বারা অন্যদের চেয়ে বেশি «আত্মস্থ» হয়েছে।
- তথ্যের উপস্থিতিতে উন্নতি, কিন্তু সুপ্ত bias বজায়। মডেলগুলো সঠিক উত্তরের স্পষ্ট নির্দেশসহ দ্ব্যর্থহীন প্রসঙ্গ পেলে তাদের নির্ভুলতা উল্লেখযোগ্যভাবে বৃদ্ধি পেয়েছিল (অনিশ্চয়তার পরিস্থিতির তুলনায়)[1]। তবে বিস্তারিত বিশ্লেষণে একটি সূক্ষ্ম প্রভাব উন্মোচিত হয়েছে: নির্ভুলতা স্টেরিওটাইপের সাথে সঠিক উত্তরের সম্পর্কের উপর নির্ভর করে অসমান ছিল[1]। গড়ে, মডেলগুলো সেই উদাহরণগুলোতে ৩-৩.৫ শতাংশ পয়েন্ট বেশি নির্ভুলতা অর্জন করেছে যেখানে সঠিক উত্তর প্রচলিত স্টেরিওটাইপের সাথে মিলে যায়, সেই উদাহরণগুলোর তুলনায় যেখানে সঠিক উত্তর সেই স্টেরিওটাইপের বিরোধিতা করে[1]। অন্যভাবে বলতে গেলে, তথ্য যখন পক্ষপাতকে নিশ্চিত করে তখন মডেলগুলো প্রায় নির্ভুলভাবে উত্তর দিয়েছে; কিন্তু যদি স্টেরিওটাইপের জন্য «অস্বাভাবিক» বিকল্পটি নামকরণ করতে হয়, তাহলে ভুলের সম্ভাবনা বেড়ে গেছে। এই কর্মক্ষমতার ব্যবধান যদিও বিশাল নয়, তবু অনেক বিভাগে পরিসংখ্যানগতভাবে প্রকাশ পেয়েছে[1]। লিঙ্গ-সংক্রান্ত স্টেরিওটাইপের প্রশ্নে সবচেয়ে বড় পার্থক্য লক্ষ্য করা গেছে: ৫ শতাংশ পয়েন্ট পর্যন্ত পার্থক্য[1]। সুতরাং, bias-এর সুপ্ত প্রভাব স্পষ্ট: মডেলগুলো গড়ে «স্টেরিওটাইপের বিরুদ্ধে» কিছুটা খারাপ কাজ করে।
- বিভাগ ও টেমপ্লেট তুলনা। BBQ-এর গবেষকরা সমস্ত নয়টি বিভাগে bias score বিশ্লেষণ করেছেন এবং দেখেছেন যে অস্পষ্ট প্রসঙ্গে এই সূচক সব বিভাগে ইতিবাচক, কিন্তু এর মাত্রা ভিন্ন[1]। উল্লিখিত হিসাবে, সর্বোচ্চ bias শারীরিক চেহারা, আর্থ-সামাজিক মর্যাদা এবং কিছু আন্তঃবিভাগীয় বিভাগে লক্ষ্য করা গেছে[1]। বর্ণ/জাতিসত্তা এবং যৌন অভিমুখীতার বিভাগে bias score তুলনামূলকভাবে «নিচু» ছিল, যদিও শূন্য নয়[1]। দ্ব্যর্থহীন প্রসঙ্গে bias score সামগ্রিকভাবে শূন্যের কাছাকাছি (কারণ মডেল প্রায়ই সঠিকভাবে উত্তর দেয়), তবু কিছু টেমপ্লেটের জন্য ইতিবাচক থাকে, যা ভুলের প্রকৃতিতে লক্ষণীয় বিচ্যুতি প্রতিফলিত করে[1]। উদাহরণস্বরূপ, ধর্ম বিভাগে বেশিরভাগ ভুল একদিকে ছিল — মডেলগুলো সাধারণত ভুল করলে পক্ষপাতের ভিত্তিতে উত্তর বেছে নিয়েছে[1]।
সামগ্রিকভাবে BBQ প্রদর্শন করেছে যে এমনকি শক্তিশালী আধুনিক ভাষা মডেলগুলোও স্পষ্টতই সামাজিক পক্ষপাত থেকে মুক্ত নয়[1]। অনিশ্চয়তার পরিস্থিতিতে রাখা হলে এগুলো স্টেরিওটাইপ পুনরুৎপাদন করতে প্রবণ, এবং বিপরীত উত্তর প্রয়োজন এমন তথ্যের উপস্থিতিতেও সূক্ষ্ম bias প্রকাশ করতে পারে[1]। তবে এই প্রভাবগুলোর মাত্রা বিভিন্ন গোষ্ঠীর জন্য একরকম নয়: কিছু স্টেরিওটাইপ মডেল দ্বারা আরও বেশি «আত্মস্থ» হয়েছে[1]। BBQ-এর লেখকরা জোর দেন যে চিহ্নিত পার্থক্যগুলো যদিও লক্ষণীয়, তবু বিপর্যয়মূলক নয় — বেশিরভাগ মডেলের bias score চরম মানে পৌঁছায় না, প্রায়ই কয়েক দশক শতাংশের মধ্যে থাকে[1]। তথাপি, LLM-এর ব্যাপক ব্যবহারে স্টেরিওটাইপের দিকে এমনকি সামান্য পদ্ধতিগত বিচ্যুতিও সম্ভাব্য বিপজ্জনক, তাই এই bias চিহ্নিত করা ও দূর করা একটি গুরুত্বপূর্ণ কাজ[3]। BBQ গবেষকদের এই ক্ষেত্রে অগ্রগতি পর্যবেক্ষণের একটি স্পষ্ট ও পরিমাণগতভাবে পরিমাপযোগ্য পদ্ধতি প্রদান করেছে[3]।
প্রভাব ও পরবর্তী গবেষণা
BBQ dataset দ্রুত ভাষা মডেলের fairness বৈশিষ্ট্য মূল্যায়নের একটি মানক হাতিয়ার হিসেবে স্বীকৃতি পেয়েছে[4]। এর উন্মুক্ত সোর্স কোড ও ডেটা একটি রিপোজিটরিতে (CC BY 4.0 লাইসেন্স) পাওয়া যায়[4], যা বৃহৎ গবেষণা সম্প্রদায়কে নতুন মডেল উন্নয়ন ও পরীক্ষায় BBQ প্রয়োগ করতে সক্ষম করেছে। কিছু সমীক্ষায় BBQ অন্যান্য benchmark-এর (যেমন StereoSet, WinoBias, ToxiGen) পাশাপাশি NLP-তে সামাজিক bias গবেষণার একটি গুরুত্বপূর্ণ মাইলফলক হিসেবে উল্লেখ করা হয়[3]। BBQ প্রকাশের পর থেকে এর ধারণা বিকাশকারী ও নতুন পরিস্থিতিতে অভিযোজনকারী কাজ সামনে এসেছে:
- প্রশ্নের ফর্ম্যাট সম্প্রসারণ (Open-BBQ)। মূল BBQ বহু-বিকল্প ফর্ম্যাটে কাজ প্রস্তাব করে[3]। ২০২৪ সালে BBQ-এর একটি মুক্ত উত্তর পরিবর্তন প্রস্তাব করা হয়েছিল, যেখানে শূন্যস্থান পূরণ ও সংক্ষিপ্ত উত্তরের পাঠ্যের কাজ অন্তর্ভুক্ত রয়েছে[3]। এই সংস্করণটি, অনানুষ্ঠানিকভাবে Open-BBQ নামে পরিচিত, আরও মুক্ত কথোপকথনের পরিস্থিতিতে bias মূল্যায়ন করতে সক্ষম করে, যেখানে মডেলের কোনো নির্দিষ্ট উত্তর বিকল্প নেই[3]। গবেষণাটি দেখিয়েছে যে LLM-গুলো মুক্ত পাঠ্য তৈরিতেও কিছু গোষ্ঠীর বিরুদ্ধে বর্ধিত bias প্রদর্শন করে[3]। Open-BBQ-এর লেখকরা zero-shot ও few-shot prompt এবং chain-of-thought (ধাপে ধাপে যুক্তি) সমন্বয় করে পক্ষপাত প্রশমনের পদ্ধতি নিয়েও পরীক্ষা-নিরীক্ষা করেছেন[3]। এই পদ্ধতিগুলো উত্তরে bias-এর মাত্রা উল্লেখযোগ্যভাবে কমাতে সক্ষম হয়েছে[3]। Open-BBQ মূল dataset-টিকে পরিপূরক করেছে, জেনারেটিভ মডেলগুলোকে ব্যবহারকারীর অনুরোধের আরও কাছাকাছি ফর্ম্যাটে পরীক্ষা করা সম্ভব করেছে।
- সাংস্কৃতিক অভিযোজন (স্থানীয়করণ)। BBQ মার্কিন সামাজিক বাস্তবতার সাথে যুক্ত হওয়ায় গবেষকরা এটিকে অন্যান্য ভাষা ও সংস্কৃতিতে অভিযোজিত করতে আগ্রহী হয়েছেন[5]। ২০২৩ সালে কোরিয়ান গবেষকরা KoBBQ (Korean BBQ) dataset উপস্থাপন করেছেন — Bias Benchmark-এর কোরিয়ান সংস্করণ[5]। তারা BBQ-এর স্থানীয়করণের একটি সাধারণ পদ্ধতি তৈরি করেছেন: মূল টেমপ্লেটগুলোকে তিনটি বিভাগে ভাগ করেছেন — যেগুলো সরাসরি অনুবাদ করা যায়, যেগুলোর স্থানীয় সমকক্ষ গোষ্ঠী দিয়ে প্রতিস্থাপন প্রয়োজন, এবং যেগুলো কোরিয়ান প্রেক্ষাপটে মোটেই প্রযোজ্য নয়[5]। অতিরিক্তভাবে KoBBQ কোরিয়ান সমাজের জন্য নির্দিষ্ট ৪টি নতুন স্টেরিওটাইপ বিভাগ যোগ করেছে এবং বেশ কিছু অসংগতিপূর্ণ উদাহরণ বাদ দিয়েছে[5]। ফলস্বরূপ ১২টি সামাজিক bias বিভাগ (মূল ও নতুন) অন্তর্ভুক্ত করে কোরিয়ান ভাষায় ২৬৮টি টেমপ্লেট ও ৭৬,০৪৮টি উদাহরণের একটি dataset তৈরি হয়েছে[5]। KoBBQ-তে বহুভাষিক মডেল পরীক্ষা করে দেখা গেছে যে মূল BBQ-এর কোরিয়ান ভাষায় সরাসরি মেশিন অনুবাদের তুলনায় পক্ষপাতের মাত্রায় উল্লেখযোগ্য পার্থক্য রয়েছে[5]। এটি জোর দেয় যে সরাসরি অনুবাদ যথেষ্ট নয় — প্রতিটি দেশের অনন্য স্টেরিওটাইপ ও প্রেক্ষাপট বিবেচনা করে সংস্কৃতি-নির্দিষ্ট benchmark প্রয়োজন[5]। KoBBQ-এর কাজ BBQ পদ্ধতি বৈশ্বিকভাবে স্কেল করার সম্ভাবনা প্রদর্শন করেছে।
BBQ কৃত্রিম বুদ্ধিমত্তার নৈতিকতা গবেষণার একটি অবিচ্ছেদ্য অংশ হয়ে উঠেছে[3]। মডেল ডিবায়াসিং-এর নতুন পদ্ধতি তৈরি, আরও অন্তর্ভুক্তিমূলক dataset নির্মাণ এবং সূক্ষ্ম bias বিশ্লেষণের মেট্রিক তৈরিতে এর প্রভাব স্পষ্ট। গবেষকরা উল্লেখ করেন যে BBQ-এর অন্যতম শক্তিশালী দিক হলো এর কভারেজের বিস্তৃতি ও উদাহরণ নির্মাণের যত্নশীলতা[3]। BBQ-এর চিহ্নিত চ্যালেঞ্জের প্রতিক্রিয়ায়, সম্প্রতি প্রশিক্ষণ ডেটা ফিল্টারিং থেকে শুরু করে বিশেষ পোস্ট-প্রসেসিং অ্যালগরিদম এবং ন্যায়সঙ্গত উত্তরের জন্য LLM fine-tuning পর্যন্ত সক্রিয়ভাবে bias হ্রাসের কৌশল তৈরি হচ্ছে[3]।
সারসংক্ষেপে, BBQ (Bias Benchmark for QA) ভাষা মডেলে সামাজিক পক্ষপাত পরিমাপের একটি মূল্যবান ও নির্ভরযোগ্য হাতিয়ার হিসেবে প্রতিষ্ঠিত হয়েছে। এটি গবেষণা সম্প্রদায়কে একটি মানক যাচাইয়ের সেট প্রদান করে, যা মডেলগুলোর স্টেরিওটাইপিক প্রবণতার তুলনা এবং তাদের নিরপেক্ষতা উন্নয়নে অগ্রগতি পর্যবেক্ষণ করতে দেয়[3]। BBQ সম্প্রসারিত ও অভিযোজিত হতে থাকে, যা আরও ন্যায্য ও নিরাপদ AI সিস্টেম তৈরিতে বৈশ্বিক আগ্রহকে প্রতিফলিত করে[3], যা অদৃশ্য কিন্তু উল্লেখযোগ্য ক্ষতিকর bias থেকে মুক্ত।
তথ্যসূত্র
- BBQ-এর মূল নিবন্ধ (arXiv)
- GitHub-এ BBQ রিপোজিটরি
- Papers With Code-এ BBQ dataset পৃষ্ঠা
- ACL Anthology-তে BBQ নিবন্ধ
- KoBBQ dataset সম্পর্কিত নিবন্ধ (arXiv)
- Open-BBQ dataset সম্পর্কিত নিবন্ধ (arXiv)
সাহিত্য
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
টীকা
[1] [2] [3] [4] [5] </references>
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 1.24 1.25 1.26 1.27 1.28 1.29 1.30 1.31 1.32 1.33 1.34 1.35 1.36 1.37 1.38 1.39 1.40 1.41 1.42 1.43 1.44 1.45 1.46 1.47 1.48 1.49 1.50 1.51 1.52 1.53 1.54 1.55 1.56 1.57 1.58 1.59 1.60 1.61 1.62 1.63 1.64 1.65 1.66 1.67 1.68 1.69 1.70 1.71 1.72 1.73 1.74 1.75 1.76 1.77 1.78 1.79 1.80 1.81 Parrish A. et al. «BBQ: A Hand-Built Bias Benchmark for Question Answering». arXiv. [১]
- ↑ 2.0 2.1 Parrish A. et al. «BBQ: A hand-built bias benchmark for question answering». ACL Anthology. [২]
- ↑ 3.00 3.01 3.02 3.03 3.04 3.05 3.06 3.07 3.08 3.09 3.10 3.11 3.12 3.13 3.14 3.15 3.16 Liu Z. et al. (2024). «Evaluating and Mitigating Social Bias for Large Language Models in Open-ended Settings». arXiv preprint. [৩]
- ↑ 4.0 4.1 4.2 4.3 4.4 4.5 4.6 «BBQ Dataset». Papers With Code. [৪]
- ↑ 5.0 5.1 5.2 5.3 5.4 5.5 5.6 5.7 Jin J. et al. (2024). «KoBBQ: Korean Bias Benchmark for Question Answering». arXiv preprint. [৫]