SafetyBench (BN)
SafetyBench — এটি বড় ভাষা মডেলগুলির নিরাপত্তার ব্যাপক মূল্যায়নের জন্য প্রথম সমন্বিত benchmark [1]। এটি সিংহুয়া বিশ্ববিদ্যালয়ের গবেষকদের একটি দল দ্বারা তৈরি করা হয়েছিল এবং ২০২৩ সালে উপস্থাপিত হয়েছিল[1]।
বৃহৎ ভাষা মডেল (BYM)-এর বিকাশের সাথে সাথে (যেমন ChatGPT-এর আবির্ভাব) এবং সেগুলির ব্যাপক ব্যবহারের ফলে এই ধরনের সিস্টেমের নিরাপত্তা সমস্যার প্রতি মনোযোগ বৃদ্ধি পেয়েছে[1]। গবেষণায় দেখা গেছে যে কথোপকথন মডেলগুলি ব্যবহারকারীদের ব্যক্তিগত তথ্য ফাঁস করতে পারে বা বিষাক্ত বক্তব্য তৈরি করতে পারে[1]। এভাবে, BYM-এর নিরাপত্তা মূল্যায়ন তাদের বাস্তব প্রয়োগে নির্ভরযোগ্যভাবে ব্যবহারের জন্য একটি অত্যন্ত গুরুত্বপূর্ণ কাজ হয়ে উঠেছে। তবে সম্প্রতি পর্যন্ত মডেলের নিরাপত্তার সমস্ত প্রধান দিক অন্তর্ভুক্ত করে এমন কোনো সমন্বিত benchmark (পরীক্ষার সেট) ছিল না; বিদ্যমান dataset-গুলি কেবল কিছু নির্দিষ্ট দিক পরীক্ষা করত (যেমন বিষাক্ততা বা সামাজিক পক্ষপাত) এবং সামগ্রিক চিত্র প্রদান করত না[1]। একটি সর্বাঙ্গীণ মূল্যায়ন পদ্ধতির অনুপস্থিতি দুর্বলতা চিহ্নিত করা এবং আরও নিরাপদ ভাষা মডেল তৈরি করা উভয়কেই কঠিন করে তুলেছিল[1]। SafetyBench এই শূন্যস্থান পূরণ করতে তৈরি করা হয়েছিল[1]।
SafetyBench-এর বিকাশ ও বিবরণ
SafetyBench হলো ১১,৪৩৫টি multiple-choice প্রশ্নের একটি সেট, যা AI দ্বারা তৈরি কন্টেন্ট সম্পর্কিত সাধারণ সমস্যা বা হুমকির ৭টি ভিন্ন বিভাগ অন্তর্ভুক্ত করে[1]। একটি গুরুত্বপূর্ণ বৈশিষ্ট্য হলো দ্বিভাষিকতা: প্রতিটি প্রশ্ন ইংরেজি এবং চীনা উভয় ভাষায় পাওয়া যায়, যা একই উপাদানে ইংরেজি এবং চীনা উভয় মডেলের মূল্যায়ন করার সুযোগ দেয়[1]। মূলত SafetyBench হলো প্রথম বৃহত্তর মাপের হাতিয়ার যা স্বয়ংক্রিয়ভাবে এবং উচ্চ নির্ভুলতার সাথে নিরাপদ আচরণ ও কন্টেন্ট সম্পর্কিত প্রশ্নে মডেলের বোঝাপড়া পরীক্ষা করতে পারে[1]। MMLU-এর মতো পরিচিত benchmark-এর অনুরূপ একটি সঠিক উত্তর সহ প্রশ্নের ফরম্যাট মূল্যায়নের বস্তুনিষ্ঠতা ও কার্যকারিতা নিশ্চিত করে এবং মডেলের উত্তরের শ্রমসাধ্য ম্যানুয়াল যাচাইয়ের উপর নির্ভরতা কমায়[1]।
SafetyBench-এর ডেভেলপাররা পূর্বে প্রস্তাবিত অনিরাপদ কন্টেন্ট সম্পর্কিত সাধারণ পরিস্থিতির শ্রেণীবিভাগের উপর নির্ভর করেছিলেন[1]। বিশেষত, benchmark-এর বিভাগগুলি Sun এবং সহ-লেখকদের (২০২৩) কাজে বর্ণিত ৮টি পরিস্থিতির ভিত্তিতে চিহ্নিত করা হয়েছিল, তবে চীনা ও ইংরেজি প্রেক্ষাপটে উত্তরের অতুলনীয়তা এড়াতে একটি বিভাগ (রাজনৈতিকভাবে সংবেদনশীল বিষয়) বাদ দেওয়া হয়েছিল[1]। এভাবে চূড়ান্ত সেটে দুটি ভাষার জন্য সাধারণ ৭টি নিরাপত্তা বিভাগ অন্তর্ভুক্ত রয়েছে।
SafetyBench-এর নিরাপত্তা বিভাগসমূহ
SafetyBench-এর প্রতিটি পরীক্ষার প্রশ্ন সাতটি বিভাগের একটিতে পড়ে, যা সম্ভাব্য বিপজ্জনক বা অবাঞ্ছিত দিকগুলির বিস্তৃত পরিসর অন্তর্ভুক্ত করে[1]। নিচে এই বিভাগগুলি এবং তাদের সংক্ষিপ্ত বিবরণ দেওয়া হলো:
- আপত্তিকর কন্টেন্ট (Offensiveness) – হুমকি, অপমান, রুক্ষতা, অশ্লীল ভাষা, বিদ্রূপ এবং অগ্রহণযোগ্য স্বরের অন্যান্য প্রকাশ[1]। মডেলকে অবশ্যই এই ধরনের আক্রমণ সনাক্ত করতে এবং বিষাক্ত বা আক্রমণাত্মক কন্টেন্টের বিরুদ্ধে প্রতিরোধ করতে সক্ষম হতে হবে[1]।
- পক্ষপাত ও বৈষম্য (Unfairness and Bias) – জাতি, লিঙ্গ, ধর্ম ইত্যাদির ভিত্তিতে সামাজিক পক্ষপাত ও অন্যায়ের প্রকাশ[1]। মডেলকে অবশ্যই পক্ষপাত বা বৈষম্য প্রকাশ করে এমন ভাষাগত কাঠামো সনাক্ত ও এড়িয়ে চলতে হবে[1]।
- শারীরিক স্বাস্থ্য (Physical Health) – পরিস্থিতি ও বক্তব্য যা মানুষের শারীরিক স্বাস্থ্যকে প্রভাবিত করতে পারে[1]। মডেলকে অবশ্যই বিভিন্ন জীবনের পরিস্থিতিতে স্বাস্থ্য রক্ষার জন্য সঠিক, নিরাপদ কর্মপন্থা ও পরামর্শ জানতে হবে[1]।
- মানসিক স্বাস্থ্য (Mental Health) – মনস্তাত্ত্বিক সুস্থতা, আবেগ ও মানসিক স্বাস্থ্য সম্পর্কিত প্রশ্ন[1]। মডেলকে অবশ্যই মানসিক স্বাস্থ্য রক্ষা ও নেতিবাচক মানসিক প্রভাব প্রতিরোধের সঠিক উপায় প্রস্তাব করতে হবে[1]।
- বেআইনি কার্যকলাপ (Illegal Activities) – বেআইনি কার্যকলাপ জড়িত পরিস্থিতি[1]। মডেলকে অবশ্যই বৈধ ও অবৈধ আচরণের পার্থক্য করতে, আইনি নিয়মকানুন সম্পর্কে মৌলিক জ্ঞান রাখতে এবং আইন লঙ্ঘনে উসকানি না দিতে হবে[1]।
- নৈতিকতা ও নীতিশাস্ত্র (Ethics and Morality) – অনৈতিক বা অসদাচরণমূলক আচরণ সম্পর্কিত পরিস্থিতি, এমনকি যদি তা সরাসরি আইনের আওতায় না পড়ে[1]। মডেলকে অবশ্যই উচ্চ নৈতিক মান প্রদর্শন করতে এবং অনৈতিক কাজ বা বক্তব্যের নিন্দা করতে হবে[1]।
- গোপনীয়তা ও সম্পত্তি (Privacy and Property) – ব্যক্তিগত তথ্য, সম্পত্তির অধিকার, আর্থিক ঝুঁকি ইত্যাদি সম্পর্কিত প্রশ্ন[1]। মডেলকে অবশ্যই গোপনীয়তা ও সম্পত্তির অধিকারের নীতিগুলি সংবেদনশীলভাবে বুঝতে এবং ব্যক্তিগত তথ্যের অনিচ্ছাকৃত প্রকাশ বা সম্পত্তির ক্ষতি রোধ করতে হবে[1]।
প্রতিটি বিভাগে শত শত বা হাজার হাজার প্রশ্ন রয়েছে, যা সংশ্লিষ্ট নিয়ম ও নীতি সম্পর্কে মডেলের জ্ঞান সর্বাঙ্গীণভাবে পরীক্ষা করার সুযোগ দেয়[1]।
তথ্য সংগ্রহ ও প্রস্তুতি
এত বৃহৎ পরীক্ষার সেট তৈরির জন্য SafetyBench-এর লেখকরা বিভিন্ন ধরনের তথ্য উৎস ব্যবহার করেছেন[1]। গবেষণায় উল্লেখ করা হয়েছে যে প্রশ্নগুলি তিনটি প্রধান উৎস থেকে সংগ্রহ করা হয়েছিল[1]:
- বিদ্যমান dataset: কিছু বিভাগের জন্য (বিশেষত অপমান, পক্ষপাত, শারীরিক স্বাস্থ্য, নৈতিকতা) সর্বজনীনভাবে উপলব্ধ dataset ব্যবহার করা হয়েছিল[1]। লেখকরা এই সেটগুলি থেকে মূল পাঠ্য নিয়ে সেগুলিকে বিকল্প উত্তর সহ প্রশ্নের ফরম্যাটে রূপান্তরিত করেছেন[1]। উদাহরণস্বরূপ, Offensiveness বিভাগের জন্য আংশিকভাবে COLD কর্পাস (চীনা ভাষায় অপমান সনাক্তকরণের dataset) ব্যবহার করা হয়েছে[1]; ইংরেজির জন্য Jigsaw Toxic Comment প্রতিযোগিতার তথ্য ইত্যাদি ব্যবহার করা হয়েছে[1]। একইভাবে, Unfairness and Bias-এর জন্য চীনা সেট (COLD, CDial-Bias) এবং ইংরেজি সম্পদ ব্যবহার করা হয়েছে[1]। এই পদ্ধতিটি ইতোমধ্যে চিহ্নিত উপাদান পুনরায় প্রক্রিয়া করে চারটি বিভাগ একসাথে কভার করার সুযোগ দিয়েছে[1]।
- পরীক্ষার প্রশ্ন: dataset-এর পাশাপাশি, গবেষকরা নিরাপত্তা ও জীবন দক্ষতা বিষয়ক বিভিন্ন পরীক্ষামূলক উপকরণ ও প্রশ্নপত্র থেকে উপযুক্ত প্রশ্ন ম্যানুয়ালি বাছাই করেছেন[1]। বিশেষত, নৈতিকতা ও আইনশাস্ত্র বিষয়ক শিক্ষামূলক পরীক্ষা থেকে প্রশ্ন নেওয়া হয়েছে (যেমন নিরাপত্তার মৌলিক বিষয়ে স্কুলের পরীক্ষা), যা বেআইনি কার্যকলাপ, নৈতিকতা ও নীতিশাস্ত্র এবং অন্যান্য সংশ্লিষ্ট বিষয়ের বিভাগের সাথে সামঞ্জস্যপূর্ণ[1]। এই ধরনের প্রতিটি প্রশ্নও multiple-choice ফরম্যাটে রূপান্তরিত করা হয়েছে এবং একটি বিভাগে অর্পণ করা হয়েছে[1]।
- নতুন প্রশ্নের তৈরি: কিছু দিকের জন্য (যেমন গোপনীয়তা বা মানসিক স্বাস্থ্য), যেখানে উন্মুক্ত উৎসে পর্যাপ্ত বৈচিত্র্যময় তথ্য পাওয়া যায়নি, লেখকরা উচ্চ-মানের ভাষা মডেল (যেমন ChatGPT) ব্যবহার করে অতিরিক্ত প্রশ্ন তৈরি করেছেন[1]। এই বিষয়গুলিতে বিভিন্ন পরিস্থিতি তৈরির জন্য prompt তৈরি করা হয়েছিল, এরপর প্রাপ্ত বিকল্পগুলি benchmark-এ অন্তর্ভুক্তির আগে সতর্কতার সাথে ফিল্টার করা হয়েছে এবং বিশেষজ্ঞদের দ্বারা যাচাই করা হয়েছে[1]। এই নিয়ন্ত্রিত augmented পদ্ধতিটি বিভাগের কভারেজে ফাঁক পূরণ করতে সক্ষম হয়েছে[1]।
পরিশেষে SafetyBench-এর প্রতিটি প্রশ্ন দ্বিভাষিকভাবে উপস্থাপিত হয়েছে — চীনা ও ইংরেজিতে[1]। বিষয়বস্তুর সমতুল্যতা নিশ্চিত করতে লেখকরা Baidu-এর বাণিজ্যিক machine translation API ব্যবহার করে সংগ্রহ করা সমস্ত ইংরেজি প্রশ্ন চীনা ভাষায় এবং বিপরীতভাবে অনুবাদ করেছেন[1]। এই অনুবাদের ব্যবহার এই কারণে ঘটেছিল যে কিছু উচ্চ-মানের BYM (যেমন ChatGPT নিজেই) সম্ভাব্য বিপজ্জনক কন্টেন্ট প্রক্রিয়া করতে বা সঠিকভাবে অনুবাদ করতে অস্বীকার করত, কখনো কখনো অনুবাদের সময় প্রকাশভঙ্গি নরম করে দিত[1]। স্বয়ংক্রিয় অনুবাদগুলি পরে ম্যানুয়ালি পর্যালোচনা ও সংশোধন করা হয়েছে, যাতে সম্ভাব্য অসংগতি বা সাংস্কৃতিক সূক্ষ্মতা দূর করা যায়[1]। সামগ্রিকভাবে সমস্ত প্রশ্ন মানবিক গুণমান যাচাই পর্যায় অতিক্রম করেছে[1], যা উভয় ভাষায় প্রকাশভঙ্গির সঠিকতা ও প্রত্যাশিত উত্তরের সামঞ্জস্য নিশ্চিত করতে উদ্দেশ্যমূলক[1]।
চূড়ান্ত dataset-এ উৎসের বিতরণ মোটামুটি নিম্নরূপ: প্রায় অর্ধেক প্রশ্ন উন্মুক্ত dataset থেকে নেওয়া, উল্লেখযোগ্য অংশ পরীক্ষামূলক উপকরণ থেকে এবং বাকি অংশ (বাছাইয়ের পর) মডেল দ্বারা তৈরি[1]। এই পদ্ধতি বিষয়ের বিস্তৃতি এবং যথেষ্ট গভীরতা (প্রতিটি বিভাগে অনেক উদাহরণ) উভয়ই নিশ্চিত করেছে।
পরীক্ষা পদ্ধতি ও ফলাফল
SafetyBench সেট প্রস্তুত করার পর লেখকরা তাদের নিরাপত্তা সম্পর্কিত বোঝাপড়ার স্তর নির্ধারণ করতে আধুনিক ভাষা মডেলগুলির ব্যাপক পরীক্ষা পরিচালনা করেছেন। মডেলের মূল্যায়ন স্বয়ংক্রিয়ভাবে পরিচালিত হয়[1]: প্রতিটি মডেলকে পর্যায়ক্রমে সমস্ত প্রশ্ন (সংশ্লিষ্ট ভাষায়) জিজ্ঞাসা করা হয় এবং সঠিক উত্তরের হার (অর্থাৎ মডেলের বেছে নেওয়া বিকল্প সঠিক উত্তরের সাথে মিলে যাওয়ার শতাংশ) নথিভুক্ত করা হয়[1]। এই শতাংশ একটি সূচক হিসেবে কাজ করে যে মডেলটি নিরাপত্তা সমস্যাগুলি কতটা ভালো "বোঝে" এবং নিরাপত্তার দৃষ্টিকোণ থেকে সঠিক উত্তর দেয়[1]।
ডেভেলপারদের পরিচালিত পরীক্ষায় উভয় ভাষায় বিভিন্ন উৎসের (উন্মুক্ত মডেল এবং মালিকানাধীন API পরিষেবা উভয়) ২৫টি জনপ্রিয় BYM অংশগ্রহণ করেছিল[1]। পরীক্ষা দুটি মোডে সম্পাদিত হয়েছিল: zero-shot (মডেলগুলি কোনো উদাহরণ ছাড়াই প্রশ্নের উত্তর দেয়) এবং few-shot (মডেলগুলিকে প্রথমে প্রেক্ষাপট নির্ধারণ করতে সঠিক উত্তর সহ বেশ কয়েকটি নমুনা প্রশ্ন দেখানো হয়)[1]। এই প্রোটোকল মডেলের মৌলিক ক্ষমতা এবং শিক্ষামূলক ইঙ্গিত পাওয়ার সময় উত্তর উন্নত করার ক্ষমতা উভয়ই মূল্যায়ন করার সুযোগ দেয়।
পরীক্ষার মূল উপসংহার হলো — আধুনিক মডেলগুলি নিরাপত্তা জ্ঞানের স্তরে ব্যাপকভাবে ভিন্ন, এবং উপলব্ধ BYM-গুলির মধ্যে কোনোটিই এখনো সমস্ত বিভাগে নিখুঁত নয়[1]। ফলাফলে শীর্ষস্থানীয় মডেল হলো GPT-4 (OpenAI): এটি সর্বোচ্চ গড় নির্ভুলতা দেখিয়েছে এবং অনেক বিভাগে অন্য সমস্ত মডেলকে উল্লেখযোগ্যভাবে ছাড়িয়ে গেছে[1]। zero-shot মোডে GPT-4 নিকটতম প্রতিযোগী (GPT-3.5-turbo মডেল)-কে সামগ্রিক নির্ভুলতায় প্রায় ১০ শতাংশ পয়েন্ট ব্যবধানে ছাড়িয়ে গেছে[1]। নির্দিষ্ট ক্ষেত্রে ব্যবধান বিশেষভাবে বড়, উদাহরণস্বরূপ শারীরিক নিরাপত্তা ও নৈতিক দ্বন্দ্বের প্রশ্নে GPT-4 প্রতিযোগীদের তুলনায় উল্লেখযোগ্যভাবে বেশি সঠিক উত্তর দিয়েছে[1]।
একই সময়ে GPT-4-এও দুর্বলতা চিহ্নিত করা হয়েছে। \"পক্ষপাত ও বৈষম্য\" (Unfairness and Bias) বিভাগে এই মডেলটি অন্যান্য বিভাগে তার নিজস্ব ফলাফলের তুলনায় তুলনামূলকভাবে দুর্বল পারফরম্যান্স দেখিয়েছে[1]। উত্তর বিশ্লেষণ দেখিয়েছে যে GPT-4 কখনো কখনো বৈষম্য সম্পর্কিত নিরপেক্ষ বক্তব্যকে ভুলভাবে পক্ষপাতের প্রকাশ হিসেবে চিহ্নিত করে বা নির্দিষ্ট প্রকাশভঙ্গি ও ঘটনায় বিভ্রান্ত হয়[1]। এই ত্রুটিগুলি জোর দিয়ে বলে যে এমনকি সবচেয়ে উন্নত মডেলও সাংস্কৃতিক বা ভাষাগত সূক্ষ্মতা অবমূল্যায়ন করতে পারে, যা কোনো বক্তব্যের নৈতিকতা মূল্যায়নকে প্রভাবিত করে[1]।
অন্যান্য মডেলগুলি GPT-4 থেকে উল্লেখযোগ্যভাবে পিছিয়ে রয়েছে[1]। গড়ে বেশিরভাগ উন্মুক্ত BYM (LLaMA-এর বিভিন্ন সংস্করণ, Falcon, চীনা দেশীয় মডেল ইত্যাদি সহ) উল্লেখযোগ্যভাবে কম নির্ভুলতা দেখিয়েছে, প্রায়ই ৭০-৮০% সঠিক উত্তর অতিক্রম করতে পারছে না[1]। তাদের অনেকেই বিশেষ কিছু বিভাগে বিশেষভাবে দুর্বল: উদাহরণস্বরূপ, কিছু মডেল সামাজিক পক্ষপাত বা সূক্ষ্ম নৈতিক প্রশ্ন সম্পর্কিত বিভাগে ৭০%-এর কম স্কোর পেয়েছে[1]। সামগ্রিকভাবে GPT-4 ছাড়া কোনো মডেলই সামগ্রিক নিরাপত্তা সূচকে শর্তসাপেক্ষ ৮০% সীমা অতিক্রম করতে পারেনি, যা তাদের নিরাপদ আচরণের আরও উন্নতির জন্য বিশাল সুযোগের কথা বলে[1]। GPT-4 এবং উন্মুক্ত কোড মডেলগুলির মধ্যে এই পার্থক্য বন্ধ মডেলগুলিতে বৃহত্তর প্রশিক্ষণ ও লক্ষ্যভিত্তিক alignment-সেটিংয়ের প্রভাব নির্দেশ করে।
আকর্ষণীয়ভাবে, কিছু সিস্টেমের কার্যক্ষমতা ভাষা-নির্ভর হয়ে উঠেছিল[1]। চীনে তৈরি মডেলগুলি (যেমন Baidu Ernie, Alibaba Tongyi ইত্যাদি) সাধারণত ইংরেজি সংস্করণের চেয়ে চীনা পরীক্ষায় ভালো উত্তর দিয়েছে[1]। বিপরীতে, OpenAI-এর GPT মডেলগুলির পরিবার আরও সুষম ফলাফল দেখিয়েছে[1]। এটি সংশ্লিষ্ট ভাষার ডেটায় প্রশিক্ষণের পরিমাণ ও গুণমানের পার্থক্য এবং কিছু আঞ্চলিক মডেলে অন্তর্নির্মিত ফিল্টার বা সেন্সরশিপ প্রক্রিয়ার উপস্থিতি প্রতিফলিত করতে পারে।
few-shot উদাহরণ যোগ করার সময় (পরীক্ষার আগে কিছু নমুনা Q&A) বিভিন্নমুখী প্রভাব পরিলক্ষিত হয়েছিল[1]। কিছু মডেল ইঙ্গিতের সাহায্যে নির্ভুলতা উল্লেখযোগ্যভাবে উন্নত করতে সক্ষম হয়েছে: যেমন text-davinci-003 (GPT-3) বা চীনা InternLM-এর মতো আগের প্রজন্মের বৃহৎ ভাষা মডেলগুলি five-shot মোডে মানের উল্লেখযোগ্য উন্নতি পেয়েছে[1]। তবে কিছু মডেলের ক্ষেত্রে অতিরিক্ত প্রেক্ষাপট প্রায় কোনো উন্নতি করেনি, এবং কিছু ক্ষেত্রে নির্ভুলতা হ্রাসও পেয়েছে[1]। বিশেষত, GPT-3.5-এর জন্য লেখকরা few-shot মোডে একটি ছোট \"নেতিবাচক প্রবৃদ্ধি\" নথিভুক্ত করেছেন[1], যা তারা \"alignment tax\" ঘটনার সাথে যুক্ত করেছেন[1]। তবুও গড়ে উদাহরণ প্রদান করা উত্তরগুলিকে আরও স্থিতিশীল করে তুলেছে এবং মডেলটি একটি স্পষ্ট উত্তর দিতে অস্বীকার করার ঘটনার হার কমিয়েছে[1]।
আলাদাভাবে গবেষকরা চীনা ভাষা সম্পর্কিত প্রশ্নের ফিল্টার করা উপসেটে মডেলের কার্যক্ষমতা মূল্যায়ন করেছেন[1]। কারণ হলো কিছু বড় চীনা মডেলের API স্বয়ংক্রিয়ভাবে নির্দিষ্ট \"সংবেদনশীল\" শব্দযুক্ত অনুরোধ প্রত্যাখ্যান করে[1]। তাই ট্রিগার শব্দ ছাড়া ২,১০০টি প্রশ্নের একটি সংক্ষিপ্ত নমুনা তৈরি করা হয়েছিল এবং এতে পাঁচ-ধাপ মোডে কিছু মডেল তুলনা করা হয়েছিল[1]। ফলাফল দেখিয়েছে যে এই সহজতর সংস্করণে GPT-4 এবং সেরা স্থানীয় মডেলের মধ্যে ব্যবধান কমছে: চীনা মডেল ChatGLM2 GPT-4 থেকে মাত্র ~৩% কম স্কোর পেয়েছে, সামগ্রিক স্কোরে প্রায় সমকক্ষ হয়ে উঠেছে[1]। এছাড়া Baidu-এর Ernie Bot বেশিরভাগ বিভাগে (পক্ষপাত বিভাগ ছাড়া) আত্মবিশ্বাসীভাবে পারফর্ম করেছে এবং শীর্ষ স্থানীয়দের কাছাকাছি এসেছে[1]। এই তথ্যগুলি বলে যে কঠোর ফিল্টারিং নিয়ন্ত্রণে (সবচেয়ে বিপজ্জনক অনুরোধগুলি বাদ দিয়ে) কিছু জাতীয় মডেল নিরাপদ আচরণের দিক থেকে বিশ্বনেতাদের সাথে প্রতিযোগিতা করতে সক্ষম।
Benchmark-এর গুরুত্ব ও ডেভেলপারদের উপসংহার
SafetyBench বৃহৎ ভাষা মডেলগুলির নিরাপত্তা পদ্ধতিগতভাবে পরিমাপ ও উন্নত করার দিকে একটি গুরুত্বপূর্ণ পদক্ষেপ[1]। সরাসরি মিথস্ক্রিয়ার পরিস্থিতির বিপরীতে (যেখানে ব্যবহারকারীরা নির্দেশনা বা উসকানি দিয়ে মডেলকে \"হ্যাক\" করার চেষ্টা করতে পারে), এই benchmark AI-এর নিরাপদ ও অনিরাপদ কন্টেন্ট সঠিকভাবে বোঝার ও পার্থক্য করার ক্ষমতার উপর মনোযোগ দেয়[1]। লেখকরা জোর দেন যে এই বোঝাপড়া একটি প্রয়োজনীয় ভিত্তি যা ছাড়া মডেল মুক্ত সংলাপে নিরাপদ উত্তর তৈরি করতে পারবে না[1]। বিপরীতভাবে, নৈতিক নিয়ম, আচরণবিধি, বিষাক্ততার লক্ষণ ইত্যাদির গভীর আত্মীকরণ মডেলটিকে বিপজ্জনক বক্তব্য ও সিদ্ধান্ত এড়াতে কনফিগার করা সহজ করে তোলে[1]। এভাবে SafetyBench-এ উচ্চ স্কোর নিরাপদ অপারেশনের জন্য মডেলের প্রস্তুতির সূচক হিসেবে বিবেচনা করা যেতে পারে[1], এবং নির্দিষ্ট বিভাগে ব্যর্থতা ঝুঁকির ক্ষেত্র সংকেত করে যার জন্য আরও কাজ করার প্রয়োজন[1]।
লক্ষ্য করা গুরুত্বপূর্ণ যে SafetyBench ইচ্ছাকৃতভাবে মডেলের নির্দেশনায় আক্রমণ সম্পর্কিত কিছু দিক অন্তর্ভুক্ত করে না (যেমন jailbreak-prompt, ভূমিকা নিয়ে কারসাজি ইত্যাদি)[1]। লেখকরা ব্যাখ্যা করেন যে instruction attack ধরনের সমস্যাগুলির প্রকৃতি আলাদা, যা ব্যবহারকারীর আদেশ পালন এবং অন্তর্নির্মিত নিরাপত্তা নিয়ম মেনে চলার মধ্যে দ্বন্দ্বের সাথে সম্পর্কিত[1]। এই দিকগুলি অন্য পদ্ধতিতে সমাধান করা হয় এবং মডেলের বোঝাপড়ার বাইরে যায়[1]। তাই SafetyBench বিশেষভাবে নিরাপদ আচরণ সম্পর্কে মডেলের জ্ঞানের বিষয়বস্তু স্তরে মনোযোগ দেয়। তবুও benchmark-এ সাতটি মূল বিভাগের সমন্বিত কভারেজ এখনই মডেলের দুর্বলতা চিহ্নিত করা সম্ভব করে: উদাহরণস্বরূপ, জানা যায় যে GPT-4 পক্ষপাত প্রশ্নে তুলনামূলকভাবে দুর্বল ফলাফল দেখায়, এবং কিছু উন্মুক্ত মডেল নৈতিকতা বা আইন সম্পর্কিত বিভাগে অনেক পিছিয়ে[1]। এই তথ্য ডেভেলপারদের সুনির্দিষ্ট নির্দেশনা দেয় যে পরবর্তী fine-tuning বা উত্তর ফিল্টারিংয়ে কী নিয়ে কাজ করা প্রয়োজন।
SafetyBench benchmark সম্প্রদায়ের জন্য উন্মুক্ত[2]: এর ডেটা ও পদ্ধতিগত উপকরণ মুক্ত অ্যাক্সেসে প্রকাশিত হয়েছে[2], এবং বিশেষভাবে তৈরি একটি প্ল্যাটফর্মে বিভিন্ন মডেলের ফলাফলের একটি অনলাইন লিডারবোর্ড রক্ষণাবেক্ষণ করা হয়[2]। গবেষকরা ডেভেলপারদের এই সেটে তাদের নতুন মডেল পরীক্ষা করতে এবং ফলাফল প্রকাশ করতে আমন্ত্রণ জানাচ্ছেন, যা সিস্টেমের স্বচ্ছ তুলনা এবং AI নিরাপত্তা উন্নয়নে অগ্রগতি ট্র্যাকিংয়ে সহায়তা করবে।
পরিশেষে লেখকরা জোর দেন যে SafetyBench-এর লক্ষ্য হলো মডেলের উন্নতিকে উৎসাহিত করা[1], শুধু আরেকটি র্যাংকিং তৈরি করা নয়[1]। তারা ডেভেলপারদের কেবল মডেলকে পরীক্ষার সাথে \"মানানসই\" করার চেষ্টায় সীমাবদ্ধ না থেকে চিহ্নিত সমস্যাযুক্ত পয়েন্টগুলি পদ্ধতিগতভাবে সমাধান করার আহ্বান জানান[1]। নতুন সংস্করণের মডেলগুলি আরও বেশি ডেটায় এবং আরও জটিল alignment-কৌশলে প্রশিক্ষিত হওয়ার সাথে সাথে SafetyBench-এও তাদের স্কোর বৃদ্ধির প্রত্যাশা করা হচ্ছে[1]। ভবিষ্যতে এই benchmark ভাষা মডেলগুলির নিরাপত্তা প্রয়োজনীয়তার সম্মতি যাচাইয়ের জন্য একটি আদর্শ হাতিয়ার হয়ে উঠতে পারে, এবং এর পদ্ধতিটি দায়িত্বশীল AI-এর ক্ষেত্রে আরও উন্নত পরীক্ষার সেট তৈরির ভিত্তি হতে পারে।
তথ্যসূত্র
- SafetyBench-এর মূল প্রবন্ধ (arXiv)
- GitHub-এ SafetyBench রিপোজিটরি
- Hugging Face-এ SafetyBench dataset পৃষ্ঠা
- ACL Anthology-তে SafetyBench প্রবন্ধ
গ্রন্থপঞ্জি
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
টীকা
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 1.24 1.25 1.26 1.27 1.28 1.29 1.30 1.31 1.32 1.33 1.34 1.35 1.36 1.37 1.38 1.39 1.40 1.41 1.42 1.43 1.44 1.45 1.46 1.47 1.48 1.49 1.50 1.51 1.52 1.53 1.54 1.55 1.56 1.57 1.58 1.59 1.60 1.61 1.62 1.63 1.64 1.65 1.66 1.67 1.68 1.69 1.70 1.71 1.72 1.73 1.74 1.75 1.76 1.77 1.78 1.79 1.80 1.81 1.82 1.83 1.84 1.85 1.86 1.87 1.88 1.89 1.90 1.91 1.92 1.93 Zhang, Yuntao et al. «SafetyBench: Evaluating the Safety of Large Language Models with Multiple Choice Questions». arXiv. [১]
- ↑ 2.0 2.1 2.2 Zhang, Yuntao et al. «SafetyBench: Evaluating the Safety of Large Language Models». arXiv. [২]