---
title: "SafetyBench (BN)"
source: "https://systems-analysis.info/int/SafetyBench_(BN)"
wiki: "systems-analysis.info/int"
article: "SafetyBench_(BN)"
language: "bn"
categories:
  - "Category:Bengali"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 6547
wiki_created_at: 2026-09-07T00:06:24Z
wiki_modified_at: 2026-09-07T00:06:24Z
downloaded_at: 2026-09-07T23:14:29Z
---

# SafetyBench (BN)

**SafetyBench** — এটি **বড় ভাষা মডেলগুলির নিরাপত্তার** ব্যাপক মূল্যায়নের জন্য প্রথম **সমন্বিত benchmark** <sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। এটি সিংহুয়া বিশ্ববিদ্যালয়ের গবেষকদের একটি দল দ্বারা তৈরি করা হয়েছিল এবং ২০২৩ সালে উপস্থাপিত হয়েছিল<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>।

বৃহৎ ভাষা মডেল (BYM)-এর বিকাশের সাথে সাথে (যেমন ChatGPT-এর আবির্ভাব) এবং সেগুলির ব্যাপক ব্যবহারের ফলে এই ধরনের সিস্টেমের নিরাপত্তা সমস্যার প্রতি মনোযোগ বৃদ্ধি পেয়েছে<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। গবেষণায় দেখা গেছে যে কথোপকথন মডেলগুলি ব্যবহারকারীদের ব্যক্তিগত তথ্য ফাঁস করতে পারে বা বিষাক্ত বক্তব্য তৈরি করতে পারে<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। এভাবে, BYM-এর নিরাপত্তা মূল্যায়ন তাদের বাস্তব প্রয়োগে নির্ভরযোগ্যভাবে ব্যবহারের জন্য একটি অত্যন্ত গুরুত্বপূর্ণ কাজ হয়ে উঠেছে। তবে সম্প্রতি পর্যন্ত মডেলের নিরাপত্তার সমস্ত প্রধান দিক অন্তর্ভুক্ত করে এমন কোনো সমন্বিত benchmark (পরীক্ষার সেট) ছিল না; বিদ্যমান dataset-গুলি কেবল কিছু নির্দিষ্ট দিক পরীক্ষা করত (যেমন বিষাক্ততা বা সামাজিক পক্ষপাত) এবং সামগ্রিক চিত্র প্রদান করত না<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। একটি সর্বাঙ্গীণ মূল্যায়ন পদ্ধতির অনুপস্থিতি দুর্বলতা চিহ্নিত করা এবং আরও নিরাপদ ভাষা মডেল তৈরি করা উভয়কেই কঠিন করে তুলেছিল<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। SafetyBench এই শূন্যস্থান পূরণ করতে তৈরি করা হয়েছিল<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>।

## SafetyBench-এর বিকাশ ও বিবরণ

SafetyBench হলো **১১,৪৩৫টি multiple-choice প্রশ্নের** একটি সেট, যা AI দ্বারা তৈরি কন্টেন্ট সম্পর্কিত সাধারণ সমস্যা বা হুমকির **৭টি ভিন্ন বিভাগ** অন্তর্ভুক্ত করে<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। একটি গুরুত্বপূর্ণ বৈশিষ্ট্য হলো **দ্বিভাষিকতা**: প্রতিটি প্রশ্ন **ইংরেজি** এবং **চীনা** উভয় ভাষায় পাওয়া যায়, যা একই উপাদানে ইংরেজি এবং চীনা উভয় মডেলের মূল্যায়ন করার সুযোগ দেয়<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। মূলত SafetyBench হলো প্রথম বৃহত্তর মাপের হাতিয়ার যা স্বয়ংক্রিয়ভাবে এবং উচ্চ নির্ভুলতার সাথে নিরাপদ আচরণ ও কন্টেন্ট সম্পর্কিত প্রশ্নে মডেলের বোঝাপড়া পরীক্ষা করতে পারে<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। MMLU-এর মতো পরিচিত benchmark-এর অনুরূপ একটি সঠিক উত্তর সহ প্রশ্নের ফরম্যাট মূল্যায়নের বস্তুনিষ্ঠতা ও কার্যকারিতা নিশ্চিত করে এবং মডেলের উত্তরের শ্রমসাধ্য ম্যানুয়াল যাচাইয়ের উপর নির্ভরতা কমায়<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>।

SafetyBench-এর ডেভেলপাররা পূর্বে প্রস্তাবিত অনিরাপদ কন্টেন্ট সম্পর্কিত সাধারণ পরিস্থিতির শ্রেণীবিভাগের উপর নির্ভর করেছিলেন<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। বিশেষত, benchmark-এর বিভাগগুলি Sun এবং সহ-লেখকদের (২০২৩) কাজে বর্ণিত ৮টি পরিস্থিতির ভিত্তিতে চিহ্নিত করা হয়েছিল, তবে চীনা ও ইংরেজি প্রেক্ষাপটে উত্তরের অতুলনীয়তা এড়াতে একটি বিভাগ (রাজনৈতিকভাবে সংবেদনশীল বিষয়) বাদ দেওয়া হয়েছিল<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। এভাবে চূড়ান্ত সেটে দুটি ভাষার জন্য সাধারণ ৭টি নিরাপত্তা বিভাগ অন্তর্ভুক্ত রয়েছে।

## SafetyBench-এর নিরাপত্তা বিভাগসমূহ

SafetyBench-এর প্রতিটি পরীক্ষার প্রশ্ন সাতটি বিভাগের একটিতে পড়ে, যা সম্ভাব্য বিপজ্জনক বা অবাঞ্ছিত দিকগুলির বিস্তৃত পরিসর অন্তর্ভুক্ত করে<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। নিচে এই বিভাগগুলি এবং তাদের সংক্ষিপ্ত বিবরণ দেওয়া হলো:

- **আপত্তিকর কন্টেন্ট** (Offensiveness) – হুমকি, অপমান, রুক্ষতা, অশ্লীল ভাষা, বিদ্রূপ এবং অগ্রহণযোগ্য স্বরের অন্যান্য প্রকাশ<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। মডেলকে অবশ্যই এই ধরনের আক্রমণ সনাক্ত করতে এবং বিষাক্ত বা আক্রমণাত্মক কন্টেন্টের বিরুদ্ধে প্রতিরোধ করতে সক্ষম হতে হবে<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>।
- **পক্ষপাত ও বৈষম্য** (Unfairness and Bias) – জাতি, লিঙ্গ, ধর্ম ইত্যাদির ভিত্তিতে সামাজিক পক্ষপাত ও অন্যায়ের প্রকাশ<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। মডেলকে অবশ্যই পক্ষপাত বা বৈষম্য প্রকাশ করে এমন ভাষাগত কাঠামো সনাক্ত ও এড়িয়ে চলতে হবে<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>।
- **শারীরিক স্বাস্থ্য** (Physical Health) – পরিস্থিতি ও বক্তব্য যা মানুষের শারীরিক স্বাস্থ্যকে প্রভাবিত করতে পারে<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। মডেলকে অবশ্যই বিভিন্ন জীবনের পরিস্থিতিতে স্বাস্থ্য রক্ষার জন্য সঠিক, নিরাপদ কর্মপন্থা ও পরামর্শ জানতে হবে<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>।
- **মানসিক স্বাস্থ্য** (Mental Health) – মনস্তাত্ত্বিক সুস্থতা, আবেগ ও মানসিক স্বাস্থ্য সম্পর্কিত প্রশ্ন<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। মডেলকে অবশ্যই মানসিক স্বাস্থ্য রক্ষা ও নেতিবাচক মানসিক প্রভাব প্রতিরোধের সঠিক উপায় প্রস্তাব করতে হবে<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>।
- **বেআইনি কার্যকলাপ** (Illegal Activities) – বেআইনি কার্যকলাপ জড়িত পরিস্থিতি<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। মডেলকে অবশ্যই বৈধ ও অবৈধ আচরণের পার্থক্য করতে, আইনি নিয়মকানুন সম্পর্কে মৌলিক জ্ঞান রাখতে এবং আইন লঙ্ঘনে উসকানি না দিতে হবে<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>।
- **নৈতিকতা ও নীতিশাস্ত্র** (Ethics and Morality) – অনৈতিক বা অসদাচরণমূলক আচরণ সম্পর্কিত পরিস্থিতি, এমনকি যদি তা সরাসরি আইনের আওতায় না পড়ে<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। মডেলকে অবশ্যই উচ্চ নৈতিক মান প্রদর্শন করতে এবং অনৈতিক কাজ বা বক্তব্যের নিন্দা করতে হবে<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>।
- **গোপনীয়তা ও সম্পত্তি** (Privacy and Property) – ব্যক্তিগত তথ্য, সম্পত্তির অধিকার, আর্থিক ঝুঁকি ইত্যাদি সম্পর্কিত প্রশ্ন<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। মডেলকে অবশ্যই গোপনীয়তা ও সম্পত্তির অধিকারের নীতিগুলি সংবেদনশীলভাবে বুঝতে এবং ব্যক্তিগত তথ্যের অনিচ্ছাকৃত প্রকাশ বা সম্পত্তির ক্ষতি রোধ করতে হবে<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>।

প্রতিটি বিভাগে শত শত বা হাজার হাজার প্রশ্ন রয়েছে, যা সংশ্লিষ্ট নিয়ম ও নীতি সম্পর্কে মডেলের জ্ঞান সর্বাঙ্গীণভাবে পরীক্ষা করার সুযোগ দেয়<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>।

## তথ্য সংগ্রহ ও প্রস্তুতি

এত বৃহৎ পরীক্ষার সেট তৈরির জন্য SafetyBench-এর লেখকরা **বিভিন্ন ধরনের তথ্য উৎস** ব্যবহার করেছেন<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। গবেষণায় উল্লেখ করা হয়েছে যে প্রশ্নগুলি তিনটি প্রধান উৎস থেকে সংগ্রহ করা হয়েছিল<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>:

- **বিদ্যমান dataset**: কিছু বিভাগের জন্য (বিশেষত অপমান, পক্ষপাত, শারীরিক স্বাস্থ্য, নৈতিকতা) সর্বজনীনভাবে উপলব্ধ dataset ব্যবহার করা হয়েছিল<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। লেখকরা এই সেটগুলি থেকে মূল পাঠ্য নিয়ে সেগুলিকে বিকল্প উত্তর সহ প্রশ্নের ফরম্যাটে রূপান্তরিত করেছেন<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। উদাহরণস্বরূপ, Offensiveness বিভাগের জন্য আংশিকভাবে COLD কর্পাস (চীনা ভাষায় অপমান সনাক্তকরণের dataset) ব্যবহার করা হয়েছে<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>; ইংরেজির জন্য Jigsaw Toxic Comment প্রতিযোগিতার তথ্য ইত্যাদি ব্যবহার করা হয়েছে<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। একইভাবে, Unfairness and Bias-এর জন্য চীনা সেট (COLD, CDial-Bias) এবং ইংরেজি সম্পদ ব্যবহার করা হয়েছে<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। এই পদ্ধতিটি ইতোমধ্যে চিহ্নিত উপাদান পুনরায় প্রক্রিয়া করে চারটি বিভাগ একসাথে কভার করার সুযোগ দিয়েছে<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>।
- **পরীক্ষার প্রশ্ন**: dataset-এর পাশাপাশি, গবেষকরা নিরাপত্তা ও জীবন দক্ষতা বিষয়ক বিভিন্ন পরীক্ষামূলক উপকরণ ও প্রশ্নপত্র থেকে উপযুক্ত প্রশ্ন ম্যানুয়ালি বাছাই করেছেন<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। বিশেষত, নৈতিকতা ও আইনশাস্ত্র বিষয়ক শিক্ষামূলক পরীক্ষা থেকে প্রশ্ন নেওয়া হয়েছে (যেমন নিরাপত্তার মৌলিক বিষয়ে স্কুলের পরীক্ষা), যা বেআইনি কার্যকলাপ, নৈতিকতা ও নীতিশাস্ত্র এবং অন্যান্য সংশ্লিষ্ট বিষয়ের বিভাগের সাথে সামঞ্জস্যপূর্ণ<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। এই ধরনের প্রতিটি প্রশ্নও multiple-choice ফরম্যাটে রূপান্তরিত করা হয়েছে এবং একটি বিভাগে অর্পণ করা হয়েছে<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>।
- **নতুন প্রশ্নের তৈরি**: কিছু দিকের জন্য (যেমন গোপনীয়তা বা মানসিক স্বাস্থ্য), যেখানে উন্মুক্ত উৎসে পর্যাপ্ত বৈচিত্র্যময় তথ্য পাওয়া যায়নি, লেখকরা উচ্চ-মানের ভাষা মডেল (যেমন ChatGPT) ব্যবহার করে অতিরিক্ত প্রশ্ন তৈরি করেছেন<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। এই বিষয়গুলিতে বিভিন্ন পরিস্থিতি তৈরির জন্য prompt তৈরি করা হয়েছিল, এরপর প্রাপ্ত বিকল্পগুলি benchmark-এ অন্তর্ভুক্তির আগে সতর্কতার সাথে **ফিল্টার করা হয়েছে এবং বিশেষজ্ঞদের দ্বারা যাচাই করা হয়েছে**<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। এই নিয়ন্ত্রিত augmented পদ্ধতিটি বিভাগের কভারেজে ফাঁক পূরণ করতে সক্ষম হয়েছে<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>।

পরিশেষে SafetyBench-এর প্রতিটি প্রশ্ন **দ্বিভাষিকভাবে উপস্থাপিত** হয়েছে — চীনা ও ইংরেজিতে<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। বিষয়বস্তুর সমতুল্যতা নিশ্চিত করতে লেখকরা Baidu-এর বাণিজ্যিক machine translation API ব্যবহার করে সংগ্রহ করা সমস্ত ইংরেজি প্রশ্ন চীনা ভাষায় এবং বিপরীতভাবে অনুবাদ করেছেন<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। এই অনুবাদের ব্যবহার এই কারণে ঘটেছিল যে কিছু উচ্চ-মানের BYM (যেমন ChatGPT নিজেই) সম্ভাব্য বিপজ্জনক কন্টেন্ট প্রক্রিয়া করতে বা সঠিকভাবে অনুবাদ করতে অস্বীকার করত, কখনো কখনো অনুবাদের সময় প্রকাশভঙ্গি নরম করে দিত<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। স্বয়ংক্রিয় অনুবাদগুলি পরে ম্যানুয়ালি পর্যালোচনা ও সংশোধন করা হয়েছে, যাতে সম্ভাব্য অসংগতি বা সাংস্কৃতিক সূক্ষ্মতা দূর করা যায়<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। সামগ্রিকভাবে সমস্ত প্রশ্ন **মানবিক গুণমান যাচাই** পর্যায় অতিক্রম করেছে<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>, যা উভয় ভাষায় প্রকাশভঙ্গির সঠিকতা ও প্রত্যাশিত উত্তরের সামঞ্জস্য নিশ্চিত করতে উদ্দেশ্যমূলক<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>।

চূড়ান্ত dataset-এ উৎসের বিতরণ মোটামুটি নিম্নরূপ: প্রায় অর্ধেক প্রশ্ন উন্মুক্ত dataset থেকে নেওয়া, উল্লেখযোগ্য অংশ পরীক্ষামূলক উপকরণ থেকে এবং বাকি অংশ (বাছাইয়ের পর) মডেল দ্বারা তৈরি<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। এই পদ্ধতি বিষয়ের বিস্তৃতি এবং যথেষ্ট গভীরতা (প্রতিটি বিভাগে অনেক উদাহরণ) উভয়ই নিশ্চিত করেছে।

## পরীক্ষা পদ্ধতি ও ফলাফল

SafetyBench সেট প্রস্তুত করার পর লেখকরা তাদের নিরাপত্তা সম্পর্কিত বোঝাপড়ার স্তর নির্ধারণ করতে আধুনিক ভাষা মডেলগুলির ব্যাপক পরীক্ষা পরিচালনা করেছেন। মডেলের মূল্যায়ন **স্বয়ংক্রিয়ভাবে** পরিচালিত হয়<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>: প্রতিটি মডেলকে পর্যায়ক্রমে সমস্ত প্রশ্ন (সংশ্লিষ্ট ভাষায়) জিজ্ঞাসা করা হয় এবং সঠিক উত্তরের হার (অর্থাৎ মডেলের বেছে নেওয়া বিকল্প সঠিক উত্তরের সাথে মিলে যাওয়ার শতাংশ) নথিভুক্ত করা হয়<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। এই শতাংশ একটি সূচক হিসেবে কাজ করে যে মডেলটি নিরাপত্তা সমস্যাগুলি কতটা ভালো "বোঝে" এবং নিরাপত্তার দৃষ্টিকোণ থেকে সঠিক উত্তর দেয়<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>।

ডেভেলপারদের পরিচালিত পরীক্ষায় উভয় ভাষায় বিভিন্ন উৎসের (উন্মুক্ত মডেল এবং মালিকানাধীন API পরিষেবা উভয়) **২৫টি জনপ্রিয় BYM** অংশগ্রহণ করেছিল<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। পরীক্ষা দুটি মোডে সম্পাদিত হয়েছিল: **zero-shot** (মডেলগুলি কোনো উদাহরণ ছাড়াই প্রশ্নের উত্তর দেয়) এবং **few-shot** (মডেলগুলিকে প্রথমে প্রেক্ষাপট নির্ধারণ করতে সঠিক উত্তর সহ বেশ কয়েকটি নমুনা প্রশ্ন দেখানো হয়)<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। এই প্রোটোকল মডেলের মৌলিক ক্ষমতা এবং শিক্ষামূলক ইঙ্গিত পাওয়ার সময় উত্তর উন্নত করার ক্ষমতা উভয়ই মূল্যায়ন করার সুযোগ দেয়।

পরীক্ষার মূল উপসংহার হলো — **আধুনিক মডেলগুলি নিরাপত্তা জ্ঞানের স্তরে ব্যাপকভাবে ভিন্ন, এবং উপলব্ধ BYM-গুলির মধ্যে কোনোটিই এখনো সমস্ত বিভাগে নিখুঁত নয়**<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। ফলাফলে শীর্ষস্থানীয় মডেল হলো **GPT-4** (OpenAI): এটি সর্বোচ্চ গড় নির্ভুলতা দেখিয়েছে এবং অনেক বিভাগে অন্য সমস্ত মডেলকে উল্লেখযোগ্যভাবে ছাড়িয়ে গেছে<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। zero-shot মোডে GPT-4 নিকটতম প্রতিযোগী (GPT-3.5-turbo মডেল)-কে সামগ্রিক নির্ভুলতায় প্রায় **১০ শতাংশ পয়েন্ট** ব্যবধানে ছাড়িয়ে গেছে<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। নির্দিষ্ট ক্ষেত্রে ব্যবধান বিশেষভাবে বড়, উদাহরণস্বরূপ শারীরিক নিরাপত্তা ও নৈতিক দ্বন্দ্বের প্রশ্নে GPT-4 প্রতিযোগীদের তুলনায় উল্লেখযোগ্যভাবে বেশি সঠিক উত্তর দিয়েছে<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>।

একই সময়ে GPT-4-এও **দুর্বলতা** চিহ্নিত করা হয়েছে। \\পক্ষপাত ও বৈষম্য\\ (Unfairness and Bias) বিভাগে এই মডেলটি অন্যান্য বিভাগে তার নিজস্ব ফলাফলের তুলনায় তুলনামূলকভাবে দুর্বল পারফরম্যান্স দেখিয়েছে<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। উত্তর বিশ্লেষণ দেখিয়েছে যে GPT-4 কখনো কখনো বৈষম্য সম্পর্কিত নিরপেক্ষ বক্তব্যকে ভুলভাবে পক্ষপাতের প্রকাশ হিসেবে চিহ্নিত করে বা নির্দিষ্ট প্রকাশভঙ্গি ও ঘটনায় বিভ্রান্ত হয়<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। এই ত্রুটিগুলি জোর দিয়ে বলে যে এমনকি সবচেয়ে উন্নত মডেলও সাংস্কৃতিক বা ভাষাগত সূক্ষ্মতা অবমূল্যায়ন করতে পারে, যা কোনো বক্তব্যের নৈতিকতা মূল্যায়নকে প্রভাবিত করে<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>।

অন্যান্য মডেলগুলি GPT-4 থেকে উল্লেখযোগ্যভাবে পিছিয়ে রয়েছে<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। গড়ে বেশিরভাগ উন্মুক্ত BYM (LLaMA-এর বিভিন্ন সংস্করণ, Falcon, চীনা দেশীয় মডেল ইত্যাদি সহ) **উল্লেখযোগ্যভাবে কম নির্ভুলতা** দেখিয়েছে, প্রায়ই ৭০-৮০% সঠিক উত্তর অতিক্রম করতে পারছে না<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। তাদের অনেকেই বিশেষ কিছু বিভাগে বিশেষভাবে দুর্বল: উদাহরণস্বরূপ, কিছু মডেল সামাজিক পক্ষপাত বা সূক্ষ্ম নৈতিক প্রশ্ন সম্পর্কিত বিভাগে ৭০%-এর কম স্কোর পেয়েছে<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। সামগ্রিকভাবে GPT-4 ছাড়া কোনো মডেলই সামগ্রিক নিরাপত্তা সূচকে শর্তসাপেক্ষ ৮০% সীমা অতিক্রম করতে পারেনি, যা তাদের নিরাপদ আচরণের আরও উন্নতির জন্য বিশাল সুযোগের কথা বলে<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। GPT-4 এবং উন্মুক্ত কোড মডেলগুলির মধ্যে এই পার্থক্য বন্ধ মডেলগুলিতে বৃহত্তর প্রশিক্ষণ ও লক্ষ্যভিত্তিক alignment-সেটিংয়ের প্রভাব নির্দেশ করে।

আকর্ষণীয়ভাবে, কিছু সিস্টেমের কার্যক্ষমতা **ভাষা-নির্ভর** হয়ে উঠেছিল<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। চীনে তৈরি মডেলগুলি (যেমন Baidu Ernie, Alibaba Tongyi ইত্যাদি) সাধারণত ইংরেজি সংস্করণের চেয়ে চীনা পরীক্ষায় ভালো উত্তর দিয়েছে<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। বিপরীতে, OpenAI-এর GPT মডেলগুলির পরিবার আরও সুষম ফলাফল দেখিয়েছে<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। এটি সংশ্লিষ্ট ভাষার ডেটায় প্রশিক্ষণের পরিমাণ ও গুণমানের পার্থক্য এবং কিছু আঞ্চলিক মডেলে অন্তর্নির্মিত ফিল্টার বা সেন্সরশিপ প্রক্রিয়ার উপস্থিতি প্রতিফলিত করতে পারে।

few-shot উদাহরণ যোগ করার সময় (পরীক্ষার আগে কিছু নমুনা Q&A) **বিভিন্নমুখী প্রভাব** পরিলক্ষিত হয়েছিল<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। কিছু মডেল ইঙ্গিতের সাহায্যে নির্ভুলতা উল্লেখযোগ্যভাবে উন্নত করতে সক্ষম হয়েছে: যেমন text-davinci-003 (GPT-3) বা চীনা InternLM-এর মতো আগের প্রজন্মের বৃহৎ ভাষা মডেলগুলি five-shot মোডে মানের উল্লেখযোগ্য উন্নতি পেয়েছে<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। তবে কিছু মডেলের ক্ষেত্রে অতিরিক্ত প্রেক্ষাপট প্রায় কোনো উন্নতি করেনি, এবং কিছু ক্ষেত্রে নির্ভুলতা হ্রাসও পেয়েছে<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। বিশেষত, GPT-3.5-এর জন্য লেখকরা few-shot মোডে একটি ছোট **\\নেতিবাচক প্রবৃদ্ধি\\** নথিভুক্ত করেছেন<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>, যা তারা **\\alignment tax\\** ঘটনার সাথে যুক্ত করেছেন<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। তবুও গড়ে উদাহরণ প্রদান করা উত্তরগুলিকে আরও স্থিতিশীল করে তুলেছে এবং মডেলটি একটি স্পষ্ট উত্তর দিতে অস্বীকার করার ঘটনার হার কমিয়েছে<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>।

আলাদাভাবে গবেষকরা চীনা ভাষা সম্পর্কিত প্রশ্নের **ফিল্টার করা উপসেটে** মডেলের কার্যক্ষমতা মূল্যায়ন করেছেন<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। কারণ হলো কিছু বড় চীনা মডেলের API স্বয়ংক্রিয়ভাবে নির্দিষ্ট \\সংবেদনশীল\\ শব্দযুক্ত অনুরোধ প্রত্যাখ্যান করে<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। তাই ট্রিগার শব্দ ছাড়া ২,১০০টি প্রশ্নের একটি সংক্ষিপ্ত নমুনা তৈরি করা হয়েছিল এবং এতে পাঁচ-ধাপ মোডে কিছু মডেল তুলনা করা হয়েছিল<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। ফলাফল দেখিয়েছে যে এই সহজতর সংস্করণে GPT-4 এবং সেরা স্থানীয় মডেলের মধ্যে ব্যবধান কমছে: চীনা মডেল ChatGLM2 GPT-4 থেকে মাত্র ~৩% কম স্কোর পেয়েছে, সামগ্রিক স্কোরে প্রায় সমকক্ষ হয়ে উঠেছে<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। এছাড়া Baidu-এর Ernie Bot বেশিরভাগ বিভাগে (পক্ষপাত বিভাগ ছাড়া) আত্মবিশ্বাসীভাবে পারফর্ম করেছে এবং শীর্ষ স্থানীয়দের কাছাকাছি এসেছে<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। এই তথ্যগুলি বলে যে কঠোর ফিল্টারিং নিয়ন্ত্রণে (সবচেয়ে বিপজ্জনক অনুরোধগুলি বাদ দিয়ে) কিছু জাতীয় মডেল নিরাপদ আচরণের দিক থেকে বিশ্বনেতাদের সাথে প্রতিযোগিতা করতে সক্ষম।

## Benchmark-এর গুরুত্ব ও ডেভেলপারদের উপসংহার

SafetyBench বৃহৎ ভাষা মডেলগুলির নিরাপত্তা পদ্ধতিগতভাবে পরিমাপ ও উন্নত করার দিকে একটি গুরুত্বপূর্ণ পদক্ষেপ<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। সরাসরি মিথস্ক্রিয়ার পরিস্থিতির বিপরীতে (যেখানে ব্যবহারকারীরা নির্দেশনা বা উসকানি দিয়ে মডেলকে \\হ্যাক\\ করার চেষ্টা করতে পারে), এই benchmark AI-এর **নিরাপদ ও অনিরাপদ কন্টেন্ট সঠিকভাবে বোঝার ও পার্থক্য করার ক্ষমতার** উপর মনোযোগ দেয়<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। লেখকরা জোর দেন যে এই বোঝাপড়া একটি প্রয়োজনীয় ভিত্তি যা ছাড়া মডেল মুক্ত সংলাপে নিরাপদ উত্তর তৈরি করতে পারবে না<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। বিপরীতভাবে, নৈতিক নিয়ম, আচরণবিধি, বিষাক্ততার লক্ষণ ইত্যাদির গভীর আত্মীকরণ মডেলটিকে বিপজ্জনক বক্তব্য ও সিদ্ধান্ত এড়াতে কনফিগার করা সহজ করে তোলে<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। এভাবে SafetyBench-এ উচ্চ স্কোর **নিরাপদ অপারেশনের জন্য মডেলের প্রস্তুতির সূচক** হিসেবে বিবেচনা করা যেতে পারে<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>, এবং নির্দিষ্ট বিভাগে ব্যর্থতা ঝুঁকির ক্ষেত্র সংকেত করে যার জন্য আরও কাজ করার প্রয়োজন<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>।

লক্ষ্য করা গুরুত্বপূর্ণ যে SafetyBench ইচ্ছাকৃতভাবে **মডেলের নির্দেশনায় আক্রমণ সম্পর্কিত কিছু দিক অন্তর্ভুক্ত করে না** (যেমন jailbreak-prompt, ভূমিকা নিয়ে কারসাজি ইত্যাদি)<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। লেখকরা ব্যাখ্যা করেন যে instruction attack ধরনের সমস্যাগুলির প্রকৃতি আলাদা, যা ব্যবহারকারীর আদেশ পালন এবং অন্তর্নির্মিত নিরাপত্তা নিয়ম মেনে চলার মধ্যে দ্বন্দ্বের সাথে সম্পর্কিত<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। এই দিকগুলি অন্য পদ্ধতিতে সমাধান করা হয় এবং মডেলের বোঝাপড়ার বাইরে যায়<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। তাই SafetyBench বিশেষভাবে নিরাপদ আচরণ সম্পর্কে মডেলের জ্ঞানের বিষয়বস্তু স্তরে মনোযোগ দেয়। তবুও benchmark-এ সাতটি মূল বিভাগের সমন্বিত কভারেজ এখনই মডেলের দুর্বলতা চিহ্নিত করা সম্ভব করে: উদাহরণস্বরূপ, জানা যায় যে GPT-4 পক্ষপাত প্রশ্নে তুলনামূলকভাবে দুর্বল ফলাফল দেখায়, এবং কিছু উন্মুক্ত মডেল নৈতিকতা বা আইন সম্পর্কিত বিভাগে অনেক পিছিয়ে<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। এই তথ্য ডেভেলপারদের সুনির্দিষ্ট নির্দেশনা দেয় যে পরবর্তী fine-tuning বা উত্তর ফিল্টারিংয়ে কী নিয়ে কাজ করা প্রয়োজন।

SafetyBench benchmark **সম্প্রদায়ের জন্য উন্মুক্ত**<sup>[\[2\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-abs-2)</sup>: এর ডেটা ও পদ্ধতিগত উপকরণ মুক্ত অ্যাক্সেসে প্রকাশিত হয়েছে<sup>[\[2\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-abs-2)</sup>, এবং বিশেষভাবে তৈরি একটি প্ল্যাটফর্মে বিভিন্ন মডেলের ফলাফলের একটি **অনলাইন লিডারবোর্ড** রক্ষণাবেক্ষণ করা হয়<sup>[\[2\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-abs-2)</sup>। গবেষকরা ডেভেলপারদের এই সেটে তাদের নতুন মডেল পরীক্ষা করতে এবং ফলাফল প্রকাশ করতে আমন্ত্রণ জানাচ্ছেন, যা সিস্টেমের স্বচ্ছ তুলনা এবং AI নিরাপত্তা উন্নয়নে অগ্রগতি ট্র্যাকিংয়ে সহায়তা করবে।

পরিশেষে লেখকরা জোর দেন যে SafetyBench-এর লক্ষ্য হলো **মডেলের উন্নতিকে উৎসাহিত করা**<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>, শুধু আরেকটি র‍্যাংকিং তৈরি করা নয়<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। তারা ডেভেলপারদের কেবল মডেলকে পরীক্ষার সাথে \\মানানসই\\ করার চেষ্টায় সীমাবদ্ধ না থেকে চিহ্নিত সমস্যাযুক্ত পয়েন্টগুলি পদ্ধতিগতভাবে সমাধান করার আহ্বান জানান<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। নতুন সংস্করণের মডেলগুলি আরও বেশি ডেটায় এবং আরও জটিল alignment-কৌশলে প্রশিক্ষিত হওয়ার সাথে সাথে SafetyBench-এও তাদের স্কোর বৃদ্ধির প্রত্যাশা করা হচ্ছে<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(BN)#cite_note-arxiv-main-v2-1)</sup>। ভবিষ্যতে এই benchmark ভাষা মডেলগুলির নিরাপত্তা প্রয়োজনীয়তার সম্মতি যাচাইয়ের জন্য একটি আদর্শ হাতিয়ার হয়ে উঠতে পারে, এবং এর পদ্ধতিটি দায়িত্বশীল AI-এর ক্ষেত্রে আরও উন্নত পরীক্ষার সেট তৈরির ভিত্তি হতে পারে।

## তথ্যসূত্র

- SafetyBench-এর মূল প্রবন্ধ (arXiv)
- GitHub-এ SafetyBench রিপোজিটরি
- Hugging Face-এ SafetyBench dataset পৃষ্ঠা
- ACL Anthology-তে SafetyBench প্রবন্ধ

## গ্রন্থপঞ্জি

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## টীকা

1.  <span id="cite_note-arxiv-main-v2-1">↑ <sup>[1.00](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-11)</sup> <sup>[1.12](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-12)</sup> <sup>[1.13](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-13)</sup> <sup>[1.14](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-14)</sup> <sup>[1.15](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-15)</sup> <sup>[1.16](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-16)</sup> <sup>[1.17](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-17)</sup> <sup>[1.18](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-18)</sup> <sup>[1.19](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-19)</sup> <sup>[1.20](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-20)</sup> <sup>[1.21](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-21)</sup> <sup>[1.22](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-22)</sup> <sup>[1.23](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-23)</sup> <sup>[1.24](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-24)</sup> <sup>[1.25](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-25)</sup> <sup>[1.26](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-26)</sup> <sup>[1.27](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-27)</sup> <sup>[1.28](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-28)</sup> <sup>[1.29](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-29)</sup> <sup>[1.30](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-30)</sup> <sup>[1.31](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-31)</sup> <sup>[1.32](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-32)</sup> <sup>[1.33](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-33)</sup> <sup>[1.34](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-34)</sup> <sup>[1.35](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-35)</sup> <sup>[1.36](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-36)</sup> <sup>[1.37](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-37)</sup> <sup>[1.38](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-38)</sup> <sup>[1.39](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-39)</sup> <sup>[1.40](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-40)</sup> <sup>[1.41](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-41)</sup> <sup>[1.42](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-42)</sup> <sup>[1.43](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-43)</sup> <sup>[1.44](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-44)</sup> <sup>[1.45](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-45)</sup> <sup>[1.46](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-46)</sup> <sup>[1.47](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-47)</sup> <sup>[1.48](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-48)</sup> <sup>[1.49](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-49)</sup> <sup>[1.50](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-50)</sup> <sup>[1.51](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-51)</sup> <sup>[1.52](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-52)</sup> <sup>[1.53](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-53)</sup> <sup>[1.54](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-54)</sup> <sup>[1.55](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-55)</sup> <sup>[1.56](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-56)</sup> <sup>[1.57](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-57)</sup> <sup>[1.58](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-58)</sup> <sup>[1.59](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-59)</sup> <sup>[1.60](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-60)</sup> <sup>[1.61](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-61)</sup> <sup>[1.62](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-62)</sup> <sup>[1.63](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-63)</sup> <sup>[1.64](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-64)</sup> <sup>[1.65](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-65)</sup> <sup>[1.66](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-66)</sup> <sup>[1.67](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-67)</sup> <sup>[1.68](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-68)</sup> <sup>[1.69](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-69)</sup> <sup>[1.70](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-70)</sup> <sup>[1.71](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-71)</sup> <sup>[1.72](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-72)</sup> <sup>[1.73](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-73)</sup> <sup>[1.74](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-74)</sup> <sup>[1.75](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-75)</sup> <sup>[1.76](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-76)</sup> <sup>[1.77](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-77)</sup> <sup>[1.78](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-78)</sup> <sup>[1.79](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-79)</sup> <sup>[1.80](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-80)</sup> <sup>[1.81](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-81)</sup> <sup>[1.82](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-82)</sup> <sup>[1.83](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-83)</sup> <sup>[1.84](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-84)</sup> <sup>[1.85](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-85)</sup> <sup>[1.86](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-86)</sup> <sup>[1.87](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-87)</sup> <sup>[1.88](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-88)</sup> <sup>[1.89](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-89)</sup> <sup>[1.90](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-90)</sup> <sup>[1.91](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-91)</sup> <sup>[1.92](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-92)</sup> <sup>[1.93](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-v2_1-93)</sup> Zhang, Yuntao et al. «SafetyBench: Evaluating the Safety of Large Language Models with Multiple Choice Questions». *arXiv*. <a href="https://ar5iv.labs.arxiv.org/html/2309.07045v2" class="external autonumber" rel="nofollow">[১]</a></span>
2.  <span id="cite_note-arxiv-main-abs-2">↑ <sup>[2.0](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-abs_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-abs_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/SafetyBench_(BN)#cite_ref-arxiv-main-abs_2-2)</sup> Zhang, Yuntao et al. «SafetyBench: Evaluating the Safety of Large Language Models». *arXiv*. <a href="https://arxiv.org/abs/2309.07045" class="external autonumber" rel="nofollow">[২]</a></span>
