SafetyBench (FA)
SafetyBench — نخستین benchmark جامع برای ارزیابی همهجانبه ایمنی مدلهای زبانی بزرگ [1]. این benchmark توسط گروهی از پژوهشگران دانشگاه Tsinghua توسعه یافته و در سال ۲۰۲۳ معرفی شده است[1].
با گسترش مدلهای زبانی بزرگ (مانند ظهور ChatGPT) و استقرار گسترده آنها، توجه به مسائل ایمنی این سیستمها افزایش یافته است[1]. پژوهشها نشان دادهاند که مدلهای گفتگومحور ممکن است اطلاعات خصوصی کاربران را فاش کنند یا محتوای سمّی تولید نمایند[1]. بنابراین، ارزیابی ایمنی مدلهای زبانی بزرگ به یک وظیفه حیاتی برای کاربرد مطمئن آنها در عمل تبدیل شده است. با این حال، تا همین اواخر هیچ benchmark جامعی که تمام جنبههای اصلی ایمنی مدل را پوشش دهد وجود نداشت؛ datasetهای موجود تنها جنبههای خاصی (مانند سمّیت یا تعصبات اجتماعی) را بررسی میکردند و تصویر کاملی ارائه نمیدادند[1]. نبود روش ارزیابی جامع، هم شناسایی آسیبپذیریها و هم توسعه مدلهای زبانی ایمنتر را دشوار میساخت[1]. SafetyBench برای پر کردن این شکاف ایجاد شد[1].
توسعه و توصیف SafetyBench
SafetyBench مجموعهای از ۱۱٬۴۳۵ سؤال چندگزینهای (multiple-choice) است که ۷ دسته مختلف از مشکلات یا تهدیدات رایج مرتبط با محتوای تولیدشده توسط هوش مصنوعی را پوشش میدهد[1]. ویژگی مهم این benchmark دوزبانه بودن آن است: هر سؤال به زبان انگلیسی و زبان چینی در دسترس است، که امکان ارزیابی هم مدلهای انگلیسیزبان و هم مدلهای چینی را بر اساس مواد یکسان فراهم میکند[1]. در واقع، SafetyBench نخستین ابزار مقیاسپذیری است که امکان آزمون خودکار و با دقت بالا درک مدل از مسائل رفتار و محتوای ایمن را فراهم میسازد[1]. قالب سؤالات با یک پاسخ صحیح، مشابه benchmarkهای شناختهشدهای چون MMLU، عینیت و کارایی ارزیابی را تضمین میکند و وابستگی به بررسی دستی پرزحمت پاسخهای مدل را کاهش میدهد[1].
توسعهدهندگان SafetyBench بر اساس طبقهبندی پیشنهادی سناریوهای رایج مرتبط با محتوای ناایمن بنا کردهاند[1]. بهطور خاص، دستههای benchmark بر اساس ۸ سناریوی توصیفشده در پژوهش Sun و همکاران (۲۰۲۳) تعیین شدهاند، با این تفاوت که یک دسته (موضوعات حساس سیاسی) حذف شده تا از ناسازگاری پاسخها در بستر چینی و انگلیسی جلوگیری شود[1]. بنابراین، مجموعه نهایی شامل ۷ دسته ایمنی مشترک برای هر دو زبان است.
دستههای ایمنی در SafetyBench
هر سؤال آزمایشی در SafetyBench به یکی از هفت دسته تعلق دارد که طیف گستردهای از جنبههای بالقوه خطرناک یا نامطلوب را پوشش میدهد[1]. در ادامه این دستهها و توضیح مختصر آنها آمده است:
- محتوای توهینآمیز (Offensiveness) – تهدیدات، توهینها، درشتگویی، ناسزا، کنایه و سایر تجلیات لحن نامناسب[1]. مدل باید قادر به شناسایی چنین رفتارهایی و مقاومت در برابر محتوای سمّی یا تهاجمی باشد[1].
- تعصب و تبعیض (Unfairness and Bias) – تجلیات تعصب اجتماعی و بیعدالتی بر اساس نژاد، جنسیت، مذهب و غیره[1]. مدل باید ساختارهای زبانی بیانگر تعصب یا تبعیض را شناسایی و از آنها پرهیز کند[1].
- سلامت جسمی (Physical Health) – موقعیتها و گفتههایی که ممکن است بر سلامت جسمی انسان تأثیر بگذارند[1]. مدل باید از اقدامات و توصیههای صحیح و ایمن برای حفظ سلامت در شرایط مختلف زندگی آگاهی داشته باشد[1].
- سلامت روانی (Mental Health) – مسائل مرتبط با رفاه روانی، احساسات و سلامت ذهنی[1]. مدل باید روشهای صحیح حفظ سلامت روان و پیشگیری از تأثیرات عاطفی منفی را پیشنهاد دهد[1].
- فعالیتهای غیرقانونی (Illegal Activities) – سناریوهایی که شامل اقدامات مغایر با قانون هستند[1]. مدل باید رفتار قانونی و غیرقانونی را از هم تمییز دهد، دانش پایهای از هنجارهای قانونی داشته باشد و به نقض قانون تشویق نکند[1].
- اخلاق و اخلاقیات (Ethics and Morality) – موقعیتهای مرتبط با رفتار غیراخلاقی یا نامناسب از منظر اخلاقی، حتی اگر مستقیماً زیر پوشش قانون نباشد[1]. مدل باید استانداردهای اخلاقی بالایی نشان دهد و رفتارها یا گفتههای غیراخلاقی را محکوم کند[1].
- حریم خصوصی و مالکیت (Privacy and Property) – مسائل مربوط به اطلاعات شخصی، حقوق مالکیت، ریسکهای مالی و غیره[1]. مدل باید اصول محرمانگی و حقوق مالکیت را بهخوبی درک کند و از افشای ناخواسته اطلاعات شخصی یا وارد کردن خسارت مالی جلوگیری نماید[1].
هر دسته با صدها یا هزاران سؤال نمایندگی میشود که امکان بررسی جامع آشنایی مدل با هنجارها و اصول مربوطه را فراهم میکند[1].
گردآوری و آمادهسازی دادهها
برای تشکیل چنین مجموعه آزمایشی گستردهای، نویسندگان SafetyBench از منابع داده متنوع بهره گرفتند[1]. در پژوهش ذکر شده که سؤالات از سه منبع اصلی گردآوری شدهاند[1]:
- datasetهای موجود: برای برخی دستهها (بهویژه توهین، تعصب، سلامت جسمی، اخلاق) از مجموعه دادههای در دسترس عموم استفاده شد[1]. نویسندگان متون اصلی را از این مجموعهها گرفته و آنها را به قالب سؤالات چندگزینهای تبدیل کردند[1]. برای مثال، برای دسته Offensiveness بخشی از مجموعه COLD (dataset تشخیص توهین در زبان چینی) استفاده شد[1]؛ برای زبان انگلیسی از دادههای مسابقه Jigsaw Toxic Comment و غیره بهره گرفته شد[1]. به همین ترتیب، برای Unfairness and Bias از مجموعههای چینی (COLD، CDial-Bias) و منابع انگلیسیزبان استفاده شد[1]. این رویکرد امکان پوشش چهار دسته را از طریق بازپردازش مواد از پیش برچسبگذاریشده فراهم کرد[1].
- سؤالات آزمون: علاوه بر datasetها، پژوهشگران بهصورت دستی سؤالات مناسب را از مواد آزمونی و پرسشنامههای مختلف مرتبط با ایمنی و مهارتهای زندگی انتخاب کردند[1]. بهطور خاص، سؤالاتی از آزمونهای آموزشی اخلاق و حقوق (مثلاً آزمونهای مدرسهای درباره اصول ایمنی) استخراج شد که با دستههای فعالیتهای غیرقانونی، اخلاق و مواضع مرتبط همخوانی دارند[1]. هر سؤال از این نوع نیز به قالب چندگزینهای تبدیل شده و به یکی از دستهها تخصیص یافته است[1].
- تولید سؤالات جدید: برای برخی جنبهها (مانند حریم خصوصی یا سلامت روان) که در منابع آزاد دادههای متنوع کافی وجود نداشت، نویسندگان به تولید سؤالات اضافی با کمک خود مدلهای زبانی سطح بالا (مانند ChatGPT) روی آوردند[1]. promptهایی برای خلق موقعیتهای متنوع در این موضوعات تنظیم شد و سپس گزینههای بهدستآمده پیش از درج در benchmark بهدقت فیلتر شده و توسط متخصصان بررسی گردید[1]. این رویکرد کنترلشده از نوع augmented امکان پر کردن شکافهای پوشش دستهها را فراهم کرد[1].
در نهایت، هر سؤال SafetyBench بهصورت دوزبانه — به چینی و انگلیسی — ارائه شد[1]. برای تضمین یکسانی محتوا، نویسندگان تمام سؤالات انگلیسی گردآوریشده را با API ترجمه ماشینی تجاری Baidu به چینی و بالعکس ترجمه کردند[1]. استفاده از این ترجمه بدان دلیل بود که برخی مدلهای زبانی سطح بالا (مثلاً خود ChatGPT) از پردازش یا ترجمه دقیق محتوای بالقوه خطرناک خودداری میکردند و گاهی در هنگام ترجمه صورتبندیها را تلطیف مینمودند[1]. ترجمههای خودکار سپس بهصورت دستی ویرایش و اصلاح شدند تا هرگونه نادقیقی یا ظرافتهای فرهنگی احتمالی برطرف گردد[1]. بهطور کلی، تمام سؤالات از مرحله بررسی کیفی توسط انسان گذشتند[1] که هدف آن تضمین صحت صورتبندیها و تطابق پاسخهای مورد انتظار در هر دو زبان است[1].
توزیع منابع در dataset نهایی تقریباً به این شکل است: حدود نیمی از سؤالات از datasetهای آزاد گرفته شده، سهم قابل توجهی از مواد آزمونی استخراج شده، و بقیه توسط مدلها تولید شده (پس از بررسی)[1]. این رویکرد هم گستردگی پوشش موضوعات و هم عمق کافی (نمونههای متعدد برای هر دسته) را تضمین کرد.
روششناسی آزمایشها و نتایج
پس از آمادهسازی مجموعه SafetyBench، نویسندگان آزمون گستردهای از مدلهای زبانی معاصر انجام دادند تا سطح درک آنها از مسائل ایمنی را تعیین کنند. ارزیابی مدلها بهصورت خودکار انجام میشود[1]: تمام سؤالات (به زبان مربوطه) یکبهیک به هر مدل داده میشود و درصد پاسخهای صحیح (یعنی درصد تطابق گزینه انتخابی مدل با پاسخ درست) ثبت میگردد[1]. این درصد شاخصی است که نشان میدهد مدل تا چه اندازه در مسائل ایمنی «آگاهی» دارد و پاسخهای صحیح از منظر ایمنی ارائه میدهد[1].
در آزمایشهای انجامشده توسط توسعهدهندگان، ۲۵ مدل زبانی بزرگ محبوب از منشأهای مختلف (هم مدلهای متنباز و هم سرویسهای API اختصاصی) در هر دو زبان شرکت داشتند[1]. آزمون در دو حالت انجام شد: zero-shot (مدلها بدون هیچ نمونهای به سؤالات پاسخ میدهند) و few-shot (پیش از آزمون چند نمونه سؤال با پاسخ صحیح به مدلها نشان داده میشود تا زمینه مشخص شود)[1]. این پروتکل امکان ارزیابی هم قابلیتهای پایه مدل و هم توانایی بهبود پاسخها در حضور راهنماییهای آموزشی را فراهم میکند.
نتیجه اصلی آزمونها این است که مدلهای معاصر از نظر دانش ایمنی تفاوت بسیار زیادی با هم دارند، و هیچ یک از مدلهای زبانی بزرگ موجود در تمام دستهها بینقص نیست[1]. مدل GPT-4 (OpenAI) در صدر نتایج قرار گرفت: بالاترین میانگین دقت را نشان داد و در بسیاری از دستهها با فاصله قابل توجهی از سایر مدلها پیش بود[1]. در حالت zero-shot، GPT-4 نزدیکترین رقیب خود (مدل GPT-3.5-turbo) را تقریباً ۱۰ واحد درصد در دقت کلی پشت سر گذاشت[1]. این شکاف در برخی حوزهها بهویژه چشمگیر است؛ برای مثال، GPT-4 در سؤالات ایمنی جسمی و معضلات اخلاقی-اخلاقیاتی بهطور قابل توجهی بیشتر از رقبا پاسخ صحیح میداد[1].
در عین حال، حتی GPT-4 نیز نقاط ضعف داشت. در دسته «تعصب و تبعیض» (Unfairness and Bias)، این مدل در مقایسه با نتایج خود در سایر بخشها عملکرد ضعیفتری داشت[1]. تحلیل پاسخها نشان داد که GPT-4 گاهی اوقات گفتههای بیطرفانه درباره تبعیض را بهاشتباه بهعنوان تعصب علامتگذاری میکند یا در تعابیر و رویدادهای خاص دچار سردرگمی میشود[1]. چنین خطاهایی نشان میدهد که حتی پیشرفتهترین مدل ممکن است ظرافتهای فرهنگی یا زبانی تأثیرگذار بر ارزیابی اخلاقی یک گفته را دستکم بگیرد[1].
سایر مدلها بهطور قابل توجهی از GPT-4 عقب ماندند[1]. بهطور میانگین، اکثر مدلهای زبانی بزرگ متنباز (از جمله نسخههای مختلف LLaMA، Falcon، مدلهای چینی بومی و غیره) دقت بسیار پایینتری نشان دادند و اغلب از ۷۰-۸۰ درصد پاسخ صحیح تجاوز نمیکردند[1]. بسیاری از آنها بهویژه در دستههای خاصی ضعیف عمل میکنند: برای مثال، برخی مدلها در بخشهای مرتبط با تعصبات اجتماعی یا سؤالات اخلاقی ظریف کمتر از ۷۰ درصد کسب کردند[1]. بهطور کلی، هیچ مدلی (جز GPT-4) آستانه ۸۰ درصد را در شاخص کلی ایمنی پشت سر نگذاشت، که بیانگر فضای زیادی برای بهبود رفتار ایمن آنهاست[1]. این شکاف بین GPT-4 و مدلهای متنباز نشانگر تأثیر آموزش در مقیاس بزرگتر و تنظیم دقیق alignment هدفمند در مدلهای اختصاصی است.
جالب است که عملکرد برخی سیستمها وابسته به زبان بود[1]. مدلهای ساختهشده در چین (مانند Baidu Ernie، Alibaba Tongyi و غیره) معمولاً در نسخه چینی آزمونها بهتر از نسخه انگلیسی پاسخ میدادند[1]. در مقابل، خانواده مدلهای GPT از OpenAI نتایج متوازنتری نشان داد[1]. این موضوع ممکن است نشاندهنده حجم و کیفیت متفاوت آموزش روی دادههای زبانی مربوطه، و همچنین وجود فیلترها یا مکانیزمهای سانسور داخلی در برخی مدلهای منطقهای باشد.
با افزودن نمونههای few-shot (چند Q&A نمایشی پیش از آزمون) تأثیرات متفاوتی مشاهده شد[1]. برخی مدلها توانستند دقت خود را با کمک راهنماییها بهطور قابل توجهی افزایش دهند: برای مثال، مدلهای زبانی بزرگ نسل قبل مانند text-davinci-003 (GPT-3) یا InternLM چینی در حالت five-shot بهبود محسوسی در کیفیت کسب کردند[1]. با این حال، در برخی مدلها زمینه اضافی تقریباً نتیجه را بهبود نداد، و در موارد اندکی حتی دقت را کاهش داد[1]. بهطور خاص، برای GPT-3.5 نویسندگان «افت منفی در few-shot» اندکی ثبت کردند[1] که آن را با پدیده «مالیات alignment» (alignment tax) مرتبط میدانند[1]. با این حال، بهطور میانگین ارائه نمونهها پاسخها را پایدارتر کرد و نسبت مواردی که مدل از دادن پاسخ روشن خودداری میکند را کاهش داد[1].
پژوهشگران بهطور جداگانه عملکرد مدلها را روی زیرمجموعه فیلترشده سؤالات مربوط به زبان چینی ارزیابی کردند[1]. دلیل این بود که API برخی مدلهای بزرگ چینی بهطور خودکار درخواستهایی حاوی کلمات «حساس» مشخص را رد میکنند[1]. از این رو، یک نمونه کاهشیافته از ۲۱۰۰ سؤال بدون کلمات محرک تهیه شد و تعدادی از مدلها در حالت five-shot روی آن مقایسه شدند[1]. نتایج نشان داد که در این نسخه سادهشده، شکاف بین GPT-4 و بهترین مدلهای بومی کاهش مییابد: بهطور مثال، مدل چینی ChatGLM2 تنها حدود ۳٪ کمتر از GPT-4 کسب کرد و عملاً در امتیاز کلی با آن برابری کرد[1]. همچنین Ernie Bot از Baidu در اکثر دستهها (بهجز بخش تعصب) عملکرد خوبی داشت و به رهبران نزدیک شد[1]. این دادهها نشان میدهد که تحت کنترل فیلترینگ سختگیرانه (با حذف خطرناکترین درخواستها)، برخی مدلهای بومی میتوانند از نظر رفتار ایمن با رهبران جهانی رقابت کنند.
اهمیت benchmark و نتیجهگیری توسعهدهندگان
SafetyBench گامی مهم بهسوی سنجش منظم و بهبود ایمنی مدلهای زبانی بزرگ است[1]. برخلاف سناریوهای تعامل مستقیم (که در آنها کاربران ممکن است بکوشند مدل را با دستورالعملها یا تحریکها «بشکنند»)، این benchmark بر توانایی هوش مصنوعی در درک صحیح و تشخیص محتوای ایمن از ناایمن متمرکز است[1]. نویسندگان تأکید میکنند که چنین درکی پایه و اساس ضروری است تا مدل بتواند در کل در گفتگوهای آزاد پاسخهای ایمن تولید کند[1]. برعکس، درونیسازی عمیق هنجارهای اخلاقی، قوانین آدابمعاشرت، نشانههای سمّیت و غیره، تنظیم مدل برای اجتناب از گفتهها و تصمیمات خطرناک را تسهیل میکند[1]. بنابراین، نتایج بالا در SafetyBench را میتوان بهعنوان شاخص آمادگی مدل برای بهرهبرداری ایمن در نظر گرفت[1]، در حالی که شکست در دستههای خاص از حوزههای ریسک نیازمند بهبود خبر میدهد[1].
مهم است که SafetyBench بهعمد برخی جنبههای مرتبط با حمله به دستورالعملهای خود مدل (به اصطلاح jailbreak-promptها، دستکاری نقشها و غیره) را در بر نمیگیرد[1]. نویسندگان توضیح میدهند که مسائل از نوع instruction attacks ماهیت متفاوتی دارند که با تعارض بین اجرای دستور کاربر و رعایت قوانین ایمنی داخلی مرتبط است[1]. این جنبهها با روشهای دیگری حل میشوند و از حوزه درک مدل خارجند[1]. از این رو، SafetyBench دقیقاً بر سطح محتوایی دانش مدل درباره رفتار ایمن متمرکز است. با این حال، پوشش تجمیعی هفت دسته کلیدی در benchmark هماکنون امکان شناسایی آسیبپذیریهای مدلها را فراهم میکند: برای مثال، مشخص است که GPT-4 در سؤالات مربوط به تعصب نتیجه نسبتاً ضعیفتری دارد، و برخی مدلهای متنباز در بخشهای مرتبط با اخلاق یا قانون بهشدت عقب هستند[1]. این اطلاعات به توسعهدهندگان راهنماییهای مشخصی میدهد که هنگام fine-tuning بیشتر یا فیلتر کردن پاسخها باید روی چه چیزی کار کنند.
بenchmark SafetyBench برای جامعه باز است[2]: دادهها و مواد روششناختی آن بهصورت آزاد در دسترس قرار گرفته[2]، و روی یک پلتفرم ویژه leaderboard آنلاین نتایج مدلهای مختلف نگهداری میشود[2]. پژوهشگران از توسعهدهندگان دعوت میکنند تا مدلهای جدید خود را روی این مجموعه آزمایش کرده و نتایج را منتشر کنند، که این امر مقایسه شفاف سیستمها و رصد پیشرفت در ارتقای ایمنی هوش مصنوعی را تسهیل خواهد کرد.
سرانجام، نویسندگان تأکید میکنند که هدف SafetyBench تشویق به بهبود مدلهاست[1] نه صرفاً ایجاد یک رتبهبندی دیگر[1]. آنها از توسعهدهندگان میخواهند به جای تلاش برای «تطبیق» مدل با آزمون، مشکلات شناساییشده را بهصورت منظم برطرف کنند[1]. با پیشرفت نسخههای جدید مدلها که با دادههای بیشتر و تکنیکهای پیچیدهتر alignment آموزش میبینند، انتظار میرود شاخصهای آنها در SafetyBench نیز بهبود یابد[1]. در آینده، این benchmark میتواند به ابزار استانداردی برای بررسی انطباق مدلهای زبانی با الزامات ایمنی تبدیل شود و روششناسی آن پایهای برای توسعه مجموعههای آزمایشی پیشرفتهتر در حوزه هوش مصنوعی مسئولانه باشد.
پیوندها
- مقاله اصلی SafetyBench (arXiv)
- مخزن SafetyBench در GitHub
- صفحه dataset SafetyBench در Hugging Face
- مقاله SafetyBench در ACL Anthology
منابع
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
یادداشتها
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 1.24 1.25 1.26 1.27 1.28 1.29 1.30 1.31 1.32 1.33 1.34 1.35 1.36 1.37 1.38 1.39 1.40 1.41 1.42 1.43 1.44 1.45 1.46 1.47 1.48 1.49 1.50 1.51 1.52 1.53 1.54 1.55 1.56 1.57 1.58 1.59 1.60 1.61 1.62 1.63 1.64 1.65 1.66 1.67 1.68 1.69 1.70 1.71 1.72 1.73 1.74 1.75 1.76 1.77 1.78 1.79 1.80 1.81 1.82 1.83 1.84 1.85 1.86 1.87 1.88 1.89 1.90 1.91 1.92 1.93 1.94 Zhang, Yuntao et al. «SafetyBench: Evaluating the Safety of Large Language Models with Multiple Choice Questions». arXiv. [۱]
- ↑ 2.0 2.1 2.2 2.3 Zhang, Yuntao et al. «SafetyBench: Evaluating the Safety of Large Language Models». arXiv. [۲]