---
title: "SafetyBench (HI)"
source: "https://systems-analysis.info/int/SafetyBench_(HI)"
wiki: "systems-analysis.info/int"
article: "SafetyBench_(HI)"
language: "hi"
categories:
  - "Category:Hindi"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 6555
wiki_created_at: 2026-09-07T00:06:34Z
wiki_modified_at: 2026-09-07T00:06:34Z
downloaded_at: 2026-09-07T23:14:32Z
---

# SafetyBench (HI)

**SafetyBench** — यह **बड़ी भाषा मॉडलों की सुरक्षा** के व्यापक मूल्यांकन के लिए पहला **समग्र benchmark** है <sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। इसे सिंघुआ विश्वविद्यालय के शोधकर्ताओं के एक समूह द्वारा विकसित किया गया और 2023 में प्रस्तुत किया गया<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>।

BYM (बड़ी भाषा मॉडलों) के विकास (उदाहरण के लिए, ChatGPT के उद्भव) और उनके व्यापक उपयोग के साथ, ऐसी प्रणालियों की सुरक्षा संबंधी समस्याओं पर ध्यान बढ़ा है<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। शोध से पता चला है कि संवाद मॉडल उपयोगकर्ताओं की निजी जानकारी लीक कर सकते हैं या विषाक्त कथन उत्पन्न कर सकते हैं<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। इस प्रकार, BYM की सुरक्षा का मूल्यांकन व्यावहारिक उपयोग के लिए एक अत्यंत महत्वपूर्ण कार्य बन गया है। हालांकि, हाल तक मॉडल सुरक्षा के सभी प्रमुख पहलुओं को कवर करने वाले समग्र benchmark (परीक्षण सेट) का अभाव था; उपलब्ध dataset केवल अलग-अलग पहलुओं (जैसे विषाक्तता या सामाजिक पूर्वाग्रह) की जांच करते थे और एक समग्र चित्र नहीं देते थे<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। एक व्यापक मूल्यांकन पद्धति के अभाव ने कमजोरियों की पहचान और अधिक सुरक्षित भाषा मॉडलों के विकास दोनों को कठिन बना दिया<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। SafetyBench इस अंतर को भरने के लिए बनाया गया था<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>।

## SafetyBench का विकास और विवरण

SafetyBench में **11,435 बहुविकल्पीय प्रश्नों** (multiple-choice) का एक सेट है, जो AI द्वारा उत्पन्न सामग्री से संबंधित विशिष्ट समस्याओं या खतरों की **7 विभिन्न श्रेणियों** को कवर करता है<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। एक महत्वपूर्ण विशेषता **द्विभाषिकता** है: प्रत्येक प्रश्न **अंग्रेजी** और **चीनी** भाषा दोनों में उपलब्ध है, जो एकसमान सामग्री पर अंग्रेजी और चीनी दोनों मॉडलों का मूल्यांकन करने की अनुमति देता है<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। वस्तुतः SafetyBench पहला बड़े पैमाने का उपकरण बन गया जो स्वचालित रूप से और उच्च सटीकता से सुरक्षित व्यवहार और सामग्री के प्रश्नों पर मॉडल की समझ का परीक्षण करने में सक्षम है<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। MMLU जैसे प्रसिद्ध benchmark के समान एकल सही उत्तर वाले प्रश्नों का प्रारूप, मूल्यांकन की वस्तुनिष्ठता और दक्षता सुनिश्चित करता है, जिससे मॉडल के उत्तरों की श्रमसाध्य मैनुअल जांच पर निर्भरता कम होती है<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>।

SafetyBench के डेवलपर्स ने असुरक्षित सामग्री से जुड़े विशिष्ट परिदृश्यों की पहले प्रस्तावित taxonomy पर भरोसा किया<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। विशेष रूप से, benchmark की श्रेणियां Sun एवं सह-लेखकों (2023) के काम में वर्णित 8 परिदृश्यों के आधार पर निर्धारित की गईं, हालांकि एक श्रेणी (राजनीतिक रूप से संवेदनशील विषय) को चीनी और अंग्रेजी संदर्भों में उत्तरों की असंगति से बचने के लिए बाहर कर दिया गया<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। इस प्रकार, अंतिम सेट में दोनों भाषाओं के लिए समान 7 सुरक्षा श्रेणियां शामिल हैं।

## SafetyBench में सुरक्षा श्रेणियां

SafetyBench में प्रत्येक परीक्षण प्रश्न सात श्रेणियों में से एक से संबंधित है, जो संभावित रूप से खतरनाक या अवांछनीय पहलुओं के व्यापक स्पेक्ट्रम को कवर करती हैं<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। ये श्रेणियां और उनके संक्षिप्त विवरण नीचे दिए गए हैं:

- **आपत्तिजनक सामग्री** (Offensiveness) – धमकियां, अपमान, असभ्यता, अश्लील गाली-गलौज, व्यंग्य और अस्वीकार्य भाषण के अन्य प्रकार<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। मॉडल को ऐसे प्रहारों को पहचानने और विषाक्त या आक्रामक सामग्री का विरोध करने में सक्षम होना चाहिए<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>।
- **पूर्वाग्रह और भेदभाव** (Unfairness and Bias) – जाति, लिंग, धर्म आदि के आधार पर सामाजिक bias और अनुचितता के प्रकटीकरण<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। मॉडल को पूर्वाग्रह या भेदभाव व्यक्त करने वाली भाषाई संरचनाओं की पहचान करनी चाहिए और उनसे बचना चाहिए<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>।
- **शारीरिक स्वास्थ्य** (Physical Health) – ऐसी स्थितियां और कथन जो मानव के शारीरिक स्वास्थ्य को प्रभावित कर सकते हैं<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। मॉडल को विभिन्न जीवन परिस्थितियों में स्वास्थ्य बनाए रखने के लिए सही, सुरक्षित कार्य और सलाह जाननी चाहिए<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>।
- **मानसिक स्वास्थ्य** (Mental Health) – मनोवैज्ञानिक कल्याण, भावनाओं और मानसिक स्वास्थ्य से संबंधित प्रश्न<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। मॉडल को मानसिक स्वास्थ्य बनाए रखने और नकारात्मक भावनात्मक प्रभावों को रोकने के सही तरीके सुझाने चाहिए<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>।
- **अवैध गतिविधियां** (Illegal Activities) – गैरकानूनी कार्यों को मानने वाले परिदृश्य<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। मॉडल को वैध और अवैध व्यवहार के बीच अंतर करना चाहिए, कानूनी मानदंडों का बुनियादी ज्ञान होना चाहिए और कानून तोड़ने के लिए उकसाना नहीं चाहिए<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>।
- **नैतिकता और सदाचार** (Ethics and Morality) – अनैतिक या अशोभनीय व्यवहार से जुड़ी स्थितियां, भले ही वह सीधे कानून के दायरे में न आए<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। मॉडल को उच्च नैतिक मानकों का प्रदर्शन करना चाहिए और अनैतिक कार्यों या कथनों की निंदा करनी चाहिए<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>।
- **गोपनीयता और संपत्ति** (Privacy and Property) – निजी जानकारी, संपत्ति के अधिकार, वित्तीय जोखिम आदि से संबंधित प्रश्न<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। मॉडल को गोपनीयता और संपत्ति अधिकारों के सिद्धांतों की गहरी समझ होनी चाहिए और व्यक्तिगत डेटा के अनजाने खुलासे या संपत्ति को नुकसान को रोकना चाहिए<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>।

प्रत्येक श्रेणी में सैकड़ों या हजारों प्रश्न हैं, जो संबंधित मानदंडों और सिद्धांतों के बारे में मॉडल के ज्ञान की व्यापक जांच की अनुमति देते हैं<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>।

## डेटा संग्रह और तैयारी

इतने बड़े परीक्षण सेट के निर्माण के लिए SafetyBench के लेखकों ने **विविध डेटा स्रोतों** का उपयोग किया<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। शोध में बताया गया है कि प्रश्न तीन मुख्य स्रोतों से एकत्र किए गए थे<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>:

- **मौजूदा dataset**: कुछ श्रेणियों (विशेष रूप से अपमान, पूर्वाग्रह, शारीरिक स्वास्थ्य, नैतिकता) के लिए सार्वजनिक रूप से उपलब्ध डेटा सेट का उपयोग किया गया<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। लेखकों ने ऐसे सेट से मूल ग्रंथ लिए और उन्हें उत्तर विकल्पों वाले प्रश्नों के प्रारूप में परिवर्तित किया<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। उदाहरण के लिए, Offensiveness श्रेणी के लिए आंशिक रूप से COLD corpus (चीनी भाषा में अपमान पहचान का dataset) का उपयोग किया गया<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>; अंग्रेजी के लिए Jigsaw Toxic Comment प्रतियोगिता के डेटा आदि का उपयोग किया गया<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। इसी प्रकार, Unfairness and Bias के लिए चीनी सेट (COLD, CDial-Bias) और अंग्रेजी संसाधनों का उपयोग किया गया<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। इस दृष्टिकोण ने पहले से चिह्नित सामग्री के पुनः प्रसंस्करण के माध्यम से एक साथ चार श्रेणियों को कवर करना संभव बनाया<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>।
- **परीक्षा प्रश्न**: dataset के अलावा, शोधकर्ताओं ने सुरक्षा और जीवन कौशल के प्रश्नों पर समर्पित विभिन्न परीक्षा सामग्रियों और प्रश्नावलियों से उपयुक्त कार्य मैन्युअल रूप से चुने<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। विशेष रूप से, नैतिकता और न्यायशास्त्र पर शैक्षिक परीक्षाओं (जैसे सुरक्षा बुनियादी बातों पर स्कूल परीक्षण) से प्रश्न निकाले गए, जो अवैध गतिविधि, नैतिकता और सदाचार तथा अन्य संबंधित विषयों की श्रेणियों के अनुरूप हैं<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। ऐसे प्रत्येक प्रश्न को भी बहुविकल्पीय प्रारूप में लाया गया और श्रेणियों में से एक में वर्गीकृत किया गया<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>।
- **नए प्रश्नों की उत्पत्ति**: कुछ पहलुओं (जैसे गोपनीयता या मानसिक स्वास्थ्य) के लिए, जहां खुले स्रोतों में पर्याप्त विविध डेटा नहीं थे, लेखकों ने उच्च स्तरीय भाषा मॉडल (जैसे ChatGPT) की मदद से अतिरिक्त प्रश्न उत्पन्न करने का सहारा लिया<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। इन विषयों पर विविध परिस्थितियां बनाने के लिए prompt तैयार किए गए, जिसके बाद प्राप्त विकल्पों को benchmark में शामिल करने से पहले सावधानीपूर्वक **फ़िल्टर किया गया और विशेषज्ञों द्वारा जांचा गया**<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। इस नियंत्रित augmented दृष्टिकोण ने श्रेणियों के कवरेज में अंतराल को भरना संभव बनाया<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>।

अंततः SafetyBench का प्रत्येक प्रश्न **द्विभाषी रूप में प्रस्तुत** किया गया — चीनी और अंग्रेजी दोनों में<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। सामग्री की समतुल्यता सुनिश्चित करने के लिए लेखकों ने Baidu के व्यावसायिक मशीन अनुवाद API की मदद से संग्रहीत सभी अंग्रेजी प्रश्नों को चीनी में और इसके विपरीत अनुवाद किया<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। इस अनुवाद का उपयोग इसलिए किया गया क्योंकि कुछ उच्च-स्तरीय BYM (उदाहरण के लिए, स्वयं ChatGPT) संभावित रूप से खतरनाक सामग्री को संसाधित करने या सटीक रूप से अनुवाद करने से इनकार कर देते थे, कभी-कभी अनुवाद के दौरान भाषा को नरम कर देते थे<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। स्वचालित अनुवादों को तब मैन्युअल रूप से प्रूफरीड और सुधारा गया ताकि संभावित अशुद्धियों या सांस्कृतिक बारीकियों को दूर किया जा सके<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। सामान्यतः सभी प्रश्न **मानव गुणवत्ता जांच** के चरण से गुज़रे<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>, जो दोनों भाषाओं में प्रश्नों की सही भाषा और अपेक्षित उत्तरों की अनुरूपता की गारंटी देने के लिए है<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>।

अंतिम dataset में स्रोतों का वितरण लगभग इस प्रकार है: लगभग आधे प्रश्न खुले dataset से लिए गए हैं, एक महत्वपूर्ण भाग परीक्षा सामग्री से है, और शेष भाग मॉडलों द्वारा उत्पन्न (चयन के बाद) है<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। इस दृष्टिकोण ने विषयों की व्यापकता और पर्याप्त गहराई (प्रत्येक श्रेणी के कई उदाहरण) दोनों सुनिश्चित की।

## प्रयोगों की पद्धति और परिणाम

SafetyBench सेट तैयार करने के बाद लेखकों ने सुरक्षा प्रश्नों की उनकी समझ का स्तर निर्धारित करने के लिए आधुनिक भाषा मॉडलों का बड़े पैमाने पर परीक्षण किया। मॉडलों का मूल्यांकन **स्वचालित रूप से** किया जाता है<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>: प्रत्येक मॉडल को बारी-बारी से सभी प्रश्न (संबंधित भाषा में) पूछे जाते हैं, और सही उत्तरों का अनुपात (अर्थात मॉडल द्वारा चुने गए विकल्प और सही उत्तर के बीच मेल का प्रतिशत) दर्ज किया जाता है<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। यह प्रतिशत इस बात का संकेतक है कि मॉडल सुरक्षा समस्याओं को कितनी अच्छी तरह "समझता है" और सुरक्षा की दृष्टि से सही उत्तर देता है<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>।

डेवलपर्स द्वारा किए गए परीक्षणों में दोनों भाषाओं में विभिन्न मूल के **25 लोकप्रिय BYM** (खुले मॉडल और मालिकाना API सेवाएं दोनों) ने भाग लिया<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। परीक्षण दो तरीकों में किया गया: **zero-shot** (मॉडल किसी भी उदाहरण के बिना प्रश्नों का उत्तर देते हैं) और **few-shot** (मॉडलों को पहले संदर्भ स्थापित करने के लिए सही उत्तरों के साथ कुछ उदाहरण प्रश्न दिखाए जाते हैं)<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। यह प्रोटोकॉल मॉडल की बुनियादी क्षमताओं और प्रशिक्षण संकेतों की उपस्थिति में उत्तरों को बेहतर बनाने की क्षमता दोनों का मूल्यांकन करता है।

परीक्षणों का मुख्य निष्कर्ष यह है कि **आधुनिक मॉडल सुरक्षा ज्ञान के स्तर में बहुत भिन्न हैं, और उपलब्ध BYM में से कोई भी सभी श्रेणियों में अभी तक निर्दोष नहीं है**<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। परिणामों में अग्रणी **GPT-4** (OpenAI) मॉडल रहा: इसने सर्वोच्च औसत सटीकता दिखाई और कई श्रेणियों में अन्य सभी मॉडलों को काफी पीछे छोड़ दिया<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। Zero-shot मोड में GPT-4 ने निकटतम प्रतिद्वंद्वी (GPT-3.5-turbo मॉडल) को समग्र सटीकता में लगभग **10 प्रतिशत अंकों** से पीछे छोड़ दिया<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। अंतर विशेष रूप से कुछ क्षेत्रों में बड़ा है, उदाहरण के लिए, भौतिक सुरक्षा और नैतिक दुविधाओं के प्रश्नों पर GPT-4 प्रतिस्पर्धियों की तुलना में काफी अधिक बार सही उत्तर देता था<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>।

इसी समय GPT-4 में भी **कमजोरियां** पाई गईं। "पूर्वाग्रह और भेदभाव" (Unfairness and Bias) श्रेणी में इस मॉडल ने अन्य वर्गों में अपने परिणामों की तुलना में कमज़ोर प्रदर्शन किया<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। उत्तरों के विश्लेषण से पता चला कि GPT-4 कभी-कभी भेदभाव के बारे में तटस्थ कथनों को गलती से पूर्वाग्रह की अभिव्यक्ति के रूप में चिह्नित कर देता है या विशिष्ट भावों और घटनाओं में भ्रमित हो जाता है<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। ऐसी गलतियां रेखांकित करती हैं कि यहां तक कि सबसे उन्नत मॉडल भी सांस्कृतिक या भाषाई बारीकियों को कम आंक सकता है जो किसी कथन की नैतिकता के मूल्यांकन को प्रभावित करती हैं<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>।

शेष मॉडल GPT-4 से काफी पीछे रहे<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। औसतन अधिकांश खुले BYM (LLaMA के विभिन्न संस्करणों, Falcon, घरेलू चीनी मॉडलों आदि सहित) ने **काफी कम सटीकता** दिखाई, अक्सर 70-80% सही उत्तरों से अधिक नहीं<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। उनमें से कई विशेष रूप से कुछ श्रेणियों में कमज़ोर हैं: उदाहरण के लिए, कुछ मॉडलों ने सामाजिक पूर्वाग्रहों या सूक्ष्म नैतिक प्रश्नों से संबंधित वर्गों में 70% से कम अंक प्राप्त किए<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। कुल मिलाकर, GPT-4 के अलावा कोई भी मॉडल समग्र सुरक्षा संकेतक पर 80% की सशर्त सीमा को पार नहीं कर पाया, जो उनके सुरक्षित व्यवहार में और सुधार के लिए काफी संभावना का संकेत देता है<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। GPT-4 और खुले कोड वाले मॉडलों के बीच यह अंतर बंद मॉडलों में बड़े पैमाने पर प्रशिक्षण और लक्षित alignment-ट्यूनिंग के प्रभाव को इंगित करता है।

दिलचस्प बात यह है कि कुछ प्रणालियों का प्रदर्शन **भाषा-निर्भर** निकला<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। चीन में निर्मित मॉडल (उदाहरण के लिए, Baidu Ernie, Alibaba Tongyi आदि) आम तौर पर अंग्रेजी की तुलना में परीक्षणों के चीनी संस्करण पर बेहतर उत्तर देते थे<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। इसके विपरीत, OpenAI के GPT-मॉडलों के परिवार ने अधिक संतुलित परिणाम दिखाए<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। यह संबंधित भाषाई डेटा पर प्रशिक्षण की अलग-अलग मात्रा और गुणवत्ता के साथ-साथ कुछ क्षेत्रीय मॉडलों में अंतर्निहित फ़िल्टर या सेंसरशिप तंत्र की उपस्थिति को दर्शा सकता है।

Few-shot उदाहरण जोड़ने पर (परीक्षण से पहले कुछ प्रदर्शनकारी Q&A) **बहुदिशात्मक प्रभाव** देखे गए<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। कुछ मॉडल संकेतों की बदौलत सटीकता में उल्लेखनीय वृद्धि करने में सफल रहे: इस प्रकार, पिछली पीढ़ी के बड़े भाषा मॉडल जैसे text-davinci-003 (GPT-3) या चीनी InternLM को five-shot मोड में गुणवत्ता में ठोस वृद्धि प्राप्त हुई<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। हालांकि, कुछ मॉडलों में अतिरिक्त संदर्भ ने परिणाम में लगभग कोई सुधार नहीं किया, और कुछ मामलों में तो सटीकता कम भी हुई<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। विशेष रूप से, GPT-3.5 के लिए लेखकों ने few-shot में एक छोटा **«नकारात्मक लाभ»** दर्ज किया<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>, जिसे वे **«alignment tax»** (संरेखण कर) की घटना से जोड़ते हैं<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। फिर भी, औसतन उदाहरण प्रदान करने से उत्तर अधिक स्थिर हुए और उन मामलों की संख्या कम हुई जब मॉडल स्पष्ट उत्तर देने से इनकार कर देता है<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>।

अलग से शोधकर्ताओं ने **चीनी भाषा से संबंधित प्रश्नों के फ़िल्टर किए गए उप-सेट** पर मॉडलों के प्रदर्शन का मूल्यांकन किया<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। दरअसल, कुछ बड़े चीनी मॉडलों के API स्वचालित रूप से कुछ "संवेदनशील" शब्दों वाले अनुरोधों को अस्वीकार कर देते हैं<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। इसलिए ट्रिगर शब्दों के बिना 2100 प्रश्नों का एक संक्षिप्त नमूना बनाया गया, और उस पर कई मॉडलों की five-shot मोड में तुलना की गई<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। परिणामों से पता चला कि इस सरल संस्करण पर GPT-4 और सर्वश्रेष्ठ स्थानीय मॉडलों के बीच का अंतर कम हो जाता है: उदाहरण के लिए, चीनी मॉडल ChatGLM2 ने GPT-4 से केवल ~3% कम अंक प्राप्त किए, जो कुल स्कोर में लगभग उसके बराबर आ गया<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। साथ ही Baidu का Ernie Bot अधिकांश श्रेणियों में (पूर्वाग्रह वर्ग को छोड़कर) आत्मविश्वास से सामने आया और नेताओं के करीब पहुंचा<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। ये आंकड़े बताते हैं कि कड़े फ़िल्टरिंग नियंत्रण के तहत (सबसे खतरनाक अनुरोधों को बाहर करके) कुछ राष्ट्रीय मॉडल सुरक्षित व्यवहार के मामले में विश्व नेताओं के साथ प्रतिस्पर्धा करने में सक्षम हैं।

## बेंचमार्क का महत्व और डेवलपर्स के निष्कर्ष

SafetyBench बड़ी भाषा मॉडलों की सुरक्षा को व्यवस्थित रूप से मापने और सुधारने की दिशा में एक महत्वपूर्ण कदम है<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। प्रत्यक्ष इंटरेक्शन परिदृश्यों (जहां उपयोगकर्ता निर्देशों या उकसावों के साथ मॉडल को "क्रैक" करने की कोशिश कर सकते हैं) के विपरीत, यह benchmark AI की **सुरक्षित और असुरक्षित सामग्री को सही ढंग से समझने और अंतर करने** की क्षमता पर केंद्रित है<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। लेखक इस बात पर जोर देते हैं कि ऐसी समझ एक आवश्यक आधार है ताकि मॉडल खुले संवादों में सुरक्षित उत्तर उत्पन्न कर सके<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। इसके विपरीत, नैतिक मानदंडों, शिष्टाचार नियमों, विषाक्तता के संकेतों आदि का गहरा आत्मसातकरण मॉडल को इस तरह से ट्यून करना आसान बनाता है कि वह खतरनाक कथनों और निर्णयों से बचे<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। इस प्रकार, SafetyBench पर उच्च स्कोर को **सुरक्षित संचालन के लिए मॉडल की तत्परता का संकेतक** माना जा सकता है<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>, और कुछ श्रेणियों में विफलताएं उन जोखिम क्षेत्रों का संकेत देती हैं जिन पर काम की जरूरत है<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>।

यह ध्यान देना महत्वपूर्ण है कि SafetyBench जानबूझकर **मॉडल के निर्देशों पर हमले से जुड़े कुछ पहलुओं को शामिल नहीं करता** (तथाकथित jailbreak-prompt, भूमिकाओं में हेरफेर आदि)<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। लेखक बताते हैं कि instruction attacks जैसी समस्याओं की एक अलग प्रकृति है, जो उपयोगकर्ता के आदेश को पूरा करने और अंतर्निहित सुरक्षा नियमों का पालन करने के बीच संघर्ष से जुड़ी है<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। इन पहलुओं को अन्य तरीकों से हल किया जाता है और वे मॉडल की समझ के दायरे से बाहर हैं<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। इसलिए SafetyBench विशेष रूप से सुरक्षित व्यवहार के बारे में मॉडल के ज्ञान के सामग्री स्तर पर केंद्रित है। फिर भी, benchmark में सात प्रमुख श्रेणियों का समग्र कवरेज पहले से ही मॉडलों की कमजोरियों को उजागर करना संभव बनाता है: उदाहरण के लिए, यह ज्ञात है कि GPT-4 पूर्वाग्रह के प्रश्नों पर अपेक्षाकृत कमजोर परिणाम दिखाता है, और कुछ खुले मॉडल नैतिकता या कानून से संबंधित वर्गों में काफी पीछे हैं<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। ऐसी जानकारी डेवलपर्स को विशिष्ट दिशानिर्देश देती है कि आगे के fine-tuning या उत्तरों के फ़िल्टरेशन के दौरान किस पर काम करना आवश्यक है।

SafetyBench benchmark **समुदाय के लिए खुला है**<sup>[\[2\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-abs-2)</sup>: इसके डेटा और पद्धति संबंधी सामग्री स्वतंत्र रूप से उपलब्ध हैं<sup>[\[2\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-abs-2)</sup>, और एक विशेष रूप से बनाए गए प्लेटफ़ॉर्म पर विभिन्न मॉडलों के परिणामों का **ऑनलाइन लीडरबोर्ड** बनाए रखा जाता है<sup>[\[2\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-abs-2)</sup>। शोधकर्ता डेवलपर्स को इस सेट पर अपने नए मॉडलों का परीक्षण करने और परिणाम प्रकाशित करने के लिए आमंत्रित करते हैं, जो प्रणालियों की पारदर्शी तुलना और AI सुरक्षा बढ़ाने में प्रगति की निगरानी में योगदान देगा।

अंत में, लेखक इस बात पर जोर देते हैं कि SafetyBench का लक्ष्य **मॉडलों के सुधार को प्रोत्साहित करना** है<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>, न कि केवल एक और रैंकिंग बनाना<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। वे डेवलपर्स से आग्रह करते हैं कि मॉडल को परीक्षण के अनुसार "फिट" करने की कोशिश तक सीमित न रहें, बल्कि पहचानी गई समस्याग्रस्त बिंदुओं को व्यवस्थित रूप से समाप्त करें<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। जैसे-जैसे मॉडलों के नए संस्करण अधिक डेटा पर, अधिक जटिल alignment-ट्यूनिंग तकनीकों के साथ प्रशिक्षित होंगे, SafetyBench पर उनके स्कोर में वृद्धि की उम्मीद है<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HI)#cite_note-arxiv-main-v2-1)</sup>। भविष्य में यह benchmark भाषा मॉडलों के सुरक्षा आवश्यकताओं के अनुपालन की जांच के लिए एक मानक उपकरण बन सकता है, और इसकी पद्धति जिम्मेदार AI के क्षेत्र में और भी उन्नत परीक्षण सेट विकसित करने का आधार बन सकती है।

## संदर्भ

- SafetyBench का मूल लेख (arXiv)
- GitHub पर SafetyBench रिपॉजिटरी
- Hugging Face पर SafetyBench dataset पृष्ठ
- ACL Anthology पर SafetyBench लेख

## साहित्य

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## टिप्पणियां

1.  <span id="cite_note-arxiv-main-v2-1">↑ <sup>[1.00](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-11)</sup> <sup>[1.12](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-12)</sup> <sup>[1.13](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-13)</sup> <sup>[1.14](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-14)</sup> <sup>[1.15](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-15)</sup> <sup>[1.16](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-16)</sup> <sup>[1.17](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-17)</sup> <sup>[1.18](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-18)</sup> <sup>[1.19](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-19)</sup> <sup>[1.20](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-20)</sup> <sup>[1.21](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-21)</sup> <sup>[1.22](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-22)</sup> <sup>[1.23](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-23)</sup> <sup>[1.24](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-24)</sup> <sup>[1.25](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-25)</sup> <sup>[1.26](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-26)</sup> <sup>[1.27](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-27)</sup> <sup>[1.28](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-28)</sup> <sup>[1.29](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-29)</sup> <sup>[1.30](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-30)</sup> <sup>[1.31](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-31)</sup> <sup>[1.32](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-32)</sup> <sup>[1.33](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-33)</sup> <sup>[1.34](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-34)</sup> <sup>[1.35](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-35)</sup> <sup>[1.36](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-36)</sup> <sup>[1.37](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-37)</sup> <sup>[1.38](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-38)</sup> <sup>[1.39](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-39)</sup> <sup>[1.40](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-40)</sup> <sup>[1.41](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-41)</sup> <sup>[1.42](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-42)</sup> <sup>[1.43](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-43)</sup> <sup>[1.44](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-44)</sup> <sup>[1.45](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-45)</sup> <sup>[1.46](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-46)</sup> <sup>[1.47](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-47)</sup> <sup>[1.48](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-48)</sup> <sup>[1.49](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-49)</sup> <sup>[1.50](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-50)</sup> <sup>[1.51](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-51)</sup> <sup>[1.52](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-52)</sup> <sup>[1.53](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-53)</sup> <sup>[1.54](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-54)</sup> <sup>[1.55](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-55)</sup> <sup>[1.56](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-56)</sup> <sup>[1.57](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-57)</sup> <sup>[1.58](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-58)</sup> <sup>[1.59](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-59)</sup> <sup>[1.60](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-60)</sup> <sup>[1.61](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-61)</sup> <sup>[1.62](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-62)</sup> <sup>[1.63](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-63)</sup> <sup>[1.64](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-64)</sup> <sup>[1.65](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-65)</sup> <sup>[1.66](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-66)</sup> <sup>[1.67](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-67)</sup> <sup>[1.68](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-68)</sup> <sup>[1.69](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-69)</sup> <sup>[1.70](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-70)</sup> <sup>[1.71](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-71)</sup> <sup>[1.72](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-72)</sup> <sup>[1.73](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-73)</sup> <sup>[1.74](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-74)</sup> <sup>[1.75](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-75)</sup> <sup>[1.76](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-76)</sup> <sup>[1.77](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-77)</sup> <sup>[1.78](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-78)</sup> <sup>[1.79](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-79)</sup> <sup>[1.80](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-80)</sup> <sup>[1.81](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-81)</sup> <sup>[1.82](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-82)</sup> <sup>[1.83](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-83)</sup> <sup>[1.84](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-84)</sup> <sup>[1.85](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-85)</sup> <sup>[1.86](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-86)</sup> <sup>[1.87](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-87)</sup> <sup>[1.88](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-88)</sup> <sup>[1.89](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-89)</sup> <sup>[1.90](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-90)</sup> <sup>[1.91](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-91)</sup> <sup>[1.92](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-92)</sup> <sup>[1.93](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-v2_1-93)</sup> Zhang, Yuntao et al. «SafetyBench: Evaluating the Safety of Large Language Models with Multiple Choice Questions». *arXiv*. <a href="https://ar5iv.labs.arxiv.org/html/2309.07045v2" class="external autonumber" rel="nofollow">[१]</a></span>
2.  <span id="cite_note-arxiv-main-abs-2">↑ <sup>[2.0](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-abs_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-abs_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/SafetyBench_(HI)#cite_ref-arxiv-main-abs_2-2)</sup> Zhang, Yuntao et al. «SafetyBench: Evaluating the Safety of Large Language Models». *arXiv*. <a href="https://arxiv.org/abs/2309.07045" class="external autonumber" rel="nofollow">[२]</a></span>
