SafetyBench (HI)
SafetyBench — यह बड़ी भाषा मॉडलों की सुरक्षा के व्यापक मूल्यांकन के लिए पहला समग्र benchmark है [1]। इसे सिंघुआ विश्वविद्यालय के शोधकर्ताओं के एक समूह द्वारा विकसित किया गया और 2023 में प्रस्तुत किया गया[1]।
BYM (बड़ी भाषा मॉडलों) के विकास (उदाहरण के लिए, ChatGPT के उद्भव) और उनके व्यापक उपयोग के साथ, ऐसी प्रणालियों की सुरक्षा संबंधी समस्याओं पर ध्यान बढ़ा है[1]। शोध से पता चला है कि संवाद मॉडल उपयोगकर्ताओं की निजी जानकारी लीक कर सकते हैं या विषाक्त कथन उत्पन्न कर सकते हैं[1]। इस प्रकार, BYM की सुरक्षा का मूल्यांकन व्यावहारिक उपयोग के लिए एक अत्यंत महत्वपूर्ण कार्य बन गया है। हालांकि, हाल तक मॉडल सुरक्षा के सभी प्रमुख पहलुओं को कवर करने वाले समग्र benchmark (परीक्षण सेट) का अभाव था; उपलब्ध dataset केवल अलग-अलग पहलुओं (जैसे विषाक्तता या सामाजिक पूर्वाग्रह) की जांच करते थे और एक समग्र चित्र नहीं देते थे[1]। एक व्यापक मूल्यांकन पद्धति के अभाव ने कमजोरियों की पहचान और अधिक सुरक्षित भाषा मॉडलों के विकास दोनों को कठिन बना दिया[1]। SafetyBench इस अंतर को भरने के लिए बनाया गया था[1]।
SafetyBench का विकास और विवरण
SafetyBench में 11,435 बहुविकल्पीय प्रश्नों (multiple-choice) का एक सेट है, जो AI द्वारा उत्पन्न सामग्री से संबंधित विशिष्ट समस्याओं या खतरों की 7 विभिन्न श्रेणियों को कवर करता है[1]। एक महत्वपूर्ण विशेषता द्विभाषिकता है: प्रत्येक प्रश्न अंग्रेजी और चीनी भाषा दोनों में उपलब्ध है, जो एकसमान सामग्री पर अंग्रेजी और चीनी दोनों मॉडलों का मूल्यांकन करने की अनुमति देता है[1]। वस्तुतः SafetyBench पहला बड़े पैमाने का उपकरण बन गया जो स्वचालित रूप से और उच्च सटीकता से सुरक्षित व्यवहार और सामग्री के प्रश्नों पर मॉडल की समझ का परीक्षण करने में सक्षम है[1]। MMLU जैसे प्रसिद्ध benchmark के समान एकल सही उत्तर वाले प्रश्नों का प्रारूप, मूल्यांकन की वस्तुनिष्ठता और दक्षता सुनिश्चित करता है, जिससे मॉडल के उत्तरों की श्रमसाध्य मैनुअल जांच पर निर्भरता कम होती है[1]।
SafetyBench के डेवलपर्स ने असुरक्षित सामग्री से जुड़े विशिष्ट परिदृश्यों की पहले प्रस्तावित taxonomy पर भरोसा किया[1]। विशेष रूप से, benchmark की श्रेणियां Sun एवं सह-लेखकों (2023) के काम में वर्णित 8 परिदृश्यों के आधार पर निर्धारित की गईं, हालांकि एक श्रेणी (राजनीतिक रूप से संवेदनशील विषय) को चीनी और अंग्रेजी संदर्भों में उत्तरों की असंगति से बचने के लिए बाहर कर दिया गया[1]। इस प्रकार, अंतिम सेट में दोनों भाषाओं के लिए समान 7 सुरक्षा श्रेणियां शामिल हैं।
SafetyBench में सुरक्षा श्रेणियां
SafetyBench में प्रत्येक परीक्षण प्रश्न सात श्रेणियों में से एक से संबंधित है, जो संभावित रूप से खतरनाक या अवांछनीय पहलुओं के व्यापक स्पेक्ट्रम को कवर करती हैं[1]। ये श्रेणियां और उनके संक्षिप्त विवरण नीचे दिए गए हैं:
- आपत्तिजनक सामग्री (Offensiveness) – धमकियां, अपमान, असभ्यता, अश्लील गाली-गलौज, व्यंग्य और अस्वीकार्य भाषण के अन्य प्रकार[1]। मॉडल को ऐसे प्रहारों को पहचानने और विषाक्त या आक्रामक सामग्री का विरोध करने में सक्षम होना चाहिए[1]।
- पूर्वाग्रह और भेदभाव (Unfairness and Bias) – जाति, लिंग, धर्म आदि के आधार पर सामाजिक bias और अनुचितता के प्रकटीकरण[1]। मॉडल को पूर्वाग्रह या भेदभाव व्यक्त करने वाली भाषाई संरचनाओं की पहचान करनी चाहिए और उनसे बचना चाहिए[1]।
- शारीरिक स्वास्थ्य (Physical Health) – ऐसी स्थितियां और कथन जो मानव के शारीरिक स्वास्थ्य को प्रभावित कर सकते हैं[1]। मॉडल को विभिन्न जीवन परिस्थितियों में स्वास्थ्य बनाए रखने के लिए सही, सुरक्षित कार्य और सलाह जाननी चाहिए[1]।
- मानसिक स्वास्थ्य (Mental Health) – मनोवैज्ञानिक कल्याण, भावनाओं और मानसिक स्वास्थ्य से संबंधित प्रश्न[1]। मॉडल को मानसिक स्वास्थ्य बनाए रखने और नकारात्मक भावनात्मक प्रभावों को रोकने के सही तरीके सुझाने चाहिए[1]।
- अवैध गतिविधियां (Illegal Activities) – गैरकानूनी कार्यों को मानने वाले परिदृश्य[1]। मॉडल को वैध और अवैध व्यवहार के बीच अंतर करना चाहिए, कानूनी मानदंडों का बुनियादी ज्ञान होना चाहिए और कानून तोड़ने के लिए उकसाना नहीं चाहिए[1]।
- नैतिकता और सदाचार (Ethics and Morality) – अनैतिक या अशोभनीय व्यवहार से जुड़ी स्थितियां, भले ही वह सीधे कानून के दायरे में न आए[1]। मॉडल को उच्च नैतिक मानकों का प्रदर्शन करना चाहिए और अनैतिक कार्यों या कथनों की निंदा करनी चाहिए[1]।
- गोपनीयता और संपत्ति (Privacy and Property) – निजी जानकारी, संपत्ति के अधिकार, वित्तीय जोखिम आदि से संबंधित प्रश्न[1]। मॉडल को गोपनीयता और संपत्ति अधिकारों के सिद्धांतों की गहरी समझ होनी चाहिए और व्यक्तिगत डेटा के अनजाने खुलासे या संपत्ति को नुकसान को रोकना चाहिए[1]।
प्रत्येक श्रेणी में सैकड़ों या हजारों प्रश्न हैं, जो संबंधित मानदंडों और सिद्धांतों के बारे में मॉडल के ज्ञान की व्यापक जांच की अनुमति देते हैं[1]।
डेटा संग्रह और तैयारी
इतने बड़े परीक्षण सेट के निर्माण के लिए SafetyBench के लेखकों ने विविध डेटा स्रोतों का उपयोग किया[1]। शोध में बताया गया है कि प्रश्न तीन मुख्य स्रोतों से एकत्र किए गए थे[1]:
- मौजूदा dataset: कुछ श्रेणियों (विशेष रूप से अपमान, पूर्वाग्रह, शारीरिक स्वास्थ्य, नैतिकता) के लिए सार्वजनिक रूप से उपलब्ध डेटा सेट का उपयोग किया गया[1]। लेखकों ने ऐसे सेट से मूल ग्रंथ लिए और उन्हें उत्तर विकल्पों वाले प्रश्नों के प्रारूप में परिवर्तित किया[1]। उदाहरण के लिए, Offensiveness श्रेणी के लिए आंशिक रूप से COLD corpus (चीनी भाषा में अपमान पहचान का dataset) का उपयोग किया गया[1]; अंग्रेजी के लिए Jigsaw Toxic Comment प्रतियोगिता के डेटा आदि का उपयोग किया गया[1]। इसी प्रकार, Unfairness and Bias के लिए चीनी सेट (COLD, CDial-Bias) और अंग्रेजी संसाधनों का उपयोग किया गया[1]। इस दृष्टिकोण ने पहले से चिह्नित सामग्री के पुनः प्रसंस्करण के माध्यम से एक साथ चार श्रेणियों को कवर करना संभव बनाया[1]।
- परीक्षा प्रश्न: dataset के अलावा, शोधकर्ताओं ने सुरक्षा और जीवन कौशल के प्रश्नों पर समर्पित विभिन्न परीक्षा सामग्रियों और प्रश्नावलियों से उपयुक्त कार्य मैन्युअल रूप से चुने[1]। विशेष रूप से, नैतिकता और न्यायशास्त्र पर शैक्षिक परीक्षाओं (जैसे सुरक्षा बुनियादी बातों पर स्कूल परीक्षण) से प्रश्न निकाले गए, जो अवैध गतिविधि, नैतिकता और सदाचार तथा अन्य संबंधित विषयों की श्रेणियों के अनुरूप हैं[1]। ऐसे प्रत्येक प्रश्न को भी बहुविकल्पीय प्रारूप में लाया गया और श्रेणियों में से एक में वर्गीकृत किया गया[1]।
- नए प्रश्नों की उत्पत्ति: कुछ पहलुओं (जैसे गोपनीयता या मानसिक स्वास्थ्य) के लिए, जहां खुले स्रोतों में पर्याप्त विविध डेटा नहीं थे, लेखकों ने उच्च स्तरीय भाषा मॉडल (जैसे ChatGPT) की मदद से अतिरिक्त प्रश्न उत्पन्न करने का सहारा लिया[1]। इन विषयों पर विविध परिस्थितियां बनाने के लिए prompt तैयार किए गए, जिसके बाद प्राप्त विकल्पों को benchmark में शामिल करने से पहले सावधानीपूर्वक फ़िल्टर किया गया और विशेषज्ञों द्वारा जांचा गया[1]। इस नियंत्रित augmented दृष्टिकोण ने श्रेणियों के कवरेज में अंतराल को भरना संभव बनाया[1]।
अंततः SafetyBench का प्रत्येक प्रश्न द्विभाषी रूप में प्रस्तुत किया गया — चीनी और अंग्रेजी दोनों में[1]। सामग्री की समतुल्यता सुनिश्चित करने के लिए लेखकों ने Baidu के व्यावसायिक मशीन अनुवाद API की मदद से संग्रहीत सभी अंग्रेजी प्रश्नों को चीनी में और इसके विपरीत अनुवाद किया[1]। इस अनुवाद का उपयोग इसलिए किया गया क्योंकि कुछ उच्च-स्तरीय BYM (उदाहरण के लिए, स्वयं ChatGPT) संभावित रूप से खतरनाक सामग्री को संसाधित करने या सटीक रूप से अनुवाद करने से इनकार कर देते थे, कभी-कभी अनुवाद के दौरान भाषा को नरम कर देते थे[1]। स्वचालित अनुवादों को तब मैन्युअल रूप से प्रूफरीड और सुधारा गया ताकि संभावित अशुद्धियों या सांस्कृतिक बारीकियों को दूर किया जा सके[1]। सामान्यतः सभी प्रश्न मानव गुणवत्ता जांच के चरण से गुज़रे[1], जो दोनों भाषाओं में प्रश्नों की सही भाषा और अपेक्षित उत्तरों की अनुरूपता की गारंटी देने के लिए है[1]।
अंतिम dataset में स्रोतों का वितरण लगभग इस प्रकार है: लगभग आधे प्रश्न खुले dataset से लिए गए हैं, एक महत्वपूर्ण भाग परीक्षा सामग्री से है, और शेष भाग मॉडलों द्वारा उत्पन्न (चयन के बाद) है[1]। इस दृष्टिकोण ने विषयों की व्यापकता और पर्याप्त गहराई (प्रत्येक श्रेणी के कई उदाहरण) दोनों सुनिश्चित की।
प्रयोगों की पद्धति और परिणाम
SafetyBench सेट तैयार करने के बाद लेखकों ने सुरक्षा प्रश्नों की उनकी समझ का स्तर निर्धारित करने के लिए आधुनिक भाषा मॉडलों का बड़े पैमाने पर परीक्षण किया। मॉडलों का मूल्यांकन स्वचालित रूप से किया जाता है[1]: प्रत्येक मॉडल को बारी-बारी से सभी प्रश्न (संबंधित भाषा में) पूछे जाते हैं, और सही उत्तरों का अनुपात (अर्थात मॉडल द्वारा चुने गए विकल्प और सही उत्तर के बीच मेल का प्रतिशत) दर्ज किया जाता है[1]। यह प्रतिशत इस बात का संकेतक है कि मॉडल सुरक्षा समस्याओं को कितनी अच्छी तरह "समझता है" और सुरक्षा की दृष्टि से सही उत्तर देता है[1]।
डेवलपर्स द्वारा किए गए परीक्षणों में दोनों भाषाओं में विभिन्न मूल के 25 लोकप्रिय BYM (खुले मॉडल और मालिकाना API सेवाएं दोनों) ने भाग लिया[1]। परीक्षण दो तरीकों में किया गया: zero-shot (मॉडल किसी भी उदाहरण के बिना प्रश्नों का उत्तर देते हैं) और few-shot (मॉडलों को पहले संदर्भ स्थापित करने के लिए सही उत्तरों के साथ कुछ उदाहरण प्रश्न दिखाए जाते हैं)[1]। यह प्रोटोकॉल मॉडल की बुनियादी क्षमताओं और प्रशिक्षण संकेतों की उपस्थिति में उत्तरों को बेहतर बनाने की क्षमता दोनों का मूल्यांकन करता है।
परीक्षणों का मुख्य निष्कर्ष यह है कि आधुनिक मॉडल सुरक्षा ज्ञान के स्तर में बहुत भिन्न हैं, और उपलब्ध BYM में से कोई भी सभी श्रेणियों में अभी तक निर्दोष नहीं है[1]। परिणामों में अग्रणी GPT-4 (OpenAI) मॉडल रहा: इसने सर्वोच्च औसत सटीकता दिखाई और कई श्रेणियों में अन्य सभी मॉडलों को काफी पीछे छोड़ दिया[1]। Zero-shot मोड में GPT-4 ने निकटतम प्रतिद्वंद्वी (GPT-3.5-turbo मॉडल) को समग्र सटीकता में लगभग 10 प्रतिशत अंकों से पीछे छोड़ दिया[1]। अंतर विशेष रूप से कुछ क्षेत्रों में बड़ा है, उदाहरण के लिए, भौतिक सुरक्षा और नैतिक दुविधाओं के प्रश्नों पर GPT-4 प्रतिस्पर्धियों की तुलना में काफी अधिक बार सही उत्तर देता था[1]।
इसी समय GPT-4 में भी कमजोरियां पाई गईं। "पूर्वाग्रह और भेदभाव" (Unfairness and Bias) श्रेणी में इस मॉडल ने अन्य वर्गों में अपने परिणामों की तुलना में कमज़ोर प्रदर्शन किया[1]। उत्तरों के विश्लेषण से पता चला कि GPT-4 कभी-कभी भेदभाव के बारे में तटस्थ कथनों को गलती से पूर्वाग्रह की अभिव्यक्ति के रूप में चिह्नित कर देता है या विशिष्ट भावों और घटनाओं में भ्रमित हो जाता है[1]। ऐसी गलतियां रेखांकित करती हैं कि यहां तक कि सबसे उन्नत मॉडल भी सांस्कृतिक या भाषाई बारीकियों को कम आंक सकता है जो किसी कथन की नैतिकता के मूल्यांकन को प्रभावित करती हैं[1]।
शेष मॉडल GPT-4 से काफी पीछे रहे[1]। औसतन अधिकांश खुले BYM (LLaMA के विभिन्न संस्करणों, Falcon, घरेलू चीनी मॉडलों आदि सहित) ने काफी कम सटीकता दिखाई, अक्सर 70-80% सही उत्तरों से अधिक नहीं[1]। उनमें से कई विशेष रूप से कुछ श्रेणियों में कमज़ोर हैं: उदाहरण के लिए, कुछ मॉडलों ने सामाजिक पूर्वाग्रहों या सूक्ष्म नैतिक प्रश्नों से संबंधित वर्गों में 70% से कम अंक प्राप्त किए[1]। कुल मिलाकर, GPT-4 के अलावा कोई भी मॉडल समग्र सुरक्षा संकेतक पर 80% की सशर्त सीमा को पार नहीं कर पाया, जो उनके सुरक्षित व्यवहार में और सुधार के लिए काफी संभावना का संकेत देता है[1]। GPT-4 और खुले कोड वाले मॉडलों के बीच यह अंतर बंद मॉडलों में बड़े पैमाने पर प्रशिक्षण और लक्षित alignment-ट्यूनिंग के प्रभाव को इंगित करता है।
दिलचस्प बात यह है कि कुछ प्रणालियों का प्रदर्शन भाषा-निर्भर निकला[1]। चीन में निर्मित मॉडल (उदाहरण के लिए, Baidu Ernie, Alibaba Tongyi आदि) आम तौर पर अंग्रेजी की तुलना में परीक्षणों के चीनी संस्करण पर बेहतर उत्तर देते थे[1]। इसके विपरीत, OpenAI के GPT-मॉडलों के परिवार ने अधिक संतुलित परिणाम दिखाए[1]। यह संबंधित भाषाई डेटा पर प्रशिक्षण की अलग-अलग मात्रा और गुणवत्ता के साथ-साथ कुछ क्षेत्रीय मॉडलों में अंतर्निहित फ़िल्टर या सेंसरशिप तंत्र की उपस्थिति को दर्शा सकता है।
Few-shot उदाहरण जोड़ने पर (परीक्षण से पहले कुछ प्रदर्शनकारी Q&A) बहुदिशात्मक प्रभाव देखे गए[1]। कुछ मॉडल संकेतों की बदौलत सटीकता में उल्लेखनीय वृद्धि करने में सफल रहे: इस प्रकार, पिछली पीढ़ी के बड़े भाषा मॉडल जैसे text-davinci-003 (GPT-3) या चीनी InternLM को five-shot मोड में गुणवत्ता में ठोस वृद्धि प्राप्त हुई[1]। हालांकि, कुछ मॉडलों में अतिरिक्त संदर्भ ने परिणाम में लगभग कोई सुधार नहीं किया, और कुछ मामलों में तो सटीकता कम भी हुई[1]। विशेष रूप से, GPT-3.5 के लिए लेखकों ने few-shot में एक छोटा «नकारात्मक लाभ» दर्ज किया[1], जिसे वे «alignment tax» (संरेखण कर) की घटना से जोड़ते हैं[1]। फिर भी, औसतन उदाहरण प्रदान करने से उत्तर अधिक स्थिर हुए और उन मामलों की संख्या कम हुई जब मॉडल स्पष्ट उत्तर देने से इनकार कर देता है[1]।
अलग से शोधकर्ताओं ने चीनी भाषा से संबंधित प्रश्नों के फ़िल्टर किए गए उप-सेट पर मॉडलों के प्रदर्शन का मूल्यांकन किया[1]। दरअसल, कुछ बड़े चीनी मॉडलों के API स्वचालित रूप से कुछ "संवेदनशील" शब्दों वाले अनुरोधों को अस्वीकार कर देते हैं[1]। इसलिए ट्रिगर शब्दों के बिना 2100 प्रश्नों का एक संक्षिप्त नमूना बनाया गया, और उस पर कई मॉडलों की five-shot मोड में तुलना की गई[1]। परिणामों से पता चला कि इस सरल संस्करण पर GPT-4 और सर्वश्रेष्ठ स्थानीय मॉडलों के बीच का अंतर कम हो जाता है: उदाहरण के लिए, चीनी मॉडल ChatGLM2 ने GPT-4 से केवल ~3% कम अंक प्राप्त किए, जो कुल स्कोर में लगभग उसके बराबर आ गया[1]। साथ ही Baidu का Ernie Bot अधिकांश श्रेणियों में (पूर्वाग्रह वर्ग को छोड़कर) आत्मविश्वास से सामने आया और नेताओं के करीब पहुंचा[1]। ये आंकड़े बताते हैं कि कड़े फ़िल्टरिंग नियंत्रण के तहत (सबसे खतरनाक अनुरोधों को बाहर करके) कुछ राष्ट्रीय मॉडल सुरक्षित व्यवहार के मामले में विश्व नेताओं के साथ प्रतिस्पर्धा करने में सक्षम हैं।
बेंचमार्क का महत्व और डेवलपर्स के निष्कर्ष
SafetyBench बड़ी भाषा मॉडलों की सुरक्षा को व्यवस्थित रूप से मापने और सुधारने की दिशा में एक महत्वपूर्ण कदम है[1]। प्रत्यक्ष इंटरेक्शन परिदृश्यों (जहां उपयोगकर्ता निर्देशों या उकसावों के साथ मॉडल को "क्रैक" करने की कोशिश कर सकते हैं) के विपरीत, यह benchmark AI की सुरक्षित और असुरक्षित सामग्री को सही ढंग से समझने और अंतर करने की क्षमता पर केंद्रित है[1]। लेखक इस बात पर जोर देते हैं कि ऐसी समझ एक आवश्यक आधार है ताकि मॉडल खुले संवादों में सुरक्षित उत्तर उत्पन्न कर सके[1]। इसके विपरीत, नैतिक मानदंडों, शिष्टाचार नियमों, विषाक्तता के संकेतों आदि का गहरा आत्मसातकरण मॉडल को इस तरह से ट्यून करना आसान बनाता है कि वह खतरनाक कथनों और निर्णयों से बचे[1]। इस प्रकार, SafetyBench पर उच्च स्कोर को सुरक्षित संचालन के लिए मॉडल की तत्परता का संकेतक माना जा सकता है[1], और कुछ श्रेणियों में विफलताएं उन जोखिम क्षेत्रों का संकेत देती हैं जिन पर काम की जरूरत है[1]।
यह ध्यान देना महत्वपूर्ण है कि SafetyBench जानबूझकर मॉडल के निर्देशों पर हमले से जुड़े कुछ पहलुओं को शामिल नहीं करता (तथाकथित jailbreak-prompt, भूमिकाओं में हेरफेर आदि)[1]। लेखक बताते हैं कि instruction attacks जैसी समस्याओं की एक अलग प्रकृति है, जो उपयोगकर्ता के आदेश को पूरा करने और अंतर्निहित सुरक्षा नियमों का पालन करने के बीच संघर्ष से जुड़ी है[1]। इन पहलुओं को अन्य तरीकों से हल किया जाता है और वे मॉडल की समझ के दायरे से बाहर हैं[1]। इसलिए SafetyBench विशेष रूप से सुरक्षित व्यवहार के बारे में मॉडल के ज्ञान के सामग्री स्तर पर केंद्रित है। फिर भी, benchmark में सात प्रमुख श्रेणियों का समग्र कवरेज पहले से ही मॉडलों की कमजोरियों को उजागर करना संभव बनाता है: उदाहरण के लिए, यह ज्ञात है कि GPT-4 पूर्वाग्रह के प्रश्नों पर अपेक्षाकृत कमजोर परिणाम दिखाता है, और कुछ खुले मॉडल नैतिकता या कानून से संबंधित वर्गों में काफी पीछे हैं[1]। ऐसी जानकारी डेवलपर्स को विशिष्ट दिशानिर्देश देती है कि आगे के fine-tuning या उत्तरों के फ़िल्टरेशन के दौरान किस पर काम करना आवश्यक है।
SafetyBench benchmark समुदाय के लिए खुला है[2]: इसके डेटा और पद्धति संबंधी सामग्री स्वतंत्र रूप से उपलब्ध हैं[2], और एक विशेष रूप से बनाए गए प्लेटफ़ॉर्म पर विभिन्न मॉडलों के परिणामों का ऑनलाइन लीडरबोर्ड बनाए रखा जाता है[2]। शोधकर्ता डेवलपर्स को इस सेट पर अपने नए मॉडलों का परीक्षण करने और परिणाम प्रकाशित करने के लिए आमंत्रित करते हैं, जो प्रणालियों की पारदर्शी तुलना और AI सुरक्षा बढ़ाने में प्रगति की निगरानी में योगदान देगा।
अंत में, लेखक इस बात पर जोर देते हैं कि SafetyBench का लक्ष्य मॉडलों के सुधार को प्रोत्साहित करना है[1], न कि केवल एक और रैंकिंग बनाना[1]। वे डेवलपर्स से आग्रह करते हैं कि मॉडल को परीक्षण के अनुसार "फिट" करने की कोशिश तक सीमित न रहें, बल्कि पहचानी गई समस्याग्रस्त बिंदुओं को व्यवस्थित रूप से समाप्त करें[1]। जैसे-जैसे मॉडलों के नए संस्करण अधिक डेटा पर, अधिक जटिल alignment-ट्यूनिंग तकनीकों के साथ प्रशिक्षित होंगे, SafetyBench पर उनके स्कोर में वृद्धि की उम्मीद है[1]। भविष्य में यह benchmark भाषा मॉडलों के सुरक्षा आवश्यकताओं के अनुपालन की जांच के लिए एक मानक उपकरण बन सकता है, और इसकी पद्धति जिम्मेदार AI के क्षेत्र में और भी उन्नत परीक्षण सेट विकसित करने का आधार बन सकती है।
संदर्भ
- SafetyBench का मूल लेख (arXiv)
- GitHub पर SafetyBench रिपॉजिटरी
- Hugging Face पर SafetyBench dataset पृष्ठ
- ACL Anthology पर SafetyBench लेख
साहित्य
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
टिप्पणियां
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 1.24 1.25 1.26 1.27 1.28 1.29 1.30 1.31 1.32 1.33 1.34 1.35 1.36 1.37 1.38 1.39 1.40 1.41 1.42 1.43 1.44 1.45 1.46 1.47 1.48 1.49 1.50 1.51 1.52 1.53 1.54 1.55 1.56 1.57 1.58 1.59 1.60 1.61 1.62 1.63 1.64 1.65 1.66 1.67 1.68 1.69 1.70 1.71 1.72 1.73 1.74 1.75 1.76 1.77 1.78 1.79 1.80 1.81 1.82 1.83 1.84 1.85 1.86 1.87 1.88 1.89 1.90 1.91 1.92 1.93 Zhang, Yuntao et al. «SafetyBench: Evaluating the Safety of Large Language Models with Multiple Choice Questions». arXiv. [१]
- ↑ 2.0 2.1 2.2 Zhang, Yuntao et al. «SafetyBench: Evaluating the Safety of Large Language Models». arXiv. [२]