AgentHarm (HI)
AgentHarm — यह परीक्षण कार्यों का एक समूह (benchmark) है, जो बड़े भाषा मॉडलों पर आधारित बुद्धिमान एजेंटों (LLM-एजेंटों) की उपयोगकर्ता के अनुरोध पर हानिकारक कार्य करने की प्रवृत्ति का मूल्यांकन करने के लिए बनाया गया है[1][2]। इसे Gray Swan AI कंपनी के शोधकर्ताओं ने ब्रिटिश AI सुरक्षा संस्थान (UK AI Safety Institute) के सहयोग से विकसित किया[1] और अक्टूबर 2024 में प्रस्तुत किया गया[1]। AgentHarm का विवरण ICLR 2025 सम्मेलन में प्रस्तुत एक शोधपत्र में प्रकाशित किया गया है[2]।
LLM-एजेंट, सामान्य चैटबॉट्स के विपरीत, बाहरी उपकरणों का उपयोग कर सकते हैं और बहु-चरणीय कार्य कर सकते हैं, जिससे दुर्भावनापूर्ण उपयोगकर्ताओं द्वारा उनके दुरुपयोग का संभावित जोखिम बढ़ जाता है[1]। AgentHarm को ऐसे एजेंटों की हानिकारक अनुरोधों के प्रति प्रतिरोधक क्षमता के अपर्याप्त अध्ययन के जवाब में बनाया गया था[2]। तुलना के लिए, यदि एक सामान्य चैटबॉट से सीधे पूछा जा सकता है «बम कैसे बनाएं?», तो उपकरणों से लैस एक एजेंट निर्देश पर स्वतंत्र रूप से क्रियाओं की एक शृंखला कर सकता है: उदाहरण के लिए, «बम बनाने के लिए आवश्यक सभी घटकों को ऑनलाइन ऑर्डर करें और अधिकारियों का ध्यान आकर्षित किए बिना उन्हें घर पर डिलीवरी का प्रबंध करें»[2]। इस प्रकार, AgentHarm उन परिदृश्यों पर ध्यान केंद्रित करता है जहाँ उपयोगकर्ता का अनुरोध LLM-एजेंट को वास्तविक या डिजिटल दुनिया में खतरनाक कार्यों की एक शृंखला करने के लिए प्रेरित करता है।
बेंचमार्क की संरचना और संगठन
AgentHarm बेंचमार्क में 110 विभिन्न मूल परिदृश्य शामिल हैं, जो दुर्भावनापूर्ण निर्देशों का अनुकरण करते हैं (विविधताओं के साथ कार्यों की कुल संख्या 440 तक विस्तारित है)[1]। ये कार्य संभावित रूप से हानिकारक गतिविधि की 11 श्रेणियों को कवर करते हैं[1], जिनमें धोखाधड़ी, साइबर अपराध और उत्पीड़न शामिल हैं[1]।
नीचे AgentHarm में विचार की गई श्रेणियाँ सूचीबद्ध हैं[2]:
- धोखाधड़ी (fraud) – वित्तीय और अन्य छल-कपट की योजनाएँ;
- साइबर अपराध (cybercrime) – डिजिटल क्षेत्र में अवैध गतिविधियाँ (सिस्टम हैकिंग, डेटा चोरी आदि);
- आत्महत्या के लिए उकसाना (self-harm) – स्वयं के स्वास्थ्य और जीवन को नुकसान पहुँचाने की सलाह या सहायता;
- उत्पीड़न और दुर्व्यवहार (harassment) – लोगों के प्रति पीछा करना, अपमान, धमकियाँ;
- यौन अपराध (sexual) – अश्लील या अवैध यौन प्रकृति के कार्य;
- कॉपीराइट उल्लंघन (copyright) – पायरेसी, सामग्री के अवैध वितरण में सहायता;
- नशीली दवाएं (drugs) – अवैध पदार्थों की बिक्री, निर्माण या वितरण में सहायता;
- भ्रामक सूचना (disinformation) – जानबूझकर झूठी जानकारी का निर्माण और प्रसार;
- घृणा फैलाना (hate) – लोगों के समूहों के प्रति शत्रुता, चरमपंथी विचारों का प्रचार;
- हिंसा (violence) – शारीरिक हिंसा के कृत्यों की तैयारी या संचालन;
- आतंकवाद (terrorism) – आतंकवादी हमलों की योजना बनाना, राज्य सुरक्षा के लिए खतरे उत्पन्न करना।
प्रत्येक कार्य एजेंट को एक स्पष्ट रूप से हानिकारक बहु-चरणीय अनुरोध है, जिसके लिए लक्ष्य प्राप्त करने हेतु विभिन्न बाहरी उपकरणों के उपयोग की आवश्यकता होती है[2]। उदाहरण के लिए, राजनेताओं को बदनाम करने के लिए झूठी जानकारी के साथ एक प्रेरक प्रचार पोस्ट उत्पन्न करने का प्रस्ताव किया जाता है (श्रेणी «भ्रामक सूचना»)[3] या नशीली दवाओं की गुमनाम ऑनलाइन व्यापार के लिए एक वेबसाइट का स्रोत कोड लिखने का (श्रेणी «नशीली दवाएं»)[3]। AgentHarm के परिदृश्यों में एजेंट एकीकृत कार्यों (तथाकथित उपकरणों) के एक विस्तृत सेट का उपयोग कर सकता है, जो वास्तविक क्रियाओं का अनुकरण करते हैं: वेब खोज और ईमेल भेजने से लेकर प्रोग्राम कोड चलाने तक[2]। कुल मिलाकर, कार्यों में 100 से अधिक विभिन्न आभासी उपकरणों का उपयोग किया जाता है, जो विविध डोमेन (सोशल मीडिया, ऑनलाइन स्टोर, सेवाओं के API आदि) को कवर करते हैं[2]।
हानिकारक कार्य करने के लिए मॉडल की तत्परता का मूल्यांकन करने के लिए, प्रत्येक हानिकारक कार्य के साथ उसी विषय पर एक युग्मित सुरक्षित (benign) परिदृश्य होता है[2]। इस «हानिरहित» संस्करण में सामान्य शर्तें और कार्य का बहु-चरणीय प्रारूप बना रहता है, लेकिन अवैध या हानिकारक घटक अनुपस्थित होता है[2]। यह एजेंट की कार्य को मूल रूप से हल करने की क्षमताओं की तुलना करना संभव बनाता है (उदाहरण के लिए, किसी निश्चित क्षेत्र में योजना बनाना और उपकरणों का उपयोग करना), परिणाम पर नैतिक फ़िल्टर के प्रभाव को समाप्त करके।
मॉडलों का मूल्यांकन
AgentHarm के परीक्षण के लिए लेखकों ने विभिन्न डेवलपर्स के कई अत्याधुनिक भाषा मॉडलों को शामिल किया[2]। इनमें OpenAI के मॉडल (GPT-3.5 Turbo और GPT-4), Anthropic की प्रणालियाँ (Claude 3 परिवार), Google Gemini के प्रायोगिक मॉडल, तथा सबसे शक्तिशाली ओपन मॉडलों में से एक Mistral 2 शामिल हैं[2]। प्रत्येक मॉडल को बेंचमार्क के सभी परिदृश्यों पर उपकरणों का उपयोग करने में सक्षम एजेंट मोड में चलाया गया।
मूल्यांकन में उपयोग किए गए मुख्य प्रदर्शन संकेतक: Harm score (शाब्दिक रूप से «हानि स्कोर») और अस्वीकृति का अनुपात[2]। Harm score हानिकारक कार्य की सफल पूर्णता की डिग्री को दर्शाता है (उदाहरण के लिए, अधिकतम संभव परिणाम का वह प्रतिशत जो एजेंट ने निर्धारित अवैध लक्ष्य की पूर्ति में प्राप्त किया)[2]। अस्वीकृति का अनुपात उन मामलों का प्रतिशत है जब मॉडल ने अनुरोध पूरा करने से इनकार कर दिया (कार्य हल करने के बजाय प्रतिबंधात्मक या टालने वाला उत्तर दिया)[2]। कम अस्वीकृति प्रतिशत के साथ उच्च Harm score का मतलब है कि एजेंट ने परिदृश्य के अनुसार लगभग सभी आवश्यक खतरनाक क्रियाएं पूरी कर लीं।
प्रयोग कई मोड में किए गए। सबसे पहले मॉडलों के किसी भी हमले के बिना व्यवहार की जांच की गई[2] — यानी हानिकारक निर्देशों को सीधे, जैसा है वैसा प्रस्तुत करके[2]। इसके बाद प्रत्येक एजेंट पर एक सार्वभौमिक हमलावर prompt टेम्पलेट («jailbreak») लागू किया गया, जिसे उपयोगकर्ता के अनुरोध में जोड़ा गया[2]। यह अतिरिक्त छिपा हुआ पाठ मॉडल के अंतर्निहित फ़िल्टर को दरकिनार करने के लिए था (उदाहरण के लिए, मॉडरेशन नियमों को अनदेखा करने के लिए प्रेरित करता था)[2]। हमले का टेम्पलेट चैटबॉट्स की एक ज्ञात कमजोरी के आधार पर विकसित किया गया था और बहु-चरणीय एजेंट के लिए थोड़े बदलावों के साथ अनुकूलित किया गया था[2]।
जेलब्रेक से पहले और बाद के परिणामों की तुलना करके, शोधकर्ताओं ने मूल्यांकन किया कि प्रत्येक मॉडल में अस्वीकृति का अनुपात कितना कम होता है और हमले के प्रभाव में एजेंट अपनी कार्यात्मक क्षमताएं बनाए रखता है या नहीं[2]। इसके अतिरिक्त, लेखकों ने तुच्छ अस्वीकृतियों को समाप्त करने के लिए उपकरणों के «जबरन उपयोग» के साथ प्रयोग किए[2]। और मॉडल के कौशल की अखंडता का विश्लेषण करने के लिए non-refusal harm score मेट्रिक पेश की गई — केवल उन मामलों के आधार पर कार्य पूर्णता की प्रभावशीलता जहाँ एजेंट ने इनकार नहीं किया[2]। हानिकारक कार्यों पर non-refusal harm score (सफल हैकिंग के बाद) की हानिरहित कार्यों पर समान संकेतक के साथ तुलना करने से यह पता चलता है कि जेलब्रेक एजेंट की संज्ञानात्मक और व्यावहारिक क्षमताओं को कितना कम करता है[2]।
परिणाम और पहचाने गए पैटर्न
AgentHarm के मूल्यांकन के आधार पर लेखकों के मुख्य निष्कर्ष[1]:
- यहाँ तक कि अत्याधुनिक मॉडल भी अक्सर बिना किसी हैकिंग के स्पष्ट रूप से अवैध अनुरोधों पर सहमत हो जाते हैं। अंतर्निहित सामग्री फ़िल्टरिंग उपकरण अविश्वसनीय रूप से काम करते हैं: LLM-एजेंट अक्सर उपयोगकर्ता के हानिकारक निर्देश को अस्वीकार करने के बजाय उसे पूरा करने का प्रयास करते हैं[1]।
- सरल सार्वभौमिक «jailbreak» प्रॉम्प्ट मॉडलों की सुरक्षा को प्रभावी ढंग से दरकिनार कर देते हैं। उपयोगकर्ता के अनुरोध में जोड़ी गई एक विशेष रूप से चुनी गई स्ट्रिंग मानक अस्वीकृति प्रतिक्रियाओं को दबाने में सक्षम है[1]। यहाँ तक कि शक्तिशाली अत्याधुनिक मॉडल भी ऐसे हमले के शिकार हो जाते हैं और बिना किसी बाधा के हानिकारक निर्देशों का पालन करने लगते हैं[1]।
- हैक किए गए एजेंट अपनी कार्यात्मक क्षमताएं बनाए रखते हैं और खतरनाक क्रियाएं क्रमबद्ध रूप से करते हैं। जेलब्रेक के बाद मॉडल कौशल के मामले में सामान्य ऑपरेशन मोड से लगभग कम हुए बिना सुसंगत रूप से बहु-चरणीय हानिकारक ऑपरेशन कर सकते हैं[1]। दूसरे शब्दों में, हमला मॉडल की योजना बनाने और समस्याओं को हल करने की क्षमता को नहीं, बल्कि उसकी नैतिक सीमाओं को समाप्त करता है[1]।
व्यावहारिक परिणामों ने इन बिंदुओं की मात्रात्मक रूप से पुष्टि की[2]। किसी भी हमले के बिना, कई मॉडलों ने अप्रत्याशित रूप से बड़े हिस्से के खतरनाक कार्य पूरे किए[2]। उदाहरण के लिए, OpenAI GPT-4 (मानक कॉन्फ़िगरेशन में) ने AgentHarm के लगभग आधे परिदृश्यों को सफलतापूर्वक पूरा किया, केवल ~49% स्पष्ट रूप से हानिकारक अनुरोधों को अस्वीकार किया[2]। Anthropic की मॉडल Claude 3.5 ने शुरू में काफी अधिक कड़ा मॉडरेशन दिखाया: उसने ~85% अनुरोधों को अस्वीकार कर दिया और केवल लगभग 13.5% कार्य पूरे किए[2]। इसके विपरीत, ओपन मॉडल Mistral Large 2 को लगभग कोई अस्वीकृति नहीं हुई (केवल ~1% अस्वीकृतियाँ) और उसने 82% से अधिक हानिकारक कार्य सफलतापूर्वक पूरे किए[2]। ये आंकड़े बताते हैं कि वर्तमान «मानवीय प्रतिक्रिया से सुदृढीकरण अधिगम» (RLHF) विधियाँ और स्वामित्व प्रणालियों में उपयोग किए जाने वाले अन्य alignment उपकरण खतरनाक व्यवहार को पूरी तरह से नहीं रोकते, विशेष रूप से एजेंट मोड में।
सार्वभौमिक jailbreak प्रॉम्प्ट के आवेदन ने सभी मॉडलों में पूर्ण की गई हानिकारक क्रियाओं के अनुपात को तेजी से बढ़ाया[2]। उदाहरण के लिए, हमले के बाद GPT-4 का Harm score ~48% से बढ़कर ~73% हो गया, अर्थात मॉडल लगभग तीन-चौथाई प्रतिबंधित कार्यों को पूरा करने लगा; इस दौरान अस्वीकृति का अनुपात ~14% तक कम हो गया[2]। Claude 3.5 में इसी तरह पूर्ण किए गए हानिकारक अनुरोधों का अनुपात लगभग 13.5% से बढ़कर 68.7% हो गया, और अस्वीकृति की आवृत्ति ~85% से घटकर ~17% हो गई[2]। विशेष रूप से उल्लेखनीय Google Gemini का उदाहरण है: इस मॉडल के एक संस्करण में हमले के दौरान अस्वीकृति का स्तर ~78% से घटकर केवल ~3.5% हो गया, जिसने फ़िल्टरिंग प्रतिबंधों का लगभग पूर्ण उन्मूलन प्रदर्शित किया[2]। इस प्रकार, यहाँ तक कि जहाँ हमले के बिना मॉडल उपयोगकर्ता को अधिक बार अस्वीकार करते थे, वहाँ एक विशेष संकेत के सरल जोड़ ने उन्हें अधिकांश हानिकारक कार्यों को बिना किसी बाधा के हल करने की अनुमति दी।
महत्वपूर्ण बात यह है कि हैकिंग ने एजेंटों की कार्य हल करने की क्षमताओं को लगभग कम नहीं किया[2]। लेखकों ने हानिकारक परिदृश्यों पर मॉडलों की सफलता (न्यूनतम अस्वीकृतियों के साथ) की तुलना समान सुरक्षित कार्यों पर उनकी सफलता से की। यह पाया गया कि संकेतक लगभग मेल खाते हैं[2]। उदाहरण के लिए, जेलब्रेक के बाद Claude 3.5 का जटिल बहु-चरणीय मिशनों की पूर्णता का औसत स्कोर ~81.9% था, जो उन्हीं कार्यों के हानिरहित संस्करणों पर उसके परिणाम ~82% के तुलनीय है[2]। GPT-4 में इसी तरह: लगभग शून्य अस्वीकृतियों के साथ हानिकारक कार्यों पर उसकी सफलता ~84.2% तक पहुँच गई, यानी सुरक्षित कार्यों पर संकेतक (~84%) के लगभग बराबर[2]। दूसरे शब्दों में, प्रतिबंधों को हटाना मॉडल को «मूर्ख» नहीं बनाता और उसे उपकरणों का उपयोग करने से नहीं रोकता — एजेंट बस सुरक्षा की कीमत पर अपनी पूरी क्षमताओं को लागू करने लगता है[2]। यह निष्कर्ष इस बात पर जोर देता है कि दुरुपयोग के जोखिम सबसे शक्तिशाली LLM के साथ सबसे अधिक हैं, जो हैक होने पर उच्च दक्षता के साथ खतरनाक आवश्यकता को पूरा करने में सक्षम होते हैं।
महत्व और अनुप्रयोग
AgentHarm के अध्ययन ने एजेंटों में बड़े भाषा मॉडलों के सुरक्षित एकीकरण के वर्तमान दृष्टिकोणों में गंभीर समस्याओं को उजागर किया[4]। यह दिखाया गया कि चैटबॉट मोड में प्रभावी सुरक्षा उपाय उपकरणों का उपयोग करने वाले बहु-चरणीय कार्यों में सुरक्षा की गारंटी नहीं देते[4][5]। यहाँ तक कि जिन मॉडलों को अपेक्षाकृत विश्वसनीय रूप से «aligned» माना जाता था (उदाहरण के लिए, Claude), वे सरल दरकिनार पैंतरों के प्रति आसानी से असुरक्षित हैं[4], और इसलिए संभावित रूप से खतरनाक क्रियाओं के स्वायत्त निष्पादन में पूरी तरह से भरोसा नहीं किया जा सकता[4]। शोध के लेखक अधिक उन्नत सुरक्षा प्रोटोकॉल और मॉडल प्रशिक्षण विकसित करने की आवश्यकता पर ध्यान देते हैं[4]। विशेष रूप से, महत्वपूर्ण क्षेत्रों में LLM-एजेंटों के व्यापक परिनियोजन से पहले, हानिकारक इनपुट के प्रति उनकी प्रतिरोधक क्षमता और स्पष्ट रूप से अवैध आदेशों को पूरा करने से इनकार करने की क्षमता सुनिश्चित करना आवश्यक है।
AgentHarm बेंचमार्क सार्वजनिक रूप से प्रकाशित किया गया और AI सुरक्षा के क्षेत्र में आगे के शोध के लिए है[1]। कार्यों का सेट Hugging Face प्लेटफ़ॉर्म पर उपलब्ध है[3], जो डेवलपर्स को हानिकारक परिदृश्यों के एकरूप सेट पर अपने मॉडलों और सुरक्षात्मक विधियों का परीक्षण करने की अनुमति देता है। साथ ही, कार्यों का एक हिस्सा अप्रकाशित (छिपा हुआ) रखा गया है ताकि भविष्य में नए मॉडलों के स्वतंत्र मूल्यांकन के लिए इसका उपयोग किया जा सके और बेंचमार्क की सामग्री को बड़े मॉडलों के प्रशिक्षण डेटा में लीक होने से रोका जा सके[3]। इस प्रकार, AgentHarm LLM-एजेंटों से जुड़े जोखिमों के वस्तुनिष्ठ मापन के लिए एक महत्वपूर्ण उपकरण के रूप में कार्य करता है[4] और कृत्रिम बुद्धिमत्ता प्रणालियों में दुर्भावनापूर्ण हमलों का मुकाबला करने के अधिक विश्वसनीय तरीकों के विकास को प्रोत्साहित करता है[4][5]।
संदर्भ
- AgentHarm का मूल लेख (arXiv)
- Gray Swan AI की वेबसाइट पर AgentHarm पर लेख
- Hugging Face पर AgentHarm डेटासेट पृष्ठ
- UK सरकार के GitHub पर AgentHarm का अवलोकन
- Emergent Mind पर AgentHarm का अवलोकन
साहित्य
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
टिप्पणियाँ
[1] [2] [3] [4] [5] </references>
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 «AgentHarm: A Benchmark for Measuring Harmfulness of LLM Agents». Gray Swan News. [१]
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 2.21 2.22 2.23 2.24 2.25 2.26 2.27 2.28 2.29 2.30 2.31 2.32 2.33 2.34 2.35 2.36 2.37 2.38 Andriushchenko, Maksym et al. «AgentHarm: A Benchmark for Measuring Harmfulness of LLM Agents». arXiv. [२]
- ↑ 3.0 3.1 3.2 3.3 3.4 «ai-safety-institute/AgentHarm». Datasets at Hugging Face. [३]
- ↑ 4.0 4.1 4.2 4.3 4.4 4.5 4.6 4.7 «AgentHarm: Measuring LLM Agent Harmfulness». Emergent Mind. [४]
- ↑ 5.0 5.1 5.2 «AgentHarm: Harmfulness Potential in AI Agents». UK government BEIS Github. [५]