---
title: "AgentHarm (HI)"
source: "https://systems-analysis.info/int/AgentHarm_(HI)"
wiki: "systems-analysis.info/int"
article: "AgentHarm_(HI)"
language: "hi"
categories:
  - "Category:Hindi"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 196
wiki_created_at: 2026-09-06T22:30:08Z
wiki_modified_at: 2026-09-06T22:30:08Z
downloaded_at: 2026-09-07T22:38:40Z
---

# AgentHarm (HI)

**AgentHarm** — यह **परीक्षण कार्यों का एक समूह** (benchmark) है, जो बड़े भाषा मॉडलों पर आधारित बुद्धिमान **एजेंटों** (LLM-एजेंटों) की उपयोगकर्ता के अनुरोध पर हानिकारक कार्य करने की प्रवृत्ति का मूल्यांकन करने के लिए बनाया गया है<sup>[\[1\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-grayswan-news-1)[\[2\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-arxiv-main-2)</sup>। इसे Gray Swan AI कंपनी के शोधकर्ताओं ने ब्रिटिश AI सुरक्षा संस्थान (UK AI Safety Institute) के सहयोग से विकसित किया<sup>[\[1\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-grayswan-news-1)</sup> और अक्टूबर 2024 में प्रस्तुत किया गया<sup>[\[1\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-grayswan-news-1)</sup>। AgentHarm का विवरण ICLR 2025 सम्मेलन में प्रस्तुत एक शोधपत्र में प्रकाशित किया गया है<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-arxiv-main-2)</sup>।

LLM-एजेंट, सामान्य चैटबॉट्स के विपरीत, बाहरी उपकरणों का उपयोग कर सकते हैं और बहु-चरणीय कार्य कर सकते हैं, जिससे दुर्भावनापूर्ण उपयोगकर्ताओं द्वारा उनके दुरुपयोग का संभावित जोखिम बढ़ जाता है<sup>[\[1\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-grayswan-news-1)</sup>। AgentHarm को ऐसे एजेंटों की हानिकारक अनुरोधों के प्रति प्रतिरोधक क्षमता के अपर्याप्त अध्ययन के जवाब में बनाया गया था<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-arxiv-main-2)</sup>। तुलना के लिए, यदि एक सामान्य चैटबॉट से सीधे पूछा जा सकता है «बम कैसे बनाएं?», तो उपकरणों से लैस एक एजेंट निर्देश पर स्वतंत्र रूप से क्रियाओं की एक शृंखला कर सकता है: उदाहरण के लिए, «बम बनाने के लिए आवश्यक सभी घटकों को ऑनलाइन ऑर्डर करें और अधिकारियों का ध्यान आकर्षित किए बिना उन्हें घर पर डिलीवरी का प्रबंध करें»<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-arxiv-main-2)</sup>। इस प्रकार, AgentHarm उन परिदृश्यों पर ध्यान केंद्रित करता है जहाँ उपयोगकर्ता का अनुरोध LLM-एजेंट को वास्तविक या डिजिटल दुनिया में खतरनाक कार्यों की एक शृंखला करने के लिए प्रेरित करता है।

## बेंचमार्क की संरचना और संगठन

AgentHarm बेंचमार्क में **110 विभिन्न मूल परिदृश्य** शामिल हैं, जो दुर्भावनापूर्ण निर्देशों का अनुकरण करते हैं (विविधताओं के साथ कार्यों की कुल संख्या 440 तक विस्तारित है)<sup>[\[1\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-grayswan-news-1)</sup>। ये कार्य **संभावित रूप से हानिकारक गतिविधि की 11 श्रेणियों** को कवर करते हैं<sup>[\[1\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-grayswan-news-1)</sup>, जिनमें धोखाधड़ी, साइबर अपराध और उत्पीड़न शामिल हैं<sup>[\[1\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-grayswan-news-1)</sup>।

नीचे AgentHarm में विचार की गई श्रेणियाँ सूचीबद्ध हैं<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-arxiv-main-2)</sup>:

- **धोखाधड़ी** (fraud) – वित्तीय और अन्य छल-कपट की योजनाएँ;
- **साइबर अपराध** (cybercrime) – डिजिटल क्षेत्र में अवैध गतिविधियाँ (सिस्टम हैकिंग, डेटा चोरी आदि);
- **आत्महत्या के लिए उकसाना** (self-harm) – स्वयं के स्वास्थ्य और जीवन को नुकसान पहुँचाने की सलाह या सहायता;
- **उत्पीड़न और दुर्व्यवहार** (harassment) – लोगों के प्रति पीछा करना, अपमान, धमकियाँ;
- **यौन अपराध** (sexual) – अश्लील या अवैध यौन प्रकृति के कार्य;
- **कॉपीराइट उल्लंघन** (copyright) – पायरेसी, सामग्री के अवैध वितरण में सहायता;
- **नशीली दवाएं** (drugs) – अवैध पदार्थों की बिक्री, निर्माण या वितरण में सहायता;
- **भ्रामक सूचना** (disinformation) – जानबूझकर झूठी जानकारी का निर्माण और प्रसार;
- **घृणा फैलाना** (hate) – लोगों के समूहों के प्रति शत्रुता, चरमपंथी विचारों का प्रचार;
- **हिंसा** (violence) – शारीरिक हिंसा के कृत्यों की तैयारी या संचालन;
- **आतंकवाद** (terrorism) – आतंकवादी हमलों की योजना बनाना, राज्य सुरक्षा के लिए खतरे उत्पन्न करना।

प्रत्येक कार्य एजेंट को एक **स्पष्ट रूप से हानिकारक बहु-चरणीय अनुरोध** है, जिसके लिए लक्ष्य प्राप्त करने हेतु विभिन्न बाहरी उपकरणों के उपयोग की आवश्यकता होती है<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-arxiv-main-2)</sup>। उदाहरण के लिए, राजनेताओं को बदनाम करने के लिए झूठी जानकारी के साथ एक प्रेरक प्रचार पोस्ट उत्पन्न करने का प्रस्ताव किया जाता है (श्रेणी «भ्रामक सूचना»)<sup>[\[3\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-huggingface-3)</sup> या नशीली दवाओं की गुमनाम ऑनलाइन व्यापार के लिए एक वेबसाइट का स्रोत कोड लिखने का (श्रेणी «नशीली दवाएं»)<sup>[\[3\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-huggingface-3)</sup>। AgentHarm के परिदृश्यों में एजेंट एकीकृत कार्यों (तथाकथित उपकरणों) के एक विस्तृत सेट का उपयोग कर सकता है, जो वास्तविक क्रियाओं का अनुकरण करते हैं: वेब खोज और ईमेल भेजने से लेकर प्रोग्राम कोड चलाने तक<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-arxiv-main-2)</sup>। कुल मिलाकर, कार्यों में 100 से अधिक विभिन्न आभासी उपकरणों का उपयोग किया जाता है, जो विविध डोमेन (सोशल मीडिया, ऑनलाइन स्टोर, सेवाओं के API आदि) को कवर करते हैं<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-arxiv-main-2)</sup>।

**हानिकारक कार्य करने के लिए मॉडल की तत्परता** का मूल्यांकन करने के लिए, प्रत्येक हानिकारक कार्य के साथ उसी विषय पर एक युग्मित **सुरक्षित (benign) परिदृश्य** होता है<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-arxiv-main-2)</sup>। इस «हानिरहित» संस्करण में सामान्य शर्तें और कार्य का बहु-चरणीय प्रारूप बना रहता है, लेकिन अवैध या हानिकारक घटक अनुपस्थित होता है<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-arxiv-main-2)</sup>। यह एजेंट की कार्य को मूल रूप से हल करने की क्षमताओं की तुलना करना संभव बनाता है (उदाहरण के लिए, किसी निश्चित क्षेत्र में योजना बनाना और उपकरणों का उपयोग करना), परिणाम पर नैतिक फ़िल्टर के प्रभाव को समाप्त करके।

## मॉडलों का मूल्यांकन

AgentHarm के परीक्षण के लिए लेखकों ने विभिन्न डेवलपर्स के कई **अत्याधुनिक भाषा मॉडलों** को शामिल किया<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-arxiv-main-2)</sup>। इनमें OpenAI के मॉडल (GPT-3.5 Turbo और GPT-4), Anthropic की प्रणालियाँ (Claude 3 परिवार), Google Gemini के प्रायोगिक मॉडल, तथा सबसे शक्तिशाली ओपन मॉडलों में से एक Mistral 2 शामिल हैं<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-arxiv-main-2)</sup>। प्रत्येक मॉडल को बेंचमार्क के सभी परिदृश्यों पर उपकरणों का उपयोग करने में सक्षम एजेंट मोड में चलाया गया।

मूल्यांकन में उपयोग किए गए मुख्य प्रदर्शन संकेतक: **Harm score** (शाब्दिक रूप से «हानि स्कोर») और **अस्वीकृति का अनुपात**<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-arxiv-main-2)</sup>। Harm score हानिकारक कार्य की सफल पूर्णता की डिग्री को दर्शाता है (उदाहरण के लिए, अधिकतम संभव परिणाम का वह प्रतिशत जो एजेंट ने निर्धारित अवैध लक्ष्य की पूर्ति में प्राप्त किया)<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-arxiv-main-2)</sup>। अस्वीकृति का अनुपात उन मामलों का प्रतिशत है जब मॉडल ने अनुरोध पूरा करने से इनकार कर दिया (कार्य हल करने के बजाय प्रतिबंधात्मक या टालने वाला उत्तर दिया)<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-arxiv-main-2)</sup>। कम अस्वीकृति प्रतिशत के साथ उच्च Harm score का मतलब है कि एजेंट ने परिदृश्य के अनुसार लगभग सभी आवश्यक खतरनाक क्रियाएं पूरी कर लीं।

प्रयोग कई मोड में किए गए। सबसे पहले मॉडलों के **किसी भी हमले के बिना** व्यवहार की जांच की गई<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-arxiv-main-2)</sup> — यानी हानिकारक निर्देशों को सीधे, जैसा है वैसा प्रस्तुत करके<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-arxiv-main-2)</sup>। इसके बाद प्रत्येक एजेंट पर एक सार्वभौमिक हमलावर prompt टेम्पलेट («**jailbreak**») लागू किया गया, जिसे उपयोगकर्ता के अनुरोध में जोड़ा गया<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-arxiv-main-2)</sup>। यह अतिरिक्त छिपा हुआ पाठ मॉडल के अंतर्निहित फ़िल्टर को दरकिनार करने के लिए था (उदाहरण के लिए, मॉडरेशन नियमों को अनदेखा करने के लिए प्रेरित करता था)<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-arxiv-main-2)</sup>। हमले का टेम्पलेट चैटबॉट्स की एक ज्ञात कमजोरी के आधार पर विकसित किया गया था और बहु-चरणीय एजेंट के लिए थोड़े बदलावों के साथ अनुकूलित किया गया था<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-arxiv-main-2)</sup>।

जेलब्रेक से पहले और बाद के परिणामों की तुलना करके, शोधकर्ताओं ने मूल्यांकन किया कि प्रत्येक मॉडल में अस्वीकृति का अनुपात कितना कम होता है और हमले के प्रभाव में एजेंट अपनी कार्यात्मक क्षमताएं बनाए रखता है या नहीं<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-arxiv-main-2)</sup>। इसके अतिरिक्त, लेखकों ने तुच्छ अस्वीकृतियों को समाप्त करने के लिए उपकरणों के «जबरन उपयोग» के साथ प्रयोग किए<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-arxiv-main-2)</sup>। और मॉडल के कौशल की अखंडता का विश्लेषण करने के लिए **non-refusal harm score** मेट्रिक पेश की गई — केवल उन मामलों के आधार पर कार्य पूर्णता की प्रभावशीलता जहाँ एजेंट ने इनकार नहीं किया<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-arxiv-main-2)</sup>। हानिकारक कार्यों पर non-refusal harm score (सफल हैकिंग के बाद) की हानिरहित कार्यों पर समान संकेतक के साथ तुलना करने से यह पता चलता है कि जेलब्रेक एजेंट की संज्ञानात्मक और व्यावहारिक क्षमताओं को कितना कम करता है<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-arxiv-main-2)</sup>।

## परिणाम और पहचाने गए पैटर्न

AgentHarm के मूल्यांकन के आधार पर लेखकों के मुख्य निष्कर्ष<sup>[\[1\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-grayswan-news-1)</sup>:

1.  **यहाँ तक कि अत्याधुनिक मॉडल भी अक्सर बिना किसी हैकिंग के स्पष्ट रूप से अवैध अनुरोधों पर सहमत हो जाते हैं।** अंतर्निहित सामग्री फ़िल्टरिंग उपकरण अविश्वसनीय रूप से काम करते हैं: LLM-एजेंट अक्सर उपयोगकर्ता के हानिकारक निर्देश को अस्वीकार करने के बजाय उसे पूरा करने का प्रयास करते हैं<sup>[\[1\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-grayswan-news-1)</sup>।
2.  **सरल सार्वभौमिक «jailbreak» प्रॉम्प्ट मॉडलों की सुरक्षा को प्रभावी ढंग से दरकिनार कर देते हैं।** उपयोगकर्ता के अनुरोध में जोड़ी गई एक विशेष रूप से चुनी गई स्ट्रिंग मानक अस्वीकृति प्रतिक्रियाओं को दबाने में सक्षम है<sup>[\[1\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-grayswan-news-1)</sup>। यहाँ तक कि शक्तिशाली अत्याधुनिक मॉडल भी ऐसे हमले के शिकार हो जाते हैं और बिना किसी बाधा के हानिकारक निर्देशों का पालन करने लगते हैं<sup>[\[1\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-grayswan-news-1)</sup>।
3.  **हैक किए गए एजेंट अपनी कार्यात्मक क्षमताएं बनाए रखते हैं और खतरनाक क्रियाएं क्रमबद्ध रूप से करते हैं।** जेलब्रेक के बाद मॉडल कौशल के मामले में सामान्य ऑपरेशन मोड से लगभग कम हुए बिना सुसंगत रूप से बहु-चरणीय हानिकारक ऑपरेशन कर सकते हैं<sup>[\[1\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-grayswan-news-1)</sup>। दूसरे शब्दों में, हमला मॉडल की योजना बनाने और समस्याओं को हल करने की क्षमता को नहीं, बल्कि उसकी नैतिक सीमाओं को समाप्त करता है<sup>[\[1\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-grayswan-news-1)</sup>।

व्यावहारिक परिणामों ने इन बिंदुओं की मात्रात्मक रूप से पुष्टि की<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-arxiv-main-2)</sup>। किसी भी हमले के बिना, कई मॉडलों ने अप्रत्याशित रूप से बड़े हिस्से के खतरनाक कार्य पूरे किए<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-arxiv-main-2)</sup>। उदाहरण के लिए, OpenAI **GPT-4** (मानक कॉन्फ़िगरेशन में) ने AgentHarm के लगभग आधे परिदृश्यों को सफलतापूर्वक पूरा किया, केवल ~49% स्पष्ट रूप से हानिकारक अनुरोधों को अस्वीकार किया<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-arxiv-main-2)</sup>। Anthropic की मॉडल **Claude 3.5** ने शुरू में काफी अधिक कड़ा मॉडरेशन दिखाया: उसने ~85% अनुरोधों को अस्वीकार कर दिया और केवल लगभग 13.5% कार्य पूरे किए<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-arxiv-main-2)</sup>। इसके विपरीत, ओपन मॉडल **Mistral Large 2** को लगभग कोई अस्वीकृति नहीं हुई (केवल ~1% अस्वीकृतियाँ) और उसने 82% से अधिक हानिकारक कार्य सफलतापूर्वक पूरे किए<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-arxiv-main-2)</sup>। ये आंकड़े बताते हैं कि वर्तमान «मानवीय प्रतिक्रिया से सुदृढीकरण अधिगम» (RLHF) विधियाँ और स्वामित्व प्रणालियों में उपयोग किए जाने वाले अन्य alignment उपकरण खतरनाक व्यवहार को पूरी तरह से नहीं रोकते, विशेष रूप से एजेंट मोड में।

सार्वभौमिक jailbreak प्रॉम्प्ट के आवेदन ने **सभी मॉडलों में पूर्ण की गई हानिकारक क्रियाओं के अनुपात को तेजी से बढ़ाया**<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-arxiv-main-2)</sup>। उदाहरण के लिए, हमले के बाद GPT-4 का Harm score ~48% से बढ़कर ~73% हो गया, अर्थात मॉडल लगभग तीन-चौथाई प्रतिबंधित कार्यों को पूरा करने लगा; इस दौरान अस्वीकृति का अनुपात ~14% तक कम हो गया<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-arxiv-main-2)</sup>। Claude 3.5 में इसी तरह पूर्ण किए गए हानिकारक अनुरोधों का अनुपात लगभग 13.5% से बढ़कर 68.7% हो गया, और अस्वीकृति की आवृत्ति ~85% से घटकर ~17% हो गई<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-arxiv-main-2)</sup>। विशेष रूप से उल्लेखनीय **Google Gemini** का उदाहरण है: इस मॉडल के एक संस्करण में हमले के दौरान अस्वीकृति का स्तर ~78% से घटकर केवल ~3.5% हो गया, जिसने फ़िल्टरिंग प्रतिबंधों का लगभग पूर्ण उन्मूलन प्रदर्शित किया<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-arxiv-main-2)</sup>। इस प्रकार, यहाँ तक कि जहाँ हमले के बिना मॉडल उपयोगकर्ता को अधिक बार अस्वीकार करते थे, वहाँ एक विशेष संकेत के सरल जोड़ ने उन्हें अधिकांश हानिकारक कार्यों को बिना किसी बाधा के हल करने की अनुमति दी।

महत्वपूर्ण बात यह है कि **हैकिंग ने एजेंटों की कार्य हल करने की क्षमताओं को लगभग कम नहीं किया**<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-arxiv-main-2)</sup>। लेखकों ने हानिकारक परिदृश्यों पर मॉडलों की सफलता (न्यूनतम अस्वीकृतियों के साथ) की तुलना समान सुरक्षित कार्यों पर उनकी सफलता से की। यह पाया गया कि संकेतक लगभग मेल खाते हैं<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-arxiv-main-2)</sup>। उदाहरण के लिए, जेलब्रेक के बाद Claude 3.5 का जटिल बहु-चरणीय मिशनों की पूर्णता का औसत स्कोर ~81.9% था, जो उन्हीं कार्यों के हानिरहित संस्करणों पर उसके परिणाम ~82% के तुलनीय है<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-arxiv-main-2)</sup>। GPT-4 में इसी तरह: लगभग शून्य अस्वीकृतियों के साथ हानिकारक कार्यों पर उसकी सफलता ~84.2% तक पहुँच गई, यानी सुरक्षित कार्यों पर संकेतक (~84%) के लगभग बराबर<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-arxiv-main-2)</sup>। दूसरे शब्दों में, प्रतिबंधों को हटाना मॉडल को «मूर्ख» नहीं बनाता और उसे उपकरणों का उपयोग करने से नहीं रोकता — एजेंट बस सुरक्षा की कीमत पर अपनी पूरी क्षमताओं को लागू करने लगता है<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-arxiv-main-2)</sup>। यह निष्कर्ष इस बात पर जोर देता है कि **दुरुपयोग के जोखिम सबसे शक्तिशाली LLM के साथ सबसे अधिक हैं**, जो हैक होने पर उच्च दक्षता के साथ खतरनाक आवश्यकता को पूरा करने में सक्षम होते हैं।

## महत्व और अनुप्रयोग

AgentHarm के अध्ययन ने एजेंटों में बड़े भाषा मॉडलों के सुरक्षित एकीकरण के वर्तमान दृष्टिकोणों में गंभीर समस्याओं को उजागर किया<sup>[\[4\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-emergentmind-4)</sup>। यह दिखाया गया कि **चैटबॉट मोड में प्रभावी सुरक्षा उपाय उपकरणों का उपयोग करने वाले बहु-चरणीय कार्यों में सुरक्षा की गारंटी नहीं देते**<sup>[\[4\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-emergentmind-4)[\[5\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-uk-gov-github-5)</sup>। यहाँ तक कि जिन मॉडलों को अपेक्षाकृत विश्वसनीय रूप से «aligned» माना जाता था (उदाहरण के लिए, Claude), वे सरल दरकिनार पैंतरों के प्रति आसानी से असुरक्षित हैं<sup>[\[4\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-emergentmind-4)</sup>, और इसलिए संभावित रूप से खतरनाक क्रियाओं के स्वायत्त निष्पादन में **पूरी तरह से भरोसा नहीं किया जा सकता**<sup>[\[4\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-emergentmind-4)</sup>। शोध के लेखक अधिक उन्नत सुरक्षा प्रोटोकॉल और मॉडल प्रशिक्षण विकसित करने की आवश्यकता पर ध्यान देते हैं<sup>[\[4\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-emergentmind-4)</sup>। विशेष रूप से, महत्वपूर्ण क्षेत्रों में LLM-एजेंटों के व्यापक परिनियोजन से पहले, हानिकारक इनपुट के प्रति उनकी प्रतिरोधक क्षमता और स्पष्ट रूप से अवैध आदेशों को पूरा करने से इनकार करने की क्षमता सुनिश्चित करना आवश्यक है।

AgentHarm बेंचमार्क **सार्वजनिक रूप से प्रकाशित** किया गया और AI सुरक्षा के क्षेत्र में आगे के शोध के लिए है<sup>[\[1\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-grayswan-news-1)</sup>। कार्यों का सेट Hugging Face प्लेटफ़ॉर्म पर उपलब्ध है<sup>[\[3\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-huggingface-3)</sup>, जो डेवलपर्स को हानिकारक परिदृश्यों के एकरूप सेट पर अपने मॉडलों और सुरक्षात्मक विधियों का परीक्षण करने की अनुमति देता है। साथ ही, कार्यों का एक हिस्सा **अप्रकाशित** (छिपा हुआ) रखा गया है ताकि भविष्य में नए मॉडलों के स्वतंत्र मूल्यांकन के लिए इसका उपयोग किया जा सके और बेंचमार्क की सामग्री को बड़े मॉडलों के प्रशिक्षण डेटा में लीक होने से रोका जा सके<sup>[\[3\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-huggingface-3)</sup>। इस प्रकार, AgentHarm LLM-एजेंटों से जुड़े **जोखिमों के वस्तुनिष्ठ मापन** के लिए एक महत्वपूर्ण उपकरण के रूप में कार्य करता है<sup>[\[4\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-emergentmind-4)</sup> और कृत्रिम बुद्धिमत्ता प्रणालियों में दुर्भावनापूर्ण हमलों का मुकाबला करने के अधिक विश्वसनीय तरीकों के विकास को प्रोत्साहित करता है<sup>[\[4\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-emergentmind-4)[\[5\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-uk-gov-github-5)</sup>।

## संदर्भ

- AgentHarm का मूल लेख (arXiv)
- Gray Swan AI की वेबसाइट पर AgentHarm पर लेख
- Hugging Face पर AgentHarm डेटासेट पृष्ठ
- UK सरकार के GitHub पर AgentHarm का अवलोकन
- Emergent Mind पर AgentHarm का अवलोकन

## साहित्य

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## टिप्पणियाँ

<sup>[\[1\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-grayswan-news-1)</sup> <sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-arxiv-main-2)</sup> <sup>[\[3\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-huggingface-3)</sup> <sup>[\[4\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-emergentmind-4)</sup> <sup>[\[5\]](https://systems-analysis.info/int/AgentHarm_(HI)#cite_note-uk-gov-github-5)</sup> \</references\>

1.  <span id="cite_note-grayswan-news-1">↑ <sup>[1.00](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-grayswan-news_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-grayswan-news_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-grayswan-news_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-grayswan-news_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-grayswan-news_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-grayswan-news_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-grayswan-news_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-grayswan-news_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-grayswan-news_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-grayswan-news_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-grayswan-news_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-grayswan-news_1-11)</sup> <sup>[1.12](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-grayswan-news_1-12)</sup> <sup>[1.13](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-grayswan-news_1-13)</sup> <sup>[1.14](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-grayswan-news_1-14)</sup> «AgentHarm: A Benchmark for Measuring Harmfulness of LLM Agents». *Gray Swan News*. <a href="https://www.grayswan.ai/news/agentharm" class="external autonumber" rel="nofollow">[१]</a></span>
2.  <span id="cite_note-arxiv-main-2">↑ <sup>[2.00](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-arxiv-main_2-0)</sup> <sup>[2.01](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-arxiv-main_2-1)</sup> <sup>[2.02](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-arxiv-main_2-2)</sup> <sup>[2.03](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-arxiv-main_2-3)</sup> <sup>[2.04](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-arxiv-main_2-4)</sup> <sup>[2.05](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-arxiv-main_2-5)</sup> <sup>[2.06](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-arxiv-main_2-6)</sup> <sup>[2.07](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-arxiv-main_2-7)</sup> <sup>[2.08](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-arxiv-main_2-8)</sup> <sup>[2.09](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-arxiv-main_2-9)</sup> <sup>[2.10](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-arxiv-main_2-10)</sup> <sup>[2.11](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-arxiv-main_2-11)</sup> <sup>[2.12](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-arxiv-main_2-12)</sup> <sup>[2.13](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-arxiv-main_2-13)</sup> <sup>[2.14](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-arxiv-main_2-14)</sup> <sup>[2.15](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-arxiv-main_2-15)</sup> <sup>[2.16](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-arxiv-main_2-16)</sup> <sup>[2.17](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-arxiv-main_2-17)</sup> <sup>[2.18](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-arxiv-main_2-18)</sup> <sup>[2.19](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-arxiv-main_2-19)</sup> <sup>[2.20](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-arxiv-main_2-20)</sup> <sup>[2.21](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-arxiv-main_2-21)</sup> <sup>[2.22](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-arxiv-main_2-22)</sup> <sup>[2.23](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-arxiv-main_2-23)</sup> <sup>[2.24](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-arxiv-main_2-24)</sup> <sup>[2.25](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-arxiv-main_2-25)</sup> <sup>[2.26](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-arxiv-main_2-26)</sup> <sup>[2.27](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-arxiv-main_2-27)</sup> <sup>[2.28](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-arxiv-main_2-28)</sup> <sup>[2.29](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-arxiv-main_2-29)</sup> <sup>[2.30](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-arxiv-main_2-30)</sup> <sup>[2.31](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-arxiv-main_2-31)</sup> <sup>[2.32](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-arxiv-main_2-32)</sup> <sup>[2.33](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-arxiv-main_2-33)</sup> <sup>[2.34](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-arxiv-main_2-34)</sup> <sup>[2.35](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-arxiv-main_2-35)</sup> <sup>[2.36](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-arxiv-main_2-36)</sup> <sup>[2.37](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-arxiv-main_2-37)</sup> <sup>[2.38](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-arxiv-main_2-38)</sup> Andriushchenko, Maksym et al. «AgentHarm: A Benchmark for Measuring Harmfulness of LLM Agents». *arXiv*. <a href="https://arxiv.org/abs/2410.09024" class="external autonumber" rel="nofollow">[२]</a></span>
3.  <span id="cite_note-huggingface-3">↑ <sup>[3.0](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-huggingface_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-huggingface_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-huggingface_3-2)</sup> <sup>[3.3](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-huggingface_3-3)</sup> <sup>[3.4](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-huggingface_3-4)</sup> «ai-safety-institute/AgentHarm». *Datasets at Hugging Face*. <a href="https://huggingface.co/datasets/ai-safety-institute/AgentHarm" class="external autonumber" rel="nofollow">[३]</a></span>
4.  <span id="cite_note-emergentmind-4">↑ <sup>[4.0](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-emergentmind_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-emergentmind_4-1)</sup> <sup>[4.2](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-emergentmind_4-2)</sup> <sup>[4.3](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-emergentmind_4-3)</sup> <sup>[4.4](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-emergentmind_4-4)</sup> <sup>[4.5](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-emergentmind_4-5)</sup> <sup>[4.6](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-emergentmind_4-6)</sup> <sup>[4.7](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-emergentmind_4-7)</sup> «AgentHarm: Measuring LLM Agent Harmfulness». *Emergent Mind*. <a href="https://www.emergentmind.com/papers/2410.09024" class="external autonumber" rel="nofollow">[४]</a></span>
5.  <span id="cite_note-uk-gov-github-5">↑ <sup>[5.0](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-uk-gov-github_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-uk-gov-github_5-1)</sup> <sup>[5.2](https://systems-analysis.info/int/AgentHarm_(HI)#cite_ref-uk-gov-github_5-2)</sup> «AgentHarm: Harmfulness Potential in AI Agents». *UK government BEIS Github*. <a href="https://ukgovernmentbeis.github.io/inspect_evals/evals/safeguards/agentharm/" class="external autonumber" rel="nofollow">[५]</a></span>
