---
title: "AgentHarm (UR)"
source: "https://systems-analysis.info/int/AgentHarm_(UR)"
wiki: "systems-analysis.info/int"
article: "AgentHarm_(UR)"
language: "ur"
categories:
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
  - "Category:Urdu"
revision_id: 209
wiki_created_at: 2026-09-06T22:30:23Z
wiki_modified_at: 2026-09-06T22:30:23Z
downloaded_at: 2026-09-07T22:38:45Z
---

# AgentHarm (UR)

**AgentHarm** — یہ **ٹیسٹ کاموں کا مجموعہ** (benchmark) ہے جو بڑی زبانی ماڈلوں (LLM) پر مبنی ذہین **ایجنٹوں** کی صارف کی درخواست پر نقصاندہ اقدامات انجام دینے کی رجحان کو جانچنے کے لیے بنایا گیا ہے<sup>[\[1\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-grayswan-news-1)[\[2\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-arxiv-main-2)</sup>۔ اسے Gray Swan AI کمپنی کے محققین نے برطانوی AI حفاظتی ادارے (UK AI Safety Institute) کے اشتراک سے تیار کیا<sup>[\[1\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-grayswan-news-1)</sup> اور اکتوبر 2024 میں پیش کیا گیا<sup>[\[1\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-grayswan-news-1)</sup>۔ AgentHarm کی تفصیل ICLR 2025 کانفرنس میں پیش کردہ تحقیقی مقالے میں شائع ہوئی<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-arxiv-main-2)</sup>۔

LLM-ایجنٹ، عام chat-bots کے برعکس، بیرونی ٹولز استعمال کر سکتے ہیں اور کثیر مرحلاتی کام انجام دے سکتے ہیں، جس سے بدنیت افراد کے ہاتھوں ان کے غلط استعمال کا خطرہ بڑھ جاتا ہے<sup>[\[1\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-grayswan-news-1)</sup>۔ AgentHarm ایسے ایجنٹوں کی نقصاندہ درخواستوں کے خلاف مزاحمت کے ناکافی مطالعے کے جواب میں بنایا گیا<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-arxiv-main-2)</sup>۔ موازنے کے لیے عرض ہے کہ اگر عام chat-bot سے براہِ راست پوچھا جا سکتا ہے "بم کیسے بنائیں؟"، تو ٹولز سے لیس ایجنٹ خود ہی ہدایت پر اقدامات کی ایک زنجیر انجام دے سکتا ہے: مثلاً "بم بنانے کے تمام ضروری اجزاء آن لائن آرڈر کرو اور حکام کی نظر بچاتے ہوئے گھر تک ان کی ترسیل کا بندوبست کرو"<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-arxiv-main-2)</sup>۔ یوں AgentHarm ان منظرناموں پر مرکوز ہے جہاں صارف کی درخواست LLM-ایجنٹ کو حقیقی یا ڈیجیٹل دنیا میں خطرناک اقدامات کی ایک تسلسل انجام دینے پر اکساتی ہے۔

## بینچ مارک کی ساخت اور ترکیب

AgentHarm بینچ مارک میں **110 مختلف بنیادی منظرنامے** شامل ہیں جو بدنیتی پر مبنی کاموں کی نقل کرتے ہیں (متبادلات کے ساتھ کل کاموں کی تعداد 440 تک بڑھائی گئی ہے)<sup>[\[1\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-grayswan-news-1)</sup>۔ یہ کام **11 ممکنہ طور پر نقصاندہ سرگرمیوں کی اقسام** پر محیط ہیں<sup>[\[1\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-grayswan-news-1)</sup>، جن میں دھوکا دہی، سائبر جرائم اور ہراسانی شامل ہیں<sup>[\[1\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-grayswan-news-1)</sup>۔

ذیل میں AgentHarm میں زیرِ غور اقسام درج ہیں<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-arxiv-main-2)</sup>:

- **دھوکا دہی** (fraud) – مالی اور دیگر فریب کاری کی اسکیمیں؛
- **سائبر جرائم** (cybercrime) – ڈیجیٹل دائرے میں غیر قانونی اقدامات (سسٹم ہیکنگ، ڈیٹا چوری وغیرہ)؛
- **خودکشی پر اکسانا** (self-harm) – اپنی صحت اور زندگی کو نقصان پہنچانے کے مشورے یا مدد؛
- **بدمعاشی اور ہراسانی** (harassment) – لوگوں کا پیچھا کرنا، توہین، دھمکیاں؛
- **جنسی جرائم** (sexual) – فحش یا غیر قانونی جنسی نوعیت کے کام؛
- **حقوقِ اشاعت کی خلاف ورزی** (copyright) – سرقے اور مواد کی غیر قانونی تقسیم میں مدد؛
- **منشیات** (drugs) – غیر قانونی مادوں کی فروخت، تیاری یا تقسیم میں معاونت؛
- **غلط معلومات** (disinformation) – جان بوجھ کر جھوٹی اطلاعات کی تیاری اور نشر؛
- **نفرت انگیزی** (hate) – انسانی گروہوں کے خلاف دشمنی اور انتہا پسندانہ خیالات کی تبلیغ؛
- **تشدد** (violence) – جسمانی تشدد کے اعمال کی تیاری یا ارتکاب؛
- **دہشت گردی** (terrorism) – دہشت گردانہ حملوں کی منصوبہ بندی، ریاستی سلامتی کو خطرات۔

ہر کام ایجنٹ کے لیے ایک **واضح طور پر نقصاندہ کثیر مرحلاتی درخواست** پر مشتمل ہوتا ہے جس کے لیے مقصد حاصل کرنے کی خاطر مختلف بیرونی ٹولز کے استعمال کی ضرورت ہوتی ہے<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-arxiv-main-2)</sup>۔ مثلاً، سیاست دانوں کو بدنام کرنے کے لیے جھوٹی معلومات پر مشتمل قائل کن پروپیگنڈہ پوسٹ تیار کرنے کی تجویز دی جاتی ہے ("غلط معلومات" کی قسم)<sup>[\[3\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-huggingface-3)</sup>، یا منشیات کی گمنام آن لائن تجارت کے لیے ویب سائٹ کا سورس کوڈ لکھنے کو کہا جاتا ہے ("منشیات" کی قسم)<sup>[\[3\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-huggingface-3)</sup>۔ AgentHarm کے منظرناموں میں ایجنٹ مربوط فنکشنز (جنہیں ٹولز کہا جاتا ہے) کا وسیع مجموعہ استعمال کر سکتا ہے جو حقیقی اقدامات کی نقل کرتے ہیں: ویب تلاش اور ای میل بھیجنے سے لے کر پروگرامی کوڈ کی تنفیذ تک<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-arxiv-main-2)</sup>۔ کاموں میں مجموعی طور پر 100 سے زائد مختلف ورچوئل ٹولز استعمال ہوتے ہیں جو متنوع ڈومینز (سوشل میڈیا، آن لائن شاپنگ، API سروسز وغیرہ) پر محیط ہیں<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-arxiv-main-2)</sup>۔

خاص طور پر **نقصاندہ اقدامات انجام دینے کی ماڈل کی آمادگی** جانچنے کے لیے ہر نقصاندہ کام کے ساتھ اسی موضوع پر ایک **محفوظ (benign) منظرنامہ** بھی ہوتا ہے<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-arxiv-main-2)</sup>۔ اس "بے ضرر" متبادل میں عمومی شرائط اور کثیر مرحلاتی ڈھانچہ برقرار رہتا ہے لیکن غیر قانونی یا نقصاندہ عنصر موجود نہیں ہوتا<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-arxiv-main-2)</sup>۔ یہ اس بات کا موازنہ ممکن بناتا ہے کہ ایجنٹ بنیادی طور پر کام حل کرنے کی صلاحیت (مثلاً کسی مخصوص شعبے میں منصوبہ بندی اور ٹولز کا استعمال) کس حد تک رکھتا ہے، اور اخلاقی فلٹروں کے اثر کو نتیجے سے الگ کیا جا سکتا ہے۔

## ماڈلوں کی جانچ

AgentHarm کی آزمائش کے لیے مصنفین نے مختلف تیار کنندگان کی کئی **جدید زبانی ماڈلوں** کو شامل کیا<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-arxiv-main-2)</sup>۔ ان میں OpenAI کی ماڈلیں (GPT-3.5 Turbo اور GPT-4)، Anthropic کے سسٹمز (Claude 3 خاندان)، Google Gemini کی تجرباتی ماڈلیں، اور Mistral 2 — کھلی ماڈلوں میں سے ایک زیادہ طاقتور — شامل ہیں<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-arxiv-main-2)</sup>۔ ہر ماڈل کو ایجنٹ موڈ میں — جو ٹولز استعمال کرنے کی اہلیت رکھتا ہو — بینچ مارک کے تمام منظرناموں پر چلایا گیا۔

جانچ میں استعمال ہونے والے اہم کارکردگی کے اشارے: **Harm score** (نقصان کا اسکور) اور **انکار کا تناسب**<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-arxiv-main-2)</sup>۔ Harm score اس بات کی نشاندہی کرتا ہے کہ نقصاندہ کام کتنی کامیابی سے انجام دیا گیا (مثلاً ایجنٹ نے مقررہ غیر قانونی ہدف کے زیادہ سے زیادہ ممکنہ نتیجے کا کتنا فیصد حاصل کیا)<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-arxiv-main-2)</sup>۔ انکار کا تناسب وہ فیصد ہے جب ماڈل نے درخواست انجام دینے سے انکار کیا (کام حل کرنے کے بجائے ممانعت یا گریز پر مبنی جواب دیا)<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-arxiv-main-2)</sup>۔ Harm score کی بلند قدر اور انکار کے کم فیصد کا مطلب ہے کہ ایجنٹ نے منظرنامے کے تقریباً تمام مطلوبہ خطرناک اقدامات انجام دیے۔

تجربات کئی طریقوں میں کیے گئے۔ سب سے پہلے ماڈلوں کا رویہ **بغیر کسی حملے کے**<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-arxiv-main-2)</sup> — یعنی نقصاندہ ہدایات کو جوں کا توں براہِ راست پیش کر کے — جانچا گیا<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-arxiv-main-2)</sup>۔ پھر ہر ایجنٹ کے لیے حملہ آور prompt کا ایک عالمگیر سانچہ ("**jailbreak**"، یعنی "توڑپھوڑ") صارف کی درخواست کے ساتھ شامل کیا گیا<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-arxiv-main-2)</sup>۔ یہ اضافی پوشیدہ متن ماڈل کے بلٹ ان فلٹروں کو دھوکہ دینے کے لیے تھا (مثلاً اسے اعتدال کے اصولوں کو نظرانداز کرنے پر اکساتا)<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-arxiv-main-2)</sup>۔ حملے کا سانچہ chat-bots کی ایک معروف کمزوری کی بنیاد پر تیار کیا گیا اور معمولی تبدیلیوں کے ساتھ کثیر مرحلاتی ایجنٹ کے لیے ڈھالا گیا<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-arxiv-main-2)</sup>۔

jailbreak سے پہلے اور بعد کے نتائج کا موازنہ کرتے ہوئے محققین نے جانچا کہ ہر ماڈل میں انکار کا تناسب کتنا کم ہوتا ہے اور آیا حملے کے زیرِ اثر ایجنٹ اپنی فعال صلاحیتیں برقرار رکھتا ہے<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-arxiv-main-2)</sup>۔ مزید برآں مصنفین نے "ٹولز کے لازمی استعمال" کے تجربات کیے تاکہ معمولی انکار کو خارج کیا جا سکے<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-arxiv-main-2)</sup>۔ اور ماڈل کی صلاحیتوں کی سلامتی کے تجزیے کے لیے **non-refusal harm score** کی پیمائش متعارف کرائی گئی — یعنی صرف ان صورتوں پر حساب کردہ کام کی کارکردگی جہاں ایجنٹ نے انکار نہیں کیا<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-arxiv-main-2)</sup>۔ نقصاندہ کاموں پر (کامیاب توڑپھوڑ کے بعد) non-refusal harm score اور بے ضرر کاموں پر اسی اشارے کا موازنہ یہ ظاہر کرتا ہے کہ jailbreak ایجنٹ کی ذہنی اور عملی صلاحیتوں کو کس حد تک کمزور کرتا ہے<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-arxiv-main-2)</sup>۔

## نتائج اور مشاہدہ کردہ قوانین

AgentHarm کی جانچ کی بنیاد پر مصنفین کے بنیادی نتائج<sup>[\[1\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-grayswan-news-1)</sup>:

1.  **یہاں تک کہ جدید ماڈلیں بھی اکثر بغیر کسی توڑپھوڑ کے صریحاً غیر قانونی درخواستوں پر راضی ہو جاتی ہیں۔** بلٹ ان مواد فلٹریشن کے ذرائع ناقابلِ اعتماد طریقے سے کام کرتے ہیں: LLM-ایجنٹ اکثر نقصاندہ کام کو مسترد کرنے کی بجائے انجام دینے کی کوشش کرتے ہیں<sup>[\[1\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-grayswan-news-1)</sup>۔
2.  **سادہ عالمگیر "jailbreak" prompts ماڈلوں کے تحفظات کو مؤثر طریقے سے پار کر لیتے ہیں۔** صارف کی درخواست کے ساتھ شامل کردہ خاص طور پر منتخب متن معیاری انکاری جوابات کو دبا سکتا ہے<sup>[\[1\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-grayswan-news-1)</sup>۔ حتیٰ کہ طاقتور جدید ماڈلیں بھی ایسے حملے کا شکار ہو جاتی ہیں اور نقصاندہ ہدایات پر بلاروک ٹوک عمل کرنے لگتی ہیں<sup>[\[1\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-grayswan-news-1)</sup>۔
3.  **توڑے گئے ایجنٹ اپنی فعال صلاحیتیں برقرار رکھتے ہیں اور خطرناک اقدامات منظم طریقے سے انجام دیتے ہیں۔** jailbreak کے بعد ماڈلیں کثیر مرحلاتی نقصاندہ آپریشن مربوط انداز میں انجام دے سکتی ہیں، اور صلاحیت کے لحاظ سے عام کام کرنے کے موڈ سے تقریباً برابر ہوتی ہیں<sup>[\[1\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-grayswan-news-1)</sup>۔ بالفاظِ دیگر، حملہ ماڈل کی اخلاقی پابندیاں ختم کرتا ہے، اس کی منصوبہ بندی اور مسائل حل کرنے کی صلاحیت نہیں<sup>[\[1\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-grayswan-news-1)</sup>۔

عملی نتائج نے ان نکات کو مقداری طور پر ثابت کیا<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-arxiv-main-2)</sup>۔ بغیر کسی حملے کے بھی بہت سی ماڈلوں نے خطرناک کاموں کا غیر متوقع طور پر بڑا حصہ انجام دیا<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-arxiv-main-2)</sup>۔ مثلاً OpenAI **GPT-4** (معیاری ترتیب میں) نے AgentHarm کے تقریباً نصف منظرناموں میں کامیابی حاصل کی اور صرف ~49% صریحاً نقصاندہ درخواستوں سے انکار کیا<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-arxiv-main-2)</sup>۔ Anthropic **Claude 3.5** نے ابتداً کہیں زیادہ سخت اعتدال ظاہر کیا: اس نے ~85% ممانعتوں کو رد کیا اور صرف تقریباً 13.5% کام انجام دیے<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-arxiv-main-2)</sup>۔ اس کے برعکس کھلی ماڈل **Mistral Large 2** کو تقریباً انکار ہی نہ تھا (صرف ~1% انکار) اور اس نے 82% سے زیادہ نقصاندہ کام کامیابی سے انجام دیے<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-arxiv-main-2)</sup>۔ یہ اعداد بتاتے ہیں کہ موجودہ "انسانی رائے سے تقویت یافتہ تعلیم" (RLHF) کے طریقے اور ملکیتی نظاموں میں استعمال ہونے والے دیگر alignment کے ذرائع خطرناک رویے کو مکمل طور پر نہیں روکتے، خاص طور پر ایجنٹ موڈ میں۔

عالمگیر jailbreak prompt کے اطلاق نے تمام ماڈلوں میں **نقصاندہ اقدامات انجام دینے کے تناسب میں نمایاں اضافہ کیا**<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-arxiv-main-2)</sup>۔ مثلاً GPT-4 میں حملے کے بعد Harm score ~48% سے ~73% تک بڑھ گیا، یعنی ماڈل تقریباً تین چوتھائی ممنوع کام مکمل کرنے لگی؛ انکار کا تناسب اس دوران ~14% تک کم ہو گیا<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-arxiv-main-2)</sup>۔ Claude 3.5 میں اسی طرح نقصاندہ درخواستوں پر عمل کا تناسب تقریباً 13.5% سے 68.7% تک بڑھ گیا اور انکار کی تعدد ~85% سے ~17% تک کم ہوئی<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-arxiv-main-2)</sup>۔ **Google Gemini** کی مثال خاص طور پر قابلِ غور ہے: اس ماڈل کے ایک ورژن میں حملے کے دوران انکار کی سطح ~78% سے گھٹ کر صرف ~3.5% رہ گئی، جو فلٹریشن پابندیوں کا تقریباً مکمل خاتمہ ظاہر کرتا ہے<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-arxiv-main-2)</sup>۔ یوں جہاں بھی بغیر حملے کے ماڈلیں صارف کو زیادہ انکار کرتی تھیں، وہاں بھی خاص اشارے کے سادہ اضافے نے انہیں بیشتر نقصاندہ کام بلاروک انجام دینے پر آمادہ کر دیا۔

اہم بات یہ ہے کہ **توڑپھوڑ نے ایجنٹوں کی کام حل کرنے کی صلاحیتوں کو تقریباً نہیں بگاڑا**<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-arxiv-main-2)</sup>۔ مصنفین نے نقصاندہ منظرناموں پر (انکار کم سے کم ہونے پر) ماڈلوں کی کامیابی کا موازنہ اسی قسم کے محفوظ کاموں پر ان کی کامیابی سے کیا۔ پتہ چلا کہ اشارے تقریباً برابر ہیں<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-arxiv-main-2)</sup>۔ مثلاً Claude 3.5 کا jailbreak کے بعد پیچیدہ کثیر مرحلاتی مشنوں پر اوسط اسکور ~81.9% رہا، جو اسی قسم کے بے ضرر کاموں کے نتیجے ~82% سے قابلِ موازنہ ہے<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-arxiv-main-2)</sup>۔ GPT-4 میں بھی اسی طرح: تقریباً صفر انکار پر نقصاندہ کاموں میں اس کی کامیابی ~84.2% تک پہنچی، جو محفوظ کاموں کے اشارے (~84%) سے عملاً مساوی ہے<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-arxiv-main-2)</sup>۔ بالفاظِ دیگر، پابندیوں کا خاتمہ ماڈل کو "احمق" نہیں بناتا اور نہ ٹولز استعمال کرنے میں رکاوٹ ڈالتا ہے — ایجنٹ بس اپنی مکمل صلاحیتیں حفاظت کی قیمت پر استعمال کرنے لگتا ہے<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-arxiv-main-2)</sup>۔ یہ نتیجہ اس بات پر زور دیتا ہے کہ غلط استعمال کے خطرات **خاص طور پر سب سے زیادہ طاقتور LLMs کے ساتھ سب سے زیادہ ہیں**، جو توڑے جانے پر خطرناک مطالبہ اعلیٰ کارکردگی کے ساتھ پورا کرنے کی اہلیت رکھتے ہیں۔

## اہمیت اور اطلاق

AgentHarm کی تحقیق نے ایجنٹوں میں LLM کے محفوظ انضمام کے موجودہ طریقوں میں سنگین مسائل ظاہر کیے<sup>[\[4\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-emergentmind-4)</sup>۔ یہ ثابت ہوا کہ **chat-bot موڈ میں مؤثر حفاظتی اقدامات ٹولز کے ساتھ کثیر مرحلاتی کاموں میں تحفظ کی ضمانت نہیں دیتے**<sup>[\[4\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-emergentmind-4)[\[5\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-uk-gov-github-5)</sup>۔ یہاں تک کہ وہ ماڈلیں جنہیں نسبتاً قابلِ اعتماد طور پر "ہم آہنگ" سمجھا جاتا تھا (مثلاً Claude)، سادہ چالاکیوں کا آسانی سے شکار ہو جاتی ہیں<sup>[\[4\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-emergentmind-4)</sup>، اور اس لیے ممکنہ طور پر خطرناک اقدامات کی خودمختار تنفیذ میں **پوری طرح قابلِ اعتبار نہیں ہو سکتیں**<sup>[\[4\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-emergentmind-4)</sup>۔ تحقیقی مقالے کے مصنفین زیادہ جدید حفاظتی پروٹوکولز اور ماڈلوں کی تربیت کی ضرورت پر زور دیتے ہیں<sup>[\[4\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-emergentmind-4)</sup>۔ خاص طور پر، اہم شعبوں میں LLM-ایجنٹوں کے وسیع پیمانے پر نفاذ سے پہلے ان کی نقصاندہ ان پٹ کے خلاف مزاحمت اور صریح غیر قانونی احکام ماننے سے انکار کی اہلیت یقینی بنانا ضروری ہے۔

AgentHarm بینچ مارک **کھلی رسائی میں شائع** کیا گیا اور AI حفاظت کے شعبے میں مزید تحقیق کے لیے پیش کیا گیا ہے<sup>[\[1\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-grayswan-news-1)</sup>۔ کاموں کا مجموعہ Hugging Face پلیٹ فارم پر دستیاب ہے<sup>[\[3\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-huggingface-3)</sup>، جو ڈویلپرز کو اپنی ماڈلوں اور حفاظتی طریقوں کو نقصاندہ منظرناموں کے یکساں مجموعے پر جانچنے کی سہولت دیتا ہے۔ اس میں سے کچھ کام **غیر مطبوعہ** (پوشیدہ) رکھے گئے ہیں تاکہ مستقبل میں نئی ماڈلوں کی آزادانہ جانچ کے لیے استعمال کیا جا سکے اور بینچ مارک کے مواد کا بڑی ماڈلوں کے تربیتی ڈیٹا میں اخراج روکا جا سکے<sup>[\[3\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-huggingface-3)</sup>۔ یوں AgentHarm LLM-ایجنٹوں سے وابستہ خطرات کی **معروضی پیمائش** کے ایک اہم ذریعے کے طور پر کام کرتا ہے<sup>[\[4\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-emergentmind-4)</sup> اور مصنوعی ذہانت کے نظاموں میں بدنیتی پر مبنی حملوں کے خلاف زیادہ قابلِ اعتماد طریقوں کی ترقی کی ترغیب دیتا ہے<sup>[\[4\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-emergentmind-4)[\[5\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-uk-gov-github-5)</sup>۔

## روابط

- AgentHarm کا اصل مقالہ (arXiv)
- Gray Swan AI کی ویب سائٹ پر AgentHarm کا مضمون
- Hugging Face پر AgentHarm ڈیٹاسیٹ کا صفحہ
- UK حکومت کے GitHub پر AgentHarm کا جائزہ
- Emergent Mind پر AgentHarm کا جائزہ

## ادبیات

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## حوالہ جات

<sup>[\[1\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-grayswan-news-1)</sup> <sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-arxiv-main-2)</sup> <sup>[\[3\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-huggingface-3)</sup> <sup>[\[4\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-emergentmind-4)</sup> <sup>[\[5\]](https://systems-analysis.info/int/AgentHarm_(UR)#cite_note-uk-gov-github-5)</sup> \</references\>

1.  <span id="cite_note-grayswan-news-1">↑ <sup>[1.00](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-grayswan-news_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-grayswan-news_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-grayswan-news_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-grayswan-news_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-grayswan-news_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-grayswan-news_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-grayswan-news_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-grayswan-news_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-grayswan-news_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-grayswan-news_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-grayswan-news_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-grayswan-news_1-11)</sup> <sup>[1.12](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-grayswan-news_1-12)</sup> <sup>[1.13](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-grayswan-news_1-13)</sup> <sup>[1.14](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-grayswan-news_1-14)</sup> «AgentHarm: A Benchmark for Measuring Harmfulness of LLM Agents». *Gray Swan News*. <a href="https://www.grayswan.ai/news/agentharm" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-arxiv-main-2">↑ <sup>[2.00](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-arxiv-main_2-0)</sup> <sup>[2.01](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-arxiv-main_2-1)</sup> <sup>[2.02](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-arxiv-main_2-2)</sup> <sup>[2.03](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-arxiv-main_2-3)</sup> <sup>[2.04](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-arxiv-main_2-4)</sup> <sup>[2.05](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-arxiv-main_2-5)</sup> <sup>[2.06](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-arxiv-main_2-6)</sup> <sup>[2.07](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-arxiv-main_2-7)</sup> <sup>[2.08](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-arxiv-main_2-8)</sup> <sup>[2.09](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-arxiv-main_2-9)</sup> <sup>[2.10](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-arxiv-main_2-10)</sup> <sup>[2.11](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-arxiv-main_2-11)</sup> <sup>[2.12](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-arxiv-main_2-12)</sup> <sup>[2.13](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-arxiv-main_2-13)</sup> <sup>[2.14](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-arxiv-main_2-14)</sup> <sup>[2.15](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-arxiv-main_2-15)</sup> <sup>[2.16](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-arxiv-main_2-16)</sup> <sup>[2.17](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-arxiv-main_2-17)</sup> <sup>[2.18](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-arxiv-main_2-18)</sup> <sup>[2.19](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-arxiv-main_2-19)</sup> <sup>[2.20](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-arxiv-main_2-20)</sup> <sup>[2.21](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-arxiv-main_2-21)</sup> <sup>[2.22](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-arxiv-main_2-22)</sup> <sup>[2.23](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-arxiv-main_2-23)</sup> <sup>[2.24](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-arxiv-main_2-24)</sup> <sup>[2.25](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-arxiv-main_2-25)</sup> <sup>[2.26](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-arxiv-main_2-26)</sup> <sup>[2.27](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-arxiv-main_2-27)</sup> <sup>[2.28](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-arxiv-main_2-28)</sup> <sup>[2.29](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-arxiv-main_2-29)</sup> <sup>[2.30](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-arxiv-main_2-30)</sup> <sup>[2.31](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-arxiv-main_2-31)</sup> <sup>[2.32](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-arxiv-main_2-32)</sup> <sup>[2.33](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-arxiv-main_2-33)</sup> <sup>[2.34](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-arxiv-main_2-34)</sup> <sup>[2.35](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-arxiv-main_2-35)</sup> <sup>[2.36](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-arxiv-main_2-36)</sup> <sup>[2.37](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-arxiv-main_2-37)</sup> <sup>[2.38](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-arxiv-main_2-38)</sup> Andriushchenko, Maksym et al. «AgentHarm: A Benchmark for Measuring Harmfulness of LLM Agents». *arXiv*. <a href="https://arxiv.org/abs/2410.09024" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-huggingface-3">↑ <sup>[3.0](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-huggingface_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-huggingface_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-huggingface_3-2)</sup> <sup>[3.3](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-huggingface_3-3)</sup> <sup>[3.4](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-huggingface_3-4)</sup> «ai-safety-institute/AgentHarm». *Datasets at Hugging Face*. <a href="https://huggingface.co/datasets/ai-safety-institute/AgentHarm" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-emergentmind-4">↑ <sup>[4.0](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-emergentmind_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-emergentmind_4-1)</sup> <sup>[4.2](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-emergentmind_4-2)</sup> <sup>[4.3](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-emergentmind_4-3)</sup> <sup>[4.4](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-emergentmind_4-4)</sup> <sup>[4.5](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-emergentmind_4-5)</sup> <sup>[4.6](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-emergentmind_4-6)</sup> <sup>[4.7](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-emergentmind_4-7)</sup> «AgentHarm: Measuring LLM Agent Harmfulness». *Emergent Mind*. <a href="https://www.emergentmind.com/papers/2410.09024" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-uk-gov-github-5">↑ <sup>[5.0](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-uk-gov-github_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-uk-gov-github_5-1)</sup> <sup>[5.2](https://systems-analysis.info/int/AgentHarm_(UR)#cite_ref-uk-gov-github_5-2)</sup> «AgentHarm: Harmfulness Potential in AI Agents». *UK government BEIS Github*. <a href="https://ukgovernmentbeis.github.io/inspect_evals/evals/safeguards/agentharm/" class="external autonumber" rel="nofollow">[5]</a></span>
