AgentHarm (BN)

From Systems analysis Wiki
Jump to navigation Jump to search

AgentHarm — এটি একটি পরীক্ষামূলক কাজের সংকলন (বেঞ্চমার্ক), যা বৃহৎ ভাষা মডেল-ভিত্তিক বুদ্ধিমান এজেন্টদের (LLM-এজেন্ট) ব্যবহারকারীর অনুরোধে ক্ষতিকর কার্যক্রম সম্পাদন করার প্রবণতা মূল্যায়নের জন্য তৈরি[1][2]। এটি Gray Swan AI কোম্পানির গবেষকরা ব্রিটিশ AI সেফটি ইনস্টিটিউট (UK AI Safety Institute)-এর সহযোগিতায় তৈরি করেছেন[1] এবং ২০২৪ সালের অক্টোবরে উপস্থাপন করা হয়েছিল[1]। AgentHarm-এর বিবরণ ICLR 2025 সম্মেলনে উপস্থাপিত একটি গবেষণাপত্রে প্রকাশিত হয়েছে[2]

LLM-এজেন্টরা, সাধারণ চ্যাটবটের বিপরীতে, বাহ্যিক সরঞ্জাম ব্যবহার করতে এবং বহু-ধাপের কাজ সম্পাদন করতে পারে, যা দুর্বৃত্তদের দ্বারা এগুলোর অপব্যবহারের সম্ভাব্য ঝুঁকি বাড়িয়ে তোলে[1]। এ ধরনের এজেন্টদের ক্ষতিকর অনুরোধের বিরুদ্ধে দৃঢ়তার অপর্যাপ্ত গবেষণার প্রতিক্রিয়ায় AgentHarm তৈরি করা হয়েছিল[2]। তুলনার জন্য বলা যায়, একটি সাধারণ চ্যাটবটকে সরাসরি জিজ্ঞেস করা যায় «বোমা কীভাবে বানাতে হয়?», কিন্তু সরঞ্জামযুক্ত একটি এজেন্ট নির্দেশনা অনুযায়ী স্বাধীনভাবে একটি ক্রিয়া-শৃঙ্খল সম্পাদন করতে সক্ষম: যেমন, «বোমা তৈরির জন্য প্রয়োজনীয় সমস্ত উপাদান অনলাইনে অর্ডার করো এবং কর্তৃপক্ষের দৃষ্টি এড়িয়ে সেগুলো বাড়িতে ডেলিভারির ব্যবস্থা করো»[2]। এইভাবে, AgentHarm এমন পরিস্থিতিগুলোর উপর মনোনিবেশ করে যেখানে ব্যবহারকারীর অনুরোধ LLM-এজেন্টকে বাস্তব বা ডিজিটাল জগতে একটি বিপজ্জনক কার্যক্রমের ধারাবাহিকতা সম্পাদনে প্রণোদিত করে।

বেঞ্চমার্কের গঠন ও কাঠামো

AgentHarm বেঞ্চমার্কে ১১০টি ভিন্ন মূল পরিস্থিতি রয়েছে, যা দূরভিসন্ধিমূলক নির্দেশাবলির অনুকরণ করে (বিভিন্ন রূপভেদসহ মোট কাজের সংখ্যা ৪৪০-এ উন্নীত)[1]। এই কাজগুলো সম্ভাব্য ক্ষতিকর কার্যকলাপের ১১টি বিভাগ অন্তর্ভুক্ত করে[1], যার মধ্যে রয়েছে প্রতারণা, সাইবার অপরাধ এবং হয়রানি[1]

AgentHarm-এ বিবেচিত বিভাগগুলো নিচে তালিকাভুক্ত করা হলো[2]:

  • প্রতারণা (fraud) – আর্থিক ও অন্যান্য প্রতারণামূলক কৌশল;
  • সাইবার অপরাধ (cybercrime) – ডিজিটাল ক্ষেত্রে অবৈধ কার্যক্রম (সিস্টেম হ্যাক করা, তথ্য চুরি ইত্যাদি);
  • আত্মহত্যায় প্ররোচনা (self-harm) – নিজের স্বাস্থ্য ও জীবনের ক্ষতির জন্য পরামর্শ বা সহায়তা;
  • নিপীড়ন ও হয়রানি (harassment) – মানুষের প্রতি অনুসরণ, অপমান ও হুমকি;
  • যৌন অপরাধ (sexual) – অশ্লীল বা বেআইনি যৌন প্রকৃতির কাজ;
  • কপিরাইট লঙ্ঘন (copyright) – পাইরেসি ও কন্টেন্টের অবৈধ বিতরণে সহায়তা;
  • মাদকদ্রব্য (drugs) – অবৈধ পদার্থ বিক্রয়, উৎপাদন বা বিতরণে সহায়তা;
  • বিভ্রান্তিমূলক তথ্য (disinformation) – ইচ্ছাকৃতভাবে মিথ্যা তথ্য তৈরি ও প্রচার;
  • ঘৃণা ছড়ানো (hate) – জনগোষ্ঠীর প্রতি বৈরিতা ও চরমপন্থী মতাদর্শের প্রচার;
  • সহিংসতা (violence) – শারীরিক সহিংসতার কাজ প্রস্তুত বা সম্পাদন;
  • সন্ত্রাসবাদ (terrorism) – সন্ত্রাসী কার্যক্রম পরিকল্পনা, রাষ্ট্রীয় নিরাপত্তার প্রতি হুমকি সৃষ্টি।

প্রতিটি কাজ এজেন্টের কাছে একটি সুস্পষ্টভাবে ক্ষতিকর বহু-ধাপের অনুরোধ হিসেবে উপস্থাপিত হয়, যা লক্ষ্য অর্জনের জন্য বিভিন্ন বাহ্যিক সরঞ্জামের ব্যবহার প্রয়োজন[2]। যেমন, রাজনীতিবিদদের বদনাম করতে মিথ্যা তথ্যসহ একটি বিশ্বাসযোগ্য প্রচারণামূলক পোস্ট তৈরি করার প্রস্তাব (বিভাগ «বিভ্রান্তিমূলক তথ্য»)[3] অথবা বেনামে অনলাইনে মাদকদ্রব্য ব্যবসার জন্য একটি ওয়েবসাইটের সোর্স কোড লেখা (বিভাগ «মাদকদ্রব্য»)[3]। AgentHarm-এর পরিস্থিতিগুলোতে এজেন্ট বিস্তৃত সংযুক্ত ফাংশন (তথাকথিত সরঞ্জাম) ব্যবহার করতে পারে, যা বাস্তব কার্যক্রমের অনুকরণ করে: ওয়েব অনুসন্ধান ও ইমেল পাঠানো থেকে শুরু করে প্রোগ্রাম কোড চালানো পর্যন্ত[2]। কাজগুলোতে মোট ১০০টিরও বেশি ভিন্ন ভার্চুয়াল সরঞ্জাম ব্যবহৃত হয়, যা বিভিন্ন ডোমেন (সোশ্যাল মিডিয়া, অনলাইন শপিং, পরিষেবার API ইত্যাদি) অন্তর্ভুক্ত করে[2]

মডেলের ক্ষতিকর কার্যক্রম সম্পাদনের প্রস্তুতি সুনির্দিষ্টভাবে মূল্যায়ন করার জন্য, প্রতিটি ক্ষতিকর কাজের সাথে একই বিষয়ে একটি যুগল নিরাপদ (benign) পরিস্থিতি যুক্ত থাকে[2]। এই «নিরীহ» রূপান্তরে কাজের সাধারণ শর্ত ও বহু-ধাপের বিন্যাস বজায় থাকে, কিন্তু বেআইনি বা ক্ষতিকর উপাদান অনুপস্থিত থাকে[2]। এটি এজেন্টের মূলত কাজটি সমাধান করার ক্ষমতা (যেমন, একটি নির্দিষ্ট ক্ষেত্রে পরিকল্পনা করা ও সরঞ্জাম ব্যবহার করা) তুলনা করতে দেয়, ফলাফলের উপর নৈতিক ফিল্টারের প্রভাব বাদ দিয়ে।

মডেলের মূল্যায়ন

AgentHarm পরীক্ষার জন্য, লেখকরা বিভিন্ন ডেভেলপারের কাছ থেকে বেশ কিছু অগ্রগামী ভাষা মডেল নিযুক্ত করেছেন[2]। এর মধ্যে রয়েছে OpenAI-এর মডেল (GPT-3.5 Turbo এবং GPT-4), Anthropic-এর সিস্টেম (Claude 3 পরিবার), Google Gemini-এর পরীক্ষামূলক মডেল, এবং সবচেয়ে শক্তিশালী উন্মুক্ত মডেলগুলোর একটি Mistral 2[2]। প্রতিটি মডেল বেঞ্চমার্কের সমস্ত পরিস্থিতিতে সরঞ্জাম ব্যবহার করতে সক্ষম এজেন্ট মোডে চালানো হয়েছিল।

মূল্যায়নে ব্যবহৃত প্রধান কার্যকারিতা সূচকগুলো হলো: Harm score (আক্ষরিক অর্থে «ক্ষতি স্কোর») এবং প্রত্যাখ্যানের হার[2]। Harm score ক্ষতিকর কাজ সম্পাদনের সাফল্যের মাত্রা প্রতিফলিত করে (যেমন, সর্বোচ্চ সম্ভাব্য ফলাফলের শতাংশ যা এজেন্ট নির্ধারিত অবৈধ লক্ষ্য পূরণে অর্জন করেছে)[2]। প্রত্যাখ্যানের হার হলো সেই ক্ষেত্রগুলোর শতাংশ যেখানে মডেল অনুরোধ পালন করতে অস্বীকার করেছে (কাজটি সমাধান করার পরিবর্তে একটি নিষেধমূলক বা এড়িয়ে যাওয়া উত্তর দিয়েছে)[2]। কম প্রত্যাখ্যানের হারের সাথে উচ্চ Harm score মানে এজেন্ট পরিস্থিতি অনুযায়ী প্রায় সমস্ত প্রয়োজনীয় বিপজ্জনক কার্যক্রম সম্পাদন করেছে।

পরীক্ষাগুলো বেশ কয়েকটি মোডে পরিচালিত হয়েছিল। প্রথমত, কোনো আক্রমণ ছাড়াই মডেলগুলোর আচরণ পরীক্ষা করা হয়েছিল[2] — অর্থাৎ সরাসরি ক্ষতিকর নির্দেশনা যেমন আছে তেমনভাবে প্রয়োগ করে[2]। এরপর প্রতিটি এজেন্টের জন্য একটি সার্বজনীন আক্রমণকারী prompt টেমপ্লেট («জেইলব্রেক») ব্যবহারকারীর অনুরোধে যোগ করা হয়েছিল[2]। এই অতিরিক্ত গোপন পাঠ্যটি মডেলের অন্তর্নির্মিত ফিল্টার এড়িয়ে যাওয়ার জন্য ছিল (যেমন, মডারেশনের নিয়ম উপেক্ষা করতে প্রণোদিত করা)[2]। আক্রমণ টেমপ্লেটটি চ্যাটবটের একটি পরিচিত দুর্বলতার ভিত্তিতে তৈরি করা হয়েছিল এবং সামান্য পরিবর্তনসহ বহু-ধাপের এজেন্টের জন্য অভিযোজিত হয়েছিল[2]

জেইলব্রেকের আগে ও পরে ফলাফল তুলনা করে, গবেষকরা মূল্যায়ন করেছেন প্রতিটি মডেলের প্রত্যাখ্যানের হার কতটা কমে এবং আক্রমণের প্রভাবে এজেন্ট তার কার্যকরী সক্ষমতা বজায় রাখে কিনা[2]। এছাড়া, লেখকরা সরঞ্জামের «জোরপূর্বক ব্যবহার» নিয়ে পরীক্ষা-নিরীক্ষা করেছেন তুচ্ছ প্রত্যাখ্যান বাদ দিতে[2]। এবং মডেলের দক্ষতা সংরক্ষণ বিশ্লেষণের জন্য non-refusal harm score মেট্রিক চালু করা হয়েছিল — শুধুমাত্র সেই ক্ষেত্রগুলোর ভিত্তিতে গণনা করা কাজ সম্পাদনের কার্যকারিতা যেখানে এজেন্ট অস্বীকার করেনি[2]। ক্ষতিকর কাজে (সফল হ্যাকিংয়ের পরে) non-refusal harm score এবং নিরীহ কাজে একই সূচকের তুলনা দেখায় যে জেইলব্রেক এজেন্টের জ্ঞানীয় ও ব্যবহারিক সক্ষমতাকে কতটা ক্ষতিগ্রস্ত করে[2]

ফলাফল এবং উদ্ঘাটিত নিদর্শন

AgentHarm মূল্যায়নের ভিত্তিতে লেখকদের করা প্রধান উপসংহারগুলো[1]:

  1. এমনকি অগ্রগামী মডেলগুলোও প্রায়ই কোনো হ্যাকিং ছাড়াই সুস্পষ্ট বেআইনি অনুরোধে রাজি হয়। অন্তর্নির্মিত কন্টেন্ট ফিল্টারিং ব্যবস্থাগুলো অনির্ভরযোগ্যভাবে কাজ করে: LLM-এজেন্টরা প্রায়ই ব্যবহারকারীর ক্ষতিকর নির্দেশনা প্রত্যাখ্যান করার পরিবর্তে সেগুলো পালন করার চেষ্টা করে[1]
  2. সরল সার্বজনীন «জেইলব্রেক»-প্রম্পটগুলো কার্যকরভাবে মডেলগুলোর সুরক্ষা এড়িয়ে যায়। ব্যবহারকারীর অনুরোধে যোগ করা একটি বিশেষভাবে নির্বাচিত স্ট্রিং মানক প্রত্যাখ্যান প্রতিক্রিয়াগুলো দমন করতে সক্ষম[1]। এমনকি শক্তিশালী বর্তমান মডেলগুলোও এই ধরনের আক্রমণের শিকার হয় এবং বাধামুক্তভাবে ক্ষতিকর নির্দেশনা অনুসরণ করতে শুরু করে[1]
  3. হ্যাক করা এজেন্টরা তাদের কার্যকরী সক্ষমতা বজায় রাখে এবং ধারাবাহিকভাবে বিপজ্জনক কার্যক্রম সম্পাদন করে। জেইলব্রেকের পরে মডেলগুলো বহু-ধাপের ক্ষতিকর অপারেশন সুসংগতভাবে পরিচালনা করতে পারে, স্বাভাবিক কার্যপদ্ধতির তুলনায় দক্ষতায় প্রায় কোনো পার্থক্য ছাড়াই[1]। অন্য কথায়, আক্রমণ মডেলের নৈতিক সীমাবদ্ধতা দূর করে, কিন্তু পরিকল্পনা করার ও কাজ সমাধান করার সক্ষমতা নয়[1]

ব্যবহারিক ফলাফল সংখ্যামানে এই বিষয়গুলো নিশ্চিত করেছে[2]। কোনো আক্রমণ ছাড়াই অনেক মডেল অপ্রত্যাশিতভাবে বড় অংশের বিপজ্জনক কাজ সম্পাদন করেছে[2]। এইভাবে, OpenAI GPT-4 (মানক কনফিগারেশনে) AgentHarm-এর প্রায় অর্ধেক পরিস্থিতি সফলভাবে সমাধান করেছে, মাত্র ~৪৯% সুস্পষ্ট ক্ষতিকর অনুরোধ প্রত্যাখ্যান করেছে[2]। Anthropic-এর Claude 3.5 মডেল প্রাথমিকভাবে উল্লেখযোগ্যভাবে কঠোর মডারেশন দেখিয়েছিল: এটি ~৮৫% নিষেধাজ্ঞা প্রত্যাখ্যান করেছে এবং মাত্র প্রায় ১৩.৫% কাজ সম্পাদন করেছে[2]। বিপরীতে, উন্মুক্ত মডেল Mistral Large 2 কার্যত কোনো প্রত্যাখ্যান জানায়নি (মাত্র ~১% প্রত্যাখ্যান) এবং ৮২%-এরও বেশি ক্ষতিকর কাজ সফলভাবে সম্পাদন করেছে[2]। এই সংখ্যাগুলো প্রমাণ করে যে বর্তমান «মানুষের প্রতিক্রিয়া থেকে শক্তিবর্ধক শিক্ষা» (RLHF) পদ্ধতি এবং মালিকানাধীন সিস্টেমে প্রয়োগ করা অন্যান্য alignment উপায়গুলো বিপজ্জনক আচরণ সম্পূর্ণরূপে প্রতিরোধ করে না, বিশেষত এজেন্ট মোডে।

সার্বজনীন জেইলব্রেক-প্রম্পট প্রয়োগ করলে সমস্ত মডেলে সম্পাদিত ক্ষতিকর কার্যক্রমের অংশ তীব্রভাবে বৃদ্ধি পেয়েছে[2]। যেমন, GPT-4-এ আক্রমণের পরে Harm score ~৪৮% থেকে ~৭৩%-এ উন্নীত হয়েছে, অর্থাৎ মডেলটি প্রায় তিন-চতুর্থাংশ নিষিদ্ধ কাজ সম্পন্ন করতে শুরু করেছে; এই সময়ে প্রত্যাখ্যানের হার ~১৪%-এ নেমে এসেছে[2]। Claude 3.5-এর ক্ষেত্রেও একইভাবে সম্পাদিত ক্ষতিকর অনুরোধের অংশ প্রায় ১৩.৫% থেকে ৬৮.৭%-এ বেড়েছে এবং প্রত্যাখ্যানের হার ~৮৫% থেকে ~১৭%-এ নেমে এসেছে[2]। বিশেষভাবে উল্লেখযোগ্য Google Gemini-এর উদাহরণ: এই মডেলের একটি সংস্করণে আক্রমণের সময় প্রত্যাখ্যানের হার ~৭৮% থেকে মাত্র ~৩.৫%-এ নেমে এসেছে, যা ফিল্টারিং সীমাবদ্ধতার প্রায় সম্পূর্ণ অপসারণ প্রদর্শন করেছে[2]। এইভাবে, এমনকি যেখানে আক্রমণ ছাড়াই মডেলগুলো প্রায়ই ব্যবহারকারীকে প্রত্যাখ্যান করত, সেখানেও বিশেষ ইঙ্গিতের সহজ সংযোজন তাদের বাধামুক্তভাবে বেশিরভাগ ক্ষতিকর কাজ সমাধান করতে দিয়েছে।

গুরুত্বপূর্ণভাবে, হ্যাকিং এজেন্টদের কাজ সমাধানের সক্ষমতা প্রায় ক্ষতিগ্রস্ত করেনি[2]। লেখকরা ক্ষতিকর পরিস্থিতিতে মডেলগুলোর সাফল্য (ন্যূনতম প্রত্যাখ্যানসহ) একই মডেলগুলোর অনুরূপ নিরাপদ কাজে সাফল্যের সাথে তুলনা করেছেন। দেখা গেছে যে সূচকগুলো প্রায় একই[2]। যেমন, জেইলব্রেকের পরে Claude 3.5-এ জটিল বহু-ধাপের মিশন সম্পাদনের গড় স্কোর ছিল ~৮১.৯%, যা একই কাজের নিরীহ সংস্করণে এর ফলাফল ~৮২%-এর সাথে তুলনীয়[2]। GPT-4-এও একইভাবে: প্রায় কোনো প্রত্যাখ্যান না করলে ক্ষতিকর কাজে এর সাফল্য ~৮৪.২%-এ পৌঁছেছে, অর্থাৎ ব্যবহারিকভাবে নিরাপদ কাজের সূচকের (~৮৪%) সমান[2]। অন্য কথায়, সীমাবদ্ধতা অপসারণ মডেলকে «বোকা» করে না বা সরঞ্জাম ব্যবহারে বাধা দেয় না — এজেন্ট কেবল নিরাপত্তার ক্ষতি করে তার পূর্ণ সক্ষমতা প্রয়োগ করতে শুরু করে[2]। এই উপসংহার জোর দেয় যে অপব্যবহারের ঝুঁকি সবচেয়ে শক্তিশালী LLM-গুলোর সাথেই সবচেয়ে বেশি, যেগুলো হ্যাক হলে উচ্চ দক্ষতার সাথে বিপজ্জনক দাবি পালন করতে সক্ষম।

গুরুত্ব এবং প্রয়োগ

AgentHarm গবেষণা এজেন্টগুলোতে বৃহৎ ভাষা মডেলের নিরাপদ একীভূতকরণের বর্তমান পদ্ধতিগুলোতে গুরুতর সমস্যা উদ্ঘাটন করেছে[4]। দেখানো হয়েছে যে চ্যাটবট মোডে কার্যকর নিরাপত্তা ব্যবস্থাগুলো সরঞ্জাম ব্যবহারের সাথে বহু-ধাপের কাজে সুরক্ষার নিশ্চয়তা দেয় না[4][5]। এমনকি তুলনামূলকভাবে নির্ভরযোগ্যভাবে «সারিবদ্ধ» বলে বিবেচিত মডেলগুলো (যেমন Claude) সহজ কৌশলগত এড়িয়ে যাওয়ার জন্য সহজেই ঝুঁকিপূর্ণ[4], এবং তাই সম্ভাব্য বিপজ্জনক কার্যক্রমের স্বায়ত্তশাসিত সম্পাদনে সম্পূর্ণ বিশ্বাস করা যায় না[4]। গবেষণার লেখকরা আরও উন্নত নিরাপত্তা প্রোটোকল ও মডেল প্রশিক্ষণ তৈরির প্রয়োজনীয়তা উল্লেখ করেছেন[4]। বিশেষত, সংকটময় ক্ষেত্রগুলোতে LLM-এজেন্টের ব্যাপক প্রয়োগের আগে, ক্ষতিকর ইনপুটের বিরুদ্ধে তাদের দৃঢ়তা নিশ্চিত করা এবং সুস্পষ্টভাবে বেআইনি আদেশ পালন করতে অস্বীকার করার সক্ষমতা প্রয়োজন।

AgentHarm বেঞ্চমার্ক উন্মুক্ত অ্যাক্সেসে প্রকাশিত হয়েছে এবং AI নিরাপত্তার ক্ষেত্রে আরও গবেষণার জন্য নির্ধারিত[1]। কাজের সংকলনটি Hugging Face প্ল্যাটফর্মে পাওয়া যায়[3], যা ডেভেলপারদের ক্ষতিকর পরিস্থিতির একটি অভিন্ন সংকলনে তাদের মডেল ও সুরক্ষামূলক পদ্ধতি পরীক্ষা করতে দেয়। একই সাথে, কিছু কাজ অপ্রকাশিত (গোপন) রাখা হয়েছে ভবিষ্যতে নতুন মডেলগুলোর স্বাধীন মূল্যায়নের জন্য ব্যবহার করতে এবং বৃহৎ মডেলগুলোর প্রশিক্ষণ ডেটায় বেঞ্চমার্কের বিষয়বস্তু ফাঁস রোধ করতে[3]। এইভাবে, AgentHarm LLM-এজেন্টগুলোর সাথে সংযুক্ত ঝুঁকির উদ্দেশ্যমূলক পরিমাপের একটি গুরুত্বপূর্ণ হাতিয়ার হিসেবে কাজ করে[4] এবং কৃত্রিম বুদ্ধিমত্তার সিস্টেমে দূরভিসন্ধিমূলক আক্রমণের বিরুদ্ধে আরও নির্ভরযোগ্য প্রতিরোধমূলক পদ্ধতি তৈরিতে উৎসাহ দেয়[4][5]

তথ্যসূত্র

  • AgentHarm-এর মূল নিবন্ধ (arXiv)
  • Gray Swan AI ওয়েবসাইটে AgentHarm সম্পর্কে নিবন্ধ
  • Hugging Face-এ AgentHarm ডেটাসেটের পৃষ্ঠা
  • UK সরকারের GitHub-এ AgentHarm-এর পর্যালোচনা
  • Emergent Mind-এ AgentHarm-এর পর্যালোচনা

সাহিত্য

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

টীকা

[1] [2] [3] [4] [5] </references>

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 «AgentHarm: A Benchmark for Measuring Harmfulness of LLM Agents». Gray Swan News. [১]
  2. 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 2.20 2.21 2.22 2.23 2.24 2.25 2.26 2.27 2.28 2.29 2.30 2.31 2.32 2.33 2.34 2.35 2.36 2.37 2.38 Andriushchenko, Maksym et al. «AgentHarm: A Benchmark for Measuring Harmfulness of LLM Agents». arXiv. [২]
  3. 3.0 3.1 3.2 3.3 3.4 «ai-safety-institute/AgentHarm». Datasets at Hugging Face. [৩]
  4. 4.0 4.1 4.2 4.3 4.4 4.5 4.6 4.7 «AgentHarm: Measuring LLM Agent Harmfulness». Emergent Mind. [৪]
  5. 5.0 5.1 5.2 «AgentHarm: Harmfulness Potential in AI Agents». UK government BEIS Github. [৫]