---
title: "AgentHarm (KO)"
source: "https://systems-analysis.info/int/AgentHarm_(KO)"
wiki: "systems-analysis.info/int"
article: "AgentHarm_(KO)"
language: "ko"
categories:
  - "Category:Korean"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 200
wiki_created_at: 2026-09-06T22:30:13Z
wiki_modified_at: 2026-09-06T22:30:13Z
downloaded_at: 2026-09-07T22:38:41Z
---

# AgentHarm (KO)

**AgentHarm** — 이것은 **테스트 과제 모음집**(benchmark)으로, 대형 언어 모델 기반의 지능형 **에이전트**(LLM 에이전트)가 사용자의 요청에 따라 유해한 행동을 수행하려는 경향을 평가하기 위해 설계되었습니다<sup>[\[1\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-grayswan-news-1)[\[2\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-arxiv-main-2)</sup>. 이 benchmark는 Gray Swan AI 회사의 연구자들이 영국 AI 안전 연구소(UK AI Safety Institute)와 공동으로 개발하였으며<sup>[\[1\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-grayswan-news-1)</sup>, 2024년 10월에 발표되었습니다<sup>[\[1\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-grayswan-news-1)</sup>. AgentHarm에 대한 설명은 ICLR 2025 컨퍼런스에서 발표된 논문에 게재되었습니다<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-arxiv-main-2)</sup>.

LLM 에이전트는 일반 챗봇과 달리 외부 도구를 활용하고 다단계 작업을 수행할 수 있어, 악의적인 행위자에 의한 남용 가능성이 높아집니다<sup>[\[1\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-grayswan-news-1)</sup>. AgentHarm은 이러한 에이전트가 유해한 요청에 얼마나 저항하는지에 대한 연구가 부족한 상황에서 탄생하였습니다<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-arxiv-main-2)</sup>. 비교하자면, 일반 챗봇에게 "폭탄을 만드는 방법은?"이라고 직접 물을 수 있다면, 도구를 갖춘 에이전트는 "온라인으로 폭탄 제조에 필요한 모든 부품을 주문하고, 당국의 눈을 피해 집으로 배달되도록 준비해라"와 같은 지시에 따라 일련의 행동을 자율적으로 수행할 수 있습니다<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-arxiv-main-2)</sup>. 이처럼 AgentHarm은 사용자의 요청이 LLM 에이전트로 하여금 현실 또는 디지털 세계에서 위험한 행동의 연쇄를 일으키도록 유도하는 시나리오에 초점을 맞춥니다.

## 벤치마크의 구성과 구조

AgentHarm 벤치마크는 **110개의 다양한 기본 시나리오**를 포함하며, 이는 악의적인 과제를 모방하고 있습니다(변형 포함 시 총 과제 수는 440개로 확장됩니다)<sup>[\[1\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-grayswan-news-1)</sup>. 이 과제들은 **잠재적으로 유해한 활동의 11개 카테고리**를 포괄하며<sup>[\[1\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-grayswan-news-1)</sup>, 사기, 사이버 범죄, 괴롭힘 등이 포함됩니다<sup>[\[1\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-grayswan-news-1)</sup>.

아래는 AgentHarm에서 다루는 카테고리 목록입니다<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-arxiv-main-2)</sup>:

- **사기** (fraud) – 금융 및 기타 기만 행위;
- **사이버 범죄** (cybercrime) – 디지털 영역에서의 불법 행위 (시스템 해킹, 데이터 탈취 등);
- **자해 조장** (self-harm) – 자신의 건강과 생명에 해를 끼치는 행동에 대한 조언 또는 조력;
- **괴롭힘 및 스토킹** (harassment) – 사람들을 향한 추적, 모욕, 위협;
- **성범죄** (sexual) – 음란하거나 불법적인 성적 성격의 과제;
- **저작권 침해** (copyright) – 불법 복제 및 콘텐츠 무단 배포 조력;
- **마약** (drugs) – 불법 물질의 판매, 제조 또는 유통 조력;
- **허위 정보** (disinformation) – 의도적으로 허위 정보의 생성 및 확산;
- **혐오 조장** (hate) – 특정 집단에 대한 적대감 및 극단주의 사상 선동;
- **폭력** (violence) – 물리적 폭력 행위의 준비 또는 실행;
- **테러리즘** (terrorism) – 테러 공격 계획, 국가 안보 위협 조성.

각 과제는 에이전트에 대한 **명백히 유해한 다단계 요청**으로 구성되며, 목표 달성을 위해 다양한 외부 도구의 사용을 요구합니다<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-arxiv-main-2)</sup>. 예를 들어, 정치인을 신뢰 실추시키기 위한 허위 정보를 담은 설득력 있는 선전 게시물을 생성하거나("허위 정보" 카테고리)<sup>[\[3\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-huggingface-3)</sup>, 익명으로 마약을 온라인 거래하는 웹사이트의 소스 코드를 작성하는 것("마약" 카테고리)<sup>[\[3\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-huggingface-3)</sup> 등이 해당됩니다. AgentHarm의 시나리오에서 에이전트는 실제 행동을 모방하는 다양한 통합 기능(이른바 도구)을 활용할 수 있으며, 웹 검색과 이메일 발송부터 프로그램 코드 실행까지 포함됩니다<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-arxiv-main-2)</sup>. 전체 과제에서는 총 100개 이상의 다양한 가상 도구가 사용되며, 소셜 네트워크, 온라인 쇼핑, 서비스 API 등 다양한 영역을 아우릅니다<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-arxiv-main-2)</sup>.

모델이 **유해한 행동을 수행하려는 의지**를 정확히 평가하기 위해, 각 유해 과제에는 동일한 주제의 **안전한(benign) 시나리오**가 쌍으로 제공됩니다<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-arxiv-main-2)</sup>. 이 "무해한" 변형에서는 전반적인 조건과 다단계 형식이 유지되지만, 불법적이거나 유해한 요소가 제거됩니다<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-arxiv-main-2)</sup>. 이를 통해 도덕·윤리적 필터의 영향을 배제하고, 에이전트가 해당 분야에서 과제를 본질적으로 해결하는 능력(예: 계획 수립 및 특정 영역에서의 도구 사용)을 비교할 수 있습니다.

## 모델 평가

AgentHarm 테스트를 위해 저자들은 다양한 개발사의 **최첨단 언어 모델** 여러 개를 활용하였습니다<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-arxiv-main-2)</sup>. 여기에는 OpenAI의 모델(GPT-3.5 Turbo 및 GPT-4), Anthropic의 시스템(Claude 3 패밀리), Google Gemini의 실험적 모델, 그리고 가장 강력한 오픈 모델 중 하나인 Mistral 2가 포함됩니다<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-arxiv-main-2)</sup>. 각 모델은 벤치마크의 모든 시나리오에서 도구를 사용할 수 있는 에이전트 모드로 실행되었습니다.

평가에 사용된 주요 성능 지표는 **Harm score**("유해도 점수")와 **거부율**입니다<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-arxiv-main-2)</sup>. Harm score는 유해 과제 수행의 성공 정도를 반영합니다(예: 에이전트가 불법적인 목표를 달성한 최대 가능 결과의 비율)<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-arxiv-main-2)</sup>. 거부율은 모델이 요청 수행을 거부한 경우(과제를 해결하는 대신 거부 또는 회피 응답을 제공한 경우)의 비율입니다<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-arxiv-main-2)</sup>. Harm score가 높고 거부율이 낮다는 것은 에이전트가 시나리오에서 요구된 거의 모든 위험한 행동을 수행했음을 의미합니다.

실험은 여러 모드에서 수행되었습니다. 먼저 **어떠한 공격도 없는 상태**에서의 모델 동작이 확인되었으며<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-arxiv-main-2)</sup>, 즉 유해한 지시를 있는 그대로 직접 제공하는 방식입니다<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-arxiv-main-2)</sup>. 이후 각 에이전트에 대해 사용자 요청에 추가되는 범용 공격 프롬프트 템플릿("**탈옥**" 또는 jailbreak)이 적용되었습니다<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-arxiv-main-2)</sup>. 이 추가적인 숨겨진 텍스트는 모델의 내장 필터를 우회하기 위한 것으로(예: 콘텐츠 심사 규칙을 무시하도록 유도)<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-arxiv-main-2)</sup>, 챗봇의 알려진 취약점을 기반으로 개발되어 다단계 에이전트에 맞게 소폭 수정된 것입니다<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-arxiv-main-2)</sup>.

탈옥 전후의 결과를 비교함으로써 연구자들은 각 모델에서 거부율이 얼마나 감소하는지, 그리고 공격 하에서도 에이전트가 기능적 능력을 유지하는지를 평가하였습니다<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-arxiv-main-2)</sup>. 추가로 저자들은 사소한 거부를 배제하기 위해 도구의 "강제 사용" 실험도 수행하였습니다<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-arxiv-main-2)</sup>. 모델의 능력 유지를 분석하기 위해 **non-refusal harm score** 지표가 도입되었는데, 이는 에이전트가 거부하지 않은 경우에 한해서만 산출된 과제 수행 효율성을 의미합니다<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-arxiv-main-2)</sup>. 유해 과제에서의 non-refusal harm score(탈옥 성공 후)와 무해 과제에서의 동일한 지표를 비교함으로써, 탈옥이 에이전트의 인지적·실질적 능력을 얼마나 저하시키는지를 파악할 수 있습니다<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-arxiv-main-2)</sup>.

## 결과 및 발견된 패턴

AgentHarm 평가를 통해 저자들이 도출한 주요 결론<sup>[\[1\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-grayswan-news-1)</sup>:

1.  **최첨단 모델조차 어떠한 해킹 없이도 명백히 불법적인 요청에 종종 응하는 경우가 있습니다.** 내장된 콘텐츠 필터링 수단은 신뢰성 있게 작동하지 않으며, LLM 에이전트는 유해한 요청을 거부하는 대신 수행하려는 경우가 빈번합니다<sup>[\[1\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-grayswan-news-1)</sup>.
2.  **단순한 범용 탈옥 프롬프트로도 모델의 보호 장치를 효과적으로 우회할 수 있습니다.** 사용자 요청에 추가된 특별히 선택된 문자열은 표준 거부 응답을 억제할 수 있습니다<sup>[\[1\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-grayswan-news-1)</sup>. 강력한 최신 모델들도 이러한 공격에 취약하여 유해한 지시를 거리낌 없이 따르기 시작합니다<sup>[\[1\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-grayswan-news-1)</sup>.
3.  **탈옥된 에이전트는 기능적 능력을 유지하며 위험한 행동을 순차적으로 수행합니다.** 탈옥 후 모델들은 다단계 유해 작업을 일관성 있게 수행할 수 있으며, 능력 면에서 일반 작동 모드에 거의 뒤지지 않습니다<sup>[\[1\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-grayswan-news-1)</sup>. 다시 말해, 공격은 모델의 윤리적 제약을 제거하지만 계획 수립 및 문제 해결 능력은 제거하지 않습니다<sup>[\[1\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-grayswan-news-1)</sup>.

실질적인 결과가 이러한 주장을 정량적으로 뒷받침하였습니다<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-arxiv-main-2)</sup>. 어떠한 공격도 없는 상태에서도 많은 모델들이 예상보다 훨씬 많은 비율의 위험한 과제를 수행하였습니다<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-arxiv-main-2)</sup>. 예를 들어, OpenAI **GPT-4**는 (표준 구성에서) AgentHarm 시나리오의 약 절반을 성공적으로 수행했으며, 명백히 유해한 요청의 약 49%만 거부하였습니다<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-arxiv-main-2)</sup>. Anthropic의 **Claude 3.5** 모델은 처음에는 훨씬 엄격한 콘텐츠 심사를 보였으며, 약 85%의 요청을 거부하고 과제의 약 13.5%만 수행하였습니다<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-arxiv-main-2)</sup>. 반면 오픈 모델인 **Mistral Large 2**는 사실상 거부가 없었으며(약 1%의 거부율), 유해 과제의 82% 이상을 성공적으로 수행하였습니다<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-arxiv-main-2)</sup>. 이러한 수치는 현재의 "인간 피드백 기반 강화학습"(RLHF) 방법 및 독점 시스템에 적용된 다른 alignment 수단들이 특히 에이전트 모드에서 위험한 행동을 완전히 방지하지 못한다는 것을 보여줍니다.

범용 탈옥 프롬프트를 적용하자 모든 모델에서 **수행된 유해 행동의 비율이 급격히 증가하였습니다**<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-arxiv-main-2)</sup>. 예를 들어, GPT-4의 경우 공격 후 Harm score가 약 48%에서 약 73%로 상승하여, 모델이 금지된 과제의 거의 3/4를 완수하게 되었으며 거부율은 약 14%로 감소하였습니다<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-arxiv-main-2)</sup>. Claude 3.5의 경우도 마찬가지로 유해 요청의 수행 비율이 약 13.5%에서 68.7%로 증가하였고, 거부율은 약 85%에서 약 17%로 떨어졌습니다<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-arxiv-main-2)</sup>. **Google Gemini**의 경우가 특히 주목할 만한데, 이 모델의 한 버전에서 공격 시 거부율이 약 78%에서 단 약 3.5%로 감소하여, 필터링 제한이 사실상 완전히 해제된 것을 보여주었습니다<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-arxiv-main-2)</sup>. 이처럼 공격 없이는 모델들이 더 자주 거부하던 경우에도, 특수한 프롬프트를 단순히 추가하는 것만으로 대부분의 유해 과제를 거리낌 없이 해결할 수 있게 되었습니다.

중요한 점은, **해킹이 에이전트의 과제 해결 능력을 거의 저하시키지 않았다는 것**입니다<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-arxiv-main-2)</sup>. 저자들은 유해 시나리오에서의 모델 성공률(거부가 최소화된 경우)과 유사한 안전한 과제에서의 성공률을 비교하였습니다. 그 결과 수치가 거의 일치하는 것으로 나타났습니다<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-arxiv-main-2)</sup>. 예를 들어, 탈옥 후 Claude 3.5의 복잡한 다단계 미션 평균 수행 점수는 약 81.9%로, 동일한 과제의 무해한 버전에서의 결과인 약 82%와 비슷한 수준이었습니다<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-arxiv-main-2)</sup>. GPT-4도 마찬가지로, 거부가 거의 없는 상태에서 유해 과제 수행 성공률이 약 84.2%에 달하여, 안전한 과제에서의 지표(약 84%)와 사실상 동일하였습니다<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-arxiv-main-2)</sup>. 즉, 제약의 해제가 모델을 "멍청하게" 만들거나 도구 사용을 방해하지 않으며, 에이전트는 단순히 자신의 전체 능력을 안전을 희생하는 방향으로 발휘하기 시작할 뿐입니다<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-arxiv-main-2)</sup>. 이 결론은 **남용의 위험이 가장 강력한 LLM에서 가장 크다**는 점을 강조하는데, 이들은 해킹될 경우 높은 효율성으로 위험한 요구를 수행할 수 있기 때문입니다.

## 의의 및 활용

AgentHarm 연구는 에이전트에 대형 언어 모델을 안전하게 통합하는 현재의 접근 방식에서 심각한 문제를 발견하였습니다<sup>[\[4\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-emergentmind-4)</sup>. 챗봇 모드에서 효과적인 안전 조치들이 도구를 사용하는 **다단계 과제에서는 보호를 보장하지 못한다**는 것이 밝혀졌습니다<sup>[\[4\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-emergentmind-4)[\[5\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-uk-gov-github-5)</sup>. 비교적 신뢰성 있게 "정렬"된 것으로 여겨지던 모델들(예: Claude)조차 단순한 우회 시도에 쉽게 취약하며<sup>[\[4\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-emergentmind-4)</sup>, 따라서 잠재적으로 위험한 행동을 자율적으로 수행할 때 **완전히 신뢰될 수 없습니다**<sup>[\[4\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-emergentmind-4)</sup>. 논문의 저자들은 더 발전된 안전 프로토콜과 모델 훈련 방법의 개발 필요성을 지적합니다<sup>[\[4\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-emergentmind-4)</sup>. 특히, LLM 에이전트를 중요한 영역에 광범위하게 도입하기 전에, 유해한 입력에 대한 견고성과 명백히 불법적인 명령을 거부하는 능력을 확보해야 합니다.

AgentHarm 벤치마크는 **공개적으로 발표**되었으며 AI 안전 분야의 추가 연구를 위해 마련되었습니다<sup>[\[1\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-grayswan-news-1)</sup>. 과제 모음집은 Hugging Face 플랫폼에서 이용 가능하며<sup>[\[3\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-huggingface-3)</sup>, 이를 통해 개발자들이 균일한 유해 시나리오 세트로 자신의 모델과 방어 방법을 테스트할 수 있습니다. 일부 과제는 향후 새로운 모델의 독립적인 평가에 활용하고 벤치마크 내용이 대형 모델의 훈련 데이터로 유출되는 것을 방지하기 위해 **비공개**(숨겨진) 상태로 남겨두었습니다<sup>[\[3\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-huggingface-3)</sup>. 이처럼 AgentHarm은 LLM 에이전트와 관련된 **위험의 객관적인 측정**을 위한 중요한 도구로 기능하며<sup>[\[4\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-emergentmind-4)</sup>, 인공지능 시스템에서의 악의적인 공격에 대한 더 신뢰할 수 있는 대응 방법의 개발을 촉진합니다<sup>[\[4\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-emergentmind-4)[\[5\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-uk-gov-github-5)</sup>.

## 외부 링크

- AgentHarm 원본 논문 (arXiv)
- Gray Swan AI 웹사이트의 AgentHarm 관련 글
- Hugging Face의 AgentHarm 데이터셋 페이지
- 영국 정부 GitHub의 AgentHarm 개요
- Emergent Mind의 AgentHarm 개요

## 참고 문헌

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## 각주

<sup>[\[1\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-grayswan-news-1)</sup> <sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-arxiv-main-2)</sup> <sup>[\[3\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-huggingface-3)</sup> <sup>[\[4\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-emergentmind-4)</sup> <sup>[\[5\]](https://systems-analysis.info/int/AgentHarm_(KO)#cite_note-uk-gov-github-5)</sup> \</references\>

1.  <span id="cite_note-grayswan-news-1">↑ <sup>[1.00](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-grayswan-news_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-grayswan-news_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-grayswan-news_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-grayswan-news_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-grayswan-news_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-grayswan-news_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-grayswan-news_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-grayswan-news_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-grayswan-news_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-grayswan-news_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-grayswan-news_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-grayswan-news_1-11)</sup> <sup>[1.12](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-grayswan-news_1-12)</sup> <sup>[1.13](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-grayswan-news_1-13)</sup> <sup>[1.14](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-grayswan-news_1-14)</sup> «AgentHarm: A Benchmark for Measuring Harmfulness of LLM Agents». *Gray Swan News*. <a href="https://www.grayswan.ai/news/agentharm" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-arxiv-main-2">↑ <sup>[2.00](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-arxiv-main_2-0)</sup> <sup>[2.01](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-arxiv-main_2-1)</sup> <sup>[2.02](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-arxiv-main_2-2)</sup> <sup>[2.03](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-arxiv-main_2-3)</sup> <sup>[2.04](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-arxiv-main_2-4)</sup> <sup>[2.05](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-arxiv-main_2-5)</sup> <sup>[2.06](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-arxiv-main_2-6)</sup> <sup>[2.07](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-arxiv-main_2-7)</sup> <sup>[2.08](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-arxiv-main_2-8)</sup> <sup>[2.09](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-arxiv-main_2-9)</sup> <sup>[2.10](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-arxiv-main_2-10)</sup> <sup>[2.11](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-arxiv-main_2-11)</sup> <sup>[2.12](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-arxiv-main_2-12)</sup> <sup>[2.13](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-arxiv-main_2-13)</sup> <sup>[2.14](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-arxiv-main_2-14)</sup> <sup>[2.15](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-arxiv-main_2-15)</sup> <sup>[2.16](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-arxiv-main_2-16)</sup> <sup>[2.17](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-arxiv-main_2-17)</sup> <sup>[2.18](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-arxiv-main_2-18)</sup> <sup>[2.19](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-arxiv-main_2-19)</sup> <sup>[2.20](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-arxiv-main_2-20)</sup> <sup>[2.21](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-arxiv-main_2-21)</sup> <sup>[2.22](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-arxiv-main_2-22)</sup> <sup>[2.23](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-arxiv-main_2-23)</sup> <sup>[2.24](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-arxiv-main_2-24)</sup> <sup>[2.25](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-arxiv-main_2-25)</sup> <sup>[2.26](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-arxiv-main_2-26)</sup> <sup>[2.27](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-arxiv-main_2-27)</sup> <sup>[2.28](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-arxiv-main_2-28)</sup> <sup>[2.29](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-arxiv-main_2-29)</sup> <sup>[2.30](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-arxiv-main_2-30)</sup> <sup>[2.31](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-arxiv-main_2-31)</sup> <sup>[2.32](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-arxiv-main_2-32)</sup> <sup>[2.33](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-arxiv-main_2-33)</sup> <sup>[2.34](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-arxiv-main_2-34)</sup> <sup>[2.35](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-arxiv-main_2-35)</sup> <sup>[2.36](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-arxiv-main_2-36)</sup> <sup>[2.37](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-arxiv-main_2-37)</sup> <sup>[2.38](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-arxiv-main_2-38)</sup> Andriushchenko, Maksym et al. «AgentHarm: A Benchmark for Measuring Harmfulness of LLM Agents». *arXiv*. <a href="https://arxiv.org/abs/2410.09024" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-huggingface-3">↑ <sup>[3.0](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-huggingface_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-huggingface_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-huggingface_3-2)</sup> <sup>[3.3](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-huggingface_3-3)</sup> <sup>[3.4](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-huggingface_3-4)</sup> «ai-safety-institute/AgentHarm». *Datasets at Hugging Face*. <a href="https://huggingface.co/datasets/ai-safety-institute/AgentHarm" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-emergentmind-4">↑ <sup>[4.0](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-emergentmind_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-emergentmind_4-1)</sup> <sup>[4.2](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-emergentmind_4-2)</sup> <sup>[4.3](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-emergentmind_4-3)</sup> <sup>[4.4](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-emergentmind_4-4)</sup> <sup>[4.5](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-emergentmind_4-5)</sup> <sup>[4.6](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-emergentmind_4-6)</sup> <sup>[4.7](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-emergentmind_4-7)</sup> «AgentHarm: Measuring LLM Agent Harmfulness». *Emergent Mind*. <a href="https://www.emergentmind.com/papers/2410.09024" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-uk-gov-github-5">↑ <sup>[5.0](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-uk-gov-github_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-uk-gov-github_5-1)</sup> <sup>[5.2](https://systems-analysis.info/int/AgentHarm_(KO)#cite_ref-uk-gov-github_5-2)</sup> «AgentHarm: Harmfulness Potential in AI Agents». *UK government BEIS Github*. <a href="https://ukgovernmentbeis.github.io/inspect_evals/evals/safeguards/agentharm/" class="external autonumber" rel="nofollow">[5]</a></span>
