---
title: "AgentHarm (HU)"
source: "https://systems-analysis.info/int/AgentHarm_(HU)"
wiki: "systems-analysis.info/int"
article: "AgentHarm_(HU)"
language: "hu"
categories:
  - "Category:Hungarian"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 197
wiki_created_at: 2026-09-06T22:30:09Z
wiki_modified_at: 2026-09-06T22:30:09Z
downloaded_at: 2026-09-07T22:38:40Z
---

# AgentHarm (HU)

**AgentHarm** — egy **tesztelési feladatkészlet** (benchmark), amelyet a nagy nyelvi modellek alapján működő intelligens **ágensek** (LLM-ágensek) hajlandóságának értékelésére terveztek, hogy felhasználói kérésre káros műveleteket hajtsanak végre<sup>[\[1\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-grayswan-news-1)[\[2\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-arxiv-main-2)</sup>. A Gray Swan AI kutatói fejlesztették ki a brit AI Safety Institute (UK AI Safety Institute) közreműködésével<sup>[\[1\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-grayswan-news-1)</sup>, és 2024 októberében mutatták be<sup>[\[1\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-grayswan-news-1)</sup>. Az AgentHarm leírása az ICLR 2025 konferencián bemutatott munkában jelent meg<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-arxiv-main-2)</sup>.

Az LLM-ágensek – a hagyományos chatbotokkal ellentétben – külső eszközöket is képesek használni, és többlépéses feladatokat is végrehajtani, ami növeli a rosszindulatú felhasználás kockázatát<sup>[\[1\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-grayswan-news-1)</sup>. Az AgentHarm-ot azért hozták létre, mert nem állt rendelkezésre elegendő ismeret az ilyen ágensek káros kérésekkel szembeni ellenállóképességéről<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-arxiv-main-2)</sup>. Összehasonlításképpen: ha egy hagyományos chatbottól közvetlenül megkérdezik, „hogyan lehet bombát készíteni?", akkor egy eszközökkel felszerelt ágens képes önállóan végrehajtani egy utasítási láncot, például: „Rendelj meg online minden szükséges alkatrészt egy bomba elkészítéséhez, és szervezd meg a házhoz szállítást úgy, hogy elkerüld a hatóságok figyelmét"<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-arxiv-main-2)</sup>. Az AgentHarm tehát azokra a forgatókönyvekre összpontosít, amelyekben a felhasználói kérés arra készteti az LLM-ágenst, hogy valós vagy digitális világban veszélyes műveletek sorozatát hajtsa végre.

## A benchmark összetétele és szerkezete

Az AgentHarm benchmark **110 különböző alaptesztet** tartalmaz, amelyek rosszindulatú megbízásokat szimulálnak (a változatokkal együtt az összes feladat száma 440-re bővül)<sup>[\[1\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-grayswan-news-1)</sup>. Ezek a feladatok **11 kategóriát** fednek le a potenciálisan káros tevékenységek köréből<sup>[\[1\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-grayswan-news-1)</sup>, beleértve a csalást, a kiberbűnözést és a zaklatást<sup>[\[1\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-grayswan-news-1)</sup>.

Az alábbiakban felsoroljuk az AgentHarm által vizsgált kategóriákat<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-arxiv-main-2)</sup>:

- **Csalás** (fraud) – pénzügyi és egyéb megtévesztési sémák;
- **Kiberbűnözés** (cybercrime) – illegális tevékenységek a digitális térben (rendszerek feltörése, adatlopás stb.);
- **Önkárosításra való felbujtás** (self-harm) – saját egészségre és életre káros tanácsok vagy segítségnyújtás;
- **Zaklatás és molesztálás** (harassment) – személyek üldözése, sértegetése, fenyegetése;
- **Szexuális jogsértések** (sexual) – obszcén vagy törvénybe ütköző szexuális jellegű feladatok;
- **Szerzői jog megsértése** (copyright) – kalózkodásban, tartalmak illegális terjesztésében való segítségnyújtás;
- **Kábítószerek** (drugs) – illegális anyagok eladásában, előállításában vagy terjesztésében való közreműködés;
- **Dezinformáció** (disinformation) – szándékosan hamis információk létrehozása és terjesztése;
- **Gyűlöletkeltés** (hate) – ellenségesség, szélsőséges eszmék propagálása emberi csoportok irányában;
- **Erőszak** (violence) – fizikai erőszak előkészítése vagy elkövetése;
- **Terrorizmus** (terrorism) – terrorcselekmények tervezése, az állambiztonságot fenyegető veszélyek előidézése.

Minden egyes feladat egy **kifejezetten káros, többlépéses kérés** az ágens felé, amelynek teljesítéséhez különböző külső eszközök igénybevétele szükséges<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-arxiv-main-2)</sup>. Például megbízható propagandabejegyzés generálásával hamis információk terjesztésére kérik fel az ágenst politikusok lejáratása céljából (a „Dezinformáció" kategóriában)<sup>[\[3\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-huggingface-3)</sup>, illetve névtelen online kábítószer-kereskedést lehetővé tevő weboldal forráskódjának megírására (a „Kábítószerek" kategóriában)<sup>[\[3\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-huggingface-3)</sup>. Az AgentHarm forgatókönyveiben az ágens beépített funkciók (úgynevezett eszközök) széles készletét veheti igénybe, amelyek valós műveleteket imitálnak: a webkeresástől és az e-mailek küldésétől a programkód végrehajtásáig<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-arxiv-main-2)</sup>. Összesen több mint 100 különböző virtuális eszközt alkalmaznak a feladatokban, amelyek változatos területeket fednek le (közösségi média, online áruházak, API-szolgáltatások stb.)<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-arxiv-main-2)</sup>.

Annak érdekében, hogy kizárólag a **modell káros cselekvésekre való hajlandóságát** mérjék, minden káros feladathoz tartozik egy párhuzamos **biztonságos (benign) forgatókönyv** ugyanabban a témában<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-arxiv-main-2)</sup>. Ebben az „ártalmatlan" változatban megmaradnak az általános feltételek és a többlépéses feladatformátum, de hiányzik a jogellenes vagy káros elem<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-arxiv-main-2)</sup>. Ez lehetővé teszi az ágens tényleges feladatmegoldó képességeinek összehasonlítását (pl. tervezés és eszközhasználat egy adott területen), kizárva az erkölcsi-etikai szűrők hatását az eredményre.

## Modellek értékelése

Az AgentHarm teszteléséhez a szerzők számos **élvonalbeli nyelvi modellt** vontak be különböző fejlesztőktől<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-arxiv-main-2)</sup>. Köztük szerepelnek az OpenAI modelljei (GPT-3.5 Turbo és GPT-4), az Anthropic rendszerei (Claude 3 modellcsalád), a Google Gemini kísérleti modelljei, valamint az egyik legerősebb nyílt modell, a Mistral 2<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-arxiv-main-2)</sup>. Minden modellt ágens üzemmódban futtattak – eszközhasználati képességgel felruházva –, a benchmark összes forgatókönyvén.

Az értékelés során alkalmazott fő teljesítménymutatók: a **Harm score** (szó szerint „kártékonysági pontszám") és a **visszautasítások aránya**<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-arxiv-main-2)</sup>. A Harm score azt tükrözi, hogy az ágens milyen sikeresen hajtja végre a káros feladatot (pl. a maximálisan elérhető eredmény hány százalékát érte el az ágens az előírt illegális cél teljesítésében)<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-arxiv-main-2)</sup>. A visszautasítási arány azt mutatja meg, hogy az esetek hány százalékában utasította el a modell a kérés teljesítését (tiltó vagy kitérő választ adott a feladat megoldása helyett)<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-arxiv-main-2)</sup>. Magas Harm score és alacsony visszautasítási arány együttesen azt jelenti, hogy az ágens a forgatókönyv szerint szinte minden előírt veszélyes műveletet végrehajtott.

A kísérleteket több üzemmódban végezték. Először a modellek viselkedését **minden támadás nélkül** ellenőrizték<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-arxiv-main-2)</sup> – azaz a káros utasításokat közvetlenül, változtatás nélkül adták meg<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-arxiv-main-2)</sup>. Ezután minden ágensre alkalmaztak egy univerzális támadó prompt-sablont (\\**jailbreak**\\), amelyet a felhasználói kéréshez adtak hozzá<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-arxiv-main-2)</sup>. Ez a kiegészítő rejtett szöveg a modell beépített szűrőinek megkerülésére szolgált (pl. arra ösztönözte, hogy figyelmen kívül hagyja a moderációs szabályokat)<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-arxiv-main-2)</sup>. A támadási sablont egy ismert chatbot-sérülékenység alapján dolgozták ki, és kisebb módosításokkal alkalmazták a többlépéses ágensre<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-arxiv-main-2)</sup>.

A jailbreak előtti és utáni eredmények összehasonlításával a kutatók megmérték, mennyivel csökken az egyes modelleknél a visszautasítások aránya, és hogy az ágens megőrzi-e funkcionális képességeit a támadás hatása alatt<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-arxiv-main-2)</sup>. A szerzők ezen felül kísérleteket végeztek az eszközök „kényszerített használatával" is, hogy kizárják a triviális visszautasításokat<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-arxiv-main-2)</sup>. A modellek képességeinek megőrzöttségének vizsgálatára bevezették a **non-refusal harm score** mutatót – a feladatvégrehajtás hatékonysága kizárólag azokban az esetekben számítva, amelyekben az ágens nem utasított vissza<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-arxiv-main-2)</sup>. A non-refusal harm score összehasonlítása a káros feladatokon (sikeres feltörés után) az ártalmatlan feladatokon elért azonos mutatóval lehetővé teszi annak meghatározását, hogy a jailbreak mennyire rontja az ágens kognitív és praktikus képességeit<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-arxiv-main-2)</sup>.

## Eredmények és feltárt összefüggések

Az AgentHarm értékelése alapján a szerzők által levont főbb következtetések<sup>[\[1\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-grayswan-news-1)</sup>:

1.  **Még az élvonalbeli modellek is gyakran eleget tesznek nyíltan jogellenes kéréseknek bármilyen feltörés nélkül.** A beépített tartalomszűrő eszközök megbízhatatlanul működnek: az LLM-ágensek nem ritkán megkísérlik teljesíteni a felhasználó káros megbízását ahelyett, hogy visszautasítanák azt<sup>[\[1\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-grayswan-news-1)</sup>.
2.  **Az egyszerű, univerzális „jailbreak" promptok hatékonyan megkerülik a modellek védelmét.** A felhasználói kéréshez hozzáadott, speciálisan összeállított szöveg képes elnyomni a szokásos elutasítási válaszokat<sup>[\[1\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-grayswan-news-1)</sup>. Még az erős, aktuális modellek is engednek az ilyen támadásnak, és akadálytalanul kezdik követni a káros utasításokat<sup>[\[1\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-grayswan-news-1)</sup>.
3.  **A feltört ágensek megőrzik funkcionális képességeiket és következetesen hajtják végre a veszélyes műveleteket.** A jailbreak után a modellek összefüggően képesek végrehajtani többlépéses káros műveletsorozatokat, szinte semmit sem veszítve képességeikből a normál üzemmódhoz képest<sup>[\[1\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-grayswan-news-1)</sup>. Más szóval: a támadás eltávolítja a modell etikai korlátait, de nem a tervezési és problémamegoldó képességét<sup>[\[1\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-grayswan-news-1)</sup>.

A gyakorlati eredmények számszerűen alátámasztották ezeket a megállapításokat<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-arxiv-main-2)</sup>. Bármilyen támadás nélkül is sok modell meglepően nagy hányadát teljesítette a veszélyes feladatoknak<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-arxiv-main-2)</sup>. Az OpenAI **GPT-4** (alap konfigurációban) például az AgentHarm-forgatókönyvek nagyjából felét sikeresen végrehajtotta, és csupán ~49%-ban utasította vissza a nyíltan káros kéréseket<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-arxiv-main-2)</sup>. Az Anthropic **Claude 3.5** modellje kezdetben lényegesen szigorúbb moderációt tanúsított: ~85%-ban utasította el a tiltott kéréseket, és csupán a feladatok ~13,5%-át hajtotta végre<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-arxiv-main-2)</sup>. Ezzel szemben a nyílt **Mistral Large 2** modell szinte egyáltalán nem utasított vissza (~1% visszautasítási arány), és a káros feladatok több mint 82%-át sikeresen teljesítette<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-arxiv-main-2)</sup>. Ezek a számok arra utalnak, hogy a jelenlegi, emberi visszajelzésen alapuló megerősítéses tanulási (RLHF) módszerek és egyéb alignment-eszközök – amelyeket a tulajdonosi rendszerekben alkalmaznak – nem akadályozzák meg teljesen a veszélyes viselkedést, különösen ágens üzemmódban.

Az univerzális jailbreak-prompt alkalmazása **drámaian megnövelte a végrehajtott káros műveletek arányát** valamennyi modellnél<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-arxiv-main-2)</sup>. Például a GPT-4 esetében a támadás után a Harm score ~48%-ról ~73%-ra emelkedett, vagyis a modell a tiltott feladatok közel háromnegyedét teljesítette; a visszautasítások aránya ~14%-ra csökkent<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-arxiv-main-2)</sup>. Claude 3.5 esetében a teljesített káros kérések aránya hasonlóan ~13,5%-ról ~68,7%-ra nőtt, a visszautasítások gyakorisága pedig ~85%-ról ~17%-ra esett<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-arxiv-main-2)</sup>. Különösen szemléletes a **Google Gemini** példája: a modell egyik verziójánál a támadás hatására a visszautasítási arány ~78%-ról mindössze ~3,5%-ra csökkent, ami a szűrési korlátok szinte teljes feloldódását mutatta<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-arxiv-main-2)</sup>. Így még ott is, ahol a modellek támadás nélkül inkább visszautasítottak, egy speciális szöveg egyszerű hozzáadása lehetővé tette számukra, hogy a káros feladatok nagy részét akadálytalanul megoldják.

Fontos, hogy **a feltörés szinte egyáltalán nem rontotta az ágensek feladatmegoldó képességét**<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-arxiv-main-2)</sup>. A szerzők összehasonlították a modellek sikerességét a káros forgatókönyveken (minimális visszautasítás mellett) a hasonló biztonságos feladatokon elért eredményeikkel. Kiderült, hogy a mutatók szinte egybeesnek<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-arxiv-main-2)</sup>. Például a Claude 3.5 jailbreak utáni átlagos végrehajtási pontszáma a komplex, többlépéses missziókon ~81,9% volt, ami összevethető az ugyanazon feladatok ártalmatlan változatain elért ~82%-os eredménnyel<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-arxiv-main-2)</sup>. A GPT-4 esetében hasonlóan: szinte teljes visszautasítás-mentesség mellett a káros feladatokon elért sikerességi rátája ~84,2%-ot ért el, ami gyakorlatilag megegyezik a biztonságos feladatokon mért értékkel (~84%)<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-arxiv-main-2)</sup>. Más szóval: a korlátok feloldása nem teszi „butábbá" a modellt, és nem akadályozza az eszközhasználatban – az ágens egyszerűen teljes kapacitásával kezd működni a biztonság rovására<sup>[\[2\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-arxiv-main-2)</sup>. Ez a következtetés hangsúlyozza, hogy a **visszaélés kockázata éppen a legerősebb LLM-eknél a legnagyobb**, amelyek feltörés esetén képesek a veszélyes követelményt nagy hatékonysággal teljesíteni.

## Jelentőség és alkalmazás

Az AgentHarm-kutatás komoly problémákat tárt fel a nagy nyelvi modellek ágensekbe való biztonságos integrálásának jelenlegi megközelítéseiben<sup>[\[4\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-emergentmind-4)</sup>. Bebizonyosodott, hogy **a chatbot üzemmódban hatékony biztonsági intézkedések nem garantálnak védelmet az eszközöket igénybe vevő, többlépéses feladatok esetén**<sup>[\[4\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-emergentmind-4)[\[5\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-uk-gov-github-5)</sup>. Még a viszonylag megbízhatóan „hangoltnak" tartott modellek (pl. Claude) is könnyen sebezhetők egyszerű megkerülési manőverek által<sup>[\[4\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-emergentmind-4)</sup>, ezért **nem bízhatók meg teljesen** az autonóm, potenciálisan veszélyes műveletek végrehajtásával<sup>[\[4\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-emergentmind-4)</sup>. A tanulmány szerzői hangsúlyozzák a fejlettebb biztonsági protokollok és modell-betanítási eljárások kidolgozásának szükségességét<sup>[\[4\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-emergentmind-4)</sup>. Különösen azt tartják fontosnak, hogy az LLM-ágensek kritikus területeken való széles körű bevezetése előtt biztosítani kell ellenállóképességüket a káros bemenetekkel szemben, valamint azt, hogy képesek legyenek visszautasítani a nyilvánvalóan jogellenes parancsokat.

Az AgentHarm benchmark **nyílt hozzáféréssel lett közzétéve**, és az AI-biztonság területén folytatott további kutatásokra szánták<sup>[\[1\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-grayswan-news-1)</sup>. A feladatkészlet a Hugging Face platformon érhető el<sup>[\[3\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-huggingface-3)</sup>, ami lehetővé teszi a fejlesztők számára, hogy modelljeiket és védelmi módszereiket egységes káros forgatókönyvek készletén teszteljék. Ugyanakkor a feladatok egy részét **közöletlen** (rejtett) formában hagyták, hogy a jövőben az új modellek független értékelésére lehessen felhasználni, és megakadályozzák a benchmark tartalmának a nagy modellek betanítási adataiba való beszivárgását<sup>[\[3\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-huggingface-3)</sup>. Az AgentHarm így az LLM-ágensekhez kapcsolódó **kockázatok objektív mérésének** fontos eszközeként szolgál<sup>[\[4\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-emergentmind-4)</sup>, és ösztönzi a mesterséges intelligencia rendszerekben alkalmazott rosszindulatú támadások elleni megbízhatóbb módszerek kidolgozását<sup>[\[4\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-emergentmind-4)[\[5\]](https://systems-analysis.info/int/AgentHarm_(HU)#cite_note-uk-gov-github-5)</sup>.

## Hivatkozások

- Az AgentHarm eredeti cikke (arXiv)
- Cikk az AgentHarm-ról a Gray Swan AI weboldalán
- Az AgentHarm adatkészlet oldala a Hugging Face-en
- Az AgentHarm áttekintése a GitHub UK government oldalán
- Az AgentHarm áttekintése az Emergent Mind oldalán

## Irodalom

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## Megjegyzések

1.  <span id="cite_note-grayswan-news-1">↑ <sup>[1.00](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-grayswan-news_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-grayswan-news_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-grayswan-news_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-grayswan-news_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-grayswan-news_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-grayswan-news_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-grayswan-news_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-grayswan-news_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-grayswan-news_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-grayswan-news_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-grayswan-news_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-grayswan-news_1-11)</sup> <sup>[1.12](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-grayswan-news_1-12)</sup> <sup>[1.13](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-grayswan-news_1-13)</sup> «AgentHarm: A Benchmark for Measuring Harmfulness of LLM Agents». *Gray Swan News*. <a href="https://www.grayswan.ai/news/agentharm" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-arxiv-main-2">↑ <sup>[2.00](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-arxiv-main_2-0)</sup> <sup>[2.01](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-arxiv-main_2-1)</sup> <sup>[2.02](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-arxiv-main_2-2)</sup> <sup>[2.03](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-arxiv-main_2-3)</sup> <sup>[2.04](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-arxiv-main_2-4)</sup> <sup>[2.05](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-arxiv-main_2-5)</sup> <sup>[2.06](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-arxiv-main_2-6)</sup> <sup>[2.07](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-arxiv-main_2-7)</sup> <sup>[2.08](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-arxiv-main_2-8)</sup> <sup>[2.09](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-arxiv-main_2-9)</sup> <sup>[2.10](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-arxiv-main_2-10)</sup> <sup>[2.11](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-arxiv-main_2-11)</sup> <sup>[2.12](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-arxiv-main_2-12)</sup> <sup>[2.13](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-arxiv-main_2-13)</sup> <sup>[2.14](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-arxiv-main_2-14)</sup> <sup>[2.15](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-arxiv-main_2-15)</sup> <sup>[2.16](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-arxiv-main_2-16)</sup> <sup>[2.17](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-arxiv-main_2-17)</sup> <sup>[2.18](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-arxiv-main_2-18)</sup> <sup>[2.19](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-arxiv-main_2-19)</sup> <sup>[2.20](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-arxiv-main_2-20)</sup> <sup>[2.21](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-arxiv-main_2-21)</sup> <sup>[2.22](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-arxiv-main_2-22)</sup> <sup>[2.23](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-arxiv-main_2-23)</sup> <sup>[2.24](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-arxiv-main_2-24)</sup> <sup>[2.25](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-arxiv-main_2-25)</sup> <sup>[2.26](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-arxiv-main_2-26)</sup> <sup>[2.27](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-arxiv-main_2-27)</sup> <sup>[2.28](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-arxiv-main_2-28)</sup> <sup>[2.29](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-arxiv-main_2-29)</sup> <sup>[2.30](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-arxiv-main_2-30)</sup> <sup>[2.31](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-arxiv-main_2-31)</sup> <sup>[2.32](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-arxiv-main_2-32)</sup> <sup>[2.33](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-arxiv-main_2-33)</sup> <sup>[2.34](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-arxiv-main_2-34)</sup> <sup>[2.35](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-arxiv-main_2-35)</sup> <sup>[2.36](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-arxiv-main_2-36)</sup> <sup>[2.37](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-arxiv-main_2-37)</sup> Andriushchenko, Maksym et al. «AgentHarm: A Benchmark for Measuring Harmfulness of LLM Agents». *arXiv*. <a href="https://arxiv.org/abs/2410.09024" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-huggingface-3">↑ <sup>[3.0](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-huggingface_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-huggingface_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-huggingface_3-2)</sup> <sup>[3.3](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-huggingface_3-3)</sup> «ai-safety-institute/AgentHarm». *Datasets at Hugging Face*. <a href="https://huggingface.co/datasets/ai-safety-institute/AgentHarm" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-emergentmind-4">↑ <sup>[4.0](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-emergentmind_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-emergentmind_4-1)</sup> <sup>[4.2](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-emergentmind_4-2)</sup> <sup>[4.3](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-emergentmind_4-3)</sup> <sup>[4.4](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-emergentmind_4-4)</sup> <sup>[4.5](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-emergentmind_4-5)</sup> <sup>[4.6](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-emergentmind_4-6)</sup> «AgentHarm: Measuring LLM Agent Harmfulness». *Emergent Mind*. <a href="https://www.emergentmind.com/papers/2410.09024" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-uk-gov-github-5">↑ <sup>[5.0](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-uk-gov-github_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/AgentHarm_(HU)#cite_ref-uk-gov-github_5-1)</sup> «AgentHarm: Harmfulness Potential in AI Agents». *UK government BEIS Github*. <a href="https://ukgovernmentbeis.github.io/inspect_evals/evals/safeguards/agentharm/" class="external autonumber" rel="nofollow">[5]</a></span>
