Jailbreaks (LLM) (HU)

From Systems analysis Wiki
Jump to navigation Jump to search

Jailbreak (angol Jailbreak — szó szerint „börtönszökés\") a nagy nyelvi modellek (LLM) kontextusában egy olyan típusú adversariális támadás, amelynek célja a beépített biztonsági mechanizmusok és korlátozások megkerülése tiltott vagy potenciálisan káros válaszok kinyerése érdekében[1]. A Jailbreak lényege „a modell káros válaszok generálására való indukálása, amelyek ellentmondanak a felhasználási irányelveknek és a társadalmi normáknak, adversariális promptok kidolgozásán keresztül"[2].

A jailbreak-támadások által kihasznált alapvető sérülékenység az LLM-ek architekturális sajátosságában rejlik: a modellek nem képesek típus szerint megkülönböztetni az utasításokat az adatoktól, mivel mind a rendszer-promptok, mind a felhasználói bevitel azonos formátummal rendelkezik — természetes nyelvű szöveges karakterláncok[3].

A kialakulás és fejlődés története

Korai időszak: Prompt-injekciók (2022)

A prompt-injekciós sérülékenység első dokumentált felfedezése 2022 májusában történt, amikor a Preamble vállalat kutatói felfedezték a ChatGPT ilyen jellegű támadásokra való fogékonyságát. 2022 szeptemberében Riley Goodside önállóan közzétette a GPT-3 sérülékenységének első nyilvános demonstrációját Twitteren, egy ismert példán keresztül, ahol a modellnek azt parancsolták, hogy hagyja figyelmen kívül az előző utasításokat[4].

A DAN korszaka (2022–2023)

2022 közepén megjelentek az első "Do Anything Now" (DAN) promptok, amelyek szerepjátékra vonatkozó utasítások voltak. A kulcsinnovációt a szerepjáték biztonsági korlátozások megkerülésére való alkalmazása jelentette, egy szabályoktól mentes „alternatív személyiség" létrehozásával[5]. A DAN evolúciója összetett forgatókönyvek megjelenéséhez vezetett, token-rendszerekkel (büntetés/jutalom mechanizmusok) és karaktermegőrzési mechanizmusokkal[6].

A módszerek diverzifikációja (2023–2024)

2023-tól kezdődően átfogó akadémiai kutatások indultak a jailbreak-támadásokról. 2024-ben megjelentek a multimodális támadások, amelyek magukban foglalják a káros utasítások képekbe és hangfájlokba való rejtését, valamint az ASCII-art alapú vizuális prompt-injekciót[7].

Jelenkori időszak (2024–2025)

A támadási technikák tovább bonyolódnak. 2024 novemberében felfedezték a "Time Bandit" technikát, amely a ChatGPT-4o időbeli zavarát használja ki azáltal, hogy a kérdéseket úgy fogalmazza meg, mintha történelmi korszakokból (1800–1900-as évek) származnának[8].

Technikai módszerek és osztályozás

A támadások a modellhez való hozzáférés alapján osztályozhatók:

  • Fekete doboz támadások: A modell belső összetevőihez (paraméterek, gradiensek) való hozzáférés nélkül.
  • Fehér doboz támadások: A modell paramétereinek és gradienseinek teljes hozzáférésével[2].

A JailbreakRadar taxonómiája

A JailbreakRadar osztályozása (Chu et al., 2024) hat fő támadási kategóriát különböztet meg:

  1. Közvetlen támadások: Közvetlen káros promptok.
  2. Közvetett támadások: Többlépéses manipulációs stratégiák.
  3. Kontextuális támadások: A beszélgetési előzmények felhasználása.
  4. Szerepjáték-alapú támadások: Karakterszemélyes technikák (pl. DAN).
  5. Kódolási támadások: Obfuszkációs módszerek a káros utasítások elrejtésére.
  6. Sablon-alapú támadások: Strukturált adversariális keretrendszerek[9].

Technikai mechanizmusok

  • Adversariális szuffixgenerálás (GCG): A Zou et al. (2023) által javasolt módszer automatikusan generál adversariális szuffixeket (token-sorozatokat), amelyek a prompthoz adva nagy valószínűséggel káros választ váltanak ki. A módszer gradiens-optimalizációt alkalmaz, és magas sikerességi arányt mutat (akár 84% GPT-4 esetén) és modellek között is átvihető[10].
  • Többfordulós jailbreaking: Az Anthropic (2024) kutatása kimutatta, hogy a támadások hatékonysága hatványfüggvényt követ: ahogy a promptban szereplő káros példák száma nő, úgy emelkedik a nemkívánatos válaszok aránya[11].

Védelmi mechanizmusok

  • Alkotmányos osztályozók (Anthropic): A bemeneti/kimeneti adatok szűrése alkotmányos elvek készlete alapján. Ez a módszer lehetővé tette a jailbreak sikerességének csökkentését 86%-ról 4,4%-ra kontrollált értékelések során[12].
  • Emberi visszajelzésen alapuló megerősítéses tanulás (RLHF): A háromfázisú tanítás (OpenAI), amely magában foglalja a felügyelt finomhangolást, a jutalom-modell tanítását és a policy optimalizálást, jelentős csökkentést mutatott a toxikus tartalom generálásában.
  • Adversariális tanítás: A modell jailbreak-támadási példákon való tanítása az ellenállóképesség növelése érdekében. Ennek a megközelítésnek a hatékonysága a támadások sikerességének csökkentésében 60–80%-ra becsülhető[1].
  • Többrétegű védelem: Ajánlott stratégia, amely magában foglalja a bemeneti adatok validálását, a modell szintű védelmet, a kimeneti adatok monitorozását és a folyamatos valós idejű megfigyelést.

A nagy nyelvi modellek elleni jailbreak-támadások az AI biztonságának alapvető problémáját jelentik, folyamatos feszültséget demonstrálva a modellek képességei és összehangolása között. A támadási tér folyamatosan bonyolódik, az egyszerű prompt-injekciókról összetett multimodális és automatizált támadásokra való átmenettel. A kutatások azt mutatják, hogy egyetlen jelenlegi védelmi mechanizmus sem teljesen ellenálló az összes jailbreak-kísérlettel szemben. A siker ezen a területen folyamatos befektetést igényel a biztonsági kutatásokba, a felelős közzétételi gyakorlatokba, valamint a kutatók, az ipar és a szabályozók közös erőfeszítéseibe.

Hivatkozások

  • Prompting Guide: Jailbreaking
  • A GCG-támadás GitHub-implementációjának adattára

Irodalom

  • Bai, Y. et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.
  • Zou, A. et al. (2023). Universal and Transferable Adversarial Attacks on Aligned Language Models. arXiv:2307.15043.
  • Shen, X. et al. (2023). "Do Anything Now": Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models. arXiv:2308.03825.
  • Chao, P. et al. (2024). JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models. arXiv:2404.01318.
  • Liao, Z.; Sun, H. (2024). AmpleGCG: Learning a Universal and Transferable Generative Model of Adversarial Suffixes for Jailbreaking Both Open and Closed LLMs. OpenReview UfqzXg95I5.
  • Yi, S. et al. (2024). Jailbreak Attacks and Defenses Against Large Language Models: A Survey. arXiv:2407.04295.
  • Chu, J. et al. (2025). JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs. arXiv:2402.05668.
  • Liu, A. et al. (2025). PiCo: Jailbreaking Multimodal Large Language Models via Pictorial Code Contextualization. arXiv:2504.01444.
  • Ghosal, D. et al. (2025). Immune: Improving Safety Against Jailbreaks in Multi-modal LLMs via Inference-Time Filtering. CVPR 2025. PDF.
  • Yan, Q. et al. (2025). Hidden in Plain Sight: Probing Implicit Reasoning in Multimodal Language Models. arXiv:2506.00258.
  • Liu, Y. et al. (2025). RePD: Defending Jailbreak Attack through a Retrieval-Based Detector. Findings of NAACL 2025. ACL Anthology.

Megjegyzések

  1. 1.0 1.1 «A brief history of jailbreaking». Lil'Log. [1]
  2. 2.0 2.1 Yi, J., et al. «Jailbreak Attacks and Defenses Against Large Language Models: A Comprehensive Survey». arXiv:2405.09443. [2]
  3. «Jailbreaking LLMs». Prompting Guide. [3]
  4. «Exploring prompt injection attacks». NCC Group. [4]
  5. «Do Anything Now: Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models». arXiv:2308.03825. [5]
  6. «0xk1h0/ChatGPT_DAN». GitHub. [6]
  7. «Hiding in Plain Sight: Multimodal Jailbreaking of Large Language Models». HiddenLayer. [7]
  8. «ChatGPT "Time-travel" jailbreak lets you bypass its safety guards». BleepingComputer. [8]
  9. Chu, Z., et al. «JailbreakRadar: A Comprehensive Benchmark for Jailbreak Attack and Defense». arXiv:2402.12642. [9]
  10. Zou, A., et al. «Universal and Transferable Adversarial Attacks on Aligned Language Models». arXiv:2307.15043. [10]
  11. «Many-shot Jailbreaking». Anthropic. [11]
  12. «How we're using 'constitutional AI' to make our models safer». MIT Technology Review. [12]