Jailbreaks (LLM) (CS)

From Systems analysis Wiki
Jump to navigation Jump to search

Jailbreak (angl. Jailbreak — doslova „útěk z vězení") v kontextu velkých jazykových modelů (LLM) je typ útoku na bázi soupeřícího přístupu, jehož cílem je obejít zabudované bezpečnostní mechanismy a omezení za účelem získání zakázaných nebo potenciálně škodlivých odpovědí[1]. Jailbreak představuje „navádění modelu ke generování škodlivých odpovědí, které jsou v rozporu s podmínkami použití a společenskými normami, prostřednictvím tvorby soupeřících promptů"[2].

Fundamentální zranitelnost, jež je při jailbreak útocích zneužívána, spočívá v architektonické vlastnosti LLM: modely nedokážou rozlišit instrukce a data podle jejich typu, protože jak systémové prompty, tak uživatelský vstup mají stejný formát — řetězce textu v přirozeném jazyce[3].

Historie vzniku a vývoje

Rané období: Prompt injection (2022)

První zdokumentované odhalení zranitelnosti vůči prompt injection proběhlo v květnu 2022, kdy výzkumníci ze společnosti Preamble objevili náchylnost ChatGPT k těmto útokům. V září 2022 Riley Goodside nezávisle zveřejnil první veřejnou demonstraci zranitelnosti GPT-3 na Twitteru s proslulým příkladem, v němž byl modelu vydán příkaz ignorovat předchozí instrukce[4].

Éra DAN (2022–2023)

V polovině roku 2022 se objevily první prompty "Do Anything Now" (DAN), které představovaly instrukce pro hraní rolí. Klíčovou inovací bylo využití hraní rolí k obcházení bezpečnostních omezení prostřednictvím vytvoření „alternativní osobnosti" osvobozené od pravidel[5]. Evoluce DAN vedla ke vzniku složitých scénářů se systémy tokenů (mechanismy trestání/odměňování) a mechanismy zachování postavy[6].

Diverzifikace metod (2023–2024)

Od roku 2023 začaly komplexní akademické výzkumy jailbreak útoků. V roce 2024 se objevily multimodální útoky zahrnující skrývání škodlivých instrukcí v obrázcích, zvukových souborech a také vizuální prompt injection prostřednictvím ASCII-art[7].

Současné období (2024–2025)

Techniky útoků se nadále zdokonalují. V listopadu 2024 byla objevena technika "Time Bandit", která v ChatGPT-4o zneužívá časový zmatek formulováním otázek, jako by pocházely z historických období (18.–19. století)[8].

Technické metody a klasifikace

Útoky lze klasifikovat podle přístupu k modelu:

  • Útoky černé skříňky: Bez přístupu k interním komponentám modelu (parametrům, gradientům).
  • Útoky bílé skříňky: S plným přístupem k parametrům modelu a gradientům[2].

Taxonomie JailbreakRadar

Klasifikace JailbreakRadar (Chu et al., 2024) rozlišuje šest hlavních kategorií útoků:

  1. Přímé útoky: Bezprostřední škodlivé prompty.
  2. Nepřímé útoky: Vícekrokové strategie manipulace.
  3. Kontextové útoky: Využití historie konverzace.
  4. Rolové útoky: Techniky vydávání se za postavy (např. DAN).
  5. Kódovací útoky: Metody obfuskace ke skrytí škodlivých instrukcí.
  6. Šablonové útoky: Strukturované soupeřící frameworky[9].

Technické mechanismy

  • Generování soupeřících sufixů (GCG): Metoda navržená Zou et al. (2023) automaticky generuje soupeřící sufixy (sekvence tokenů), které při přidání k promptu s vysokou pravděpodobností vyvolají škodlivou odpověď. Metoda využívá gradientní optimalizaci a vykazuje vysokou úspěšnost (až 84 % na GPT-4) a přenositelnost mezi modely[10].
  • Vícetahový jailbreaking: Výzkum Anthropic (2024) ukázal, že účinnost útoků se řídí mocninným zákonem: s rostoucím počtem škodlivých příkladů v promptu roste podíl nežádoucích odpovědí[11].

Mechanismy ochrany

  • Konstituční klasifikátory (Anthropic): Filtrování vstupních/výstupních dat na základě souboru konstitučních principů. Tato metoda umožnila snížit úspěšnost jailbreaku z 86 % na 4,4 % v kontrolovaných hodnoceních[12].
  • Reinforcement Learning from Human Feedback (RLHF): Třífázové trénování (OpenAI) zahrnující řízenou kalibraci, trénování modelu odměny a optimalizaci politiky prokázalo výrazné snížení generování toxického obsahu.
  • Soupeřící trénování: Trénování modelu na příkladech jailbreak útoků za účelem zvýšení jeho odolnosti. Účinnost tohoto přístupu při snižování úspěšnosti útoků je odhadována na 60–80 %[1].
  • Víceúrovňová ochrana: Doporučená strategie zahrnující validaci vstupních dat, ochranu na úrovni modelu, monitorování výstupních dat a průběžné monitorování v reálném čase.

Jailbreak útoky na velké jazykové modely představují fundamentální problém bezpečnosti AI a demonstrují trvalé napětí mezi schopnostmi modelů a jejich sladěním. Krajina útoků se neustále komplikuje, přechází od jednoduchých prompt injection ke složitým multimodálním a automatizovaným útokům. Výzkumy ukazují, že žádný současný obranný mechanismus není zcela odolný vůči všem pokusům o jailbreak. Úspěch v této oblasti vyžaduje neustálé investice do bezpečnostního výzkumu, praxi odpovědného zveřejňování a společné úsilí výzkumníků, průmyslu a regulátorů.

Odkazy

  • Prompting Guide: Jailbreaking
  • Repozitář s implementací útoku GCG na GitHub

Literatura

  • Bai, Y. et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.
  • Zou, A. et al. (2023). Universal and Transferable Adversarial Attacks on Aligned Language Models. arXiv:2307.15043.
  • Shen, X. et al. (2023). "Do Anything Now": Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models. arXiv:2308.03825.
  • Chao, P. et al. (2024). JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models. arXiv:2404.01318.
  • Liao, Z.; Sun, H. (2024). AmpleGCG: Learning a Universal and Transferable Generative Model of Adversarial Suffixes for Jailbreaking Both Open and Closed LLMs. OpenReview UfqzXg95I5.
  • Yi, S. et al. (2024). Jailbreak Attacks and Defenses Against Large Language Models: A Survey. arXiv:2407.04295.
  • Chu, J. et al. (2025). JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs. arXiv:2402.05668.
  • Liu, A. et al. (2025). PiCo: Jailbreaking Multimodal Large Language Models via Pictorial Code Contextualization. arXiv:2504.01444.
  • Ghosal, D. et al. (2025). Immune: Improving Safety Against Jailbreaks in Multi-modal LLMs via Inference-Time Filtering. CVPR 2025. PDF.
  • Yan, Q. et al. (2025). Hidden in Plain Sight: Probing Implicit Reasoning in Multimodal Language Models. arXiv:2506.00258.
  • Liu, Y. et al. (2025). RePD: Defending Jailbreak Attack through a Retrieval-Based Detector. Findings of NAACL 2025. ACL Anthology.

Poznámky

  1. 1.0 1.1 «A brief history of jailbreaking». Lil'Log. [1]
  2. 2.0 2.1 Yi, J., et al. «Jailbreak Attacks and Defenses Against Large Language Models: A Comprehensive Survey». arXiv:2405.09443. [2]
  3. «Jailbreaking LLMs». Prompting Guide. [3]
  4. «Exploring prompt injection attacks». NCC Group. [4]
  5. «Do Anything Now: Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models». arXiv:2308.03825. [5]
  6. «0xk1h0/ChatGPT_DAN». GitHub. [6]
  7. «Hiding in Plain Sight: Multimodal Jailbreaking of Large Language Models». HiddenLayer. [7]
  8. «ChatGPT "Time-travel" jailbreak lets you bypass its safety guards». BleepingComputer. [8]
  9. Chu, Z., et al. «JailbreakRadar: A Comprehensive Benchmark for Jailbreak Attack and Defense». arXiv:2402.12642. [9]
  10. Zou, A., et al. «Universal and Transferable Adversarial Attacks on Aligned Language Models». arXiv:2307.15043. [10]
  11. «Many-shot Jailbreaking». Anthropic. [11]
  12. «How we're using 'constitutional AI' to make our models safer». MIT Technology Review. [12]