Jailbreaks (LLM) (CS)
Jailbreak (angl. Jailbreak — doslova „útěk z vězení") v kontextu velkých jazykových modelů (LLM) je typ útoku na bázi soupeřícího přístupu, jehož cílem je obejít zabudované bezpečnostní mechanismy a omezení za účelem získání zakázaných nebo potenciálně škodlivých odpovědí[1]. Jailbreak představuje „navádění modelu ke generování škodlivých odpovědí, které jsou v rozporu s podmínkami použití a společenskými normami, prostřednictvím tvorby soupeřících promptů"[2].
Fundamentální zranitelnost, jež je při jailbreak útocích zneužívána, spočívá v architektonické vlastnosti LLM: modely nedokážou rozlišit instrukce a data podle jejich typu, protože jak systémové prompty, tak uživatelský vstup mají stejný formát — řetězce textu v přirozeném jazyce[3].
Historie vzniku a vývoje
Rané období: Prompt injection (2022)
První zdokumentované odhalení zranitelnosti vůči prompt injection proběhlo v květnu 2022, kdy výzkumníci ze společnosti Preamble objevili náchylnost ChatGPT k těmto útokům. V září 2022 Riley Goodside nezávisle zveřejnil první veřejnou demonstraci zranitelnosti GPT-3 na Twitteru s proslulým příkladem, v němž byl modelu vydán příkaz ignorovat předchozí instrukce[4].
Éra DAN (2022–2023)
V polovině roku 2022 se objevily první prompty "Do Anything Now" (DAN), které představovaly instrukce pro hraní rolí. Klíčovou inovací bylo využití hraní rolí k obcházení bezpečnostních omezení prostřednictvím vytvoření „alternativní osobnosti" osvobozené od pravidel[5]. Evoluce DAN vedla ke vzniku složitých scénářů se systémy tokenů (mechanismy trestání/odměňování) a mechanismy zachování postavy[6].
Diverzifikace metod (2023–2024)
Od roku 2023 začaly komplexní akademické výzkumy jailbreak útoků. V roce 2024 se objevily multimodální útoky zahrnující skrývání škodlivých instrukcí v obrázcích, zvukových souborech a také vizuální prompt injection prostřednictvím ASCII-art[7].
Současné období (2024–2025)
Techniky útoků se nadále zdokonalují. V listopadu 2024 byla objevena technika "Time Bandit", která v ChatGPT-4o zneužívá časový zmatek formulováním otázek, jako by pocházely z historických období (18.–19. století)[8].
Technické metody a klasifikace
Útoky lze klasifikovat podle přístupu k modelu:
- Útoky černé skříňky: Bez přístupu k interním komponentám modelu (parametrům, gradientům).
- Útoky bílé skříňky: S plným přístupem k parametrům modelu a gradientům[2].
Taxonomie JailbreakRadar
Klasifikace JailbreakRadar (Chu et al., 2024) rozlišuje šest hlavních kategorií útoků:
- Přímé útoky: Bezprostřední škodlivé prompty.
- Nepřímé útoky: Vícekrokové strategie manipulace.
- Kontextové útoky: Využití historie konverzace.
- Rolové útoky: Techniky vydávání se za postavy (např. DAN).
- Kódovací útoky: Metody obfuskace ke skrytí škodlivých instrukcí.
- Šablonové útoky: Strukturované soupeřící frameworky[9].
Technické mechanismy
- Generování soupeřících sufixů (GCG): Metoda navržená Zou et al. (2023) automaticky generuje soupeřící sufixy (sekvence tokenů), které při přidání k promptu s vysokou pravděpodobností vyvolají škodlivou odpověď. Metoda využívá gradientní optimalizaci a vykazuje vysokou úspěšnost (až 84 % na GPT-4) a přenositelnost mezi modely[10].
- Vícetahový jailbreaking: Výzkum Anthropic (2024) ukázal, že účinnost útoků se řídí mocninným zákonem: s rostoucím počtem škodlivých příkladů v promptu roste podíl nežádoucích odpovědí[11].
Mechanismy ochrany
- Konstituční klasifikátory (Anthropic): Filtrování vstupních/výstupních dat na základě souboru konstitučních principů. Tato metoda umožnila snížit úspěšnost jailbreaku z 86 % na 4,4 % v kontrolovaných hodnoceních[12].
- Reinforcement Learning from Human Feedback (RLHF): Třífázové trénování (OpenAI) zahrnující řízenou kalibraci, trénování modelu odměny a optimalizaci politiky prokázalo výrazné snížení generování toxického obsahu.
- Soupeřící trénování: Trénování modelu na příkladech jailbreak útoků za účelem zvýšení jeho odolnosti. Účinnost tohoto přístupu při snižování úspěšnosti útoků je odhadována na 60–80 %[1].
- Víceúrovňová ochrana: Doporučená strategie zahrnující validaci vstupních dat, ochranu na úrovni modelu, monitorování výstupních dat a průběžné monitorování v reálném čase.
Jailbreak útoky na velké jazykové modely představují fundamentální problém bezpečnosti AI a demonstrují trvalé napětí mezi schopnostmi modelů a jejich sladěním. Krajina útoků se neustále komplikuje, přechází od jednoduchých prompt injection ke složitým multimodálním a automatizovaným útokům. Výzkumy ukazují, že žádný současný obranný mechanismus není zcela odolný vůči všem pokusům o jailbreak. Úspěch v této oblasti vyžaduje neustálé investice do bezpečnostního výzkumu, praxi odpovědného zveřejňování a společné úsilí výzkumníků, průmyslu a regulátorů.
Odkazy
- Prompting Guide: Jailbreaking
- Repozitář s implementací útoku GCG na GitHub
Literatura
- Bai, Y. et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.
- Zou, A. et al. (2023). Universal and Transferable Adversarial Attacks on Aligned Language Models. arXiv:2307.15043.
- Shen, X. et al. (2023). "Do Anything Now": Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models. arXiv:2308.03825.
- Chao, P. et al. (2024). JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models. arXiv:2404.01318.
- Liao, Z.; Sun, H. (2024). AmpleGCG: Learning a Universal and Transferable Generative Model of Adversarial Suffixes for Jailbreaking Both Open and Closed LLMs. OpenReview UfqzXg95I5.
- Yi, S. et al. (2024). Jailbreak Attacks and Defenses Against Large Language Models: A Survey. arXiv:2407.04295.
- Chu, J. et al. (2025). JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs. arXiv:2402.05668.
- Liu, A. et al. (2025). PiCo: Jailbreaking Multimodal Large Language Models via Pictorial Code Contextualization. arXiv:2504.01444.
- Ghosal, D. et al. (2025). Immune: Improving Safety Against Jailbreaks in Multi-modal LLMs via Inference-Time Filtering. CVPR 2025. PDF.
- Yan, Q. et al. (2025). Hidden in Plain Sight: Probing Implicit Reasoning in Multimodal Language Models. arXiv:2506.00258.
- Liu, Y. et al. (2025). RePD: Defending Jailbreak Attack through a Retrieval-Based Detector. Findings of NAACL 2025. ACL Anthology.
Poznámky
- ↑ 1.0 1.1 «A brief history of jailbreaking». Lil'Log. [1]
- ↑ 2.0 2.1 Yi, J., et al. «Jailbreak Attacks and Defenses Against Large Language Models: A Comprehensive Survey». arXiv:2405.09443. [2]
- ↑ «Jailbreaking LLMs». Prompting Guide. [3]
- ↑ «Exploring prompt injection attacks». NCC Group. [4]
- ↑ «Do Anything Now: Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models». arXiv:2308.03825. [5]
- ↑ «0xk1h0/ChatGPT_DAN». GitHub. [6]
- ↑ «ChatGPT "Time-travel" jailbreak lets you bypass its safety guards». BleepingComputer. [8]
- ↑ Chu, Z., et al. «JailbreakRadar: A Comprehensive Benchmark for Jailbreak Attack and Defense». arXiv:2402.12642. [9]
- ↑ Zou, A., et al. «Universal and Transferable Adversarial Attacks on Aligned Language Models». arXiv:2307.15043. [10]
- ↑ «Many-shot Jailbreaking». Anthropic. [11]
- ↑ «How we're using 'constitutional AI' to make our models safer». MIT Technology Review. [12]