Jailbreaks (LLM) (PL)
Jailbreak (ang. Jailbreak — dosłownie „ucieczka z więzienia\") w kontekście dużych modeli językowych (LLM) — to rodzaj ataku adversarialnego, którego celem jest ominięcie wbudowanych mechanizmów bezpieczeństwa i ograniczeń w celu uzyskania zakazanych lub potencjalnie szkodliwych odpowiedzi[1]. Jailbreak polega na „nakłonieniu modelu do generowania szkodliwych odpowiedzi, sprzecznych z polityką użytkowania i normami społecznymi, poprzez opracowanie adversarialnych promptów\"[2].
Fundamentalna podatność eksploatowana podczas ataków jailbreak wynika z architektonicznej cechy LLM: modele nie są w stanie odróżnić instrukcji od danych ze względu na ich typ, ponieważ zarówno systemowe prompty, jak i dane wprowadzane przez użytkownika mają ten sam format — ciągi tekstu w języku naturalnym[3].
Historia powstania i rozwoju
Wczesny okres: prompt injection (2022)
Pierwsze udokumentowane odkrycie podatności na prompt injection miało miejsce w maju 2022 roku, gdy badacze z firmy Preamble wykryli podatność ChatGPT na tego rodzaju ataki. We wrześniu 2022 roku Riley Goodside niezależnie opublikował pierwszą publiczną demonstrację podatności GPT-3 na Twitterze, przedstawiając znany przykład, w którym modeli nakazywano zignorowanie poprzednich instrukcji[4].
Era DAN (2022–2023)
W połowie 2022 roku pojawiły się pierwsze prompty "Do Anything Now" (DAN), stanowiące instrukcje do gry fabularnej. Kluczową innowacją było wykorzystanie gry fabularnej do obejścia ograniczeń bezpieczeństwa poprzez stworzenie „alternatywnej osobowości\" wolnej od reguł[5]. Ewolucja DAN doprowadziła do powstania złożonych scenariuszy z systemami tokenów (mechanizmy kar/nagród) oraz mechanizmami utrzymania postaci[6].
Dywersyfikacja metod (2023–2024)
Od 2023 roku rozpoczęły się kompleksowe akademickie badania nad atakami jailbreak. W 2024 roku pojawiły się ataki multimodalne, obejmujące ukrywanie szkodliwych instrukcji w obrazach, plikach audio, a także wizualne prompt injection za pomocą ASCII-art[7].
Okres współczesny (2024–2025)
Techniki ataku nadal się komplikują. W listopadzie 2024 roku odkryto technikę "Time Bandit\", eksploatującą temporalne zamieszanie w ChatGPT-4o poprzez formułowanie pytań tak, jakby pochodziły z okresów historycznych (lata 1800–1900)[8].
Metody techniczne i klasyfikacja
Ataki można klasyfikować według poziomu dostępu do modelu:
- Ataki czarnej skrzynki: Bez dostępu do wewnętrznych komponentów modelu (parametrów, gradientów).
- Ataki białej skrzynki: Z pełnym dostępem do parametrów modelu i gradientów[2].
Taksonomia JailbreakRadar
Klasyfikacja JailbreakRadar (Chu et al., 2024) wyróżnia sześć głównych kategorii ataków:
- Ataki bezpośrednie: Bezpośrednie szkodliwe prompty.
- Ataki pośrednie: Wieloetapowe strategie manipulacji.
- Ataki kontekstowe: Wykorzystanie historii rozmowy.
- Ataki fabularne: Techniki impersonacji postaci (np. DAN).
- Ataki kodujące: Metody obfuskacji służące ukrywaniu szkodliwych instrukcji.
- Ataki szablonowe: Ustrukturyzowane adversarialne frameworki[9].
Mechanizmy techniczne
- Generowanie adversarialnych sufiksów (GCG): Metoda zaproponowana przez Zou et al. (2023) automatycznie generuje adversarialne sufiksy (sekwencje tokenów), które po dołączeniu do promptu z wysokim prawdopodobieństwem wywołują szkodliwą odpowiedź. Metoda wykorzystuje optymalizację gradientową i wykazuje wysoką skuteczność (do 84% w przypadku GPT-4) oraz przenoszalność między modelami[10].
- Wieloetapowy jailbreaking: Badanie Anthropic (2024) wykazało, że skuteczność ataków podlega prawu potęgowemu: wraz ze wzrostem liczby szkodliwych przykładów w promptcie rośnie odsetek niepożądanych odpowiedzi[11].
Mechanizmy ochrony
- Klasyfikatory konstytucyjne (Anthropic): Filtrowanie danych wejściowych/wyjściowych na podstawie zestawu zasad konstytucyjnych. Metoda ta pozwoliła obniżyć skuteczność jailbreak z 86% do 4,4% w kontrolowanych ocenach[12].
- Uczenie przez wzmacnianie z ludzką informacją zwrotną (RLHF): Trzyetapowe uczenie (OpenAI), obejmujące nadzorowane dostrajanie, uczenie modelu nagrody i optymalizację polityki, wykazało znaczące ograniczenie generowania toksycznych treści.
- Uczenie adversarialne: Uczenie modelu na przykładach ataków jailbreak w celu zwiększenia jego odporności. Skuteczność tego podejścia w ograniczaniu powodzenia ataków szacuje się na 60–80%[1].
- Ochrona wielowarstwowa: Zalecana strategia obejmująca walidację danych wejściowych, ochronę na poziomie modelu, monitorowanie danych wyjściowych oraz ciągły monitoring w czasie rzeczywistym.
Ataki jailbreak na duże modele językowe stanowią fundamentalny problem bezpieczeństwa AI, ukazując stałe napięcie między możliwościami a wyrównaniem modeli. Krajobraz ataków nieustannie się komplikuje, przechodząc od prostych prompt injection do złożonych ataków multimodalnych i zautomatyzowanych. Badania wskazują, że żaden z aktualnych mechanizmów obronnych nie jest w pełni odporny na wszystkie próby jailbreak. Sukces w tej dziedzinie wymaga stałych inwestycji w badania nad bezpieczeństwem, praktyk odpowiedzialnego ujawniania informacji oraz wspólnych wysiłków badaczy, przemysłu i organów regulacyjnych.
Odnośniki
- Prompting Guide: Jailbreaking
- Repozytorium z implementacją ataku GCG na GitHub
Literatura
- Bai, Y. et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.
- Zou, A. et al. (2023). Universal and Transferable Adversarial Attacks on Aligned Language Models. arXiv:2307.15043.
- Shen, X. et al. (2023). "Do Anything Now\": Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models. arXiv:2308.03825.
- Chao, P. et al. (2024). JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models. arXiv:2404.01318.
- Liao, Z.; Sun, H. (2024). AmpleGCG: Learning a Universal and Transferable Generative Model of Adversarial Suffixes for Jailbreaking Both Open and Closed LLMs. OpenReview UfqzXg95I5.
- Yi, S. et al. (2024). Jailbreak Attacks and Defenses Against Large Language Models: A Survey. arXiv:2407.04295.
- Chu, J. et al. (2025). JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs. arXiv:2402.05668.
- Liu, A. et al. (2025). PiCo: Jailbreaking Multimodal Large Language Models via Pictorial Code Contextualization. arXiv:2504.01444.
- Ghosal, D. et al. (2025). Immune: Improving Safety Against Jailbreaks in Multi-modal LLMs via Inference-Time Filtering. CVPR 2025. PDF.
- Yan, Q. et al. (2025). Hidden in Plain Sight: Probing Implicit Reasoning in Multimodal Language Models. arXiv:2506.00258.
- Liu, Y. et al. (2025). RePD: Defending Jailbreak Attack through a Retrieval-Based Detector. Findings of NAACL 2025. ACL Anthology.
Przypisy
- ↑ 1.0 1.1 «A brief history of jailbreaking». Lil'Log. [1]
- ↑ 2.0 2.1 Yi, J., et al. «Jailbreak Attacks and Defenses Against Large Language Models: A Comprehensive Survey». arXiv:2405.09443. [2]
- ↑ «Jailbreaking LLMs». Prompting Guide. [3]
- ↑ «Exploring prompt injection attacks». NCC Group. [4]
- ↑ «Do Anything Now: Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models». arXiv:2308.03825. [5]
- ↑ «0xk1h0/ChatGPT_DAN». GitHub. [6]
- ↑ «ChatGPT "Time-travel" jailbreak lets you bypass its safety guards». BleepingComputer. [8]
- ↑ Chu, Z., et al. «JailbreakRadar: A Comprehensive Benchmark for Jailbreak Attack and Defense». arXiv:2402.12642. [9]
- ↑ Zou, A., et al. «Universal and Transferable Adversarial Attacks on Aligned Language Models». arXiv:2307.15043. [10]
- ↑ «Many-shot Jailbreaking». Anthropic. [11]
- ↑ «How we're using 'constitutional AI' to make our models safer». MIT Technology Review. [12]