Jailbreaks (LLM) (NL)
Jailbreak (Engels: Jailbreak — letterlijk \"ontsnapping uit de gevangenis\") is in de context van grote taalmodellen (LLM) een type adversariale aanval, gericht op het omzeilen van ingebouwde veiligheidsmechanismen en beperkingen om verboden of potentieel schadelijke antwoorden te verkrijgen[1]. Een Jailbreak is het \"aanzetten van een model tot het genereren van schadelijke antwoorden die in strijd zijn met het gebruiksbeleid en maatschappelijke normen, door middel van het ontwikkelen van adversariale prompts\"[2].
De fundamentele kwetsbaarheid die bij jailbreak-aanvallen wordt uitgebuit, ligt in een architecturale eigenschap van LLM's: modellen kunnen instructies en gegevens niet op type onderscheiden, omdat zowel systeemprompts als gebruikersinvoer hetzelfde formaat hebben — tekstreeksen in natuurlijke taal[3].
Geschiedenis van ontstaan en ontwikkeling
Vroege periode: Prompt-injecties (2022)
De eerste gedocumenteerde ontdekking van de kwetsbaarheid voor prompt-injecties vond plaats in mei 2022, toen onderzoekers van het bedrijf Preamble de gevoeligheid van ChatGPT voor dergelijke aanvallen ontdekten. In september 2022 publiceerde Riley Goodside zelfstandig de eerste publieke demonstratie van de kwetsbaarheid van GPT-3 op Twitter, met het bekende voorbeeld waarbij het model werd opgedragen eerdere instructies te negeren[4].
Het DAN-tijdperk (2022–2023)
In het midden van 2022 verschenen de eerste "Do Anything Now"-prompts (DAN), die bestonden uit instructies voor rollenspel. De belangrijkste innovatie was het gebruik van rollenspel om veiligheidsbeperkingen te omzeilen door een \"alternatieve persoonlijkheid\" te creëren die vrij is van regels[5]. De evolutie van DAN leidde tot de ontwikkeling van complexe scenario's met tokensystemen (straffen/beloningen-mechanismen) en mechanismen voor het behoud van het personage[6].
Diversificatie van methoden (2023–2024)
Vanaf 2023 begonnen uitgebreide academische onderzoeken naar jailbreak-aanvallen. In 2024 verschenen multimodale aanvallen, waaronder het verbergen van schadelijke instructies in afbeeldingen en audiobestanden, alsmede visuele prompt-injecties via ASCII-art[7].
Hedendaagse periode (2024–2025)
Aanvalstechnieken blijven toenemen in complexiteit. In november 2024 werd de techniek "Time Bandit" ontdekt, die temporele verwarring in ChatGPT-4o uitbuit door vragen te formuleren alsof ze uit historische perioden stammen (de jaren 1800–1900)[8].
Technische methoden en classificatie
Aanvallen kunnen worden geclassificeerd op basis van toegang tot het model:
- Black-box-aanvallen: Zonder toegang tot interne componenten van het model (parameters, gradiënten).
- White-box-aanvallen: Met volledige toegang tot de modelparameters en gradiënten[2].
Taxonomie van JailbreakRadar
De classificatie van JailbreakRadar (Chu et al., 2024) onderscheidt zes hoofdcategorieën van aanvallen:
- Directe aanvallen: Rechtstreekse schadelijke prompts.
- Indirecte aanvallen: Meerstapsstrategieën voor manipulatie.
- Contextuele aanvallen: Gebruik van de gespreksgeschiedenis.
- Rolgebaseerde aanvallen: Technieken voor het imiteren van personages (bijv. DAN).
- Coderingsaanvallen: Obfuscatiemethoden om schadelijke instructies te verbergen.
- Sjabloonaanvallen: Gestructureerde adversariale frameworks[9].
Technische mechanismen
- Generatie van adversariale achtervoegsels (GCG): De methode, voorgesteld door Zou et al. (2023), genereert automatisch adversariale achtervoegsels (tokenreeksen) die, wanneer toegevoegd aan een prompt, met grote kans een schadelijk antwoord veroorzaken. De methode maakt gebruik van gradiëntoptimalisatie en toont een hoge succesratio (tot 84% op GPT-4) en overdraagbaarheid tussen modellen[10].
- Meerstaps-jailbreaking: Onderzoek van Anthropic (2024) toonde aan dat de effectiviteit van aanvallen een machtswet volgt: naarmate het aantal schadelijke voorbeelden in een prompt toeneemt, stijgt het percentage ongewenste antwoorden[11].
Verdedigingsmechanismen
- Constitutionele classifiers (Anthropic): Filtering van invoer- en uitvoergegevens op basis van een set constitutionele principes. Deze methode verlaagde de succesratio van jailbreaks van 86% naar 4,4% in gecontroleerde evaluaties[12].
- Reinforcement Learning from Human Feedback (RLHF): Drietrapstraining (OpenAI), bestaande uit supervised fine-tuning, het trainen van een beloningsmodel en beleidsoptimalisatie, toonde een significante verlaging van de generatie van toxische inhoud.
- Adversariaal trainen: Het trainen van het model op voorbeelden van jailbreak-aanvallen om de robuustheid te vergroten. De effectiviteit van deze aanpak bij het verlagen van de succesratio van aanvallen wordt geschat op 60–80%[1].
- Meerlaagse verdediging: Een aanbevolen strategie die invoervalidatie, beveiliging op modelniveau, monitoring van uitvoergegevens en continue realtime-monitoring omvat.
Jailbreak-aanvallen op grote taalmodellen vormen een fundamenteel AI-veiligheidsprobleem en tonen de voortdurende spanning tussen de mogelijkheden en de afstemming van modellen aan. Het aanvalslandschap wordt steeds complexer en ontwikkelt zich van eenvoudige prompt-injecties naar geavanceerde multimodale en geautomatiseerde aanvallen. Onderzoek toont aan dat geen enkel huidig verdedigingsmechanisme volledig bestand is tegen alle jailbreak-pogingen. Succes op dit gebied vereist voortdurende investeringen in veiligheidsonderzoek, verantwoorde openbaarmakingspraktijken en gezamenlijke inspanningen van onderzoekers, de industrie en toezichthouders.
Verwijzingen
- Prompting Guide: Jailbreaking
- Repository met de implementatie van de GCG-aanval op GitHub
Literatuur
- Bai, Y. et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.
- Zou, A. et al. (2023). Universal and Transferable Adversarial Attacks on Aligned Language Models. arXiv:2307.15043.
- Shen, X. et al. (2023). "Do Anything Now": Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models. arXiv:2308.03825.
- Chao, P. et al. (2024). JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models. arXiv:2404.01318.
- Liao, Z.; Sun, H. (2024). AmpleGCG: Learning a Universal and Transferable Generative Model of Adversarial Suffixes for Jailbreaking Both Open and Closed LLMs. OpenReview UfqzXg95I5.
- Yi, S. et al. (2024). Jailbreak Attacks and Defenses Against Large Language Models: A Survey. arXiv:2407.04295.
- Chu, J. et al. (2025). JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs. arXiv:2402.05668.
- Liu, A. et al. (2025). PiCo: Jailbreaking Multimodal Large Language Models via Pictorial Code Contextualization. arXiv:2504.01444.
- Ghosal, D. et al. (2025). Immune: Improving Safety Against Jailbreaks in Multi-modal LLMs via Inference-Time Filtering. CVPR 2025. PDF.
- Yan, Q. et al. (2025). Hidden in Plain Sight: Probing Implicit Reasoning in Multimodal Language Models. arXiv:2506.00258.
- Liu, Y. et al. (2025). RePD: Defending Jailbreak Attack through a Retrieval-Based Detector. Findings of NAACL 2025. ACL Anthology.
Noten
- ↑ 1.0 1.1 «A brief history of jailbreaking». Lil'Log. [1]
- ↑ 2.0 2.1 Yi, J., et al. «Jailbreak Attacks and Defenses Against Large Language Models: A Comprehensive Survey». arXiv:2405.09443. [2]
- ↑ «Jailbreaking LLMs». Prompting Guide. [3]
- ↑ «Exploring prompt injection attacks». NCC Group. [4]
- ↑ «Do Anything Now: Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models». arXiv:2308.03825. [5]
- ↑ «0xk1h0/ChatGPT_DAN». GitHub. [6]
- ↑ «ChatGPT "Time-travel" jailbreak lets you bypass its safety guards». BleepingComputer. [8]
- ↑ Chu, Z., et al. «JailbreakRadar: A Comprehensive Benchmark for Jailbreak Attack and Defense». arXiv:2402.12642. [9]
- ↑ Zou, A., et al. «Universal and Transferable Adversarial Attacks on Aligned Language Models». arXiv:2307.15043. [10]
- ↑ «Many-shot Jailbreaking». Anthropic. [11]
- ↑ «How we're using 'constitutional AI' to make our models safer». MIT Technology Review. [12]