Jailbreaks (LLM) (SV)
Jailbreak (engelska: Jailbreak — ordagrant \"fångrymning\") i kontexten av stora språkmodeller (LLM) är en typ av motståndsinriktad attack vars syfte är att kringgå inbyggda säkerhetsmekanismer och begränsningar för att erhålla förbjudna eller potentiellt skadliga svar[1]. Jailbreak innebär \"att förmå en modell att generera skadliga svar som strider mot användningspolicyer och samhälleliga normer, genom att utforma motståndsinriktade promptar\"[2].
Den grundläggande sårbarhet som utnyttjas vid jailbreak-attacker ligger i en arkitektonisk egenskap hos LLM: modellerna kan inte skilja mellan instruktioner och data utifrån deras typ, eftersom både systempromptarna och användarinmatningen har samma format — textsträngar på naturligt språk[3].
Historia och utveckling
Tidig period: Prompt-injektioner (2022)
Den första dokumenterade upptäckten av sårbarheten för prompt-injektioner skedde i maj 2022, när forskare från företaget Preamble upptäckte att ChatGPT var mottagligt för sådana attacker. I september 2022 publicerade Riley Goodside oberoende den första offentliga demonstrationen av sårbarheten i GPT-3 på Twitter, med ett välkänt exempel där modellen beordrades att ignorera tidigare instruktioner[4].
DAN-eran (2022–2023)
I mitten av 2022 dök de första promptarna med namnet "Do Anything Now" (DAN) upp, vilka utgjorde instruktioner för rollspel. Den viktigaste innovationen var användningen av rollspel för att kringgå säkerhetsbegränsningar genom att skapa en \"alternativ personlighet\" fri från regler[5]. Utvecklingen av DAN ledde till komplexa scenarier med tokensystem (straff- och belöningsmekanismer) och mekanismer för att bibehålla karaktären[6].
Diversifiering av metoder (2023–2024)
Från och med 2023 inleddes omfattande akademisk forskning om jailbreak-attacker. År 2024 uppstod multimodala attacker, som inkluderar dolda skadliga instruktioner i bilder och ljudfiler, samt visuella prompt-injektioner via ASCII-art[7].
Nutida period (2024–2025)
Angreppsmetoderna fortsätter att bli alltmer sofistikerade. I november 2024 upptäcktes tekniken "Time Bandit", som utnyttjar temporal förvirring i ChatGPT-4o genom att formulera frågor som om de kommer från historiska perioder (1800–1900-talet)[8].
Tekniska metoder och klassificering
Attackerna kan klassificeras utifrån åtkomst till modellen:
- Black box-attacker: Utan åtkomst till modellens interna komponenter (parametrar, gradienter).
- White box-attacker: Med full åtkomst till modellens parametrar och gradienter[2].
JailbreakRadar-taxonomi
Klassificeringen JailbreakRadar (Chu et al., 2024) identifierar sex huvudkategorier av attacker:
- Direkta attacker: Omedelbart skadliga promptar.
- Indirekta attacker: Flerstegsstrategier för manipulation.
- Kontextuella attacker: Utnyttjande av konversationshistorik.
- Rollspelsattacker: Tekniker för personifiering av karaktärer (t.ex. DAN).
- Kodningsattacker: Obfuskeringsmetoder för att dölja skadliga instruktioner.
- Mallbaserade attacker: Strukturerade motståndsinriktade ramverk[9].
Tekniska mekanismer
- Generering av motståndsinriktade suffix (GCG): En metod föreslagen av Zou et al. (2023) som automatiskt genererar motståndsinriktade suffix (tokensekvenser) som, när de läggs till en prompt, med hög sannolikhet framkallar ett skadligt svar. Metoden använder gradientoptimering och uppvisar hög framgångsfrekvens (upp till 84% på GPT-4) samt överförbarhet mellan modeller[10].
- Flerstegs-jailbreaking: En studie av Anthropic (2024) visade att attackernas effektivitet följer en potenslag: i takt med att antalet skadliga exempel i prompten ökar, stiger andelen oönskade svar[11].
Skyddsmekanismer
- Konstitutionella klassificerare (Anthropic): Filtrering av in- och utdata baserat på en uppsättning konstitutionella principer. Denna metod minskade framgångsnivån för jailbreak från 86% till 4,4% i kontrollerade utvärderingar[12].
- Reinforcement Learning from Human Feedback (RLHF): Trestegsinlärning (OpenAI) som inkluderar övervakad finjustering, träning av belöningsmodell och policyoptimering, vilket visade en betydande minskning av genereringen av toxiskt innehåll.
- Motståndsinriktad träning: Träning av modellen på exempel med jailbreak-attacker för att öka dess motståndskraft. Effektiviteten av detta tillvägagångssätt för att minska attackframgången uppskattas till 60–80%[1].
- Flernivåskydd: En rekommenderad strategi som inkluderar validering av indata, skydd på modellnivå, övervakning av utdata samt kontinuerlig realtidsövervakning.
Jailbreak-attacker mot stora språkmodeller utgör ett grundläggande AI-säkerhetsproblem och påvisar den ständiga spänningen mellan modellernas förmågor och deras anpassning till mänskliga värderingar. Attacklandskapet blir alltmer komplext och övergår från enkla prompt-injektioner till sofistikerade multimodala och automatiserade attacker. Forskning visar att ingen nuvarande skyddsmekanism är helt motståndskraftig mot alla jailbreak-försök. Framgång på detta område kräver kontinuerliga investeringar i säkerhetsforskning, ansvarsfull informationsdelning och gemensamma ansträngningar från forskare, industri och tillsynsmyndigheter.
Referenser
- Prompting Guide: Jailbreaking
- Arkiv med implementering av GCG-attacken på GitHub
Litteratur
- Bai, Y. et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.
- Zou, A. et al. (2023). Universal and Transferable Adversarial Attacks on Aligned Language Models. arXiv:2307.15043.
- Shen, X. et al. (2023). "Do Anything Now": Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models. arXiv:2308.03825.
- Chao, P. et al. (2024). JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models. arXiv:2404.01318.
- Liao, Z.; Sun, H. (2024). AmpleGCG: Learning a Universal and Transferable Generative Model of Adversarial Suffixes for Jailbreaking Both Open and Closed LLMs. OpenReview UfqzXg95I5.
- Yi, S. et al. (2024). Jailbreak Attacks and Defenses Against Large Language Models: A Survey. arXiv:2407.04295.
- Chu, J. et al. (2025). JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs. arXiv:2402.05668.
- Liu, A. et al. (2025). PiCo: Jailbreaking Multimodal Large Language Models via Pictorial Code Contextualization. arXiv:2504.01444.
- Ghosal, D. et al. (2025). Immune: Improving Safety Against Jailbreaks in Multi-modal LLMs via Inference-Time Filtering. CVPR 2025. PDF.
- Yan, Q. et al. (2025). Hidden in Plain Sight: Probing Implicit Reasoning in Multimodal Language Models. arXiv:2506.00258.
- Liu, Y. et al. (2025). RePD: Defending Jailbreak Attack through a Retrieval-Based Detector. Findings of NAACL 2025. ACL Anthology.
Noter
- ↑ 1.0 1.1 «A brief history of jailbreaking». Lil'Log. [1]
- ↑ 2.0 2.1 Yi, J., et al. «Jailbreak Attacks and Defenses Against Large Language Models: A Comprehensive Survey». arXiv:2405.09443. [2]
- ↑ «Jailbreaking LLMs». Prompting Guide. [3]
- ↑ «Exploring prompt injection attacks». NCC Group. [4]
- ↑ «Do Anything Now: Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models». arXiv:2308.03825. [5]
- ↑ «0xk1h0/ChatGPT_DAN». GitHub. [6]
- ↑ «ChatGPT "Time-travel" jailbreak lets you bypass its safety guards». BleepingComputer. [8]
- ↑ Chu, Z., et al. «JailbreakRadar: A Comprehensive Benchmark for Jailbreak Attack and Defense». arXiv:2402.12642. [9]
- ↑ Zou, A., et al. «Universal and Transferable Adversarial Attacks on Aligned Language Models». arXiv:2307.15043. [10]
- ↑ «Many-shot Jailbreaking». Anthropic. [11]
- ↑ «How we're using 'constitutional AI' to make our models safer». MIT Technology Review. [12]