Jailbreaks (LLM) (BG)
Джейлбрейк (англ. Jailbreak — буквално „бягство от затвор") в контекста на големите езикови модели (LLM) — това е вид състезателна атака, чиято цел е заобикаляне на вградените механизми за сигурност и ограничения с цел получаване на забранени или потенциално вредоносни отговори[1]. Jailbreak представлява „индуциране на модела към генериране на вредоносни отговори, противоречащи на политиките за ползване и обществените норми, чрез разработване на състезателни prompt-ове"[2].
Фундаменталната уязвимост, която се експлоатира при jailbreak атаки, се крие в архитектурната особеност на LLM: моделите не могат да различават инструкциите от данните по техния тип, тъй като системните prompt-ове и потребителският вход имат еднакъв формат — низове от текст на естествен език[3].
История на възникването и развитието
Ранен период: Промпт-инжекции (2022)
Първото документирано установяване на уязвимост към промпт-инжекции се случи през май 2022 година, когато изследователи от компанията Preamble открили възприемчивостта на ChatGPT към такива атаки. През септември 2022 година Райли Гудсайд независимо публикувал първата публична демонстрация на уязвимостта на GPT-3 в Twitter с известен пример, в който на модела се нарежда да игнорира предишните инструкции[4].
Ерата на DAN (2022–2023)
В средата на 2022 година се появили първите prompt-ове "Do Anything Now" ('DAN), представляващи инструкции за ролева игра. Ключовата иновация се изразявала в използването на ролева игра за заобикаляне на ограниченията за сигурност чрез създаване на „алтернативна личност", свободна от правила[5]. Еволюцията на DAN довела до появата на сложни сценарии със системи от token-и (механизми за наказание/награда) и механизми за запазване на персонажа[6].
Диверсификация на методите (2023–2024)
От 2023 година започнали комплексни академични изследвания на jailbreak атаките. През 2024 година се появили мултимодални атаки, включващи скриване на вредоносни инструкции в изображения, аудиофайлове, както и визуални промпт-инжекции чрез ASCII-art[7].
Съвременен период (2024–2025)
Техниките за атаки продължават да се усложняват. През ноември 2024 година беше открита техниката "Time Bandit", която експлоатира временното объркване в ChatGPT-4o чрез формулиране на въпроси сякаш от исторически периоди (1800–1900-те години)[8].
Технически методи и класификация
Атаките могат да се класифицират според достъпа до модела:
- Атаки на черна кутия: Без достъп до вътрешните компоненти на модела (параметри, градиенти).
- Атаки на бяла кутия: С пълен достъп до параметрите на модела и градиентите[2].
Таксономия на JailbreakRadar
Класификацията JailbreakRadar (Chu et al., 2024) разграничава шест основни категории атаки:
- Преки атаки: Непосредствени вредоносни prompt-ове.
- Косвени атаки: Многостъпкови стратегии за манипулиране.
- Контекстни атаки: Използване на историята на разговора.
- Ролеви атаки: Техники за имперсонация на персонажи (например DAN).
- Кодиращи атаки: Методи за обфускация с цел скриване на вредоносни инструкции.
- Шаблонни атаки: Структурирани състезателни фреймворки[9].
Технически механизми
- Генериране на състезателни суфикси (GCG): Методът, предложен от Zou et al. (2023), автоматично генерира състезателни суфикси (последователности от token-и), които при добавяне към prompt-а с висока вероятност предизвикват вредоносен отговор. Методът използва градиентна оптимизация и демонстрира висока успеваемост (до 84% при GPT-4) и преносимост между модели[10].
- Многоходово джейлбрейкване: Изследване на Anthropic (2024) показа, че ефективността на атаките следва степенен закон: с увеличаването на броя на вредоносните примери в prompt-а нараства процентът на нежелателните отговори[11].
Механизми за защита
- Конституционални класификатори (Anthropic): Филтриране на входните/изходните данни въз основа на набор от конституционални принципи. Този метод позволи намаляване на успеваемостта на jailbreak от 86% до 4.4% при контролирани оценки[12].
- Обучение с подкрепление от човешка обратна връзка (RLHF): Триетапното обучение (OpenAI), включващо контролирана настройка, обучение на модела на награда и оптимизация на политиката, показа значително намаляване на генерирането на токсично съдържание.
- Състезателно обучение: Обучение на модела върху примери на jailbreak атаки с цел повишаване на неговата устойчивост. Ефективността на този подход за намаляване на успеваемостта на атаките се оценява на 60–80%[1].
- Многоравнищна защита: Препоръчителна стратегия, включваща валидиране на входните данни, защита на ниво модел, мониторинг на изходните данни и непрекъснат мониторинг в реално време.
Jailbreak атаките срещу големите езикови модели представляват фундаментален проблем за сигурността на ИИ, демонстрирайки постоянното напрежение между възможностите и изравняването на моделите. Пейзажът на атаките непрекъснато се усложнява, преминавайки от прости промпт-инжекции към сложни мултимодални и автоматизирани атаки. Изследванията показват, че нито един от съществуващите защитни механизми не е напълно устойчив към всички опити за jailbreak. Успехът в тази област изисква постоянни инвестиции в изследвания в областта на сигурността, практики за отговорно разкриване и съвместни усилия на изследователи, индустрия и регулатори.
Препратки
- Prompting Guide: Jailbreaking
- Хранилище с реализация на атаката GCG в GitHub
Литература
- Bai, Y. et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.
- Zou, A. et al. (2023). Universal and Transferable Adversarial Attacks on Aligned Language Models. arXiv:2307.15043.
- Shen, X. et al. (2023). "Do Anything Now": Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models. arXiv:2308.03825.
- Chao, P. et al. (2024). JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models. arXiv:2404.01318.
- Liao, Z.; Sun, H. (2024). AmpleGCG: Learning a Universal and Transferable Generative Model of Adversarial Suffixes for Jailbreaking Both Open and Closed LLMs. OpenReview UfqzXg95I5.
- Yi, S. et al. (2024). Jailbreak Attacks and Defenses Against Large Language Models: A Survey. arXiv:2407.04295.
- Chu, J. et al. (2025). JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs. arXiv:2402.05668.
- Liu, A. et al. (2025). PiCo: Jailbreaking Multimodal Large Language Models via Pictorial Code Contextualization. arXiv:2504.01444.
- Ghosal, D. et al. (2025). Immune: Improving Safety Against Jailbreaks in Multi-modal LLMs via Inference-Time Filtering. CVPR 2025. PDF.
- Yan, Q. et al. (2025). Hidden in Plain Sight: Probing Implicit Reasoning in Multimodal Language Models. arXiv:2506.00258.
- Liu, Y. et al. (2025). RePD: Defending Jailbreak Attack through a Retrieval-Based Detector. Findings of NAACL 2025. ACL Anthology.
Бележки
- ↑ 1.0 1.1 «A brief history of jailbreaking». Lil'Log. [1]
- ↑ 2.0 2.1 Yi, J., et al. «Jailbreak Attacks and Defenses Against Large Language Models: A Comprehensive Survey». arXiv:2405.09443. [2]
- ↑ «Jailbreaking LLMs». Prompting Guide. [3]
- ↑ «Exploring prompt injection attacks». NCC Group. [4]
- ↑ «Do Anything Now: Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models». arXiv:2308.03825. [5]
- ↑ «0xk1h0/ChatGPT_DAN». GitHub. [6]
- ↑ «ChatGPT "Time-travel" jailbreak lets you bypass its safety guards». BleepingComputer. [8]
- ↑ Chu, Z., et al. «JailbreakRadar: A Comprehensive Benchmark for Jailbreak Attack and Defense». arXiv:2402.12642. [9]
- ↑ Zou, A., et al. «Universal and Transferable Adversarial Attacks on Aligned Language Models». arXiv:2307.15043. [10]
- ↑ «Many-shot Jailbreaking». Anthropic. [11]
- ↑ «How we're using 'constitutional AI' to make our models safer». MIT Technology Review. [12]