---
title: "Jailbreaks"
source: "https://systems-analysis.info/wiki/Jailbreaks"
wiki: "systems-analysis.info/wiki"
article: "Jailbreaks"
language: "ru"
categories:
  - "Категория:Russian"
  - "Категория:Большие языковые модели"
  - "Категория:Машинное обучение"
revision_id: 129
wiki_created_at: 2026-09-06T21:55:29Z
wiki_modified_at: 2026-09-06T21:55:29Z
downloaded_at: 2026-09-07T22:17:40Z
---

# Jailbreaks

**Джейлбрейк** (англ. **Jailbreak** — дословно «побег из тюрьмы») в контексте [больших языковых моделей](https://systems-analysis.info/wiki/%D0%91%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D0%B5_%D1%8F%D0%B7%D1%8B%D0%BA%D0%BE%D0%B2%D1%8B%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8 "Большие языковые модели") (LLM) — это тип состязательной атаки, целью которой является обход встроенных механизмов безопасности и ограничений для получения запрещённых или потенциально вредоносных ответов<sup>[\[1\]](https://systems-analysis.info/wiki/Jailbreaks#cite_note-lillog_intro-1)</sup>. Jailbreak представляет собой «индуцирование модели к генерации вредоносных ответов, противоречащих политике использования и общественным нормам, посредством разработки состязательных промптов»<sup>[\[2\]](https://systems-analysis.info/wiki/Jailbreaks#cite_note-yi_2024_survey-2)</sup>.

Фундаментальная уязвимость, эксплуатируемая при jailbreak-атаках, заключается в архитектурной особенности LLM: модели не могут различать инструкции и данные по их типу, поскольку и системные промпты, и пользовательский ввод имеют одинаковый формат — строки текста на естественном языке<sup>[\[3\]](https://systems-analysis.info/wiki/Jailbreaks#cite_note-prompting_guide_vuln-3)</sup>.

## История возникновения и развития

### Ранний период: Промпт-инъекции (2022)

Первое документированное обнаружение уязвимости к промпт-инъекциям произошло в мае 2022 года, когда исследователи из компании **Preamble** обнаружили восприимчивость ChatGPT к таким атакам. В сентябре 2022 года **Райли Гудсайд** независимо опубликовал первую публичную демонстрацию уязвимости GPT-3 в Twitter с известным примером, где модели приказывалось проигнорировать предыдущие инструкции<sup>[\[4\]](https://systems-analysis.info/wiki/Jailbreaks#cite_note-ncc_group_history-4)</sup>.

### Эра DAN (2022–2023)

В середине 2022 года появились первые промпты **"Do Anything Now"** (**DAN**), представлявшие собой инструкции для ролевой игры. Ключевой инновацией стало использование ролевой игры для обхода ограничений безопасности путём создания «альтернативной личности», свободной от правил<sup>[\[5\]](https://systems-analysis.info/wiki/Jailbreaks#cite_note-dan_evolution_arxiv-5)</sup>. Эволюция DAN привела к появлению сложных сценариев с системами [токенов](https://systems-analysis.info/wiki/%D0%A2%D0%BE%D0%BA%D0%B5%D0%BD "Токен") (механизмы наказания/вознаграждения) и механизмами сохранения персонажа<sup>[\[6\]](https://systems-analysis.info/wiki/Jailbreaks#cite_note-dan_github-6)</sup>.

### Диверсификация методов (2023–2024)

С 2023 года начались комплексные академические исследования jailbreak-атак. В 2024 году появились **мультимодальные атаки**, включающие скрытие вредоносных инструкций в изображениях, аудиофайлах, а также визуальные промпт-инъекции через ASCII-art<sup>[\[7\]](https://systems-analysis.info/wiki/Jailbreaks#cite_note-hiddenlayer_multimodal-7)</sup>.

### Современный период (2024–2025)

Техники атак продолжают усложняться. В ноябре 2024 года была обнаружена техника **"Time Bandit"**, эксплуатирующая временную путаницу в ChatGPT-4o путём формулирования вопросов как будто из исторических периодов (1800-1900-е годы)<sup>[\[8\]](https://systems-analysis.info/wiki/Jailbreaks#cite_note-bleeping_computer_time_bandit-8)</sup>.

## Технические методы и классификация

Атаки можно классифицировать по доступу к модели:

- **Атаки чёрного ящика**: Без доступа к внутренним компонентам модели (параметрам, градиентам).
- **Атаки белого ящика**: С полным доступом к параметрам модели и градиентам<sup>[\[2\]](https://systems-analysis.info/wiki/Jailbreaks#cite_note-yi_2024_survey-2)</sup>.

### Таксономия JailbreakRadar

Классификация *JailbreakRadar* (Chu et al., 2024) выделяет шесть основных категорий атак:

1.  **Прямые атаки:** Непосредственные вредоносные промпты.
2.  **Косвенные атаки:** Многошаговые стратегии манипулирования.
3.  **Контекстные атаки:** Использование истории разговора.
4.  **Ролевые атаки:** Техники имперсонации персонажей (например, DAN).
5.  **Кодирующие атаки:** Методы обфускации для скрытия вредоносных инструкций.
6.  **Шаблонные атаки:** Структурированные состязательные фреймворки<sup>[\[9\]](https://systems-analysis.info/wiki/Jailbreaks#cite_note-chu_2024_radar-9)</sup>.

### Технические механизмы

- **Генерация состязательных суффиксов (GCG):** Метод, предложенный Zou et al. (2023), автоматически генерирует состязательные суффиксы (последовательности токенов), которые при добавлении к промпту с высокой вероятностью вызывают вредоносный ответ. Метод использует градиентную оптимизацию и демонстрирует высокую успешность (до 84% на GPT-4) и переносимость между моделями<sup>[\[10\]](https://systems-analysis.info/wiki/Jailbreaks#cite_note-zou_2023_gcg-10)</sup>.
- **Многоходовый джейлбрейкинг:** Исследование Anthropic (2024) показало, что эффективность атак следует степенному закону: по мере увеличения количества вредоносных примеров в промпте возрастает процент нежелательных ответов<sup>[\[11\]](https://systems-analysis.info/wiki/Jailbreaks#cite_note-anthropic_many_shot-11)</sup>.

## Механизмы защиты

- **[Конституционные классификаторы](https://systems-analysis.info/wiki/Constitutional_AI "Constitutional AI") (Anthropic):** Фильтрация входных/выходных данных на основе набора конституционных принципов. Этот метод позволил снизить успешность jailbreak с 86% до 4.4% в контролируемых оценках<sup>[\[12\]](https://systems-analysis.info/wiki/Jailbreaks#cite_note-mit_tech_review_const_ai-12)</sup>.
- **Обучение с подкреплением от человеческой обратной связи ([RLHF](https://systems-analysis.info/wiki/RLHF "RLHF")):** Трёхэтапное обучение (OpenAI), включающее контролируемую настройку, обучение модели вознаграждения и оптимизацию политики, показало значительное снижение генерации токсичного контента.
- **Состязательное обучение:** Обучение модели на примерах jailbreak-атак для повышения её устойчивости. Эффективность этого подхода в снижении успешности атак оценивается в 60–80%<sup>[\[1\]](https://systems-analysis.info/wiki/Jailbreaks#cite_note-lillog_intro-1)</sup>.
- **Многоуровневая защита:** Рекомендуемая стратегия, включающая валидацию входных данных, защиту на уровне модели, мониторинг выходных данных и непрерывный мониторинг в реальном времени.

Jailbreak-атаки на большие языковые модели представляют фундаментальную проблему безопасности ИИ, демонстрируя постоянное напряжение между возможностями и выравниванием моделей. Ландшафт атак постоянно усложняется, переходя от простых промпт-инъекций к сложным мультимодальным и автоматизированным атакам. Исследования показывают, что ни один текущий защитный механизм не является полностью устойчивым ко всем попыткам jailbreak. Успех в этой области требует постоянных инвестиций в исследования безопасности, практики ответственного раскрытия и совместных усилий исследователей, индустрии и регуляторов.

## См. также

- [Prompt](https://systems-analysis.info/wiki/Prompt "Prompt")
- [Constitutional AI](https://systems-analysis.info/wiki/Constitutional_AI "Constitutional AI")
- [Большие языковые модели](https://systems-analysis.info/wiki/%D0%91%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D0%B5_%D1%8F%D0%B7%D1%8B%D0%BA%D0%BE%D0%B2%D1%8B%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8 "Большие языковые модели")
- [AI-агент](https://systems-analysis.info/wiki/AI-%D0%B0%D0%B3%D0%B5%D0%BD%D1%82 "AI-агент")
- [Agentic workflows](https://systems-analysis.info/wiki/Agentic_workflows "Agentic workflows")

## Ссылки

- <a href="https://www.promptingguide.ai/risks/jailbreaking" class="external text" rel="nofollow">Prompting Guide: Jailbreaking</a>
- <a href="https://github.com/llm-attacks/llm-attacks" class="external text" rel="nofollow">Репозиторий с реализацией атаки GCG на GitHub</a>

## Литература

- Bai, Y. et al. (2022). *Constitutional AI: Harmlessness from AI Feedback*. <a href="https://arxiv.org/abs/2212.08073" class="external text" rel="nofollow">arXiv:2212.08073</a>.
- Zou, A. et al. (2023). *Universal and Transferable Adversarial Attacks on Aligned Language Models*. <a href="https://arxiv.org/abs/2307.15043" class="external text" rel="nofollow">arXiv:2307.15043</a>.
- Shen, X. et al. (2023). *“Do Anything Now”: Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models*. <a href="https://arxiv.org/abs/2308.03825" class="external text" rel="nofollow">arXiv:2308.03825</a>.
- Chao, P. et al. (2024). *JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models*. <a href="https://arxiv.org/abs/2404.01318" class="external text" rel="nofollow">arXiv:2404.01318</a>.
- Liao, Z.; Sun, H. (2024). *AmpleGCG: Learning a Universal and Transferable Generative Model of Adversarial Suffixes for Jailbreaking Both Open and Closed LLMs*. <a href="https://openreview.net/forum?id=UfqzXg95I5" class="external text" rel="nofollow">OpenReview UfqzXg95I5</a>.
- Yi, S. et al. (2024). *Jailbreak Attacks and Defenses Against Large Language Models: A Survey*. <a href="https://arxiv.org/abs/2407.04295" class="external text" rel="nofollow">arXiv:2407.04295</a>.
- Chu, J. et al. (2025). *JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs*. <a href="https://arxiv.org/abs/2402.05668" class="external text" rel="nofollow">arXiv:2402.05668</a>.
- Liu, A. et al. (2025). *PiCo: Jailbreaking Multimodal Large Language Models via Pictorial Code Contextualization*. <a href="https://arxiv.org/abs/2504.01444" class="external text" rel="nofollow">arXiv:2504.01444</a>.
- Ghosal, D. et al. (2025). *Immune: Improving Safety Against Jailbreaks in Multi-modal LLMs via Inference-Time Filtering*. *CVPR 2025*. <a href="https://openaccess.thecvf.com/content/CVPR2025/papers/Ghosal_Immune_Improving_Safety_Against_Jailbreaks_in_Multi-modal_LLMs_via_Inference-Time_CVPR_2025_paper.pdf" class="external text" rel="nofollow">PDF</a>.
- Yan, Q. et al. (2025). *Hidden in Plain Sight: Probing Implicit Reasoning in Multimodal Language Models*. <a href="https://arxiv.org/abs/2506.00258" class="external text" rel="nofollow">arXiv:2506.00258</a>.
- Liu, Y. et al. (2025). *RePD: Defending Jailbreak Attack through a Retrieval-Based Detector*. *Findings of NAACL 2025*. <a href="https://aclanthology.org/2025.findings-naacl.16.pdf" class="external text" rel="nofollow">ACL Anthology</a>.

## Примечания

1.  <span id="cite_note-lillog_intro-1">↑ <sup>[1,0](https://systems-analysis.info/wiki/Jailbreaks#cite_ref-lillog_intro_1-0)</sup> <sup>[1,1](https://systems-analysis.info/wiki/Jailbreaks#cite_ref-lillog_intro_1-1)</sup> «A brief history of jailbreaking». *Lil'Log*. <a href="https://lilianweng.github.io/posts/2023-03-15-prompt-engineering/" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-yi_2024_survey-2">↑ <sup>[2,0](https://systems-analysis.info/wiki/Jailbreaks#cite_ref-yi_2024_survey_2-0)</sup> <sup>[2,1](https://systems-analysis.info/wiki/Jailbreaks#cite_ref-yi_2024_survey_2-1)</sup> Yi, J., et al. «Jailbreak Attacks and Defenses Against Large Language Models: A Comprehensive Survey». *arXiv:2405.09443*. <a href="https://arxiv.org/abs/2405.09443" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-prompting_guide_vuln-3">[↑](https://systems-analysis.info/wiki/Jailbreaks#cite_ref-prompting_guide_vuln_3-0) «Jailbreaking LLMs». *Prompting Guide*. <a href="https://www.promptingguide.ai/risks/jailbreaking" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-ncc_group_history-4">[↑](https://systems-analysis.info/wiki/Jailbreaks#cite_ref-ncc_group_history_4-0) «Exploring prompt injection attacks». *NCC Group*. <a href="https://research.nccgroup.com/2022/12/05/exploring-prompt-injection-attacks/" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-dan_evolution_arxiv-5">[↑](https://systems-analysis.info/wiki/Jailbreaks#cite_ref-dan_evolution_arxiv_5-0) «Do Anything Now: Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models». *arXiv:2308.03825*. <a href="https://arxiv.org/abs/2308.03825" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-dan_github-6">[↑](https://systems-analysis.info/wiki/Jailbreaks#cite_ref-dan_github_6-0) «0xk1h0/ChatGPT_DAN». *GitHub*. <a href="https://github.com/0xk1h0/ChatGPT_DAN" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-hiddenlayer_multimodal-7">[↑](https://systems-analysis.info/wiki/Jailbreaks#cite_ref-hiddenlayer_multimodal_7-0) «Hiding in Plain Sight: Multimodal Jailbreaking of Large Language Models». *HiddenLayer*. <a href="https://hiddenlayer.com/research/multimodal-jailbreaking-of-large-language-models/" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-bleeping_computer_time_bandit-8">[↑](https://systems-analysis.info/wiki/Jailbreaks#cite_ref-bleeping_computer_time_bandit_8-0) «ChatGPT "Time-travel" jailbreak lets you bypass its safety guards». *BleepingComputer*. <a href="https://www.bleepingcomputer.com/news/security/chatgpt-time-travel-jailbreak-lets-you-bypass-its-safety-guards/" class="external autonumber" rel="nofollow">[8]</a></span>
9.  <span id="cite_note-chu_2024_radar-9">[↑](https://systems-analysis.info/wiki/Jailbreaks#cite_ref-chu_2024_radar_9-0) Chu, Z., et al. «JailbreakRadar: A Comprehensive Benchmark for Jailbreak Attack and Defense». *arXiv:2402.12642*. <a href="https://arxiv.org/abs/2402.12642" class="external autonumber" rel="nofollow">[9]</a></span>
10. <span id="cite_note-zou_2023_gcg-10">[↑](https://systems-analysis.info/wiki/Jailbreaks#cite_ref-zou_2023_gcg_10-0) Zou, A., et al. «Universal and Transferable Adversarial Attacks on Aligned Language Models». *arXiv:2307.15043*. <a href="https://arxiv.org/abs/2307.15043" class="external autonumber" rel="nofollow">[10]</a></span>
11. <span id="cite_note-anthropic_many_shot-11">[↑](https://systems-analysis.info/wiki/Jailbreaks#cite_ref-anthropic_many_shot_11-0) «Many-shot Jailbreaking». *Anthropic*. <a href="https://www.anthropic.com/research/many-shot-jailbreaking" class="external autonumber" rel="nofollow">[11]</a></span>
12. <span id="cite_note-mit_tech_review_const_ai-12">[↑](https://systems-analysis.info/wiki/Jailbreaks#cite_ref-mit_tech_review_const_ai_12-0) «How we're using 'constitutional AI' to make our models safer». *MIT Technology Review*. <a href="https://www.technologyreview.com/2023/05/09/1072782/how-were-using-constitutional-ai-to-make-our-models-safer/" class="external autonumber" rel="nofollow">[12]</a></span>
