---
title: "Jailbreaks (LLM) (BG)"
source: "https://systems-analysis.info/int/Jailbreaks_(LLM)_(BG)"
wiki: "systems-analysis.info/int"
article: "Jailbreaks_(LLM)_(BG)"
language: "bg"
categories:
  - "Category:Bulgarian"
  - "Category:Large language models"
  - "Category:Machine learning"
revision_id: 3288
wiki_created_at: 2026-09-06T23:18:27Z
wiki_modified_at: 2026-09-06T23:18:27Z
downloaded_at: 2026-09-07T22:56:09Z
---

# Jailbreaks (LLM) (BG)

**Джейлбрейк** (англ. **Jailbreak** — буквално „бягство от затвор") в контекста на големите езикови модели (LLM) — това е вид състезателна атака, чиято цел е заобикаляне на вградените механизми за сигурност и ограничения с цел получаване на забранени или потенциално вредоносни отговори<sup>[\[1\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(BG)#cite_note-lillog_intro-1)</sup>. Jailbreak представлява „индуциране на модела към генериране на вредоносни отговори, противоречащи на политиките за ползване и обществените норми, чрез разработване на състезателни prompt-ове"<sup>[\[2\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(BG)#cite_note-yi_2024_survey-2)</sup>.

Фундаменталната уязвимост, която се експлоатира при jailbreak атаки, се крие в архитектурната особеност на LLM: моделите не могат да различават инструкциите от данните по техния тип, тъй като системните prompt-ове и потребителският вход имат еднакъв формат — низове от текст на естествен език<sup>[\[3\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(BG)#cite_note-prompting_guide_vuln-3)</sup>.

## История на възникването и развитието

### Ранен период: Промпт-инжекции (2022)

Първото документирано установяване на уязвимост към промпт-инжекции се случи през май 2022 година, когато изследователи от компанията **Preamble** открили възприемчивостта на ChatGPT към такива атаки. През септември 2022 година **Райли Гудсайд** независимо публикувал първата публична демонстрация на уязвимостта на GPT-3 в Twitter с известен пример, в който на модела се нарежда да игнорира предишните инструкции<sup>[\[4\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(BG)#cite_note-ncc_group_history-4)</sup>.

### Ерата на DAN (2022–2023)

В средата на 2022 година се появили първите prompt-ове *"Do Anything Now" **('*****DAN**), представляващи инструкции за ролева игра. Ключовата иновация се изразявала в използването на ролева игра за заобикаляне на ограниченията за сигурност чрез създаване на „алтернативна личност", свободна от правила<sup>[\[5\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(BG)#cite_note-dan_evolution_arxiv-5)</sup>. Еволюцията на DAN довела до появата на сложни сценарии със системи от token-и (механизми за наказание/награда) и механизми за запазване на персонажа<sup>[\[6\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(BG)#cite_note-dan_github-6)</sup>.

### Диверсификация на методите (2023–2024)

От 2023 година започнали комплексни академични изследвания на jailbreak атаките. През 2024 година се появили **мултимодални атаки**, включващи скриване на вредоносни инструкции в изображения, аудиофайлове, както и визуални промпт-инжекции чрез ASCII-art<sup>[\[7\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(BG)#cite_note-hiddenlayer_multimodal-7)</sup>.

### Съвременен период (2024–2025)

Техниките за атаки продължават да се усложняват. През ноември 2024 година беше открита техниката **"Time Bandit"**, която експлоатира временното объркване в ChatGPT-4o чрез формулиране на въпроси сякаш от исторически периоди (1800–1900-те години)<sup>[\[8\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(BG)#cite_note-bleeping_computer_time_bandit-8)</sup>.

## Технически методи и класификация

Атаките могат да се класифицират според достъпа до модела:

- **Атаки на черна кутия**: Без достъп до вътрешните компоненти на модела (параметри, градиенти).
- **Атаки на бяла кутия**: С пълен достъп до параметрите на модела и градиентите<sup>[\[2\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(BG)#cite_note-yi_2024_survey-2)</sup>.

### Таксономия на JailbreakRadar

Класификацията *JailbreakRadar* (Chu et al., 2024) разграничава шест основни категории атаки:

1.  **Преки атаки:** Непосредствени вредоносни prompt-ове.
2.  **Косвени атаки:** Многостъпкови стратегии за манипулиране.
3.  **Контекстни атаки:** Използване на историята на разговора.
4.  **Ролеви атаки:** Техники за имперсонация на персонажи (например DAN).
5.  **Кодиращи атаки:** Методи за обфускация с цел скриване на вредоносни инструкции.
6.  **Шаблонни атаки:** Структурирани състезателни фреймворки<sup>[\[9\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(BG)#cite_note-chu_2024_radar-9)</sup>.

### Технически механизми

- **Генериране на състезателни суфикси (GCG):** Методът, предложен от Zou et al. (2023), автоматично генерира състезателни суфикси (последователности от token-и), които при добавяне към prompt-а с висока вероятност предизвикват вредоносен отговор. Методът използва градиентна оптимизация и демонстрира висока успеваемост (до 84% при GPT-4) и преносимост между модели<sup>[\[10\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(BG)#cite_note-zou_2023_gcg-10)</sup>.
- **Многоходово джейлбрейкване:** Изследване на Anthropic (2024) показа, че ефективността на атаките следва степенен закон: с увеличаването на броя на вредоносните примери в prompt-а нараства процентът на нежелателните отговори<sup>[\[11\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(BG)#cite_note-anthropic_many_shot-11)</sup>.

## Механизми за защита

- **Конституционални класификатори (Anthropic):** Филтриране на входните/изходните данни въз основа на набор от конституционални принципи. Този метод позволи намаляване на успеваемостта на jailbreak от 86% до 4.4% при контролирани оценки<sup>[\[12\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(BG)#cite_note-mit_tech_review_const_ai-12)</sup>.
- **Обучение с подкрепление от човешка обратна връзка (RLHF):** Триетапното обучение (OpenAI), включващо контролирана настройка, обучение на модела на награда и оптимизация на политиката, показа значително намаляване на генерирането на токсично съдържание.
- **Състезателно обучение:** Обучение на модела върху примери на jailbreak атаки с цел повишаване на неговата устойчивост. Ефективността на този подход за намаляване на успеваемостта на атаките се оценява на 60–80%<sup>[\[1\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(BG)#cite_note-lillog_intro-1)</sup>.
- **Многоравнищна защита:** Препоръчителна стратегия, включваща валидиране на входните данни, защита на ниво модел, мониторинг на изходните данни и непрекъснат мониторинг в реално време.

Jailbreak атаките срещу големите езикови модели представляват фундаментален проблем за сигурността на ИИ, демонстрирайки постоянното напрежение между възможностите и изравняването на моделите. Пейзажът на атаките непрекъснато се усложнява, преминавайки от прости промпт-инжекции към сложни мултимодални и автоматизирани атаки. Изследванията показват, че нито един от съществуващите защитни механизми не е напълно устойчив към всички опити за jailbreak. Успехът в тази област изисква постоянни инвестиции в изследвания в областта на сигурността, практики за отговорно разкриване и съвместни усилия на изследователи, индустрия и регулатори.

## Препратки

- Prompting Guide: Jailbreaking
- Хранилище с реализация на атаката GCG в GitHub

## Литература

- Bai, Y. et al. (2022). *Constitutional AI: Harmlessness from AI Feedback*. arXiv:2212.08073.
- Zou, A. et al. (2023). *Universal and Transferable Adversarial Attacks on Aligned Language Models*. arXiv:2307.15043.
- Shen, X. et al. (2023). *"Do Anything Now": Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models*. arXiv:2308.03825.
- Chao, P. et al. (2024). *JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models*. arXiv:2404.01318.
- Liao, Z.; Sun, H. (2024). *AmpleGCG: Learning a Universal and Transferable Generative Model of Adversarial Suffixes for Jailbreaking Both Open and Closed LLMs*. OpenReview UfqzXg95I5.
- Yi, S. et al. (2024). *Jailbreak Attacks and Defenses Against Large Language Models: A Survey*. arXiv:2407.04295.
- Chu, J. et al. (2025). *JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs*. arXiv:2402.05668.
- Liu, A. et al. (2025). *PiCo: Jailbreaking Multimodal Large Language Models via Pictorial Code Contextualization*. arXiv:2504.01444.
- Ghosal, D. et al. (2025). *Immune: Improving Safety Against Jailbreaks in Multi-modal LLMs via Inference-Time Filtering*. *CVPR 2025*. PDF.
- Yan, Q. et al. (2025). *Hidden in Plain Sight: Probing Implicit Reasoning in Multimodal Language Models*. arXiv:2506.00258.
- Liu, Y. et al. (2025). *RePD: Defending Jailbreak Attack through a Retrieval-Based Detector*. *Findings of NAACL 2025*. ACL Anthology.

## Бележки

1.  <span id="cite_note-lillog_intro-1">↑ <sup>[1.0](https://systems-analysis.info/int/Jailbreaks_(LLM)_(BG)#cite_ref-lillog_intro_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Jailbreaks_(LLM)_(BG)#cite_ref-lillog_intro_1-1)</sup> «A brief history of jailbreaking». *Lil'Log*. <a href="https://lilianweng.github.io/posts/2023-03-15-prompt-engineering/" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-yi_2024_survey-2">↑ <sup>[2.0](https://systems-analysis.info/int/Jailbreaks_(LLM)_(BG)#cite_ref-yi_2024_survey_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/Jailbreaks_(LLM)_(BG)#cite_ref-yi_2024_survey_2-1)</sup> Yi, J., et al. «Jailbreak Attacks and Defenses Against Large Language Models: A Comprehensive Survey». *arXiv:2405.09443*. <a href="https://arxiv.org/abs/2405.09443" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-prompting_guide_vuln-3">[↑](https://systems-analysis.info/int/Jailbreaks_(LLM)_(BG)#cite_ref-prompting_guide_vuln_3-0) «Jailbreaking LLMs». *Prompting Guide*. <a href="https://www.promptingguide.ai/risks/jailbreaking" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-ncc_group_history-4">[↑](https://systems-analysis.info/int/Jailbreaks_(LLM)_(BG)#cite_ref-ncc_group_history_4-0) «Exploring prompt injection attacks». *NCC Group*. <a href="https://research.nccgroup.com/2022/12/05/exploring-prompt-injection-attacks/" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-dan_evolution_arxiv-5">[↑](https://systems-analysis.info/int/Jailbreaks_(LLM)_(BG)#cite_ref-dan_evolution_arxiv_5-0) «Do Anything Now: Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models». *arXiv:2308.03825*. <a href="https://arxiv.org/abs/2308.03825" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-dan_github-6">[↑](https://systems-analysis.info/int/Jailbreaks_(LLM)_(BG)#cite_ref-dan_github_6-0) «0xk1h0/ChatGPT_DAN». *GitHub*. <a href="https://github.com/0xk1h0/ChatGPT_DAN" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-hiddenlayer_multimodal-7">[↑](https://systems-analysis.info/int/Jailbreaks_(LLM)_(BG)#cite_ref-hiddenlayer_multimodal_7-0) «Hiding in Plain Sight: Multimodal Jailbreaking of Large Language Models». *HiddenLayer*. <a href="https://hiddenlayer.com/research/multimodal-jailbreaking-of-large-language-models/" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-bleeping_computer_time_bandit-8">[↑](https://systems-analysis.info/int/Jailbreaks_(LLM)_(BG)#cite_ref-bleeping_computer_time_bandit_8-0) «ChatGPT "Time-travel" jailbreak lets you bypass its safety guards». *BleepingComputer*. <a href="https://www.bleepingcomputer.com/news/security/chatgpt-time-travel-jailbreak-lets-you-bypass-its-safety-guards/" class="external autonumber" rel="nofollow">[8]</a></span>
9.  <span id="cite_note-chu_2024_radar-9">[↑](https://systems-analysis.info/int/Jailbreaks_(LLM)_(BG)#cite_ref-chu_2024_radar_9-0) Chu, Z., et al. «JailbreakRadar: A Comprehensive Benchmark for Jailbreak Attack and Defense». *arXiv:2402.12642*. <a href="https://arxiv.org/abs/2402.12642" class="external autonumber" rel="nofollow">[9]</a></span>
10. <span id="cite_note-zou_2023_gcg-10">[↑](https://systems-analysis.info/int/Jailbreaks_(LLM)_(BG)#cite_ref-zou_2023_gcg_10-0) Zou, A., et al. «Universal and Transferable Adversarial Attacks on Aligned Language Models». *arXiv:2307.15043*. <a href="https://arxiv.org/abs/2307.15043" class="external autonumber" rel="nofollow">[10]</a></span>
11. <span id="cite_note-anthropic_many_shot-11">[↑](https://systems-analysis.info/int/Jailbreaks_(LLM)_(BG)#cite_ref-anthropic_many_shot_11-0) «Many-shot Jailbreaking». *Anthropic*. <a href="https://www.anthropic.com/research/many-shot-jailbreaking" class="external autonumber" rel="nofollow">[11]</a></span>
12. <span id="cite_note-mit_tech_review_const_ai-12">[↑](https://systems-analysis.info/int/Jailbreaks_(LLM)_(BG)#cite_ref-mit_tech_review_const_ai_12-0) «How we're using 'constitutional AI' to make our models safer». *MIT Technology Review*. <a href="https://www.technologyreview.com/2023/05/09/1072782/how-were-using-constitutional-ai-to-make-our-models-safer/" class="external autonumber" rel="nofollow">[12]</a></span>
