---
title: "Jailbreaks (LLM) (RO)"
source: "https://systems-analysis.info/int/Jailbreaks_(LLM)_(RO)"
wiki: "systems-analysis.info/int"
article: "Jailbreaks_(LLM)_(RO)"
language: "ro"
categories:
  - "Category:Large language models"
  - "Category:Machine learning"
  - "Category:Romanian"
revision_id: 3301
wiki_created_at: 2026-09-06T23:18:39Z
wiki_modified_at: 2026-09-06T23:18:39Z
downloaded_at: 2026-09-07T22:56:13Z
---

# Jailbreaks (LLM) (RO)

**Jailbreak** (engl. **Jailbreak** — literal „evadare din închisoare") în contextul modelelor lingvistice de mari dimensiuni (LLM) este un tip de atac adversarial al cărui scop este ocolirea mecanismelor de securitate și a restricțiilor încorporate pentru a obține răspunsuri interzise sau potențial dăunătoare<sup>[\[1\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(RO)#cite_note-lillog_intro-1)</sup>. Jailbreak reprezintă „inducerea modelului să genereze răspunsuri dăunătoare, care contravin politicilor de utilizare și normelor sociale, prin elaborarea de prompt-uri adversariale"<sup>[\[2\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(RO)#cite_note-yi_2024_survey-2)</sup>.

Vulnerabilitatea fundamentală exploatată în atacurile de tip jailbreak constă într-o particularitate arhitecturală a LLM-urilor: modelele nu pot distinge instrucțiunile de date după tipul lor, deoarece atât prompt-urile de sistem, cât și intrările utilizatorului au același format — șiruri de text în limbaj natural<sup>[\[3\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(RO)#cite_note-prompting_guide_vuln-3)</sup>.

## Istoricul apariției și dezvoltării

### Perioada timpurie: Injecții de prompt (2022)

Prima detectare documentată a vulnerabilității la injecții de prompt a avut loc în mai 2022, când cercetători de la compania **Preamble** au descoperit susceptibilitatea ChatGPT la astfel de atacuri. În septembrie 2022, **Riley Goodside** a publicat independent prima demonstrație publică a vulnerabilității GPT-3 pe Twitter, cu un exemplu celebru în care modelului i se ordona să ignore instrucțiunile anterioare<sup>[\[4\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(RO)#cite_note-ncc_group_history-4)</sup>.

### Era DAN (2022–2023)

În mijlocul anului 2022 au apărut primele prompt-uri **"Do Anything Now"** (**DAN**), care reprezentau instrucțiuni pentru jocuri de rol. Inovația cheie a constat în utilizarea jocului de rol pentru ocolirea restricțiilor de securitate prin crearea unei „personalități alternative", libere de reguli<sup>[\[5\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(RO)#cite_note-dan_evolution_arxiv-5)</sup>. Evoluția DAN a condus la apariția unor scenarii complexe cu sisteme de token-uri (mecanisme de pedeapsă/recompensă) și mecanisme de menținere a personajului<sup>[\[6\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(RO)#cite_note-dan_github-6)</sup>.

### Diversificarea metodelor (2023–2024)

Începând cu 2023 au debutat cercetări academice complexe privind atacurile de tip jailbreak. În 2024 au apărut **atacuri multimodale**, care includ ascunderea instrucțiunilor dăunătoare în imagini, fișiere audio, precum și injecții vizuale de prompt prin intermediul ASCII-art<sup>[\[7\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(RO)#cite_note-hiddenlayer_multimodal-7)</sup>.

### Perioada contemporană (2024–2025)

Tehnicile de atac continuă să se perfecționeze. În noiembrie 2024 a fost descoperită tehnica **"Time Bandit"**, care exploatează confuzia temporală în ChatGPT-4o prin formularea întrebărilor ca și cum ar proveni din perioade istorice (anii 1800–1900)<sup>[\[8\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(RO)#cite_note-bleeping_computer_time_bandit-8)</sup>.

## Metode tehnice și clasificare

Atacurile pot fi clasificate după nivelul de acces la model:

- **Atacuri de tip cutie neagră**: Fără acces la componentele interne ale modelului (parametri, gradienți).
- **Atacuri de tip cutie albă**: Cu acces complet la parametrii modelului și la gradienți<sup>[\[2\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(RO)#cite_note-yi_2024_survey-2)</sup>.

### Taxonomia JailbreakRadar

Clasificarea *JailbreakRadar* (Chu et al., 2024) identifică șase categorii principale de atacuri:

1.  **Atacuri directe:** Prompt-uri dăunătoare nemijlocite.
2.  **Atacuri indirecte:** Strategii de manipulare în mai mulți pași.
3.  **Atacuri contextuale:** Utilizarea istoricului conversației.
4.  **Atacuri bazate pe roluri:** Tehnici de impersonare a personajelor (de exemplu, DAN).
5.  **Atacuri de codificare:** Metode de ofuscare pentru ascunderea instrucțiunilor dăunătoare.
6.  **Atacuri bazate pe șabloane:** Framework-uri adversariale structurate<sup>[\[9\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(RO)#cite_note-chu_2024_radar-9)</sup>.

### Mecanisme tehnice

- **Generarea de sufixuri adversariale (GCG):** Metoda propusă de Zou et al. (2023) generează automat sufixuri adversariale (secvențe de token-uri) care, atunci când sunt adăugate la un prompt, provoacă cu probabilitate ridicată un răspuns dăunător. Metoda utilizează optimizarea prin gradienți și demonstrează o rată ridicată de succes (până la 84% pe GPT-4) și transferabilitate între modele<sup>[\[10\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(RO)#cite_note-zou_2023_gcg-10)</sup>.
- **Jailbreaking în mai mulți pași:** Cercetarea Anthropic (2024) a arătat că eficiența atacurilor urmează o lege de putere: pe măsură ce crește numărul de exemple dăunătoare din prompt, crește și procentul de răspunsuri nedorite<sup>[\[11\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(RO)#cite_note-anthropic_many_shot-11)</sup>.

## Mecanisme de apărare

- **Clasificatori constituționali (Anthropic):** Filtrarea datelor de intrare/ieșire pe baza unui set de principii constituționale. Această metodă a permis reducerea ratei de succes a jailbreak-ului de la 86% la 4,4% în evaluări controlate<sup>[\[12\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(RO)#cite_note-mit_tech_review_const_ai-12)</sup>.
- **Antrenament prin reinforcement learning din feedback uman (RLHF):** Antrenamentul în trei etape (OpenAI), care include ajustarea supervizată, antrenarea modelului de recompensă și optimizarea politicii, a demonstrat o reducere semnificativă a generării de conținut toxic.
- **Antrenament adversarial:** Antrenarea modelului pe exemple de atacuri de tip jailbreak pentru creșterea rezistenței sale. Eficiența acestei abordări în reducerea ratei de succes a atacurilor este estimată la 60–80%<sup>[\[1\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(RO)#cite_note-lillog_intro-1)</sup>.
- **Apărare pe mai multe niveluri:** Strategie recomandată care include validarea datelor de intrare, protecție la nivelul modelului, monitorizarea datelor de ieșire și monitorizare continuă în timp real.

Atacurile de tip jailbreak asupra modelelor lingvistice de mari dimensiuni reprezintă o problemă fundamentală de securitate a IA, demonstrând tensiunea permanentă dintre capacitățile și alinierea modelelor. Peisajul atacurilor devine din ce în ce mai complex, trecând de la injecții simple de prompt la atacuri multimodale și automatizate sofisticate. Cercetările arată că niciun mecanism de apărare actual nu este complet rezistent la toate tentativele de jailbreak. Succesul în acest domeniu necesită investiții continue în cercetarea securității, practici responsabile de divulgare și eforturi comune ale cercetătorilor, industriei și autorităților de reglementare.

## Referințe

- Prompting Guide: Jailbreaking
- Repositoriu cu implementarea atacului GCG pe GitHub

## Bibliografie

- Bai, Y. et al. (2022). *Constitutional AI: Harmlessness from AI Feedback*. arXiv:2212.08073.
- Zou, A. et al. (2023). *Universal and Transferable Adversarial Attacks on Aligned Language Models*. arXiv:2307.15043.
- Shen, X. et al. (2023). *"Do Anything Now": Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models*. arXiv:2308.03825.
- Chao, P. et al. (2024). *JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models*. arXiv:2404.01318.
- Liao, Z.; Sun, H. (2024). *AmpleGCG: Learning a Universal and Transferable Generative Model of Adversarial Suffixes for Jailbreaking Both Open and Closed LLMs*. OpenReview UfqzXg95I5.
- Yi, S. et al. (2024). *Jailbreak Attacks and Defenses Against Large Language Models: A Survey*. arXiv:2407.04295.
- Chu, J. et al. (2025). *JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs*. arXiv:2402.05668.
- Liu, A. et al. (2025). *PiCo: Jailbreaking Multimodal Large Language Models via Pictorial Code Contextualization*. arXiv:2504.01444.
- Ghosal, D. et al. (2025). *Immune: Improving Safety Against Jailbreaks in Multi-modal LLMs via Inference-Time Filtering*. *CVPR 2025*. PDF.
- Yan, Q. et al. (2025). *Hidden in Plain Sight: Probing Implicit Reasoning in Multimodal Language Models*. arXiv:2506.00258.
- Liu, Y. et al. (2025). *RePD: Defending Jailbreak Attack through a Retrieval-Based Detector*. *Findings of NAACL 2025*. ACL Anthology.

## Note

1.  <span id="cite_note-lillog_intro-1">↑ <sup>[1.0](https://systems-analysis.info/int/Jailbreaks_(LLM)_(RO)#cite_ref-lillog_intro_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Jailbreaks_(LLM)_(RO)#cite_ref-lillog_intro_1-1)</sup> «A brief history of jailbreaking». *Lil'Log*. <a href="https://lilianweng.github.io/posts/2023-03-15-prompt-engineering/" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-yi_2024_survey-2">↑ <sup>[2.0](https://systems-analysis.info/int/Jailbreaks_(LLM)_(RO)#cite_ref-yi_2024_survey_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/Jailbreaks_(LLM)_(RO)#cite_ref-yi_2024_survey_2-1)</sup> Yi, J., et al. «Jailbreak Attacks and Defenses Against Large Language Models: A Comprehensive Survey». *arXiv:2405.09443*. <a href="https://arxiv.org/abs/2405.09443" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-prompting_guide_vuln-3">[↑](https://systems-analysis.info/int/Jailbreaks_(LLM)_(RO)#cite_ref-prompting_guide_vuln_3-0) «Jailbreaking LLMs». *Prompting Guide*. <a href="https://www.promptingguide.ai/risks/jailbreaking" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-ncc_group_history-4">[↑](https://systems-analysis.info/int/Jailbreaks_(LLM)_(RO)#cite_ref-ncc_group_history_4-0) «Exploring prompt injection attacks». *NCC Group*. <a href="https://research.nccgroup.com/2022/12/05/exploring-prompt-injection-attacks/" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-dan_evolution_arxiv-5">[↑](https://systems-analysis.info/int/Jailbreaks_(LLM)_(RO)#cite_ref-dan_evolution_arxiv_5-0) «Do Anything Now: Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models». *arXiv:2308.03825*. <a href="https://arxiv.org/abs/2308.03825" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-dan_github-6">[↑](https://systems-analysis.info/int/Jailbreaks_(LLM)_(RO)#cite_ref-dan_github_6-0) «0xk1h0/ChatGPT_DAN». *GitHub*. <a href="https://github.com/0xk1h0/ChatGPT_DAN" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-hiddenlayer_multimodal-7">[↑](https://systems-analysis.info/int/Jailbreaks_(LLM)_(RO)#cite_ref-hiddenlayer_multimodal_7-0) «Hiding in Plain Sight: Multimodal Jailbreaking of Large Language Models». *HiddenLayer*. <a href="https://hiddenlayer.com/research/multimodal-jailbreaking-of-large-language-models/" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-bleeping_computer_time_bandit-8">[↑](https://systems-analysis.info/int/Jailbreaks_(LLM)_(RO)#cite_ref-bleeping_computer_time_bandit_8-0) «ChatGPT "Time-travel" jailbreak lets you bypass its safety guards». *BleepingComputer*. <a href="https://www.bleepingcomputer.com/news/security/chatgpt-time-travel-jailbreak-lets-you-bypass-its-safety-guards/" class="external autonumber" rel="nofollow">[8]</a></span>
9.  <span id="cite_note-chu_2024_radar-9">[↑](https://systems-analysis.info/int/Jailbreaks_(LLM)_(RO)#cite_ref-chu_2024_radar_9-0) Chu, Z., et al. «JailbreakRadar: A Comprehensive Benchmark for Jailbreak Attack and Defense». *arXiv:2402.12642*. <a href="https://arxiv.org/abs/2402.12642" class="external autonumber" rel="nofollow">[9]</a></span>
10. <span id="cite_note-zou_2023_gcg-10">[↑](https://systems-analysis.info/int/Jailbreaks_(LLM)_(RO)#cite_ref-zou_2023_gcg_10-0) Zou, A., et al. «Universal and Transferable Adversarial Attacks on Aligned Language Models». *arXiv:2307.15043*. <a href="https://arxiv.org/abs/2307.15043" class="external autonumber" rel="nofollow">[10]</a></span>
11. <span id="cite_note-anthropic_many_shot-11">[↑](https://systems-analysis.info/int/Jailbreaks_(LLM)_(RO)#cite_ref-anthropic_many_shot_11-0) «Many-shot Jailbreaking». *Anthropic*. <a href="https://www.anthropic.com/research/many-shot-jailbreaking" class="external autonumber" rel="nofollow">[11]</a></span>
12. <span id="cite_note-mit_tech_review_const_ai-12">[↑](https://systems-analysis.info/int/Jailbreaks_(LLM)_(RO)#cite_ref-mit_tech_review_const_ai_12-0) «How we're using 'constitutional AI' to make our models safer». *MIT Technology Review*. <a href="https://www.technologyreview.com/2023/05/09/1072782/how-were-using-constitutional-ai-to-make-our-models-safer/" class="external autonumber" rel="nofollow">[12]</a></span>
