---
title: "Jailbreaks (LLM) (FA)"
source: "https://systems-analysis.info/int/Jailbreaks_(LLM)_(FA)"
wiki: "systems-analysis.info/int"
article: "Jailbreaks_(LLM)_(FA)"
language: "fa"
categories:
  - "Category:Large language models"
  - "Category:Machine learning"
  - "Category:Persian"
revision_id: 3294
wiki_created_at: 2026-09-06T23:18:33Z
wiki_modified_at: 2026-09-06T23:18:33Z
downloaded_at: 2026-09-07T22:56:11Z
---

# Jailbreaks (LLM) (FA)

**جیلبریک** (انگلیسی: **Jailbreak** — به معنای واقعی «فرار از زندان») در زمینه مدل‌های زبانی بزرگ (LLM) نوعی حمله تقابلی است که هدف آن دور زدن مکانیزم‌های امنیتی و محدودیت‌های داخلی به منظور دریافت پاسخ‌های ممنوع یا بالقوه مضر است<sup>[\[1\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(FA)#cite_note-lillog_intro-1)</sup>. Jailbreak عبارت است از «وادار کردن مدل به تولید پاسخ‌های مضر که با سیاست‌های استفاده و هنجارهای اجتماعی در تضادند، از طریق طراحی prompt‌های تقابلی»<sup>[\[2\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(FA)#cite_note-yi_2024_survey-2)</sup>.

آسیب‌پذیری بنیادی که در حملات jailbreak مورد بهره‌برداری قرار می‌گیرد، در ویژگی معماری LLM نهفته است: مدل‌ها نمی‌توانند دستورالعمل‌ها و داده‌ها را بر اساس نوعشان از یکدیگر تمییز دهند، زیرا هم prompt‌های سیستمی و هم ورودی کاربر فرمت یکسانی دارند — رشته‌های متنی به زبان طبیعی<sup>[\[3\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(FA)#cite_note-prompting_guide_vuln-3)</sup>.

## تاریخچه پیدایش و توسعه

### دوره اولیه: Prompt Injection‌ها (۲۰۲۲)

اولین کشف مستند آسیب‌پذیری prompt injection در ماه می ۲۰۲۲ رخ داد، زمانی که پژوهشگران شرکت **Preamble** حساسیت ChatGPT به این گونه حملات را کشف کردند. در سپتامبر ۲۰۲۲، **Riley Goodside** به طور مستقل اولین نمایش عمومی آسیب‌پذیری GPT-3 را در Twitter منتشر کرد، با مثال معروفی که در آن به مدل دستور داده می‌شد دستورالعمل‌های قبلی را نادیده بگیرد<sup>[\[4\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(FA)#cite_note-ncc_group_history-4)</sup>.

### دوران DAN (۲۰۲۲–۲۰۲۳)

در اواسط ۲۰۲۲، اولین prompt‌های **"Do Anything Now"** (**DAN**) ظاهر شدند که دستورالعمل‌هایی برای بازی نقش بودند. نوآوری کلیدی، استفاده از بازی نقش برای دور زدن محدودیت‌های امنیتی از طریق ایجاد «شخصیت جایگزین» آزاد از قوانین بود<sup>[\[5\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(FA)#cite_note-dan_evolution_arxiv-5)</sup>. تکامل DAN به ظهور سناریوهای پیچیده با سیستم‌های token (مکانیزم‌های تنبیه/پاداش) و مکانیزم‌های حفظ شخصیت انجامید<sup>[\[6\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(FA)#cite_note-dan_github-6)</sup>.

### تنوع روش‌ها (۲۰۲۳–۲۰۲۴)

از سال ۲۰۲۳، پژوهش‌های جامع دانشگاهی درباره حملات jailbreak آغاز شد. در سال ۲۰۲۴، **حملات چندوجهی** ظهور کردند که شامل پنهان کردن دستورالعمل‌های مضر در تصاویر، فایل‌های صوتی، و همچنین visual prompt injection از طریق ASCII-art بودند<sup>[\[7\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(FA)#cite_note-hiddenlayer_multimodal-7)</sup>.

### دوره معاصر (۲۰۲۴–۲۰۲۵)

تکنیک‌های حمله به پیچیده‌تر شدن ادامه می‌دهند. در نوامبر ۲۰۲۴، تکنیک **"Time Bandit"** کشف شد که با طرح سؤالات گویی از دوره‌های تاریخی (سده‌های ۱۸۰۰–۱۹۰۰)، از سردرگمی زمانی در ChatGPT-4o بهره می‌برد<sup>[\[8\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(FA)#cite_note-bleeping_computer_time_bandit-8)</sup>.

## روش‌های فنی و طبقه‌بندی

حملات را می‌توان بر اساس دسترسی به مدل طبقه‌بندی کرد:

- **حملات جعبه سیاه:** بدون دسترسی به اجزای داخلی مدل (پارامترها، گرادیان‌ها).
- **حملات جعبه سفید:** با دسترسی کامل به پارامترها و گرادیان‌های مدل<sup>[\[2\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(FA)#cite_note-yi_2024_survey-2)</sup>.

### طبقه‌بندی JailbreakRadar

طبقه‌بندی *JailbreakRadar* (Chu et al., 2024) شش دسته اصلی حمله را تعریف می‌کند:

1.  **حملات مستقیم:** prompt‌های مضر بلافصل.
2.  **حملات غیرمستقیم:** راهبردهای دستکاری چندمرحله‌ای.
3.  **حملات زمینه‌ای:** استفاده از تاریخچه مکالمه.
4.  **حملات نقش‌آفرینی:** تکنیک‌های تقلید شخصیت (مانند DAN).
5.  **حملات رمزگذاری:** روش‌های obfuscation برای پنهان کردن دستورالعمل‌های مضر.
6.  **حملات الگویی:** چارچوب‌های تقابلی ساختاریافته<sup>[\[9\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(FA)#cite_note-chu_2024_radar-9)</sup>.

### مکانیزم‌های فنی

- **تولید پسوندهای تقابلی (GCG):** روشی که توسط Zou et al. (2023) پیشنهاد شده، به‌صورت خودکار پسوندهای تقابلی (دنباله‌های token) تولید می‌کند که با افزوده شدن به prompt، با احتمال بالایی پاسخ مضر ایجاد می‌کنند. این روش از بهینه‌سازی مبتنی بر گرادیان استفاده می‌کند و نرخ موفقیت بالایی (تا ۸۴٪ روی GPT-4) و قابلیت انتقال بین مدل‌ها نشان می‌دهد<sup>[\[10\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(FA)#cite_note-zou_2023_gcg-10)</sup>.
- **جیلبریکینگ چندمرحله‌ای:** پژوهش Anthropic (2024) نشان داد که اثربخشی حملات از قانون توانی پیروی می‌کند: با افزایش تعداد نمونه‌های مضر در prompt، درصد پاسخ‌های ناخواسته افزایش می‌یابد<sup>[\[11\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(FA)#cite_note-anthropic_many_shot-11)</sup>.

## مکانیزم‌های دفاعی

- **طبقه‌بندی‌کننده‌های قانون اساسی (Anthropic):** فیلترسازی داده‌های ورودی/خروجی بر اساس مجموعه‌ای از اصول قانون اساسی. این روش توانست نرخ موفقیت jailbreak را از ۸۶٪ به ۴.۴٪ در ارزیابی‌های کنترل‌شده کاهش دهد<sup>[\[12\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(FA)#cite_note-mit_tech_review_const_ai-12)</sup>.
- **Reinforcement Learning from Human Feedback (RLHF):** آموزش سه‌مرحله‌ای (OpenAI) شامل تنظیم دقیق نظارت‌شده، آموزش مدل پاداش و بهینه‌سازی سیاست، کاهش چشمگیری در تولید محتوای سمی نشان داده است.
- **آموزش تقابلی:** آموزش مدل با نمونه‌های حملات jailbreak برای افزایش مقاومت آن. اثربخشی این رویکرد در کاهش نرخ موفقیت حملات بین ۶۰ تا ۸۰٪ ارزیابی شده است<sup>[\[1\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(FA)#cite_note-lillog_intro-1)</sup>.
- **دفاع چندلایه:** راهبرد توصیه‌شده شامل اعتبارسنجی داده‌های ورودی، حفاظت در سطح مدل، نظارت بر داده‌های خروجی و پایش مستمر در زمان واقعی.

حملات jailbreak به مدل‌های زبانی بزرگ یک مشکل امنیتی بنیادی در هوش مصنوعی را نشان می‌دهند و تنش دائمی میان قابلیت‌ها و همسویی مدل‌ها را آشکار می‌سازند. چشم‌انداز حملات پیوسته در حال پیچیده‌تر شدن است و از prompt injection‌های ساده به حملات چندوجهی و خودکار پیشرفته تبدیل می‌شود. پژوهش‌ها نشان می‌دهند که هیچ مکانیزم دفاعی کنونی در برابر تمام تلاش‌های jailbreak کاملاً مقاوم نیست. موفقیت در این حوزه مستلزم سرمایه‌گذاری مستمر در پژوهش‌های امنیتی، رویه‌های افشای مسئولانه و تلاش مشترک پژوهشگران، صنعت و نهادهای نظارتی است.

## پیوندها

- Prompting Guide: Jailbreaking
- مخزن پیاده‌سازی حمله GCG در GitHub

## منابع

- Bai, Y. et al. (2022). *Constitutional AI: Harmlessness from AI Feedback*. arXiv:2212.08073.
- Zou, A. et al. (2023). *Universal and Transferable Adversarial Attacks on Aligned Language Models*. arXiv:2307.15043.
- Shen, X. et al. (2023). *"Do Anything Now": Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models*. arXiv:2308.03825.
- Chao, P. et al. (2024). *JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models*. arXiv:2404.01318.
- Liao, Z.; Sun, H. (2024). *AmpleGCG: Learning a Universal and Transferable Generative Model of Adversarial Suffixes for Jailbreaking Both Open and Closed LLMs*. OpenReview UfqzXg95I5.
- Yi, S. et al. (2024). *Jailbreak Attacks and Defenses Against Large Language Models: A Survey*. arXiv:2407.04295.
- Chu, J. et al. (2025). *JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs*. arXiv:2402.05668.
- Liu, A. et al. (2025). *PiCo: Jailbreaking Multimodal Large Language Models via Pictorial Code Contextualization*. arXiv:2504.01444.
- Ghosal, D. et al. (2025). *Immune: Improving Safety Against Jailbreaks in Multi-modal LLMs via Inference-Time Filtering*. *CVPR 2025*. PDF.
- Yan, Q. et al. (2025). *Hidden in Plain Sight: Probing Implicit Reasoning in Multimodal Language Models*. arXiv:2506.00258.
- Liu, Y. et al. (2025). *RePD: Defending Jailbreak Attack through a Retrieval-Based Detector*. *Findings of NAACL 2025*. ACL Anthology.

## یادداشت‌ها

1.  <span id="cite_note-lillog_intro-1">↑ <sup>[1.0](https://systems-analysis.info/int/Jailbreaks_(LLM)_(FA)#cite_ref-lillog_intro_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Jailbreaks_(LLM)_(FA)#cite_ref-lillog_intro_1-1)</sup> «A brief history of jailbreaking». *Lil'Log*. <a href="https://lilianweng.github.io/posts/2023-03-15-prompt-engineering/" class="external autonumber" rel="nofollow">[۱]</a></span>
2.  <span id="cite_note-yi_2024_survey-2">↑ <sup>[2.0](https://systems-analysis.info/int/Jailbreaks_(LLM)_(FA)#cite_ref-yi_2024_survey_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/Jailbreaks_(LLM)_(FA)#cite_ref-yi_2024_survey_2-1)</sup> Yi, J., et al. «Jailbreak Attacks and Defenses Against Large Language Models: A Comprehensive Survey». *arXiv:2405.09443*. <a href="https://arxiv.org/abs/2405.09443" class="external autonumber" rel="nofollow">[۲]</a></span>
3.  <span id="cite_note-prompting_guide_vuln-3">[↑](https://systems-analysis.info/int/Jailbreaks_(LLM)_(FA)#cite_ref-prompting_guide_vuln_3-0) «Jailbreaking LLMs». *Prompting Guide*. <a href="https://www.promptingguide.ai/risks/jailbreaking" class="external autonumber" rel="nofollow">[۳]</a></span>
4.  <span id="cite_note-ncc_group_history-4">[↑](https://systems-analysis.info/int/Jailbreaks_(LLM)_(FA)#cite_ref-ncc_group_history_4-0) «Exploring prompt injection attacks». *NCC Group*. <a href="https://research.nccgroup.com/2022/12/05/exploring-prompt-injection-attacks/" class="external autonumber" rel="nofollow">[۴]</a></span>
5.  <span id="cite_note-dan_evolution_arxiv-5">[↑](https://systems-analysis.info/int/Jailbreaks_(LLM)_(FA)#cite_ref-dan_evolution_arxiv_5-0) «Do Anything Now: Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models». *arXiv:2308.03825*. <a href="https://arxiv.org/abs/2308.03825" class="external autonumber" rel="nofollow">[۵]</a></span>
6.  <span id="cite_note-dan_github-6">[↑](https://systems-analysis.info/int/Jailbreaks_(LLM)_(FA)#cite_ref-dan_github_6-0) «0xk1h0/ChatGPT_DAN». *GitHub*. <a href="https://github.com/0xk1h0/ChatGPT_DAN" class="external autonumber" rel="nofollow">[۶]</a></span>
7.  <span id="cite_note-hiddenlayer_multimodal-7">[↑](https://systems-analysis.info/int/Jailbreaks_(LLM)_(FA)#cite_ref-hiddenlayer_multimodal_7-0) «Hiding in Plain Sight: Multimodal Jailbreaking of Large Language Models». *HiddenLayer*. <a href="https://hiddenlayer.com/research/multimodal-jailbreaking-of-large-language-models/" class="external autonumber" rel="nofollow">[۷]</a></span>
8.  <span id="cite_note-bleeping_computer_time_bandit-8">[↑](https://systems-analysis.info/int/Jailbreaks_(LLM)_(FA)#cite_ref-bleeping_computer_time_bandit_8-0) «ChatGPT "Time-travel" jailbreak lets you bypass its safety guards». *BleepingComputer*. <a href="https://www.bleepingcomputer.com/news/security/chatgpt-time-travel-jailbreak-lets-you-bypass-its-safety-guards/" class="external autonumber" rel="nofollow">[۸]</a></span>
9.  <span id="cite_note-chu_2024_radar-9">[↑](https://systems-analysis.info/int/Jailbreaks_(LLM)_(FA)#cite_ref-chu_2024_radar_9-0) Chu, Z., et al. «JailbreakRadar: A Comprehensive Benchmark for Jailbreak Attack and Defense». *arXiv:2402.12642*. <a href="https://arxiv.org/abs/2402.12642" class="external autonumber" rel="nofollow">[۹]</a></span>
10. <span id="cite_note-zou_2023_gcg-10">[↑](https://systems-analysis.info/int/Jailbreaks_(LLM)_(FA)#cite_ref-zou_2023_gcg_10-0) Zou, A., et al. «Universal and Transferable Adversarial Attacks on Aligned Language Models». *arXiv:2307.15043*. <a href="https://arxiv.org/abs/2307.15043" class="external autonumber" rel="nofollow">[۱۰]</a></span>
11. <span id="cite_note-anthropic_many_shot-11">[↑](https://systems-analysis.info/int/Jailbreaks_(LLM)_(FA)#cite_ref-anthropic_many_shot_11-0) «Many-shot Jailbreaking». *Anthropic*. <a href="https://www.anthropic.com/research/many-shot-jailbreaking" class="external autonumber" rel="nofollow">[۱۱]</a></span>
12. <span id="cite_note-mit_tech_review_const_ai-12">[↑](https://systems-analysis.info/int/Jailbreaks_(LLM)_(FA)#cite_ref-mit_tech_review_const_ai_12-0) «How we're using 'constitutional AI' to make our models safer». *MIT Technology Review*. <a href="https://www.technologyreview.com/2023/05/09/1072782/how-were-using-constitutional-ai-to-make-our-models-safer/" class="external autonumber" rel="nofollow">[۱۲]</a></span>
