---
title: "Jailbreaks (LLM) — كسر الحماية"
source: "https://systems-analysis.info/int/Jailbreaks_(LLM)_%E2%80%94_%D9%83%D8%B3%D8%B1_%D8%A7%D9%84%D8%AD%D9%85%D8%A7%D9%8A%D8%A9"
wiki: "systems-analysis.info/int"
article: "Jailbreaks_(LLM)_—_كسر_الحماية"
language: "ar"
categories:
  - "Category:Arabic"
  - "Category:Large language models"
  - "Category:Machine learning"
revision_id: 3308
wiki_created_at: 2026-09-06T23:18:45Z
wiki_modified_at: 2026-09-06T23:18:45Z
downloaded_at: 2026-09-07T22:56:15Z
---

# Jailbreaks (LLM) — كسر الحماية

**كسر الحماية** (بالإنجليزية: **Jailbreak** - وتعني حرفيًا «الهروب من السجن») في سياق نماذج اللغة الكبيرة (LLM) هو نوع من الهجمات التنافسية التي تهدف إلى تجاوز آليات الأمان والقيود المدمجة للحصول على استجابات محظورة أو قد تكون ضارة<sup>[\[1\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_%E2%80%94_%D9%83%D8%B3%D8%B1_%D8%A7%D9%84%D8%AD%D9%85%D8%A7%D9%8A%D8%A9#cite_note-lillog_intro-1)</sup>. يُعرَّف كسر الحماية بأنه «حث النموذج على توليد استجابات ضارة تتعارض مع سياسة الاستخدام والأعراف المجتمعية، من خلال تصميم مُوجِّهات تنافسية»<sup>[\[2\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_%E2%80%94_%D9%83%D8%B3%D8%B1_%D8%A7%D9%84%D8%AD%D9%85%D8%A7%D9%8A%D8%A9#cite_note-yi_2024_survey-2)</sup>.

تكمن الثغرة الأساسية التي تستغلها هجمات كسر الحماية في خاصية معمارية لنماذج اللغة الكبيرة: لا تستطيع النماذج التمييز بين التعليمات والبيانات حسب نوعها، لأن كلًا من مُوجِّهات النظام ومدخلات المستخدم لها نفس التنسيق — وهو سلاسل نصية بلغة طبيعية<sup>[\[3\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_%E2%80%94_%D9%83%D8%B3%D8%B1_%D8%A7%D9%84%D8%AD%D9%85%D8%A7%D9%8A%D8%A9#cite_note-prompting_guide_vuln-3)</sup>.

## تاريخ النشأة والتطور

### الفترة المبكرة: حقن المُوجِّهات (2022)

أول اكتشاف موثق لثغرة حقن المُوجِّهات حدث في مايو 2022، عندما اكتشف باحثون من شركة **Preamble** قابلية ChatGPT لمثل هذه الهجمات. في سبتمبر 2022، نشر **رايلي غودسايد** بشكل مستقل أول عرض عام لثغرة GPT-3 على تويتر، مع المثال الشهير الذي أُمر فيه النموذج بتجاهل التعليمات السابقة<sup>[\[4\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_%E2%80%94_%D9%83%D8%B3%D8%B1_%D8%A7%D9%84%D8%AD%D9%85%D8%A7%D9%8A%D8%A9#cite_note-ncc_group_history-4)</sup>.

### عصر DAN (2022–2023)

في منتصف عام 2022، ظهرت أولى مُوجِّهات **"Do Anything Now"** (**DAN**)، والتي كانت تمثل تعليمات للعب الأدوار. كان الابتكار الرئيسي هو استخدام لعب الأدوار لتجاوز قيود الأمان من خلال إنشاء «شخصية بديلة» متحررة من القواعد<sup>[\[5\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_%E2%80%94_%D9%83%D8%B3%D8%B1_%D8%A7%D9%84%D8%AD%D9%85%D8%A7%D9%8A%D8%A9#cite_note-dan_evolution_arxiv-5)</sup>. أدى تطور DAN إلى ظهور سيناريوهات معقدة مع أنظمة الرموز (آليات العقاب/المكافأة) وآليات الحفاظ على الشخصية<sup>[\[6\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_%E2%80%94_%D9%83%D8%B3%D8%B1_%D8%A7%D9%84%D8%AD%D9%85%D8%A7%D9%8A%D8%A9#cite_note-dan_github-6)</sup>.

### تنويع الأساليب (2023–2024)

منذ عام 2023، بدأت الأبحاث الأكاديمية المعقدة حول هجمات كسر الحماية. في عام 2024، ظهرت **الهجمات متعددة الوسائط**، والتي تتضمن إخفاء التعليمات الضارة في الصور والملفات الصوتية، بالإضافة إلى حقن المُوجِّهات المرئية عبر فن ASCII<sup>[\[7\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_%E2%80%94_%D9%83%D8%B3%D8%B1_%D8%A7%D9%84%D8%AD%D9%85%D8%A7%D9%8A%D8%A9#cite_note-hiddenlayer_multimodal-7)</sup>.

### الفترة الحالية (2024–2025)

تستمر تقنيات الهجوم في التعقيد. في نوفمبر 2024، تم اكتشاف تقنية **"Time Bandit"** (لص الزمن)، التي تستغل الارتباك الزمني في ChatGPT-4o من خلال صياغة الأسئلة كما لو كانت من فترات تاريخية (القرنين التاسع عشر والعشرين)<sup>[\[8\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_%E2%80%94_%D9%83%D8%B3%D8%B1_%D8%A7%D9%84%D8%AD%D9%85%D8%A7%D9%8A%D8%A9#cite_note-bleeping_computer_time_bandit-8)</sup>.

## الأساليب التقنية والتصنيف

يمكن تصنيف الهجمات بناءً على الوصول إلى النموذج:

- **هجمات الصندوق الأسود**: بدون الوصول إلى المكونات الداخلية للنموذج (المعلمات، التدرجات).
- **هجمات الصندوق الأبيض**: مع الوصول الكامل إلى معلمات النموذج والتدرجات<sup>[\[2\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_%E2%80%94_%D9%83%D8%B3%D8%B1_%D8%A7%D9%84%D8%AD%D9%85%D8%A7%D9%8A%D8%A9#cite_note-yi_2024_survey-2)</sup>.

### JailbreakRadar Taxonomy - تصنيف JailbreakRadar

يحدد تصنيف *JailbreakRadar* (Chu et al., 2024) ست فئات رئيسية من الهجمات:

1.  **الهجمات المباشرة:** مُوجِّهات ضارة مباشرة.
2.  **الهجمات غير المباشرة:** استراتيجيات تلاعب متعددة الخطوات.
3.  **الهجمات السياقية:** استخدام سجل المحادثة.
4.  **هجمات لعب الأدوار:** تقنيات انتحال الشخصيات (مثل DAN).
5.  **هجمات التشفير:** أساليب التعمية لإخفاء التعليمات الضارة.
6.  **الهجمات القائمة على القوالب:** أطر تنافسية مهيكلة<sup>[\[9\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_%E2%80%94_%D9%83%D8%B3%D8%B1_%D8%A7%D9%84%D8%AD%D9%85%D8%A7%D9%8A%D8%A9#cite_note-chu_2024_radar-9)</sup>.

### الآليات التقنية

- **توليد اللواحق التنافسية (GCG):** هي طريقة اقترحها Zou et al. (2023)، تقوم تلقائيًا بتوليد لواحق تنافسية (متواليات من الرموز) والتي، عند إضافتها إلى مُوجِّه، تزيد من احتمالية إثارة استجابة ضارة. تستخدم الطريقة التحسين بالتدرج وتظهر نسبة نجاح عالية (تصل إلى 84% على GPT-4) وقابلية للنقل بين النماذج<sup>[\[10\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_%E2%80%94_%D9%83%D8%B3%D8%B1_%D8%A7%D9%84%D8%AD%D9%85%D8%A7%D9%8A%D8%A9#cite_note-zou_2023_gcg-10)</sup>.
- **كسر الحماية متعدد المحاولات (Many-shot Jailbreaking):** أظهرت دراسة أجرتها Anthropic (2024) أن فعالية الهجمات تتبع قانون القوة: كلما زاد عدد الأمثلة الضارة في المُوجِّه، زادت نسبة الاستجابات غير المرغوب فيها<sup>[\[11\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_%E2%80%94_%D9%83%D8%B3%D8%B1_%D8%A7%D9%84%D8%AD%D9%85%D8%A7%D9%8A%D8%A9#cite_note-anthropic_many_shot-11)</sup>.

## آليات الدفاع

- **المصنفات الدستورية (Anthropic):** فلترة البيانات المدخلة والمخرجة بناءً على مجموعة من المبادئ الدستورية. سمحت هذه الطريقة بتقليل نجاح هجمات كسر الحماية من 86% إلى 4.4% في التقييمات الخاضعة للرقابة<sup>[\[12\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_%E2%80%94_%D9%83%D8%B3%D8%B1_%D8%A7%D9%84%D8%AD%D9%85%D8%A7%D9%8A%D8%A9#cite_note-mit_tech_review_const_ai-12)</sup>.
- **التعلم المعزز من خلال ردود الفعل البشرية (RLHF):** تدريب ثلاثي المراحل (OpenAI)، يتضمن الضبط الدقيق الخاضع للإشراف، وتدريب نموذج المكافأة، وتحسين السياسة، وقد أظهر انخفاضًا كبيرًا في توليد المحتوى السام.
- **التدريب التنافسي:** تدريب النموذج على أمثلة من هجمات كسر الحماية لزيادة مقاومته. تقدر فعالية هذا النهج في تقليل نجاح الهجمات بنسبة 60-80%<sup>[\[1\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_%E2%80%94_%D9%83%D8%B3%D8%B1_%D8%A7%D9%84%D8%AD%D9%85%D8%A7%D9%8A%D8%A9#cite_note-lillog_intro-1)</sup>.
- **الدفاع متعدد المستويات:** استراتيجية موصى بها تتضمن التحقق من صحة المدخلات، والحماية على مستوى النموذج، ومراقبة المخرجات، والمراقبة المستمرة في الوقت الفعلي.

تمثل هجمات كسر الحماية على نماذج اللغة الكبيرة مشكلة أمنية أساسية في مجال الذكاء الاصطناعي، مما يظهر التوتر المستمر بين قدرات النماذج ومواءمتها. يتطور مشهد الهجمات باستمرار، منتقلاً من حقن المُوجِّهات البسيطة إلى هجمات معقدة متعددة الوسائط وآلية. تظهر الأبحاث أنه لا يوجد آلية دفاع حالية منيعة تمامًا ضد جميع محاولات كسر الحماية. يتطلب النجاح في هذا المجال استثمارًا مستمرًا في أبحاث الأمان، وممارسات الكشف المسؤول، وجهودًا تعاونية بين الباحثين والصناعة والجهات التنظيمية.

## روابط خارجية

- <a href="https://www.promptingguide.ai/risks/jailbreaking" class="external text" rel="nofollow">دليل التوجيه: كسر الحماية (Jailbreaking)</a>
- <a href="https://github.com/llm-attacks/llm-attacks" class="external text" rel="nofollow">مستودع GitHub لتنفيذ هجوم GCG</a>

## مراجع

- Bai, Y. et al. (2022). *Constitutional AI: Harmlessness from AI Feedback*. <a href="https://arxiv.org/abs/2212.08073" class="external text" rel="nofollow">arXiv:2212.08073</a>.
- Zou, A. et al. (2023). *Universal and Transferable Adversarial Attacks on Aligned Language Models*. <a href="https://arxiv.org/abs/2307.15043" class="external text" rel="nofollow">arXiv:2307.15043</a>.
- Shen, X. et al. (2023). *“Do Anything Now”: Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models*. <a href="https://arxiv.org/abs/2308.03825" class="external text" rel="nofollow">arXiv:2308.03825</a>.
- Chao, P. et al. (2024). *JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models*. <a href="https://arxiv.org/abs/2404.01318" class="external text" rel="nofollow">arXiv:2404.01318</a>.
- Liao, Z.; Sun, H. (2024). *AmpleGCG: Learning a Universal and Transferable Generative Model of Adversarial Suffixes for Jailbreaking Both Open and Closed LLMs*. <a href="https://openreview.net/forum?id=UfqzXg95I5" class="external text" rel="nofollow">OpenReview UfqzXg95I5</a>.
- Yi, S. et al. (2024). *Jailbreak Attacks and Defenses Against Large Language Models: A Survey*. <a href="https://arxiv.org/abs/2407.04295" class="external text" rel="nofollow">arXiv:2407.04295</a>.
- Chu, J. et al. (2025). *JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs*. <a href="https://arxiv.org/abs/2402.05668" class="external text" rel="nofollow">arXiv:2402.05668</a>.
- Liu, A. et al. (2025). *PiCo: Jailbreaking Multimodal Large Language Models via Pictorial Code Contextualization*. <a href="https://arxiv.org/abs/2504.01444" class="external text" rel="nofollow">arXiv:2504.01444</a>.
- Ghosal, D. et al. (2025). *Immune: Improving Safety Against Jailbreaks in Multi-modal LLMs via Inference-Time Filtering*. *CVPR 2025*. <a href="https://openaccess.thecvf.com/content/CVPR2025/papers/Ghosal_Immune_Improving_Safety_Against_Jailbreaks_in_Multi-modal_LLMs_via_Inference-Time_CVPR_2025_paper.pdf" class="external text" rel="nofollow">PDF</a>.
- Yan, Q. et al. (2025). *Hidden in Plain Sight: Probing Implicit Reasoning in Multimodal Language Models*. <a href="https://arxiv.org/abs/2506.00258" class="external text" rel="nofollow">arXiv:2506.00258</a>.
- Liu, Y. et al. (2025). *RePD: Defending Jailbreak Attack through a Retrieval-Based Detector*. *Findings of NAACL 2025*. <a href="https://aclanthology.org/2025.findings-naacl.16.pdf" class="external text" rel="nofollow">ACL Anthology</a>.

## ملاحظات

1.  <span id="cite_note-lillog_intro-1">↑ <sup>[1.0](https://systems-analysis.info/int/Jailbreaks_(LLM)_%E2%80%94_%D9%83%D8%B3%D8%B1_%D8%A7%D9%84%D8%AD%D9%85%D8%A7%D9%8A%D8%A9#cite_ref-lillog_intro_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Jailbreaks_(LLM)_%E2%80%94_%D9%83%D8%B3%D8%B1_%D8%A7%D9%84%D8%AD%D9%85%D8%A7%D9%8A%D8%A9#cite_ref-lillog_intro_1-1)</sup> «A brief history of jailbreaking». *Lil'Log*. <a href="https://lilianweng.github.io/posts/2023-03-15-prompt-engineering/" class="external autonumber" rel="nofollow">[١]</a></span>
2.  <span id="cite_note-yi_2024_survey-2">↑ <sup>[2.0](https://systems-analysis.info/int/Jailbreaks_(LLM)_%E2%80%94_%D9%83%D8%B3%D8%B1_%D8%A7%D9%84%D8%AD%D9%85%D8%A7%D9%8A%D8%A9#cite_ref-yi_2024_survey_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/Jailbreaks_(LLM)_%E2%80%94_%D9%83%D8%B3%D8%B1_%D8%A7%D9%84%D8%AD%D9%85%D8%A7%D9%8A%D8%A9#cite_ref-yi_2024_survey_2-1)</sup> Yi, J., et al. «Jailbreak Attacks and Defenses Against Large Language Models: A Comprehensive Survey». *arXiv:2405.09443*. <a href="https://arxiv.org/abs/2405.09443" class="external autonumber" rel="nofollow">[٢]</a></span>
3.  <span id="cite_note-prompting_guide_vuln-3">[↑](https://systems-analysis.info/int/Jailbreaks_(LLM)_%E2%80%94_%D9%83%D8%B3%D8%B1_%D8%A7%D9%84%D8%AD%D9%85%D8%A7%D9%8A%D8%A9#cite_ref-prompting_guide_vuln_3-0) «Jailbreaking LLMs». *Prompting Guide*. <a href="https://www.promptingguide.ai/risks/jailbreaking" class="external autonumber" rel="nofollow">[٣]</a></span>
4.  <span id="cite_note-ncc_group_history-4">[↑](https://systems-analysis.info/int/Jailbreaks_(LLM)_%E2%80%94_%D9%83%D8%B3%D8%B1_%D8%A7%D9%84%D8%AD%D9%85%D8%A7%D9%8A%D8%A9#cite_ref-ncc_group_history_4-0) «Exploring prompt injection attacks». *NCC Group*. <a href="https://research.nccgroup.com/2022/12/05/exploring-prompt-injection-attacks/" class="external autonumber" rel="nofollow">[٤]</a></span>
5.  <span id="cite_note-dan_evolution_arxiv-5">[↑](https://systems-analysis.info/int/Jailbreaks_(LLM)_%E2%80%94_%D9%83%D8%B3%D8%B1_%D8%A7%D9%84%D8%AD%D9%85%D8%A7%D9%8A%D8%A9#cite_ref-dan_evolution_arxiv_5-0) «Do Anything Now: Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models». *arXiv:2308.03825*. <a href="https://arxiv.org/abs/2308.03825" class="external autonumber" rel="nofollow">[٥]</a></span>
6.  <span id="cite_note-dan_github-6">[↑](https://systems-analysis.info/int/Jailbreaks_(LLM)_%E2%80%94_%D9%83%D8%B3%D8%B1_%D8%A7%D9%84%D8%AD%D9%85%D8%A7%D9%8A%D8%A9#cite_ref-dan_github_6-0) «0xk1h0/ChatGPT_DAN». *GitHub*. <a href="https://github.com/0xk1h0/ChatGPT_DAN" class="external autonumber" rel="nofollow">[٦]</a></span>
7.  <span id="cite_note-hiddenlayer_multimodal-7">[↑](https://systems-analysis.info/int/Jailbreaks_(LLM)_%E2%80%94_%D9%83%D8%B3%D8%B1_%D8%A7%D9%84%D8%AD%D9%85%D8%A7%D9%8A%D8%A9#cite_ref-hiddenlayer_multimodal_7-0) «Hiding in Plain Sight: Multimodal Jailbreaking of Large Language Models». *HiddenLayer*. <a href="https://hiddenlayer.com/research/multimodal-jailbreaking-of-large-language-models/" class="external autonumber" rel="nofollow">[٧]</a></span>
8.  <span id="cite_note-bleeping_computer_time_bandit-8">[↑](https://systems-analysis.info/int/Jailbreaks_(LLM)_%E2%80%94_%D9%83%D8%B3%D8%B1_%D8%A7%D9%84%D8%AD%D9%85%D8%A7%D9%8A%D8%A9#cite_ref-bleeping_computer_time_bandit_8-0) «ChatGPT "Time-travel" jailbreak lets you bypass its safety guards». *BleepingComputer*. <a href="https://www.bleepingcomputer.com/news/security/chatgpt-time-travel-jailbreak-lets-you-bypass-its-safety-guards/" class="external autonumber" rel="nofollow">[٨]</a></span>
9.  <span id="cite_note-chu_2024_radar-9">[↑](https://systems-analysis.info/int/Jailbreaks_(LLM)_%E2%80%94_%D9%83%D8%B3%D8%B1_%D8%A7%D9%84%D8%AD%D9%85%D8%A7%D9%8A%D8%A9#cite_ref-chu_2024_radar_9-0) Chu, Z., et al. «JailbreakRadar: A Comprehensive Benchmark for Jailbreak Attack and Defense». *arXiv:2402.12642*. <a href="https://arxiv.org/abs/2402.12642" class="external autonumber" rel="nofollow">[٩]</a></span>
10. <span id="cite_note-zou_2023_gcg-10">[↑](https://systems-analysis.info/int/Jailbreaks_(LLM)_%E2%80%94_%D9%83%D8%B3%D8%B1_%D8%A7%D9%84%D8%AD%D9%85%D8%A7%D9%8A%D8%A9#cite_ref-zou_2023_gcg_10-0) Zou, A., et al. «Universal and Transferable Adversarial Attacks on Aligned Language Models». *arXiv:2307.15043*. <a href="https://arxiv.org/abs/2307.15043" class="external autonumber" rel="nofollow">[١٠]</a></span>
11. <span id="cite_note-anthropic_many_shot-11">[↑](https://systems-analysis.info/int/Jailbreaks_(LLM)_%E2%80%94_%D9%83%D8%B3%D8%B1_%D8%A7%D9%84%D8%AD%D9%85%D8%A7%D9%8A%D8%A9#cite_ref-anthropic_many_shot_11-0) «Many-shot Jailbreaking». *Anthropic*. <a href="https://www.anthropic.com/research/many-shot-jailbreaking" class="external autonumber" rel="nofollow">[١١]</a></span>
12. <span id="cite_note-mit_tech_review_const_ai-12">[↑](https://systems-analysis.info/int/Jailbreaks_(LLM)_%E2%80%94_%D9%83%D8%B3%D8%B1_%D8%A7%D9%84%D8%AD%D9%85%D8%A7%D9%8A%D8%A9#cite_ref-mit_tech_review_const_ai_12-0) «How we're using 'constitutional AI' to make our models safer». *MIT Technology Review*. <a href="https://www.technologyreview.com/2023/05/09/1072782/how-were-using-constitutional-ai-to-make-our-models-safer/" class="external autonumber" rel="nofollow">[١٢]</a></span>
