Jailbreaks (LLM) — كسر الحماية

From Systems analysis Wiki
Jump to navigation Jump to search

كسر الحماية (بالإنجليزية: Jailbreak - وتعني حرفيًا «الهروب من السجن») في سياق نماذج اللغة الكبيرة (LLM) هو نوع من الهجمات التنافسية التي تهدف إلى تجاوز آليات الأمان والقيود المدمجة للحصول على استجابات محظورة أو قد تكون ضارة[1]. يُعرَّف كسر الحماية بأنه «حث النموذج على توليد استجابات ضارة تتعارض مع سياسة الاستخدام والأعراف المجتمعية، من خلال تصميم مُوجِّهات تنافسية»[2].

تكمن الثغرة الأساسية التي تستغلها هجمات كسر الحماية في خاصية معمارية لنماذج اللغة الكبيرة: لا تستطيع النماذج التمييز بين التعليمات والبيانات حسب نوعها، لأن كلًا من مُوجِّهات النظام ومدخلات المستخدم لها نفس التنسيق — وهو سلاسل نصية بلغة طبيعية[3].

تاريخ النشأة والتطور

الفترة المبكرة: حقن المُوجِّهات (2022)

أول اكتشاف موثق لثغرة حقن المُوجِّهات حدث في مايو 2022، عندما اكتشف باحثون من شركة Preamble قابلية ChatGPT لمثل هذه الهجمات. في سبتمبر 2022، نشر رايلي غودسايد بشكل مستقل أول عرض عام لثغرة GPT-3 على تويتر، مع المثال الشهير الذي أُمر فيه النموذج بتجاهل التعليمات السابقة[4].

عصر DAN (2022–2023)

في منتصف عام 2022، ظهرت أولى مُوجِّهات "Do Anything Now" (DAN)، والتي كانت تمثل تعليمات للعب الأدوار. كان الابتكار الرئيسي هو استخدام لعب الأدوار لتجاوز قيود الأمان من خلال إنشاء «شخصية بديلة» متحررة من القواعد[5]. أدى تطور DAN إلى ظهور سيناريوهات معقدة مع أنظمة الرموز (آليات العقاب/المكافأة) وآليات الحفاظ على الشخصية[6].

تنويع الأساليب (2023–2024)

منذ عام 2023، بدأت الأبحاث الأكاديمية المعقدة حول هجمات كسر الحماية. في عام 2024، ظهرت الهجمات متعددة الوسائط، والتي تتضمن إخفاء التعليمات الضارة في الصور والملفات الصوتية، بالإضافة إلى حقن المُوجِّهات المرئية عبر فن ASCII[7].

الفترة الحالية (2024–2025)

تستمر تقنيات الهجوم في التعقيد. في نوفمبر 2024، تم اكتشاف تقنية "Time Bandit" (لص الزمن)، التي تستغل الارتباك الزمني في ChatGPT-4o من خلال صياغة الأسئلة كما لو كانت من فترات تاريخية (القرنين التاسع عشر والعشرين)[8].

الأساليب التقنية والتصنيف

يمكن تصنيف الهجمات بناءً على الوصول إلى النموذج:

  • هجمات الصندوق الأسود: بدون الوصول إلى المكونات الداخلية للنموذج (المعلمات، التدرجات).
  • هجمات الصندوق الأبيض: مع الوصول الكامل إلى معلمات النموذج والتدرجات[2].

JailbreakRadar Taxonomy - تصنيف JailbreakRadar

يحدد تصنيف JailbreakRadar (Chu et al., 2024) ست فئات رئيسية من الهجمات:

  1. الهجمات المباشرة: مُوجِّهات ضارة مباشرة.
  2. الهجمات غير المباشرة: استراتيجيات تلاعب متعددة الخطوات.
  3. الهجمات السياقية: استخدام سجل المحادثة.
  4. هجمات لعب الأدوار: تقنيات انتحال الشخصيات (مثل DAN).
  5. هجمات التشفير: أساليب التعمية لإخفاء التعليمات الضارة.
  6. الهجمات القائمة على القوالب: أطر تنافسية مهيكلة[9].

الآليات التقنية

  • توليد اللواحق التنافسية (GCG): هي طريقة اقترحها Zou et al. (2023)، تقوم تلقائيًا بتوليد لواحق تنافسية (متواليات من الرموز) والتي، عند إضافتها إلى مُوجِّه، تزيد من احتمالية إثارة استجابة ضارة. تستخدم الطريقة التحسين بالتدرج وتظهر نسبة نجاح عالية (تصل إلى 84% على GPT-4) وقابلية للنقل بين النماذج[10].
  • كسر الحماية متعدد المحاولات (Many-shot Jailbreaking): أظهرت دراسة أجرتها Anthropic (2024) أن فعالية الهجمات تتبع قانون القوة: كلما زاد عدد الأمثلة الضارة في المُوجِّه، زادت نسبة الاستجابات غير المرغوب فيها[11].

آليات الدفاع

  • المصنفات الدستورية (Anthropic): فلترة البيانات المدخلة والمخرجة بناءً على مجموعة من المبادئ الدستورية. سمحت هذه الطريقة بتقليل نجاح هجمات كسر الحماية من 86% إلى 4.4% في التقييمات الخاضعة للرقابة[12].
  • التعلم المعزز من خلال ردود الفعل البشرية (RLHF): تدريب ثلاثي المراحل (OpenAI)، يتضمن الضبط الدقيق الخاضع للإشراف، وتدريب نموذج المكافأة، وتحسين السياسة، وقد أظهر انخفاضًا كبيرًا في توليد المحتوى السام.
  • التدريب التنافسي: تدريب النموذج على أمثلة من هجمات كسر الحماية لزيادة مقاومته. تقدر فعالية هذا النهج في تقليل نجاح الهجمات بنسبة 60-80%[1].
  • الدفاع متعدد المستويات: استراتيجية موصى بها تتضمن التحقق من صحة المدخلات، والحماية على مستوى النموذج، ومراقبة المخرجات، والمراقبة المستمرة في الوقت الفعلي.

تمثل هجمات كسر الحماية على نماذج اللغة الكبيرة مشكلة أمنية أساسية في مجال الذكاء الاصطناعي، مما يظهر التوتر المستمر بين قدرات النماذج ومواءمتها. يتطور مشهد الهجمات باستمرار، منتقلاً من حقن المُوجِّهات البسيطة إلى هجمات معقدة متعددة الوسائط وآلية. تظهر الأبحاث أنه لا يوجد آلية دفاع حالية منيعة تمامًا ضد جميع محاولات كسر الحماية. يتطلب النجاح في هذا المجال استثمارًا مستمرًا في أبحاث الأمان، وممارسات الكشف المسؤول، وجهودًا تعاونية بين الباحثين والصناعة والجهات التنظيمية.

روابط خارجية

مراجع

  • Bai, Y. et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.
  • Zou, A. et al. (2023). Universal and Transferable Adversarial Attacks on Aligned Language Models. arXiv:2307.15043.
  • Shen, X. et al. (2023). “Do Anything Now”: Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models. arXiv:2308.03825.
  • Chao, P. et al. (2024). JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models. arXiv:2404.01318.
  • Liao, Z.; Sun, H. (2024). AmpleGCG: Learning a Universal and Transferable Generative Model of Adversarial Suffixes for Jailbreaking Both Open and Closed LLMs. OpenReview UfqzXg95I5.
  • Yi, S. et al. (2024). Jailbreak Attacks and Defenses Against Large Language Models: A Survey. arXiv:2407.04295.
  • Chu, J. et al. (2025). JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs. arXiv:2402.05668.
  • Liu, A. et al. (2025). PiCo: Jailbreaking Multimodal Large Language Models via Pictorial Code Contextualization. arXiv:2504.01444.
  • Ghosal, D. et al. (2025). Immune: Improving Safety Against Jailbreaks in Multi-modal LLMs via Inference-Time Filtering. CVPR 2025. PDF.
  • Yan, Q. et al. (2025). Hidden in Plain Sight: Probing Implicit Reasoning in Multimodal Language Models. arXiv:2506.00258.
  • Liu, Y. et al. (2025). RePD: Defending Jailbreak Attack through a Retrieval-Based Detector. Findings of NAACL 2025. ACL Anthology.

ملاحظات

  1. 1.0 1.1 «A brief history of jailbreaking». Lil'Log. [١]
  2. 2.0 2.1 Yi, J., et al. «Jailbreak Attacks and Defenses Against Large Language Models: A Comprehensive Survey». arXiv:2405.09443. [٢]
  3. «Jailbreaking LLMs». Prompting Guide. [٣]
  4. «Exploring prompt injection attacks». NCC Group. [٤]
  5. «Do Anything Now: Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models». arXiv:2308.03825. [٥]
  6. «0xk1h0/ChatGPT_DAN». GitHub. [٦]
  7. «Hiding in Plain Sight: Multimodal Jailbreaking of Large Language Models». HiddenLayer. [٧]
  8. «ChatGPT "Time-travel" jailbreak lets you bypass its safety guards». BleepingComputer. [٨]
  9. Chu, Z., et al. «JailbreakRadar: A Comprehensive Benchmark for Jailbreak Attack and Defense». arXiv:2402.12642. [٩]
  10. Zou, A., et al. «Universal and Transferable Adversarial Attacks on Aligned Language Models». arXiv:2307.15043. [١٠]
  11. «Many-shot Jailbreaking». Anthropic. [١١]
  12. «How we're using 'constitutional AI' to make our models safer». MIT Technology Review. [١٢]