Jailbreaks (LLM) (HE)

From Systems analysis Wiki
Jump to navigation Jump to search

ג'יילברייק (באנגלית: Jailbreak — פשוטו כמשמעו \"בריחה מהכלא\") בהקשר של מודלי שפה גדולים (LLM) — הוא סוג של מתקפה יריבה, שמטרתה לעקוף את מנגנוני האבטחה המובנים ואת המגבלות כדי לקבל תגובות אסורות או בעלות פוטנציאל מזיק[1]. Jailbreak מוגדר כ\"גרימה למודל לייצר תגובות מזיקות, הסותרות את מדיניות השימוש ואת הנורמות החברתיות, באמצעות פיתוח prompt-ים יריביים\"[2].

הפגיעות הבסיסית המנוצלת במתקפות jailbreak נעוצה במאפיין אדריכלי של LLM: המודלים אינם מסוגלים להבחין בין הוראות לבין נתונים לפי סוגם, שכן הן prompt-ים מערכתיים והן קלט המשתמש נמצאים באותו פורמט — מחרוזות טקסט בשפה טבעית[3].

היסטוריית הופעה והתפתחות

התקופה המוקדמת: Prompt Injection - הזרקת פקודות (2022)

הגילוי הראשון המתועד של הפגיעות להזרקת פקודות אירע במאי 2022, כאשר חוקרים מחברת Preamble גילו את רגישות ChatGPT למתקפות אלו. בספטמבר 2022 פרסם ריילי גודסייד באופן עצמאי את ההדגמה הציבורית הראשונה של הפגיעות ב-GPT-3 ב-Twitter, עם דוגמה ידועה שבה הוצוה המודל להתעלם מהוראות קודמות[4].

עידן DAN (2022–2023)

באמצע 2022 הופיעו ה-prompt-ים הראשונים מסוג "Do Anything Now" (DAN), שהיו הוראות למשחק תפקידים. החידוש המרכזי היה שימוש במשחק תפקידים לעקיפת מגבלות האבטחה על ידי יצירת \"אישיות חלופית\" החופשייה מכללים[5]. האבולוציה של DAN הובילה להופעת תרחישים מורכבים עם מערכות token-ים (מנגנוני ענישה/תגמול) ומנגנוני שמירת דמות[6].

גיוון השיטות (2023–2024)

משנת 2023 החלו מחקרים אקדמיים מקיפים על מתקפות jailbreak. בשנת 2024 הופיעו מתקפות מולטי-מודאליות, הכוללות הסתרת הוראות מזיקות בתמונות, בקבצי שמע, וכן הזרקת prompt ויזואלית באמצעות ASCII-art[7].

התקופה העכשווית (2024–2025)

טכניקות המתקפה ממשיכות להסתבך. בנובמבר 2024 התגלתה הטכניקה "Time Bandit", המנצלת בלבול זמני ב-ChatGPT-4o על ידי ניסוח שאלות כאילו הן מגיעות מתקופות היסטוריות (שנות 1800–1900)[8].

שיטות טכניות וסיווג

ניתן לסווג מתקפות לפי הגישה למודל:

  • מתקפות קופסה שחורה: ללא גישה לרכיבים הפנימיים של המודל (פרמטרים, גרדיאנטים).
  • מתקפות קופסה לבנה: עם גישה מלאה לפרמטרים ולגרדיאנטים של המודל[2].

טקסונומיית JailbreakRadar

הסיווג של JailbreakRadar ‏(Chu et al., 2024) מגדיר שש קטגוריות עיקריות של מתקפות:

  1. מתקפות ישירות: prompt-ים מזיקים ישירים.
  2. מתקפות עקיפות: אסטרטגיות מניפולציה רב-שלביות.
  3. מתקפות הקשריות: שימוש בהיסטוריית השיחה.
  4. מתקפות תפקידים: טכניקות התחזות לדמויות (למשל, DAN).
  5. מתקפות קידוד: שיטות ערפול להסתרת הוראות מזיקות.
  6. מתקפות תבנית: מסגרות יריביות מובנות[9].

מנגנונים טכניים

  • יצירת סיומות יריביות (GCG): שיטה שהציעו Zou et al. (2023), המייצרת אוטומטית סיומות יריביות (רצפי token-ים) אשר בהוספתן ל-prompt מעוררות בהסתברות גבוהה תגובה מזיקה. השיטה משתמשת באופטימיזציה גרדיאנטית ומדגימה שיעור הצלחה גבוה (עד 84% על GPT-4) והעברה בין מודלים[10].
  • ג'יילברייקינג רב-סיבובי: מחקר של Anthropic (2024) הראה שיעילות המתקפות פועלת לפי חוק חזקה: ככל שגדל מספר הדוגמאות המזיקות ב-prompt, כך עולה שיעור התגובות הבלתי רצויות[11].

מנגנוני הגנה

  • מסווגים חוקתיים (Anthropic): סינון נתוני קלט/פלט על בסיס מערכת עקרונות חוקתיים. שיטה זו אפשרה להפחית את שיעור הצלחת jailbreak מ-86% ל-4.4% בהערכות מבוקרות[12].
  • Reinforcement Learning from Human Feedback ‏(RLHF): אימון תלת-שלבי (OpenAI), הכולל כוונון מפוקח, אימון מודל תגמול ואופטימיזציה של מדיניות, הדגים ירידה משמעותית בייצור תוכן רעיל.
  • אימון יריבי: אימון המודל על דוגמאות של מתקפות jailbreak לשיפור עמידותו. יעילות גישה זו בהפחתת שיעור הצלחת המתקפות מוערכת ב-60–80%[1].
  • הגנה רב-שכבתית: אסטרטגיה מומלצת הכוללת אימות נתוני קלט, הגנה ברמת המודל, ניטור נתוני פלט וניטור רציף בזמן אמת.

מתקפות Jailbreak על מודלי שפה גדולים מהוות בעיית אבטחת בינה מלאכותית יסודית, ומדגימות את המתח המתמיד בין יכולות המודלים לבין היישור שלהם. נוף המתקפות מסתבך ללא הרף, עובר מהזרקות prompt פשוטות למתקפות מולטי-מודאליות ואוטומטיות מורכבות. המחקרים מראים כי אין מנגנון הגנה נוכחי יחיד שיהיה עמיד לחלוטין כנגד כל ניסיונות ה-jailbreak. ההצלחה בתחום זה מחייבת השקעה מתמשכת במחקר אבטחה, נוהלי גילוי אחראי ומאמץ משותף של חוקרים, תעשייה ורגולטורים.

קישורים

  • Prompting Guide: Jailbreaking
  • מאגר עם מימוש מתקפת GCG ב-GitHub

ספרות

  • Bai, Y. et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.
  • Zou, A. et al. (2023). Universal and Transferable Adversarial Attacks on Aligned Language Models. arXiv:2307.15043.
  • Shen, X. et al. (2023). \"Do Anything Now\": Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models. arXiv:2308.03825.
  • Chao, P. et al. (2024). JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models. arXiv:2404.01318.
  • Liao, Z.; Sun, H. (2024). AmpleGCG: Learning a Universal and Transferable Generative Model of Adversarial Suffixes for Jailbreaking Both Open and Closed LLMs. OpenReview UfqzXg95I5.
  • Yi, S. et al. (2024). Jailbreak Attacks and Defenses Against Large Language Models: A Survey. arXiv:2407.04295.
  • Chu, J. et al. (2025). JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs. arXiv:2402.05668.
  • Liu, A. et al. (2025). PiCo: Jailbreaking Multimodal Large Language Models via Pictorial Code Contextualization. arXiv:2504.01444.
  • Ghosal, D. et al. (2025). Immune: Improving Safety Against Jailbreaks in Multi-modal LLMs via Inference-Time Filtering. CVPR 2025. PDF.
  • Yan, Q. et al. (2025). Hidden in Plain Sight: Probing Implicit Reasoning in Multimodal Language Models. arXiv:2506.00258.
  • Liu, Y. et al. (2025). RePD: Defending Jailbreak Attack through a Retrieval-Based Detector. Findings of NAACL 2025. ACL Anthology.

הערות

  1. 1.0 1.1 «A brief history of jailbreaking». Lil'Log. [1]
  2. 2.0 2.1 Yi, J., et al. «Jailbreak Attacks and Defenses Against Large Language Models: A Comprehensive Survey». arXiv:2405.09443. [2]
  3. «Jailbreaking LLMs». Prompting Guide. [3]
  4. «Exploring prompt injection attacks». NCC Group. [4]
  5. «Do Anything Now: Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models». arXiv:2308.03825. [5]
  6. «0xk1h0/ChatGPT_DAN». GitHub. [6]
  7. «Hiding in Plain Sight: Multimodal Jailbreaking of Large Language Models». HiddenLayer. [7]
  8. «ChatGPT "Time-travel" jailbreak lets you bypass its safety guards». BleepingComputer. [8]
  9. Chu, Z., et al. «JailbreakRadar: A Comprehensive Benchmark for Jailbreak Attack and Defense». arXiv:2402.12642. [9]
  10. Zou, A., et al. «Universal and Transferable Adversarial Attacks on Aligned Language Models». arXiv:2307.15043. [10]
  11. «Many-shot Jailbreaking». Anthropic. [11]
  12. «How we're using 'constitutional AI' to make our models safer». MIT Technology Review. [12]