Jailbreaks (LLM) (UR)

From Systems analysis Wiki
Jump to navigation Jump to search

جیل بریک (انگریزی: Jailbreak — لفظی معنی «جیل سے فرار») بڑے زبانی ماڈلز (LLM) کے تناظر میں ایک قسم کا مقابلہ جاتی حملہ (adversarial attack) ہے، جس کا مقصد ماڈل کے اندرونی حفاظتی طریقہ کاروں اور پابندیوں کو عبور کرکے ممنوع یا ممکنہ طور پر نقصاندہ جوابات حاصل کرنا ہے[1]۔ Jailbreak سے مراد «مقابلہ جاتی prompts تیار کرکے ماڈل کو ایسے نقصاندہ جوابات دینے پر آمادہ کرنا ہے جو استعمال کی پالیسی اور معاشرتی اصولوں کے خلاف ہوں»[2]۔

Jailbreak حملوں میں استحصال کی جانے والی بنیادی کمزوری LLM کی معماری خصوصیت میں مضمر ہے: ماڈل ہدایات اور ڈیٹا میں ان کی قسم کی بنیاد پر فرق نہیں کر سکتے، کیونکہ سسٹم prompts اور صارف کا ان پٹ دونوں ایک ہی شکل میں ہوتے ہیں — قدرتی زبان میں متنی تاریں[3]۔

آغاز اور ارتقاء کی تاریخ

ابتدائی دور: Prompt Injection (2022)

Prompt injection کی کمزوری کی پہلی دستاویزی دریافت مئی 2022 میں ہوئی، جب Preamble کمپنی کے محققین نے ChatGPT کی ایسے حملوں کے لیے حساسیت دریافت کی۔ ستمبر 2022 میں Riley Goodside نے Twitter پر GPT-3 کی کمزوری کا پہلا عوامی مظاہرہ آزادانہ طور پر شائع کیا، جس میں معروف مثال پیش کی گئی جہاں ماڈل کو پچھلی ہدایات نظرانداز کرنے کا حکم دیا گیا تھا[4]۔

DAN کا دور (2022–2023)

2022 کے وسط میں پہلے "Do Anything Now" (DAN) prompts سامنے آئے، جو کردار ادا کرنے کی ہدایات پر مشتمل تھے۔ کلیدی اختراع یہ تھی کہ کردار ادا کرنے (role-play) کو حفاظتی پابندیوں کو عبور کرنے کے لیے استعمال کیا گیا، جس میں قواعد سے آزاد «متبادل شخصیت» تخلیق کی گئی[5]۔ DAN کے ارتقاء نے token نظاموں (سزا/انعام کے طریقہ کار) اور کردار برقرار رکھنے کے طریقہ کاروں کے ساتھ پیچیدہ منظرنامے جنم دیے[6]۔

طریقوں کا تنوع (2023–2024)

2023 سے jailbreak حملوں پر جامع تعلیمی تحقیق کا آغاز ہوا۔ 2024 میں ملٹی موڈل حملے سامنے آئے، جن میں تصویروں اور آڈیو فائلوں میں نقصاندہ ہدایات چھپانا، نیز ASCII-art کے ذریعے بصری prompt injection شامل ہے[7]۔

جدید دور (2024–2025)

حملوں کی تکنیکیں پیچیدہ ہوتی جا رہی ہیں۔ نومبر 2024 میں "Time Bandit" تکنیک دریافت ہوئی، جو ChatGPT-4o میں وقتی الجھن کا استحصال کرتے ہوئے سوالات کو تاریخی ادوار (1800ء–1900ء) کے انداز میں پیش کرتی ہے[8]۔

تکنیکی طریقے اور درجہ بندی

حملوں کو ماڈل تک رسائی کی بنیاد پر درجہ بندی کیا جا سکتا ہے:

  • بلیک باکس حملے: ماڈل کے اندرونی اجزاء (پیرامیٹرز، گریڈیئنٹس) تک رسائی کے بغیر۔
  • وائٹ باکس حملے: ماڈل کے پیرامیٹرز اور گریڈیئنٹس تک مکمل رسائی کے ساتھ[2]۔

JailbreakRadar کی درجہ بندی

JailbreakRadar (Chu et al., 2024) کی درجہ بندی حملوں کی چھ بنیادی اقسام متعین کرتی ہے:

  1. براہ راست حملے: فوری نقصاندہ prompts۔
  2. بالواسطہ حملے: کثیر مرحلہ جاتی ہیرا پھیری کی حکمت عملیاں۔
  3. سیاقی حملے: گفتگو کی تاریخ کا استعمال۔
  4. کرداری حملے: کردار کی نقل اتارنے کی تکنیکیں (مثلاً DAN)۔
  5. کوڈنگ حملے: نقصاندہ ہدایات چھپانے کے لیے obfuscation کے طریقے۔
  6. سانچہ جاتی حملے: منظم مقابلہ جاتی frameworks[9]۔

تکنیکی طریقہ کار

  • مقابلہ جاتی suffixes کی تخلیق (GCG): Zou et al. (2023) کا پیش کردہ طریقہ خود بخود مقابلہ جاتی suffixes (tokens کی ترتیبیں) تیار کرتا ہے، جو prompt میں شامل کرنے پر زیادہ امکان کے ساتھ نقصاندہ جواب حاصل کرتا ہے۔ یہ طریقہ gradient optimization استعمال کرتا ہے اور اعلیٰ کامیابی (GPT-4 پر 84% تک) اور ماڈلز کے درمیان منتقلی کا مظاہرہ کرتا ہے[10]۔
  • کثیر مرحلہ جیل بریکنگ: Anthropic (2024) کی تحقیق نے ظاہر کیا کہ حملوں کی کارکردگی ایک قوتی قانون (power law) کی پیروی کرتی ہے: prompt میں نقصاندہ مثالوں کی تعداد بڑھنے کے ساتھ ناپسندیدہ جوابات کا تناسب بڑھتا ہے[11]۔

تحفظ کے طریقہ کار

  • آئینی درجہ بند کنندگان (Anthropic): آئینی اصولوں کے مجموعے کی بنیاد پر ان پٹ/آؤٹ پٹ ڈیٹا کی فلٹرنگ۔ اس طریقے نے کنٹرول شدہ جائزوں میں jailbreak کی کامیابی 86% سے گھٹا کر 4.4% کر دی[12]۔
  • انسانی آراء سے Reinforcement Learning (RLHF): تین مرحلہ جاتی تربیت (OpenAI)، جس میں زیر نگرانی fine-tuning، reward ماڈل کی تربیت اور پالیسی optimization شامل ہے، نے زہریلے مواد کی تخلیق میں نمایاں کمی ظاہر کی۔
  • مقابلہ جاتی تربیت: ماڈل کو jailbreak حملوں کی مثالوں پر تربیت دے کر اس کی مضبوطی بڑھانا۔ حملوں کی کامیابی کم کرنے میں اس طریقے کی تاثیر 60–80% لگائی گئی ہے[1]۔
  • کثیر سطحی تحفظ: تجویز کردہ حکمت عملی جس میں ان پٹ ڈیٹا کی توثیق، ماڈل کی سطح پر تحفظ، آؤٹ پٹ ڈیٹا کی نگرانی اور حقیقی وقت میں مسلسل نگرانی شامل ہے۔

بڑے زبانی ماڈلز پر Jailbreak حملے AI سیکیورٹی کا ایک بنیادی مسئلہ پیش کرتے ہیں، جو ماڈلز کی صلاحیتوں اور ان کی ہم آہنگی (alignment) کے درمیان مسلسل کشمکش کو اجاگر کرتے ہیں۔ حملوں کا منظرنامہ مسلسل پیچیدہ ہوتا جا رہا ہے، جو سادہ prompt injection سے پیچیدہ ملٹی موڈل اور خودکار حملوں کی طرف بڑھ رہا ہے۔ تحقیق سے ظاہر ہوتا ہے کہ کوئی بھی موجودہ تحفظاتی طریقہ کار jailbreak کی تمام کوششوں کے خلاف مکمل طور پر مضبوط نہیں ہے۔ اس میدان میں کامیابی کے لیے سیکیورٹی تحقیق میں مسلسل سرمایہ کاری، ذمہ دارانہ انکشاف کے طریقوں اور محققین، صنعت اور ریگولیٹرز کی مشترکہ کوششوں کی ضرورت ہے۔

حوالہ جات

  • Prompting Guide: Jailbreaking
  • GitHub پر GCG حملے کی نفاذ کا ذخیرہ

کتابیات

  • Bai, Y. et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.
  • Zou, A. et al. (2023). Universal and Transferable Adversarial Attacks on Aligned Language Models. arXiv:2307.15043.
  • Shen, X. et al. (2023). "Do Anything Now": Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models. arXiv:2308.03825.
  • Chao, P. et al. (2024). JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models. arXiv:2404.01318.
  • Liao, Z.; Sun, H. (2024). AmpleGCG: Learning a Universal and Transferable Generative Model of Adversarial Suffixes for Jailbreaking Both Open and Closed LLMs. OpenReview UfqzXg95I5.
  • Yi, S. et al. (2024). Jailbreak Attacks and Defenses Against Large Language Models: A Survey. arXiv:2407.04295.
  • Chu, J. et al. (2025). JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs. arXiv:2402.05668.
  • Liu, A. et al. (2025). PiCo: Jailbreaking Multimodal Large Language Models via Pictorial Code Contextualization. arXiv:2504.01444.
  • Ghosal, D. et al. (2025). Immune: Improving Safety Against Jailbreaks in Multi-modal LLMs via Inference-Time Filtering. CVPR 2025. PDF.
  • Yan, Q. et al. (2025). Hidden in Plain Sight: Probing Implicit Reasoning in Multimodal Language Models. arXiv:2506.00258.
  • Liu, Y. et al. (2025). RePD: Defending Jailbreak Attack through a Retrieval-Based Detector. Findings of NAACL 2025. ACL Anthology.

حواشی

  1. 1.0 1.1 «A brief history of jailbreaking». Lil'Log. [1]
  2. 2.0 2.1 Yi, J., et al. «Jailbreak Attacks and Defenses Against Large Language Models: A Comprehensive Survey». arXiv:2405.09443. [2]
  3. «Jailbreaking LLMs». Prompting Guide. [3]
  4. «Exploring prompt injection attacks». NCC Group. [4]
  5. «Do Anything Now: Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models». arXiv:2308.03825. [5]
  6. «0xk1h0/ChatGPT_DAN». GitHub. [6]
  7. «Hiding in Plain Sight: Multimodal Jailbreaking of Large Language Models». HiddenLayer. [7]
  8. «ChatGPT "Time-travel" jailbreak lets you bypass its safety guards». BleepingComputer. [8]
  9. Chu, Z., et al. «JailbreakRadar: A Comprehensive Benchmark for Jailbreak Attack and Defense». arXiv:2402.12642. [9]
  10. Zou, A., et al. «Universal and Transferable Adversarial Attacks on Aligned Language Models». arXiv:2307.15043. [10]
  11. «Many-shot Jailbreaking». Anthropic. [11]
  12. «How we're using 'constitutional AI' to make our models safer». MIT Technology Review. [12]