Jailbreaks (LLM) (BN)

From Systems analysis Wiki
Jump to navigation Jump to search

জেলব্রেক (ইংরেজি Jailbreak — আক্ষরিক অর্থে «কারাগার থেকে পলায়ন») বৃহৎ ভাষা মডেলের (LLM) প্রসঙ্গে — এটি এক ধরনের প্রতিকূল আক্রমণ, যার লক্ষ্য হলো অন্তর্নির্মিত নিরাপত্তা ব্যবস্থা ও বিধিনিষেধ এড়িয়ে নিষিদ্ধ বা সম্ভাব্য ক্ষতিকর উত্তর পাওয়া[1]। Jailbreak হলো «প্রতিকূল prompt তৈরির মাধ্যমে মডেলকে এমন ক্ষতিকর উত্তর উৎপন্ন করতে প্ররোচিত করা যা ব্যবহারনীতি ও সামাজিক মানদণ্ডের পরিপন্থী»[2]

Jailbreak আক্রমণে যে মৌলিক দুর্বলতাকে কাজে লাগানো হয়, তা হলো LLM-এর একটি স্থাপত্যগত বৈশিষ্ট্য: মডেলগুলো নির্দেশনা ও তথ্যকে তাদের ধরন অনুযায়ী আলাদা করতে পারে না, কারণ সিস্টেম prompt এবং ব্যবহারকারীর ইনপুট উভয়েরই একই ফরম্যাট রয়েছে — স্বাভাবিক ভাষার টেক্সট স্ট্রিং[3]

উৎপত্তি ও বিকাশের ইতিহাস

প্রারম্ভিক পর্যায়: Prompt Injection (২০২২)

Prompt injection দুর্বলতার প্রথম নথিভুক্ত আবিষ্কার ঘটে ২০২২ সালের মে মাসে, যখন Preamble কোম্পানির গবেষকরা ChatGPT-এর এই ধরনের আক্রমণের প্রতি সংবেদনশীলতা আবিষ্কার করেন। ২০২২ সালের সেপ্টেম্বরে রাইলি গুডসাইড স্বাধীনভাবে Twitter-এ GPT-3-এর দুর্বলতার প্রথম সর্বজনীন প্রদর্শনী প্রকাশ করেন, যেখানে একটি পরিচিত উদাহরণ ছিল যেখানে মডেলকে পূর্ববর্তী নির্দেশনা উপেক্ষা করার নির্দেশ দেওয়া হয়েছিল[4]

DAN যুগ (২০২২–২০২৩)

২০২২ সালের মাঝামাঝি সময়ে প্রথম "Do Anything Now" (DAN) prompt আবির্ভূত হয়, যা ছিল রোলপ্লে-এর জন্য নির্দেশনা। মূল উদ্ভাবন ছিল নিয়ম-মুক্ত একটি «বিকল্প পরিচয়» তৈরি করে রোলপ্লে ব্যবহারের মাধ্যমে নিরাপত্তা বিধিনিষেধ এড়ানো[5]। DAN-এর বিবর্তন token সিস্টেম (শাস্তি/পুরস্কার প্রক্রিয়া) এবং চরিত্র সংরক্ষণের কৌশলসহ জটিল পরিস্থিতির জন্ম দেয়[6]

পদ্ধতির বৈচিত্র্যায়ন (২০২৩–২০২৪)

২০২৩ সাল থেকে jailbreak আক্রমণের উপর ব্যাপক একাডেমিক গবেষণা শুরু হয়। ২০২৪ সালে মাল্টিমোডাল আক্রমণ আবির্ভূত হয়, যার মধ্যে ছিল ছবিতে ক্ষতিকর নির্দেশনা লুকানো, অডিও ফাইলে এবং ASCII-art-এর মাধ্যমে ভিজ্যুয়াল prompt injection[7]

সাম্প্রতিক পর্যায় (২০২৪–২০২৫)

আক্রমণের কৌশলগুলো আরও জটিল হতে থাকে। ২০২৪ সালের নভেম্বরে "Time Bandit" কৌশলটি আবিষ্কার হয়, যা ChatGPT-4o-তে ঐতিহাসিক কালপর্ব (১৮০০-১৯০০ দশক) থেকে যেন প্রশ্ন করা হচ্ছে এইভাবে প্রশ্ন প্রণয়ন করে সময়গত বিভ্রান্তিকে কাজে লাগায়[8]

প্রযুক্তিগত পদ্ধতি ও শ্রেণীবিভাগ

আক্রমণগুলোকে মডেলে প্রবেশাধিকারের ভিত্তিতে শ্রেণীবদ্ধ করা যায়:

  • ব্ল্যাক বক্স আক্রমণ: মডেলের অভ্যন্তরীণ উপাদানে (প্যারামিটার, গ্রেডিয়েন্ট) প্রবেশাধিকার ছাড়াই।
  • হোয়াইট বক্স আক্রমণ: মডেলের প্যারামিটার ও গ্রেডিয়েন্টে সম্পূর্ণ প্রবেশাধিকারসহ[2]

JailbreakRadar ট্যাক্সোনমি

JailbreakRadar (Chu et al., 2024) শ্রেণীবিভাগ ছয়টি মূল আক্রমণ বিভাগ চিহ্নিত করে:

  1. সরাসরি আক্রমণ: তাৎক্ষণিক ক্ষতিকর prompt।
  2. পরোক্ষ আক্রমণ: বহু-ধাপবিশিষ্ট কৌশলগত ম্যানিপুলেশন।
  3. প্রাসঙ্গিক আক্রমণ: কথোপকথনের ইতিহাস ব্যবহার।
  4. রোলপ্লে আক্রমণ: চরিত্র অনুকরণের কৌশল (যেমন DAN)।
  5. এনকোডিং আক্রমণ: ক্ষতিকর নির্দেশনা লুকাতে অবফাসকেশন পদ্ধতি।
  6. টেমপ্লেট আক্রমণ: কাঠামোবদ্ধ প্রতিকূল framework[9]

প্রযুক্তিগত কৌশল

  • প্রতিকূল সাফিক্স উৎপাদন (GCG): Zou et al. (2023) প্রস্তাবিত পদ্ধতিটি স্বয়ংক্রিয়ভাবে প্রতিকূল সাফিক্স (token ক্রম) তৈরি করে, যা prompt-এ যোগ করলে উচ্চ সম্ভাবনায় ক্ষতিকর উত্তর আসে। পদ্ধতিটি গ্রেডিয়েন্ট অপ্টিমাইজেশন ব্যবহার করে এবং উচ্চ সাফল্যের হার (GPT-4-এ ৮৪% পর্যন্ত) ও মডেলগুলোর মধ্যে স্থানান্তরযোগ্যতা প্রদর্শন করে[10]
  • বহু-পদক্ষেপ জেলব্রেকিং: Anthropic (2024)-এর গবেষণা দেখিয়েছে যে আক্রমণের কার্যকারিতা একটি পাওয়ার ল অনুসরণ করে: prompt-এ ক্ষতিকর উদাহরণের সংখ্যা বাড়ার সাথে সাথে অবাঞ্ছিত উত্তরের শতাংশও বাড়ে[11]

সুরক্ষা কৌশল

  • সাংবিধানিক শ্রেণীকারক (Anthropic): সাংবিধানিক নীতিমালার ভিত্তিতে ইনপুট/আউটপুট ফিল্টারিং। এই পদ্ধতি নিয়ন্ত্রিত মূল্যায়নে jailbreak-এর সাফল্যের হার ৮৬% থেকে ৪.৪%-এ নামিয়ে আনতে সক্ষম হয়েছে[12]
  • মানবিক প্রতিক্রিয়া থেকে Reinforcement Learning (RLHF): তিন-ধাপের প্রশিক্ষণ (OpenAI), যার মধ্যে রয়েছে নিয়ন্ত্রিত fine-tuning, রিওয়ার্ড মডেলের প্রশিক্ষণ এবং নীতি অপ্টিমাইজেশন, যা বিষাক্ত কন্টেন্ট উৎপাদনে উল্লেখযোগ্য হ্রাস দেখিয়েছে।
  • প্রতিকূল প্রশিক্ষণ: মডেলের স্থিতিস্থাপকতা বাড়াতে jailbreak আক্রমণের উদাহরণে মডেল প্রশিক্ষণ। আক্রমণের সাফল্যের হার হ্রাসে এই পদ্ধতির কার্যকারিতা ৬০–৮০% বলে মূল্যায়ন করা হয়[1]
  • বহুস্তরীয় সুরক্ষা: প্রস্তাবিত কৌশল, যার মধ্যে রয়েছে ইনপুট যাচাইকরণ, মডেল স্তরে সুরক্ষা, আউটপুট পর্যবেক্ষণ এবং রিয়েল-টাইমে ক্রমাগত মনিটরিং।

বৃহৎ ভাষা মডেলের উপর Jailbreak আক্রমণ AI নিরাপত্তার একটি মৌলিক সমস্যা উপস্থাপন করে, যা মডেলের সক্ষমতা ও alignment-এর মধ্যে ক্রমাগত টানাপোড়েন প্রদর্শন করে। আক্রমণের পরিবেশ ক্রমাগত জটিল হচ্ছে, সরল prompt injection থেকে জটিল মাল্টিমোডাল ও স্বয়ংক্রিয় আক্রমণে পরিণত হচ্ছে। গবেষণা দেখায় যে বর্তমান কোনো একক সুরক্ষা কৌশলই সব jailbreak প্রচেষ্টার বিরুদ্ধে সম্পূর্ণ কার্যকর নয়। এই ক্ষেত্রে সাফল্যের জন্য নিরাপত্তা গবেষণায় ক্রমাগত বিনিয়োগ, দায়িত্বশীল প্রকাশের অনুশীলন এবং গবেষক, শিল্প ও নিয়ন্ত্রকদের সম্মিলিত প্রচেষ্টা প্রয়োজন।

তথ্যসূত্র

  • Prompting Guide: Jailbreaking
  • GitHub-এ GCG আক্রমণের বাস্তবায়ন সহ রিপোজিটরি

সাহিত্য

  • Bai, Y. et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.
  • Zou, A. et al. (2023). Universal and Transferable Adversarial Attacks on Aligned Language Models. arXiv:2307.15043.
  • Shen, X. et al. (2023). \"Do Anything Now\": Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models. arXiv:2308.03825.
  • Chao, P. et al. (2024). JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models. arXiv:2404.01318.
  • Liao, Z.; Sun, H. (2024). AmpleGCG: Learning a Universal and Transferable Generative Model of Adversarial Suffixes for Jailbreaking Both Open and Closed LLMs. OpenReview UfqzXg95I5.
  • Yi, S. et al. (2024). Jailbreak Attacks and Defenses Against Large Language Models: A Survey. arXiv:2407.04295.
  • Chu, J. et al. (2025). JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs. arXiv:2402.05668.
  • Liu, A. et al. (2025). PiCo: Jailbreaking Multimodal Large Language Models via Pictorial Code Contextualization. arXiv:2504.01444.
  • Ghosal, D. et al. (2025). Immune: Improving Safety Against Jailbreaks in Multi-modal LLMs via Inference-Time Filtering. CVPR 2025. PDF.
  • Yan, Q. et al. (2025). Hidden in Plain Sight: Probing Implicit Reasoning in Multimodal Language Models. arXiv:2506.00258.
  • Liu, Y. et al. (2025). RePD: Defending Jailbreak Attack through a Retrieval-Based Detector. Findings of NAACL 2025. ACL Anthology.

টীকা

  1. 1.0 1.1 «A brief history of jailbreaking». Lil'Log. [১]
  2. 2.0 2.1 Yi, J., et al. «Jailbreak Attacks and Defenses Against Large Language Models: A Comprehensive Survey». arXiv:2405.09443. [২]
  3. «Jailbreaking LLMs». Prompting Guide. [৩]
  4. «Exploring prompt injection attacks». NCC Group. [৪]
  5. «Do Anything Now: Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models». arXiv:2308.03825. [৫]
  6. «0xk1h0/ChatGPT_DAN». GitHub. [৬]
  7. «Hiding in Plain Sight: Multimodal Jailbreaking of Large Language Models». HiddenLayer. [৭]
  8. «ChatGPT "Time-travel" jailbreak lets you bypass its safety guards». BleepingComputer. [৮]
  9. Chu, Z., et al. «JailbreakRadar: A Comprehensive Benchmark for Jailbreak Attack and Defense». arXiv:2402.12642. [৯]
  10. Zou, A., et al. «Universal and Transferable Adversarial Attacks on Aligned Language Models». arXiv:2307.15043. [১০]
  11. «Many-shot Jailbreaking». Anthropic. [১১]
  12. «How we're using 'constitutional AI' to make our models safer». MIT Technology Review. [১২]