---
title: "Jailbreaks (LLM) (BN)"
source: "https://systems-analysis.info/int/Jailbreaks_(LLM)_(BN)"
wiki: "systems-analysis.info/int"
article: "Jailbreaks_(LLM)_(BN)"
language: "bn"
categories:
  - "Category:Bengali"
  - "Category:Large language models"
  - "Category:Machine learning"
revision_id: 3289
wiki_created_at: 2026-09-06T23:18:28Z
wiki_modified_at: 2026-09-06T23:18:28Z
downloaded_at: 2026-09-07T22:56:09Z
---

# Jailbreaks (LLM) (BN)

**জেলব্রেক** (ইংরেজি **Jailbreak** — আক্ষরিক অর্থে «কারাগার থেকে পলায়ন») বৃহৎ ভাষা মডেলের (LLM) প্রসঙ্গে — এটি এক ধরনের প্রতিকূল আক্রমণ, যার লক্ষ্য হলো অন্তর্নির্মিত নিরাপত্তা ব্যবস্থা ও বিধিনিষেধ এড়িয়ে নিষিদ্ধ বা সম্ভাব্য ক্ষতিকর উত্তর পাওয়া<sup>[\[1\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(BN)#cite_note-lillog_intro-1)</sup>। Jailbreak হলো «প্রতিকূল prompt তৈরির মাধ্যমে মডেলকে এমন ক্ষতিকর উত্তর উৎপন্ন করতে প্ররোচিত করা যা ব্যবহারনীতি ও সামাজিক মানদণ্ডের পরিপন্থী»<sup>[\[2\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(BN)#cite_note-yi_2024_survey-2)</sup>।

Jailbreak আক্রমণে যে মৌলিক দুর্বলতাকে কাজে লাগানো হয়, তা হলো LLM-এর একটি স্থাপত্যগত বৈশিষ্ট্য: মডেলগুলো নির্দেশনা ও তথ্যকে তাদের ধরন অনুযায়ী আলাদা করতে পারে না, কারণ সিস্টেম prompt এবং ব্যবহারকারীর ইনপুট উভয়েরই একই ফরম্যাট রয়েছে — স্বাভাবিক ভাষার টেক্সট স্ট্রিং<sup>[\[3\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(BN)#cite_note-prompting_guide_vuln-3)</sup>।

## উৎপত্তি ও বিকাশের ইতিহাস

### প্রারম্ভিক পর্যায়: Prompt Injection (২০২২)

Prompt injection দুর্বলতার প্রথম নথিভুক্ত আবিষ্কার ঘটে ২০২২ সালের মে মাসে, যখন **Preamble** কোম্পানির গবেষকরা ChatGPT-এর এই ধরনের আক্রমণের প্রতি সংবেদনশীলতা আবিষ্কার করেন। ২০২২ সালের সেপ্টেম্বরে **রাইলি গুডসাইড** স্বাধীনভাবে Twitter-এ GPT-3-এর দুর্বলতার প্রথম সর্বজনীন প্রদর্শনী প্রকাশ করেন, যেখানে একটি পরিচিত উদাহরণ ছিল যেখানে মডেলকে পূর্ববর্তী নির্দেশনা উপেক্ষা করার নির্দেশ দেওয়া হয়েছিল<sup>[\[4\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(BN)#cite_note-ncc_group_history-4)</sup>।

### DAN যুগ (২০২২–২০২৩)

২০২২ সালের মাঝামাঝি সময়ে প্রথম **"Do Anything Now"** (**DAN**) prompt আবির্ভূত হয়, যা ছিল রোলপ্লে-এর জন্য নির্দেশনা। মূল উদ্ভাবন ছিল নিয়ম-মুক্ত একটি «বিকল্প পরিচয়» তৈরি করে রোলপ্লে ব্যবহারের মাধ্যমে নিরাপত্তা বিধিনিষেধ এড়ানো<sup>[\[5\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(BN)#cite_note-dan_evolution_arxiv-5)</sup>। DAN-এর বিবর্তন token সিস্টেম (শাস্তি/পুরস্কার প্রক্রিয়া) এবং চরিত্র সংরক্ষণের কৌশলসহ জটিল পরিস্থিতির জন্ম দেয়<sup>[\[6\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(BN)#cite_note-dan_github-6)</sup>।

### পদ্ধতির বৈচিত্র্যায়ন (২০২৩–২০২৪)

২০২৩ সাল থেকে jailbreak আক্রমণের উপর ব্যাপক একাডেমিক গবেষণা শুরু হয়। ২০২৪ সালে **মাল্টিমোডাল আক্রমণ** আবির্ভূত হয়, যার মধ্যে ছিল ছবিতে ক্ষতিকর নির্দেশনা লুকানো, অডিও ফাইলে এবং ASCII-art-এর মাধ্যমে ভিজ্যুয়াল prompt injection<sup>[\[7\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(BN)#cite_note-hiddenlayer_multimodal-7)</sup>।

### সাম্প্রতিক পর্যায় (২০২৪–২০২৫)

আক্রমণের কৌশলগুলো আরও জটিল হতে থাকে। ২০২৪ সালের নভেম্বরে **"Time Bandit"** কৌশলটি আবিষ্কার হয়, যা ChatGPT-4o-তে ঐতিহাসিক কালপর্ব (১৮০০-১৯০০ দশক) থেকে যেন প্রশ্ন করা হচ্ছে এইভাবে প্রশ্ন প্রণয়ন করে সময়গত বিভ্রান্তিকে কাজে লাগায়<sup>[\[8\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(BN)#cite_note-bleeping_computer_time_bandit-8)</sup>।

## প্রযুক্তিগত পদ্ধতি ও শ্রেণীবিভাগ

আক্রমণগুলোকে মডেলে প্রবেশাধিকারের ভিত্তিতে শ্রেণীবদ্ধ করা যায়:

- **ব্ল্যাক বক্স আক্রমণ:** মডেলের অভ্যন্তরীণ উপাদানে (প্যারামিটার, গ্রেডিয়েন্ট) প্রবেশাধিকার ছাড়াই।
- **হোয়াইট বক্স আক্রমণ:** মডেলের প্যারামিটার ও গ্রেডিয়েন্টে সম্পূর্ণ প্রবেশাধিকারসহ<sup>[\[2\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(BN)#cite_note-yi_2024_survey-2)</sup>।

### JailbreakRadar ট্যাক্সোনমি

*JailbreakRadar* (Chu et al., 2024) শ্রেণীবিভাগ ছয়টি মূল আক্রমণ বিভাগ চিহ্নিত করে:

1.  **সরাসরি আক্রমণ:** তাৎক্ষণিক ক্ষতিকর prompt।
2.  **পরোক্ষ আক্রমণ:** বহু-ধাপবিশিষ্ট কৌশলগত ম্যানিপুলেশন।
3.  **প্রাসঙ্গিক আক্রমণ:** কথোপকথনের ইতিহাস ব্যবহার।
4.  **রোলপ্লে আক্রমণ:** চরিত্র অনুকরণের কৌশল (যেমন DAN)।
5.  **এনকোডিং আক্রমণ:** ক্ষতিকর নির্দেশনা লুকাতে অবফাসকেশন পদ্ধতি।
6.  **টেমপ্লেট আক্রমণ:** কাঠামোবদ্ধ প্রতিকূল framework<sup>[\[9\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(BN)#cite_note-chu_2024_radar-9)</sup>।

### প্রযুক্তিগত কৌশল

- **প্রতিকূল সাফিক্স উৎপাদন (GCG):** Zou et al. (2023) প্রস্তাবিত পদ্ধতিটি স্বয়ংক্রিয়ভাবে প্রতিকূল সাফিক্স (token ক্রম) তৈরি করে, যা prompt-এ যোগ করলে উচ্চ সম্ভাবনায় ক্ষতিকর উত্তর আসে। পদ্ধতিটি গ্রেডিয়েন্ট অপ্টিমাইজেশন ব্যবহার করে এবং উচ্চ সাফল্যের হার (GPT-4-এ ৮৪% পর্যন্ত) ও মডেলগুলোর মধ্যে স্থানান্তরযোগ্যতা প্রদর্শন করে<sup>[\[10\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(BN)#cite_note-zou_2023_gcg-10)</sup>।
- **বহু-পদক্ষেপ জেলব্রেকিং:** Anthropic (2024)-এর গবেষণা দেখিয়েছে যে আক্রমণের কার্যকারিতা একটি পাওয়ার ল অনুসরণ করে: prompt-এ ক্ষতিকর উদাহরণের সংখ্যা বাড়ার সাথে সাথে অবাঞ্ছিত উত্তরের শতাংশও বাড়ে<sup>[\[11\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(BN)#cite_note-anthropic_many_shot-11)</sup>।

## সুরক্ষা কৌশল

- **সাংবিধানিক শ্রেণীকারক (Anthropic):** সাংবিধানিক নীতিমালার ভিত্তিতে ইনপুট/আউটপুট ফিল্টারিং। এই পদ্ধতি নিয়ন্ত্রিত মূল্যায়নে jailbreak-এর সাফল্যের হার ৮৬% থেকে ৪.৪%-এ নামিয়ে আনতে সক্ষম হয়েছে<sup>[\[12\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(BN)#cite_note-mit_tech_review_const_ai-12)</sup>।
- **মানবিক প্রতিক্রিয়া থেকে Reinforcement Learning (RLHF):** তিন-ধাপের প্রশিক্ষণ (OpenAI), যার মধ্যে রয়েছে নিয়ন্ত্রিত fine-tuning, রিওয়ার্ড মডেলের প্রশিক্ষণ এবং নীতি অপ্টিমাইজেশন, যা বিষাক্ত কন্টেন্ট উৎপাদনে উল্লেখযোগ্য হ্রাস দেখিয়েছে।
- **প্রতিকূল প্রশিক্ষণ:** মডেলের স্থিতিস্থাপকতা বাড়াতে jailbreak আক্রমণের উদাহরণে মডেল প্রশিক্ষণ। আক্রমণের সাফল্যের হার হ্রাসে এই পদ্ধতির কার্যকারিতা ৬০–৮০% বলে মূল্যায়ন করা হয়<sup>[\[1\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(BN)#cite_note-lillog_intro-1)</sup>।
- **বহুস্তরীয় সুরক্ষা:** প্রস্তাবিত কৌশল, যার মধ্যে রয়েছে ইনপুট যাচাইকরণ, মডেল স্তরে সুরক্ষা, আউটপুট পর্যবেক্ষণ এবং রিয়েল-টাইমে ক্রমাগত মনিটরিং।

বৃহৎ ভাষা মডেলের উপর Jailbreak আক্রমণ AI নিরাপত্তার একটি মৌলিক সমস্যা উপস্থাপন করে, যা মডেলের সক্ষমতা ও alignment-এর মধ্যে ক্রমাগত টানাপোড়েন প্রদর্শন করে। আক্রমণের পরিবেশ ক্রমাগত জটিল হচ্ছে, সরল prompt injection থেকে জটিল মাল্টিমোডাল ও স্বয়ংক্রিয় আক্রমণে পরিণত হচ্ছে। গবেষণা দেখায় যে বর্তমান কোনো একক সুরক্ষা কৌশলই সব jailbreak প্রচেষ্টার বিরুদ্ধে সম্পূর্ণ কার্যকর নয়। এই ক্ষেত্রে সাফল্যের জন্য নিরাপত্তা গবেষণায় ক্রমাগত বিনিয়োগ, দায়িত্বশীল প্রকাশের অনুশীলন এবং গবেষক, শিল্প ও নিয়ন্ত্রকদের সম্মিলিত প্রচেষ্টা প্রয়োজন।

## তথ্যসূত্র

- Prompting Guide: Jailbreaking
- GitHub-এ GCG আক্রমণের বাস্তবায়ন সহ রিপোজিটরি

## সাহিত্য

- Bai, Y. et al. (2022). *Constitutional AI: Harmlessness from AI Feedback*. arXiv:2212.08073.
- Zou, A. et al. (2023). *Universal and Transferable Adversarial Attacks on Aligned Language Models*. arXiv:2307.15043.
- Shen, X. et al. (2023). *\\Do Anything Now\\: Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models*. arXiv:2308.03825.
- Chao, P. et al. (2024). *JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models*. arXiv:2404.01318.
- Liao, Z.; Sun, H. (2024). *AmpleGCG: Learning a Universal and Transferable Generative Model of Adversarial Suffixes for Jailbreaking Both Open and Closed LLMs*. OpenReview UfqzXg95I5.
- Yi, S. et al. (2024). *Jailbreak Attacks and Defenses Against Large Language Models: A Survey*. arXiv:2407.04295.
- Chu, J. et al. (2025). *JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs*. arXiv:2402.05668.
- Liu, A. et al. (2025). *PiCo: Jailbreaking Multimodal Large Language Models via Pictorial Code Contextualization*. arXiv:2504.01444.
- Ghosal, D. et al. (2025). *Immune: Improving Safety Against Jailbreaks in Multi-modal LLMs via Inference-Time Filtering*. *CVPR 2025*. PDF.
- Yan, Q. et al. (2025). *Hidden in Plain Sight: Probing Implicit Reasoning in Multimodal Language Models*. arXiv:2506.00258.
- Liu, Y. et al. (2025). *RePD: Defending Jailbreak Attack through a Retrieval-Based Detector*. *Findings of NAACL 2025*. ACL Anthology.

## টীকা

1.  <span id="cite_note-lillog_intro-1">↑ <sup>[1.0](https://systems-analysis.info/int/Jailbreaks_(LLM)_(BN)#cite_ref-lillog_intro_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Jailbreaks_(LLM)_(BN)#cite_ref-lillog_intro_1-1)</sup> «A brief history of jailbreaking». *Lil'Log*. <a href="https://lilianweng.github.io/posts/2023-03-15-prompt-engineering/" class="external autonumber" rel="nofollow">[১]</a></span>
2.  <span id="cite_note-yi_2024_survey-2">↑ <sup>[2.0](https://systems-analysis.info/int/Jailbreaks_(LLM)_(BN)#cite_ref-yi_2024_survey_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/Jailbreaks_(LLM)_(BN)#cite_ref-yi_2024_survey_2-1)</sup> Yi, J., et al. «Jailbreak Attacks and Defenses Against Large Language Models: A Comprehensive Survey». *arXiv:2405.09443*. <a href="https://arxiv.org/abs/2405.09443" class="external autonumber" rel="nofollow">[২]</a></span>
3.  <span id="cite_note-prompting_guide_vuln-3">[↑](https://systems-analysis.info/int/Jailbreaks_(LLM)_(BN)#cite_ref-prompting_guide_vuln_3-0) «Jailbreaking LLMs». *Prompting Guide*. <a href="https://www.promptingguide.ai/risks/jailbreaking" class="external autonumber" rel="nofollow">[৩]</a></span>
4.  <span id="cite_note-ncc_group_history-4">[↑](https://systems-analysis.info/int/Jailbreaks_(LLM)_(BN)#cite_ref-ncc_group_history_4-0) «Exploring prompt injection attacks». *NCC Group*. <a href="https://research.nccgroup.com/2022/12/05/exploring-prompt-injection-attacks/" class="external autonumber" rel="nofollow">[৪]</a></span>
5.  <span id="cite_note-dan_evolution_arxiv-5">[↑](https://systems-analysis.info/int/Jailbreaks_(LLM)_(BN)#cite_ref-dan_evolution_arxiv_5-0) «Do Anything Now: Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models». *arXiv:2308.03825*. <a href="https://arxiv.org/abs/2308.03825" class="external autonumber" rel="nofollow">[৫]</a></span>
6.  <span id="cite_note-dan_github-6">[↑](https://systems-analysis.info/int/Jailbreaks_(LLM)_(BN)#cite_ref-dan_github_6-0) «0xk1h0/ChatGPT_DAN». *GitHub*. <a href="https://github.com/0xk1h0/ChatGPT_DAN" class="external autonumber" rel="nofollow">[৬]</a></span>
7.  <span id="cite_note-hiddenlayer_multimodal-7">[↑](https://systems-analysis.info/int/Jailbreaks_(LLM)_(BN)#cite_ref-hiddenlayer_multimodal_7-0) «Hiding in Plain Sight: Multimodal Jailbreaking of Large Language Models». *HiddenLayer*. <a href="https://hiddenlayer.com/research/multimodal-jailbreaking-of-large-language-models/" class="external autonumber" rel="nofollow">[৭]</a></span>
8.  <span id="cite_note-bleeping_computer_time_bandit-8">[↑](https://systems-analysis.info/int/Jailbreaks_(LLM)_(BN)#cite_ref-bleeping_computer_time_bandit_8-0) «ChatGPT "Time-travel" jailbreak lets you bypass its safety guards». *BleepingComputer*. <a href="https://www.bleepingcomputer.com/news/security/chatgpt-time-travel-jailbreak-lets-you-bypass-its-safety-guards/" class="external autonumber" rel="nofollow">[৮]</a></span>
9.  <span id="cite_note-chu_2024_radar-9">[↑](https://systems-analysis.info/int/Jailbreaks_(LLM)_(BN)#cite_ref-chu_2024_radar_9-0) Chu, Z., et al. «JailbreakRadar: A Comprehensive Benchmark for Jailbreak Attack and Defense». *arXiv:2402.12642*. <a href="https://arxiv.org/abs/2402.12642" class="external autonumber" rel="nofollow">[৯]</a></span>
10. <span id="cite_note-zou_2023_gcg-10">[↑](https://systems-analysis.info/int/Jailbreaks_(LLM)_(BN)#cite_ref-zou_2023_gcg_10-0) Zou, A., et al. «Universal and Transferable Adversarial Attacks on Aligned Language Models». *arXiv:2307.15043*. <a href="https://arxiv.org/abs/2307.15043" class="external autonumber" rel="nofollow">[১০]</a></span>
11. <span id="cite_note-anthropic_many_shot-11">[↑](https://systems-analysis.info/int/Jailbreaks_(LLM)_(BN)#cite_ref-anthropic_many_shot_11-0) «Many-shot Jailbreaking». *Anthropic*. <a href="https://www.anthropic.com/research/many-shot-jailbreaking" class="external autonumber" rel="nofollow">[১১]</a></span>
12. <span id="cite_note-mit_tech_review_const_ai-12">[↑](https://systems-analysis.info/int/Jailbreaks_(LLM)_(BN)#cite_ref-mit_tech_review_const_ai_12-0) «How we're using 'constitutional AI' to make our models safer». *MIT Technology Review*. <a href="https://www.technologyreview.com/2023/05/09/1072782/how-were-using-constitutional-ai-to-make-our-models-safer/" class="external autonumber" rel="nofollow">[১২]</a></span>
