Jailbreaks (LLM) (TL)
Jailbreak (Ingles: Jailbreak — doblehan ang kahulugan ay \"pagtakas mula sa bilangguan\") sa konteksto ng malalaking modelong pangwika (LLM) — ito ay isang uri ng mapaghamong pag-atake na ang layunin ay ang pag-iwas sa mga naka-embed na mekanismo ng kaligtasan at mga paghihigpit upang makakuha ng mga ipinagbabawal o potensyal na mapanganib na sagot[1]. Ang Jailbreak ay kumakatawan sa \"pag-uudyok sa modelo na makabuo ng mga mapanganib na sagot na sumasalungat sa patakaran ng paggamit at mga pamantayan ng lipunan, sa pamamagitan ng pagbuo ng mga mapaghamong prompt\"[2].
Ang pangunahing kahinaan na pinagsamantalahan sa mga Jailbreak na pag-atake ay nakasalalay sa arkitekturang katangian ng LLM: ang mga modelo ay hindi makakakilala ng mga instruksyon at data ayon sa kanilang uri, dahil ang mga system prompt at ang input ng gumagamit ay may parehong format — mga linya ng teksto sa natural na wika[3].
Kasaysayan ng Pinagmulan at Pag-unlad
Maagang Panahon: Prompt Injection (2022)
Ang unang dokumentadong pagtuklas ng kahinaan sa prompt injection ay naganap noong Mayo 2022, nang ang mga mananaliksik mula sa kumpanyang Preamble ay natuklasan ang pagiging madaling kapitan ng ChatGPT sa ganitong mga pag-atake. Noong Setyembre 2022, si Riley Goodside ay naglathala ng una at pampublikong demonstrasyon ng kahinaan ng GPT-3 sa Twitter, na may kilalang halimbawa kung saan inutusan ang modelo na huwag pansinin ang mga nakaraang instruksyon[4].
Panahon ng DAN (2022–2023)
Noong kalagitnaan ng 2022, lumabas ang mga unang prompt na "Do Anything Now" (DAN), na kumakatawan sa mga instruksyon para sa role-play. Ang pangunahing inobasyon ay ang paggamit ng role-play upang maiwasan ang mga paghihigpit sa kaligtasan sa pamamagitan ng paglikha ng isang \"alternatibong personalidad\" na malaya mula sa mga patakaran[5]. Ang ebolusyon ng DAN ay humantong sa paglabas ng mga kumplikadong senaryo na may mga sistema ng token (mga mekanismo ng parusa/gantimpala) at mga mekanismo ng pagpapanatili ng karakter[6].
Pagkakaiba-iba ng mga Pamamaraan (2023–2024)
Mula 2023, nagsimula ang komprehensibong akademikong pananaliksik sa mga Jailbreak na pag-atake. Noong 2024, lumabas ang mga multimodal na pag-atake, kasama ang pagtatago ng mga mapanganib na instruksyon sa mga imahe, audio file, pati na rin ang mga visual na prompt injection sa pamamagitan ng ASCII-art[7].
Kasalukuyang Panahon (2024–2025)
Patuloy na lumalaki ang kumplikasyon ng mga teknik ng pag-atake. Noong Nobyembre 2024, natuklasan ang teknik na "Time Bandit", na pinagsamantalahan ang temporal na kalituhan sa ChatGPT-4o sa pamamagitan ng pagbuo ng mga tanong na parang nagmumula sa mga makasaysayang panahon (taong 1800–1900)[8].
Mga Teknikal na Pamamaraan at Klasipikasyon
Maaaring iuri-uriin ang mga pag-atake ayon sa access sa modelo:
- Mga pag-atake sa black box: Nang walang access sa mga panloob na bahagi ng modelo (mga parameter, gradient).
- Mga pag-atake sa white box: Na may ganap na access sa mga parameter ng modelo at mga gradient[2].
Taxonomy ng JailbreakRadar
Ang klasipikasyon ng JailbreakRadar (Chu et al., 2024) ay nagtatangi ng anim na pangunahing kategorya ng pag-atake:
- Mga direktang pag-atake: Mga direktang mapanganib na prompt.
- Mga hindi direktang pag-atake: Mga estratehiya ng manipulasyon na may maraming hakbang.
- Mga kontekstuwal na pag-atake: Paggamit ng kasaysayan ng pag-uusap.
- Mga pag-atakeng may role-play: Mga teknik ng impersonasyon ng karakter (hal., DAN).
- Mga pag-atake sa pag-encode: Mga pamamaraan ng obfuskasyon upang itago ang mga mapanganib na instruksyon.
- Mga pag-atakeng may template: Mga nakaistrakturang mapaghamong framework[9].
Mga Teknikal na Mekanismo
- Pagbuo ng mapaghamong suffix (GCG): Ang pamamaraang iminungkahi ni Zou et al. (2023) ay awtomatikong bumubuo ng mga mapaghamong suffix (mga pagkakasunud-sunod ng token) na, kapag idinagdag sa isang prompt, ay may mataas na posibilidad na magdulot ng mapanganib na sagot. Ang pamamaraan ay gumagamit ng gradient optimization at nagpapakita ng mataas na tagumpay (hanggang 84% sa GPT-4) at pagiging ilipat sa pagitan ng mga modelo[10].
- Multi-turn na Jailbreaking: Ang pananaliksik ng Anthropic (2024) ay nagpakita na ang bisa ng mga pag-atake ay sumusunod sa batas ng kapangyarihan: habang tumataas ang bilang ng mga mapanganib na halimbawa sa prompt, tumataas ang porsyento ng mga hindi gustong sagot[11].
Mga Mekanismo ng Proteksyon
- Mga constitutional classifier (Anthropic): Pag-filter ng input/output data batay sa isang hanay ng mga constitutional na prinsipyo. Ang pamamaraang ito ay nagpahintulot na bawasan ang tagumpay ng Jailbreak mula 86% hanggang 4.4% sa mga kontroladong pagsusuri[12].
- Reinforcement Learning mula sa Human Feedback (RLHF): Ang tatlong-yugto na pagsasanay (OpenAI), na kinabibilangan ng kontroladong fine-tuning, pagsasanay ng modelo ng gantimpala at pag-optimize ng patakaran, ay nagpakita ng malaking pagbaba sa pagbuo ng nakalason na nilalaman.
- Adversarial training: Pagsasanay ng modelo gamit ang mga halimbawa ng Jailbreak na pag-atake upang mapataas ang katatagan nito. Ang bisa ng pamamaraang ito sa pagbabawas ng tagumpay ng mga pag-atake ay tinatayang 60–80%[1].
- Multi-level na proteksyon: Isang inirerekomendang estratehiya na kinabibilangan ng pagpapatunay ng input data, proteksyon sa antas ng modelo, pagsubaybay ng output data at patuloy na real-time na pagsubaybay.
Ang mga Jailbreak na pag-atake sa malalaking modelong pangwika ay kumakatawan sa isang pundamental na problema ng kaligtasan ng AI, na nagpapakita ng patuloy na tensyon sa pagitan ng mga kakayahan at pagkakatugma ng mga modelo. Ang tanawin ng mga pag-atake ay patuloy na lumalaki ang kumplikasyon, na lumilipat mula sa simpleng prompt injection patungo sa mga kumplikadong multimodal at awtomatisadong pag-atake. Ipinapakita ng pananaliksik na walang kasalukuyang mekanismo ng proteksyon na ganap na lumalaban sa lahat ng pagtatangkang Jailbreak. Ang tagumpay sa larangang ito ay nangangailangan ng patuloy na pamumuhunan sa pananaliksik sa kaligtasan, mga gawi ng responsableng pagsisiwalat at magkasanib na pagsisikap ng mga mananaliksik, industriya at mga regulator.
Mga Sanggunian
- Prompting Guide: Jailbreaking
- Repositoryo na may implementasyon ng pag-atakeng GCG sa GitHub
Panitikan
- Bai, Y. et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.
- Zou, A. et al. (2023). Universal and Transferable Adversarial Attacks on Aligned Language Models. arXiv:2307.15043.
- Shen, X. et al. (2023). "Do Anything Now": Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models. arXiv:2308.03825.
- Chao, P. et al. (2024). JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models. arXiv:2404.01318.
- Liao, Z.; Sun, H. (2024). AmpleGCG: Learning a Universal and Transferable Generative Model of Adversarial Suffixes for Jailbreaking Both Open and Closed LLMs. OpenReview UfqzXg95I5.
- Yi, S. et al. (2024). Jailbreak Attacks and Defenses Against Large Language Models: A Survey. arXiv:2407.04295.
- Chu, J. et al. (2025). JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs. arXiv:2402.05668.
- Liu, A. et al. (2025). PiCo: Jailbreaking Multimodal Large Language Models via Pictorial Code Contextualization. arXiv:2504.01444.
- Ghosal, D. et al. (2025). Immune: Improving Safety Against Jailbreaks in Multi-modal LLMs via Inference-Time Filtering. CVPR 2025. PDF.
- Yan, Q. et al. (2025). Hidden in Plain Sight: Probing Implicit Reasoning in Multimodal Language Models. arXiv:2506.00258.
- Liu, Y. et al. (2025). RePD: Defending Jailbreak Attack through a Retrieval-Based Detector. Findings of NAACL 2025. ACL Anthology.
Mga Tala
- ↑ 1.0 1.1 «A brief history of jailbreaking». Lil'Log. [1]
- ↑ 2.0 2.1 Yi, J., et al. «Jailbreak Attacks and Defenses Against Large Language Models: A Comprehensive Survey». arXiv:2405.09443. [2]
- ↑ «Jailbreaking LLMs». Prompting Guide. [3]
- ↑ «Exploring prompt injection attacks». NCC Group. [4]
- ↑ «Do Anything Now: Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models». arXiv:2308.03825. [5]
- ↑ «0xk1h0/ChatGPT_DAN». GitHub. [6]
- ↑ «ChatGPT "Time-travel" jailbreak lets you bypass its safety guards». BleepingComputer. [8]
- ↑ Chu, Z., et al. «JailbreakRadar: A Comprehensive Benchmark for Jailbreak Attack and Defense». arXiv:2402.12642. [9]
- ↑ Zou, A., et al. «Universal and Transferable Adversarial Attacks on Aligned Language Models». arXiv:2307.15043. [10]
- ↑ «Many-shot Jailbreaking». Anthropic. [11]
- ↑ «How we're using 'constitutional AI' to make our models safer». MIT Technology Review. [12]