Jailbreaks (LLM) (TH)
เจลเบรก (อังกฤษ: Jailbreak — แปลตรงตัวว่า \"การหลบหนีจากคุก\") ในบริบทของโมเดลภาษาขนาดใหญ่ (LLM) คือประเภทของการโจมตีแบบปฏิปักษ์ที่มีเป้าหมายเพื่อเลี่ยงกลไกความปลอดภัยและข้อจำกัดที่ฝังอยู่ภายในโมเดล เพื่อให้ได้รับคำตอบที่ต้องห้ามหรืออาจเป็นอันตราย[1] Jailbreak หมายถึง \"การชักนำโมเดลให้สร้างคำตอบที่เป็นอันตรายซึ่งขัดต่อนโยบายการใช้งานและบรรทัดฐานทางสังคม ผ่านการพัฒนา prompt แบบปฏิปักษ์\"[2]
ช่องโหว่พื้นฐานที่ถูกใช้ประโยชน์ในการโจมตีแบบ jailbreak อยู่ที่ลักษณะเฉพาะทางสถาปัตยกรรมของ LLM: โมเดลไม่สามารถแยกแยะระหว่างคำสั่งและข้อมูลตามประเภทได้ เนื่องจากทั้ง system prompt และข้อมูลนำเข้าจากผู้ใช้มีรูปแบบเดียวกัน นั่นคือสตริงข้อความในภาษาธรรมชาติ[3]
ประวัติความเป็นมาและพัฒนาการ
ช่วงเริ่มต้น: Prompt Injection (2022)
การค้นพบช่องโหว่ต่อ prompt injection ที่มีการบันทึกเป็นครั้งแรกเกิดขึ้นในเดือนพฤษภาคม 2022 เมื่อนักวิจัยจากบริษัท Preamble ค้นพบความเปราะบางของ ChatGPT ต่อการโจมตีดังกล่าว ในเดือนกันยายน 2022 Riley Goodside ได้เผยแพร่การสาธิตสาธารณะครั้งแรกของช่องโหว่ใน GPT-3 บน Twitter โดยอิสระ พร้อมตัวอย่างที่เป็นที่รู้จักซึ่งสั่งให้โมเดลเพิกเฉยต่อคำสั่งก่อนหน้า[4]
ยุค DAN (2022–2023)
ในช่วงกลางปี 2022 ปรากฏ prompt แรกในรูปแบบ "Do Anything Now" (DAN) ซึ่งเป็นคำสั่งสำหรับการแสดงบทบาทสมมติ นวัตกรรมสำคัญคือการใช้การเล่นตามบทบาทเพื่อเลี่ยงข้อจำกัดด้านความปลอดภัยโดยการสร้าง \"บุคลิกทางเลือก\" ที่ปราศจากกฎเกณฑ์[5] วิวัฒนาการของ DAN นำไปสู่การปรากฏของสถานการณ์ที่ซับซ้อนพร้อมระบบ token (กลไกการลงโทษ/รางวัล) และกลไกการรักษาบุคลิกตัวละคร[6]
การกระจายตัวของวิธีการ (2023–2024)
ตั้งแต่ปี 2023 เริ่มมีการวิจัยเชิงวิชาการอย่างครอบคลุมเกี่ยวกับการโจมตีแบบ jailbreak ในปี 2024 ปรากฏ การโจมตีแบบมัลติโมดัล ซึ่งรวมถึงการซ่อนคำสั่งที่เป็นอันตรายในรูปภาพ ไฟล์เสียง รวมถึง visual prompt injection ผ่าน ASCII-art[7]
ช่วงปัจจุบัน (2024–2025)
เทคนิคการโจมตียังคงมีความซับซ้อนเพิ่มขึ้นเรื่อยๆ ในเดือนพฤศจิกายน 2024 มีการค้นพบเทคนิค "Time Bandit" ที่ใช้ประโยชน์จากความสับสนด้านเวลาใน ChatGPT-4o โดยการตั้งคำถามราวกับว่ามาจากช่วงเวลาทางประวัติศาสตร์ (ช่วงปี ค.ศ. 1800–1900)[8]
วิธีการทางเทคนิคและการจำแนกประเภท
การโจมตีสามารถจำแนกตามระดับการเข้าถึงโมเดล:
- การโจมตีแบบกล่องดำ: โดยไม่มีการเข้าถึงส่วนประกอบภายในของโมเดล (พารามิเตอร์, ค่า gradient)
- การโจมตีแบบกล่องขาว: ด้วยการเข้าถึงพารามิเตอร์และค่า gradient ของโมเดลอย่างเต็มรูปแบบ[2]
อนุกรมวิธาน JailbreakRadar
การจำแนกประเภทแบบ JailbreakRadar (Chu et al., 2024) แบ่งหมวดหมู่การโจมตีหลักออกเป็นหกประเภท:
- การโจมตีโดยตรง: Prompt ที่เป็นอันตรายโดยตรง
- การโจมตีทางอ้อม: กลยุทธ์การจัดการแบบหลายขั้นตอน
- การโจมตีเชิงบริบท: การใช้ประวัติการสนทนา
- การโจมตีเชิงบทบาท: เทคนิคการแสดงเป็นตัวละคร (เช่น DAN)
- การโจมตีเชิงการเข้ารหัส: วิธีการ obfuscation เพื่อซ่อนคำสั่งที่เป็นอันตราย
- การโจมตีเชิงแม่แบบ: กรอบการทำงานแบบปฏิปักษ์ที่มีโครงสร้าง[9]
กลไกทางเทคนิค
- การสร้าง suffix แบบปฏิปักษ์ (GCG): วิธีการที่เสนอโดย Zou et al. (2023) ซึ่งสร้าง suffix แบบปฏิปักษ์ (ลำดับของ token) โดยอัตโนมัติ ซึ่งเมื่อเพิ่มเข้าไปใน prompt จะกระตุ้นให้เกิดคำตอบที่เป็นอันตรายด้วยความน่าจะเป็นสูง วิธีการนี้ใช้การปรับแต่งแบบ gradient และแสดงให้เห็นถึงอัตราความสำเร็จสูง (สูงถึง 84% บน GPT-4) และความสามารถในการถ่ายโอนระหว่างโมเดล[10]
- การเจลเบรกแบบหลายรอบ: การวิจัยของ Anthropic (2024) แสดงให้เห็นว่าประสิทธิภาพของการโจมตีเป็นไปตามกฎกำลัง: เมื่อจำนวนตัวอย่างที่เป็นอันตรายใน prompt เพิ่มขึ้น สัดส่วนของคำตอบที่ไม่พึงประสงค์ก็เพิ่มขึ้นตาม[11]
กลไกการป้องกัน
- ตัวจำแนกประเภทแบบรัฐธรรมนูญ (Anthropic): การกรองข้อมูลนำเข้า/ส่งออกโดยอิงหลักการรัฐธรรมนูญ วิธีการนี้ช่วยลดอัตราความสำเร็จของ jailbreak จาก 86% เหลือ 4.4% ในการประเมินที่ควบคุม[12]
- Reinforcement Learning from Human Feedback (RLHF): การฝึกสามขั้นตอน (OpenAI) ซึ่งรวมถึงการปรับแต่งแบบมีผู้ดูแล การฝึกโมเดลรางวัล และการปรับแต่งนโยบาย แสดงให้เห็นถึงการลดลงอย่างมีนัยสำคัญในการสร้างเนื้อหาที่เป็นพิษ
- การฝึกแบบปฏิปักษ์: การฝึกโมเดลบนตัวอย่างของการโจมตีแบบ jailbreak เพื่อเพิ่มความทนทาน ประสิทธิภาพของแนวทางนี้ในการลดอัตราความสำเร็จของการโจมตีประเมินไว้ที่ 60–80%[1]
- การป้องกันแบบหลายชั้น: กลยุทธ์ที่แนะนำซึ่งรวมถึงการตรวจสอบความถูกต้องของข้อมูลนำเข้า การป้องกันในระดับโมเดล การตรวจสอบข้อมูลส่งออก และการติดตามอย่างต่อเนื่องในเวลาจริง
การโจมตีแบบ jailbreak ต่อโมเดลภาษาขนาดใหญ่เป็นปัญหาความปลอดภัยของ AI เชิงพื้นฐาน ที่แสดงให้เห็นถึงความตึงเครียดอย่างต่อเนื่องระหว่างความสามารถและการปรับแนวทางของโมเดล ภูมิทัศน์ของการโจมตียิ่งซับซ้อนขึ้นเรื่อยๆ เปลี่ยนจาก prompt injection ง่ายๆ ไปสู่การโจมตีแบบมัลติโมดัลและแบบอัตโนมัติที่ซับซ้อน การวิจัยแสดงให้เห็นว่าไม่มีกลไกการป้องกันใดในปัจจุบันที่ทนทานต่อความพยายาม jailbreak ทุกรูปแบบอย่างสมบูรณ์ ความสำเร็จในด้านนี้ต้องอาศัยการลงทุนอย่างต่อเนื่องในการวิจัยด้านความปลอดภัย แนวปฏิบัติการเปิดเผยข้อมูลอย่างรับผิดชอบ และความพยายามร่วมกันของนักวิจัย ภาคอุตสาหกรรม และหน่วยงานกำกับดูแล
อ้างอิง
- Prompting Guide: Jailbreaking
- คลังข้อมูลการนำการโจมตี GCG ไปใช้งานบน GitHub
บรรณานุกรม
- Bai, Y. et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.
- Zou, A. et al. (2023). Universal and Transferable Adversarial Attacks on Aligned Language Models. arXiv:2307.15043.
- Shen, X. et al. (2023). "Do Anything Now": Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models. arXiv:2308.03825.
- Chao, P. et al. (2024). JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models. arXiv:2404.01318.
- Liao, Z.; Sun, H. (2024). AmpleGCG: Learning a Universal and Transferable Generative Model of Adversarial Suffixes for Jailbreaking Both Open and Closed LLMs. OpenReview UfqzXg95I5.
- Yi, S. et al. (2024). Jailbreak Attacks and Defenses Against Large Language Models: A Survey. arXiv:2407.04295.
- Chu, J. et al. (2025). JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs. arXiv:2402.05668.
- Liu, A. et al. (2025). PiCo: Jailbreaking Multimodal Large Language Models via Pictorial Code Contextualization. arXiv:2504.01444.
- Ghosal, D. et al. (2025). Immune: Improving Safety Against Jailbreaks in Multi-modal LLMs via Inference-Time Filtering. CVPR 2025. PDF.
- Yan, Q. et al. (2025). Hidden in Plain Sight: Probing Implicit Reasoning in Multimodal Language Models. arXiv:2506.00258.
- Liu, Y. et al. (2025). RePD: Defending Jailbreak Attack through a Retrieval-Based Detector. Findings of NAACL 2025. ACL Anthology.
หมายเหตุ
- ↑ 1.0 1.1 «A brief history of jailbreaking». Lil'Log. [1]
- ↑ 2.0 2.1 Yi, J., et al. «Jailbreak Attacks and Defenses Against Large Language Models: A Comprehensive Survey». arXiv:2405.09443. [2]
- ↑ «Jailbreaking LLMs». Prompting Guide. [3]
- ↑ «Exploring prompt injection attacks». NCC Group. [4]
- ↑ «Do Anything Now: Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models». arXiv:2308.03825. [5]
- ↑ «0xk1h0/ChatGPT_DAN». GitHub. [6]
- ↑ «ChatGPT "Time-travel" jailbreak lets you bypass its safety guards». BleepingComputer. [8]
- ↑ Chu, Z., et al. «JailbreakRadar: A Comprehensive Benchmark for Jailbreak Attack and Defense». arXiv:2402.12642. [9]
- ↑ Zou, A., et al. «Universal and Transferable Adversarial Attacks on Aligned Language Models». arXiv:2307.15043. [10]
- ↑ «Many-shot Jailbreaking». Anthropic. [11]
- ↑ «How we're using 'constitutional AI' to make our models safer». MIT Technology Review. [12]