Jailbreaks (LLM) (VI)
Jailbreak (tiếng Anh: Jailbreak — nghĩa đen là «vượt ngục») trong bối cảnh các mô hình ngôn ngữ lớn (LLM) là một loại tấn công đối kháng nhằm mục đích vượt qua các cơ chế an toàn và hạn chế tích hợp để thu được các phản hồi bị cấm hoặc có khả năng gây hại[1]. Jailbreak được định nghĩa là «việc kích thích mô hình tạo ra các phản hồi độc hại, vi phạm chính sách sử dụng và chuẩn mực xã hội, thông qua việc xây dựng các prompt đối kháng»[2].
Lỗ hổng cơ bản bị khai thác trong các cuộc tấn công jailbreak nằm ở đặc điểm kiến trúc của LLM: các mô hình không thể phân biệt lệnh và dữ liệu theo loại của chúng, vì cả prompt hệ thống lẫn đầu vào của người dùng đều có cùng định dạng — các chuỗi văn bản ngôn ngữ tự nhiên[3].
Lịch sử hình thành và phát triển
Giai đoạn đầu: Prompt injection (2022)
Lần đầu tiên ghi nhận phát hiện lỗ hổng prompt injection là vào tháng 5 năm 2022, khi các nhà nghiên cứu từ công ty Preamble phát hiện ra khả năng bị tấn công của ChatGPT. Vào tháng 9 năm 2022, Riley Goodside đã độc lập công bố bản trình diễn công khai đầu tiên về lỗ hổng GPT-3 trên Twitter với ví dụ nổi tiếng, trong đó mô hình được lệnh bỏ qua các hướng dẫn trước đó[4].
Thời đại DAN (2022–2023)
Vào giữa năm 2022, các prompt "Do Anything Now" (DAN) đầu tiên xuất hiện, đại diện cho các hướng dẫn nhập vai. Đổi mới then chốt là việc sử dụng nhập vai để vượt qua các hạn chế an toàn bằng cách tạo ra một «nhân cách thay thế» không bị ràng buộc bởi các quy tắc[5]. Sự phát triển của DAN đã dẫn đến sự xuất hiện của các kịch bản phức tạp với hệ thống token (cơ chế phạt/thưởng) và các cơ chế duy trì nhân vật[6].
Đa dạng hóa phương pháp (2023–2024)
Từ năm 2023, các nghiên cứu học thuật toàn diện về tấn công jailbreak bắt đầu được triển khai. Năm 2024, xuất hiện các tấn công đa phương thức, bao gồm việc ẩn các hướng dẫn độc hại trong hình ảnh, tệp âm thanh, cũng như các prompt injection trực quan qua ASCII-art[7].
Giai đoạn hiện đại (2024–2025)
Các kỹ thuật tấn công tiếp tục trở nên phức tạp hơn. Vào tháng 11 năm 2024, kỹ thuật "Time Bandit" được phát hiện, khai thác sự nhầm lẫn về thời gian trong ChatGPT-4o bằng cách đặt câu hỏi như thể từ các giai đoạn lịch sử (thế kỷ 1800–1900)[8].
Các phương pháp kỹ thuật và phân loại
Các cuộc tấn công có thể được phân loại theo mức độ truy cập vào mô hình:
- Tấn công hộp đen: Không có quyền truy cập vào các thành phần nội bộ của mô hình (tham số, gradient).
- Tấn công hộp trắng: Có toàn quyền truy cập vào tham số mô hình và gradient[2].
Phân loại JailbreakRadar
Phân loại JailbreakRadar (Chu et al., 2024) xác định sáu danh mục tấn công chính:
- Tấn công trực tiếp: Các prompt độc hại trực tiếp.
- Tấn công gián tiếp: Các chiến lược thao túng nhiều bước.
- Tấn công ngữ cảnh: Sử dụng lịch sử hội thoại.
- Tấn công nhập vai: Các kỹ thuật mạo danh nhân vật (ví dụ: DAN).
- Tấn công mã hóa: Các phương pháp obfuscation để ẩn các hướng dẫn độc hại.
- Tấn công mẫu: Các framework đối kháng có cấu trúc[9].
Cơ chế kỹ thuật
- Sinh hậu tố đối kháng (GCG): Phương pháp do Zou et al. (2023) đề xuất, tự động tạo ra các hậu tố đối kháng (chuỗi token) mà khi thêm vào prompt sẽ có xác suất cao kích hoạt phản hồi độc hại. Phương pháp sử dụng tối ưu hóa gradient và cho thấy tỷ lệ thành công cao (lên đến 84% trên GPT-4) cùng khả năng chuyển giao giữa các mô hình[10].
- Jailbreak nhiều lượt: Nghiên cứu của Anthropic (2024) cho thấy hiệu quả tấn công tuân theo luật lũy thừa: khi số lượng ví dụ độc hại trong prompt tăng lên, tỷ lệ phản hồi không mong muốn cũng tăng theo[11].
Các cơ chế bảo vệ
- Bộ phân loại hiến pháp (Anthropic): Lọc dữ liệu đầu vào/đầu ra dựa trên tập hợp các nguyên tắc hiến pháp. Phương pháp này giúp giảm tỷ lệ thành công của jailbreak từ 86% xuống còn 4,4% trong các đánh giá có kiểm soát[12].
- Học tăng cường từ phản hồi của con người (RLHF): Quy trình huấn luyện ba giai đoạn (OpenAI), bao gồm tinh chỉnh có giám sát, huấn luyện mô hình phần thưởng và tối ưu hóa chính sách, cho thấy sự giảm đáng kể trong việc tạo nội dung độc hại.
- Huấn luyện đối kháng: Huấn luyện mô hình trên các ví dụ tấn công jailbreak để nâng cao khả năng chống chịu. Hiệu quả của phương pháp này trong việc giảm tỷ lệ thành công của tấn công được đánh giá là 60–80%[1].
- Bảo vệ đa lớp: Chiến lược được khuyến nghị, bao gồm xác thực dữ liệu đầu vào, bảo vệ ở cấp độ mô hình, giám sát dữ liệu đầu ra và giám sát liên tục theo thời gian thực.
Các cuộc tấn công jailbreak vào các mô hình ngôn ngữ lớn đặt ra vấn đề bảo mật AI cơ bản, cho thấy sự căng thẳng thường trực giữa khả năng và sự căn chỉnh của các mô hình. Bối cảnh tấn công ngày càng phức tạp, chuyển từ các prompt injection đơn giản sang các cuộc tấn công đa phương thức và tự động hóa tinh vi. Các nghiên cứu cho thấy không có cơ chế bảo vệ hiện tại nào hoàn toàn có khả năng chống lại mọi nỗ lực jailbreak. Thành công trong lĩnh vực này đòi hỏi đầu tư liên tục vào nghiên cứu bảo mật, các thực hành công bố có trách nhiệm và nỗ lực phối hợp giữa các nhà nghiên cứu, ngành công nghiệp và cơ quan quản lý.
Liên kết
- Prompting Guide: Jailbreaking
- Kho lưu trữ triển khai tấn công GCG trên GitHub
Tài liệu tham khảo
- Bai, Y. et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.
- Zou, A. et al. (2023). Universal and Transferable Adversarial Attacks on Aligned Language Models. arXiv:2307.15043.
- Shen, X. et al. (2023). "Do Anything Now": Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models. arXiv:2308.03825.
- Chao, P. et al. (2024). JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models. arXiv:2404.01318.
- Liao, Z.; Sun, H. (2024). AmpleGCG: Learning a Universal and Transferable Generative Model of Adversarial Suffixes for Jailbreaking Both Open and Closed LLMs. OpenReview UfqzXg95I5.
- Yi, S. et al. (2024). Jailbreak Attacks and Defenses Against Large Language Models: A Survey. arXiv:2407.04295.
- Chu, J. et al. (2025). JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs. arXiv:2402.05668.
- Liu, A. et al. (2025). PiCo: Jailbreaking Multimodal Large Language Models via Pictorial Code Contextualization. arXiv:2504.01444.
- Ghosal, D. et al. (2025). Immune: Improving Safety Against Jailbreaks in Multi-modal LLMs via Inference-Time Filtering. CVPR 2025. PDF.
- Yan, Q. et al. (2025). Hidden in Plain Sight: Probing Implicit Reasoning in Multimodal Language Models. arXiv:2506.00258.
- Liu, Y. et al. (2025). RePD: Defending Jailbreak Attack through a Retrieval-Based Detector. Findings of NAACL 2025. ACL Anthology.
Ghi chú
- ↑ 1.0 1.1 «A brief history of jailbreaking». Lil'Log. [1]
- ↑ 2.0 2.1 Yi, J., et al. «Jailbreak Attacks and Defenses Against Large Language Models: A Comprehensive Survey». arXiv:2405.09443. [2]
- ↑ «Jailbreaking LLMs». Prompting Guide. [3]
- ↑ «Exploring prompt injection attacks». NCC Group. [4]
- ↑ «Do Anything Now: Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models». arXiv:2308.03825. [5]
- ↑ «0xk1h0/ChatGPT_DAN». GitHub. [6]
- ↑ «ChatGPT "Time-travel" jailbreak lets you bypass its safety guards». BleepingComputer. [8]
- ↑ Chu, Z., et al. «JailbreakRadar: A Comprehensive Benchmark for Jailbreak Attack and Defense». arXiv:2402.12642. [9]
- ↑ Zou, A., et al. «Universal and Transferable Adversarial Attacks on Aligned Language Models». arXiv:2307.15043. [10]
- ↑ «Many-shot Jailbreaking». Anthropic. [11]
- ↑ «How we're using 'constitutional AI' to make our models safer». MIT Technology Review. [12]