Jailbreaks (LLM) (TR)

From Systems analysis Wiki
Jump to navigation Jump to search

Jailbreak (İng. Jailbreak — kelime anlamıyla «hapishaneden kaçış»), büyük dil modelleri (LLM) bağlamında, yerleşik güvenlik mekanizmalarını ve kısıtlamalarını atlatarak yasaklı veya potansiyel olarak zararlı yanıtlar elde etmeyi amaçlayan bir tür çekişmeli saldırıdır[1]. Jailbreak, «kullanım politikalarına ve toplumsal normlara aykırı zararlı yanıtların üretilmesinin, çekişmeli prompt'lar geliştirilerek modele dayatılması» olarak tanımlanmaktadır[2].

Jailbreak saldırılarında istismar edilen temel güvenlik açığı, LLM'lerin mimari bir özelliğinden kaynaklanmaktadır: modeller, sistem prompt'ları ve kullanıcı girdisi aynı biçime — doğal dil metin dizilerine — sahip olduğundan, talimatları ve verileri türlerine göre birbirinden ayırt edememektedir[3].

Ortaya Çıkış ve Gelişim Tarihi

Erken Dönem: Prompt Enjeksiyonları (2022)

Prompt enjeksiyonu güvenlik açığına ilişkin ilk belgelenmiş keşif, Mayıs 2022'de Preamble şirketinin araştırmacılarının ChatGPT'nin bu tür saldırılara karşı duyarlı olduğunu ortaya koymasıyla gerçekleşti. Eylül 2022'de Riley Goodside, GPT-3'teki güvenlik açığının ilk halka açık gösterimini Twitter'da bağımsız olarak yayımladı; bu gösterimde modele önceki talimatları görmezden gelmesi emredilen bilinen bir örnek yer alıyordu[4].

DAN Dönemi (2022–2023)

2022'nin ortasında, rol yapma talimatları niteliğindeki ilk "Do Anything Now" (DAN) prompt'ları ortaya çıktı. Temel yenilik, güvenlik kısıtlamalarını aşmak için rol yapma tekniğinin kullanılmasıydı; bu yöntemle kurallardan bağımsız bir «alternatif kimlik» oluşturuluyordu[5]. DAN'ın evrimi, token sistemleri (ceza/ödül mekanizmaları) ve karakter sürekliliği mekanizmaları içeren karmaşık senaryoların ortaya çıkmasına zemin hazırladı[6].

Yöntemlerin Çeşitlenmesi (2023–2024)

2023'ten itibaren jailbreak saldırılarına yönelik kapsamlı akademik araştırmalar başladı. 2024'te, zararlı talimatların görüntülere ve ses dosyalarına gizlenmesini, ayrıca ASCII-art aracılığıyla gerçekleştirilen görsel prompt enjeksiyonlarını kapsayan multimodal saldırılar gündeme geldi[7].

Günümüz Dönemi (2024–2025)

Saldırı teknikleri gelişmeye devam etmektedir. Kasım 2024'te, soruları tarihsel dönemlerden (1800'ler–1900'ler) soruluyormuş gibi kurgulamak suretiyle ChatGPT-4o'daki zamansal karışıklığı istismar eden "Time Bandit" tekniği keşfedildi[8].

Teknik Yöntemler ve Sınıflandırma

Saldırılar, modele erişim düzeyine göre sınıflandırılabilir:

  • Kara kutu saldırıları: Modelin iç bileşenlerine (parametreler, gradyanlar) erişim olmaksızın gerçekleştirilen saldırılar.
  • Beyaz kutu saldırıları: Model parametrelerine ve gradyanlara tam erişimle gerçekleştirilen saldırılar[2].

JailbreakRadar Taksonomisi

JailbreakRadar sınıflandırması (Chu et al., 2024) altı temel saldırı kategorisi tanımlamaktadır:

  1. Doğrudan saldırılar: Doğrudan zararlı prompt'lar.
  2. Dolaylı saldırılar: Çok adımlı manipülasyon stratejileri.
  3. Bağlamsal saldırılar: Konuşma geçmişinin kullanımı.
  4. Rol yapma saldırıları: Karakter taklidi teknikleri (örneğin, DAN).
  5. Kodlama saldırıları: Zararlı talimatları gizlemeye yönelik gizleme yöntemleri.
  6. Şablon saldırıları: Yapılandırılmış çekişmeli çerçeveler[9].

Teknik Mekanizmalar

  • Çekişmeli sonek üretimi (GCG): Zou et al. (2023) tarafından önerilen bu yöntem, bir prompt'a eklendiğinde yüksek olasılıkla zararlı yanıt üreten çekişmeli sonekleri (token dizileri) otomatik olarak üretmektedir. Yöntem, gradyan optimizasyonunu kullanmakta; yüksek başarı oranı (GPT-4'te %84'e kadar) ve modeller arasında taşınabilirlik sergilemektedir[10].
  • Çok turlu jailbreaking: Anthropic'in (2024) araştırması, saldırı etkinliğinin bir güç yasasını izlediğini ortaya koymuştur: prompt'taki zararlı örnek sayısı arttıkça istenmeyen yanıt oranı da yükselmektedir[11].

Savunma Mekanizmaları

  • Anayasal sınıflandırıcılar (Anthropic): Bir dizi anayasal ilkeye dayalı girdi/çıktı filtrelemesi. Bu yöntem, kontrollü değerlendirmelerde jailbreak başarı oranını %86'dan %4,4'e düşürmeyi başarmıştır[12].
  • İnsan geri bildiriminden pekiştirmeli öğrenme (RLHF): Denetimli ince ayar, ödül modeli eğitimi ve politika optimizasyonundan oluşan üç aşamalı eğitim (OpenAI), toksik içerik üretiminde kayda değer bir düşüş sağlamıştır.
  • Çekişmeli eğitim: Modelin jailbreak saldırı örnekleri üzerinde eğitilerek dayanıklılığının artırılması. Bu yaklaşımın saldırı başarı oranını düşürmedeki etkinliği %60–80 olarak değerlendirilmektedir[1].
  • Çok katmanlı savunma: Girdi doğrulama, model düzeyinde koruma, çıktı izleme ve gerçek zamanlı sürekli izlemeyi kapsayan önerilen strateji.

LLM'lere yönelik jailbreak saldırıları, yapay zeka güvenliğinin temel sorunlarından birini oluşturmakta; model yetenekleri ile model hizalaması arasındaki süregelen gerilimi gözler önüne sermektedir. Saldırı ortamı sürekli karmaşıklaşmakta, basit prompt enjeksiyonlarından gelişmiş multimodal ve otomatik saldırılara doğru evrilmektedir. Araştırmalar, mevcut hiçbir savunma mekanizmasının tüm jailbreak girişimlerine karşı tam anlamıyla dirençli olmadığını ortaya koymaktadır. Bu alanda başarı, güvenlik araştırmalarına sürekli yatırım yapılmasını, sorumlu ifşa uygulamalarını ve araştırmacılar, sektör ile düzenleyicilerin ortak çabalarını gerektirmektedir.

Literatür

  • Bai, Y. et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.
  • Zou, A. et al. (2023). Universal and Transferable Adversarial Attacks on Aligned Language Models. arXiv:2307.15043.
  • Shen, X. et al. (2023). "Do Anything Now": Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models. arXiv:2308.03825.
  • Chao, P. et al. (2024). JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models. arXiv:2404.01318.
  • Liao, Z.; Sun, H. (2024). AmpleGCG: Learning a Universal and Transferable Generative Model of Adversarial Suffixes for Jailbreaking Both Open and Closed LLMs. OpenReview UfqzXg95I5.
  • Yi, S. et al. (2024). Jailbreak Attacks and Defenses Against Large Language Models: A Survey. arXiv:2407.04295.
  • Chu, J. et al. (2025). JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs. arXiv:2402.05668.
  • Liu, A. et al. (2025). PiCo: Jailbreaking Multimodal Large Language Models via Pictorial Code Contextualization. arXiv:2504.01444.
  • Ghosal, D. et al. (2025). Immune: Improving Safety Against Jailbreaks in Multi-modal LLMs via Inference-Time Filtering. CVPR 2025. PDF.
  • Yan, Q. et al. (2025). Hidden in Plain Sight: Probing Implicit Reasoning in Multimodal Language Models. arXiv:2506.00258.
  • Liu, Y. et al. (2025). RePD: Defending Jailbreak Attack through a Retrieval-Based Detector. Findings of NAACL 2025. ACL Anthology.

Kaynakça

  • Prompting Guide: Jailbreaking
  • GitHub'da GCG saldırısı uygulamasını içeren depo

Notlar

  1. 1.0 1.1 «A brief history of jailbreaking». Lil'Log. [1]
  2. 2.0 2.1 Yi, J., et al. «Jailbreak Attacks and Defenses Against Large Language Models: A Comprehensive Survey». arXiv:2405.09443. [2]
  3. «Jailbreaking LLMs». Prompting Guide. [3]
  4. «Exploring prompt injection attacks». NCC Group. [4]
  5. «Do Anything Now: Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models». arXiv:2308.03825. [5]
  6. «0xk1h0/ChatGPT_DAN». GitHub. [6]
  7. «Hiding in Plain Sight: Multimodal Jailbreaking of Large Language Models». HiddenLayer. [7]
  8. «ChatGPT "Time-travel" jailbreak lets you bypass its safety guards». BleepingComputer. [8]
  9. Chu, Z., et al. «JailbreakRadar: A Comprehensive Benchmark for Jailbreak Attack and Defense». arXiv:2402.12642. [9]
  10. Zou, A., et al. «Universal and Transferable Adversarial Attacks on Aligned Language Models». arXiv:2307.15043. [10]
  11. «Many-shot Jailbreaking». Anthropic. [11]
  12. «How we're using 'constitutional AI' to make our models safer». MIT Technology Review. [12]