---
title: "Jailbreaks (LLM) (DE)"
source: "https://systems-analysis.info/int/Jailbreaks_(LLM)_(DE)"
wiki: "systems-analysis.info/int"
article: "Jailbreaks_(LLM)_(DE)"
language: "de"
categories:
  - "Category:German"
  - "Category:Large language models"
  - "Category:Machine learning"
revision_id: 3291
wiki_created_at: 2026-09-06T23:18:30Z
wiki_modified_at: 2026-09-06T23:18:30Z
downloaded_at: 2026-09-07T22:56:10Z
---

# Jailbreaks (LLM) (DE)

**Jailbreak** (englisch für „Ausbruch aus dem Gefängnis“) ist im Kontext von [großen Sprachmodellen](https://systems-analysis.info/int/Gro%C3%9Fe_Sprachmodelle "Große Sprachmodelle") (LLM) eine Art von adversarialem Angriff, dessen Ziel es ist, die integrierten Sicherheitsmechanismen und Einschränkungen zu umgehen, um verbotene oder potenziell schädliche Antworten zu erhalten<sup>[\[1\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(DE)#cite_note-lillog_intro-1)</sup>. Ein Jailbreak ist das „Verleiten eines Modells zur Generierung schädlicher Antworten, die den Nutzungsrichtlinien und gesellschaftlichen Normen widersprechen, durch die Entwicklung adversarieller Prompts“<sup>[\[2\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(DE)#cite_note-yi_2024_survey-2)</sup>.

Die grundlegende Schwachstelle, die bei Jailbreak-Angriffen ausgenutzt wird, liegt in einer architektonischen Besonderheit von LLMs: Die Modelle können nicht zwischen Anweisungen und Daten nach ihrem Typ unterscheiden, da sowohl System-Prompts als auch Benutzereingaben das gleiche Format haben – Textzeichenfolgen in natürlicher Sprache<sup>[\[3\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(DE)#cite_note-prompting_guide_vuln-3)</sup>.

## Entstehungs- und Entwicklungsgeschichte

### Frühphase: Prompt-Injections (2022)

Die erste dokumentierte Entdeckung der Anfälligkeit für Prompt-Injections erfolgte im Mai 2022, als Forscher des Unternehmens **Preamble** die Anfälligkeit von ChatGPT für solche Angriffe feststellten. Im September 2022 veröffentlichte **Riley Goodside** unabhängig davon die erste öffentliche Demonstration der Schwachstelle von GPT-3 auf Twitter mit dem bekannten Beispiel, bei dem dem Modell befohlen wurde, vorherige Anweisungen zu ignorieren<sup>[\[4\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(DE)#cite_note-ncc_group_history-4)</sup>.

### Die DAN-Ära (2022–2023)

Mitte 2022 erschienen die ersten **„Do Anything Now“** (**DAN**)-Prompts, die Anweisungen für ein Rollenspiel darstellten. Die entscheidende Innovation war die Nutzung des Rollenspiels, um Sicherheitsbeschränkungen durch die Schaffung einer von Regeln befreiten „alternativen Persönlichkeit“ zu umgehen<sup>[\[5\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(DE)#cite_note-dan_evolution_arxiv-5)</sup>. Die Entwicklung von DAN führte zur Entstehung komplexer Szenarien mit Token-Systemen (Bestrafungs-/Belohnungsmechanismen) und Mechanismen zur Aufrechterhaltung der Persona<sup>[\[6\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(DE)#cite_note-dan_github-6)</sup>.

### Diversifizierung der Methoden (2023–2024)

Ab 2023 begannen umfassende akademische Forschungen zu Jailbreak-Angriffen. Im Jahr 2024 traten **multimodale Angriffe** auf, die das Verstecken schädlicher Anweisungen in Bildern, Audiodateien sowie visuelle Prompt-Injections mittels ASCII-Art umfassten<sup>[\[7\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(DE)#cite_note-hiddenlayer_multimodal-7)</sup>.

### Aktuelle Periode (2024–2025)

Die Angriffstechniken werden immer komplexer. Im November 2024 wurde die Technik **„Time Bandit“** entdeckt, die eine zeitliche Verwirrung in ChatGPT-4o ausnutzt, indem Fragen so formuliert werden, als stammten sie aus historischen Perioden (1800er-1900er Jahre)<sup>[\[8\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(DE)#cite_note-bleeping_computer_time_bandit-8)</sup>.

## Technische Methoden und Klassifikation

Angriffe können nach dem Zugriff auf das Modell klassifiziert werden:

- **Black-Box-Angriffe**: Ohne Zugriff auf die internen Komponenten des Modells (Parameter, Gradienten).
- **White-Box-Angriffe**: Mit vollem Zugriff auf die Modellparameter und Gradienten<sup>[\[2\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(DE)#cite_note-yi_2024_survey-2)</sup>.

### Taxonomie von JailbreakRadar

Die Klassifikation von *JailbreakRadar* (Chu et al., 2024) unterscheidet sechs Hauptkategorien von Angriffen:

1.  **Direkte Angriffe:** Unmittelbare schädliche Prompts.
2.  **Indirekte Angriffe:** Mehrstufige Manipulationsstrategien.
3.  **Kontextbezogene Angriffe:** Nutzung des Gesprächsverlaufs.
4.  **Rollenspiel-Angriffe:** Techniken zur Nachahmung von Charakteren (z. B. DAN).
5.  **Kodierungsangriffe:** Obfuskationsmethoden zum Verbergen schädlicher Anweisungen.
6.  **Vorlagenbasierte Angriffe:** Strukturierte adversarielle Frameworks<sup>[\[9\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(DE)#cite_note-chu_2024_radar-9)</sup>.

### Technische Mechanismen

- **Generierung adversarieller Suffixe (GCG):** Eine von Zou et al. (2023) vorgeschlagene Methode, die automatisch adversarielle Suffixe (Token-Sequenzen) generiert, die bei Hinzufügung zu einem Prompt mit hoher Wahrscheinlichkeit eine schädliche Antwort hervorrufen. Die Methode verwendet Gradientenoptimierung und zeigt eine hohe Erfolgsrate (bis zu 84 % bei GPT-4) sowie Übertragbarkeit zwischen Modellen<sup>[\[10\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(DE)#cite_note-zou_2023_gcg-10)</sup>.
- **Many-Shot Jailbreaking:** Eine Untersuchung von Anthropic (2024) zeigte, dass die Effektivität von Angriffen einem Potenzgesetz folgt: Mit zunehmender Anzahl schädlicher Beispiele im Prompt steigt der Prozentsatz unerwünschter Antworten<sup>[\[11\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(DE)#cite_note-anthropic_many_shot-11)</sup>.

## Schutzmechanismen

- **[Konstitutionelle KI](https://systems-analysis.info/int/Constitutional_AI "Constitutional AI") (Anthropic):** Filterung von Eingabe- und Ausgabedaten auf der Grundlage eines Satzes konstitutioneller Prinzipien. Diese Methode ermöglichte es, die Erfolgsrate von Jailbreaks in kontrollierten Bewertungen von 86 % auf 4,4 % zu senken<sup>[\[12\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(DE)#cite_note-mit_tech_review_const_ai-12)</sup>.
- **Bestärkendes Lernen durch menschliches Feedback (RLHF):** Ein dreistufiger Trainingsprozess (OpenAI), der überwachtes Fine-Tuning, das Trainieren eines Belohnungsmodells und die Optimierung der Richtlinien umfasst, hat eine signifikante Reduzierung der Generierung toxischer Inhalte gezeigt.
- **Adversariales Training:** Das Trainieren des Modells an Beispielen von Jailbreak-Angriffen, um seine Widerstandsfähigkeit zu erhöhen. Die Wirksamkeit dieses Ansatzes bei der Reduzierung der Erfolgsrate von Angriffen wird auf 60–80 % geschätzt<sup>[\[1\]](https://systems-analysis.info/int/Jailbreaks_(LLM)_(DE)#cite_note-lillog_intro-1)</sup>.
- **Mehrstufiger Schutz:** Eine empfohlene Strategie, die die Validierung von Eingabedaten, Schutz auf Modellebene, Überwachung der Ausgabedaten und kontinuierliches Echtzeit-Monitoring umfasst.

Jailbreak-Angriffe auf große Sprachmodelle stellen ein fundamentales Problem der KI-Sicherheit dar und demonstrieren die ständige Spannung zwischen den Fähigkeiten und dem Alignment der Modelle. Die Angriffslandschaft wird ständig komplexer und entwickelt sich von einfachen Prompt-Injections zu komplizierten multimodalen und automatisierten Angriffen. Forschungen zeigen, dass kein aktueller Schutzmechanismus vollständig gegen alle Jailbreak-Versuche resistent ist. Erfolg in diesem Bereich erfordert kontinuierliche Investitionen in die Sicherheitsforschung, Praktiken der verantwortungsvollen Offenlegung (Responsible Disclosure) und gemeinsame Anstrengungen von Forschern, Industrie und Regulierungsbehörden.

## Weblinks

- <a href="https://www.promptingguide.ai/risks/jailbreaking" class="external text" rel="nofollow">Prompting Guide: Jailbreaking</a>
- <a href="https://github.com/llm-attacks/llm-attacks" class="external text" rel="nofollow">Repository mit der Implementierung des GCG-Angriffs auf GitHub</a>

## Literatur

- Bai, Y. et al. (2022). *Constitutional AI: Harmlessness from AI Feedback*. <a href="https://arxiv.org/abs/2212.08073" class="external text" rel="nofollow">arXiv:2212.08073</a>.
- Zou, A. et al. (2023). *Universal and Transferable Adversarial Attacks on Aligned Language Models*. <a href="https://arxiv.org/abs/2307.15043" class="external text" rel="nofollow">arXiv:2307.15043</a>.
- Shen, X. et al. (2023). *“Do Anything Now”: Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models*. <a href="https://arxiv.org/abs/2308.03825" class="external text" rel="nofollow">arXiv:2308.03825</a>.
- Chao, P. et al. (2024). *JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models*. <a href="https://arxiv.org/abs/2404.01318" class="external text" rel="nofollow">arXiv:2404.01318</a>.
- Liao, Z.; Sun, H. (2024). *AmpleGCG: Learning a Universal and Transferable Generative Model of Adversarial Suffixes for Jailbreaking Both Open and Closed LLMs*. <a href="https://openreview.net/forum?id=UfqzXg95I5" class="external text" rel="nofollow">OpenReview UfqzXg95I5</a>.
- Yi, S. et al. (2024). *Jailbreak Attacks and Defenses Against Large Language Models: A Survey*. <a href="https://arxiv.org/abs/2407.04295" class="external text" rel="nofollow">arXiv:2407.04295</a>.
- Chu, J. et al. (2025). *JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs*. <a href="https://arxiv.org/abs/2402.05668" class="external text" rel="nofollow">arXiv:2402.05668</a>.
- Liu, A. et al. (2025). *PiCo: Jailbreaking Multimodal Large Language Models via Pictorial Code Contextualization*. <a href="https://arxiv.org/abs/2504.01444" class="external text" rel="nofollow">arXiv:2504.01444</a>.
- Ghosal, D. et al. (2025). *Immune: Improving Safety Against Jailbreaks in Multi-modal LLMs via Inference-Time Filtering*. *CVPR 2025*. <a href="https://openaccess.thecvf.com/content/CVPR2025/papers/Ghosal_Immune_Improving_Safety_Against_Jailbreaks_in_Multi-modal_LLMs_via_Inference-Time_CVPR_2025_paper.pdf" class="external text" rel="nofollow">PDF</a>.
- Yan, Q. et al. (2025). *Hidden in Plain Sight: Probing Implicit Reasoning in Multimodal Language Models*. <a href="https://arxiv.org/abs/2506.00258" class="external text" rel="nofollow">arXiv:2506.00258</a>.
- Liu, Y. et al. (2025). *RePD: Defending Jailbreak Attack through a Retrieval-Based Detector*. *Findings of NAACL 2025*. <a href="https://aclanthology.org/2025.findings-naacl.16.pdf" class="external text" rel="nofollow">ACL Anthology</a>.

## Einzelnachweise

1.  <span id="cite_note-lillog_intro-1">↑ <sup>[1.0](https://systems-analysis.info/int/Jailbreaks_(LLM)_(DE)#cite_ref-lillog_intro_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Jailbreaks_(LLM)_(DE)#cite_ref-lillog_intro_1-1)</sup> „A brief history of jailbreaking“. *Lil'Log*. <a href="https://lilianweng.github.io/posts/2023-03-15-prompt-engineering/" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-yi_2024_survey-2">↑ <sup>[2.0](https://systems-analysis.info/int/Jailbreaks_(LLM)_(DE)#cite_ref-yi_2024_survey_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/Jailbreaks_(LLM)_(DE)#cite_ref-yi_2024_survey_2-1)</sup> Yi, J., et al. „Jailbreak Attacks and Defenses Against Large Language Models: A Comprehensive Survey“. *arXiv:2405.09443*. <a href="https://arxiv.org/abs/2405.09443" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-prompting_guide_vuln-3">[↑](https://systems-analysis.info/int/Jailbreaks_(LLM)_(DE)#cite_ref-prompting_guide_vuln_3-0) „Jailbreaking LLMs“. *Prompting Guide*. <a href="https://www.promptingguide.ai/risks/jailbreaking" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-ncc_group_history-4">[↑](https://systems-analysis.info/int/Jailbreaks_(LLM)_(DE)#cite_ref-ncc_group_history_4-0) „Exploring prompt injection attacks“. *NCC Group*. <a href="https://research.nccgroup.com/2022/12/05/exploring-prompt-injection-attacks/" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-dan_evolution_arxiv-5">[↑](https://systems-analysis.info/int/Jailbreaks_(LLM)_(DE)#cite_ref-dan_evolution_arxiv_5-0) „Do Anything Now: Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models“. *arXiv:2308.03825*. <a href="https://arxiv.org/abs/2308.03825" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-dan_github-6">[↑](https://systems-analysis.info/int/Jailbreaks_(LLM)_(DE)#cite_ref-dan_github_6-0) „0xk1h0/ChatGPT_DAN“. *GitHub*. <a href="https://github.com/0xk1h0/ChatGPT_DAN" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-hiddenlayer_multimodal-7">[↑](https://systems-analysis.info/int/Jailbreaks_(LLM)_(DE)#cite_ref-hiddenlayer_multimodal_7-0) „Hiding in Plain Sight: Multimodal Jailbreaking of Large Language Models“. *HiddenLayer*. <a href="https://hiddenlayer.com/research/multimodal-jailbreaking-of-large-language-models/" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-bleeping_computer_time_bandit-8">[↑](https://systems-analysis.info/int/Jailbreaks_(LLM)_(DE)#cite_ref-bleeping_computer_time_bandit_8-0) „ChatGPT "Time-travel" jailbreak lets you bypass its safety guards“. *BleepingComputer*. <a href="https://www.bleepingcomputer.com/news/security/chatgpt-time-travel-jailbreak-lets-you-bypass-its-safety-guards/" class="external autonumber" rel="nofollow">[8]</a></span>
9.  <span id="cite_note-chu_2024_radar-9">[↑](https://systems-analysis.info/int/Jailbreaks_(LLM)_(DE)#cite_ref-chu_2024_radar_9-0) Chu, Z., et al. „JailbreakRadar: A Comprehensive Benchmark for Jailbreak Attack and Defense“. *arXiv:2402.12642*. <a href="https://arxiv.org/abs/2402.12642" class="external autonumber" rel="nofollow">[9]</a></span>
10. <span id="cite_note-zou_2023_gcg-10">[↑](https://systems-analysis.info/int/Jailbreaks_(LLM)_(DE)#cite_ref-zou_2023_gcg_10-0) Zou, A., et al. „Universal and Transferable Adversarial Attacks on Aligned Language Models“. *arXiv:2307.15043*. <a href="https://arxiv.org/abs/2307.15043" class="external autonumber" rel="nofollow">[10]</a></span>
11. <span id="cite_note-anthropic_many_shot-11">[↑](https://systems-analysis.info/int/Jailbreaks_(LLM)_(DE)#cite_ref-anthropic_many_shot_11-0) „Many-shot Jailbreaking“. *Anthropic*. <a href="https://www.anthropic.com/research/many-shot-jailbreaking" class="external autonumber" rel="nofollow">[11]</a></span>
12. <span id="cite_note-mit_tech_review_const_ai-12">[↑](https://systems-analysis.info/int/Jailbreaks_(LLM)_(DE)#cite_ref-mit_tech_review_const_ai_12-0) „How we're using 'constitutional AI' to make our models safer“. *MIT Technology Review*. <a href="https://www.technologyreview.com/2023/05/09/1072782/how-were-using-constitutional-ai-to-make-our-models-safer/" class="external autonumber" rel="nofollow">[12]</a></span>
