Jailbreaks (LLM) (ES)
Jailbreak (del inglés Jailbreak, literalmente «fuga de la cárcel») en el contexto de los modelos de lenguaje grandes (LLM) es un tipo de ataque adversarial cuyo objetivo es eludir los mecanismos de seguridad y las restricciones integradas para obtener respuestas prohibidas o potencialmente maliciosas[1]. Un jailbreak consiste en «inducir al modelo a generar respuestas maliciosas que contradicen las políticas de uso y las normas sociales, mediante el diseño de prompts adversariales»[2].
La vulnerabilidad fundamental explotada en los ataques de jailbreak reside en una característica arquitectónica de los LLM: los modelos no pueden distinguir entre instrucciones y datos por su tipo, ya que tanto los prompts del sistema como la entrada del usuario tienen el mismo formato: cadenas de texto en lenguaje natural[3].
Historia y desarrollo
Período temprano: Inyecciones de prompts (2022)
El primer descubrimiento documentado de la vulnerabilidad a las inyecciones de prompts ocurrió en mayo de 2022, cuando investigadores de la empresa Preamble descubrieron la susceptibilidad de ChatGPT a este tipo de ataques. En septiembre de 2022, Riley Goodside publicó de forma independiente la primera demostración pública de la vulnerabilidad de GPT-3 en Twitter con un conocido ejemplo en el que se le ordenaba al modelo ignorar las instrucciones previas[4].
La era de DAN (2022–2023)
A mediados de 2022, aparecieron los primeros prompts "Do Anything Now" (DAN), que consistían en instrucciones para un juego de rol. La innovación clave fue el uso del juego de rol para eludir las restricciones de seguridad mediante la creación de una «personalidad alternativa» libre de reglas[5]. La evolución de DAN llevó a la aparición de escenarios complejos con sistemas de tokens (mecanismos de castigo/recompensa) y mecanismos para mantener el personaje[6].
Diversificación de métodos (2023–2024)
A partir de 2023, comenzaron las investigaciones académicas exhaustivas sobre los ataques de jailbreak. En 2024, surgieron los ataques multimodales, que incluyen la ocultación de instrucciones maliciosas en imágenes, archivos de audio, así como inyecciones de prompts visuales a través de ASCII-art[7].
Período actual (2024–2025)
Las técnicas de ataque continúan volviéndose más complejas. En noviembre de 2024, se descubrió la técnica "Time Bandit", que explota la confusión temporal en ChatGPT-4o al formular preguntas como si provinieran de períodos históricos (décadas de 1800-1900)[8].
Métodos técnicos y clasificación
Los ataques se pueden clasificar según el acceso al modelo:
- Ataques de caja negra: Sin acceso a los componentes internos del modelo (parámetros, gradientes).
- Ataques de caja blanca: Con acceso completo a los parámetros y gradientes del modelo[2].
Taxonomía de JailbreakRadar
La clasificación de JailbreakRadar (Chu et al., 2024) distingue seis categorías principales de ataques:
- Ataques directos: Prompts maliciosos directos.
- Ataques indirectos: Estrategias de manipulación en varios pasos.
- Ataques contextuales: Uso del historial de la conversación.
- Ataques de rol: Técnicas de suplantación de personajes (por ejemplo, DAN).
- Ataques de codificación: Métodos de ofuscación para ocultar instrucciones maliciosas.
- Ataques basados en plantillas: Frameworks adversariales estructurados[9].
Mecanismos técnicos
- Generación de sufijos adversariales (GCG): Un método propuesto por Zou et al. (2023) que genera automáticamente sufijos adversariales (secuencias de tokens) que, al añadirse a un prompt, tienen una alta probabilidad de provocar una respuesta maliciosa. El método utiliza optimización basada en gradientes y demuestra una alta tasa de éxito (hasta un 84 % en GPT-4) y transferibilidad entre modelos[10].
- Jailbreaking de múltiples intentos (Many-shot jailbreaking): Una investigación de Anthropic (2024) demostró que la efectividad de los ataques sigue una ley de potencias: a medida que aumenta el número de ejemplos maliciosos en el prompt, también lo hace el porcentaje de respuestas no deseadas[11].
Mecanismos de defensa
- Clasificadores constitucionales (Anthropic): Filtrado de datos de entrada/salida basado en un conjunto de principios constitucionales. Este método ha permitido reducir la tasa de éxito de los jailbreaks del 86 % al 4.4 % en evaluaciones controladas[12].
- Aprendizaje por refuerzo con retroalimentación humana (RLHF): Un proceso de entrenamiento en tres etapas (OpenAI) que incluye ajuste fino supervisado, entrenamiento de un modelo de recompensa y optimización de la política, ha demostrado una reducción significativa en la generación de contenido tóxico.
- Entrenamiento adversarial: Entrenar al modelo con ejemplos de ataques de jailbreak para aumentar su resistencia. La eficacia de este enfoque para reducir el éxito de los ataques se estima entre el 60 % y el 80 %[1].
- Defensa multinivel: Una estrategia recomendada que incluye la validación de las entradas, la protección a nivel del modelo, el monitoreo de las salidas y la supervisión continua en tiempo real.
Los ataques de jailbreak a los modelos de lenguaje grandes representan un problema fundamental para la seguridad de la IA, demostrando una tensión constante entre las capacidades y el alineamiento de los modelos. El panorama de los ataques se vuelve cada vez más complejo, evolucionando desde simples inyecciones de prompts hasta ataques multimodales y automatizados sofisticados. Las investigaciones muestran que ningún mecanismo de defensa actual es completamente resistente a todos los intentos de jailbreak. El éxito en este campo requiere una inversión continua en investigación de seguridad, prácticas de divulgación responsable y esfuerzos colaborativos entre investigadores, la industria y los reguladores.
Enlaces externos
Bibliografía
- Bai, Y. et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.
- Zou, A. et al. (2023). Universal and Transferable Adversarial Attacks on Aligned Language Models. arXiv:2307.15043.
- Shen, X. et al. (2023). “Do Anything Now”: Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models. arXiv:2308.03825.
- Chao, P. et al. (2024). JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models. arXiv:2404.01318.
- Liao, Z.; Sun, H. (2024). AmpleGCG: Learning a Universal and Transferable Generative Model of Adversarial Suffixes for Jailbreaking Both Open and Closed LLMs. OpenReview UfqzXg95I5.
- Yi, S. et al. (2024). Jailbreak Attacks and Defenses Against Large Language Models: A Survey. arXiv:2407.04295.
- Chu, J. et al. (2025). JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs. arXiv:2402.05668.
- Liu, A. et al. (2025). PiCo: Jailbreaking Multimodal Large Language Models via Pictorial Code Contextualization. arXiv:2504.01444.
- Ghosal, D. et al. (2025). Immune: Improving Safety Against Jailbreaks in Multi-modal LLMs via Inference-Time Filtering. CVPR 2025. PDF.
- Yan, Q. et al. (2025). Hidden in Plain Sight: Probing Implicit Reasoning in Multimodal Language Models. arXiv:2506.00258.
- Liu, Y. et al. (2025). RePD: Defending Jailbreak Attack through a Retrieval-Based Detector. Findings of NAACL 2025. ACL Anthology.
Referencias
- ↑ 1.0 1.1 «A brief history of jailbreaking». Lil'Log. [1]
- ↑ 2.0 2.1 Yi, J., et al. «Jailbreak Attacks and Defenses Against Large Language Models: A Comprehensive Survey». arXiv:2405.09443. [2]
- ↑ «Jailbreaking LLMs». Prompting Guide. [3]
- ↑ «Exploring prompt injection attacks». NCC Group. [4]
- ↑ «Do Anything Now: Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models». arXiv:2308.03825. [5]
- ↑ «0xk1h0/ChatGPT_DAN». GitHub. [6]
- ↑ «ChatGPT "Time-travel" jailbreak lets you bypass its safety guards». BleepingComputer. [8]
- ↑ Chu, Z., et al. «JailbreakRadar: A Comprehensive Benchmark for Jailbreak Attack and Defense». arXiv:2402.12642. [9]
- ↑ Zou, A., et al. «Universal and Transferable Adversarial Attacks on Aligned Language Models». arXiv:2307.15043. [10]
- ↑ «Many-shot Jailbreaking». Anthropic. [11]
- ↑ «How we're using 'constitutional AI' to make our models safer». MIT Technology Review. [12]