Jailbreaks (LLM) (EL)

From Systems analysis Wiki
Jump to navigation Jump to search

Jailbreak (αγγλ. Jailbreak — κυριολεκτικά «απόδραση από τη φυλακή») στο πλαίσιο των μεγάλων γλωσσικών μοντέλων (LLM) — είναι ένας τύπος επίθεσης αντιπαλότητας, σκοπός της οποίας είναι η παράκαμψη των ενσωματωμένων μηχανισμών ασφαλείας και των περιορισμών, για την απόκτηση απαγορευμένων ή δυνητικά επιβλαβών απαντήσεων[1]. Το Jailbreak αποτελεί «επαγωγή του μοντέλου στη δημιουργία επιβλαβών απαντήσεων που αντιβαίνουν στην πολιτική χρήσης και στους κοινωνικούς κανόνες, μέσω της ανάπτυξης adversarial prompt»[2].

Η θεμελιώδης ευπάθεια που εκμεταλλεύονται οι επιθέσεις jailbreak έγκειται σε ένα αρχιτεκτονικό χαρακτηριστικό των LLM: τα μοντέλα δεν μπορούν να διακρίνουν εντολές από δεδομένα βάσει τύπου, καθώς τόσο τα system prompt όσο και η είσοδος χρήστη έχουν την ίδια μορφή — συμβολοσειρές κειμένου σε φυσική γλώσσα[3].

Ιστορία εμφάνισης και ανάπτυξης

Πρώιμη περίοδος: Prompt Injections (2022)

Η πρώτη τεκμηριωμένη ανακάλυψη ευπάθειας σε prompt injection έγινε τον Μάιο του 2022, όταν ερευνητές από την εταιρεία Preamble ανακάλυψαν την ευαισθησία του ChatGPT σε τέτοιες επιθέσεις. Τον Σεπτέμβριο του 2022, ο Riley Goodside δημοσίευσε ανεξάρτητα την πρώτη δημόσια επίδειξη της ευπάθειας του GPT-3 στο Twitter, με το γνωστό παράδειγμα όπου το μοντέλο λάμβανε εντολή να αγνοήσει τις προηγούμενες οδηγίες[4].

Εποχή DAN (2022–2023)

Τα μέσα του 2022 εμφανίστηκαν τα πρώτα prompt "Do Anything Now" (DAN), τα οποία αποτελούσαν οδηγίες για παιχνίδι ρόλων. Η βασική καινοτομία ήταν η χρήση του παιχνιδιού ρόλων για την παράκαμψη των περιορισμών ασφαλείας μέσω της δημιουργίας μιας «εναλλακτικής προσωπικότητας», ελεύθερης από κανόνες[5]. Η εξέλιξη του DAN οδήγησε στην εμφάνιση σύνθετων σεναρίων με συστήματα token (μηχανισμοί τιμωρίας/ανταμοιβής) και μηχανισμούς διατήρησης χαρακτήρα[6].

Διαφοροποίηση μεθόδων (2023–2024)

Από το 2023 ξεκίνησαν ολοκληρωμένες ακαδημαϊκές έρευνες για τις επιθέσεις jailbreak. Το 2024 εμφανίστηκαν πολυτροπικές επιθέσεις (multimodal attacks), που περιλαμβάνουν απόκρυψη κακόβουλων οδηγιών σε εικόνες, αρχεία ήχου, καθώς και οπτικά prompt injection μέσω ASCII-art[7].

Σύγχρονη περίοδος (2024–2025)

Οι τεχνικές επίθεσης συνεχίζουν να γίνονται πιο σύνθετες. Τον Νοέμβριο του 2024 ανακαλύφθηκε η τεχνική "Time Bandit", η οποία εκμεταλλεύεται τη χρονική σύγχυση στο ChatGPT-4o, διατυπώνοντας ερωτήματα ως εάν προέρχονται από ιστορικές περιόδους (δεκαετίες 1800–1900)[8].

Τεχνικές μέθοδοι και ταξινόμηση

Οι επιθέσεις μπορούν να ταξινομηθούν ανάλογα με την πρόσβαση στο μοντέλο:

  • Επιθέσεις μαύρου κουτιού: Χωρίς πρόσβαση στα εσωτερικά στοιχεία του μοντέλου (παράμετροι, κλίσεις).
  • Επιθέσεις λευκού κουτιού: Με πλήρη πρόσβαση στις παραμέτρους του μοντέλου και τις κλίσεις[2].

Ταξινομία JailbreakRadar

Η ταξινόμηση JailbreakRadar (Chu et al., 2024) διακρίνει έξι βασικές κατηγορίες επιθέσεων:

  1. Άμεσες επιθέσεις: Απευθείας κακόβουλα prompt.
  2. Έμμεσες επιθέσεις: Στρατηγικές χειραγώγησης πολλαπλών βημάτων.
  3. Επιθέσεις πλαισίου: Χρήση του ιστορικού συνομιλίας.
  4. Επιθέσεις ρόλων: Τεχνικές πλαστοπροσωπίας χαρακτήρων (π.χ. DAN).
  5. Επιθέσεις κωδικοποίησης: Μέθοδοι obfuscation για απόκρυψη κακόβουλων οδηγιών.
  6. Επιθέσεις προτύπων: Δομημένα adversarial framework[9].

Τεχνικοί μηχανισμοί

  • Δημιουργία adversarial suffix (GCG): Η μέθοδος που πρότειναν οι Zou et al. (2023) δημιουργεί αυτόματα adversarial suffix (ακολουθίες token), οι οποίες όταν προστεθούν σε ένα prompt προκαλούν με υψηλή πιθανότητα κακόβουλη απάντηση. Η μέθοδος χρησιμοποιεί βελτιστοποίηση κλίσης και επιδεικνύει υψηλή επιτυχία (έως 84% στο GPT-4) και μεταφερσιμότητα μεταξύ μοντέλων[10].
  • Jailbreaking πολλαπλών γύρων: Η έρευνα της Anthropic (2024) έδειξε ότι η αποτελεσματικότητα των επιθέσεων ακολουθεί νόμο δύναμης: καθώς αυξάνεται ο αριθμός κακόβουλων παραδειγμάτων στο prompt, αυξάνεται το ποσοστό ανεπιθύμητων απαντήσεων[11].

Μηχανισμοί προστασίας

  • Συνταγματικοί ταξινομητές (Anthropic): Φιλτράρισμα εισόδου/εξόδου βάσει ενός συνόλου συνταγματικών αρχών. Αυτή η μέθοδος επέτρεψε τη μείωση της επιτυχίας των jailbreak από 86% σε 4,4% σε ελεγχόμενες αξιολογήσεις[12].
  • Εκπαίδευση με ενίσχυση από ανθρώπινη ανατροφοδότηση (RLHF): Τριεταπική εκπαίδευση (OpenAI), που περιλαμβάνει εποπτευόμενη ρύθμιση, εκπαίδευση μοντέλου ανταμοιβής και βελτιστοποίηση πολιτικής, επέδειξε σημαντική μείωση στη δημιουργία τοξικού περιεχομένου.
  • Adversarial training: Εκπαίδευση του μοντέλου σε παραδείγματα επιθέσεων jailbreak για την ενίσχυση της ανθεκτικότητάς του. Η αποτελεσματικότητα αυτής της προσέγγισης στη μείωση της επιτυχίας επιθέσεων εκτιμάται σε 60–80%[1].
  • Πολυεπίπεδη προστασία: Συνιστώμενη στρατηγική που περιλαμβάνει επικύρωση εισόδου, προστασία σε επίπεδο μοντέλου, παρακολούθηση εξόδου και συνεχή παρακολούθηση σε πραγματικό χρόνο.

Οι επιθέσεις jailbreak στα μεγάλα γλωσσικά μοντέλα αντιπροσωπεύουν ένα θεμελιώδες πρόβλημα ασφάλειας ΑΙ, αναδεικνύοντας τη συνεχή ένταση μεταξύ δυνατοτήτων και ευθυγράμμισης μοντέλων. Το τοπίο των επιθέσεων συνεχώς περιπλέκεται, μεταβαίνοντας από απλά prompt injection σε σύνθετες πολυτροπικές και αυτοματοποιημένες επιθέσεις. Οι έρευνες δείχνουν ότι κανένας τρέχων αμυντικός μηχανισμός δεν είναι πλήρως ανθεκτικός σε όλες τις απόπειρες jailbreak. Η επιτυχία σε αυτόν τον τομέα απαιτεί συνεχείς επενδύσεις σε έρευνα ασφαλείας, πρακτικές υπεύθυνης αποκάλυψης και συντονισμένες προσπάθειες ερευνητών, βιομηχανίας και ρυθμιστικών αρχών.

Αναφορές

  • Prompting Guide: Jailbreaking
  • Αποθετήριο με υλοποίηση της επίθεσης GCG στο GitHub

Βιβλιογραφία

  • Bai, Y. et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.
  • Zou, A. et al. (2023). Universal and Transferable Adversarial Attacks on Aligned Language Models. arXiv:2307.15043.
  • Shen, X. et al. (2023). "Do Anything Now": Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models. arXiv:2308.03825.
  • Chao, P. et al. (2024). JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models. arXiv:2404.01318.
  • Liao, Z.; Sun, H. (2024). AmpleGCG: Learning a Universal and Transferable Generative Model of Adversarial Suffixes for Jailbreaking Both Open and Closed LLMs. OpenReview UfqzXg95I5.
  • Yi, S. et al. (2024). Jailbreak Attacks and Defenses Against Large Language Models: A Survey. arXiv:2407.04295.
  • Chu, J. et al. (2025). JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs. arXiv:2402.05668.
  • Liu, A. et al. (2025). PiCo: Jailbreaking Multimodal Large Language Models via Pictorial Code Contextualization. arXiv:2504.01444.
  • Ghosal, D. et al. (2025). Immune: Improving Safety Against Jailbreaks in Multi-modal LLMs via Inference-Time Filtering. CVPR 2025. PDF.
  • Yan, Q. et al. (2025). Hidden in Plain Sight: Probing Implicit Reasoning in Multimodal Language Models. arXiv:2506.00258.
  • Liu, Y. et al. (2025). RePD: Defending Jailbreak Attack through a Retrieval-Based Detector. Findings of NAACL 2025. ACL Anthology.

Σημειώσεις

  1. 1.0 1.1 «A brief history of jailbreaking». Lil'Log. [1]
  2. 2.0 2.1 Yi, J., et al. «Jailbreak Attacks and Defenses Against Large Language Models: A Comprehensive Survey». arXiv:2405.09443. [2]
  3. «Jailbreaking LLMs». Prompting Guide. [3]
  4. «Exploring prompt injection attacks». NCC Group. [4]
  5. «Do Anything Now: Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models». arXiv:2308.03825. [5]
  6. «0xk1h0/ChatGPT_DAN». GitHub. [6]
  7. «Hiding in Plain Sight: Multimodal Jailbreaking of Large Language Models». HiddenLayer. [7]
  8. «ChatGPT "Time-travel" jailbreak lets you bypass its safety guards». BleepingComputer. [8]
  9. Chu, Z., et al. «JailbreakRadar: A Comprehensive Benchmark for Jailbreak Attack and Defense». arXiv:2402.12642. [9]
  10. Zou, A., et al. «Universal and Transferable Adversarial Attacks on Aligned Language Models». arXiv:2307.15043. [10]
  11. «Many-shot Jailbreaking». Anthropic. [11]
  12. «How we're using 'constitutional AI' to make our models safer». MIT Technology Review. [12]