Prompt Injection oder Jailbreak — der Unterschied
Beim Jailbreaking versucht der Nutzer selbst, die Sicherheitsregeln des Modellanbieters zu umgehen; das Ziel ist eine verbotene Ausgabe. Prompt Injection ist der weitere Begriff und umfasst insbesondere Fälle, in denen ein Dritter über verarbeitete Daten die Kontrolle über das Verhalten der Anwendung übernimmt — der Angriff richtet sich dann gegen den Nutzer oder den Betreiber, nicht gegen die Richtlinien des Anbieters.
Die Begriffe werden im Alltag oft synonym benutzt, führen aber zu unterschiedlichen Zuständigkeiten und Gegenmaßnahmen. Wer die Unterscheidung sauber trifft, redet in Sicherheitsgesprächen über das richtige Problem — Grundlagen dazu auf der Seite Was ist Prompt Injection?.
Die Unterscheidung in einer Tabelle
| Jailbreak | Prompt Injection | |
|---|---|---|
| Angreifer | der Nutzer selbst | oft ein Dritter über Fremddaten |
| Ziel | Richtlinien des Modellanbieters | Aufgabenrahmen und Daten der Anwendung |
| Geschädigt | Anbieter und dessen Regelwerk | Betreiber und dessen Nutzer |
| Zuständig für Abwehr | Modellanbieter (Alignment, Filter) | Betreiber (Architektur, Rechte, Prüfung) |
| Typische Wirkung | verbotene Ausgabe | Datenabfluss, fremdgesteuerte Aktionen |
Die Zeilen beschreiben Schwerpunkte, keine trennscharfen Klassen. Eine direkte Injektion gegen den System-Prompt eines Betreibers kann dieselbe Technik verwenden wie ein Jailbreak gegen die Anbieterregeln — der Unterschied liegt im Ziel, nicht im Werkzeug.
Warum die Abgrenzung praktisch zählt
Ein Jailbreak ist für einen Betreiber vor allem dann relevant, wenn seine Anwendung dadurch Inhalte ausgibt, für die er haftet. Die Abwehr liegt jedoch überwiegend beim Modellanbieter — als Betreiber wählt man ein Modell und ergänzt Ausgabefilter.
Bei Prompt Injection liegt die Verantwortung dagegen fast vollständig beim Betreiber. Kein Modell und kein Filter nimmt ihm die Entscheidung ab, welche Rechte seine Anwendung hat und welche Aktionen ohne menschliche Freigabe laufen dürfen.
Für die Risikobewertung folgt daraus eine einfache Regel: Ein Jailbreak ist ein Reputations- und Compliance-Thema, eine Injektion ein Thema der Systemsicherheit.
Jailbreak-Techniken im Verzeichnis
Diese Techniken zielen primär auf die Regeln des Modellanbieters — viele lassen sich aber ebenso gegen den Aufgabenrahmen einer Anwendung richten.
-
Rollenspiel-Persona
Das Modell wird gebeten, eine fiktive Rolle einzunehmen, für die die üblichen Regeln angeblich nicht gelten — die Fiktion dient als Vorwand für regelwidrige Ausgaben.
Risiko mittel -
DAN („Do Anything Now")
Die bekannteste Familie von Community-Jailbreak-Prompts: Das Modell soll eine entfesselte Zweitpersönlichkeit annehmen, die „alles darf" — häufig verstärkt durch ein fiktives Punkte- oder Strafsystem.
Risiko mittel -
Skeleton Key
Von Microsoft dokumentierte Technik, bei der das Modell nicht zum Regelbruch überredet, sondern gebeten wird, seine Regeln zu „ergänzen": Es soll künftig alles beantworten und lediglich eine Warnung voranstellen.
Risiko hoch -
Policy Puppetry
Von HiddenLayer 2025 veröffentlichte Technik: Der Angriffs-Prompt wird als strukturierte Richtliniendatei (XML, JSON, INI) formuliert, die das Modell als interne Konfiguration statt als Nutzereingabe interpretiert.
Risiko hoch -
Verweigerungs-Unterdrückung
Dem Modell wird untersagt, typische Ablehnungsformeln zu verwenden („sage niemals ‚Ich kann nicht'") — der sprachliche Ausweg für eine Verweigerung wird ihm damit genommen.
Risiko mittel -
DeepInception (verschachtelte Fiktion)
Mehrfach verschachtelte fiktive Szenen — eine Geschichte in einer Geschichte in einer Geschichte — verwässern den Bezug zur Realität, bis das Modell die Sicherheitsprüfung auf die innerste Ebene nicht mehr anwendet.
Risiko mittel -
Selbsttäuschung des Modells
Das Modell wird veranlasst, den schädlichen Kontext selbst zu erzeugen — anschließend arbeitet es mit seinem eigenen, als vertrauenswürdig behandelten Output weiter.
Risiko mittel -
Kombinationsangriffe
Die praktisch wirksamsten Angriffe kombinieren mehrere Techniken — etwa Rollenspiel plus Kodierung plus Verweigerungs-Unterdrückung — und übersteigen dadurch die Wirkung jeder Einzeltechnik.
Risiko hoch -
Crescendo
Von Microsoft beschriebener Mehrschritt-Angriff: Das Gespräch beginnt harmlos und steigert sich in kleinen, jeweils plausiblen Schritten, bis das Modell den ursprünglich abgelehnten Inhalt liefert.
Risiko hoch -
Echo Chamber
Von NeuralTrust beschriebene Kontextvergiftung: Harmlose „Saat"-Aussagen werden gesetzt und über mehrere Turns vom Modell selbst wiederholt, bis der vergiftete Kontext als eigener Konsens wirkt.
Risiko hoch -
Bad Likert Judge
Von Unit 42 beschriebene Technik: Das Modell wird als Bewertungsinstanz eingesetzt und soll Beispielantworten zu verschiedenen Stufen einer Likert-Skala erzeugen — die Höchststufe enthält den schädlichen Inhalt.
Risiko hoch -
Deceptive Delight
Von Unit 42 beschriebene Technik: Ein unzulässiges Thema wird zwischen zwei harmlose Themen gebettet und das Modell gebeten, alle drei in einer positiven Erzählung zu verbinden — anschließend soll es den kritischen Teil ausführen.
Risiko mittel -
Many-Shot-Jailbreaking
Von Anthropic veröffentlichte Technik: Sehr viele fingierte Dialogbeispiele, in denen ein „Assistent" regelwidrig antwortet, werden in den Prompt gestellt — das Modell setzt das Muster fort.
Risiko hoch -
Persuasions-Jailbreak
Der Angriff nutzt klassische sozialwissenschaftliche Überzeugungstechniken — Autorität, Reziprozität, emotionale Appelle — statt technischer Tricks, um das Modell zur Kooperation zu bewegen.
Risiko mittel
Passende Werkzeuge
-
Llama Guard
Auf Inhaltssicherheit spezialisiertes Modell, das Eingaben und Antworten anhand einer anpassbaren Risikotaxonomie klassifiziert.
Open Source -
OpenAI Moderation API
Klassifikations-API, die Texte und Bilder gegen eine Kategorienliste schädlicher Inhalte prüft.
kommerziell -
promptfoo
Test- und Red-Teaming-Werkzeug für Prompts und Modelle mit Plugin-System für Angriffsklassen und CI-Integration.
Open Source
Einordnung in die OWASP LLM Top 10
-
LLM01: Prompt Injection
Eingaben verändern das Verhalten des Modells auf eine vom Betreiber nicht vorgesehene Weise — unabhängig davon, ob der Text für Menschen sichtbar ist oder nicht.
Häufige Fragen
Ist jeder Jailbreak eine Prompt Injection?
Nicht zwingend. Ein Jailbreak richtet sich gegen die Sicherheitsregeln des Modellanbieters und wird vom Nutzer selbst ausgelöst. Prompt Injection ist der weitere Begriff und umfasst insbesondere Angriffe Dritter über verarbeitete Fremddaten.
Wer ist für die Abwehr zuständig?
Beim Jailbreak überwiegend der Modellanbieter über Alignment und Filter. Bei Prompt Injection der Betreiber der Anwendung: über begrenzte Rechte, geprüfte Ausgaben und die Trennung von Daten und Kontrollfluss.
Quellen
- Greshake et al.: Not what you've signed up for (arXiv:2302.12173): https://arxiv.org/abs/2302.12173
- OWASP GenAI Security Project: LLM01:2025 Prompt Injection: https://genai.owasp.org/llmrisk/llm01-prompt-injection/
- Wallace et al.: The Instruction Hierarchy (arXiv:2404.13208): https://arxiv.org/abs/2404.13208