prompt injections.de
Abgrenzung

Prompt Injection oder Jailbreak — der Unterschied

Beim Jailbreaking versucht der Nutzer selbst, die Sicherheitsregeln des Modellanbieters zu umgehen; das Ziel ist eine verbotene Ausgabe. Prompt Injection ist der weitere Begriff und umfasst insbesondere Fälle, in denen ein Dritter über verarbeitete Daten die Kontrolle über das Verhalten der Anwendung übernimmt — der Angriff richtet sich dann gegen den Nutzer oder den Betreiber, nicht gegen die Richtlinien des Anbieters.

Die Begriffe werden im Alltag oft synonym benutzt, führen aber zu unterschiedlichen Zuständigkeiten und Gegenmaßnahmen. Wer die Unterscheidung sauber trifft, redet in Sicherheitsgesprächen über das richtige Problem — Grundlagen dazu auf der Seite Was ist Prompt Injection?.

Die Unterscheidung in einer Tabelle

JailbreakPrompt Injection
Angreiferder Nutzer selbstoft ein Dritter über Fremddaten
ZielRichtlinien des ModellanbietersAufgabenrahmen und Daten der Anwendung
GeschädigtAnbieter und dessen RegelwerkBetreiber und dessen Nutzer
Zuständig für AbwehrModellanbieter (Alignment, Filter)Betreiber (Architektur, Rechte, Prüfung)
Typische Wirkungverbotene AusgabeDatenabfluss, fremdgesteuerte Aktionen

Die Zeilen beschreiben Schwerpunkte, keine trennscharfen Klassen. Eine direkte Injektion gegen den System-Prompt eines Betreibers kann dieselbe Technik verwenden wie ein Jailbreak gegen die Anbieterregeln — der Unterschied liegt im Ziel, nicht im Werkzeug.

Warum die Abgrenzung praktisch zählt

Ein Jailbreak ist für einen Betreiber vor allem dann relevant, wenn seine Anwendung dadurch Inhalte ausgibt, für die er haftet. Die Abwehr liegt jedoch überwiegend beim Modellanbieter — als Betreiber wählt man ein Modell und ergänzt Ausgabefilter.

Bei Prompt Injection liegt die Verantwortung dagegen fast vollständig beim Betreiber. Kein Modell und kein Filter nimmt ihm die Entscheidung ab, welche Rechte seine Anwendung hat und welche Aktionen ohne menschliche Freigabe laufen dürfen.

Für die Risikobewertung folgt daraus eine einfache Regel: Ein Jailbreak ist ein Reputations- und Compliance-Thema, eine Injektion ein Thema der Systemsicherheit.

Jailbreak-Techniken im Verzeichnis

Diese Techniken zielen primär auf die Regeln des Modellanbieters — viele lassen sich aber ebenso gegen den Aufgabenrahmen einer Anwendung richten.

  • Jailbreak

    Rollenspiel-Persona

    Das Modell wird gebeten, eine fiktive Rolle einzunehmen, für die die üblichen Regeln angeblich nicht gelten — die Fiktion dient als Vorwand für regelwidrige Ausgaben.

    Risiko mittel
  • Jailbreak

    DAN („Do Anything Now")

    Die bekannteste Familie von Community-Jailbreak-Prompts: Das Modell soll eine entfesselte Zweitpersönlichkeit annehmen, die „alles darf" — häufig verstärkt durch ein fiktives Punkte- oder Strafsystem.

    Risiko mittel
  • Jailbreak

    Skeleton Key

    Von Microsoft dokumentierte Technik, bei der das Modell nicht zum Regelbruch überredet, sondern gebeten wird, seine Regeln zu „ergänzen": Es soll künftig alles beantworten und lediglich eine Warnung voranstellen.

    Risiko hoch
  • Jailbreak

    Policy Puppetry

    Von HiddenLayer 2025 veröffentlichte Technik: Der Angriffs-Prompt wird als strukturierte Richtliniendatei (XML, JSON, INI) formuliert, die das Modell als interne Konfiguration statt als Nutzereingabe interpretiert.

    Risiko hoch
  • Jailbreak

    Verweigerungs-Unterdrückung

    Dem Modell wird untersagt, typische Ablehnungsformeln zu verwenden („sage niemals ‚Ich kann nicht'") — der sprachliche Ausweg für eine Verweigerung wird ihm damit genommen.

    Risiko mittel
  • Jailbreak

    DeepInception (verschachtelte Fiktion)

    Mehrfach verschachtelte fiktive Szenen — eine Geschichte in einer Geschichte in einer Geschichte — verwässern den Bezug zur Realität, bis das Modell die Sicherheitsprüfung auf die innerste Ebene nicht mehr anwendet.

    Risiko mittel
  • Jailbreak

    Selbsttäuschung des Modells

    Das Modell wird veranlasst, den schädlichen Kontext selbst zu erzeugen — anschließend arbeitet es mit seinem eigenen, als vertrauenswürdig behandelten Output weiter.

    Risiko mittel
  • Jailbreak

    Kombinationsangriffe

    Die praktisch wirksamsten Angriffe kombinieren mehrere Techniken — etwa Rollenspiel plus Kodierung plus Verweigerungs-Unterdrückung — und übersteigen dadurch die Wirkung jeder Einzeltechnik.

    Risiko hoch
  • Mehrstufiger Angriff

    Crescendo

    Von Microsoft beschriebener Mehrschritt-Angriff: Das Gespräch beginnt harmlos und steigert sich in kleinen, jeweils plausiblen Schritten, bis das Modell den ursprünglich abgelehnten Inhalt liefert.

    Risiko hoch
  • Mehrstufiger Angriff

    Echo Chamber

    Von NeuralTrust beschriebene Kontextvergiftung: Harmlose „Saat"-Aussagen werden gesetzt und über mehrere Turns vom Modell selbst wiederholt, bis der vergiftete Kontext als eigener Konsens wirkt.

    Risiko hoch
  • Mehrstufiger Angriff

    Bad Likert Judge

    Von Unit 42 beschriebene Technik: Das Modell wird als Bewertungsinstanz eingesetzt und soll Beispielantworten zu verschiedenen Stufen einer Likert-Skala erzeugen — die Höchststufe enthält den schädlichen Inhalt.

    Risiko hoch
  • Mehrstufiger Angriff

    Deceptive Delight

    Von Unit 42 beschriebene Technik: Ein unzulässiges Thema wird zwischen zwei harmlose Themen gebettet und das Modell gebeten, alle drei in einer positiven Erzählung zu verbinden — anschließend soll es den kritischen Teil ausführen.

    Risiko mittel
  • Mehrstufiger Angriff

    Many-Shot-Jailbreaking

    Von Anthropic veröffentlichte Technik: Sehr viele fingierte Dialogbeispiele, in denen ein „Assistent" regelwidrig antwortet, werden in den Prompt gestellt — das Modell setzt das Muster fort.

    Risiko hoch
  • Mehrstufiger Angriff

    Persuasions-Jailbreak

    Der Angriff nutzt klassische sozialwissenschaftliche Überzeugungstechniken — Autorität, Reziprozität, emotionale Appelle — statt technischer Tricks, um das Modell zur Kooperation zu bewegen.

    Risiko mittel

Passende Werkzeuge

  • Schutzmodell · Meta

    Llama Guard

    Auf Inhaltssicherheit spezialisiertes Modell, das Eingaben und Antworten anhand einer anpassbaren Risikotaxonomie klassifiziert.

    Open Source
  • Guardrail-API · OpenAI

    OpenAI Moderation API

    Klassifikations-API, die Texte und Bilder gegen eine Kategorienliste schädlicher Inhalte prüft.

    kommerziell
  • Red-Teaming · promptfoo

    promptfoo

    Test- und Red-Teaming-Werkzeug für Prompts und Modelle mit Plugin-System für Angriffsklassen und CI-Integration.

    Open Source

Einordnung in die OWASP LLM Top 10

  • OWASP LLM Top 10 · 2025

    LLM01: Prompt Injection

    Eingaben verändern das Verhalten des Modells auf eine vom Betreiber nicht vorgesehene Weise — unabhängig davon, ob der Text für Menschen sichtbar ist oder nicht.

Häufige Fragen

Ist jeder Jailbreak eine Prompt Injection?

Nicht zwingend. Ein Jailbreak richtet sich gegen die Sicherheitsregeln des Modellanbieters und wird vom Nutzer selbst ausgelöst. Prompt Injection ist der weitere Begriff und umfasst insbesondere Angriffe Dritter über verarbeitete Fremddaten.

Wer ist für die Abwehr zuständig?

Beim Jailbreak überwiegend der Modellanbieter über Alignment und Filter. Bei Prompt Injection der Betreiber der Anwendung: über begrenzte Rechte, geprüfte Ausgaben und die Trennung von Daten und Kontrollfluss.

Quellen

  1. Greshake et al.: Not what you've signed up for (arXiv:2302.12173): https://arxiv.org/abs/2302.12173
  2. OWASP GenAI Security Project: LLM01:2025 Prompt Injection: https://genai.owasp.org/llmrisk/llm01-prompt-injection/
  3. Wallace et al.: The Instruction Hierarchy (arXiv:2404.13208): https://arxiv.org/abs/2404.13208