prompt injections.de
Cluster

Arten der Prompt Injection

Die Arten der Prompt Injection unterscheiden sich nicht darin, was das Sprachmodell falsch macht, sondern darin, auf welchem Weg die fremde Anweisung in sein Kontextfenster gelangt. Bei der direkten Injektion tippt der Angreifer sie selbst ein. Bei der indirekten steht sie in Daten, die das System im Auftrag des Nutzers abruft. Bei der gespeicherten liegt sie dauerhaft in einem Speicher und wirkt bei jedem künftigen Abruf erneut. Bei der multimodalen kommt sie über Bild oder Ton. OWASP fasst diese Wege unter dem Risiko LLM01:2025 zusammen.1

Diese Einteilung ist kein Etikett, sondern bestimmt das Bedrohungsmodell. Sie beantwortet drei Fragen, die jede Schutzentscheidung vorstrukturieren: Wer kann angreifen, gegen wen richtet sich der Angriff, und wann wirkt er?

ArtAngreifer istAngriff richtet sich gegenWirkung
Direktder Nutzer selbstdie Regeln des Betreibersin der Sitzung
Indirektein Dritter ohne ZugangNutzer und Betreiberbeim Abruf des Inhalts
Gespeichertein Dritter ohne Zugangauch unbeteiligte Nutzersitzungsübergreifend
Multimodalbeides möglichje nach Kanalbeim Verarbeiten der Datei

Die Grenzen sind durchlässig. Ein über eine Webseite ausgelöster Angriff, der sich ins Langzeitgedächtnis schreibt, ist indirekt in der Zustellung und gespeichert in der Wirkung. Für die Abwehr zählt beides: der Kanal für die Erkennung, die Persistenz für die Bereinigung.

Die Seiten dieses Clusters

Direkte Prompt Injection Der Angreifer gibt die Anweisung selbst ein und richtet sie gegen die Regeln der Anwendung, etwa um den System-Prompt offenzulegen oder die Aufgabe der Anwendung auszutauschen.

Indirekte Prompt Injection Die Anweisung steht in einer Webseite, einer E-Mail, einem PDF oder einem Kalendereintrag, den das System später verarbeitet. Für Anwendungen mit RAG, Postfach- oder Browser-Zugriff der praktisch relevanteste Weg, vom BSI als intrinsische Schwachstelle eingestuft.2

Gespeicherte Prompt Injection Die Anweisung landet dauerhaft im Langzeitgedächtnis, in der Vektordatenbank oder in einer Werkzeugbeschreibung und wirkt bei jedem künftigen Abruf erneut, teils auch gegenüber anderen Nutzern.

Multimodale Prompt Injection Anweisungen stecken in Bildern oder Audiodateien, als sichtbarer Text im Bild oder als adversariale Störung, und wirken, sobald ein multimodales Modell die Datei verarbeitet.3

Prompt Injection oder Jailbreak: der Unterschied Beim Jailbreak umgeht der Nutzer die Sicherheitsregeln des Modellanbieters, das Ziel ist eine verbotene Ausgabe. Prompt Injection ist der weitere Begriff und umfasst besonders die Fälle, in denen ein Dritter über verarbeitete Daten die Kontrolle übernimmt.4

Was daraus für die Abwehr folgt

Direkte Injektion lässt sich eingrenzen, weil der Angreifer identifizierbar ist: Authentifizierung, Ratenbegrenzung und Ausgabevalidierung greifen. Indirekte und gespeicherte Injektion entziehen sich dem, weil der Angreifer nie mit der Anwendung spricht. Dort helfen nur Maßnahmen, die unabhängig vom Inhalt wirken: Rechte begrenzen, Kontrollfluss von Fremddaten trennen, ausgehende Kanäle schließen und riskante Aktionen an eine menschliche Freigabe binden.

Wer wissen will, über welche Systeme diese Wege in der Praxis führen, findet das im Cluster Angriffsvektoren. Die einzelnen Verfahren sind unter Techniken katalogisiert, die Gegenmaßnahmen unter Schutz.

Die Formen im Einzelnen 5

  • Art der Prompt Injection

    Direkte Prompt Injection

    Bei der direkten Prompt Injection gibt der Angreifer die manipulierende Anweisung selbst in die Anwendung ein. Er ist also der Nutzer und richtet den Angriff gegen die Regeln des Betreibers — etwa um den geheimen System-Prompt sichtbar zu machen oder gesperrte Ausgaben zu erzwingen. OWASP zählt hierzu ausdrücklich auch unbeabsichtigte Fälle, in denen harmlose Eingaben das Modellverhalten unerwartet verändern.

  • Art der Prompt Injection

    Indirekte Prompt Injection

    Bei der indirekten Prompt Injection steht die Anweisung nicht in der Nutzereingabe, sondern in Daten, die das Modell im Auftrag des Nutzers verarbeitet: einer Webseite, einer E-Mail, einem PDF, einem Kalendereintrag, einem Repository. Der Angreifer braucht keinen Zugang zur Anwendung — er muss nur den Inhalt kontrollieren, den sie später abruft. Das Bundesamt für Sicherheit in der Informationstechnik bezeichnet indirekte Prompt Injections als intrinsische Schwachstelle anwendungsintegrierter KI-Sprachmodelle.

  • Art der Prompt Injection

    Gespeicherte Prompt Injection

    Die gespeicherte Prompt Injection verhält sich zur indirekten wie Stored XSS zum reflektierten XSS: Die eingeschleuste Anweisung landet in einem dauerhaften Speicher des Systems — im Langzeitgedächtnis eines Assistenten, in einer Vektordatenbank, in Notizen oder in Werkzeugdefinitionen. Sie wirkt dann nicht nur in der Sitzung, in der sie eingeschleust wurde, sondern wird bei späteren Aufrufen erneut in den Kontext geladen.

  • Art der Prompt Injection

    Multimodale Prompt Injection

    Multimodale Prompt Injection nutzt Eingabekanäle jenseits des Textes: Anweisungen stecken als sichtbarer oder kaum wahrnehmbarer Text in einem Bild, in Metadaten oder als adversariale Störung im Signal. Sobald ein multimodales Modell die Datei verarbeitet, landen sie im selben Kontextfenster wie der Auftrag des Nutzers — mit derselben Wirkung wie eingeschleuster Text.

  • Abgrenzung

    Prompt Injection oder Jailbreak — der Unterschied

    Beim Jailbreaking versucht der Nutzer selbst, die Sicherheitsregeln des Modellanbieters zu umgehen; das Ziel ist eine verbotene Ausgabe. Prompt Injection ist der weitere Begriff und umfasst insbesondere Fälle, in denen ein Dritter über verarbeitete Daten die Kontrolle über das Verhalten der Anwendung übernimmt — der Angriff richtet sich dann gegen den Nutzer oder den Betreiber, nicht gegen die Richtlinien des Anbieters.

Quellen

  1. OWASP GenAI Security Project: LLM01:2025 Prompt Injection. https://genai.owasp.org/llmrisk/llm01-prompt-injection/
  2. BSI: Indirect Prompt Injections. Intrinsische Schwachstelle in anwendungsintegrierten KI-Sprachmodellen, Cyber-Sicherheitswarnung 2023. https://www.bsi.bund.de/SharedDocs/Cybersicherheitswarnungen/DE/2023/2023-249034-1032_csw.html
  3. Bagdasaryan, Hsieh, Nassi, Shmatikov: (Ab)using Images and Sounds for Indirect Instruction Injection in Multi-Modal LLMs, arXiv:2307.10490. https://arxiv.org/abs/2307.10490
  4. Greshake, Abdelnabi, Mishra, Endres, Holz, Fritz: Not what you've signed up for, arXiv:2302.12173. https://arxiv.org/abs/2302.12173