prompt injections.de
Modell · OpenAI

GPT-4o / GPT-4o mini / GPT-4.1

Für GPT-4o / GPT-4o mini / GPT-4.1 von OpenAI sind öffentlich 3 Befunde zu Prompt Injection und verwandten Angriffen dokumentiert. Der Eintrag fasst sie mit Quelle zusammen — es sind keine eigenen Messungen dieses Portals, sondern belegte Fremdbefunde zum jeweiligen Untersuchungszeitpunkt.

Anbieter
OpenAI
Modellfamilie
GPT
Stand der Angaben
2026-08-03
Primärquelle
hiddenlayer.com

Momentaufnahme. Anbieter bessern laufend nach. Ein hier dokumentierter Befund muss für die heute ausgelieferte Modellversion nicht mehr gelten. Umgekehrt gilt Prompt Injection bislang bei keinem Modell als grundsätzlich gelöst — die Absicherung gehört in die Anwendung, nicht in die Modellauswahl.

Dokumentierte Schwächen

  • HiddenLayer führt GPT-4o, GPT-4o mini und GPT-4.1 unter den Modellen, gegen die die Policy-Puppetry-Vorlage wirkte.
  • Die Vorlage war modellfamilien-übergreifend übertragbar und musste nicht je Modell angepasst werden.
  • Multimodale Eingaben erweitern die Angriffsfläche um Bild- und Audio-Kanäle.

Was das für Betreiber bedeutet

Die Auswahl eines robusteren Modells senkt die Erfolgsquote einfacher Angriffe, ersetzt aber keine Architektur. Wirksam bleiben die Maßnahmen aus OWASP LLM01: Rechte nach dem Least-Privilege-Prinzip vergeben, Ausgabeformate erzwingen und prüfen, Fremdinhalte klar von Anweisungen trennen (Spotlighting) und riskante Aktionen von einer menschlichen Freigabe abhängig machen.

Betroffene Techniken

  • Jailbreak

    Policy Puppetry

    Von HiddenLayer 2025 veröffentlichte Technik: Der Angriffs-Prompt wird als strukturierte Richtliniendatei (XML, JSON, INI) formuliert, die das Modell als interne Konfiguration statt als Nutzereingabe interpretiert.

    Risiko hoch
  • Multimodal

    Multimodale Injektion über Bild und Ton

    Anweisungen werden in Bilder oder Audiodateien eingebettet — als sichtbarer Text im Bild oder als adversariale Störung — und wirken, sobald ein multimodales Modell die Datei verarbeitet.

    Risiko hoch

Quellen

  1. GPT-4o / GPT-4o mini / GPT-4.1 — dokumentierter Befund: https://hiddenlayer.com/innovation-hub/novel-universal-bypass-for-all-major-llms/

Momentaufnahme: Die aufgeführten Schwächen beziehen sich auf den jeweils genannten Untersuchungszeitpunkt. Anbieter bessern laufend nach — ein hier dokumentierter Befund muss für die heutige Modellversion nicht mehr gelten. Prompt Injection gilt bislang bei keinem Modell als grundsätzlich gelöst.