GPT-4o / GPT-4o mini / GPT-4.1
Für GPT-4o / GPT-4o mini / GPT-4.1 von OpenAI sind öffentlich 3 Befunde zu Prompt Injection und verwandten Angriffen dokumentiert. Der Eintrag fasst sie mit Quelle zusammen — es sind keine eigenen Messungen dieses Portals, sondern belegte Fremdbefunde zum jeweiligen Untersuchungszeitpunkt.
- Anbieter
- OpenAI
- Modellfamilie
- GPT
- Stand der Angaben
- 2026-08-03
- Primärquelle
- hiddenlayer.com
Momentaufnahme. Anbieter bessern laufend nach. Ein hier dokumentierter Befund muss für die heute ausgelieferte Modellversion nicht mehr gelten. Umgekehrt gilt Prompt Injection bislang bei keinem Modell als grundsätzlich gelöst — die Absicherung gehört in die Anwendung, nicht in die Modellauswahl.
Dokumentierte Schwächen
- HiddenLayer führt GPT-4o, GPT-4o mini und GPT-4.1 unter den Modellen, gegen die die Policy-Puppetry-Vorlage wirkte.
- Die Vorlage war modellfamilien-übergreifend übertragbar und musste nicht je Modell angepasst werden.
- Multimodale Eingaben erweitern die Angriffsfläche um Bild- und Audio-Kanäle.
Was das für Betreiber bedeutet
Die Auswahl eines robusteren Modells senkt die Erfolgsquote einfacher Angriffe, ersetzt aber keine Architektur. Wirksam bleiben die Maßnahmen aus OWASP LLM01: Rechte nach dem Least-Privilege-Prinzip vergeben, Ausgabeformate erzwingen und prüfen, Fremdinhalte klar von Anweisungen trennen (Spotlighting) und riskante Aktionen von einer menschlichen Freigabe abhängig machen.
Betroffene Techniken
-
Policy Puppetry
Von HiddenLayer 2025 veröffentlichte Technik: Der Angriffs-Prompt wird als strukturierte Richtliniendatei (XML, JSON, INI) formuliert, die das Modell als interne Konfiguration statt als Nutzereingabe interpretiert.
Risiko hoch -
Multimodale Injektion über Bild und Ton
Anweisungen werden in Bilder oder Audiodateien eingebettet — als sichtbarer Text im Bild oder als adversariale Störung — und wirken, sobald ein multimodales Modell die Datei verarbeitet.
Risiko hoch
Quellen
- GPT-4o / GPT-4o mini / GPT-4.1 — dokumentierter Befund: https://hiddenlayer.com/innovation-hub/novel-universal-bypass-for-all-major-llms/
Momentaufnahme: Die aufgeführten Schwächen beziehen sich auf den jeweils genannten Untersuchungszeitpunkt. Anbieter bessern laufend nach — ein hier dokumentierter Befund muss für die heutige Modellversion nicht mehr gelten. Prompt Injection gilt bislang bei keinem Modell als grundsätzlich gelöst.