GPT-4
Für GPT-4 von OpenAI sind öffentlich 3 Befunde zu Prompt Injection und verwandten Angriffen dokumentiert. Der Eintrag fasst sie mit Quelle zusammen — es sind keine eigenen Messungen dieses Portals, sondern belegte Fremdbefunde zum jeweiligen Untersuchungszeitpunkt.
- Anbieter
- OpenAI
- Modellfamilie
- GPT
- Stand der Angaben
- 2026-08-03
- Primärquelle
- anthropic.com
Momentaufnahme. Anbieter bessern laufend nach. Ein hier dokumentierter Befund muss für die heute ausgelieferte Modellversion nicht mehr gelten. Umgekehrt gilt Prompt Injection bislang bei keinem Modell als grundsätzlich gelöst — die Absicherung gehört in die Anwendung, nicht in die Modellauswahl.
Dokumentierte Schwächen
- Anthropic konnte GPT-4 im Rahmen der Many-Shot-Jailbreaking-Studie durch massenhafte fingierte Dialogbeispiele zu unerwünschten Ausgaben bringen.
- Die Crescendo-Arbeit weist für GPT-4 deutliche Erfolgssteigerungen gegenüber vorherigen Verfahren aus.
- Die Studie „GPT-4 Is Too Smart To Be Safe" zeigt, dass gerade die hohe Fähigkeit zur Chiffre-Entschlüsselung ausgenutzt werden kann.
Was das für Betreiber bedeutet
Die Auswahl eines robusteren Modells senkt die Erfolgsquote einfacher Angriffe, ersetzt aber keine Architektur. Wirksam bleiben die Maßnahmen aus OWASP LLM01: Rechte nach dem Least-Privilege-Prinzip vergeben, Ausgabeformate erzwingen und prüfen, Fremdinhalte klar von Anweisungen trennen (Spotlighting) und riskante Aktionen von einer menschlichen Freigabe abhängig machen.
Betroffene Techniken
-
Many-Shot-Jailbreaking
Von Anthropic veröffentlichte Technik: Sehr viele fingierte Dialogbeispiele, in denen ein „Assistent" regelwidrig antwortet, werden in den Prompt gestellt — das Modell setzt das Muster fort.
Risiko hoch -
Crescendo
Von Microsoft beschriebener Mehrschritt-Angriff: Das Gespräch beginnt harmlos und steigert sich in kleinen, jeweils plausiblen Schritten, bis das Modell den ursprünglich abgelehnten Inhalt liefert.
Risiko hoch -
Chiffren- und Leetspeak-Umgehung
Die Anfrage wird in einer einfachen Chiffre (ROT13, Caesar, Leetspeak, Morse) gestellt; das Modell entschlüsselt sie und antwortet, während Sicherheitsfilter die Bedeutung nicht erfassen.
Risiko mittel
Quellen
- GPT-4 — dokumentierter Befund: https://www.anthropic.com/research/many-shot-jailbreaking
Momentaufnahme: Die aufgeführten Schwächen beziehen sich auf den jeweils genannten Untersuchungszeitpunkt. Anbieter bessern laufend nach — ein hier dokumentierter Befund muss für die heutige Modellversion nicht mehr gelten. Prompt Injection gilt bislang bei keinem Modell als grundsätzlich gelöst.