prompt injections.de
Modell · OpenAI

o1 / o1-preview

Für o1 / o1-preview von OpenAI sind öffentlich 3 Befunde zu Prompt Injection und verwandten Angriffen dokumentiert. Der Eintrag fasst sie mit Quelle zusammen — es sind keine eigenen Messungen dieses Portals, sondern belegte Fremdbefunde zum jeweiligen Untersuchungszeitpunkt.

Anbieter
OpenAI
Modellfamilie
Reasoning
Stand der Angaben
2026-08-03
Primärquelle
blogs.cisco.com

Momentaufnahme. Anbieter bessern laufend nach. Ein hier dokumentierter Befund muss für die heute ausgelieferte Modellversion nicht mehr gelten. Umgekehrt gilt Prompt Injection bislang bei keinem Modell als grundsätzlich gelöst — die Absicherung gehört in die Anwendung, nicht in die Modellauswahl.

Dokumentierte Schwächen

  • Cisco maß für o1-preview eine Blockrate von 74 Prozent gegen den verwendeten HarmBench-Satz — deutlich besser als andere getestete Reasoning-Modelle, aber kein vollständiger Schutz.
  • Rund ein Viertel der Angriffe kam durch; auch reasoning-starke Modelle sind kein Ersatz für externe Guardrails.
  • Längere Argumentationsketten bieten zusätzliche Ansatzpunkte für mehrstufige Kontextvergiftung.

Was das für Betreiber bedeutet

Die Auswahl eines robusteren Modells senkt die Erfolgsquote einfacher Angriffe, ersetzt aber keine Architektur. Wirksam bleiben die Maßnahmen aus OWASP LLM01: Rechte nach dem Least-Privilege-Prinzip vergeben, Ausgabeformate erzwingen und prüfen, Fremdinhalte klar von Anweisungen trennen (Spotlighting) und riskante Aktionen von einer menschlichen Freigabe abhängig machen.

Betroffene Techniken

  • Mehrstufiger Angriff

    Crescendo

    Von Microsoft beschriebener Mehrschritt-Angriff: Das Gespräch beginnt harmlos und steigert sich in kleinen, jeweils plausiblen Schritten, bis das Modell den ursprünglich abgelehnten Inhalt liefert.

    Risiko hoch
  • Mehrstufiger Angriff

    Echo Chamber

    Von NeuralTrust beschriebene Kontextvergiftung: Harmlose „Saat"-Aussagen werden gesetzt und über mehrere Turns vom Modell selbst wiederholt, bis der vergiftete Kontext als eigener Konsens wirkt.

    Risiko hoch

Quellen

  1. o1 / o1-preview — dokumentierter Befund: https://blogs.cisco.com/security/evaluating-security-risk-in-deepseek-and-other-frontier-reasoning-models

Momentaufnahme: Die aufgeführten Schwächen beziehen sich auf den jeweils genannten Untersuchungszeitpunkt. Anbieter bessern laufend nach — ein hier dokumentierter Befund muss für die heutige Modellversion nicht mehr gelten. Prompt Injection gilt bislang bei keinem Modell als grundsätzlich gelöst.