prompt injections.de
Verzeichnis

Sprachmodelle und ihre dokumentierten Schwachstellen

Dieser Cluster sammelt öffentlich dokumentierte Befunde zur Anfälligkeit von 16 Sprachmodellen gegenüber Prompt Injection und Jailbreaks. Jeder Eintrag nennt die Primärquelle, aus der der Befund stammt, sowie den Zeitpunkt der Untersuchung. Es handelt sich um eine Momentaufnahme fremder Messungen, nicht um eigene Tests dieses Portals. Anbieter bessern laufend nach, ein hier dokumentierter Befund muss für die heute ausgelieferte Modellversion nicht mehr gelten. Als grundsätzlich gelöst gilt Prompt Injection bislang bei keinem Modell.

Diese Einschränkung ist keine Formalie. Sie folgt aus der Sache: Modellsicherheit ist ein bewegliches Ziel, und ein Datum ohne Befund ist so wertlos wie ein Befund ohne Datum. Deshalb trägt jede Modellseite beides sichtbar.

Was die Befunde übergreifend zeigen

Kein Anbieter ist ausgenommen. HiddenLayer beschrieb 2025 mit Policy Puppetry eine Vorlage, die modellfamilien-übergreifend wirkte und nicht je Modell angepasst werden musste. Betroffen waren Modelle von OpenAI, Anthropic, Google, Meta und DeepSeek.1 Eine Modellwahl allein ist also keine Schutzmaßnahme.

Alignment eines Einzelturns löst mehrstufige Angriffe nicht. NeuralTrust demonstrierte innerhalb weniger Stunden nach der Veröffentlichung von GPT-5 einen erfolgreichen Jailbreak aus Echo Chamber und erzählerischer Einbettung, bei dem das Ziel nie explizit genannt wurde. Filter, die einzelne Eingaben bewerten, greifen dabei nicht.2

Auch reasoning-starke Modelle brauchen externe Guardrails. Cisco maß für o1-preview gegen den verwendeten HarmBench-Satz eine Blockrate von 74 Prozent, deutlich besser als bei anderen getesteten Reasoning-Modellen. Rund ein Viertel der Angriffe kam dennoch durch. Für DeepSeek-R1 berichtet dieselbe Untersuchung eine Angriffserfolgsquote von 100 Prozent, es wurde kein einziger Angriff blockiert.3

Selbst gehostete Modelle sind ohne Zusatzschicht ungeschützt. Bei offenen Gewichten fehlen die Guardrails der Anbieter-Plattformen, und gradientenbasierte Angriffe wie GCG werden im White-Box-Zugriff möglich. Meta liefert für diesen Fall mit LlamaFirewall und Prompt Guard ausdrücklich externe Schutzschichten mit.

Große Kontextfenster vergrößern die Angriffsfläche. Anthropic veröffentlichte 2024 selbst den Befund, dass sich Modelle über massenhafte fingierte Beispieldialoge aushebeln lassen und die Wirksamkeit systematisch mit der Anzahl der Beispiele steigt.4Many-Shot-Jailbreaking

Die Modelle im Verzeichnis

OpenAI (5): GPT-5, GPT-4o und GPT-4.1, GPT-4, GPT-3.5 Turbo, o1 Anthropic (2): Claude 3.5 und 3.7 Sonnet, Claude 2.0 Google (3): Gemini 2.0 und 2.5, Gemini 1.5, Gemini CLI Meta (2): Llama 3, Llama 4 DeepSeek (2): DeepSeek-R1, DeepSeek-V3 Mistral AI (1): Mistral 7B Microsoft (1): Microsoft 365 Copilot, das über EchoLeak den ersten dokumentierten Zero-Click-Fall in einem Produktivsystem beitrug.5

Was Betreiber daraus ableiten sollten

Die naheliegende Frage, welches Modell am sichersten sei, führt in die Irre. Sie wird unter Welches LLM ist am sichersten? ausführlich behandelt, und die kurze Antwort lautet: Die Unterschiede zwischen Modellen sind kleiner als die Unterschiede zwischen Architekturen. Ein gut abgesichertes System mit einem mittelmäßig robusten Modell ist sicherer als eine offene Agentenschleife mit dem robustesten verfügbaren Modell.

Praktisch heißt das: Modellrobustheit als eine Schicht unter mehreren einplanen, die eigene Anwendung gegen den Techniken-Katalog testen und die Absicherung nach dem Cluster Schutz aufbauen.

Die vollständige Liste mit Befunden, betroffenen Techniken und Quellen folgt unter diesem Text.

GPT-Familie 4

  • OpenAI

    GPT-5

    NeuralTrust demonstrierte innerhalb von Stunden nach der Veröffentlichung einen erfolgreichen Jailbreak aus Echo Chamber und erzählerischer Einbettung.

    3 Befunde
  • OpenAI

    GPT-4o / GPT-4o mini / GPT-4.1

    HiddenLayer führt GPT-4o, GPT-4o mini und GPT-4.1 unter den Modellen, gegen die die Policy-Puppetry-Vorlage wirkte.

    3 Befunde
  • OpenAI

    GPT-4

    Anthropic konnte GPT-4 im Rahmen der Many-Shot-Jailbreaking-Studie durch massenhafte fingierte Dialogbeispiele zu unerwünschten Ausgaben bringen.

    3 Befunde
  • OpenAI

    GPT-3.5 Turbo

    In der Many-Shot-Studie erfolgreich über lange Kontexte mit fingierten Beispieldialogen ausgehebelt.

    3 Befunde

Reasoning-Familie 1

  • OpenAI

    o1 / o1-preview

    Cisco maß für o1-preview eine Blockrate von 74 Prozent gegen den verwendeten HarmBench-Satz — deutlich besser als andere getestete Reasoning-Modelle, aber kein vollständiger Schutz.

    3 Befunde

Claude-Familie 2

  • Anthropic

    Claude 3.5 Sonnet / Claude 3.7 Sonnet

    HiddenLayer führt Claude 3.5 und 3.7 unter den Modellen, gegen die Policy Puppetry wirkte.

    3 Befunde
  • Anthropic

    Claude 2.0

    In Anthropics eigener Many-Shot-Studie erfolgreich über das große Kontextfenster ausgehebelt.

    3 Befunde

Gemini-Familie 3

  • Google

    Gemini 2.0 / Gemini 2.5

    Google beschreibt in einem eigenen Papier die laufende Verteidigung von Gemini gegen indirekte Prompt Injection und räumt adaptive Angreifer als offenes Problem ein.

    3 Befunde
  • Google

    Gemini 1.5

    Von HiddenLayer als anfällig für die Policy-Puppetry-Vorlage geführt.

    3 Befunde
  • Google

    Gemini CLI

    Cyera Research Labs meldete Command- und Prompt-Injection-Schwachstellen im Gemini CLI.

    3 Befunde

Llama-Familie 2

  • Meta

    Llama 3

    Von HiddenLayer als anfällig für Policy Puppetry geführt.

    3 Befunde
  • Meta

    Llama 4

    Von HiddenLayer als anfällig für die modellübergreifende Policy-Puppetry-Vorlage geführt.

    3 Befunde

DeepSeek-Familie 2

  • DeepSeek

    DeepSeek-R1

    Cisco berichtet für den eingesetzten HarmBench-Satz eine Angriffserfolgsquote von 100 Prozent — kein einziger Angriff wurde blockiert.

    3 Befunde
  • DeepSeek

    DeepSeek-V3

    Von HiddenLayer als anfällig für Policy Puppetry geführt.

    3 Befunde

Mistral-Familie 1

  • Mistral AI

    Mistral 7B

    In Anthropics Many-Shot-Studie erfolgreich ausgehebelt.

    3 Befunde

Copilot-Familie 1

  • Microsoft

    Microsoft 365 Copilot

    EchoLeak (CVE-2025-32711) gilt als erster dokumentierter Zero-Click-Prompt-Injection-Angriff auf ein produktives KI-System.

    3 Befunde

Quellen

  1. HiddenLayer: Novel Universal Bypass for All Major LLMs (Policy Puppetry). https://hiddenlayer.com/innovation-hub/novel-universal-bypass-for-all-major-llms/
  2. NeuralTrust: GPT-5 jailbreak with Echo Chamber and storytelling. https://neuraltrust.ai/blog/gpt-5-jailbreak-with-echo-chamber-and-storytelling
  3. Cisco: Evaluating Security Risk in DeepSeek and Other Frontier Reasoning Models. https://blogs.cisco.com/security/evaluating-security-risk-in-deepseek-and-other-frontier-reasoning-models
  4. Anthropic: Many-shot jailbreaking. https://www.anthropic.com/research/many-shot-jailbreaking
  5. Reddy, Gujral: EchoLeak, arXiv:2509.10540. https://arxiv.org/abs/2509.10540 ; NIST NVD: CVE-2025-32711. https://nvd.nist.gov/vuln/detail/CVE-2025-32711

Momentaufnahme: Die aufgeführten Schwächen beziehen sich auf den jeweils genannten Untersuchungszeitpunkt. Anbieter bessern laufend nach — ein hier dokumentierter Befund muss für die heutige Modellversion nicht mehr gelten. Prompt Injection gilt bislang bei keinem Modell als grundsätzlich gelöst.