Welches LLM ist am sichersten?
Es gibt kein Sprachmodell, das als sicher gegen Prompt Injection gilt. Für jede große Modellfamilie sind öffentlich Befunde dokumentiert; Anbieter bessern laufend nach, und jede Momentaufnahme veraltet. Wer die Sicherheit einer Anwendung an der Modellauswahl festmacht, hat die falsche Stellschraube gewählt.
Diese Seite stellt die dokumentierten Befunde aus dem Modell-Verzeichnis gegenüber und erklärt, warum daraus keine Rangliste wird. Die Ursache liegt in der Bauart der Modelle — siehe Was ist Prompt Injection?.
Warum eine Rangliste in die Irre führt
Die vorliegenden Befunde stammen aus unterschiedlichen Untersuchungen, zu unterschiedlichen Zeitpunkten, mit unterschiedlichen Angriffsmengen. Ein Modell mit mehr Einträgen ist deshalb nicht unsicherer — häufig ist es schlicht häufiger untersucht worden, weil es verbreiteter ist.
Hinzu kommt die Übertragbarkeit: Angriffsvorlagen wie Policy Puppetry wirkten nach Darstellung der Veröffentlichung über Modellfamilien hinweg, ohne je Modell angepasst werden zu müssen. Ein Wechsel des Anbieters verschiebt in solchen Fällen wenig.
Belastbar ist nur die negative Aussage: Prompt Injection gilt bislang bei keinem Modell als grundsätzlich gelöst.
Worauf es stattdessen ankommt
- Rechte der Anwendung — siehe Least Privilege.
- Trennung von Daten und Kontrollfluss — siehe Dual-LLM-Muster und CaMeL.
- Prüfung der Ausgaben — siehe Ausgabeprüfung.
- Menschliche Freigabe für wirkungsvolle Aktionen.
- Ein eigener Testlauf im konkreten Aufbau — siehe Penetrationstest.
Einordnung in die OWASP LLM Top 10
-
LLM01: Prompt Injection
Eingaben verändern das Verhalten des Modells auf eine vom Betreiber nicht vorgesehene Weise — unabhängig davon, ob der Text für Menschen sichtbar ist oder nicht.
Dokumentierte Befunde je Modell
Die Spalte „Befunde" zählt die auf der jeweiligen Modellseite belegten Einträge. Sie ist keine Sicherheitsbewertung: Häufiger untersuchte Modelle haben in der Regel mehr Einträge.
| Modell | Anbieter | Familie | Befunde | Betroffene Techniken |
|---|---|---|---|---|
| Claude 2.0 | Anthropic | Claude | 3 | Many-Shot-Jailbreaking, Kontext-Überflutung |
| Claude 3.5 Sonnet / Claude 3.7 Sonnet | Anthropic | Claude | 3 | Policy Puppetry, ASCII Smuggling (unsichtbare Unicode-Tags) |
| DeepSeek-R1 | DeepSeek | DeepSeek | 3 | Deceptive Delight, Bad Likert Judge, DAN („Do Anything Now") |
| DeepSeek-V3 | DeepSeek | DeepSeek | 3 | Policy Puppetry, GCG-Suffix-Angriff |
| Gemini 1.5 | Gemini | 3 | Policy Puppetry, Many-Shot-Jailbreaking, Injektion über Dokumente | |
| Gemini 2.0 / Gemini 2.5 | Gemini | 3 | Indirekte Prompt Injection, Injektion über Kalender-Einladungen, Policy Puppetry | |
| Gemini CLI | Gemini | 3 | Werkzeug-Missbrauch durch Injektion, Code-Injektion über LLM-Ausgaben, Indirekte Prompt Injection | |
| Llama 3 | Meta | Llama | 3 | Policy Puppetry, GCG-Suffix-Angriff, Projizierter Gradientenabstieg |
| Llama 4 | Meta | Llama | 3 | Policy Puppetry, Multimodale Injektion über Bild und Ton |
| Microsoft 365 Copilot | Microsoft | Copilot | 3 | Zero-Click-Injektion, Injektion über E-Mail, Datenabfluss über Markdown-Bilder |
| Mistral 7B | Mistral AI | Mistral | 3 | Many-Shot-Jailbreaking, Rollenspiel-Persona |
| GPT-3.5 Turbo | OpenAI | GPT | 3 | Many-Shot-Jailbreaking, DAN („Do Anything Now") |
| GPT-4 | OpenAI | GPT | 3 | Many-Shot-Jailbreaking, Crescendo, Chiffren- und Leetspeak-Umgehung |
| GPT-4o / GPT-4o mini / GPT-4.1 | OpenAI | GPT | 3 | Policy Puppetry, Multimodale Injektion über Bild und Ton |
| GPT-5 | OpenAI | GPT | 3 | Echo Chamber, Crescendo |
| o1 / o1-preview | OpenAI | Reasoning | 3 | Crescendo, Echo Chamber |
Häufige Fragen
Welches Sprachmodell ist am sichersten gegen Prompt Injection?
Keines gilt als sicher. Für jede große Modellfamilie sind Befunde dokumentiert, und Angriffsvorlagen wirkten in mehreren Fällen familienübergreifend. Die Absicherung gehört in die Anwendung, nicht in die Modellauswahl.
Bringt ein Wechsel zu einem neueren Modell mehr Sicherheit?
Er senkt meist die Erfolgsquote einfacher Angriffe, ersetzt aber keine Architektur. Mehrstufige und automatisierte Verfahren bleiben wirksam, weil sie nicht auf einer einzelnen Formulierung beruhen.
Quellen
- OWASP GenAI Security Project: LLM01:2025 Prompt Injection: https://genai.owasp.org/llmrisk/llm01-prompt-injection/
- HiddenLayer: Novel Universal Bypass for All Major LLMs (Policy Puppetry): https://hiddenlayer.com/innovation-hub/novel-universal-bypass-for-all-major-llms/
Die Einzelbefunde je Modell stehen mit Quelle auf den jeweiligen Modellseiten. Alle Angaben sind Momentaufnahmen zum genannten Untersuchungszeitpunkt.