Die tödliche Trias vermeiden
Simon Willison fasste 2025 unter dem Begriff „lethal trifecta" zusammen, wann eine LLM-Anwendung gefährlich wird: wenn sie Zugriff auf private Daten hat, nicht vertrauenswürdige Inhalte verarbeitet und zugleich nach außen kommunizieren kann. Fehlt eine der drei Eigenschaften, wird aus einer Injektion kein Datenabfluss.
Die Trias ist die kürzeste brauchbare Risikoprüfung für Prompt Injection — und der Grund, warum Sicherheitsarbeit hier beim Systementwurf beginnt und nicht beim Prompt.
Die drei Eigenschaften
- Zugriff auf private Daten. Postfach, Dateien, Datenbank, Chatverlauf — alles, was nicht ohnehin öffentlich ist.
- Verarbeitung nicht vertrauenswürdiger Inhalte. Webseiten, E-Mails, Dokumente, Werkzeug-Rückgaben, Nutzereingaben Dritter.
- Kanal nach außen. Senden, Posten, Aufrufen einer URL, Rendern eines Bildes von einer fremden Domain, Schreiben in ein geteiltes System.
Anwendung im Entwurf
Die Prüfung ist bewusst grob und deshalb im Alltag brauchbar: Man geht die drei Punkte für jede geplante Integration durch. Sind alle drei erfüllt, braucht der Entwurf eine harte Maßnahme — Trennung der Läufe, menschliche Freigabe oder das Streichen einer der drei Eigenschaften.
In der Praxis ist der dritte Punkt am leichtesten zu entschärfen. Ausgehende Ziele lassen sich einschränken, automatisch geladene Ressourcen unterbinden, Ausgaben bereinigen. Genau dort setzten auch die Gegenmaßnahmen bei den dokumentierten Vorfällen an.
Techniken, die die Trias ausnutzen
Diese Einträge aus dem Techniken-Verzeichnis gehören unmittelbar zu diesem Thema — jeder mit Funktionsweise, Risiko-Einstufung, Schutzmaßnahmen und Primärquelle.
-
Datenabfluss über Markdown-Bilder
Das Modell wird veranlasst, ein Bild einzubetten, dessen URL die zu stehlenden Daten als Parameter enthält. Das Rendern der Antwort löst den Abruf aus und schickt die Daten an den Angreifer.
Risiko hoch -
Datenabfluss über präparierte Links
Die Antwort des Assistenten enthält einen scheinbar hilfreichen Link, in dessen Parametern vertrauliche Daten stecken — ein Klick des Nutzers genügt für den Abfluss.
Risiko hoch -
Zero-Click-Injektion
Angriffsklasse, die ganz ohne Zutun des Opfers auskommt: Das Zustellen eines Inhalts in ein vom Assistenten durchsuchtes System genügt, um Injektion und Datenabfluss auszulösen.
Risiko hoch -
Verwirrter Stellvertreter
Der Agent handelt mit den Rechten des Nutzers, folgt aber der Absicht eines Angreifers — er wird zum Stellvertreter, der seine Berechtigungen fremdgesteuert einsetzt.
Risiko hoch -
Werkzeug-Missbrauch durch Injektion
Die eingeschleuste Anweisung veranlasst den Agenten, seine angebundenen Werkzeuge zweckwidrig einzusetzen — Mails versenden, Dateien schreiben, Käufe auslösen, Code ausführen.
Risiko hoch
Passende Werkzeuge
-
LlamaFirewall
Guardrail-System für Agenten, das Eingaben, Zwischenschritte der Modell-Argumentation und erzeugten Code prüft, bevor eine riskante Aktion ausgeführt wird.
Open Source -
mcp-scan
Prüfwerkzeug für MCP-Server, das Tool-Beschreibungen auf versteckte Anweisungen, Tool-Poisoning und nachträgliche Änderungen untersucht.
Open Source
Einordnung in die OWASP LLM Top 10
-
LLM01: Prompt Injection
Eingaben verändern das Verhalten des Modells auf eine vom Betreiber nicht vorgesehene Weise — unabhängig davon, ob der Text für Menschen sichtbar ist oder nicht.
-
LLM02: Offenlegung sensibler Informationen
Das Modell gibt personenbezogene Daten, Geschäftsgeheimnisse, Zugangsdaten oder interne Details preis — aus Trainingsdaten, aus dem Kontext oder aus angebundenen Systemen.
-
LLM06: Übermäßige Handlungsvollmacht
Das System darf mehr, als es für seine Aufgabe müsste — zu viele Werkzeuge, zu weite Rechte, zu viel Autonomie ohne menschliche Kontrolle.
Häufige Fragen
Was ist die tödliche Trias?
Die Kombination aus Zugriff auf private Daten, Verarbeitung nicht vertrauenswürdiger Inhalte und der Möglichkeit, nach außen zu kommunizieren. Sind alle drei Eigenschaften gegeben, kann eine Prompt Injection zum Datenabfluss führen.
Welche der drei Eigenschaften lässt sich am leichtesten entfernen?
In der Regel der Kanal nach außen: Ausgehende Ziele einschränken, automatisch geladene Ressourcen unterbinden und Links in Ausgaben bereinigen.
Quellen
- Simon Willison: The lethal trifecta for AI agents (16.06.2025): https://simonwillison.net/2025/Jun/16/the-lethal-trifecta/
- OWASP GenAI Security Project: LLM02:2025 Sensitive Information Disclosure: https://genai.owasp.org/llmrisk/llm022025-sensitive-information-disclosure/