prompt injections.de
Schutzmaßnahme

Die tödliche Trias vermeiden

Simon Willison fasste 2025 unter dem Begriff „lethal trifecta" zusammen, wann eine LLM-Anwendung gefährlich wird: wenn sie Zugriff auf private Daten hat, nicht vertrauenswürdige Inhalte verarbeitet und zugleich nach außen kommunizieren kann. Fehlt eine der drei Eigenschaften, wird aus einer Injektion kein Datenabfluss.

Die Trias ist die kürzeste brauchbare Risikoprüfung für Prompt Injection — und der Grund, warum Sicherheitsarbeit hier beim Systementwurf beginnt und nicht beim Prompt.

Die drei Eigenschaften

  • Zugriff auf private Daten. Postfach, Dateien, Datenbank, Chatverlauf — alles, was nicht ohnehin öffentlich ist.
  • Verarbeitung nicht vertrauenswürdiger Inhalte. Webseiten, E-Mails, Dokumente, Werkzeug-Rückgaben, Nutzereingaben Dritter.
  • Kanal nach außen. Senden, Posten, Aufrufen einer URL, Rendern eines Bildes von einer fremden Domain, Schreiben in ein geteiltes System.

Anwendung im Entwurf

Die Prüfung ist bewusst grob und deshalb im Alltag brauchbar: Man geht die drei Punkte für jede geplante Integration durch. Sind alle drei erfüllt, braucht der Entwurf eine harte Maßnahme — Trennung der Läufe, menschliche Freigabe oder das Streichen einer der drei Eigenschaften.

In der Praxis ist der dritte Punkt am leichtesten zu entschärfen. Ausgehende Ziele lassen sich einschränken, automatisch geladene Ressourcen unterbinden, Ausgaben bereinigen. Genau dort setzten auch die Gegenmaßnahmen bei den dokumentierten Vorfällen an.

Techniken, die die Trias ausnutzen

Diese Einträge aus dem Techniken-Verzeichnis gehören unmittelbar zu diesem Thema — jeder mit Funktionsweise, Risiko-Einstufung, Schutzmaßnahmen und Primärquelle.

  • Datenabfluss

    Datenabfluss über Markdown-Bilder

    Das Modell wird veranlasst, ein Bild einzubetten, dessen URL die zu stehlenden Daten als Parameter enthält. Das Rendern der Antwort löst den Abruf aus und schickt die Daten an den Angreifer.

    Risiko hoch
  • Datenabfluss

    Datenabfluss über präparierte Links

    Die Antwort des Assistenten enthält einen scheinbar hilfreichen Link, in dessen Parametern vertrauliche Daten stecken — ein Klick des Nutzers genügt für den Abfluss.

    Risiko hoch
  • Angriff auf Agenten

    Zero-Click-Injektion

    Angriffsklasse, die ganz ohne Zutun des Opfers auskommt: Das Zustellen eines Inhalts in ein vom Assistenten durchsuchtes System genügt, um Injektion und Datenabfluss auszulösen.

    Risiko hoch
  • Angriff auf Agenten

    Verwirrter Stellvertreter

    Der Agent handelt mit den Rechten des Nutzers, folgt aber der Absicht eines Angreifers — er wird zum Stellvertreter, der seine Berechtigungen fremdgesteuert einsetzt.

    Risiko hoch
  • Angriff auf Agenten

    Werkzeug-Missbrauch durch Injektion

    Die eingeschleuste Anweisung veranlasst den Agenten, seine angebundenen Werkzeuge zweckwidrig einzusetzen — Mails versenden, Dateien schreiben, Käufe auslösen, Code ausführen.

    Risiko hoch

Passende Werkzeuge

  • Guardrail-Framework · Meta

    LlamaFirewall

    Guardrail-System für Agenten, das Eingaben, Zwischenschritte der Modell-Argumentation und erzeugten Code prüft, bevor eine riskante Aktion ausgeführt wird.

    Open Source
  • Scanner · Invariant Labs

    mcp-scan

    Prüfwerkzeug für MCP-Server, das Tool-Beschreibungen auf versteckte Anweisungen, Tool-Poisoning und nachträgliche Änderungen untersucht.

    Open Source

Einordnung in die OWASP LLM Top 10

  • OWASP LLM Top 10 · 2025

    LLM01: Prompt Injection

    Eingaben verändern das Verhalten des Modells auf eine vom Betreiber nicht vorgesehene Weise — unabhängig davon, ob der Text für Menschen sichtbar ist oder nicht.

  • OWASP LLM Top 10 · 2025

    LLM02: Offenlegung sensibler Informationen

    Das Modell gibt personenbezogene Daten, Geschäftsgeheimnisse, Zugangsdaten oder interne Details preis — aus Trainingsdaten, aus dem Kontext oder aus angebundenen Systemen.

  • OWASP LLM Top 10 · 2025

    LLM06: Übermäßige Handlungsvollmacht

    Das System darf mehr, als es für seine Aufgabe müsste — zu viele Werkzeuge, zu weite Rechte, zu viel Autonomie ohne menschliche Kontrolle.

Häufige Fragen

Was ist die tödliche Trias?

Die Kombination aus Zugriff auf private Daten, Verarbeitung nicht vertrauenswürdiger Inhalte und der Möglichkeit, nach außen zu kommunizieren. Sind alle drei Eigenschaften gegeben, kann eine Prompt Injection zum Datenabfluss führen.

Welche der drei Eigenschaften lässt sich am leichtesten entfernen?

In der Regel der Kanal nach außen: Ausgehende Ziele einschränken, automatisch geladene Ressourcen unterbinden und Links in Ausgaben bereinigen.

Quellen

  1. Simon Willison: The lethal trifecta for AI agents (16.06.2025): https://simonwillison.net/2025/Jun/16/the-lethal-trifecta/
  2. OWASP GenAI Security Project: LLM02:2025 Sensitive Information Disclosure: https://genai.owasp.org/llmrisk/llm022025-sensitive-information-disclosure/