Sichere Verarbeitung von Modellausgaben
Die Ausgabe eines Sprachmodells ist eine nicht vertrauenswürdige Eingabe für alles, was danach kommt: für die Darstellung im Browser, für die Datenbank, für die Shell, für den nächsten Agenten. OWASP führt den unsachgemäßen Umgang damit als eigenes Risiko (LLM05).
Ausgabeprüfung ist die Schicht, die aus einer erfolgreichen Prompt Injection noch keinen Schaden werden lässt. Sie ist damit oft wirksamer als jede Eingabeprüfung.
Die drei Ausgabekanäle mit Schadenspotenzial
- Darstellung. Markdown-Bilder und Links sind ein Abflussweg: Das Rendern löst einen Abruf aus, dessen URL Daten enthalten kann. Ausgehende Ziele einschränken und Parameter bereinigen.
- Weiterverarbeitung. Generierter Code, SQL oder Shell-Befehle gehören niemals ungeprüft ausgeführt — hier gilt dieselbe Sorgfalt wie bei jeder anderen fremden Eingabe.
- Weitergabe an Agenten. Was ein Modell ausgibt, ist für den nächsten Schritt Fremdtext. In Multi-Agenten-Systemen wandert eine Anweisung sonst durch die Kette.
Formatprüfung als Standardmaßnahme
Ein erzwungenes Ausgabeformat — etwa ein Schema mit festen Feldern — macht Abweichungen sichtbar und begrenzt, was überhaupt transportiert werden kann. OWASP empfiehlt für LLM01 ausdrücklich, erwartete Ausgabeformate zu definieren und zu prüfen.
Der Grundsatz dahinter: Vertrauen entsteht nicht dadurch, dass die Antwort plausibel aussieht, sondern dadurch, dass sie eine Prüfung außerhalb des Modells besteht.
Techniken, die über die Ausgabe wirken
Diese Einträge aus dem Techniken-Verzeichnis gehören unmittelbar zu diesem Thema — jeder mit Funktionsweise, Risiko-Einstufung, Schutzmaßnahmen und Primärquelle.
-
Datenabfluss über Markdown-Bilder
Das Modell wird veranlasst, ein Bild einzubetten, dessen URL die zu stehlenden Daten als Parameter enthält. Das Rendern der Antwort löst den Abruf aus und schickt die Daten an den Angreifer.
Risiko hoch -
Datenabfluss über präparierte Links
Die Antwort des Assistenten enthält einen scheinbar hilfreichen Link, in dessen Parametern vertrauliche Daten stecken — ein Klick des Nutzers genügt für den Abfluss.
Risiko hoch -
Code-Injektion über LLM-Ausgaben
Die Ausgabe des Modells wird ungeprüft weiterverarbeitet — als HTML gerendert, als SQL abgesetzt, als Shell-Befehl ausgeführt. Eine Injektion wird damit zu klassischer Codeausführung.
Risiko hoch
Passende Werkzeuge
-
LLM Guard
Sicherheits-Toolkit mit Scannern für Eingaben und Ausgaben — Prompt Injection, Anonymisierung, Geheimnisse, Toxizität, Relevanz und mehr.
Open Source -
Guardrails AI
Framework mit einem Hub austauschbarer Validatoren, die Ein- und Ausgaben gegen definierte Regeln prüfen und bei Verstoß korrigieren oder ablehnen.
Open Source -
LlamaFirewall
Guardrail-System für Agenten, das Eingaben, Zwischenschritte der Modell-Argumentation und erzeugten Code prüft, bevor eine riskante Aktion ausgeführt wird.
Open Source
Einordnung in die OWASP LLM Top 10
-
LLM05: Unsichere Verarbeitung von Ausgaben
Ausgaben des Modells werden ungeprüft an nachgelagerte Systeme weitergereicht — als HTML gerendert, als Datenbankabfrage abgesetzt oder als Befehl ausgeführt.
-
LLM02: Offenlegung sensibler Informationen
Das Modell gibt personenbezogene Daten, Geschäftsgeheimnisse, Zugangsdaten oder interne Details preis — aus Trainingsdaten, aus dem Kontext oder aus angebundenen Systemen.
Häufige Fragen
Warum ist die Ausgabe eines LLM ein Sicherheitsrisiko?
Weil sie von nachgelagerten Systemen weiterverarbeitet wird — im Browser gerendert, als Code ausgeführt, an einen weiteren Agenten übergeben. OWASP führt unsachgemäßes Output Handling als Risiko LLM05:2025.
Wie verhindert man Datenabfluss über Links in der Antwort?
Ausgehende Ziele einschränken, Parameter bereinigen und automatisch geladene Ressourcen wie Bilder aus Modellantworten unterbinden oder auf freigegebene Domains begrenzen.
Quellen
- OWASP GenAI Security Project: LLM05:2025 Improper Output Handling: https://genai.owasp.org/llmrisk/llm052025-improper-output-handling/
- Johann Rehberger: Data Exfiltration via Markdown Images: https://embracethered.com/blog/posts/2023/data-exfiltration-in-azure-openai-playground-fixed/