prompt injections.de
Schutzmaßnahme

Sichere Verarbeitung von Modellausgaben

Die Ausgabe eines Sprachmodells ist eine nicht vertrauenswürdige Eingabe für alles, was danach kommt: für die Darstellung im Browser, für die Datenbank, für die Shell, für den nächsten Agenten. OWASP führt den unsachgemäßen Umgang damit als eigenes Risiko (LLM05).

Ausgabeprüfung ist die Schicht, die aus einer erfolgreichen Prompt Injection noch keinen Schaden werden lässt. Sie ist damit oft wirksamer als jede Eingabeprüfung.

Die drei Ausgabekanäle mit Schadenspotenzial

  • Darstellung. Markdown-Bilder und Links sind ein Abflussweg: Das Rendern löst einen Abruf aus, dessen URL Daten enthalten kann. Ausgehende Ziele einschränken und Parameter bereinigen.
  • Weiterverarbeitung. Generierter Code, SQL oder Shell-Befehle gehören niemals ungeprüft ausgeführt — hier gilt dieselbe Sorgfalt wie bei jeder anderen fremden Eingabe.
  • Weitergabe an Agenten. Was ein Modell ausgibt, ist für den nächsten Schritt Fremdtext. In Multi-Agenten-Systemen wandert eine Anweisung sonst durch die Kette.

Formatprüfung als Standardmaßnahme

Ein erzwungenes Ausgabeformat — etwa ein Schema mit festen Feldern — macht Abweichungen sichtbar und begrenzt, was überhaupt transportiert werden kann. OWASP empfiehlt für LLM01 ausdrücklich, erwartete Ausgabeformate zu definieren und zu prüfen.

Der Grundsatz dahinter: Vertrauen entsteht nicht dadurch, dass die Antwort plausibel aussieht, sondern dadurch, dass sie eine Prüfung außerhalb des Modells besteht.

Techniken, die über die Ausgabe wirken

Diese Einträge aus dem Techniken-Verzeichnis gehören unmittelbar zu diesem Thema — jeder mit Funktionsweise, Risiko-Einstufung, Schutzmaßnahmen und Primärquelle.

  • Datenabfluss

    Datenabfluss über Markdown-Bilder

    Das Modell wird veranlasst, ein Bild einzubetten, dessen URL die zu stehlenden Daten als Parameter enthält. Das Rendern der Antwort löst den Abruf aus und schickt die Daten an den Angreifer.

    Risiko hoch
  • Datenabfluss

    Datenabfluss über präparierte Links

    Die Antwort des Assistenten enthält einen scheinbar hilfreichen Link, in dessen Parametern vertrauliche Daten stecken — ein Klick des Nutzers genügt für den Abfluss.

    Risiko hoch
  • Angriff auf Agenten

    Code-Injektion über LLM-Ausgaben

    Die Ausgabe des Modells wird ungeprüft weiterverarbeitet — als HTML gerendert, als SQL abgesetzt, als Shell-Befehl ausgeführt. Eine Injektion wird damit zu klassischer Codeausführung.

    Risiko hoch

Passende Werkzeuge

  • Guardrail-Framework · Protect AI

    LLM Guard

    Sicherheits-Toolkit mit Scannern für Eingaben und Ausgaben — Prompt Injection, Anonymisierung, Geheimnisse, Toxizität, Relevanz und mehr.

    Open Source
  • Guardrail-Framework · Guardrails AI

    Guardrails AI

    Framework mit einem Hub austauschbarer Validatoren, die Ein- und Ausgaben gegen definierte Regeln prüfen und bei Verstoß korrigieren oder ablehnen.

    Open Source
  • Guardrail-Framework · Meta

    LlamaFirewall

    Guardrail-System für Agenten, das Eingaben, Zwischenschritte der Modell-Argumentation und erzeugten Code prüft, bevor eine riskante Aktion ausgeführt wird.

    Open Source

Einordnung in die OWASP LLM Top 10

  • OWASP LLM Top 10 · 2025

    LLM05: Unsichere Verarbeitung von Ausgaben

    Ausgaben des Modells werden ungeprüft an nachgelagerte Systeme weitergereicht — als HTML gerendert, als Datenbankabfrage abgesetzt oder als Befehl ausgeführt.

  • OWASP LLM Top 10 · 2025

    LLM02: Offenlegung sensibler Informationen

    Das Modell gibt personenbezogene Daten, Geschäftsgeheimnisse, Zugangsdaten oder interne Details preis — aus Trainingsdaten, aus dem Kontext oder aus angebundenen Systemen.

Häufige Fragen

Warum ist die Ausgabe eines LLM ein Sicherheitsrisiko?

Weil sie von nachgelagerten Systemen weiterverarbeitet wird — im Browser gerendert, als Code ausgeführt, an einen weiteren Agenten übergeben. OWASP führt unsachgemäßes Output Handling als Risiko LLM05:2025.

Wie verhindert man Datenabfluss über Links in der Antwort?

Ausgehende Ziele einschränken, Parameter bereinigen und automatisch geladene Ressourcen wie Bilder aus Modellantworten unterbinden oder auf freigegebene Domains begrenzen.