prompt injections.de
Schutzmaßnahme

Guardrails richtig einsetzen

Ein Guardrail ist eine Prüfschicht vor oder hinter dem Sprachmodell: Sie bewertet Eingaben, abgerufene Inhalte oder Ausgaben und blockiert, was gegen die Vorgaben verstößt. Guardrails verschieben Wahrscheinlichkeiten — sie sind kein Zugriffsschutz und keine Autorisierung.

Diese Seite ordnet Guardrails in die Abwehr von Prompt Injection ein. Konkrete Produkte mit Anbieter, Lizenz und Quelle stehen im Werkzeug-Verzeichnis und im Guardrail-Vergleich.

Wo ein Guardrail sitzen sollte

  • Vor dem Modell, auf der Nutzereingabe — fängt einfache direkte Injektionen ab.
  • Vor dem Modell, auf abgerufenen Inhalten — die praktisch wichtigste Position, weil indirekte Injektion hier ansetzt.
  • Hinter dem Modell, auf der Ausgabe — prüft Format, Links und eingebettete Ressourcen vor der Darstellung.
  • Vor der Aktion — prüft den konkreten Werkzeugaufruf, nicht den Text. Diese Position ist die wirksamste und wird am häufigsten vergessen.

Realistische Erwartung

Ein Guardrail entscheidet über Sprache und irrt deshalb in beide Richtungen. Für den Betrieb heißt das: Fehlalarme einplanen, Schwellen messbar machen und Umgehungen erwarten. Ein Guardrail, dessen Schwelle nach den ersten Nutzerbeschwerden gelockert wurde, ist praktisch wirkungslos.

Entscheidend ist die Reihenfolge im Entwurf: erst die Rechte begrenzen, dann prüfen. Wer Guardrails als Ersatz für Rechtekontrolle einsetzt, hat die Sicherheitsentscheidung an ein probabilistisches Modell delegiert.

Techniken, gegen die Guardrails antreten

Diese Einträge aus dem Techniken-Verzeichnis gehören unmittelbar zu diesem Thema — jeder mit Funktionsweise, Risiko-Einstufung, Schutzmaßnahmen und Primärquelle.

  • Jailbreak

    Verweigerungs-Unterdrückung

    Dem Modell wird untersagt, typische Ablehnungsformeln zu verwenden („sage niemals ‚Ich kann nicht'") — der sprachliche Ausweg für eine Verweigerung wird ihm damit genommen.

    Risiko mittel
  • Obfuskation

    Base64- und Kodierungs-Umgehung

    Die schädliche Anweisung wird kodiert übergeben (z. B. Base64) und erst vom Modell selbst dekodiert — Filter, die den Klartext prüfen, greifen ins Leere.

    Risiko mittel
  • Obfuskation

    Payload-Splitting

    Die schädliche Anweisung wird in harmlose Bruchstücke zerlegt, die einzeln jeden Filter passieren; das Modell setzt sie erst im Kontext wieder zusammen.

    Risiko mittel

Passende Werkzeuge

  • Guardrail-API · Lakera

    Lakera Guard

    Echtzeit-API zur Erkennung von Prompt Injection, Jailbreaks und Datenabfluss, die als Prüfschicht vor und hinter das Sprachmodell gehängt wird.

    kommerziell
  • Guardrail-Framework · Protect AI

    LLM Guard

    Sicherheits-Toolkit mit Scannern für Eingaben und Ausgaben — Prompt Injection, Anonymisierung, Geheimnisse, Toxizität, Relevanz und mehr.

    Open Source
  • Guardrail-Framework · Guardrails AI

    Guardrails AI

    Framework mit einem Hub austauschbarer Validatoren, die Ein- und Ausgaben gegen definierte Regeln prüfen und bei Verstoß korrigieren oder ablehnen.

    Open Source
  • Guardrail-Framework · NVIDIA

    NeMo Guardrails

    Framework für programmierbare Leitplanken: Mit der Sprache Colang werden erlaubte Gesprächsverläufe, Themen und Aktionen deklarativ festgelegt.

    Open Source
  • Guardrail-Framework · Meta

    LlamaFirewall

    Guardrail-System für Agenten, das Eingaben, Zwischenschritte der Modell-Argumentation und erzeugten Code prüft, bevor eine riskante Aktion ausgeführt wird.

    Open Source
  • Guardrail-API · Microsoft

    Azure AI Prompt Shields

    Dienst innerhalb von Azure AI Content Safety, der direkte Jailbreak-Angriffe und indirekte Injektionen in eingebetteten Dokumenten erkennt.

    kommerziell
  • Guardrail-API · Amazon Web Services

    Amazon Bedrock Guardrails

    Konfigurierbare Leitplanken auf Plattformebene mit Filtern für schädliche Inhalte, gesperrte Themen, sensible Daten und Prompt-Angriffe.

    kommerziell
  • Guardrail-API · Google Cloud

    Model Armor

    Dienst zur Prüfung von Prompts und Antworten auf Prompt Injection, Jailbreak-Versuche, sensible Daten und schädliche URLs.

    kommerziell

Einordnung in die OWASP LLM Top 10

  • OWASP LLM Top 10 · 2025

    LLM01: Prompt Injection

    Eingaben verändern das Verhalten des Modells auf eine vom Betreiber nicht vorgesehene Weise — unabhängig davon, ob der Text für Menschen sichtbar ist oder nicht.

  • OWASP LLM Top 10 · 2025

    LLM05: Unsichere Verarbeitung von Ausgaben

    Ausgaben des Modells werden ungeprüft an nachgelagerte Systeme weitergereicht — als HTML gerendert, als Datenbankabfrage abgesetzt oder als Befehl ausgeführt.

Häufige Fragen

Was ist ein Guardrail bei LLM-Anwendungen?

Eine Prüfschicht vor oder hinter dem Sprachmodell, die Eingaben, abgerufene Inhalte oder Ausgaben gegen definierte Regeln prüft und bei Verstoß blockiert oder umschreibt.

Ersetzt ein Guardrail die Rechtekontrolle?

Nein. Ein Guardrail senkt die Wahrscheinlichkeit eines erfolgreichen Angriffs. Was eine Anwendung darf, muss außerhalb des Modells festgelegt und durchgesetzt werden.

Quellen

  1. OWASP GenAI Security Project: LLM01:2025 Prompt Injection: https://genai.owasp.org/llmrisk/llm01-prompt-injection/
  2. Microsoft Learn: Prompt Shields — Jailbreak-Erkennung in Azure AI Content Safety: https://learn.microsoft.com/en-us/azure/ai-services/content-safety/concepts/jailbreak-detection
  3. BSI: Evasion Attacks on LLMs — Countermeasures: https://www.bsi.bund.de/SharedDocs/Downloads/EN/BSI/KI/Evasion_Attacks_on_LLMs-Countermeasures.pdf