Guardrails richtig einsetzen
Ein Guardrail ist eine Prüfschicht vor oder hinter dem Sprachmodell: Sie bewertet Eingaben, abgerufene Inhalte oder Ausgaben und blockiert, was gegen die Vorgaben verstößt. Guardrails verschieben Wahrscheinlichkeiten — sie sind kein Zugriffsschutz und keine Autorisierung.
Diese Seite ordnet Guardrails in die Abwehr von Prompt Injection ein. Konkrete Produkte mit Anbieter, Lizenz und Quelle stehen im Werkzeug-Verzeichnis und im Guardrail-Vergleich.
Wo ein Guardrail sitzen sollte
- Vor dem Modell, auf der Nutzereingabe — fängt einfache direkte Injektionen ab.
- Vor dem Modell, auf abgerufenen Inhalten — die praktisch wichtigste Position, weil indirekte Injektion hier ansetzt.
- Hinter dem Modell, auf der Ausgabe — prüft Format, Links und eingebettete Ressourcen vor der Darstellung.
- Vor der Aktion — prüft den konkreten Werkzeugaufruf, nicht den Text. Diese Position ist die wirksamste und wird am häufigsten vergessen.
Realistische Erwartung
Ein Guardrail entscheidet über Sprache und irrt deshalb in beide Richtungen. Für den Betrieb heißt das: Fehlalarme einplanen, Schwellen messbar machen und Umgehungen erwarten. Ein Guardrail, dessen Schwelle nach den ersten Nutzerbeschwerden gelockert wurde, ist praktisch wirkungslos.
Entscheidend ist die Reihenfolge im Entwurf: erst die Rechte begrenzen, dann prüfen. Wer Guardrails als Ersatz für Rechtekontrolle einsetzt, hat die Sicherheitsentscheidung an ein probabilistisches Modell delegiert.
Techniken, gegen die Guardrails antreten
Diese Einträge aus dem Techniken-Verzeichnis gehören unmittelbar zu diesem Thema — jeder mit Funktionsweise, Risiko-Einstufung, Schutzmaßnahmen und Primärquelle.
-
Verweigerungs-Unterdrückung
Dem Modell wird untersagt, typische Ablehnungsformeln zu verwenden („sage niemals ‚Ich kann nicht'") — der sprachliche Ausweg für eine Verweigerung wird ihm damit genommen.
Risiko mittel -
Base64- und Kodierungs-Umgehung
Die schädliche Anweisung wird kodiert übergeben (z. B. Base64) und erst vom Modell selbst dekodiert — Filter, die den Klartext prüfen, greifen ins Leere.
Risiko mittel -
Payload-Splitting
Die schädliche Anweisung wird in harmlose Bruchstücke zerlegt, die einzeln jeden Filter passieren; das Modell setzt sie erst im Kontext wieder zusammen.
Risiko mittel
Passende Werkzeuge
-
Lakera Guard
Echtzeit-API zur Erkennung von Prompt Injection, Jailbreaks und Datenabfluss, die als Prüfschicht vor und hinter das Sprachmodell gehängt wird.
kommerziell -
LLM Guard
Sicherheits-Toolkit mit Scannern für Eingaben und Ausgaben — Prompt Injection, Anonymisierung, Geheimnisse, Toxizität, Relevanz und mehr.
Open Source -
Guardrails AI
Framework mit einem Hub austauschbarer Validatoren, die Ein- und Ausgaben gegen definierte Regeln prüfen und bei Verstoß korrigieren oder ablehnen.
Open Source -
NeMo Guardrails
Framework für programmierbare Leitplanken: Mit der Sprache Colang werden erlaubte Gesprächsverläufe, Themen und Aktionen deklarativ festgelegt.
Open Source -
LlamaFirewall
Guardrail-System für Agenten, das Eingaben, Zwischenschritte der Modell-Argumentation und erzeugten Code prüft, bevor eine riskante Aktion ausgeführt wird.
Open Source -
Azure AI Prompt Shields
Dienst innerhalb von Azure AI Content Safety, der direkte Jailbreak-Angriffe und indirekte Injektionen in eingebetteten Dokumenten erkennt.
kommerziell -
Amazon Bedrock Guardrails
Konfigurierbare Leitplanken auf Plattformebene mit Filtern für schädliche Inhalte, gesperrte Themen, sensible Daten und Prompt-Angriffe.
kommerziell -
Model Armor
Dienst zur Prüfung von Prompts und Antworten auf Prompt Injection, Jailbreak-Versuche, sensible Daten und schädliche URLs.
kommerziell
Einordnung in die OWASP LLM Top 10
-
LLM01: Prompt Injection
Eingaben verändern das Verhalten des Modells auf eine vom Betreiber nicht vorgesehene Weise — unabhängig davon, ob der Text für Menschen sichtbar ist oder nicht.
-
LLM05: Unsichere Verarbeitung von Ausgaben
Ausgaben des Modells werden ungeprüft an nachgelagerte Systeme weitergereicht — als HTML gerendert, als Datenbankabfrage abgesetzt oder als Befehl ausgeführt.
Häufige Fragen
Was ist ein Guardrail bei LLM-Anwendungen?
Eine Prüfschicht vor oder hinter dem Sprachmodell, die Eingaben, abgerufene Inhalte oder Ausgaben gegen definierte Regeln prüft und bei Verstoß blockiert oder umschreibt.
Ersetzt ein Guardrail die Rechtekontrolle?
Nein. Ein Guardrail senkt die Wahrscheinlichkeit eines erfolgreichen Angriffs. Was eine Anwendung darf, muss außerhalb des Modells festgelegt und durchgesetzt werden.
Quellen
- OWASP GenAI Security Project: LLM01:2025 Prompt Injection: https://genai.owasp.org/llmrisk/llm01-prompt-injection/
- Microsoft Learn: Prompt Shields — Jailbreak-Erkennung in Azure AI Content Safety: https://learn.microsoft.com/en-us/azure/ai-services/content-safety/concepts/jailbreak-detection
- BSI: Evasion Attacks on LLMs — Countermeasures: https://www.bsi.bund.de/SharedDocs/Downloads/EN/BSI/KI/Evasion_Attacks_on_LLMs-Countermeasures.pdf