Werkzeuge zur Abwehr von Prompt Injection
Dieses Verzeichnis führt 32 defensive Werkzeuge, mit denen sich LLM-Anwendungen gegen Prompt Injection prüfen und härten lassen: Guardrail-Dienste, Schutzmodelle, Scanner, Red-Teaming-Werkzeuge, Benchmarks und Forschungsreferenzen. 19 davon stehen als Open Source zur Verfügung, 9 sind kommerziell, 4 sind Forschungsimplementierungen. Jede Beschreibung stammt aus der jeweils verlinkten Primärquelle des Projekts oder Herstellers. Wirksamkeitsversprechen der Anbieter werden nicht übernommen, weil die Glaubwürdigkeit eines solchen Verzeichnisses sein einziger Wert ist.
Angriffswerkzeuge sind nicht enthalten. Aufgenommen sind ausschließlich Werkzeuge, die dem Betrieb oder der Prüfung eigener Systeme dienen, einschließlich Red-Teaming-Werkzeugen, deren Zweck der Test der eigenen Anwendung ist.
Vor der Auswahl lohnt eine Einordnung: Kein Werkzeug dieser Liste löst Prompt Injection. OWASP hält fest, dass eine vollständige Verhinderung wegen des stochastischen Charakters generativer Modelle unklar bleibt.1 Guardrails senken die Erfolgsquote bekannter Angriffsmuster, Scanner finden bekannte Schwächen, Benchmarks machen Fortschritt messbar. Die strukturelle Abhilfe liegt in der Architektur und ist im Cluster Schutz beschrieben.
Die acht Kategorien
Guardrail-APIs (5). Gehostete Prüfschichten, die vor und hinter das Modell gehängt werden, etwa Lakera Guard, Azure AI Prompt Shields, Amazon Bedrock Guardrails, Model Armor und die OpenAI Moderation API. Schnell integriert, dafür mit Abhängigkeit vom Anbieter und laufender Latenz.
Guardrail-Frameworks (5). Selbst betriebene Prüfketten mit eigener Regel- und Validatorlogik: Rebuff, LLM Guard, Guardrails AI, NeMo Guardrails, LlamaFirewall.
Schutzmodelle (3). Klassifikatoren, die Eingaben als Injektionsversuch einstufen: Llama Prompt Guard, Llama Guard und der DeBERTa-Klassifikator. Als Modelle unterliegen sie denselben Grenzen wie das System, das sie schützen sollen.
Scanner (5). Prüfen Anwendungen, Modelle oder angebundene Server auf bekannte Schwächen: garak, Vigil, Giskard, LangKit und mcp-scan für Werkzeug-Server.
Red Teaming (3). Für den systematischen Angriff auf das eigene System: PyRIT, promptfoo und, als Lernumgebung, Gandalf.
Benchmarks (4). Machen Schutzwirkung vergleichbar: AgentDojo, InjecAgent, Open-Prompt-Injection und der HackAPrompt-Datensatz.
Forschungsreferenzen (4). Implementierungen von Verteidigungsverfahren, die als Vorbild für eigene Architekturen taugen: CaMeL, SecAlign, StruQ und Jatmo.
Plattformen (3). Umfassendere kommerzielle Angebote mit Erkennung, Monitoring und Richtlinienverwaltung: HiddenLayer AISec, Cisco AI Defense, NeuralTrust.
Wie dieses Verzeichnis zu benutzen ist
Jede Werkzeug-Seite folgt derselben Gliederung: Was es ist, Typ und Lizenz, wofür es sich eignet, wofür nicht, verwandte Werkzeuge, Quelle. Der Abschnitt „wofür nicht" ist der eigentliche Zweck des Verzeichnisses. Ein Klassifikator, der Eingaben prüft, hilft nicht gegen eine bereits in der Wissensbasis gespeicherte Anweisung. Ein Guardrail, das Text bewertet, sieht keine Werkzeugaufrufe.
Für die Auswahl gilt deshalb die Reihenfolge: erst die Architektur klären, dann das Werkzeug wählen. Wer wissen will, welche Angriffe gegen sein System überhaupt in Frage kommen, beginnt bei den Angriffsvektoren und dem Katalog der Techniken.
Eine tabellarische Gegenüberstellung der Guardrail-Optionen steht unter Guardrail-Werkzeuge im Vergleich. Die vollständige, nach Typ und Lizenz filterbare Liste folgt unter diesem Text.
Guardrail-API 5
-
Amazon Bedrock Guardrails
Konfigurierbare Leitplanken auf Plattformebene mit Filtern für schädliche Inhalte, gesperrte Themen, sensible Daten und Prompt-Angriffe.
kommerziell -
Azure AI Prompt Shields
Dienst innerhalb von Azure AI Content Safety, der direkte Jailbreak-Angriffe und indirekte Injektionen in eingebetteten Dokumenten erkennt.
kommerziell -
Lakera Guard
Echtzeit-API zur Erkennung von Prompt Injection, Jailbreaks und Datenabfluss, die als Prüfschicht vor und hinter das Sprachmodell gehängt wird.
kommerziell -
Model Armor
Dienst zur Prüfung von Prompts und Antworten auf Prompt Injection, Jailbreak-Versuche, sensible Daten und schädliche URLs.
kommerziell -
OpenAI Moderation API
Klassifikations-API, die Texte und Bilder gegen eine Kategorienliste schädlicher Inhalte prüft.
kommerziell
Guardrail-Framework 5
-
Guardrails AI
Framework mit einem Hub austauschbarer Validatoren, die Ein- und Ausgaben gegen definierte Regeln prüfen und bei Verstoß korrigieren oder ablehnen.
Open Source -
LlamaFirewall
Guardrail-System für Agenten, das Eingaben, Zwischenschritte der Modell-Argumentation und erzeugten Code prüft, bevor eine riskante Aktion ausgeführt wird.
Open Source -
LLM Guard
Sicherheits-Toolkit mit Scannern für Eingaben und Ausgaben — Prompt Injection, Anonymisierung, Geheimnisse, Toxizität, Relevanz und mehr.
Open Source -
NeMo Guardrails
Framework für programmierbare Leitplanken: Mit der Sprache Colang werden erlaubte Gesprächsverläufe, Themen und Aktionen deklarativ festgelegt.
Open Source -
Rebuff
Prompt-Injection-Detektor mit vier Schichten: Heuristiken, LLM-basierte Prüfung, Vektor-Datenbank bekannter Angriffe und Canary-Tokens zur Leck-Erkennung.
Open Source
Schutzmodell 3
-
DeBERTa Prompt-Injection-Klassifikator
Feingetuntes DeBERTa-Modell, das Eingaben binär als Prompt Injection oder als unbedenklich klassifiziert.
Open Source -
Llama Guard
Auf Inhaltssicherheit spezialisiertes Modell, das Eingaben und Antworten anhand einer anpassbaren Risikotaxonomie klassifiziert.
Open Source -
Llama Prompt Guard
Kompaktes Klassifikationsmodell, das Nutzereingaben und abgerufene Inhalte auf Jailbreak- und Injektionsversuche prüft.
Open Source
Scanner 5
-
garak
Schwachstellen-Scanner für Sprachmodelle mit einer großen Sammlung von Prüfmodulen für Prompt Injection, Jailbreaks, Datenlecks, Toxizität und Halluzination.
Open Source -
Giskard
Testframework für KI-Systeme, das automatisiert nach Schwachstellen sucht — darunter Prompt Injection, Halluzination und Vorurteile — und Testberichte erzeugt.
Open Source -
LangKit
Bibliothek zur Extraktion von Telemetriedaten aus Prompts und Antworten, unter anderem Ähnlichkeit zu bekannten Injektionsmustern.
Open Source -
mcp-scan
Prüfwerkzeug für MCP-Server, das Tool-Beschreibungen auf versteckte Anweisungen, Tool-Poisoning und nachträgliche Änderungen untersucht.
Open Source -
Vigil
Python-Bibliothek und REST-API zur Erkennung riskanter LLM-Eingaben — kombiniert Vektorsuche, YARA-Regeln, Transformer-Modell und Canary-Tokens.
Open Source
Red-Teaming 3
-
Gandalf
Frei zugängliches Lernspiel, in dem Nutzer stufenweise versuchen, einem geschützten Sprachmodell ein Passwort zu entlocken — verbreitetes Schulungswerkzeug für Sicherheitsteams.
kommerziell -
promptfoo
Test- und Red-Teaming-Werkzeug für Prompts und Modelle mit Plugin-System für Angriffsklassen und CI-Integration.
Open Source -
PyRIT
Python Risk Identification Toolkit — Automatisierungs-Framework für KI-Red-Teaming mit Orchestratoren für mehrstufige Angriffe wie Crescendo.
Open Source
Benchmark 4
-
AgentDojo
Dynamische Testumgebung, die Agenten mit realistischen Aufgaben und eingebetteten Injektionen konfrontiert und Nützlichkeit gegen Sicherheit misst.
Open Source -
HackAPrompt-Datensatz
Offener Datensatz mit über 600.000 realen Angriffs-Prompts aus einem globalen Prompt-Hacking-Wettbewerb, taxonomisch aufbereitet.
Open Source -
InjecAgent
Benchmark für indirekte Prompt Injection in werkzeugnutzenden Agenten, unterteilt in Angriffe auf Nutzerdaten und auf Nutzeraktionen.
Open Source -
Open-Prompt-Injection
Offenes Framework zur systematischen Bewertung von Prompt-Injection-Angriffen und Abwehrmaßnahmen über mehrere Aufgaben und Modelle hinweg.
Open Source
Forschungs-Referenz 4
-
CaMeL
Referenzimplementierung einer architektonischen Abwehr: Kontroll- und Datenfluss werden aus der vertrauenswürdigen Anfrage extrahiert, nicht vertrauenswürdige Daten können den Programmfluss nicht mehr beeinflussen.
Forschungsarbeit -
Jatmo
Ansatz, aufgabenspezifisch feingetunte Modelle ohne Instruktions-Fähigkeit einzusetzen — was keine Anweisungen befolgt, lässt sich auch nicht per Anweisung entführen.
Forschungsarbeit -
SecAlign
Trainingsverfahren, das Modelle mittels Preference-Optimierung gegen Prompt Injection härtet — es lernt, die injizierte Antwort systematisch niedriger zu bewerten.
Forschungsarbeit -
StruQ
Strukturiertes Instruction-Tuning: Reservierte Sondertoken trennen Anweisungs- und Datenbereich, das Modell lernt, Anweisungen im Datenbereich zu ignorieren.
Forschungsarbeit
Plattform 3
-
Cisco AI Defense
Plattform zur Absicherung von KI-Anwendungen mit automatisiertem Modell-Red-Teaming und Laufzeit-Leitplanken.
kommerziell -
HiddenLayer AISec Platform
Sicherheitsplattform für KI-Systeme mit Modell-Scanning, Laufzeitüberwachung und einer eigenen Forschungseinheit für Angriffstechniken.
kommerziell -
NeuralTrust
Gateway und Guardrail-Plattform für LLM-Anwendungen; die hauseigene Forschung veröffentlichte unter anderem die Echo-Chamber-Technik.
kommerziell
Quellen
- OWASP GenAI Security Project: LLM01:2025 Prompt Injection. https://genai.owasp.org/llmrisk/llm01-prompt-injection/ ↩
Verzeichnis defensiver Werkzeuge — Guardrails, Scanner, Benchmarks und Schutzmodelle. Keine Angriffswerkzeuge. Funktionsbeschreibungen stammen aus der jeweils verlinkten Primärquelle; es werden keine Wirksamkeitsversprechen der Anbieter übernommen.