prompt injections.de
Verzeichnis

Werkzeuge zur Abwehr von Prompt Injection

Dieses Verzeichnis führt 32 defensive Werkzeuge, mit denen sich LLM-Anwendungen gegen Prompt Injection prüfen und härten lassen: Guardrail-Dienste, Schutzmodelle, Scanner, Red-Teaming-Werkzeuge, Benchmarks und Forschungsreferenzen. 19 davon stehen als Open Source zur Verfügung, 9 sind kommerziell, 4 sind Forschungsimplementierungen. Jede Beschreibung stammt aus der jeweils verlinkten Primärquelle des Projekts oder Herstellers. Wirksamkeitsversprechen der Anbieter werden nicht übernommen, weil die Glaubwürdigkeit eines solchen Verzeichnisses sein einziger Wert ist.

Angriffswerkzeuge sind nicht enthalten. Aufgenommen sind ausschließlich Werkzeuge, die dem Betrieb oder der Prüfung eigener Systeme dienen, einschließlich Red-Teaming-Werkzeugen, deren Zweck der Test der eigenen Anwendung ist.

Vor der Auswahl lohnt eine Einordnung: Kein Werkzeug dieser Liste löst Prompt Injection. OWASP hält fest, dass eine vollständige Verhinderung wegen des stochastischen Charakters generativer Modelle unklar bleibt.1 Guardrails senken die Erfolgsquote bekannter Angriffsmuster, Scanner finden bekannte Schwächen, Benchmarks machen Fortschritt messbar. Die strukturelle Abhilfe liegt in der Architektur und ist im Cluster Schutz beschrieben.

Die acht Kategorien

Guardrail-APIs (5). Gehostete Prüfschichten, die vor und hinter das Modell gehängt werden, etwa Lakera Guard, Azure AI Prompt Shields, Amazon Bedrock Guardrails, Model Armor und die OpenAI Moderation API. Schnell integriert, dafür mit Abhängigkeit vom Anbieter und laufender Latenz.

Guardrail-Frameworks (5). Selbst betriebene Prüfketten mit eigener Regel- und Validatorlogik: Rebuff, LLM Guard, Guardrails AI, NeMo Guardrails, LlamaFirewall.

Schutzmodelle (3). Klassifikatoren, die Eingaben als Injektionsversuch einstufen: Llama Prompt Guard, Llama Guard und der DeBERTa-Klassifikator. Als Modelle unterliegen sie denselben Grenzen wie das System, das sie schützen sollen.

Scanner (5). Prüfen Anwendungen, Modelle oder angebundene Server auf bekannte Schwächen: garak, Vigil, Giskard, LangKit und mcp-scan für Werkzeug-Server.

Red Teaming (3). Für den systematischen Angriff auf das eigene System: PyRIT, promptfoo und, als Lernumgebung, Gandalf.

Benchmarks (4). Machen Schutzwirkung vergleichbar: AgentDojo, InjecAgent, Open-Prompt-Injection und der HackAPrompt-Datensatz.

Forschungsreferenzen (4). Implementierungen von Verteidigungsverfahren, die als Vorbild für eigene Architekturen taugen: CaMeL, SecAlign, StruQ und Jatmo.

Plattformen (3). Umfassendere kommerzielle Angebote mit Erkennung, Monitoring und Richtlinienverwaltung: HiddenLayer AISec, Cisco AI Defense, NeuralTrust.

Wie dieses Verzeichnis zu benutzen ist

Jede Werkzeug-Seite folgt derselben Gliederung: Was es ist, Typ und Lizenz, wofür es sich eignet, wofür nicht, verwandte Werkzeuge, Quelle. Der Abschnitt „wofür nicht" ist der eigentliche Zweck des Verzeichnisses. Ein Klassifikator, der Eingaben prüft, hilft nicht gegen eine bereits in der Wissensbasis gespeicherte Anweisung. Ein Guardrail, das Text bewertet, sieht keine Werkzeugaufrufe.

Für die Auswahl gilt deshalb die Reihenfolge: erst die Architektur klären, dann das Werkzeug wählen. Wer wissen will, welche Angriffe gegen sein System überhaupt in Frage kommen, beginnt bei den Angriffsvektoren und dem Katalog der Techniken.

Eine tabellarische Gegenüberstellung der Guardrail-Optionen steht unter Guardrail-Werkzeuge im Vergleich. Die vollständige, nach Typ und Lizenz filterbare Liste folgt unter diesem Text.

Guardrail-API 5

  • Amazon Web Services

    Amazon Bedrock Guardrails

    Konfigurierbare Leitplanken auf Plattformebene mit Filtern für schädliche Inhalte, gesperrte Themen, sensible Daten und Prompt-Angriffe.

    kommerziell
  • Microsoft

    Azure AI Prompt Shields

    Dienst innerhalb von Azure AI Content Safety, der direkte Jailbreak-Angriffe und indirekte Injektionen in eingebetteten Dokumenten erkennt.

    kommerziell
  • Lakera

    Lakera Guard

    Echtzeit-API zur Erkennung von Prompt Injection, Jailbreaks und Datenabfluss, die als Prüfschicht vor und hinter das Sprachmodell gehängt wird.

    kommerziell
  • Google Cloud

    Model Armor

    Dienst zur Prüfung von Prompts und Antworten auf Prompt Injection, Jailbreak-Versuche, sensible Daten und schädliche URLs.

    kommerziell
  • OpenAI

    OpenAI Moderation API

    Klassifikations-API, die Texte und Bilder gegen eine Kategorienliste schädlicher Inhalte prüft.

    kommerziell

Guardrail-Framework 5

  • Guardrails AI

    Guardrails AI

    Framework mit einem Hub austauschbarer Validatoren, die Ein- und Ausgaben gegen definierte Regeln prüfen und bei Verstoß korrigieren oder ablehnen.

    Open Source
  • Meta

    LlamaFirewall

    Guardrail-System für Agenten, das Eingaben, Zwischenschritte der Modell-Argumentation und erzeugten Code prüft, bevor eine riskante Aktion ausgeführt wird.

    Open Source
  • Protect AI

    LLM Guard

    Sicherheits-Toolkit mit Scannern für Eingaben und Ausgaben — Prompt Injection, Anonymisierung, Geheimnisse, Toxizität, Relevanz und mehr.

    Open Source
  • NVIDIA

    NeMo Guardrails

    Framework für programmierbare Leitplanken: Mit der Sprache Colang werden erlaubte Gesprächsverläufe, Themen und Aktionen deklarativ festgelegt.

    Open Source
  • Protect AI

    Rebuff

    Prompt-Injection-Detektor mit vier Schichten: Heuristiken, LLM-basierte Prüfung, Vektor-Datenbank bekannter Angriffe und Canary-Tokens zur Leck-Erkennung.

    Open Source

Schutzmodell 3

  • Protect AI

    DeBERTa Prompt-Injection-Klassifikator

    Feingetuntes DeBERTa-Modell, das Eingaben binär als Prompt Injection oder als unbedenklich klassifiziert.

    Open Source
  • Meta

    Llama Guard

    Auf Inhaltssicherheit spezialisiertes Modell, das Eingaben und Antworten anhand einer anpassbaren Risikotaxonomie klassifiziert.

    Open Source
  • Meta

    Llama Prompt Guard

    Kompaktes Klassifikationsmodell, das Nutzereingaben und abgerufene Inhalte auf Jailbreak- und Injektionsversuche prüft.

    Open Source

Scanner 5

  • NVIDIA

    garak

    Schwachstellen-Scanner für Sprachmodelle mit einer großen Sammlung von Prüfmodulen für Prompt Injection, Jailbreaks, Datenlecks, Toxizität und Halluzination.

    Open Source
  • Giskard

    Giskard

    Testframework für KI-Systeme, das automatisiert nach Schwachstellen sucht — darunter Prompt Injection, Halluzination und Vorurteile — und Testberichte erzeugt.

    Open Source
  • WhyLabs

    LangKit

    Bibliothek zur Extraktion von Telemetriedaten aus Prompts und Antworten, unter anderem Ähnlichkeit zu bekannten Injektionsmustern.

    Open Source
  • Invariant Labs

    mcp-scan

    Prüfwerkzeug für MCP-Server, das Tool-Beschreibungen auf versteckte Anweisungen, Tool-Poisoning und nachträgliche Änderungen untersucht.

    Open Source
  • Vigil (Adam Swanda)

    Vigil

    Python-Bibliothek und REST-API zur Erkennung riskanter LLM-Eingaben — kombiniert Vektorsuche, YARA-Regeln, Transformer-Modell und Canary-Tokens.

    Open Source

Red-Teaming 3

  • Lakera

    Gandalf

    Frei zugängliches Lernspiel, in dem Nutzer stufenweise versuchen, einem geschützten Sprachmodell ein Passwort zu entlocken — verbreitetes Schulungswerkzeug für Sicherheitsteams.

    kommerziell
  • promptfoo

    promptfoo

    Test- und Red-Teaming-Werkzeug für Prompts und Modelle mit Plugin-System für Angriffsklassen und CI-Integration.

    Open Source
  • Microsoft

    PyRIT

    Python Risk Identification Toolkit — Automatisierungs-Framework für KI-Red-Teaming mit Orchestratoren für mehrstufige Angriffe wie Crescendo.

    Open Source

Benchmark 4

  • ETH Zürich (SPY Lab)

    AgentDojo

    Dynamische Testumgebung, die Agenten mit realistischen Aufgaben und eingebetteten Injektionen konfrontiert und Nützlichkeit gegen Sicherheit misst.

    Open Source
  • Learn Prompting

    HackAPrompt-Datensatz

    Offener Datensatz mit über 600.000 realen Angriffs-Prompts aus einem globalen Prompt-Hacking-Wettbewerb, taxonomisch aufbereitet.

    Open Source
  • University of Illinois (Kang Lab)

    InjecAgent

    Benchmark für indirekte Prompt Injection in werkzeugnutzenden Agenten, unterteilt in Angriffe auf Nutzerdaten und auf Nutzeraktionen.

    Open Source
  • Duke University (Forschung)

    Open-Prompt-Injection

    Offenes Framework zur systematischen Bewertung von Prompt-Injection-Angriffen und Abwehrmaßnahmen über mehrere Aufgaben und Modelle hinweg.

    Open Source

Forschungs-Referenz 4

  • Google DeepMind (Forschung)

    CaMeL

    Referenzimplementierung einer architektonischen Abwehr: Kontroll- und Datenfluss werden aus der vertrauenswürdigen Anfrage extrahiert, nicht vertrauenswürdige Daten können den Programmfluss nicht mehr beeinflussen.

    Forschungsarbeit
  • UC Berkeley (Forschung)

    Jatmo

    Ansatz, aufgabenspezifisch feingetunte Modelle ohne Instruktions-Fähigkeit einzusetzen — was keine Anweisungen befolgt, lässt sich auch nicht per Anweisung entführen.

    Forschungsarbeit
  • Meta / UC Berkeley (Forschung)

    SecAlign

    Trainingsverfahren, das Modelle mittels Preference-Optimierung gegen Prompt Injection härtet — es lernt, die injizierte Antwort systematisch niedriger zu bewerten.

    Forschungsarbeit
  • UC Berkeley (Forschung)

    StruQ

    Strukturiertes Instruction-Tuning: Reservierte Sondertoken trennen Anweisungs- und Datenbereich, das Modell lernt, Anweisungen im Datenbereich zu ignorieren.

    Forschungsarbeit

Plattform 3

  • Cisco

    Cisco AI Defense

    Plattform zur Absicherung von KI-Anwendungen mit automatisiertem Modell-Red-Teaming und Laufzeit-Leitplanken.

    kommerziell
  • HiddenLayer

    HiddenLayer AISec Platform

    Sicherheitsplattform für KI-Systeme mit Modell-Scanning, Laufzeitüberwachung und einer eigenen Forschungseinheit für Angriffstechniken.

    kommerziell
  • NeuralTrust

    NeuralTrust

    Gateway und Guardrail-Plattform für LLM-Anwendungen; die hauseigene Forschung veröffentlichte unter anderem die Echo-Chamber-Technik.

    kommerziell

Quellen

  1. OWASP GenAI Security Project: LLM01:2025 Prompt Injection. https://genai.owasp.org/llmrisk/llm01-prompt-injection/

Verzeichnis defensiver Werkzeuge — Guardrails, Scanner, Benchmarks und Schutzmodelle. Keine Angriffswerkzeuge. Funktionsbeschreibungen stammen aus der jeweils verlinkten Primärquelle; es werden keine Wirksamkeitsversprechen der Anbieter übernommen.