prompt injections.de
Werkzeug · Red-Teaming

Gandalf

Frei zugängliches Lernspiel, in dem Nutzer stufenweise versuchen, einem geschützten Sprachmodell ein Passwort zu entlocken — verbreitetes Schulungswerkzeug für Sicherheitsteams.

Anbieter
Lakera
Typ
Red-Teaming
Lizenzmodell
kommerziell
Primärquelle
gandalf.lakera.ai

Gandalf ist im Verzeichnis der Werkzeuge geführt, die beim Schutz vor Prompt Injection in LLM-Anwendungen eingesetzt werden. Die Beschreibung stammt aus der Primärquelle des Anbieters; Wirksamkeitsversprechen werden nicht übernommen. Vergleichbare Werkzeuge stehen im Werkzeug-Verzeichnis und im Guardrail-Vergleich.

Wofür es sich eignet

Sensibilisierung und Schulung; die gesammelten Versuche fließen in Lakeras Angriffsdatenbestand ein.

Was es nicht leistet

Angriffssimulation zeigt vorhandene Schwächen, nie deren Vollständigkeit. Ein bestandener Testlauf ist kein Freibrief für den Produktivbetrieb.

Der Grundsatz gilt unabhängig vom Produkt: Ein Sprachmodell ist kein Sicherheitskontrollpunkt. Wenn eine Aktion Schaden anrichten kann, muss sie außerhalb des Modells autorisiert werden — siehe Least Privilege für KI-Agenten.

Vergleichbare Werkzeuge

  • Microsoft

    PyRIT

    Python Risk Identification Toolkit — Automatisierungs-Framework für KI-Red-Teaming mit Orchestratoren für mehrstufige Angriffe wie Crescendo.

    Open Source
  • promptfoo

    promptfoo

    Test- und Red-Teaming-Werkzeug für Prompts und Modelle mit Plugin-System für Angriffsklassen und CI-Integration.

    Open Source

Quellen

  1. Gandalf — Anbieter- oder Projektquelle: https://gandalf.lakera.ai/