prompt injections.de
Werkzeug · Red-Teaming

promptfoo

Test- und Red-Teaming-Werkzeug für Prompts und Modelle mit Plugin-System für Angriffsklassen und CI-Integration.

Anbieter
promptfoo
Typ
Red-Teaming
Lizenzmodell
Open Source
Primärquelle
github.com

promptfoo ist im Verzeichnis der Werkzeuge geführt, die beim Schutz vor Prompt Injection in LLM-Anwendungen eingesetzt werden. Die Beschreibung stammt aus der Primärquelle des Anbieters; Wirksamkeitsversprechen werden nicht übernommen. Vergleichbare Werkzeuge stehen im Werkzeug-Verzeichnis und im Guardrail-Vergleich.

Wofür es sich eignet

Regressionstests für Prompts und automatisierte Sicherheitsprüfungen bei jedem Deployment.

Was es nicht leistet

Angriffssimulation zeigt vorhandene Schwächen, nie deren Vollständigkeit. Ein bestandener Testlauf ist kein Freibrief für den Produktivbetrieb.

Der Grundsatz gilt unabhängig vom Produkt: Ein Sprachmodell ist kein Sicherheitskontrollpunkt. Wenn eine Aktion Schaden anrichten kann, muss sie außerhalb des Modells autorisiert werden — siehe Least Privilege für KI-Agenten.

Vergleichbare Werkzeuge

  • Lakera

    Gandalf

    Frei zugängliches Lernspiel, in dem Nutzer stufenweise versuchen, einem geschützten Sprachmodell ein Passwort zu entlocken — verbreitetes Schulungswerkzeug für Sicherheitsteams.

    kommerziell
  • Microsoft

    PyRIT

    Python Risk Identification Toolkit — Automatisierungs-Framework für KI-Red-Teaming mit Orchestratoren für mehrstufige Angriffe wie Crescendo.

    Open Source

Quellen

  1. promptfoo — Anbieter- oder Projektquelle: https://github.com/promptfoo/promptfoo