prompt injections.de
Werkzeug · Schutzmodell

DeBERTa Prompt-Injection-Klassifikator

Feingetuntes DeBERTa-Modell, das Eingaben binär als Prompt Injection oder als unbedenklich klassifiziert.

Anbieter
Protect AI
Typ
Schutzmodell
Lizenzmodell
Open Source
Primärquelle
huggingface.co

DeBERTa Prompt-Injection-Klassifikator ist im Verzeichnis der Werkzeuge geführt, die beim Schutz vor Prompt Injection in LLM-Anwendungen eingesetzt werden. Die Beschreibung stammt aus der Primärquelle des Anbieters; Wirksamkeitsversprechen werden nicht übernommen. Vergleichbare Werkzeuge stehen im Werkzeug-Verzeichnis und im Guardrail-Vergleich.

Wofür es sich eignet

Schnelle, lokal betreibbare Vorfilterung ohne API-Aufruf an Dritte.

Was es nicht leistet

Ein Klassifikator entscheidet probabilistisch. Er erkennt bekannte Muster zuverlässiger als neue und sollte deshalb als eine Schicht unter mehreren geplant werden.

Der Grundsatz gilt unabhängig vom Produkt: Ein Sprachmodell ist kein Sicherheitskontrollpunkt. Wenn eine Aktion Schaden anrichten kann, muss sie außerhalb des Modells autorisiert werden — siehe Least Privilege für KI-Agenten.

Vergleichbare Werkzeuge

  • Meta

    Llama Prompt Guard

    Kompaktes Klassifikationsmodell, das Nutzereingaben und abgerufene Inhalte auf Jailbreak- und Injektionsversuche prüft.

    Open Source
  • Meta

    Llama Guard

    Auf Inhaltssicherheit spezialisiertes Modell, das Eingaben und Antworten anhand einer anpassbaren Risikotaxonomie klassifiziert.

    Open Source