prompt injections.de
Werkzeug · Forschungs-Referenz

SecAlign

Trainingsverfahren, das Modelle mittels Preference-Optimierung gegen Prompt Injection härtet — es lernt, die injizierte Antwort systematisch niedriger zu bewerten.

Anbieter
Meta / UC Berkeley (Forschung)
Typ
Forschungs-Referenz
Lizenzmodell
Forschungsarbeit
Primärquelle
github.com

SecAlign ist im Verzeichnis der Werkzeuge geführt, die beim Schutz vor Prompt Injection in LLM-Anwendungen eingesetzt werden. Die Beschreibung stammt aus der Primärquelle des Anbieters; Wirksamkeitsversprechen werden nicht übernommen. Vergleichbare Werkzeuge stehen im Werkzeug-Verzeichnis und im Guardrail-Vergleich.

Wofür es sich eignet

Modellseitige Härtung als Ergänzung zu externen Guardrails.

Was es nicht leistet

Forschungsarbeiten liefern das Prinzip, keinen betriebsfertigen Baustein. Die Übertragung in ein Produktivsystem ist eigene Ingenieursarbeit.

Der Grundsatz gilt unabhängig vom Produkt: Ein Sprachmodell ist kein Sicherheitskontrollpunkt. Wenn eine Aktion Schaden anrichten kann, muss sie außerhalb des Modells autorisiert werden — siehe Least Privilege für KI-Agenten.

Vergleichbare Werkzeuge

  • Google DeepMind (Forschung)

    CaMeL

    Referenzimplementierung einer architektonischen Abwehr: Kontroll- und Datenfluss werden aus der vertrauenswürdigen Anfrage extrahiert, nicht vertrauenswürdige Daten können den Programmfluss nicht mehr beeinflussen.

    Forschungsarbeit
  • UC Berkeley (Forschung)

    StruQ

    Strukturiertes Instruction-Tuning: Reservierte Sondertoken trennen Anweisungs- und Datenbereich, das Modell lernt, Anweisungen im Datenbereich zu ignorieren.

    Forschungsarbeit
  • UC Berkeley (Forschung)

    Jatmo

    Ansatz, aufgabenspezifisch feingetunte Modelle ohne Instruktions-Fähigkeit einzusetzen — was keine Anweisungen befolgt, lässt sich auch nicht per Anweisung entführen.

    Forschungsarbeit