Instruktions-Hierarchie
Die Instruktions-Hierarchie ist der Versuch, einem Modell antrainiert beizubringen, welchen Anweisungen es mehr Gewicht geben soll: System vor Nutzer vor Daten. Ein OpenAI-Forschungsteam um Eric Wallace zeigte 2024, dass dieser Ansatz die Robustheit deutlich erhöht — auch gegen im Training nicht gesehene Angriffsarten.
Die Hierarchie ist eine Eigenschaft des Modells, keine Maßnahme des Betreibers. Für die Praxis heißt das: Sie ist ein Auswahlkriterium und eine Erleichterung, kein Ersatz für die Absicherung der Anwendung — Grundlagen unter Was ist Prompt Injection?.
Was die Forschung zeigt
Der Kern des Problems ist laut Wallace et al., dass Modelle den System-Prompt eines Entwicklers mit derselben Priorität behandeln wie Text von nicht vertrauenswürdigen Nutzern. Die vorgeschlagene Hierarchie trainiert das Modell darauf, Anweisungen nach Herkunft zu gewichten und niedrigrangige Anweisungen zu ignorieren, wenn sie höherrangigen widersprechen.
Die berichteten Verbesserungen sind erheblich, aber nicht vollständig. Das Papier hält ausdrücklich fest, dass das Verfahren die Robustheit erhöht, ohne das Problem aufzuheben — die Priorität bleibt eine antrainierte Neigung, keine technische Grenze.
Was Betreiber daraus machen
- Rollen konsequent nutzen: Betreiber-Anweisungen gehören in die Systemrolle, nie in den Nutzerkanal.
- Fremddaten nie in die Systemrolle schreiben — auch nicht „zur besseren Wirkung".
- Bei der Modellauswahl prüfen, ob und wie der Anbieter eine Hierarchie umsetzt.
- Trotzdem prüfen: Ausgabeformat, Rechte und Freigaben bleiben unverzichtbar.
Techniken aus dem Verzeichnis
Diese Einträge aus dem Techniken-Verzeichnis gehören unmittelbar zu diesem Thema — jeder mit Funktionsweise, Risiko-Einstufung, Schutzmaßnahmen und Primärquelle.
-
Anweisungen-ignorieren-Angriff
Der klassische Einstieg in die Prompt Injection: Der Angreifer schreibt in die Nutzereingabe eine Anweisung, die dem Modell befiehlt, seine bisherigen Vorgaben zu verwerfen und stattdessen der neuen Anweisung zu folgen.
Risiko hoch -
Zielentführung
Der Angreifer ersetzt nicht die Regeln, sondern das Ziel der Anwendung: Ein Übersetzungsdienst schreibt plötzlich Werbetexte, ein Support-Bot gibt Rabatte — die Anwendung arbeitet weiter, nur für den Falschen.
Risiko hoch -
System-Prompt-Auslesen
Angriff mit dem Ziel, den verborgenen System-Prompt einer Anwendung offenzulegen — samt Regeln, Rollenbeschreibung und teils eingebetteten Geschäftsgeheimnissen.
Risiko mittel -
Policy Puppetry
Von HiddenLayer 2025 veröffentlichte Technik: Der Angriffs-Prompt wird als strukturierte Richtliniendatei (XML, JSON, INI) formuliert, die das Modell als interne Konfiguration statt als Nutzereingabe interpretiert.
Risiko hoch
Passende Werkzeuge
-
SecAlign
Trainingsverfahren, das Modelle mittels Preference-Optimierung gegen Prompt Injection härtet — es lernt, die injizierte Antwort systematisch niedriger zu bewerten.
Forschungsarbeit -
StruQ
Strukturiertes Instruction-Tuning: Reservierte Sondertoken trennen Anweisungs- und Datenbereich, das Modell lernt, Anweisungen im Datenbereich zu ignorieren.
Forschungsarbeit
Einordnung in die OWASP LLM Top 10
-
LLM01: Prompt Injection
Eingaben verändern das Verhalten des Modells auf eine vom Betreiber nicht vorgesehene Weise — unabhängig davon, ob der Text für Menschen sichtbar ist oder nicht.
-
LLM07: Preisgabe des System-Prompts
Der System-Prompt wird offengelegt — problematisch vor allem dann, wenn er Zugangsdaten, interne Regeln oder Geschäftslogik enthält, die als Sicherheitsmechanismus gedacht waren.
Häufige Fragen
Was ist die Instruktions-Hierarchie?
Ein Trainingsansatz, der einem Sprachmodell eine Rangfolge für Anweisungen beibringt: Systemanweisungen des Betreibers vor Nutzereingaben vor Inhalten aus verarbeiteten Daten.
Löst sie Prompt Injection?
Nein. Sie erhöht die Robustheit deutlich, bleibt aber eine antrainierte Neigung des Modells. Eine technische Trennung von Anweisung und Daten entsteht dadurch nicht.
Quellen
- Wallace, Xiao, Leike, Weng, Heidecke, Beutel: The Instruction Hierarchy (arXiv:2404.13208): https://arxiv.org/abs/2404.13208
- Chen et al.: SecAlign — Defending Against Prompt Injection with Preference Optimization (arXiv:2410.05451): https://arxiv.org/abs/2410.05451