LLM-Penetrationstest und Red Teaming
Ein LLM-Penetrationstest prüft nicht das Modell, sondern die Anwendung: Welche Rechte hat sie, welche Daten erreicht sie, was passiert, wenn ein Fremdinhalt eine Anweisung enthält? Ein bestandener Testlauf belegt die Abwesenheit der geprüften Schwächen zum Prüfzeitpunkt — nicht Sicherheit.
Red Teaming ist die einzige Methode, die zeigt, wie sich die Abwehr gegen Prompt Injection im Zusammenspiel verhält — Filter, Rechte und Freigaben gemeinsam statt einzeln.
Was geprüft gehört
- Direkte Injektion gegen den Aufgabenrahmen: Lässt sich die Anwendung zweckentfremden?
- Indirekte Injektion über jede angebundene Datenquelle — der wichtigste Teil.
- Datenabfluss über die Ausgabe: Links, Bilder, generierter Code.
- Werkzeugmissbrauch: Welche Aktionen laufen ohne Freigabe?
- Persistenz: Bleiben eingeschleuste Inhalte in Gedächtnis oder Index?
- Belastbarkeit der Filter: Wie viele Umformulierungen braucht eine Umgehung?
Ergebnisse richtig lesen
Die übliche Kennzahl ist die Angriffserfolgsquote. Sie ist nur innerhalb eines Testaufbaus vergleichbar: Andere Angriffsmenge, anderes Modell, andere Quote. Wer Zahlen zwischen Anbietern vergleicht, vergleicht meist Testaufbauten.
Nützlicher als die Quote ist die Frage nach dem Schaden: Welche der erfolgreichen Angriffe hätten eine Aktion mit Außenwirkung ausgelöst? Diese Teilmenge bestimmt das reale Risiko, nicht die Gesamtzahl.
Automatisierte Angriffsverfahren, die im Test vorkommen
Diese Einträge aus dem Techniken-Verzeichnis gehören unmittelbar zu diesem Thema — jeder mit Funktionsweise, Risiko-Einstufung, Schutzmaßnahmen und Primärquelle.
-
GCG-Suffix-Angriff
Gradientenbasiertes Verfahren, das automatisch eine scheinbar sinnlose Zeichenkette berechnet, die an beliebige Anfragen angehängt die Verweigerung des Modells aushebelt.
Risiko hoch -
AutoDAN
Verfahren, das mit einem genetischen Algorithmus Jailbreak-Prompts erzeugt, die im Gegensatz zu GCG-Suffixen sprachlich unauffällig und damit für Perplexitäts-Filter schwer erkennbar sind.
Risiko hoch -
PAIR (iterative Prompt-Verfeinerung)
Ein angreifendes Sprachmodell verfeinert seinen Prompt anhand der Antworten des Zielmodells — die Autoren berichten Jailbreaks häufig in unter zwanzig Anfragen, ohne Zugriff auf Modellgewichte.
Risiko hoch -
Tree of Attacks (TAP)
Weiterentwicklung von PAIR: Statt einer linearen Verfeinerung wird ein Baum von Angriffspfaden aufgespannt, aussichtslose Zweige werden früh abgeschnitten.
Risiko hoch -
Best-of-N-Jailbreaking
Ein Black-Box-Verfahren, das dieselbe Anfrage in vielen zufällig variierten Schreibweisen stellt, bis eine Variante die Schutzmechanismen passiert — auch für Bild und Audio anwendbar.
Risiko hoch -
Projizierter Gradientenabstieg
White-Box-Angriff, der adversariale Eingaben im kontinuierlichen Einbettungsraum optimiert und dadurch deutlich schneller zum Ziel kommt als diskrete Suchverfahren.
Risiko mittel
Passende Werkzeuge
-
garak
Schwachstellen-Scanner für Sprachmodelle mit einer großen Sammlung von Prüfmodulen für Prompt Injection, Jailbreaks, Datenlecks, Toxizität und Halluzination.
Open Source -
PyRIT
Python Risk Identification Toolkit — Automatisierungs-Framework für KI-Red-Teaming mit Orchestratoren für mehrstufige Angriffe wie Crescendo.
Open Source -
promptfoo
Test- und Red-Teaming-Werkzeug für Prompts und Modelle mit Plugin-System für Angriffsklassen und CI-Integration.
Open Source -
Giskard
Testframework für KI-Systeme, das automatisiert nach Schwachstellen sucht — darunter Prompt Injection, Halluzination und Vorurteile — und Testberichte erzeugt.
Open Source -
AgentDojo
Dynamische Testumgebung, die Agenten mit realistischen Aufgaben und eingebetteten Injektionen konfrontiert und Nützlichkeit gegen Sicherheit misst.
Open Source -
HackAPrompt-Datensatz
Offener Datensatz mit über 600.000 realen Angriffs-Prompts aus einem globalen Prompt-Hacking-Wettbewerb, taxonomisch aufbereitet.
Open Source
Einordnung in die OWASP LLM Top 10
-
LLM01: Prompt Injection
Eingaben verändern das Verhalten des Modells auf eine vom Betreiber nicht vorgesehene Weise — unabhängig davon, ob der Text für Menschen sichtbar ist oder nicht.
Häufige Fragen
Was prüft ein LLM-Penetrationstest?
Die Anwendung, nicht das Modell: direkte und indirekte Injektion über alle Datenquellen, Datenabfluss über die Ausgabe, Werkzeugmissbrauch, Persistenz eingeschleuster Inhalte und die Belastbarkeit vorhandener Filter.
Was sagt die Angriffserfolgsquote aus?
Sie ist nur innerhalb eines Testaufbaus vergleichbar. Aussagekräftiger ist, welcher Anteil der erfolgreichen Angriffe eine Aktion mit Außenwirkung ausgelöst hätte.
Quellen
- NIST AI Risk Management Framework: https://www.nist.gov/itl/ai-risk-management-framework
- garak — LLM Vulnerability Scanner: https://github.com/NVIDIA/garak
- PyRIT — Python Risk Identification Tool for generative AI: https://github.com/Azure/PyRIT