prompt injections.de
Schutzmaßnahme

LLM-Penetrationstest und Red Teaming

Ein LLM-Penetrationstest prüft nicht das Modell, sondern die Anwendung: Welche Rechte hat sie, welche Daten erreicht sie, was passiert, wenn ein Fremdinhalt eine Anweisung enthält? Ein bestandener Testlauf belegt die Abwesenheit der geprüften Schwächen zum Prüfzeitpunkt — nicht Sicherheit.

Red Teaming ist die einzige Methode, die zeigt, wie sich die Abwehr gegen Prompt Injection im Zusammenspiel verhält — Filter, Rechte und Freigaben gemeinsam statt einzeln.

Was geprüft gehört

  • Direkte Injektion gegen den Aufgabenrahmen: Lässt sich die Anwendung zweckentfremden?
  • Indirekte Injektion über jede angebundene Datenquelle — der wichtigste Teil.
  • Datenabfluss über die Ausgabe: Links, Bilder, generierter Code.
  • Werkzeugmissbrauch: Welche Aktionen laufen ohne Freigabe?
  • Persistenz: Bleiben eingeschleuste Inhalte in Gedächtnis oder Index?
  • Belastbarkeit der Filter: Wie viele Umformulierungen braucht eine Umgehung?

Ergebnisse richtig lesen

Die übliche Kennzahl ist die Angriffserfolgsquote. Sie ist nur innerhalb eines Testaufbaus vergleichbar: Andere Angriffsmenge, anderes Modell, andere Quote. Wer Zahlen zwischen Anbietern vergleicht, vergleicht meist Testaufbauten.

Nützlicher als die Quote ist die Frage nach dem Schaden: Welche der erfolgreichen Angriffe hätten eine Aktion mit Außenwirkung ausgelöst? Diese Teilmenge bestimmt das reale Risiko, nicht die Gesamtzahl.

Automatisierte Angriffsverfahren, die im Test vorkommen

Diese Einträge aus dem Techniken-Verzeichnis gehören unmittelbar zu diesem Thema — jeder mit Funktionsweise, Risiko-Einstufung, Schutzmaßnahmen und Primärquelle.

  • Automatisierter Angriff

    GCG-Suffix-Angriff

    Gradientenbasiertes Verfahren, das automatisch eine scheinbar sinnlose Zeichenkette berechnet, die an beliebige Anfragen angehängt die Verweigerung des Modells aushebelt.

    Risiko hoch
  • Automatisierter Angriff

    AutoDAN

    Verfahren, das mit einem genetischen Algorithmus Jailbreak-Prompts erzeugt, die im Gegensatz zu GCG-Suffixen sprachlich unauffällig und damit für Perplexitäts-Filter schwer erkennbar sind.

    Risiko hoch
  • Automatisierter Angriff

    PAIR (iterative Prompt-Verfeinerung)

    Ein angreifendes Sprachmodell verfeinert seinen Prompt anhand der Antworten des Zielmodells — die Autoren berichten Jailbreaks häufig in unter zwanzig Anfragen, ohne Zugriff auf Modellgewichte.

    Risiko hoch
  • Automatisierter Angriff

    Tree of Attacks (TAP)

    Weiterentwicklung von PAIR: Statt einer linearen Verfeinerung wird ein Baum von Angriffspfaden aufgespannt, aussichtslose Zweige werden früh abgeschnitten.

    Risiko hoch
  • Automatisierter Angriff

    Best-of-N-Jailbreaking

    Ein Black-Box-Verfahren, das dieselbe Anfrage in vielen zufällig variierten Schreibweisen stellt, bis eine Variante die Schutzmechanismen passiert — auch für Bild und Audio anwendbar.

    Risiko hoch
  • Automatisierter Angriff

    Projizierter Gradientenabstieg

    White-Box-Angriff, der adversariale Eingaben im kontinuierlichen Einbettungsraum optimiert und dadurch deutlich schneller zum Ziel kommt als diskrete Suchverfahren.

    Risiko mittel

Passende Werkzeuge

  • Scanner · NVIDIA

    garak

    Schwachstellen-Scanner für Sprachmodelle mit einer großen Sammlung von Prüfmodulen für Prompt Injection, Jailbreaks, Datenlecks, Toxizität und Halluzination.

    Open Source
  • Red-Teaming · Microsoft

    PyRIT

    Python Risk Identification Toolkit — Automatisierungs-Framework für KI-Red-Teaming mit Orchestratoren für mehrstufige Angriffe wie Crescendo.

    Open Source
  • Red-Teaming · promptfoo

    promptfoo

    Test- und Red-Teaming-Werkzeug für Prompts und Modelle mit Plugin-System für Angriffsklassen und CI-Integration.

    Open Source
  • Scanner · Giskard

    Giskard

    Testframework für KI-Systeme, das automatisiert nach Schwachstellen sucht — darunter Prompt Injection, Halluzination und Vorurteile — und Testberichte erzeugt.

    Open Source
  • Benchmark · ETH Zürich (SPY Lab)

    AgentDojo

    Dynamische Testumgebung, die Agenten mit realistischen Aufgaben und eingebetteten Injektionen konfrontiert und Nützlichkeit gegen Sicherheit misst.

    Open Source
  • Benchmark · Learn Prompting

    HackAPrompt-Datensatz

    Offener Datensatz mit über 600.000 realen Angriffs-Prompts aus einem globalen Prompt-Hacking-Wettbewerb, taxonomisch aufbereitet.

    Open Source

Einordnung in die OWASP LLM Top 10

  • OWASP LLM Top 10 · 2025

    LLM01: Prompt Injection

    Eingaben verändern das Verhalten des Modells auf eine vom Betreiber nicht vorgesehene Weise — unabhängig davon, ob der Text für Menschen sichtbar ist oder nicht.

Häufige Fragen

Was prüft ein LLM-Penetrationstest?

Die Anwendung, nicht das Modell: direkte und indirekte Injektion über alle Datenquellen, Datenabfluss über die Ausgabe, Werkzeugmissbrauch, Persistenz eingeschleuster Inhalte und die Belastbarkeit vorhandener Filter.

Was sagt die Angriffserfolgsquote aus?

Sie ist nur innerhalb eines Testaufbaus vergleichbar. Aussagekräftiger ist, welcher Anteil der erfolgreichen Angriffe eine Aktion mit Außenwirkung ausgelöst hätte.

Quellen

  1. NIST AI Risk Management Framework: https://www.nist.gov/itl/ai-risk-management-framework
  2. garak — LLM Vulnerability Scanner: https://github.com/NVIDIA/garak
  3. PyRIT — Python Risk Identification Tool for generative AI: https://github.com/Azure/PyRIT