prompt injections.de
Technik · Obfuskation

Chiffren- und Leetspeak-Umgehung

Die Anfrage wird in einer einfachen Chiffre (ROT13, Caesar, Leetspeak, Morse) gestellt; das Modell entschlüsselt sie und antwortet, während Sicherheitsfilter die Bedeutung nicht erfassen.

Englischer Begriff
Cipher-based Jailbreak
Kategorie
Obfuskation
Risiko
Risiko mittel
OWASP-Bezug
LLM01 — Prompt Injection
Primärquelle
arxiv.org

Chiffren- und Leetspeak-Umgehung (englisch „Cipher-based Jailbreak") gehört zur Kategorie Obfuskation und ist eine der dokumentierten Techniken der Prompt Injection gegen Sprachmodelle. Der Eintrag beschreibt das Wirkprinzip, damit Betreiber ihre Systeme prüfen und absichern können; eine Übersicht aller Verfahren steht im Techniken-Verzeichnis. Im Risikokatalog OWASP LLM Top 10 fällt die Technik unter LLM01: Prompt Injection.

Funktionsweise

  • Sicherheitstraining wirkt vor allem auf natürlichsprachliche Klartext-Muster.
  • Leistungsfähige Modelle beherrschen einfache Chiffren und wenden sie automatisch an.
  • Die Studie „GPT-4 Is Too Smart To Be Safe" zeigt: Je fähiger das Modell, desto wirksamer der Angriff.

Risiko

Risiko mittel Die praktische Gefährdung produktiver Systeme wird für diese Technik als mittel eingestuft. Maßgeblich dafür sind die Rechte der betroffenen Anwendung: Je mehr eine LLM-Anwendung lesen, senden oder ausführen darf, desto größer ist der Schaden, den eine einzelne eingeschleuste Anweisung anrichten kann. OWASP führt den zugehörigen Risikobereich als LLM01 — Prompt Injection.

Schutz

Keine Einzelmaßnahme verhindert diese Technik vollständig. Wirksam ist gestaffelte Absicherung, bei der jede Schicht davon ausgeht, dass die vorherige versagt:

  • Ausgabe-Klassifikator, der die entschlüsselte Antwort bewertet.
  • Chiffre-typische Eingabemuster als Risikosignal führen.
  • Sicherheitsprüfung außerhalb des Modells in einer eigenen Instanz.

Ausführlich behandelt der Bereich Schutz vor Prompt Injection die einzelnen Maßnahmen; passende Werkzeuge listet das Werkzeug-Verzeichnis.

Verwandte Techniken

  • Obfuskation

    Base64- und Kodierungs-Umgehung

    Die schädliche Anweisung wird kodiert übergeben (z. B. Base64) und erst vom Modell selbst dekodiert — Filter, die den Klartext prüfen, greifen ins Leere.

    Risiko mittel
  • Obfuskation

    ASCII-Art-Jailbreak (ArtPrompt)

    Ein sicherheitsrelevantes Schlüsselwort wird als ASCII-Art dargestellt. Das Modell rekonstruiert das Wort aus der Grafik, die Sicherheitsprüfung auf Textebene erkennt es nicht.

    Risiko mittel
  • Obfuskation

    Zeichen-Umkehr-Angriff (FlipAttack)

    Der schädliche Prompt wird zeichen- oder wortweise umgekehrt übergeben; das Modell dreht ihn im Zuge der Bearbeitung zurück und führt ihn aus.

    Risiko mittel

Quellen

  1. Chiffren- und Leetspeak-Umgehung — Primärquelle: https://arxiv.org/abs/2308.06463

Dieser Eintrag erklärt das Prinzip zu Verteidigungszwecken. Er enthält bewusst keine einsatzfertigen Angriffs-Payloads gegen konkrete Systeme (siehe redaktionelle Grundsätze).