prompt injections.de
Angriffsvektor

Angriffsvektor Bilder, Audio und multimodale Eingaben

Multimodale Modelle verarbeiten Bild und Ton im selben Kontext wie Text. Damit wird jede hochgeladene, abgerufene oder weitergeleitete Mediendatei zu einem möglichen Träger von Anweisungen — sichtbar als Text im Bild oder unsichtbar als adversariale Störung im Signal.

Der Kanal ist neu, das Prinzip nicht: Es bleibt Prompt Injection über Fremddaten. Die Angriffsklasse behandelt die Seite Multimodale Prompt Injection ausführlich.

Warum Textfilter hier nicht greifen

Eine Prüfschicht, die den Prompt liest, sieht in einem Bild nur eine Datei. Die Interpretation entsteht erst im Modell — und damit hinter dem Filter. Wer Bilder prüfen will, muss sie zuerst auswerten, was den Prüfvorgang selbst angreifbar macht.

Hinzu kommt eine praktische Eigenheit: Screenshots und Weiterleitungen tragen sichtbaren Text im Bild zuverlässig weiter, während adversariale Störungen Kompression und Skalierung oft nicht überstehen. Die einfache Variante ist deshalb die verbreitetere.

Verwandt ist der Fall der ASCII-Art- und Homoglyphen-Angriffe: Auch dort transportiert die Darstellung eine Anweisung, die eine reine Zeichenprüfung nicht erkennt.

Was wirksam hilft

  • Aus Bildern extrahierten Text als zitierten Fremdinhalt einbetten, nie als Anweisung.
  • Metadaten von Mediendateien vor der Verarbeitung entfernen.
  • Aktionen, die auf multimodalen Eingaben beruhen, mit Bestätigung versehen.
  • Herkunft der Datei protokollieren, damit sich eine Fehldeutung nachvollziehen lässt.
  • Rechte des Systems begrenzen — ein beschreibendes Modell richtet mit einer Fehldeutung wenig an.

Techniken aus dem Verzeichnis

Diese Einträge aus dem Techniken-Verzeichnis gehören unmittelbar zu diesem Thema — jeder mit Funktionsweise, Risiko-Einstufung, Schutzmaßnahmen und Primärquelle.

  • Multimodal

    Multimodale Injektion über Bild und Ton

    Anweisungen werden in Bilder oder Audiodateien eingebettet — als sichtbarer Text im Bild oder als adversariale Störung — und wirken, sobald ein multimodales Modell die Datei verarbeitet.

    Risiko hoch
  • Obfuskation

    ASCII-Art-Jailbreak (ArtPrompt)

    Ein sicherheitsrelevantes Schlüsselwort wird als ASCII-Art dargestellt. Das Modell rekonstruiert das Wort aus der Grafik, die Sicherheitsprüfung auf Textebene erkennt es nicht.

    Risiko mittel
  • Obfuskation

    Homoglyphen und Zero-Width-Zeichen

    Schlüsselwörter werden mit optisch identischen Zeichen aus anderen Alphabeten oder mit unsichtbaren Trennzeichen geschrieben, um Signatur- und Sperrlisten-Filter zu unterlaufen.

    Risiko mittel
  • Obfuskation

    ASCII Smuggling (unsichtbare Unicode-Tags)

    Anweisungen werden in Unicode-Tag-Zeichen kodiert, die in Oberflächen unsichtbar bleiben, vom Modell aber als Text gelesen werden — der Mensch sieht nichts, das Modell folgt.

    Risiko hoch

Passende Werkzeuge

  • Schutzmodell · Meta

    Llama Guard

    Auf Inhaltssicherheit spezialisiertes Modell, das Eingaben und Antworten anhand einer anpassbaren Risikotaxonomie klassifiziert.

    Open Source
  • Guardrail-API · Microsoft

    Azure AI Prompt Shields

    Dienst innerhalb von Azure AI Content Safety, der direkte Jailbreak-Angriffe und indirekte Injektionen in eingebetteten Dokumenten erkennt.

    kommerziell
  • Guardrail-API · Google Cloud

    Model Armor

    Dienst zur Prüfung von Prompts und Antworten auf Prompt Injection, Jailbreak-Versuche, sensible Daten und schädliche URLs.

    kommerziell

Einordnung in die OWASP LLM Top 10

  • OWASP LLM Top 10 · 2025

    LLM01: Prompt Injection

    Eingaben verändern das Verhalten des Modells auf eine vom Betreiber nicht vorgesehene Weise — unabhängig davon, ob der Text für Menschen sichtbar ist oder nicht.

Häufige Fragen

Kann ein Bild wirklich eine Anweisung an ein Sprachmodell enthalten?

Ja. Multimodale Modelle werten Bildinhalte aus und übernehmen dabei auch abgebildeten Text. Forschungsarbeiten zeigen zusätzlich adversariale Störungen, die für Menschen wie Rauschen aussehen, die Interpretation des Modells aber gezielt beeinflussen.

Quellen

  1. (Ab)using Images and Sounds for Indirect Instruction Injection in Multi-Modal LLMs (arXiv:2307.10490): https://arxiv.org/abs/2307.10490
  2. OWASP GenAI Security Project: LLM01:2025 Prompt Injection: https://genai.owasp.org/llmrisk/llm01-prompt-injection/