prompt injections.de
Modell · DeepSeek

DeepSeek-R1

Für DeepSeek-R1 von DeepSeek sind öffentlich 3 Befunde zu Prompt Injection und verwandten Angriffen dokumentiert. Der Eintrag fasst sie mit Quelle zusammen — es sind keine eigenen Messungen dieses Portals, sondern belegte Fremdbefunde zum jeweiligen Untersuchungszeitpunkt.

Anbieter
DeepSeek
Modellfamilie
DeepSeek
Stand der Angaben
2026-08-03
Primärquelle
blogs.cisco.com

Momentaufnahme. Anbieter bessern laufend nach. Ein hier dokumentierter Befund muss für die heute ausgelieferte Modellversion nicht mehr gelten. Umgekehrt gilt Prompt Injection bislang bei keinem Modell als grundsätzlich gelöst — die Absicherung gehört in die Anwendung, nicht in die Modellauswahl.

Dokumentierte Schwächen

  • Cisco berichtet für den eingesetzten HarmBench-Satz eine Angriffserfolgsquote von 100 Prozent — kein einziger Angriff wurde blockiert.
  • Unit 42 dokumentierte mehrere unabhängig wirksame Jailbreak-Techniken gegen das Modell.
  • Wird häufig selbst gehostet — ohne zusätzliche Guardrails bleibt das Modell ungeschützt.

Was das für Betreiber bedeutet

Die Auswahl eines robusteren Modells senkt die Erfolgsquote einfacher Angriffe, ersetzt aber keine Architektur. Wirksam bleiben die Maßnahmen aus OWASP LLM01: Rechte nach dem Least-Privilege-Prinzip vergeben, Ausgabeformate erzwingen und prüfen, Fremdinhalte klar von Anweisungen trennen (Spotlighting) und riskante Aktionen von einer menschlichen Freigabe abhängig machen.

Betroffene Techniken

  • Mehrstufiger Angriff

    Deceptive Delight

    Von Unit 42 beschriebene Technik: Ein unzulässiges Thema wird zwischen zwei harmlose Themen gebettet und das Modell gebeten, alle drei in einer positiven Erzählung zu verbinden — anschließend soll es den kritischen Teil ausführen.

    Risiko mittel
  • Mehrstufiger Angriff

    Bad Likert Judge

    Von Unit 42 beschriebene Technik: Das Modell wird als Bewertungsinstanz eingesetzt und soll Beispielantworten zu verschiedenen Stufen einer Likert-Skala erzeugen — die Höchststufe enthält den schädlichen Inhalt.

    Risiko hoch
  • Jailbreak

    DAN („Do Anything Now")

    Die bekannteste Familie von Community-Jailbreak-Prompts: Das Modell soll eine entfesselte Zweitpersönlichkeit annehmen, die „alles darf" — häufig verstärkt durch ein fiktives Punkte- oder Strafsystem.

    Risiko mittel

Quellen

  1. DeepSeek-R1 — dokumentierter Befund: https://blogs.cisco.com/security/evaluating-security-risk-in-deepseek-and-other-frontier-reasoning-models

Momentaufnahme: Die aufgeführten Schwächen beziehen sich auf den jeweils genannten Untersuchungszeitpunkt. Anbieter bessern laufend nach — ein hier dokumentierter Befund muss für die heutige Modellversion nicht mehr gelten. Prompt Injection gilt bislang bei keinem Modell als grundsätzlich gelöst.