prompt injections.de
Modell · Anthropic

Claude 2.0

Für Claude 2.0 von Anthropic sind öffentlich 3 Befunde zu Prompt Injection und verwandten Angriffen dokumentiert. Der Eintrag fasst sie mit Quelle zusammen — es sind keine eigenen Messungen dieses Portals, sondern belegte Fremdbefunde zum jeweiligen Untersuchungszeitpunkt.

Anbieter
Anthropic
Modellfamilie
Claude
Stand der Angaben
2026-08-03
Primärquelle
anthropic.com

Momentaufnahme. Anbieter bessern laufend nach. Ein hier dokumentierter Befund muss für die heute ausgelieferte Modellversion nicht mehr gelten. Umgekehrt gilt Prompt Injection bislang bei keinem Modell als grundsätzlich gelöst — die Absicherung gehört in die Anwendung, nicht in die Modellauswahl.

Dokumentierte Schwächen

  • In Anthropics eigener Many-Shot-Studie erfolgreich über das große Kontextfenster ausgehebelt.
  • Die Wirksamkeit stieg systematisch mit der Anzahl der eingefügten Beispieldialoge.
  • Anthropic veröffentlichte den Befund bewusst, um branchenweite Gegenmaßnahmen zu beschleunigen.

Was das für Betreiber bedeutet

Die Auswahl eines robusteren Modells senkt die Erfolgsquote einfacher Angriffe, ersetzt aber keine Architektur. Wirksam bleiben die Maßnahmen aus OWASP LLM01: Rechte nach dem Least-Privilege-Prinzip vergeben, Ausgabeformate erzwingen und prüfen, Fremdinhalte klar von Anweisungen trennen (Spotlighting) und riskante Aktionen von einer menschlichen Freigabe abhängig machen.

Betroffene Techniken

  • Mehrstufiger Angriff

    Many-Shot-Jailbreaking

    Von Anthropic veröffentlichte Technik: Sehr viele fingierte Dialogbeispiele, in denen ein „Assistent" regelwidrig antwortet, werden in den Prompt gestellt — das Modell setzt das Muster fort.

    Risiko hoch
  • Direkte Injektion

    Kontext-Überflutung

    Der Angreifer füllt das Kontextfenster mit sehr viel Text, sodass die eigentlichen Sicherheitsanweisungen an Gewicht verlieren oder aus dem Kontext gedrängt werden.

    Risiko mittel

Quellen

  1. Claude 2.0 — dokumentierter Befund: https://www.anthropic.com/research/many-shot-jailbreaking

Momentaufnahme: Die aufgeführten Schwächen beziehen sich auf den jeweils genannten Untersuchungszeitpunkt. Anbieter bessern laufend nach — ein hier dokumentierter Befund muss für die heutige Modellversion nicht mehr gelten. Prompt Injection gilt bislang bei keinem Modell als grundsätzlich gelöst.