prompt injections.de
Glossar

Many-Shot-Jailbreaking

Many-Shot-Jailbreaking füllt das Kontextfenster mit vielen fingierten Dialogbeispielen, in denen ein Assistent regelwidrig antwortet, worauf das Modell das Muster fortsetzt. Die Wirksamkeit steigt messbar mit der Zahl der Beispiele und damit mit der Größe des Kontextfensters.

Der Begriff gehört zum Themenfeld Prompt Injection und LLM-Sicherheit. Das vollständige Nachschlagewerk mit 82 Einträgen steht im Glossar. Unmittelbar benachbart sind Kontextfenster, In-Context-Learning, Jailbreak.

Wo der Begriff auftaucht

  • Kontext-Überflutung — Der Angreifer füllt das Kontextfenster mit sehr viel Text, sodass die eigentlichen Sicherheitsanweisungen an Gewicht verlieren oder aus dem Kontext…
  • Echo Chamber — Von NeuralTrust beschriebene Kontextvergiftung: Harmlose „Saat"-Aussagen werden gesetzt und über mehrere Turns vom Modell selbst wiederholt, bis der…
  • Many-Shot-Jailbreaking — Von Anthropic veröffentlichte Technik: Sehr viele fingierte Dialogbeispiele, in denen ein „Assistent" regelwidrig antwortet, werden in den Prompt…

Verwandte Begriffe

  • Kontextfenster — Das Kontextfenster ist die maximale Textmenge, die ein Modell bei einer Anfrage gleichzeitig berücksichtigen kann. In ihm liegen…
  • In-Context-Learning — In-Context-Learning bezeichnet die Fähigkeit eines Modells, aus Beispielen im Prompt eine Aufgabe zu erschließen, ohne neu…
  • Jailbreak — Ein Jailbreak ist der Versuch, die Sicherheitsregeln eines Modells auszuhebeln, damit es Inhalte erzeugt, die es normalerweise…

Quellen

  1. Many-Shot-Jailbreaking — Beleg: https://www.anthropic.com/research/many-shot-jailbreaking