prompt injections.de
Nachschlagewerk

Glossar: Prompt Injection und LLM-Sicherheit

Dieses Glossar definiert 82 Fachbegriffe aus dem Umfeld von Prompt Injection und LLM-Sicherheit, jeden in genau zwei Sätzen: Der erste erklärt den Begriff, der zweite ordnet ihn ein. Wo der Fachbegriff englisch ist, bleibt er englisch, weil die Zielgruppe so sucht und spricht. Jeder Eintrag nennt seine Quelle. Die Einträge sind als DefinedTermSet nach Schema.org ausgezeichnet und damit auch maschinell auswertbar.1

Die Kürze ist Absicht. Wer einen Begriff nachschlägt, will eine Definition, keinen Aufsatz. Die Vertiefung steht jeweils dort, wo der Begriff im Zusammenhang gebraucht wird: im Pillar Was ist Prompt Injection?, im Katalog Techniken oder im Cluster Schutz.

Sechs thematische Felder

Grundlagen der Sprachmodelle. Was ein Modell technisch tut und warum daraus das Sicherheitsproblem folgt: Prompt, System-Prompt, Kontextfenster, Token, Tokenisierung, großes Sprachmodell, In-Context-Learning, Halluzination.

Angriffsbegriffe. Die Klassen und ihre Bausteine: direkte, indirekte und gespeicherte Prompt Injection, Jailbreak, Payload, Goal Hijacking, Prompt Leaking, Obfuskation, Homoglyph, Unicode-Tag-Zeichen, Kontextvergiftung, Datenexfiltration, Zero-Click.

Retrieval und Wissensbasen. Die Begriffe, ohne die sich RAG-Risiken nicht sauber beschreiben lassen: RAG, Retriever, Vektordatenbank, Einbettung, Chunking, RAG-Vergiftung.

Agenten und Werkzeuge. Wo aus Text Handlung wird: KI-Agent, Werkzeugnutzung, Function Calling, Model Context Protocol, Tool Poisoning, Multi-Agenten-System, Prompt-Infektion, verwirrter Stellvertreter.

Schutz und Architektur. Die Gegenseite, von der Einzelmaßnahme bis zum Entwurfsmuster: Guardrail, Spotlighting, Begrenzer, Instruktions-Hierarchie, Dual-LLM-Muster, CaMeL, StruQ, SecAlign, Least Privilege, Sandbox, Mensch in der Schleife, Vertrauensgrenze, tödliche Trias, Canary-Token, sichere Ausgabeverarbeitung.

Bewertung, Training und Regulierung. Wie Sicherheit gemessen, antrainiert und vorgeschrieben wird: Alignment, RLHF, Constitutional AI, Constitutional Classifiers, Red Teaming, Angriffserfolgsquote, Benchmark, LLM-as-a-Judge, Feintuning, Datenvergiftung, Backdoor, Lieferkette, Provenienz, OWASP LLM Top 10, MITRE ATLAS, NIST AI RMF, EU-KI-Verordnung, CVE.

Zur Schreibweise

Englische Fachbegriffe bleiben unübersetzt, wenn die Fachsprache sie so verwendet: prompt injection, jailbreak, system prompt, tool use, guardrail. Eingedeutscht wird nur dort, wo sich ein deutscher Begriff tatsächlich durchgesetzt hat, etwa Kontextfenster oder Einbettung. Kunstwörter wie „Eingabeaufforderungs-Einschleusung" kommen nicht vor, weil sie niemand sucht und niemand sagt.

Wo ein Begriff in mehreren Bedeutungen kursiert, benennt der Eintrag die Abweichung, statt sich für eine zu entscheiden. „Jailbreak" und „Prompt Injection" werden in der Praxis häufig vermischt, obwohl sie unterschiedliche Ziele beschreiben. Diese Abgrenzung ist unter Prompt Injection oder Jailbreak ausführlich behandelt.

Die vollständige alphabetische Liste aller 82 Einträge folgt unter diesem Text.

A 4

  • Adversariale Eingabe — Eine adversariale Eingabe ist gezielt so konstruiert, dass ein Modell fehlerhaft oder regelwidrig reagiert
  • Alignment — Alignment bezeichnet die Ausrichtung eines Modells auf hilfreiches, ehrliches und unschädliches Verhalten…
  • Angriffserfolgsquote (ASR) — Die Angriffserfolgsquote gibt an, welcher Anteil der Angriffsversuche das gewünschte Ergebnis erzielt
  • AutoDAN — AutoDAN erzeugt mit einem genetischen Algorithmus Jailbreak-Prompts, die sprachlich unauffällig bleiben

B 3

  • Backdoor (Sleeper Agent) — Eine Backdoor ist ein im Training eingebautes Verhalten, das nur bei einem bestimmten Auslöser aktiv wird
  • Begrenzer (Delimiter) — Begrenzer sind Markierungen, die Datenbereiche im Prompt vom Anweisungsbereich abgrenzen
  • Benchmark — Ein Sicherheits-Benchmark misst die Widerstandsfähigkeit eines Systems anhand eines festgelegten Angriffs- und…

C 8

  • CaMeL — CaMeL ist eine Architektur, die Kontroll- und Datenfluss aus der vertrauenswürdigen Anfrage ableitet und die…
  • Canary-Token — Ein Canary-Token ist eine eindeutige Zeichenfolge, die verdeckt in den System-Prompt eingebettet wird
  • Chunking — Chunking zerlegt Dokumente in Abschnitte, die einzeln indexiert und abgerufen werden
  • Constitutional AI — Constitutional AI trainiert Modelle anhand eines expliziten Prinzipienkatalogs, den das Modell zur Selbstkritik…
  • Constitutional Classifiers — Constitutional Classifiers sind dem Modell vor- und nachgeschaltete Prüfmodelle, die anhand explizit formulierter…
  • Content-Filter — Ein Content-Filter prüft Texte gegen Kategorien unerwünschter Inhalte wie Gewalt, Hass oder Selbstgefährdung
  • Crescendo — Crescendo ist ein mehrstufiger Angriff, der harmlos beginnt und sich in kleinen, jeweils plausiblen Schritten zum Ziel…
  • CVE — Eine CVE-Nummer ist die eindeutige öffentliche Kennung einer konkreten Schwachstelle

D 5

  • DAN — DAN steht für „Do Anything Now" und bezeichnet die bekannteste Familie von Community-Jailbreak-Prompts, die dem Modell…
  • Datenexfiltration — Datenexfiltration ist der unbefugte Abfluss von Daten aus einem System
  • Datenvergiftung — Datenvergiftung manipuliert Trainings-, Feintuning- oder Wissensdaten, um Verhalten oder Hintertüren in ein Modell…
  • Direkte Prompt Injection — Bei der direkten Prompt Injection schreibt der Angreifer die schädliche Anweisung selbst in das Eingabefeld der…
  • Dual-LLM-Muster — Beim Dual-LLM-Muster arbeitet ein privilegiertes Modell mit Werkzeugzugriff niemals direkt mit nicht…

E 3

  • Echo Chamber — Echo Chamber ist eine mehrstufige Jailbreak-Technik, die harmlose Anknüpfungspunkte setzt und das Modell die eigenen…
  • Einbettung (Embedding) — Eine Einbettung ist die Darstellung eines Textes als Zahlenvektor, in dem inhaltliche Ähnlichkeit einem geringen…
  • EU-KI-Verordnung (AI Act) — Die EU-KI-Verordnung regelt KI-Systeme risikobasiert und stellt an Hochrisiko-Systeme sowie an KI-Modelle mit…

F 2

  • Feintuning — Feintuning passt ein vortrainiertes Modell mit zusätzlichen Daten an eine spezifische Aufgabe an
  • Function Calling — Function Calling ist die Schnittstelle, über die ein Modell strukturierte Aufrufe an vordefinierte Funktionen erzeugt

G 5

  • GCG-Suffix — Ein GCG-Suffix ist eine automatisch berechnete, meist sinnlos wirkende Zeichenfolge, die an eine Anfrage angehängt…
  • Gespeicherte Prompt Injection — Bei der gespeicherten Prompt Injection liegt der Payload dauerhaft in einem Datenspeicher und wirkt bei jedem erneuten…
  • Goal Hijacking — Beim Goal Hijacking ersetzt die Injektion nicht die Regeln, sondern die Aufgabe der Anwendung — der Dienst arbeitet…
  • Großes Sprachmodell (LLM) — Ein großes Sprachmodell ist ein auf sehr großen Textmengen trainiertes neuronales Netz, das Text fortschreibt, indem…
  • Guardrail — Ein Guardrail ist eine Schutzschicht außerhalb des Modells, die Ein- und Ausgaben prüft, filtert oder blockiert

H 2

  • Halluzination — Als Halluzination bezeichnet man eine sachlich falsche, aber sprachlich überzeugend formulierte Ausgabe eines…
  • Homoglyph — Ein Homoglyph ist ein Zeichen, das einem anderen optisch gleicht, aber einen anderen Codepunkt hat — etwa kyrillisches…

I 3

  • In-Context-Learning — In-Context-Learning bezeichnet die Fähigkeit eines Modells, aus Beispielen im Prompt eine Aufgabe zu erschließen, ohne…
  • Indirekte Prompt Injection — Bei der indirekten Prompt Injection stammt die Anweisung aus Inhalten, die das System selbst abruft — Webseiten…
  • Instruktions-Hierarchie — Die Instruktions-Hierarchie trainiert ein Modell darauf, Anweisungen nach Vertrauensstufe zu gewichten: System vor…

J 1

  • Jailbreak — Ein Jailbreak ist der Versuch, die Sicherheitsregeln eines Modells auszuhebeln, damit es Inhalte erzeugt, die es…

K 4

  • KI-Agent — Ein KI-Agent ist ein System, das ein Sprachmodell mit Werkzeugen und einer Handlungsschleife verbindet, um Aufgaben…
  • Klassifikator — Ein Klassifikator ist ein spezialisiertes Modell, das Eingaben oder Ausgaben in Kategorien einordnet — etwa…
  • Kontextfenster — Das Kontextfenster ist die maximale Textmenge, die ein Modell bei einer Anfrage gleichzeitig berücksichtigen kann
  • Kontextvergiftung — Bei der Kontextvergiftung wird der Gesprächs- oder Datenkontext schrittweise mit Inhalten angereichert, die spätere…

L 3

  • Least Privilege — Least Privilege bedeutet, jeder Komponente nur die minimal nötigen Rechte zu geben
  • Lieferkette (Supply Chain) — Die KI-Lieferkette umfasst alle fremden Bestandteile einer Anwendung: Modelle, Adapter, Datensätze, Bibliotheken und…
  • LLM-as-a-Judge — Bei LLM-as-a-Judge bewertet ein Sprachmodell die Ausgaben eines anderen Modells

M 6

  • Many-Shot-Jailbreaking — Many-Shot-Jailbreaking füllt das Kontextfenster mit vielen fingierten Dialogbeispielen, in denen ein Assistent…
  • Mensch in der Schleife (Human in the Loop) — Human in the Loop bedeutet, dass folgenschwere Aktionen erst nach ausdrücklicher menschlicher Freigabe ausgeführt werden
  • MITRE ATLAS — MITRE ATLAS ist eine Wissensbasis realer Angriffstaktiken und -techniken gegen KI-Systeme, aufgebaut nach dem Vorbild…
  • Model Context Protocol (MCP) — MCP ist ein offener Standard, über den KI-Anwendungen Werkzeuge und Datenquellen einheitlich anbinden
  • Multi-Agenten-System — In einem Multi-Agenten-System arbeiten mehrere spezialisierte KI-Agenten zusammen und tauschen Zwischenergebnisse aus
  • Multimodales Modell — Ein multimodales Modell verarbeitet neben Text auch Bilder, Audio oder Video

N 1

O 2

  • Obfuskation — Obfuskation verschleiert einen Angriffs-Payload so, dass Filter ihn nicht erkennen, das Modell ihn aber weiterhin…
  • OWASP LLM Top 10 — Die OWASP Top 10 für LLM-Anwendungen sind die maßgebliche Referenzliste der häufigsten Sicherheitsrisiken generativer…

P 8

  • Payload — Als Payload bezeichnet man den eigentlichen Schadanteil eines Angriffs — bei Prompt Injection der eingeschleuste…
  • Perplexitäts-Filter — Ein Perplexitäts-Filter verwirft Eingaben, deren statistische Unwahrscheinlichkeit auf maschinell optimierten Text…
  • Prompt — Ein Prompt ist die Texteingabe, mit der ein Sprachmodell zu einer Ausgabe veranlasst wird
  • Prompt Engineering — Prompt Engineering ist das gezielte Gestalten von Eingaben, um verlässlichere Modellausgaben zu erhalten
  • Prompt Injection — Prompt Injection bezeichnet einen Angriff, bei dem eingeschleuster Text das Verhalten eines Sprachmodells entgegen der…
  • Prompt Leaking — Prompt Leaking ist die Offenlegung des verborgenen System-Prompts einer Anwendung
  • Prompt-Infektion — Eine Prompt-Infektion ist eine sich selbst weitergebende Injektion, die den empfangenden Agenten anweist, sie an alle…
  • Provenienz — Provenienz ist der nachvollziehbare Herkunftsnachweis von Modellen, Daten und Werkzeugen

R 6

  • RAG (Retrieval-Augmented Generation) — RAG erweitert ein Sprachmodell um eine Suchkomponente, die zur Anfrage passende Dokumente abruft und in den Kontext…
  • RAG-Vergiftung — Bei der RAG-Vergiftung werden präparierte Dokumente so gestaltet, dass sie für bestimmte Fragen zuverlässig abgerufen…
  • Red Teaming — Red Teaming ist das systematische Angreifen des eigenen Systems, um Schwachstellen vor Dritten zu finden
  • Retriever — Der Retriever ist die Komponente eines RAG-Systems, die zu einer Anfrage die passendsten Dokumente aus einem Index…
  • RLHF — RLHF (Reinforcement Learning from Human Feedback) trainiert ein Modell mittels menschlicher Präferenzurteile auf…
  • Rollenspiel-Jailbreak — Beim Rollenspiel-Jailbreak nimmt das Modell eine fiktive Rolle ein, für die die üblichen Regeln angeblich nicht gelten

S 6

  • Sandbox — Eine Sandbox ist eine abgeschottete Ausführungsumgebung ohne Zugriff auf produktive Daten und Netzwerke
  • SecAlign — SecAlign härtet Modelle über Preference-Optimierung: Trainiert wird auf simulierten Injektionen mit jeweils…
  • Sichere Ausgabeverarbeitung — Sichere Ausgabeverarbeitung behandelt jede Modellantwort als nicht vertrauenswürdige Eingabe für das nachfolgende…
  • Spotlighting — Spotlighting kennzeichnet externe Inhalte im Prompt eindeutig als Daten — durch Begrenzer, Markierungen oder Kodierung…
  • StruQ — StruQ ist ein Trainingsverfahren, das mit reservierten Sondertoken eine strukturelle Trennung von Anweisung und Daten…
  • System-Prompt — Der System-Prompt ist die vom Betreiber gesetzte Grundanweisung, die Rolle, Regeln und Aufgabenrahmen des Modells…

T 4

  • Tödliche Trias — Die tödliche Trias beschreibt die gefährliche Kombination aus Zugriff auf private Daten, Verarbeitung nicht…
  • Token — Ein Token ist die kleinste Verarbeitungseinheit eines Sprachmodells — meist ein Wortteil, seltener ein ganzes Wort…
  • Tokenisierung — Die Tokenisierung zerlegt Text in die Einheiten, die ein Modell tatsächlich verarbeitet
  • Tool Poisoning — Beim Tool Poisoning enthält die Beschreibung eines Werkzeugs versteckte Anweisungen, die der Agent bereits beim…

U 1

  • Unicode-Tag-Zeichen — Unicode-Tag-Zeichen bilden einen Zeichenblock, der ASCII spiegelt, in Oberflächen aber meist nicht dargestellt wird

V 3

  • Vektordatenbank — Eine Vektordatenbank speichert Texte als numerische Einbettungen und findet inhaltlich ähnliche Passagen über…
  • Vertrauensgrenze — Eine Vertrauensgrenze ist die Linie, an der Daten aus einer weniger vertrauenswürdigen Quelle in einen geschützten…
  • Verwirrter Stellvertreter (Confused Deputy) — Ein verwirrter Stellvertreter ist eine Komponente, die ihre legitimen Rechte im Auftrag eines Angreifers einsetzt

W 1

  • Werkzeugnutzung (Tool Use) — Werkzeugnutzung bezeichnet die Fähigkeit eines Modells, externe Funktionen aufzurufen — Suche, E-Mail-Versand…

Z 1

  • Zero-Click — Ein Zero-Click-Angriff kommt ohne jede Handlung des Opfers aus

Quellen

  1. Schema.org: DefinedTermSet. https://schema.org/DefinedTermSet