prompt injections.de
Glossar

Guardrail

Ein Guardrail ist eine Schutzschicht außerhalb des Modells, die Ein- und Ausgaben prüft, filtert oder blockiert. Guardrails sind notwendig, aber allein nicht ausreichend — sie senken die Erfolgswahrscheinlichkeit, beseitigen die Ursache aber nicht.

Der Begriff gehört zum Themenfeld Prompt Injection und LLM-Sicherheit. Das vollständige Nachschlagewerk mit 82 Einträgen steht im Glossar. Unmittelbar benachbart sind Klassifikator, Content-Filter, Instruktions-Hierarchie.

Verwandte Begriffe

  • Klassifikator — Ein Klassifikator ist ein spezialisiertes Modell, das Eingaben oder Ausgaben in Kategorien einordnet — etwa „Injektionsversuch"…
  • Content-Filter — Ein Content-Filter prüft Texte gegen Kategorien unerwünschter Inhalte wie Gewalt, Hass oder Selbstgefährdung. Er adressiert…
  • Instruktions-Hierarchie — Die Instruktions-Hierarchie trainiert ein Modell darauf, Anweisungen nach Vertrauensstufe zu gewichten: System vor Entwickler…

Quellen

  1. Guardrail — Beleg: https://learn.microsoft.com/en-us/azure/ai-services/content-safety/concepts/jailbreak-detection