Glossar
Content-Filter
Ein Content-Filter prüft Texte gegen Kategorien unerwünschter Inhalte wie Gewalt, Hass oder Selbstgefährdung. Er adressiert Inhaltsrisiken, nicht die Anwendungsübernahme durch Prompt Injection.
Der Begriff gehört zum Themenfeld Prompt Injection und LLM-Sicherheit. Das vollständige Nachschlagewerk mit 82 Einträgen steht im Glossar. Unmittelbar benachbart sind Guardrail, Klassifikator, Prompt Injection.
Verwandte Begriffe
- Guardrail — Ein Guardrail ist eine Schutzschicht außerhalb des Modells, die Ein- und Ausgaben prüft, filtert oder blockiert. Guardrails sind…
- Klassifikator — Ein Klassifikator ist ein spezialisiertes Modell, das Eingaben oder Ausgaben in Kategorien einordnet — etwa „Injektionsversuch"…
- Prompt Injection — Prompt Injection bezeichnet einen Angriff, bei dem eingeschleuster Text das Verhalten eines Sprachmodells entgegen der Absicht…
Quellen
- Content-Filter — Beleg: https://platform.openai.com/docs/guides/moderation