Glossar
Constitutional Classifiers
Constitutional Classifiers sind dem Modell vor- und nachgeschaltete Prüfmodelle, die anhand explizit formulierter Regeln über Zulässigkeit entscheiden. Anthropic zeigte damit deutlich erhöhte Widerstandsfähigkeit gegen universelle Jailbreaks im Dauer-Red-Teaming.
Der Begriff gehört zum Themenfeld Prompt Injection und LLM-Sicherheit. Das vollständige Nachschlagewerk mit 82 Einträgen steht im Glossar. Unmittelbar benachbart sind Constitutional AI, Guardrail, Klassifikator.
Verwandte Begriffe
- Constitutional AI — Constitutional AI trainiert Modelle anhand eines expliziten Prinzipienkatalogs, den das Modell zur Selbstkritik heranzieht…
- Guardrail — Ein Guardrail ist eine Schutzschicht außerhalb des Modells, die Ein- und Ausgaben prüft, filtert oder blockiert. Guardrails sind…
- Klassifikator — Ein Klassifikator ist ein spezialisiertes Modell, das Eingaben oder Ausgaben in Kategorien einordnet — etwa „Injektionsversuch"…
Quellen
- Constitutional Classifiers — Beleg: https://arxiv.org/abs/2501.18837