Glossar
Constitutional AI
Constitutional AI trainiert Modelle anhand eines expliziten Prinzipienkatalogs, den das Modell zur Selbstkritik heranzieht, statt allein auf menschliche Einzelurteile zu setzen. Der Ansatz stammt von Anthropic und wurde später um vorgeschaltete Klassifikatoren ergänzt.
Der Begriff gehört zum Themenfeld Prompt Injection und LLM-Sicherheit. Das vollständige Nachschlagewerk mit 82 Einträgen steht im Glossar. Unmittelbar benachbart sind Alignment, RLHF, Constitutional Classifiers.
Verwandte Begriffe
- Alignment — Alignment bezeichnet die Ausrichtung eines Modells auf hilfreiches, ehrliches und unschädliches Verhalten, typischerweise über…
- RLHF — RLHF (Reinforcement Learning from Human Feedback) trainiert ein Modell mittels menschlicher Präferenzurteile auf gewünschtes…
- Constitutional Classifiers — Constitutional Classifiers sind dem Modell vor- und nachgeschaltete Prüfmodelle, die anhand explizit formulierter Regeln über…
Quellen
- Constitutional AI — Beleg: https://arxiv.org/abs/2212.08073