Glossar
Alignment
Alignment bezeichnet die Ausrichtung eines Modells auf hilfreiches, ehrliches und unschädliches Verhalten, typischerweise über Nachtraining mit menschlichem Feedback. Alignment ist eine statistische Neigung, keine durchsetzbare Regel — deshalb bleiben Jailbreaks möglich.
Der Begriff gehört zum Themenfeld Prompt Injection und LLM-Sicherheit. Das vollständige Nachschlagewerk mit 82 Einträgen steht im Glossar. Unmittelbar benachbart sind RLHF, Constitutional AI, Jailbreak.
Verwandte Begriffe
- RLHF — RLHF (Reinforcement Learning from Human Feedback) trainiert ein Modell mittels menschlicher Präferenzurteile auf gewünschtes…
- Constitutional AI — Constitutional AI trainiert Modelle anhand eines expliziten Prinzipienkatalogs, den das Modell zur Selbstkritik heranzieht…
- Jailbreak — Ein Jailbreak ist der Versuch, die Sicherheitsregeln eines Modells auszuhebeln, damit es Inhalte erzeugt, die es normalerweise…
Quellen
- Alignment — Beleg: https://arxiv.org/abs/2203.02155