prompt injections.de
Glossar

Alignment

Alignment bezeichnet die Ausrichtung eines Modells auf hilfreiches, ehrliches und unschädliches Verhalten, typischerweise über Nachtraining mit menschlichem Feedback. Alignment ist eine statistische Neigung, keine durchsetzbare Regel — deshalb bleiben Jailbreaks möglich.

Der Begriff gehört zum Themenfeld Prompt Injection und LLM-Sicherheit. Das vollständige Nachschlagewerk mit 82 Einträgen steht im Glossar. Unmittelbar benachbart sind RLHF, Constitutional AI, Jailbreak.

Verwandte Begriffe

  • RLHF — RLHF (Reinforcement Learning from Human Feedback) trainiert ein Modell mittels menschlicher Präferenzurteile auf gewünschtes…
  • Constitutional AI — Constitutional AI trainiert Modelle anhand eines expliziten Prinzipienkatalogs, den das Modell zur Selbstkritik heranzieht…
  • Jailbreak — Ein Jailbreak ist der Versuch, die Sicherheitsregeln eines Modells auszuhebeln, damit es Inhalte erzeugt, die es normalerweise…

Quellen

  1. Alignment — Beleg: https://arxiv.org/abs/2203.02155