prompt injections.de
Glossar

RLHF

RLHF (Reinforcement Learning from Human Feedback) trainiert ein Modell mittels menschlicher Präferenzurteile auf gewünschtes Antwortverhalten. Es prägt Neigungen, erzeugt aber keine harte Sicherheitsgrenze im Sinne klassischer Zugriffskontrolle.

Der Begriff gehört zum Themenfeld Prompt Injection und LLM-Sicherheit. Das vollständige Nachschlagewerk mit 82 Einträgen steht im Glossar. Unmittelbar benachbart sind Alignment, Constitutional AI, Feintuning.

Verwandte Begriffe

  • Alignment — Alignment bezeichnet die Ausrichtung eines Modells auf hilfreiches, ehrliches und unschädliches Verhalten, typischerweise über…
  • Constitutional AI — Constitutional AI trainiert Modelle anhand eines expliziten Prinzipienkatalogs, den das Modell zur Selbstkritik heranzieht…
  • Feintuning — Feintuning passt ein vortrainiertes Modell mit zusätzlichen Daten an eine spezifische Aufgabe an. Es kann Sicherheit erhöhen…

Quellen

  1. RLHF — Beleg: https://arxiv.org/abs/2203.02155