Glossar
LLM-as-a-Judge
Bei LLM-as-a-Judge bewertet ein Sprachmodell die Ausgaben eines anderen Modells. Das Verfahren ist in Evaluation und Guardrails verbreitet, aber selbst durch Prompt Injection angreifbar — die Bad-Likert-Judge-Technik nutzt genau das aus.
Der Begriff gehört zum Themenfeld Prompt Injection und LLM-Sicherheit. Das vollständige Nachschlagewerk mit 82 Einträgen steht im Glossar. Unmittelbar benachbart sind Benchmark, Klassifikator, Guardrail.
Verwandte Begriffe
- Benchmark — Ein Sicherheits-Benchmark misst die Widerstandsfähigkeit eines Systems anhand eines festgelegten Angriffs- und Aufgabensatzes…
- Klassifikator — Ein Klassifikator ist ein spezialisiertes Modell, das Eingaben oder Ausgaben in Kategorien einordnet — etwa „Injektionsversuch"…
- Guardrail — Ein Guardrail ist eine Schutzschicht außerhalb des Modells, die Ein- und Ausgaben prüft, filtert oder blockiert. Guardrails sind…
Quellen
- LLM-as-a-Judge — Beleg: https://unit42.paloaltonetworks.com/multi-turn-technique-jailbreaks-llms/