LLM04: Daten- und Modellvergiftung
Manipulation von Trainings-, Feintuning- oder Einbettungsdaten, um Hintertüren, Verzerrungen oder gezielte Fehlverhalten in das Modell einzubauen.
- OWASP-Kennung
- LLM04
- Englischer Titel
- Data and Model Poisoning
- Fassung
- 2025 (OWASP Gen AI Security Project)
- Primärquelle
- genai.owasp.org
LLM04 ist ein Eintrag der OWASP Top 10 für LLM-Anwendungen, der maßgeblichen Referenzliste für Sicherheitsrisiken in Systemen mit großen Sprachmodellen. Auf Platz eins steht Prompt Injection; die übrigen Risiken stehen damit meist in direktem Zusammenhang.
Warum das Risiko kritisch ist
Die Manipulation steckt im Modell selbst und übersteht Filter, Prompts und Neustarts.
Typische Ausprägungen
- Backdoors mit seltenem Auslöser (Sleeper Agents)
- Vergiftete Dokumente in Wissensbasen
- Manipulierte öffentliche Trainingsdatensätze
Gegenmaßnahmen
- Datenherkunft dokumentieren und Datensätze validieren
- Verhaltenstests mit ungewöhnlichen Auslösern in die Abnahme aufnehmen
- Feintuning-Pipelines gegen unbefugte Änderungen absichern
Die Umsetzung im Detail behandelt der Bereich Schutz vor Prompt Injection.
Techniken, die auf dieses Risiko einzahlen
-
Backdoor im Modell (Sleeper Agent)
Ein Modell wird im Training so präpariert, dass es sich normal verhält, bis ein bestimmter Auslöser erscheint — Anthropic zeigte, dass Standard-Sicherheitstraining solche Hintertüren nicht zuverlässig entfernt.
Risiko hoch -
RAG-Vergiftung
Präparierte Dokumente werden so gestaltet, dass sie für bestimmte Nutzerfragen sicher in die Top-Treffer der Vektorsuche gelangen und dort ihre Anweisungen ausspielen.
Risiko hoch
Häufige Fragen
Was besagt LLM04 der OWASP LLM Top 10?
Manipulation von Trainings-, Feintuning- oder Einbettungsdaten, um Hintertüren, Verzerrungen oder gezielte Fehlverhalten in das Modell einzubauen.
Warum ist Daten- und Modellvergiftung kritisch?
Die Manipulation steckt im Modell selbst und übersteht Filter, Prompts und Neustarts.
Wie schützt man sich vor Daten- und Modellvergiftung?
Datenherkunft dokumentieren und Datensätze validieren Verhaltenstests mit ungewöhnlichen Auslösern in die Abnahme aufnehmen Feintuning-Pipelines gegen unbefugte Änderungen absichern
Quellen
- OWASP LLM04 — Data and Model Poisoning: https://genai.owasp.org/llmrisk/llm042025-data-and-model-poisoning/
- OWASP Top 10 für LLM-Anwendungen 2025 (PDF): https://owasp.org/www-project-top-10-for-large-language-model-applications/assets/PDF/OWASP-Top-10-for-LLMs-v2025.pdf
Die OWASP-Inhalte stehen unter Creative-Commons-Lizenz. Die deutschen Zusammenfassungen auf diesem Portal sind eigene Formulierungen, keine autorisierte Übersetzung.