Data Poisoning
Erfahre mehr über Datenvergiftung und ihre Auswirkungen auf KI. Entdecke, wie du Ultralytics YOLO26-Modelle absicherst und Trainingsdaten mit der Ultralytics Platform schützt.
Datenvergiftung ist eine Cybersicherheitsbedrohung, bei der Angreifer gezielt die Trainingsdaten manipulieren, die zum Erstellen von Modellen des maschinellen Lernens (ML) verwendet werden. Indem sie den Datensatz vor dem Modelltraining verfälschen, können Angreifer versteckte Hintertüren einbauen, Verzerrungen verursachen oder die Gesamtleistung des Modells verschlechtern. Anders als andere Sicherheitsangriffe, die auf den Code eines Systems abzielen, greifen Datenvergiftungsattacken direkt den Lernprozess an. Deshalb sind sie nach der Bereitstellung eines Modells in einer Produktionsumgebung äußerst schwer zu erkennen. Laut IBMs Überblick über Bedrohungen gefährden diese Angriffe die Integrität und Zuverlässigkeit von KI-Systemen erheblich.
So funktioniert die Vergiftung von KI-Systemen#
Da Unternehmen zunehmend auf Deep Learning (DL) und Large Language Models (LLMs) setzen, sammeln sie häufig große Mengen ungeprüfter Daten aus dem Internet. Dadurch entstehen Möglichkeiten zur Dateninjektion: Angreifer schleusen gefälschte oder schädliche Datenpunkte in öffentliche Repositorien ein. Aktuelle Studien zur Vergiftung von KI-Systemen aus dem Jahr 2025 zeigen eine alarmierende Realität: Selbst bei riesigen Modellen mit Milliarden von Parametern muss ein Angreifer nur eine nahezu konstante, minimale Anzahl von Beispielen manipulieren, um das System zu kompromittieren.
Eine Vergiftung von LLMs tritt auf, wenn bestimmte Triggerphrasen in Texte eingefügt werden, die das Modell während des Trainings verarbeitet. Nach der Bereitstellung funktioniert das Modell möglicherweise normal, bis ein Nutzer die Triggerphrase eingibt. Daraufhin kann das System Sicherheitsvorkehrungen umgehen oder schädliche Ausgaben erzeugen. Anthropics Forschung zur Vergiftung von LLMs aus dem Jahr 2025 zeigt, dass bereits 250 vergiftete Dokumente eine Hintertür in einem Modell mit 13 Milliarden Parametern erzeugen können.
Anwendungen und Beispiele aus der Praxis#
Datenvergiftung betrifft nicht nur die Textgenerierung, sondern auch Modelle für Computer Vision (CV). Hier sind zwei konkrete Beispiele dafür, wie sich diese Bedrohung in realen Anwendungen zeigt:
- Generative Kunstmodelle stören: Werkzeuge wie das Projekt Nightshade ermöglichen es Digitalkünstlern, die Bildpunkte ihrer Kunstwerke vor dem Hochladen ins Internet unauffällig zu verändern. Wenn ein Modell für generative KI diese Bilder für das Training sammelt, wirken die veränderten Bildpunkte wie ein Gift und bringen das Modell dazu, Eingabeaufforderungen völlig falsch zu interpretieren – etwa ein Katzenbild zu erzeugen, obwohl ein Auto angefragt wurde.
- Autonome Fahrzeuge kompromittieren: In Systemen zur Objekterkennung, die für selbstfahrende Autos eingesetzt werden, könnte ein Angreifer Bilder von Stoppschildern in einem öffentlich zugänglichen Trainingsdatensatz unauffällig verändern. Durch gezielt eingebrachtes visuelles Rauschen lernt das Modell anhand der vergifteten Trainingsdaten, Stoppschilder als Geschwindigkeitsbegrenzungsschilder fehlzuinterpretieren. Das birgt katastrophale Sicherheitsrisiken.
Abgrenzung zu adversarialen Angriffen#
Obwohl beide eng miteinander verwandt sind, ist es wichtig, Datenvergiftung von adversarialen Angriffen zu unterscheiden. Adversariale Angriffe erfolgen während der Inferenz: Der Angreifer manipuliert die Eingabedaten (etwa indem er einen Aufkleber auf ein echtes Stoppschild klebt), um ein bereits trainiertes Modell zu täuschen. Datenvergiftung erfolgt dagegen während des Trainings und verändert die interne Logik des Modells von Grund auf. Um beiden Bedrohungen zu begegnen, sind robuste Protokolle für die KI-Sicherheit erforderlich.
Risiken bei der Modellentwicklung mindern#
Zum Schutz vor diesen Bedrohungen sind eine sorgfältige Modellüberwachung und einwandfreie, vertrauenswürdige Validierungsdaten erforderlich, mit denen sich die Integrität des Modells überprüfen lässt. Durch die Bewertung eines Modells anhand eines verifizierten Datensatzes können Teams unerwartete Leistungseinbußen erkennen, die auf Manipulationen hindeuten. Die Best Practices aus OpenAIs Sicherheitsforschung und dem OWASP GenAI Security Project betonen die lückenlose Rückverfolgbarkeit der Datenherkunft und den Einsatz kuratierter Datensätze anstelle des ungeprüften Sammelns von Webdaten.
Beim Entwickeln und Testen von Modellen sollten Teams etablierte Frameworks wie PyTorch oder TensorFlow zusammen mit umfassenden Validierungsabläufen verwenden. Du kannst dein Ultralytics YOLO26-Modell ganz einfach anhand eines sauberen, vertrauenswürdigen Datensatzes validieren, um sicherzustellen, dass die Genauigkeit nicht beeinträchtigt wurde.
from ultralytics import YOLO
# Load a custom-trained Ultralytics YOLO26 model
model = YOLO("yolo26n.pt")
# Validate the model on a trusted dataset to detect performance drops
# Sudden decreases in precision/recall may indicate data poisoning
metrics = model.val(data="clean_validation_data.yaml")
print(f"mAP50-95: {metrics.box.map}") # Review core metricsBei großen Computer-Vision-Projekten ist es wichtig, diese Kennzahlen über mehrere Trainingsläufe hinweg zu verfolgen. Entwickler können Erkenntnisse zur Modellbewertung erkunden, um die Ausgangsleistung zu verstehen, und die Ultralytics-Plattform nutzen, um Daten sicher zu annotieren, zu trainieren und zu verwalten, ohne auf ungeprüfte externe Quellen zurückzugreifen. Die Kombination einer sicheren Datenaufbereitung mit kontrollierten Verfahren zur Datenerweiterung trägt dazu bei, dass deine Modelle präzise und widerstandsfähig gegenüber Manipulationen von außen bleiben.









