Data Drift
Erfahre, wie sich Datenveränderungen auf die Genauigkeit von ML-Modellen auswirken. Lerne, Verschiebungen mit Ultralytics YOLO26 und der Ultralytics Platform zu erkennen und zu minimieren, um robustes MLOps zu ermöglichen.
Datenverschiebung bezeichnet ein Phänomen im maschinellen Lernen (ML), bei dem sich die statistischen Eigenschaften der Eingabedaten, die in einer Produktionsumgebung beobachtet werden, im Laufe der Zeit im Vergleich zu den ursprünglich zum Erstellen des Modells verwendeten Trainingsdaten ändern. Bei der Bereitstellung eines Modells wird implizit davon ausgegangen, dass die angetroffenen realen Daten grundsätzlich den historischen Daten ähneln, aus denen das Modell gelernt hat. Wird diese Annahme aufgrund veränderter Umgebungsbedingungen oder Nutzerverhaltens verletzt, können die Genauigkeit und Zuverlässigkeit des Modells erheblich abnehmen, selbst wenn der Code und die Parameter des Modells unverändert bleiben. Das Erkennen und Verwalten von Datenverschiebungen ist ein wesentlicher Bestandteil des Betriebs maschineller Lernsysteme (MLOps), um sicherzustellen, dass KI-Systeme auch nach der Bereitstellung des Modells weiterhin einen Mehrwert liefern.
Datenverschiebung vs. Konzeptverschiebung#
Für die effektive Wartung von KI-Systemen ist es entscheidend, Datenverschiebung von dem eng verwandten Begriff Konzeptverschiebung zu unterscheiden. Beide führen zwar zu einer Verschlechterung der Leistung, entstehen jedoch durch unterschiedliche Veränderungen in der Umgebung.
- Datenverschiebung (Kovariatenverschiebung): Sie tritt auf, wenn sich die Verteilung der Eingabemerkmale ändert, die Beziehung zwischen den Eingaben und der Zielausgabe jedoch stabil bleibt. Beispielsweise könnte ein Modell in der Computer Vision (CV) mit Bildern trainiert worden sein, die bei Tag aufgenommen wurden. Beginnt die Kamera, Bilder in der Dämmerung aufzunehmen, hat sich die Eingabeverteilung (Beleuchtung, Schatten) verschoben, aber die Definition eines „Autos“ oder eines „Fußgängers“ bleibt unverändert.
- Konzeptverschiebung: Sie tritt auf, wenn sich die statistische Beziehung zwischen den Eingabemerkmalen und der Zielvariable ändert. Anders ausgedrückt: Die Definition der Grundwahrheit entwickelt sich weiter. Bei der Erkennung von Finanzbetrug ändern sich beispielsweise die Muster, die betrügerische Aktivitäten kennzeichnen, häufig, wenn Betrüger ihre Taktiken anpassen und dadurch die Grenze zwischen sicheren und betrügerischen Transaktionen verschieben.
Anwendungen und Beispiele aus der Praxis#
Datenverschiebung ist eine weitverbreitete Herausforderung in Branchen, in denen künstliche Intelligenz (AI) mit dynamischen, physischen Umgebungen interagiert.
-
Autonome Systeme: Im Bereich der autonomen Fahrzeuge nutzen Wahrnehmungsmodelle die Objekterkennung, um sicher zu navigieren. Ein Modell, das hauptsächlich mit Daten von sonnigen Straßen in Kalifornien trainiert wurde, kann bei der Bereitstellung in einer Region mit starkem Schneefall eine erhebliche Datenverschiebung erfahren. Die visuellen Eingaben (schneebedeckte Fahrspuren, verdeckte Schilder) unterscheiden sich deutlich vom Trainingsdatensatz, was Sicherheitsfunktionen wie die Spurerkennung beeinträchtigen kann.
-
Medizinische Bildgebung: Systeme zur Analyse medizinischer Bilder können eine Verschiebung aufweisen, wenn Krankenhäuser ihre Hardware aufrüsten. Wurde ein Modell mit Röntgenbildern eines bestimmten Scannerherstellers trainiert, stellt die Einführung eines neuen Geräts mit einer anderen Auflösung oder Kontrasteinstellung eine Verschiebung der Datenverteilung dar. Ohne Modellwartung kann die diagnostische Leistung abnehmen.
Strategien zur Erkennung und Eindämmung#
Das frühzeitige Erkennen einer Verschiebung verhindert einen „stillen Ausfall“, bei dem ein Modell selbstbewusste, aber falsche Vorhersagen trifft. Teams verwenden verschiedene Strategien, um diese Anomalien zu erkennen, bevor sie sich auf die Geschäftsergebnisse auswirken.
Erkennungsmethoden#
- Statistische Tests: Ingenieure verwenden häufig Methoden wie den Kolmogorow-Smirnow-Test, um die Verteilung eingehender Produktionsdaten mathematisch mit der Basisverteilung der Trainingsdaten zu vergleichen.
- Leistungsüberwachung: Die Echtzeitverfolgung von Messwerten wie Precision und Recall kann als Ersatzgröße für die Erkennung von Verschiebungen dienen. Ein plötzlicher Rückgang des durchschnittlichen Konfidenzwerts eines YOLO26-Modells deutet häufig darauf hin, dass das Modell Schwierigkeiten mit neuartigen Datenmustern hat.
- Visualisierung: Tools wie TensorBoard oder spezialisierte Plattformen wie Grafana ermöglichen es Teams, Histogramme von Merkmalsverteilungen zu visualisieren und Verschiebungen dadurch leichter visuell zu erkennen.
Techniken zur Eindämmung#
- Nachtraining: Die robusteste Lösung besteht häufig darin, das Modell neu zu trainieren. Dazu werden die neuen, von der Verschiebung betroffenen Daten gesammelt, annotiert und mit dem ursprünglichen Datensatz kombiniert. Die Ultralytics Platform vereinfacht diesen Prozess durch Tools für die Datensatzverwaltung und das Training in der Cloud.
- Datenerweiterung: Eine umfassende Datenerweiterung während des anfänglichen Trainings – etwa durch das Ändern der Helligkeit, das Hinzufügen von Rauschen oder das Drehen von Bildern – kann das Modell widerstandsfähiger gegenüber geringfügigen Veränderungen der Umgebung machen.
- Domänenanpassung: Techniken des Transferlernens ermöglichen es Modellen, sich mithilfe einer kleineren Menge gekennzeichneter Daten an eine neue Zieldomäne anzupassen und so die Lücke zwischen der ursprünglichen Trainingsumgebung und der neuen Realität in der Produktion zu schließen.
Du kannst eine grundlegende Überwachung von Verschiebungen implementieren, indem du die Konfidenz der Vorhersagen deines Modells prüfst. Wenn die durchschnittliche Konfidenz dauerhaft unter einen verlässlichen Schwellenwert fällt, kann dies einen Alarm zur Überprüfung der Daten auslösen.
from ultralytics import YOLO
# Load the official YOLO26 model
model = YOLO("yolo26n.pt")
# Run inference on a new image from the production stream
results = model("https://ultralytics.com/images/bus.jpg")
# Monitor confidence scores; consistently low scores may signal data drift
for result in results:
for box in result.boxes:
print(f"Class: {box.cls}, Confidence: {box.conf.item():.2f}")Die Verwaltung von Datenverschiebungen ist keine einmalige Korrektur, sondern ein kontinuierlicher Prozess über den gesamten Lebenszyklus. Cloudanbieter bieten verwaltete Dienste wie AWS SageMaker Model Monitor oder Google Cloud Vertex AI, um dies zu automatisieren. Durch die proaktive Überwachung solcher Verschiebungen stellen Unternehmen sicher, dass ihre Modelle robust bleiben und hohe Standards für KI-Sicherheit und betriebliche Effizienz erfüllen.









