Data Drift
Découvre l’impact de la dérive des données sur la précision des modèles de ML. Apprends à détecter et à atténuer ces changements à l’aide d’Ultralytics YOLO26 et de l’Ultralytics Platform pour un MLOps robuste.
La dérive des données désigne un phénomène de machine learning (ML) dans lequel les propriétés statistiques des données d'entrée observées dans un environnement de production évoluent au fil du temps par rapport aux données d'entraînement initialement utilisées pour créer le modèle. Lorsqu'un modèle est déployé, il fonctionne en partant implicitement du principe que les données du monde réel auxquelles il sera confronté ressembleront fondamentalement aux données historiques à partir desquelles il a appris. Si cette hypothèse n'est plus valable en raison de l'évolution des conditions environnementales ou des comportements des utilisateurs, la précision et la fiabilité du modèle peuvent se dégrader considérablement, même si son code et ses paramètres restent inchangés. La détection et la gestion de la dérive des données constituent un élément essentiel des opérations d'apprentissage automatique (MLOps), afin de garantir que les systèmes d'IA continuent à apporter de la valeur après le déploiement du modèle.
Dérive des données et dérive du concept#
Pour assurer efficacement la maintenance des systèmes d'IA, il est essentiel de distinguer la dérive des données d'un terme étroitement lié : la dérive du concept. Bien que toutes deux entraînent une dégradation des performances, elles résultent de changements différents dans l'environnement.
- Dérive des données (décalage de covariables) : Elle se produit lorsque la distribution des caractéristiques d'entrée change, mais que la relation entre les entrées et la sortie cible reste stable. Par exemple, en vision par ordinateur (CV), un modèle peut être entraîné sur des images prises pendant la journée. Si la caméra commence à capturer des images au crépuscule, la distribution des entrées (éclairage, ombres) a dérivé, mais la définition d'une « voiture » ou d'un « piéton » reste la même.
- Dérive du concept : Elle se produit lorsque la relation statistique entre les caractéristiques d'entrée et la variable cible change. En d'autres termes, la définition de la vérité terrain évolue. Par exemple, dans la détection de la fraude financière, les schémas qui constituent une activité frauduleuse changent souvent à mesure que les fraudeurs adaptent leurs tactiques, modifiant la frontière entre les transactions sûres et frauduleuses.
Applications et exemples concrets#
La dérive des données constitue un défi omniprésent dans les secteurs où l'intelligence artificielle (AI) interagit avec des environnements physiques dynamiques.
-
Systèmes autonomes : Dans le domaine des véhicules autonomes, les modèles de perception s'appuient sur la détection d'objets pour se déplacer en toute sécurité. Un modèle entraîné principalement sur des données provenant des routes ensoleillées de Californie peut subir une forte dérive des données s'il est déployé dans une région où les chutes de neige sont abondantes. Les entrées visuelles (voies couvertes de neige, panneaux masqués) diffèrent radicalement de l'ensemble d'entraînement, ce qui peut compromettre des fonctions de sécurité telles que la détection des voies.
-
Imagerie médicale : Les systèmes d'analyse d'images médicales peuvent subir une dérive lorsque les hôpitaux mettent à niveau leur matériel. Si un modèle a été entraîné sur des radiographies provenant d'un fabricant de scanners donné, l'introduction d'une nouvelle machine avec une résolution ou des paramètres de contraste différents représente une modification de la distribution des données. Sans maintenance du modèle, les performances diagnostiques peuvent chuter.
Stratégies de détection et d'atténuation#
Identifier rapidement la dérive permet d'éviter une « défaillance silencieuse », dans laquelle un modèle produit des prédictions incorrectes avec assurance. Les équipes utilisent différentes stratégies pour repérer ces anomalies avant qu'elles n'aient un impact sur les résultats de l'entreprise.
Méthodes de détection#
- Tests statistiques : Les ingénieurs utilisent souvent des méthodes telles que le test de Kolmogorov-Smirnov pour comparer mathématiquement la distribution des données de production entrantes à la référence d'entraînement.
- Suivi des performances : Le suivi en temps réel de métriques telles que la précision et le rappel peut servir d'indicateur indirect pour détecter la dérive. Une baisse soudaine du score moyen de confiance d'un modèle YOLO26 indique souvent que le modèle a du mal à gérer de nouveaux schémas de données.
- Visualisation : Des outils tels que TensorBoard ou des plateformes spécialisées comme Grafana permettent aux équipes de visualiser les histogrammes des distributions de caractéristiques, ce qui facilite la détection visuelle des changements.
Techniques d'atténuation#
- Réentraînement : La solution la plus robuste consiste souvent à réentraîner le modèle. Il faut pour cela collecter les nouvelles données ayant subi une dérive, les annoter, puis les combiner avec l'ensemble de données d'origine. L'Ultralytics Platform simplifie ce processus en fournissant des outils de gestion des ensembles de données et d'entraînement dans le cloud.
- Augmentation des données : L'application d'une augmentation des données poussée pendant l'entraînement initial — par exemple en modifiant la luminosité, en ajoutant du bruit ou en faisant pivoter les images — peut rendre le modèle plus résilient aux changements environnementaux mineurs.
- Adaptation de domaine : Les techniques d'apprentissage par transfert permettent aux modèles de s'adapter à un nouveau domaine cible à l'aide d'une plus petite quantité de données annotées, réduisant ainsi l'écart entre l'environnement d'entraînement source et la nouvelle réalité de production.
Tu peux mettre en place un suivi élémentaire de la dérive en vérifiant la confiance accordée aux prédictions de ton modèle. Si la confiance moyenne reste constamment inférieure à un seuil fiable, cela peut déclencher une alerte pour examiner les données.
from ultralytics import YOLO
# Load the official YOLO26 model
model = YOLO("yolo26n.pt")
# Run inference on a new image from the production stream
results = model("https://ultralytics.com/images/bus.jpg")
# Monitor confidence scores; consistently low scores may signal data drift
for result in results:
for box in result.boxes:
print(f"Class: {box.cls}, Confidence: {box.conf.item():.2f}")La gestion de la dérive des données n'est pas une correction ponctuelle, mais un processus continu couvrant tout le cycle de vie. Les fournisseurs cloud proposent des services gérés tels que AWS SageMaker Model Monitor ou Google Cloud Vertex AI pour automatiser ce processus. En surveillant ces changements de manière proactive, les organisations s'assurent que leurs modèles restent robustes, tout en maintenant des niveaux élevés de sécurité de l'IA et d'efficacité opérationnelle.









