Data Mining
Découvre les techniques et les applications de l’exploration de données. Apprends à extraire des informations exploitables, à identifier des tendances et à optimiser les workflows d’IA avec Ultralytics YOLO26.
L'exploration de données est le processus qui consiste à explorer et à analyser de grandes quantités d'informations afin d'en extraire des schémas et des tendances pertinents. Elle se situe à l'intersection des statistiques, de l'apprentissage automatique (ML) et des systèmes de bases de données, et constitue une étape essentielle du pipeline de « découverte de connaissances dans les bases de données » (KDD). En passant au crible d'immenses quantités de données brutes, l'exploration de données transforme le bruit non structuré en informations structurées et exploitables, que les entreprises et les chercheurs utilisent pour prendre des décisions éclairées.
Dans le contexte de l'intelligence artificielle (AI) moderne, l'exploration de données constitue souvent une étape préalable à la modélisation prédictive. Avant de pouvoir prédire l'avenir, un algorithme doit comprendre le passé. Par exemple, en vision par ordinateur (CV), les techniques d'exploration peuvent analyser des milliers d'images pour identifier les caractéristiques communes — comme les contours, les textures ou les formes — qui définissent une classe d'objets spécifique, créant ainsi les fondations nécessaires à l'entraînement de datasets robustes.
Techniques clés de l'exploration de données#
L'exploration de données repose sur plusieurs méthodologies sophistiquées pour mettre au jour les relations cachées au sein des données. Ces techniques permettent aux analystes d'aller au-delà du simple résumé des données pour parvenir à une découverte approfondie.
- Classification : elle consiste à répartir les éléments de données dans des groupes ou des classes prédéfinis. En vision AI, cela correspond au processus d'entraînement d'un modèle à distinguer une « voiture » d'un « piéton » à partir d'exemples historiques annotés.
- Analyse de clustering : contrairement à la classification, le clustering regroupe les points de données en fonction de leurs similitudes, sans étiquettes prédéfinies. Cette approche est essentielle pour l'apprentissage non supervisé, dans lequel un algorithme peut regrouper automatiquement les comportements d'achat des clients ou les textures d'images similaires. Tu peux en savoir plus sur les méthodes de clustering dans la documentation de Scikit-learn.
- Détection d'anomalies : cette technique identifie les points de données qui s'écartent considérablement de la norme. Elle est essentielle pour détecter les fraudes dans le secteur financier ou repérer les défauts de fabrication sur une chaîne de production.
- Apprentissage de règles d'association : cette méthode met au jour les relations entre les variables d'une base de données. Un exemple classique est l'analyse du panier de consommation, que les détaillants utilisent pour déterminer que les clients qui achètent du pain sont également susceptibles d'acheter du beurre.
- Analyse de régression : utilisée pour prédire une valeur numérique continue à partir d'autres variables, la régression est essentielle pour prévoir les tendances des ventes ou estimer la distance d'un objet dans le cadre de tâches d'estimation de profondeur.
Applications concrètes#
L'utilité de l'exploration de données s'étend à pratiquement tous les secteurs, favorisant l'efficacité et l'innovation en révélant des schémas invisibles à l'œil nu.
Fabrication et contrôle qualité#
Dans la fabrication intelligente, l'exploration de données sert à analyser les données des capteurs des machines. En appliquant des algorithmes de maintenance prédictive, les usines peuvent prévoir les pannes des équipements avant qu'elles ne surviennent. En outre, les modèles de vision par ordinateur comme YOLO26 peuvent générer des journaux d'inférence qui sont analysés pour identifier les types de défauts récurrents, ce qui aide les ingénieurs à ajuster les processus de production afin de réduire les déchets.
Diagnostic médical#
L'exploration de données transforme les soins de santé en analysant les dossiers médicaux électroniques et les images médicales. Les chercheurs explorent les données génomiques pour trouver des associations entre des séquences génétiques spécifiques et des maladies. En radiologie, l'exploration de grands datasets de radiographies aide à identifier les premiers signes d'affections comme la pneumonie ou les tumeurs, ce qui contribue à l'analyse d'images médicales.
Distinction entre les termes associés#
Pour bien comprendre l'exploration de données, il est utile de la distinguer des concepts étroitement liés du domaine de la data science.
- Exploration de données et apprentissage automatique : bien que ces deux domaines se recoupent, l'exploration de données se concentre sur la découverte de schémas existants, tandis que l'apprentissage automatique se concentre sur l'utilisation de ces schémas pour apprendre et prédire les résultats futurs. L'exploration constitue souvent la phase d'analyse exploratoire qui oriente l'ingénierie des caractéristiques pour les modèles de ML.
- Exploration de données et visualisation de données : la visualisation est la représentation graphique des données (diagrammes, graphiques). L'exploration est le processus analytique qui génère les informations à visualiser. Des outils comme Tableau servent souvent à visualiser les résultats de l'exploration de données.
- Exploration de données et entrepôts de données : l'entreposage de données consiste à stocker et à gérer de manière centralisée de grands volumes de données provenant de plusieurs sources. L'exploration est le processus effectué sur ces données entreposées afin d'en extraire de la valeur.
L'exploration de données en pratique avec Ultralytics#
Dans un workflow de vision par ordinateur, l'« exploration » intervient souvent lors de l'analyse des résultats d'inférence afin de trouver des détections à forte valeur ou des cas limites difficiles. Ce processus est simplifié grâce à la Ultralytics Platform, qui aide à gérer et à analyser les datasets.
L'exemple suivant montre comment « explorer » une collection d'images pour trouver des détections spécifiques présentant un niveau de confiance élevé à l'aide d'un modèle YOLO26. Cela reproduit le processus de filtrage de vastes flux de données afin d'en extraire les événements pertinents.
from ultralytics import YOLO
# Load the YOLO26n model
model = YOLO("yolo26n.pt")
# List of image paths (simulating a dataset)
image_files = ["image1.jpg", "image2.jpg", "image3.jpg"]
# Run inference on the batch
results = model(image_files)
# 'Mine' the results for high-confidence 'person' detections (class 0)
high_conf_people = []
for result in results:
# Filter boxes where class is 0 (person) and confidence > 0.8
detections = result.boxes[(result.boxes.cls == 0) & (result.boxes.conf > 0.8)]
if len(detections) > 0:
high_conf_people.append(result.path)
print(f"Found high-confidence people in: {high_conf_people}")Cet extrait illustre une opération d'exploration de base : filtrer les prédictions brutes pour extraire un sous-ensemble présentant un intérêt — des images contenant des personnes identifiées avec un haut niveau de certitude — qui pourrait ensuite être utilisé pour l'apprentissage actif afin d'améliorer davantage les performances du modèle.









