Data Lake
Découvre comment les lacs de données constituent le socle de l’IA et du ML. Apprends à exploiter les données brutes pour entraîner Ultralytics YOLO26 et rationaliser les workflows de vision par ordinateur.
Un lac de données est un référentiel de stockage centralisé qui contient une vaste quantité de données brutes dans leur format natif jusqu'à ce qu'elles soient nécessaires. Contrairement aux systèmes de stockage traditionnels, qui exigent que les données soient structurées avant leur ingestion, un lac de données accepte les données « telles quelles », notamment les données structurées (lignes et colonnes), semi-structurées (CSV, journaux, XML, JSON), non structurées (e-mails, documents, PDF) et binaires (images, audio, vidéo). Cette flexibilité architecturale fait des lacs de données un élément essentiel des stratégies modernes de mégadonnées, en particulier pour les organisations qui exploitent l'intelligence artificielle (AI) et l'apprentissage automatique (ML). En dissociant la capture des données de leur utilisation, les organisations peuvent stocker d'immenses volumes d'informations à un coût relativement faible et déterminer ultérieurement les questions d'analyse précises à poser.
Le rôle des lacs de données dans l'intelligence artificielle et l'apprentissage automatique#
Dans le contexte du développement de l'intelligence artificielle, la principale valeur d'un lac de données réside dans sa capacité à prendre en charge les workflows d'apprentissage profond (DL). Les réseaux neuronaux avancés nécessitent des [données d'entraînement](https://ultralytics-translation-1.invalid diversifiées et volumineuses pour atteindre une grande précision. Un lac de données sert de zone de préparation où résident les ressources brutes — comme des millions d'images haute résolution pour la vision par ordinateur (CV) ou des milliers d'heures d'audio pour la reconnaissance vocale — avant leur traitement.
Les data scientists utilisent des méthodologies de « schéma à la lecture » dans les lacs de données. Cela signifie que la structure est appliquée aux données uniquement lors de leur lecture pour traitement, plutôt qu'au moment de leur écriture dans le stockage. Cette approche permet une agilité considérable : le même jeu de données brutes peut être traité de multiples façons pour différentes tâches de modélisation prédictive, sans modifier la source originale. En outre, les lacs de données robustes s'intègrent souvent à des services de cloud computing comme Amazon S3 ou Azure Blob Storage, ce qui permet le traitement parallèle et évolutif nécessaire à l'entraînement de modèles lourds comme YOLO26.
Lac de données ou entrepôt de données#
Bien qu'ils soient souvent confondus, un lac de données et un entrepôt de données sont deux concepts distincts. Un entrepôt de données stocke les données dans des tables structurées et est optimisé pour les requêtes SQL rapides et les rapports de veille stratégique. Il utilise un « schéma à l'écriture », ce qui signifie que les données doivent être nettoyées et transformées au moyen d'un processus d'extraction, transformation et chargement (ETL) avant d'être intégrées au système.
À l'inverse, un lac de données est optimisé pour le volume et la variété des données stockées. Il prend en charge l'apprentissage non supervisé et l'analyse exploratoire, lorsque l'objectif n'est peut-être pas encore défini. Par exemple, un entrepôt de données peut t'indiquer combien de produits ont été vendus le mois dernier, tandis qu'un lac de données contient les journaux bruts de sentiment client et les données d'image qui aident un modèle d'IA à comprendre pourquoi ils ont été vendus.
Applications concrètes#
Les lacs de données jouent un rôle essentiel dans divers secteurs qui repoussent les limites de l'automatisation :
- Véhicules autonomes : le développement de technologies de conduite autonome nécessite le traitement de pétaoctets de données de capteurs. Les véhicules autonomes génèrent des flux continus de nuages de points LiDAR, de signaux radar et de vidéos haute définition. Un lac de données stocke ces données de télémétrie brutes, ce qui permet aux ingénieurs de rejouer des scénarios réels afin d'entraîner des modèles de détection d'objets capables d'identifier les piétons et les obstacles dans diverses conditions météorologiques.
- Diagnostic médical : dans l'analyse d'images médicales moderne, les hôpitaux regroupent les antécédents des patients, les données génomiques et les fichiers d'imagerie (IRM, scanners) dans un lac de données sécurisé. Les chercheurs peuvent ensuite accéder à ces données anonymisées et non structurées pour entraîner des modèles de détection des tumeurs ou de prédiction des maladies, en utilisant souvent des techniques de segmentation pour isoler les régions d'intérêt dans les images médicales.
Utiliser les lacs de données avec Ultralytics#
Lorsque tu travailles avec la Ultralytics Platform, tu extrais souvent des sous-ensembles de données brutes du lac de données de ton organisation afin de créer des jeux de données annotés pour l'entraînement. Une fois les images brutes récupérées et étiquetées, elles peuvent servir à entraîner des modèles de pointe.
L'exemple suivant montre comment un développeur peut charger un jeu de données local (simulant une récupération depuis un lac de données) afin d'entraîner le modèle YOLO26 pour une tâche de détection.
from ultralytics import YOLO
# Load the YOLO26n model (nano version for speed)
model = YOLO("yolo26n.pt")
# Train the model using a dataset configuration file
# In a production pipeline, this data might be streamed or downloaded
# from a cloud-based data lake prior to this step.
results = model.train(data="coco8.yaml", epochs=5, imgsz=640)
# Run inference on a new image to verify performance
predictions = model("https://ultralytics.com/images/bus.jpg")








