Data Labeling
Apprends les fondamentaux de l'étiquetage des données pour l'apprentissage automatique. Découvre les types clés comme la détection d'objets et comment accélérer les flux de travail en utilisant Ultralytics YOLO26.
L'étiquetage des données est le processus fondamental qui consiste à identifier des données brutes (telles que des images, des trames vidéo, du texte ou de l'audio) et à y ajouter des étiquettes informatives ou des métadonnées pour fournir un contexte. Dans le domaine du machine learning (ML), les algorithmes ne peuvent pas comprendre intrinsèquement le monde physique ; ils ont besoin d'un « professeur » pour les guider. Cette orientation prend la forme de jeux de données étiquetés utilisés lors de l'apprentissage supervisé. Les étiquettes servent de vérité terrain, représentant les bonnes réponses que le modèle s'efforce de prédire. Qu'il s'agisse d'entraîner un classificateur simple ou une architecture complexe comme Ultralytics YOLO26, la précision, la cohérence et la qualité de ces étiquettes sont les principaux déterminants du succès d'un modèle.
Étiquetage des données vs Annotation de données#
Bien que ces termes soient souvent utilisés de manière interchangeable dans les conversations courantes, il existe une subtile distinction qui mérite d'être soulignée. L'« étiquetage des données » désigne généralement l'action globale d'attribuer une catégorie ou une étiquette à un élément de données (par exemple, marquer un e-mail comme « spam »). En revanche, l'annotation des données est souvent plus spécifique à la vision par ordinateur (CV), impliquant la délimitation précise des objets à l'aide de boîtes englobantes, de polygones ou de points clés. Cependant, dans la plupart des flux de travail d'opérations de ML (MLOps), les deux termes décrivent la création de données d'entraînement de haute qualité.
Types principaux en vision par ordinateur#
La méthode d'étiquetage change en fonction de la tâche que le modèle doit accomplir. Les types courants incluent :
- Classification d'images : Attribution d'une étiquette unique à une image entière, telle que l'identification d'une condition météorologique comme « nuageux » ou « ensoleillé ».
- Détection d'objets : Tracé de boîtes englobantes 2D autour d'objets distincts pour enseigner au modèle ce qu'est l'objet et où il se trouve.
- Segmentation d'instances : Création de masques ou de polygones parfaits au niveau du pixel autour des objets, ce qui est essentiel pour déterminer des formes et des limites précises.
- Estimation de pose : Marquage de points clés spécifiques sur un sujet, tels que les articulations squelettiques, pour analyser le mouvement ou la posture.
Applications concrètes#
L'utilité de l'étiquetage des données s'étend à pratiquement tous les secteurs utilisant l'IA.
-
Véhicules autonomes : Les voitures autonomes s'appuient sur des jeux de données massifs où chaque véhicule, piéton, panneau de signalisation et marquage au sol est méticuleusement étiqueté. Ces données étiquetées permettent au système de perception de naviguer en toute sécurité dans des environnements complexes. Les entreprises de véhicules autonomes investissent massivement dans l'étiquetage au niveau des pixels pour garantir la conformité en matière de sécurité.
-
Agriculture de précision : Dans l'agriculture moderne, l'IA en agriculture est utilisée pour détecter les maladies des cultures ou surveiller les stades de croissance. Les agriculteurs utilisent des modèles formés sur des images étiquetées de feuilles « saines » par rapport à des feuilles « malades » pour automatiser le traitement, réduisant ainsi l'utilisation de produits chimiques et augmentant le rendement.
Le flux de travail d'étiquetage#
La création d'un jeu de données étiqueté est souvent la partie la plus chronophage d'un projet d'IA. Le processus implique généralement une approche « Human-in-the-Loop » (HITL), où des annotateurs humains vérifient les étiquettes pour garantir une haute précision. Les flux de travail modernes exploitent des outils tels que la Plateforme Ultralytics, qui simplifie la gestion des jeux de données et permet aux équipes de collaborer sur les annotations. Des techniques avancées telles que l'apprentissage actif peuvent également être employées, où un modèle pré-étiquette les données et les humains ne corrigent que les prédictions à faible confiance, accélérant considérablement le processus.
L'exemple suivant montre comment utiliser un modèle Ultralytics YOLO26 pré-entraîné pour générer automatiquement des étiquettes (étiquetage automatique) pour une nouvelle image, qui peut ensuite être corrigée par des humains :
from ultralytics import YOLO
# Load the YOLO26n model (nano version)
model = YOLO("yolo26n.pt")
# Run inference on an image to detect objects
results = model("https://ultralytics.com/images/bus.jpg")
# Save the detection results to a text file in standard YOLO format
# This file can now be used as a starting point for data labeling
results[0].save_txt("bus_labels.txt")





