Data Labeling
Apprends les fondamentaux de l’étiquetage des données pour le machine learning. Découvre des types essentiels comme la détection d’objets et comment accélérer les workflows avec Ultralytics YOLO26.
L’étiquetage des données est le processus fondamental qui consiste à identifier des données brutes — telles que des images, des images vidéo, du texte ou de l’audio — et à leur ajouter des balises ou des métadonnées informatives pour fournir un contexte. Dans le domaine de l’apprentissage automatique (ML), les algorithmes ne peuvent pas comprendre intrinsèquement le monde physique ; ils ont besoin d’un « enseignant » pour les guider. Cette guidance prend la forme d’ensembles de données étiquetés utilisés lors de l’apprentissage supervisé. Les étiquettes constituent la vérité terrain, c’est-à-dire les réponses correctes que le modèle cherche à prédire. Qu’il s’agisse d’entraîner un classificateur simple ou une architecture complexe comme Ultralytics YOLO26, la précision, la cohérence et la qualité de ces étiquettes sont les principaux facteurs déterminant la réussite d’un modèle.
Étiquetage des données et annotation des données#
Bien que ces termes soient souvent utilisés indifféremment dans les conversations courantes, une distinction subtile mérite d’être relevée. L’« étiquetage des données » désigne généralement l’acte général d’attribuer une catégorie ou une balise à une donnée (par exemple, marquer un e-mail comme « spam »). En revanche, l’annotation des données est souvent plus spécifique à la vision par ordinateur (CV) et consiste à délimiter précisément les objets à l’aide de cadres englobants, de polygones ou de points clés. Cependant, dans la plupart des workflows d’opérations ML (MLOps), les deux termes désignent la création de données d’entraînement de haute qualité.
Principaux types en vision par ordinateur#
La méthode d’étiquetage varie selon la tâche que le modèle doit accomplir. Les types courants comprennent :
- Classification d’images : Attribuer une seule étiquette à une image entière, par exemple pour identifier une condition météorologique comme « nuageux » ou « ensoleillé ».
- Détection d’objets : Dessiner des cadres englobants 2D autour d’objets distincts afin d’apprendre au modèle ce qu’est l’objet et où il se trouve.
- Segmentation d’instances : Créer des masques ou des polygones au pixel près autour des objets, ce qui est essentiel pour déterminer précisément leurs formes et leurs contours.
- Estimation de pose : Marquer des points clés précis sur un sujet, comme les articulations du squelette, afin d’analyser ses mouvements ou sa posture.
Applications concrètes#
L’utilité de l’étiquetage des données s’étend à presque tous les secteurs qui utilisent l’IA.
-
Véhicules autonomes : Les voitures autonomes reposent sur d’immenses ensembles de données où chaque véhicule, piéton, panneau de signalisation et marquage au sol est méticuleusement étiqueté. Ces données étiquetées permettent au système de perception de naviguer en toute sécurité dans des environnements complexes. Les entreprises de véhicules autonomes investissent massivement dans l’étiquetage au niveau du pixel afin de garantir le respect des exigences de sécurité.
-
Agriculture de précision : Dans l’agriculture moderne, l’IA dans l’agriculture est utilisée pour détecter les maladies des cultures ou surveiller les stades de croissance. Les agriculteurs utilisent des modèles entraînés sur des images étiquetées de feuilles « saines » et « malades » pour automatiser les traitements, réduire l’utilisation de produits chimiques et augmenter les rendements.
Le workflow d’étiquetage#
La création d’un ensemble de données étiqueté est souvent la partie la plus chronophage d’un projet d’IA. Le processus repose généralement sur une approche « humain dans la boucle » (HITL), dans laquelle des annotateurs humains vérifient les étiquettes pour garantir une grande précision. Les workflows modernes s’appuient sur des outils comme la plateforme Ultralytics, qui simplifie la gestion des ensembles de données et permet aux équipes de collaborer sur les annotations. Des techniques avancées comme l’apprentissage actif peuvent également être utilisées : un modèle préétiquette les données, puis les humains corrigent uniquement les prédictions présentant une faible confiance, ce qui accélère considérablement le processus.
L’exemple suivant montre comment utiliser un modèle Ultralytics YOLO26 préentraîné pour générer automatiquement des étiquettes (auto-étiquetage) pour une nouvelle image, qui pourront ensuite être corrigées par des humains :
from ultralytics import YOLO
# Load the YOLO26n model (nano version)
model = YOLO("yolo26n.pt")
# Run inference on an image to detect objects
results = model("https://ultralytics.com/images/bus.jpg")
# Save the detection results to a text file in standard YOLO format
# This file can now be used as a starting point for data labeling
results[0].save_txt("bus_labels.txt")








