Explorer l’annotation des données pour les projets de vision par ordinateur
Lis notre analyse approfondie de l’annotation des données appliquée aux projets de vision par ordinateur, et apprends à annoter les données visuelles et pourquoi c’est si important.

L’intelligence artificielle (AI) vise à doter les machines de capacités semblables à celles des humains, et l’une des méthodes les plus populaires pour y parvenir est l’apprentissage supervisé. Autrement dit, enseigner aux modèles d’IA en leur montrant des exemples annotés peut les aider à apprendre des schémas et à s’améliorer dans différentes tâches. C’est très similaire à la façon dont les humains apprennent de leur expérience. Alors, comment ces exemples annotés sont-ils créés ?
L’annotation des données consiste à étiqueter ou à baliser des données afin d’aider les algorithmes d’apprentissage automatique à les comprendre. En vision par ordinateur, cela signifie marquer des images ou des vidéos pour reconnaître et catégoriser avec précision des objets, des actions ou des scènes. L’étiquetage des données est essentiel, car la réussite d’un modèle d’IA dépend largement de la qualité des données annotées sur lesquelles il est entraîné.
Des études montrent que plus de 80 % du temps consacré aux projets d’IA est consacré à la gestion des données, de leur collecte et de leur agrégation à leur nettoyage et leur annotation. Cela montre à quel point l’annotation des données est importante dans le développement des modèles d’IA. L’utilisation de données annotées de haute qualité permet aux modèles d’IA d’effectuer des tâches comme la reconnaissance faciale et la détection d’objets avec davantage de précision et de fiabilité dans des situations réelles.
Pourquoi l’annotation des données est nécessaire#
L’annotation des données constitue la base des performances d’un modèle de vision par ordinateur. Les données étiquetées représentent la vérité terrain que le modèle utilise pour apprendre et effectuer des prédictions. Les données de vérité terrain sont essentielles, car elles représentent le monde réel que le modèle tente de comprendre. Sans cette référence fiable, le modèle d’IA serait comme un navire naviguant sans boussole.

Fig. 1 Vérité terrain et prédiction.
Un étiquetage précis aide ces modèles à comprendre ce qu’ils voient et conduit à de meilleures prises de décision. Si les données sont mal étiquetées ou incohérentes, le modèle aura du mal à produire des prédictions et des décisions correctes, tout comme un élève qui apprend à partir de manuels incorrects. Grâce aux données annotées, un modèle peut apprendre des tâches comme la classification d’images, la segmentation d’instances et l’estimation de pose d’objets dans des images et des vidéos.
Meilleures ressources pour les jeux de données#
Avant de créer un tout nouveau jeu de données et d’annoter méticuleusement des images et des vidéos, il est judicieux de vérifier si tu peux utiliser des jeux de données existants pour ton projet. Il existe plusieurs excellents dépôts open source dans lesquels tu peux accéder gratuitement à des jeux de données de haute qualité. Parmi les plus populaires, on trouve notamment :
- ImageNet : il est couramment utilisé pour entraîner des modèles de classification d’images.
- COCO : ce jeu de données est conçu pour la détection d’objets, la segmentation et le sous-titrage d’images.
- PASCAL VOC : il prend en charge les tâches de détection d’objets et de segmentation.

Fig. 2 Exemples de données du jeu de données COCO.
Lorsque tu choisis un jeu de données, il est important de prendre en compte des facteurs comme son adéquation avec ton projet, sa taille, sa diversité et la qualité de ses étiquettes. Veille également à consulter les conditions de licence du jeu de données afin d’éviter toute conséquence juridique, et vérifie que les données sont formatées d’une manière adaptée à ton flux de travail et à tes outils.
Créer un jeu de données personnalisé est une excellente option si les jeux de données existants ne répondent pas tout à fait à tes besoins. Tu peux recueillir des images à l’aide d’outils comme des webcams, des drones ou des smartphones, selon les exigences de ton projet. Idéalement, ton jeu de données personnalisé doit être diversifié, équilibré et véritablement représentatif du problème que tu essaies de résoudre. Cela peut impliquer de capturer des images dans différentes conditions d’éclairage, sous divers angles et dans plusieurs environnements.
Si tu ne peux recueillir qu’un nombre limité d’images ou de vidéos, l’augmentation des données est une technique utile. Elle consiste à enrichir ton jeu de données en appliquant des transformations comme la rotation, le retournement ou les ajustements de couleur aux images existantes. Elle augmente la taille de ton jeu de données et rend ton modèle plus robuste et mieux à même de gérer les variations des données. En combinant des jeux de données open source, des jeux de données personnalisés et des données augmentées, tu peux améliorer considérablement les performances de tes modèles de vision par ordinateur.
Types de techniques d’annotation d’images#
Avant de commencer à annoter des images, il est important de connaître les différents types d’annotations. Cela t’aidera à choisir celui qui convient à ton projet. Examinons maintenant certains des principaux types d’annotations.
Boîtes englobantes#
Les cadres englobants sont le type d’annotation le plus courant en vision par ordinateur. Ce sont des cadres rectangulaires utilisés pour marquer l’emplacement d’un objet dans une image. Ces cadres sont définis par les coordonnées de leurs coins et aident les modèles d’IA à identifier et à localiser les objets. Les cadres englobants sont principalement utilisés pour la détection d’objets.

Fig. 3 Exemple de cadres englobants.
Masques de segmentation#
Parfois, un objet doit être détecté avec davantage de précision qu’avec un simple cadre englobant tracé autour de lui. Tu peux t’intéresser aux contours des objets présents dans une image. Dans ce cas, les masques de segmentation te permettent de délimiter des objets complexes. Les masques de segmentation offrent une représentation plus détaillée au niveau des pixels.
Ces masques peuvent être utilisés pour la segmentation sémantique et la segmentation d’instances. La segmentation sémantique consiste à étiqueter chaque pixel d’une image en fonction de l’objet ou de la zone qu’il représente, comme un piéton, une voiture, une route ou un trottoir. La segmentation d’instances va cependant plus loin en identifiant et en séparant chaque objet individuellement, par exemple en distinguant chaque voiture d’une image, même si elles sont toutes du même type.

Fig. 4 Exemple de masques de segmentation sémantique (à gauche) et de segmentation d’instances (à droite).
Cuboïdes 3D#
Les cuboïdes 3D sont similaires aux cadres englobants, mais leur particularité est d’ajouter des informations de profondeur et de fournir une représentation 3D d’un objet. Ces informations supplémentaires permettent aux systèmes de comprendre la forme, le volume et la position des objets dans un espace 3D. Les cuboïdes 3D sont souvent utilisés dans les voitures autonomes pour mesurer la distance entre les objets et le véhicule.

Fig. 5 Exemple de cuboïdes 3D.
Points clés et repères#
Un autre type d’annotation intéressant est celui des points clés, qui consiste à marquer sur les objets des points spécifiques comme les yeux, le nez ou les articulations. Les repères vont plus loin en reliant ces points pour capturer la structure et le mouvement de formes plus complexes, comme les visages ou les poses corporelles. Ces types d’annotations sont utilisés pour des applications comme la reconnaissance faciale, la capture de mouvements et la réalité augmentée. Ils améliorent également la précision des modèles d’IA dans des tâches comme la reconnaissance des gestes ou l’analyse des performances sportives.

Fig. 6. Exemple de points clés.
Comment annoter des données avec LabelImg#
Maintenant que nous avons abordé les différents types d’annotations, voyons comment tu peux annoter des images à l’aide d’un outil populaire, LabelImg. LabelImg est un outil open source qui simplifie l’annotation d’images et peut être utilisé pour créer des jeux de données au format YOLO (Tu ne regardes qu’une seule fois). C’est un excellent choix pour les débutants qui travaillent sur de petits projets Ultralytics YOLOv8.
La configuration de LabelImg est simple. Commence par vérifier que Python 3 est installé sur ton ordinateur. Tu peux ensuite installer LabelImg avec une commande rapide :
pip3 install labelImgUne fois l’installation terminée, tu peux lancer l’outil à l’aide de la commande suivante :
labelImgLabelImg fonctionne sur plusieurs plateformes, notamment Windows, macOS et Linux. Si tu rencontres des problèmes pendant l’installation, le dépôt officiel de LabelImg peut te fournir des instructions plus détaillées.

Fig. 7. Utilisation de LabelImg pour l’annotation d’images.
Une fois l’outil lancé, suis ces quelques étapes simples pour commencer à étiqueter tes images :
- Configure tes classes : commence par définir la liste des classes (catégories) que tu souhaites annoter dans un fichier nommé « predefined_classes.txt ». Ce fichier indique au logiciel quels objets tu vas étiqueter dans tes images.
- Passe au format YOLO : par défaut, LabelImg utilise le format PASCAL VOC, mais si tu travailles avec YOLO, tu devras changer de format. Clique simplement sur le bouton « PascalVOC » de la barre d’outils pour passer à YOLO.
- Commence l’annotation : utilise les options « Open » ou « OpenDIR » pour charger tes images. Dessine ensuite des cadres englobants autour des objets que tu souhaites annoter et attribue la classe correcte. Après avoir étiqueté chaque image, enregistre ton travail. LabelImg créera un fichier texte portant le même nom que ton image et contenant les annotations YOLO.
- Enregistre et vérifie : les annotations sont enregistrées dans un fichier .txt au format YOLO. Le logiciel enregistre également un fichier « classes.txt » qui répertorie tous les noms de tes classes.
Stratégies efficaces d’annotation des données#
Pour fluidifier le processus d’annotation des données, il faut garder à l’esprit quelques stratégies clés. Par exemple, des consignes d’annotation claires sont essentielles. Sans elles, différents annotateurs pourraient interpréter une tâche de manière différente.
Supposons que la tâche consiste à annoter des oiseaux dans des images à l’aide de cadres englobants. Un annotateur pourrait étiqueter l’oiseau entier, tandis qu’un autre pourrait ne marquer que la tête ou les ailes. Ce type d’incohérence peut perturber le modèle pendant l’entraînement. En fournissant des définitions claires, comme « étiqueter l’oiseau entier, y compris les ailes et la queue », ainsi que des exemples et des instructions pour les cas complexes, tu peux t’assurer que les données sont balisées avec précision et cohérence.
Des contrôles qualité réguliers sont également importants pour maintenir des standards élevés. En définissant des références et en utilisant des métriques spécifiques pour examiner le travail, tu peux préserver l’exactitude des données et améliorer le processus grâce à un retour d’information continu.
L’annotation des données en bref#
L’annotation des données est un concept simple qui peut avoir un impact considérable sur ton modèle de vision par ordinateur. Que tu utilises des outils comme LabelImg pour annoter des images ou que tu entraînes des modèles sur des jeux de données open source, il est essentiel de comprendre l’annotation des données. Les stratégies d’annotation des données peuvent contribuer à rationaliser l’ensemble du processus et à le rendre plus efficace. Prendre le temps d’affiner ton approche de l’annotation peut produire de meilleurs résultats d’IA, plus fiables.
Continue à explorer et à développer tes compétences ! Reste en contact avec notre communauté pour continuer à apprendre sur l’IA ! Consulte notre dépôt GitHub pour découvrir comment nous utilisons l’IA afin de créer des solutions innovantes dans des secteurs comme l’industrie manufacturière et la santé. 🚀









