Ultralytics YOLO27 :
Vision par IA

Comprendre pourquoi l’annotation avec intervention humaine est essentielle

Découvre comment les données annotées par des humains améliorent la précision des modèles de vision par ordinateur et pourquoi l’expertise humaine reste essentielle pour créer des systèmes d’IA de vision fiables.

ABAbirami Vina11 min read
Annotation avec intervention humaine pour la vision par ordinateur

Il y a vingt ans, si quelqu’un disait envisager d’installer un robot pour l’aider à la maison, cela aurait semblé complètement invraisemblable. Pourtant, nous sommes en plein essor de l’IA, et des robots sont testés dans des scénarios similaires.

Un domaine clé de l’IA qui contribue à ces avancées est la vision par ordinateur, qui permet aux machines de comprendre les images et les vidéos. En d’autres termes, les modèles de vision par ordinateur comme Ultralytics YOLO11 et le prochain Ultralytics YOLO26 peuvent être entraînés sur des jeux de données composés de données visuelles et d’annotations.

Ces annotations aident le modèle à comprendre les données visuelles. Par exemple, les jeux de données de détection d’objets utilisent des boîtes englobantes pour dessiner des rectangles autour des objets d’intérêt. Cela permet au modèle de détecter et de localiser ces objets dans de nouvelles images, même lorsque la scène est encombrée ou que l’objet est partiellement masqué.

D’autres tâches de vision par ordinateur dépendent de différents types d’annotations. Les jeux de données de segmentation indiquent le contour exact d’un objet au niveau du pixel, tandis que les jeux de données de points clés marquent des repères précis, comme les articulations d’une personne.

Cependant, dans tous ces formats, un facteur essentiel est la qualité et la cohérence des labels. Les modèles apprennent directement à partir des données sur lesquelles ils sont entraînés. Si les labels sont incohérents ou incorrects, le modèle reproduira souvent ces erreurs dans ses prédictions.

Même avec l’automatisation, les jeux de données annotés par des humains restent essentiels, en particulier dans des domaines à forts enjeux comme l’imagerie médicale. De petites erreurs d’annotation, comme une limite de tumeur imprécise ou une anomalie non détectée, peuvent apprendre au modèle un mauvais schéma et entraîner par la suite des prédictions dangereuses. Les experts humains fournissent la vérité terrain et le jugement précis qu’exigent ces applications.

Les jeux de données annotés par des humains sont nécessaires

Fig. 1. Les jeux de données annotés par des humains sont nécessaires. Image de l’auteur.

Dans cet article, nous allons examiner plus attentivement pourquoi les données annotées par des humains sont essentielles, même si l’IA continue de progresser.

La nécessité de l’annotation des images et des vidéos#

Les modèles de vision par ordinateur apprennent un peu comme nous, en observant de nombreux exemples. La différence est qu’ils apprennent en s’entraînant sur de grands jeux de données d’images et de vidéos que des humains ont préalablement annotés. Ces labels servent de vérité terrain et apprennent au modèle des notions telles que « ceci est un piéton », « voici la limite d’une tumeur » ou « cet objet est une voiture ».

Les éléments visuels du monde réel sont rarement propres ou cohérents. L’éclairage peut changer et donner un aspect différent au même objet. Des personnes et des véhicules peuvent se chevaucher ou être partiellement masqués. Les arrière-plans peuvent être chargés et distrayants. Lorsque les jeux de données contiennent des labels soigneusement définis et cohérents dans ces situations, les modèles sont bien mieux préparés à ce qui les attend en dehors des environnements contrôlés.

L’annotation des données ne consiste pas seulement à dessiner des boîtes ou à tracer des contours. Elle implique d’appliquer des directives et de prendre des décisions concrètes sur ce qui constitue l’objet, l’endroit où doit se situer sa limite et la manière de procéder lorsqu’un élément n’est pas clair. Ce jugement humain garantit que les données restent précises et exploitables.

En définitive, un système de vision par ordinateur n’est performant qu’à hauteur de la qualité des données annotées à partir desquelles il apprend. Dans des applications à fort impact, comme la détection d’un cancer sur des examens ou l’identification de dangers routiers pour des voitures autonomes, des labels précis fournis par des personnes compétentes font une réelle différence en matière de précision et de sécurité.

L’essor de l’automatisation de l’annotation des données#

À mesure que la vision par ordinateur se développe et que les jeux de données s’agrandissent, l’automatisation devient un moyen courant d’accélérer l’annotation. Au lieu de tout annoter manuellement, les équipes utilisent des modèles d’IA pour produire une première version des labels.

Les humains examinent ensuite les résultats, corrigent les erreurs et traitent les cas que le modèle ne peut pas annoter avec suffisamment de confiance. Cette approche accélère l’annotation tout en maintenant un niveau de qualité élevé.

Voici quelques façons dont l’automatisation contribue généralement à l’annotation des données :

  • Segmentation automatique : les modèles peuvent proposer automatiquement des contours d’objets ou des masques au niveau du pixel, ce qui réduit la quantité de traçage manuel que les annotateurs doivent effectuer.
  • Suivi par flux optique : pour les vidéos, les méthodes de suivi peuvent suivre un objet en mouvement d’une image à l’autre et reporter son label, ce qui contribue à maintenir la cohérence des annotations au fil du temps.
  • Interpolation d’images : les outils peuvent compléter les labels des images situées entre deux images annotées en utilisant des informations de mouvement et de suivi, afin que les annotateurs n’aient pas à annoter chaque image.
  • Apprentissage actif : les pipelines d’entraînement peuvent identifier les exemples que le modèle juge incertains ou inhabituels et les transmettre en priorité aux humains, afin que l’effort manuel soit consacré aux données qui améliorent le plus les performances.

Pourquoi l’annotation humaine des données reste essentielle#

Même si l’automatisation peut accélérer l’annotation, les modèles d’IA ont toujours besoin du jugement humain pour rester précis et fiables.

Voici quelques domaines clés dans lesquels l’expertise humaine joue un rôle important dans l’annotation des données :

  • Comprendre le contexte : les images et les vidéos réelles sont souvent désordonnées. Les ombres, les reflets, le flou de mouvement et les objets qui se chevauchent peuvent perturber les outils automatisés. Les annotateurs humains peuvent interpréter ce qui se passe réellement, afin de produire des labels plus précis.
  • Garantir la cohérence des labels : à mesure que les jeux de données s’agrandissent, les labels automatisés peuvent dériver ou varier d’un lot à l’autre. Les humains peuvent auditer, corriger et harmoniser les labels afin que le jeu de données reste cohérent du début à la fin.
  • Réduire les biais et les préjudices : les personnes sont plus aptes à repérer les contenus sensibles, les nuances culturelles et les schémas susceptibles d’introduire des biais. Leur supervision contribue à rendre les jeux de données plus équitables et à éviter les préjudices involontaires.
  • Appliquer une expertise métier : certaines tâches nécessitent des connaissances spécialisées, par exemple pour identifier des anomalies médicales ou des défauts industriels. Les experts peuvent fournir des labels précis et résoudre les cas ambigus afin que le modèle apprenne les bonnes caractéristiques.

Présentation de l’annotation avec intervention humaine#

Les outils et plateformes d’annotation comme Roboflow intègrent l’automatisation pour accélérer l’annotation, souvent en utilisant des modèles fondamentaux tels que Segment Anything Model 3 ou SAM3. SAM3 est le modèle fondamental de segmentation de Meta AI prenant en charge les invites.

Il peut détecter, segmenter et suivre des objets dans des images et des vidéos à partir de simples invites, comme des clics, des boîtes englobantes ou de courtes expressions textuelles, et produire des masques de segmentation pour les objets correspondants sans nécessiter d’entraînement spécifique à chaque nouvelle catégorie.

Même avec ces approches de pointe, les experts humains restent nécessaires pour examiner et finaliser les annotations. Lorsque les outils automatisés produisent une première version et que les humains la vérifient, la corrigent et l’affinent, le processus est appelé annotation avec intervention humaine. Cette méthode permet de conserver une annotation rapide tout en garantissant que les labels finaux sont suffisamment précis et cohérents pour entraîner des modèles fiables.

Un aperçu de l’annotation avec intervention humaine

Fig. 2. Un aperçu de l’annotation avec intervention humaine. (Source)

Quand l’automatisation de l’annotation fonctionne et quand elle échoue#

L’annotation automatisée fonctionne mieux pour les données provenant d’environnements contrôlés. Les images prises dans des usines, des entrepôts ou des rayons de magasins présentent généralement un éclairage stable et une vue dégagée des objets. Les outils automatisés peuvent donc les annoter avec précision et aider les équipes à changer d’échelle plus rapidement, avec moins de travail manuel.

Les données provenant d’environnements moins contrôlés sont plus complexes. Les séquences filmées en extérieur changent selon l’heure de la journée et les conditions météorologiques, tandis que les scènes de rue ou d’intérieur comportent souvent du désordre, du flou de mouvement, des objets qui se masquent mutuellement et de nombreux chevauchements. Les petits objets, les limites fines ou les situations rares offrent encore davantage de possibilités d’erreur. Un modèle performant sur des données intérieures propres peut malgré tout rencontrer des difficultés face à des éléments visuels désordonnés du monde réel.

C’est pourquoi l’intervention humaine reste importante. Les personnes peuvent intervenir lorsque le modèle est incertain, interpréter les contextes complexes et corriger les erreurs avant qu’elles ne se retrouvent dans le jeu de données final. L’annotation avec intervention humaine aide l’automatisation à rester ancrée dans les conditions du monde réel et permet aux modèles de rester fiables après leur déploiement.

Dans quels domaines l’annotation avec intervention humaine peut-elle faire la différence ?#

Maintenant que nous avons vu où l’automatisation fonctionne bien et où elle atteint ses limites, examinons quelques applications dans lesquelles l’annotation avec intervention humaine joue un rôle important.

Détection des défauts dans l’industrie manufacturière#

Prenons l’exemple d’un tapis roulant d’usine sur lequel des centaines de pièces passent devant une caméra chaque minute. La plupart des défauts sont évidents, mais il arrive qu’une fissure très fine apparaisse sous un angle inhabituel ou sous les reflets d’une lampe. Un système automatisé pourrait ne pas la détecter ou l’identifier comme une texture de surface inoffensive, tandis qu’un contrôleur humain peut repérer le défaut, corriger l’annotation et s’assurer que le modèle apprend à faire la différence.

C’est le rôle de l’annotation avec intervention humaine dans l’inspection industrielle. L’automatisation peut préannoter les types de défauts courants et traiter rapidement de grands volumes d’images, mais les humains doivent toujours vérifier les résultats, affiner les limites et gérer les erreurs rares qui apparaissent peu souvent dans les données d’entraînement.

Véhicules autonomes et transports intelligents#

De même, les véhicules autonomes utilisent la vision par ordinateur pour repérer les piétons, lire les panneaux et se déplacer dans la circulation, mais les routes réelles sont imprévisibles. Par exemple, un piéton qui surgit derrière une voiture garée la nuit peut être partiellement masqué et difficile à voir à cause des reflets.

Utiliser la vision par ordinateur pour analyser la circulation

Fig. 3. Exemple d’utilisation de la vision par ordinateur pour analyser la circulation. (Source)

Les annotateurs humains peuvent étiqueter ces cas limites rares et critiques pour la sécurité pendant l’entraînement, afin que les modèles apprennent la réponse appropriée, non seulement dans des conditions normales, mais aussi dans les situations qui comptent le plus. Cette étape d’intervention humaine est essentielle pour apprendre aux systèmes à gérer des événements peu fréquents, difficiles à capturer avec la seule automatisation.

L’avenir des jeux de données annotés par des humains#

L’annotation avec intervention humaine devient plus collaborative à mesure que la technologie progresse. Fait intéressant, les modèles de vision et de langage (VLMs), qui apprennent à partir d’images et de textes, sont désormais utilisés pour créer une première version des labels et suggérer des corrections à partir de simples invites.

Ainsi, au lieu d’examiner manuellement chaque image pour décider quoi annoter, un annotateur peut fournir à un VLM une invite telle que « annoter tous les piétons, les voitures et les feux de circulation » ou « segmenter tous les défauts de cette pièce », puis obtenir un ensemble d’annotations préliminaires à examiner.

De grands modèles multimodaux travaillant avec des annotateurs humains

Fig. 4. Les grands modèles multimodaux peuvent travailler avec des annotateurs humains (Source)

Cela réduit le temps d’annotation, car le modèle peut traiter en amont de nombreux cas simples. Les humains peuvent ainsi se concentrer sur l’examen des résultats, la correction des exemples complexes et le maintien de la cohérence du jeu de données. Les grands modèles multimodaux commencent également à orienter les annotateurs vers les échantillons les plus incertains, ce qui cible davantage l’effort humain et améliore la qualité globale du jeu de données.

Points clés à retenir#

La vision par ordinateur aide les machines à interpréter ce qu’elles voient et à y réagir, mais elle fonctionne mieux lorsque l’expertise humaine intervient dans le processus. Les données annotées par des humains permettent aux modèles de rester ancrés dans les conditions du monde réel et améliorent la fiabilité de leurs performances. En faisant travailler côte à côte l’automatisation et le jugement humain, les équipes peuvent créer des systèmes de vision à fort impact.

Rejoins notre communauté active et découvre des innovations telles que l’IA dans la logistique et la Vision AI dans la robotique. Consulte notre dépôt GitHub pour en savoir plus. Pour commencer dès aujourd’hui avec la vision par ordinateur, découvre nos options de licence.

Explore solutions

Vision par ordinateur pour l'imagerie aérienne

Vision par ordinateur pour l'imagerie aérienne

Transforme les images de drones et aériennes en informations en temps réel pour l'agriculture, l'aquaculture, la surveillance environnementale, la conservation et l'analyse géospatiale avec Ultralytics YOLO.
En savoir plus
Vision par ordinateur dans l'aérospatiale

Vision par ordinateur dans l'aérospatiale

Apporte l'IA de vision à la surveillance aérienne grâce aux modèles Ultralytics YOLO. Alimente les drones, les flux de travail aérospatiaux, la conservation de l'environnement et les industries géospatiales avec des solutions de vision par ordinateur.
En savoir plus

Protège chaque site avec les modèles Ultralytics YOLO. L'IA de vision alimente la surveillance du périmètre, la détection des menaces, la reconnaissance des plaques d'immatriculation et la sécurité au travail.
En savoir plus
Vision par ordinateur en robotique

Vision par ordinateur en robotique

Donne plus d’intelligence à tes machines avec les modèles Ultralytics YOLO. L’IA visuelle en robotique permet la navigation autonome, la perception, le suivi d’objets et le contrôle en temps réel.
En savoir plus
Vision par ordinateur en logistique

Vision par ordinateur en logistique

Optimise la logistique avec les modèles Ultralytics YOLO. L’IA visuelle permet l’inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Vision par ordinateur dans le commerce de détail

Vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. L’IA visuelle permet le suivi des stocks, la surveillance des rayons, la gestion des files d’attente et l’obtention d’informations plus pertinentes sur les clients.
En savoir plus
La vision par ordinateur dans le secteur de la santé

La vision par ordinateur dans le secteur de la santé

Développe des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans le secteur de la santé accélère l'imagerie médicale, améliore les diagnostics et renforce la surveillance des patients.
En savoir plus
La vision par ordinateur dans l'industrie manufacturière

La vision par ordinateur dans l'industrie manufacturière

Optimise la production industrielle avec les modèles Ultralytics YOLO. L'IA de vision améliore le contrôle qualité, la détection des défauts, le respect des règles relatives aux EPI et l'automatisation des lignes d'assemblage.
En savoir plus
Vision par ordinateur dans l’automobile

Vision par ordinateur dans l’automobile

Applique la vision par ordinateur à l’automobile avec les modèles Ultralytics YOLO. L’IA de vision améliore la sécurité routière, l’aide à la conduite et l’automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Vision par ordinateur dans l’agriculture

Vision par ordinateur dans l’agriculture

Apporte l’IA de vision à l’agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l’agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus
Vision par ordinateur pour l'imagerie aérienne

Vision par ordinateur pour l'imagerie aérienne

Transforme les images de drones et aériennes en informations en temps réel pour l'agriculture, l'aquaculture, la surveillance environnementale, la conservation et l'analyse géospatiale avec Ultralytics YOLO.
En savoir plus
Vision par ordinateur dans l'aérospatiale

Vision par ordinateur dans l'aérospatiale

Apporte l'IA de vision à la surveillance aérienne grâce aux modèles Ultralytics YOLO. Alimente les drones, les flux de travail aérospatiaux, la conservation de l'environnement et les industries géospatiales avec des solutions de vision par ordinateur.
En savoir plus

Protège chaque site avec les modèles Ultralytics YOLO. L'IA de vision alimente la surveillance du périmètre, la détection des menaces, la reconnaissance des plaques d'immatriculation et la sécurité au travail.
En savoir plus
Vision par ordinateur en robotique

Vision par ordinateur en robotique

Donne plus d’intelligence à tes machines avec les modèles Ultralytics YOLO. L’IA visuelle en robotique permet la navigation autonome, la perception, le suivi d’objets et le contrôle en temps réel.
En savoir plus
Vision par ordinateur en logistique

Vision par ordinateur en logistique

Optimise la logistique avec les modèles Ultralytics YOLO. L’IA visuelle permet l’inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Vision par ordinateur dans le commerce de détail

Vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. L’IA visuelle permet le suivi des stocks, la surveillance des rayons, la gestion des files d’attente et l’obtention d’informations plus pertinentes sur les clients.
En savoir plus
La vision par ordinateur dans le secteur de la santé

La vision par ordinateur dans le secteur de la santé

Développe des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans le secteur de la santé accélère l'imagerie médicale, améliore les diagnostics et renforce la surveillance des patients.
En savoir plus
La vision par ordinateur dans l'industrie manufacturière

La vision par ordinateur dans l'industrie manufacturière

Optimise la production industrielle avec les modèles Ultralytics YOLO. L'IA de vision améliore le contrôle qualité, la détection des défauts, le respect des règles relatives aux EPI et l'automatisation des lignes d'assemblage.
En savoir plus
Vision par ordinateur dans l’automobile

Vision par ordinateur dans l’automobile

Applique la vision par ordinateur à l’automobile avec les modèles Ultralytics YOLO. L’IA de vision améliore la sécurité routière, l’aide à la conduite et l’automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Vision par ordinateur dans l’agriculture

Vision par ordinateur dans l’agriculture

Apporte l’IA de vision à l’agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l’agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus
Vision par ordinateur pour l'imagerie aérienne

Vision par ordinateur pour l'imagerie aérienne

Transforme les images de drones et aériennes en informations en temps réel pour l'agriculture, l'aquaculture, la surveillance environnementale, la conservation et l'analyse géospatiale avec Ultralytics YOLO.
En savoir plus
Vision par ordinateur dans l'aérospatiale

Vision par ordinateur dans l'aérospatiale

Apporte l'IA de vision à la surveillance aérienne grâce aux modèles Ultralytics YOLO. Alimente les drones, les flux de travail aérospatiaux, la conservation de l'environnement et les industries géospatiales avec des solutions de vision par ordinateur.
En savoir plus

Protège chaque site avec les modèles Ultralytics YOLO. L'IA de vision alimente la surveillance du périmètre, la détection des menaces, la reconnaissance des plaques d'immatriculation et la sécurité au travail.
En savoir plus
Vision par ordinateur en robotique

Vision par ordinateur en robotique

Donne plus d’intelligence à tes machines avec les modèles Ultralytics YOLO. L’IA visuelle en robotique permet la navigation autonome, la perception, le suivi d’objets et le contrôle en temps réel.
En savoir plus
Vision par ordinateur en logistique

Vision par ordinateur en logistique

Optimise la logistique avec les modèles Ultralytics YOLO. L’IA visuelle permet l’inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Vision par ordinateur dans le commerce de détail

Vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. L’IA visuelle permet le suivi des stocks, la surveillance des rayons, la gestion des files d’attente et l’obtention d’informations plus pertinentes sur les clients.
En savoir plus
La vision par ordinateur dans le secteur de la santé

La vision par ordinateur dans le secteur de la santé

Développe des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans le secteur de la santé accélère l'imagerie médicale, améliore les diagnostics et renforce la surveillance des patients.
En savoir plus
La vision par ordinateur dans l'industrie manufacturière

La vision par ordinateur dans l'industrie manufacturière

Optimise la production industrielle avec les modèles Ultralytics YOLO. L'IA de vision améliore le contrôle qualité, la détection des défauts, le respect des règles relatives aux EPI et l'automatisation des lignes d'assemblage.
En savoir plus
Vision par ordinateur dans l’automobile

Vision par ordinateur dans l’automobile

Applique la vision par ordinateur à l’automobile avec les modèles Ultralytics YOLO. L’IA de vision améliore la sécurité routière, l’aide à la conduite et l’automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Vision par ordinateur dans l’agriculture

Vision par ordinateur dans l’agriculture

Apporte l’IA de vision à l’agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l’agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus

Construisons ensemble l'avenir de l'IA !

Commence ton parcours vers l'avenir de l'apprentissage automatique