Ultralytics YOLO27 :
Vision par IA

Qu'est-ce que Mask R-CNN et comment fonctionne-t-il ?

Découvre comment Mask R-CNN peut être utilisé pour segmenter précisément les objets dans les images et les vidéos pour diverses applications dans différents secteurs.

ABAbirami Vina10 min read
Segmentation d'instances avec Mask R-CNN

Les innovations comme les robots dans les entrepôts, les voitures autonomes circulant en toute sécurité dans des rues très fréquentées, les drones surveillant les cultures et les systèmes d’IA inspectant les produits dans les usines deviennent de plus en plus courantes à mesure que l’adoption de l’IA progresse. Une technologie clé à l’origine de ces innovations est la vision par ordinateur, une branche de l’IA qui permet aux machines de comprendre et d’interpréter les données visuelles.

Par exemple, la détection d’objets est une tâche de vision par ordinateur qui aide à identifier et à localiser les objets dans les images à l’aide de cadres englobants. Bien que les cadres englobants fournissent des informations utiles, ils n’offrent qu’une estimation approximative de la position d’un objet et ne peuvent pas en capturer la forme ou les contours exacts. Ils sont donc moins efficaces dans les applications qui nécessitent une identification précise.

Pour résoudre ce problème, les chercheurs ont développé des modèles de segmentation qui capturent les contours exacts des objets et fournissent des détails au niveau du pixel pour une détection et une analyse plus précises.

Mask R-CNN est l’un de ces modèles. Présenté en 2017 par Facebook AI Research (FAIR), il s’appuie sur des modèles antérieurs comme R-CNN, Fast R-CNN et Faster R-CNN. En tant qu’étape importante dans l’histoire de la vision par ordinateur, Mask R-CNN a ouvert la voie à des modèles plus avancés, comme Ultralytics YOLO11.

Dans cet article, nous allons découvrir ce qu’est Mask R-CNN, comment il fonctionne, quelles sont ses applications et quelles améliorations lui ont succédé, jusqu’à Ultralytics YOLO11.

Présentation de Mask R-CNN#

Mask R-CNN, qui signifie réseau neuronal convolutif fondé sur des régions de masques, est un modèle d’apprentissage profond conçu pour des tâches de vision par ordinateur comme la détection d’objets et la segmentation d’instances.

La segmentation d’instances va au-delà de la détection d’objets traditionnelle : elle identifie non seulement les objets d’une image, mais délimite aussi précisément chacun d’eux. Elle attribue une étiquette unique à chaque objet détecté et capture sa forme exacte au niveau du pixel. Cette approche détaillée permet de distinguer clairement les objets qui se chevauchent et de traiter précisément les formes complexes.

Mask R-CNN s’appuie sur Faster R-CNN, qui détecte et étiquette les objets, mais ne définit pas leurs formes exactes. Mask R-CNN améliore cette approche en identifiant les pixels exacts qui composent chaque objet, ce qui permet une analyse d’image beaucoup plus détaillée et précise.

Comparaison entre la détection d’objets et la segmentation d’instances

Fig. 1 Comparaison entre la détection d’objets et la segmentation d’instances.

Architecture de Mask R-CNN et fonctionnement#

Mask R-CNN adopte une approche étape par étape pour détecter et segmenter les objets avec précision. Il commence par extraire les caractéristiques clés à l’aide d’un réseau neuronal profond (un modèle composé de plusieurs couches qui apprend à partir des données), puis identifie les zones susceptibles de contenir des objets avec un réseau de proposition de régions (un composant qui suggère les régions d’objets probables), et affine enfin ces zones en créant des masques de segmentation détaillés (des contours précis des objets) qui capturent la forme exacte de chaque objet.

Examinons maintenant chaque étape pour mieux comprendre le fonctionnement de Mask R-CNN.

Présentation de l’architecture de Mask R-CNN

Fig. 2. Présentation de l’architecture de Mask R-CNN (source : researchgate.net).

Commencer par l’extraction des caractéristiques#

La première étape de l’architecture de Mask R-CNN consiste à décomposer l’image en ses éléments clés afin que le modèle puisse comprendre ce qu’elle contient. Imagine que tu regardes une photo et que tu remarques naturellement des détails comme les formes, les couleurs et les contours. Le modèle fait quelque chose de similaire à l’aide d’un réseau neuronal profond appelé « backbone » (souvent ResNet-50 ou ResNet-101), qui lui sert d’yeux pour parcourir l’image et repérer les détails importants.

Comme les objets dans les images peuvent être très petits ou très grands, Mask R-CNN utilise un réseau pyramidal de caractéristiques. C’est comme disposer de différentes loupes permettant au modèle de voir à la fois les détails fins et la vue d’ensemble, afin de remarquer les objets de toutes les tailles.

Une fois ces caractéristiques extraites, le modèle passe à la localisation des objets potentiels dans l’image, préparant ainsi l’analyse à venir.

Proposer les zones de l’image susceptibles de contenir des objets#

Une fois l’image traitée pour en extraire les caractéristiques clés, le réseau de proposition de régions prend le relais. Cette partie du modèle examine l’image et suggère les zones susceptibles de contenir des objets.

Pour ce faire, il génère plusieurs emplacements d’objets possibles appelés ancres. Le réseau évalue ensuite ces ancres et sélectionne les plus prometteuses pour une analyse plus approfondie. De cette manière, le modèle se concentre uniquement sur les zones les plus susceptibles d’être intéressantes, au lieu de vérifier chaque point de l’image.

Schéma d’un réseau de proposition de régions

Fig. 3 Exemple de réseau de proposition de régions.

Améliorer les caractéristiques extraites#

Une fois les zones clés identifiées, l’étape suivante consiste à affiner les détails extraits de ces régions. Les modèles antérieurs utilisaient une méthode appelée ROI Pooling (regroupement des régions d’intérêt) pour extraire les caractéristiques de chaque zone, mais cette technique entraînait parfois de légers désalignements lors du redimensionnement des régions, ce qui la rendait moins efficace, notamment pour les objets plus petits ou qui se chevauchent.

Mask R-CNN améliore cette approche en utilisant une technique appelée ROI Align (alignement des régions d’intérêt). Au lieu d’arrondir les coordonnées comme le fait ROI Pooling, ROI Align utilise une interpolation bilinéaire pour estimer les valeurs des pixels avec davantage de précision. L’interpolation bilinéaire est une méthode qui calcule la valeur d’un nouveau pixel en faisant la moyenne des valeurs de ses quatre voisins les plus proches, ce qui crée des transitions plus douces. Les caractéristiques restent ainsi correctement alignées sur l’image d’origine, ce qui améliore la précision de la détection et de la segmentation des objets.

Par exemple, lors d’un match de football, deux joueurs proches l’un de l’autre peuvent être confondus parce que leurs cadres englobants se chevauchent. ROI Align aide à les séparer en préservant la distinction entre leurs formes.

Schéma montrant comment Mask R-CNN utilise ROI Align

Fig. 4. Mask R-CNN utilise ROI Align.

Classifier les objets et prédire leurs masques#

Une fois que ROI Align a traité l’image, l’étape suivante consiste à classifier les objets et à ajuster précisément leur position. Le modèle examine chaque région extraite et détermine quel objet elle contient. Il attribue un score de probabilité aux différentes catégories et choisit la meilleure correspondance.

En parallèle, il ajuste les cadres englobants afin qu’ils correspondent mieux aux objets. Les cadres initiaux peuvent ne pas être positionnés idéalement ; cet ajustement améliore donc la précision en veillant à ce que chaque cadre entoure étroitement l’objet détecté.

Enfin, Mask R-CNN franchit une étape supplémentaire : il génère en parallèle un masque de segmentation détaillé pour chaque objet.

Mask R-CNN et ses applications en temps réel#

À sa sortie, ce modèle a suscité beaucoup d’enthousiasme au sein de la communauté de l’IA et a rapidement été utilisé dans diverses applications. Sa capacité à détecter et à segmenter les objets en temps réel a changé la donne dans différents secteurs.

Par exemple, suivre des animaux menacés dans la nature est une tâche complexe. De nombreuses espèces se déplacent dans des forêts denses, ce qui complique leur suivi par les acteurs de la conservation. Les méthodes traditionnelles utilisent des pièges photographiques, des drones et des images satellite, mais le tri manuel de toutes ces données prend beaucoup de temps. Les erreurs d’identification et les observations manquées peuvent ralentir les efforts de conservation.

En reconnaissant des caractéristiques uniques comme les rayures des tigres, les taches des girafes ou la forme des oreilles des éléphants, Mask R-CNN peut détecter et segmenter les animaux dans les images et les vidéos avec une plus grande précision. Même lorsque des animaux sont partiellement cachés par des arbres ou se tiennent près les uns des autres, le modèle peut les séparer et identifier chacun individuellement, ce qui rend le suivi de la faune plus rapide et plus fiable.

Détection et segmentation d’animaux avec Mask R-CNN

Fig. 5 Détection et segmentation d’animaux avec Mask R-CNN.

Limites de Mask R-CNN#

Malgré son importance historique pour la détection et la segmentation d’objets, Mask R-CNN présente également plusieurs inconvénients majeurs. Voici quelques difficultés liées à Mask R-CNN :

  • Forte demande en calcul : il dépend de GPU puissants, ce qui peut rendre son exécution coûteuse et ralentir le traitement de grandes quantités de données.
  • Vitesse de traitement plus faible : son processus en plusieurs étapes le rend plus lent que des modèles plus rapides en temps réel comme YOLO, ce qui peut ne pas convenir aux tâches sensibles au facteur temps.
  • Dépendance à des données de haute qualité : le modèle est plus performant avec des images nettes et bien annotées. Les images floues ou mal éclairées peuvent réduire considérablement sa précision.
  • Mise en œuvre complexe : l’architecture en plusieurs étapes peut être difficile à configurer et à optimiser, en particulier avec de grands jeux de données ou des ressources limitées.

De Mask R-CNN à Ultralytics YOLO11#

Mask R-CNN était excellent pour les tâches de segmentation, mais de nombreux secteurs cherchaient à adopter la vision par ordinateur tout en privilégiant la vitesse et les performances en temps réel. Cette exigence a conduit les chercheurs à développer des modèles à une étape qui détectent les objets en un seul passage, améliorant considérablement l’efficacité.

Contrairement au processus en plusieurs étapes de Mask R-CNN, les modèles de vision par ordinateur à une étape comme YOLO (tu ne regardes qu’une fois) se concentrent sur les tâches de vision par ordinateur en temps réel. Au lieu de traiter séparément la détection et la segmentation, les modèles YOLO peuvent analyser une image en une seule fois. Ils sont ainsi parfaitement adaptés à des applications comme la conduite autonome, les soins de santé, la fabrication et la robotique, où il est essentiel de prendre rapidement des décisions.

En particulier, Ultralytics YOLO11 va encore plus loin en étant à la fois rapide et précis. Il utilise 22 % de paramètres en moins que YOLOv8m, tout en atteignant une précision moyenne (mAP) supérieure sur le jeu de données COCO, ce qui signifie qu’il détecte les objets avec davantage de précision. Sa vitesse de traitement améliorée en fait un bon choix pour les applications en temps réel où chaque milliseconde compte.

Performances d’Ultralytics YOLO11 comparées à celles d’autres modèles

Fig. 6. Performances de YOLO11 comparées à celles d’autres modèles.

Points clés à retenir#

En revenant sur l’histoire de la vision par ordinateur, Mask R-CNN est reconnu comme une avancée majeure dans la détection et la segmentation d’objets. Il fournit des résultats très précis, même dans des environnements complexes, grâce à son processus détaillé en plusieurs étapes.

Cependant, ce même processus le rend plus lent que les modèles en temps réel comme YOLO. À mesure que le besoin de rapidité et d’efficacité augmente, de nombreuses applications utilisent désormais des modèles à une étape comme Ultralytics YOLO11, qui offrent une détection d’objets rapide et précise. Bien que Mask R-CNN soit important pour comprendre l’évolution de la vision par ordinateur, l’orientation vers les solutions en temps réel souligne la demande croissante de solutions de vision par ordinateur plus rapides et plus efficaces.

Rejoins notre communauté grandissante ! Explore notre dépôt GitHub pour en apprendre davantage sur l’IA. Tu veux commencer tes propres projets de vision par ordinateur ? Consulte nos options de licence. Découvre l’IA dans l’agriculture et l’IA de vision dans les soins de santé en consultant nos pages consacrées aux solutions !

Explore solutions

Vision par ordinateur pour l'imagerie aérienne

Vision par ordinateur pour l'imagerie aérienne

Transforme les images de drones et aériennes en informations en temps réel pour l'agriculture, l'aquaculture, la surveillance environnementale, la conservation et l'analyse géospatiale avec Ultralytics YOLO.
En savoir plus
Vision par ordinateur dans l'aérospatiale

Vision par ordinateur dans l'aérospatiale

Apporte l'IA de vision à la surveillance aérienne grâce aux modèles Ultralytics YOLO. Alimente les drones, les flux de travail aérospatiaux, la conservation de l'environnement et les industries géospatiales avec des solutions de vision par ordinateur.
En savoir plus

Protège chaque site avec les modèles Ultralytics YOLO. L'IA de vision alimente la surveillance du périmètre, la détection des menaces, la reconnaissance des plaques d'immatriculation et la sécurité au travail.
En savoir plus
Vision par ordinateur en robotique

Vision par ordinateur en robotique

Donne plus d’intelligence à tes machines avec les modèles Ultralytics YOLO. L’IA visuelle en robotique permet la navigation autonome, la perception, le suivi d’objets et le contrôle en temps réel.
En savoir plus
Vision par ordinateur en logistique

Vision par ordinateur en logistique

Optimise la logistique avec les modèles Ultralytics YOLO. L’IA visuelle permet l’inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Vision par ordinateur dans le commerce de détail

Vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. L’IA visuelle permet le suivi des stocks, la surveillance des rayons, la gestion des files d’attente et l’obtention d’informations plus pertinentes sur les clients.
En savoir plus
La vision par ordinateur dans le secteur de la santé

La vision par ordinateur dans le secteur de la santé

Développe des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans le secteur de la santé accélère l'imagerie médicale, améliore les diagnostics et renforce la surveillance des patients.
En savoir plus
La vision par ordinateur dans l'industrie manufacturière

La vision par ordinateur dans l'industrie manufacturière

Optimise la production industrielle avec les modèles Ultralytics YOLO. L'IA de vision améliore le contrôle qualité, la détection des défauts, le respect des règles relatives aux EPI et l'automatisation des lignes d'assemblage.
En savoir plus
Vision par ordinateur dans l’automobile

Vision par ordinateur dans l’automobile

Applique la vision par ordinateur à l’automobile avec les modèles Ultralytics YOLO. L’IA de vision améliore la sécurité routière, l’aide à la conduite et l’automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Vision par ordinateur dans l’agriculture

Vision par ordinateur dans l’agriculture

Apporte l’IA de vision à l’agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l’agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus
Vision par ordinateur pour l'imagerie aérienne

Vision par ordinateur pour l'imagerie aérienne

Transforme les images de drones et aériennes en informations en temps réel pour l'agriculture, l'aquaculture, la surveillance environnementale, la conservation et l'analyse géospatiale avec Ultralytics YOLO.
En savoir plus
Vision par ordinateur dans l'aérospatiale

Vision par ordinateur dans l'aérospatiale

Apporte l'IA de vision à la surveillance aérienne grâce aux modèles Ultralytics YOLO. Alimente les drones, les flux de travail aérospatiaux, la conservation de l'environnement et les industries géospatiales avec des solutions de vision par ordinateur.
En savoir plus

Protège chaque site avec les modèles Ultralytics YOLO. L'IA de vision alimente la surveillance du périmètre, la détection des menaces, la reconnaissance des plaques d'immatriculation et la sécurité au travail.
En savoir plus
Vision par ordinateur en robotique

Vision par ordinateur en robotique

Donne plus d’intelligence à tes machines avec les modèles Ultralytics YOLO. L’IA visuelle en robotique permet la navigation autonome, la perception, le suivi d’objets et le contrôle en temps réel.
En savoir plus
Vision par ordinateur en logistique

Vision par ordinateur en logistique

Optimise la logistique avec les modèles Ultralytics YOLO. L’IA visuelle permet l’inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Vision par ordinateur dans le commerce de détail

Vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. L’IA visuelle permet le suivi des stocks, la surveillance des rayons, la gestion des files d’attente et l’obtention d’informations plus pertinentes sur les clients.
En savoir plus
La vision par ordinateur dans le secteur de la santé

La vision par ordinateur dans le secteur de la santé

Développe des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans le secteur de la santé accélère l'imagerie médicale, améliore les diagnostics et renforce la surveillance des patients.
En savoir plus
La vision par ordinateur dans l'industrie manufacturière

La vision par ordinateur dans l'industrie manufacturière

Optimise la production industrielle avec les modèles Ultralytics YOLO. L'IA de vision améliore le contrôle qualité, la détection des défauts, le respect des règles relatives aux EPI et l'automatisation des lignes d'assemblage.
En savoir plus
Vision par ordinateur dans l’automobile

Vision par ordinateur dans l’automobile

Applique la vision par ordinateur à l’automobile avec les modèles Ultralytics YOLO. L’IA de vision améliore la sécurité routière, l’aide à la conduite et l’automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Vision par ordinateur dans l’agriculture

Vision par ordinateur dans l’agriculture

Apporte l’IA de vision à l’agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l’agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus
Vision par ordinateur pour l'imagerie aérienne

Vision par ordinateur pour l'imagerie aérienne

Transforme les images de drones et aériennes en informations en temps réel pour l'agriculture, l'aquaculture, la surveillance environnementale, la conservation et l'analyse géospatiale avec Ultralytics YOLO.
En savoir plus
Vision par ordinateur dans l'aérospatiale

Vision par ordinateur dans l'aérospatiale

Apporte l'IA de vision à la surveillance aérienne grâce aux modèles Ultralytics YOLO. Alimente les drones, les flux de travail aérospatiaux, la conservation de l'environnement et les industries géospatiales avec des solutions de vision par ordinateur.
En savoir plus

Protège chaque site avec les modèles Ultralytics YOLO. L'IA de vision alimente la surveillance du périmètre, la détection des menaces, la reconnaissance des plaques d'immatriculation et la sécurité au travail.
En savoir plus
Vision par ordinateur en robotique

Vision par ordinateur en robotique

Donne plus d’intelligence à tes machines avec les modèles Ultralytics YOLO. L’IA visuelle en robotique permet la navigation autonome, la perception, le suivi d’objets et le contrôle en temps réel.
En savoir plus
Vision par ordinateur en logistique

Vision par ordinateur en logistique

Optimise la logistique avec les modèles Ultralytics YOLO. L’IA visuelle permet l’inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Vision par ordinateur dans le commerce de détail

Vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. L’IA visuelle permet le suivi des stocks, la surveillance des rayons, la gestion des files d’attente et l’obtention d’informations plus pertinentes sur les clients.
En savoir plus
La vision par ordinateur dans le secteur de la santé

La vision par ordinateur dans le secteur de la santé

Développe des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans le secteur de la santé accélère l'imagerie médicale, améliore les diagnostics et renforce la surveillance des patients.
En savoir plus
La vision par ordinateur dans l'industrie manufacturière

La vision par ordinateur dans l'industrie manufacturière

Optimise la production industrielle avec les modèles Ultralytics YOLO. L'IA de vision améliore le contrôle qualité, la détection des défauts, le respect des règles relatives aux EPI et l'automatisation des lignes d'assemblage.
En savoir plus
Vision par ordinateur dans l’automobile

Vision par ordinateur dans l’automobile

Applique la vision par ordinateur à l’automobile avec les modèles Ultralytics YOLO. L’IA de vision améliore la sécurité routière, l’aide à la conduite et l’automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Vision par ordinateur dans l’agriculture

Vision par ordinateur dans l’agriculture

Apporte l’IA de vision à l’agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l’agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus

Construisons ensemble l'avenir de l'IA !

Commence ton parcours vers l'avenir de l'apprentissage automatique