Qu’est-ce que R-CNN ? Vue d’ensemble rapide
Découvre RCNN et son impact sur la détection d’objets. Nous aborderons ses principaux composants, ses applications et son rôle dans l’avancement de techniques comme Fast RCNN et YOLO.

La détection d'objets est une tâche de vision par ordinateur qui permet de reconnaître et de localiser des objets dans des images ou des vidéos pour des applications comme la conduite autonome, la surveillance et l'imagerie médicale. Les premières méthodes de détection d'objets, comme le détecteur de Viola-Jones et l'histogramme des gradients orientés (HOG) avec des machines à vecteurs de support (SVM), reposaient sur des caractéristiques conçues manuellement et des fenêtres glissantes. Ces méthodes avaient souvent du mal à détecter précisément les objets dans des scènes complexes contenant plusieurs objets de formes et de tailles variées.
Les réseaux neuronaux convolutifs basés sur des régions (R-CNN) ont changé notre approche de la détection d'objets. Il s'agit d'une étape importante dans l'histoire de la vision par ordinateur. Pour comprendre l'apparition de modèles comme Ultralytics YOLOv8, nous devons d'abord comprendre des modèles comme R-CNN.
Créée par Ross Girshick et son équipe, l'architecture du modèle R-CNN génère des propositions de régions, extrait des caractéristiques avec un réseau neuronal convolutif pré-entraîné (CNN), classe les objets et affine les boîtes englobantes. Même si cela peut sembler intimidant, à la fin de cet article, tu comprendras clairement le fonctionnement de R-CNN et les raisons de son impact. Regardons cela de plus près !
Comment fonctionne R-CNN ?#
Le processus de détection d'objets du modèle R-CNN comporte trois étapes principales : générer des propositions de régions, extraire des caractéristiques et classer les objets tout en affinant leurs boîtes englobantes. Examinons chaque étape.

Fig. 1 Fonctionnement de R-CNN.
Propositions de régions : le backbone de RCNN#
Lors de la première étape, le modèle R-CNN analyse l'image pour créer de nombreuses propositions de régions. Les propositions de régions sont des zones potentielles susceptibles de contenir des objets. Des méthodes comme Selective Search examinent différents aspects de l'image, tels que la couleur, la texture et la forme, en la décomposant en différentes parties. Selective Search commence par diviser l'image en petites parties, puis fusionne celles qui se ressemblent pour former des zones d'intérêt plus grandes. Ce processus se poursuit jusqu'à la génération d'environ 2 000 propositions de régions.

Fig. 2 Fonctionnement de Selective Search.
Ces propositions de régions permettent d'identifier tous les emplacements possibles où un objet pourrait être présent. Lors des étapes suivantes, le modèle peut traiter efficacement les zones les plus pertinentes en se concentrant sur ces zones précises plutôt que sur l'image entière. L'utilisation de propositions de régions permet de concilier exhaustivité et efficacité computationnelle.
Extraction des caractéristiques de l'image : capturer les détails#
L'étape suivante du processus de détection d'objets du modèle R-CNN consiste à extraire les caractéristiques des propositions de régions. Chaque proposition de région est redimensionnée à une taille uniforme attendue par le CNN, par exemple 224x224 pixels. Le redimensionnement aide le CNN à traiter efficacement chaque proposition. Avant la déformation, la taille de chaque proposition de région est légèrement augmentée afin d'inclure 16 pixels de contexte supplémentaires autour de la région et de fournir davantage d'informations environnantes pour une meilleure extraction des caractéristiques.
Une fois redimensionnées, ces propositions de régions sont transmises à un CNN comme AlexNet, généralement pré-entraîné sur un vaste jeu de données comme ImageNet. Le CNN traite chaque région afin d'en extraire des vecteurs de caractéristiques de grande dimension qui capturent des détails importants tels que les contours, les textures et les motifs. Ces vecteurs de caractéristiques condensent les informations essentielles des régions. Ils transforment les données brutes de l'image en un format que le modèle peut utiliser pour poursuivre l'analyse. La classification et la localisation précises des objets lors des étapes suivantes dépendent de cette conversion essentielle des informations visuelles en données pertinentes.

Fig. 3 Extraire les caractéristiques d'une proposition de région avec AlexNet.
Classification des objets : identifier les objets détectés#
La troisième étape consiste à classer les objets présents dans ces régions. Cela signifie déterminer la catégorie ou la classe de chaque objet trouvé dans les propositions. Les vecteurs de caractéristiques extraits sont ensuite transmis à un classificateur de machine learning.
Dans le cas de R-CNN, les machines à vecteurs de support (SVM) sont couramment utilisées à cette fin. Chaque SVM est entraîné à reconnaître une classe d'objets spécifique en analysant les vecteurs de caractéristiques et en déterminant si une région donnée contient un objet de cette classe. En substance, pour chaque catégorie d'objets, un classificateur dédié vérifie chaque proposition de région à la recherche de cet objet précis.
Pendant l'entraînement, les classificateurs reçoivent des données annotées contenant des échantillons positifs et négatifs :
- Échantillons positifs : régions contenant l'objet cible.
- Échantillons négatifs : régions ne contenant pas l'objet.
Les classificateurs apprennent à distinguer ces échantillons. La régression des boîtes englobantes affine davantage la position et la taille des objets détectés en ajustant les boîtes englobantes proposées initialement afin qu'elles correspondent mieux aux contours réels des objets. Le modèle R-CNN peut identifier et localiser précisément les objets en combinant la classification et la régression des boîtes englobantes.

Fig. 4. Exemple de régression des boîtes englobantes. (source : towardsdatascience.com)
Tout rassembler : affiner les détections avec NMS#
Après les étapes de classification et de régression des boîtes englobantes, le modèle génère souvent plusieurs boîtes englobantes qui se chevauchent pour un même objet. La suppression des non-maxima (NMS) est appliquée pour affiner ces détections et conserver les boîtes les plus précises. Le modèle élimine les boîtes redondantes et superposées en appliquant la NMS et ne conserve que les détections les plus fiables.
La NMS fonctionne en évaluant les scores de confiance, qui indiquent la probabilité qu'un objet détecté soit effectivement présent, de toutes les boîtes englobantes, puis en supprimant celles qui chevauchent fortement des boîtes ayant obtenu des scores plus élevés.

Fig. 5. Exemple de suppression des non-maxima. (source : towardsdatascience.com)
Voici le détail des étapes de la NMS :
- Tri : Les boîtes englobantes sont triées par ordre décroissant de leurs scores de confiance.
- Sélection : La boîte ayant le score le plus élevé est sélectionnée, et toutes les boîtes qui la chevauchent fortement, selon l'intersection sur l'union (IoU), sont supprimées.
- Itération : Le processus se répète pour la boîte ayant le score suivant le plus élevé et continue jusqu'à ce que toutes les boîtes aient été traitées.
En résumé, le modèle R-CNN détecte les objets en générant des propositions de régions, en extrayant des caractéristiques avec un CNN, en classant les objets et en affinant leur position grâce à la régression des boîtes englobantes, puis en utilisant la suppression des non-maxima (NMS) pour ne conserver que les détections les plus précises.
R-CNN : une étape majeure de la détection d'objets#
R-CNN est un modèle emblématique de l'histoire de la détection d'objets, car il a introduit une nouvelle approche qui a considérablement amélioré la précision et les performances. Avant R-CNN, les modèles de détection d'objets peinaient à trouver un équilibre entre vitesse et précision. La méthode de R-CNN, qui génère des propositions de régions et utilise des CNN pour l'extraction de caractéristiques, permet de localiser et d'identifier précisément les objets dans les images.
R-CNN a ouvert la voie à des modèles comme Fast R-CNN, Faster R-CNN et Mask R-CNN, qui ont encore amélioré l'efficacité et la précision. En combinant l'apprentissage profond et l'analyse basée sur les régions, R-CNN a établi une nouvelle référence dans le domaine et ouvert de nombreuses possibilités pour des applications concrètes.
Transformer l'imagerie médicale avec R-CNN#
L'imagerie médicale](https://ultralytics-translation-0.invalid) constitue un cas d'utilisation intéressant de R-CNN. Les modèles R-CNN ont été utilisés pour détecter et classer différents types de tumeurs, comme les tumeurs cérébrales, sur des examens médicaux tels que les IRM et les scanners. L'utilisation du modèle R-CNN en imagerie médicale améliore la précision des diagnostics et aide les radiologues à identifier les tumeurs malignes à un stade précoce. La capacité de R-CNN à détecter même les tumeurs de petite taille et à un stade précoce peut faire une différence significative dans le traitement et le pronostic de maladies comme le cancer.

Fig. 6 Détection de tumeurs cérébrales avec RCNN.
Le modèle R-CNN peut être appliqué à d'autres tâches d'imagerie médicale en plus de la détection des tumeurs. Il peut par exemple identifier des fractures, détecter des maladies rétiniennes sur des examens oculaires et analyser des images pulmonaires à la recherche d'affections comme la pneumonie et la COVID-19. Quel que soit le problème médical, une détection précoce peut conduire à de meilleurs résultats pour les patients. En appliquant la précision de R-CNN pour identifier et localiser les anomalies, les professionnels de la santé peuvent améliorer la fiabilité et la rapidité des diagnostics médicaux. La détection d'objets rationalisant le processus de diagnostic, les patients peuvent bénéficier de plans de traitement précis et mis en place rapidement.
Les limites de R-CNN et ses successeurs#
Malgré ses performances impressionnantes, R-CNN présente certains inconvénients, comme une complexité computationnelle élevée et des temps d'inférence lents. Ces inconvénients rendent le modèle R-CNN inadapté aux applications en temps réel. La séparation des propositions de régions et de la classification en étapes distinctes peut entraîner des performances moins efficaces.
Au fil des années, différents modèles de détection d'objets sont apparus pour répondre à ces problèmes. Fast R-CNN combine les propositions de régions et l'extraction de caractéristiques par CNN en une seule étape, ce qui accélère le processus. Faster R-CNN introduit un réseau de proposition de régions (RPN) pour rationaliser la génération des propositions, tandis que Mask R-CNN ajoute une segmentation au niveau des pixels pour obtenir des détections plus détaillées.

Fig. 7. Comparaison de R-CNN, Fast R-CNN, Faster R-CNN et Mask R-CNN.
À peu près à la même période que Faster R-CNN, la série YOLO (You Only Look Once) a commencé à faire progresser la détection d'objets en temps réel. Les modèles YOLO prédisent les boîtes englobantes et les probabilités de classe en un seul passage dans le réseau. Par exemple, Ultralytics YOLOv8 offre une précision et une vitesse améliorées grâce à des fonctionnalités avancées pour de nombreuses tâches de vision par ordinateur.
Points clés à retenir#
RCNN a changé la donne en vision par ordinateur, en montrant comment l'apprentissage profond pouvait transformer la détection d'objets. Son succès a inspiré de nombreuses nouvelles idées dans le domaine. Même si des modèles plus récents comme Faster R-CNN et YOLO sont apparus pour corriger les défauts de RCNN, sa contribution constitue une étape majeure qu'il est important de retenir.
À mesure que la recherche progresse, nous verrons apparaître des modèles de détection d'objets encore meilleurs et plus rapides. Ces avancées amélioreront non seulement la manière dont les machines comprennent le monde, mais favoriseront également les progrès dans de nombreux secteurs. L'avenir de la détection d'objets s'annonce passionnant !
Tu veux continuer à explorer l'IA ? Rejoins la communauté Ultralytics ! Explore notre dépôt GitHub pour découvrir nos dernières innovations en intelligence artificielle. Découvre nos solutions d'IA dans divers secteurs comme l'agriculture et l'industrie manufacturière. Rejoins-nous pour apprendre et progresser !









