Ultralytics YOLO27 :
Guides

Qu’est-ce que ResNet-50 et quelle est sa pertinence pour la vision par ordinateur ?

Découvre comment l’architecture de ResNet-50 permet la classification d’images dans des applications concrètes des secteurs de la santé, de la fabrication et des systèmes autonomes.

ABAbirami Vina10 min read
Architecture de ResNet-50 pour la classification d’images

L’analyse automatisée des images devient de plus en plus courante dans des applications comme la détection des excès de vitesse ou l’analyse d’images médicales. La technologie à l’origine de ces innovations est la vision par ordinateur, ou l’IA appliquée à la vision. Il s’agit d’une branche de l’intelligence artificielle (AI) qui permet aux machines d’interpréter et de comprendre les images et les vidéos, comme le font les humains.

Pour créer de telles solutions de vision par ordinateur, les développeurs s’appuient sur des modèles d’IA appliquée à la vision capables d’apprendre à partir de grandes quantités de données visuelles. Au fil des ans, les chercheurs ont développé des modèles plus récents et plus avancés, offrant d’excellentes performances dans des tâches de vision par ordinateur telles que la classification d’images (attribuer des étiquettes aux images), la détection d’objets (localiser et identifier des objets dans les images) et la segmentation d’instances (détecter les objets et délimiter précisément leurs formes).

Cependant, revenir sur les anciens modèles et les comprendre peut aider à saisir le fonctionnement des systèmes actuels de vision par ordinateur. ResNet-50 en est un exemple clé : ce modèle influent a introduit l’idée des connexions raccourcies, c’est-à-dire des chemins simples qui aident le modèle à apprendre plus rapidement et plus précisément.

Cette innovation a permis d’entraîner efficacement des réseaux neuronaux beaucoup plus profonds, ce qui a entraîné des améliorations significatives de la classification d’images et influencé la conception de nombreux modèles ultérieurs. Dans cet article, nous allons explorer ResNet-50, son fonctionnement et sa pertinence dans l’évolution de la vision par ordinateur. C’est parti !

Qu’est-ce que ResNet-50 ?#

ResNet-50 est un modèle de vision par ordinateur basé sur un type de réseau neuronal appelé réseau neuronal convolutif (CNN). Les CNN sont conçus pour aider les ordinateurs à comprendre les informations visuelles en apprenant les motifs présents dans les images, comme les contours, les couleurs ou les formes, puis en utilisant ces motifs pour reconnaître et classer les objets.

Introduit en 2015 par des chercheurs de Microsoft Research, ResNet-50 est rapidement devenu l’un des modèles les plus marquants du domaine grâce à sa précision et à son efficacité dans les tâches de reconnaissance d’images à grande échelle.

Une caractéristique clé de ResNet-50 est l’utilisation de connexions résiduelles, également appelées connexions raccourcies. Il s’agit de chemins simples qui permettent au modèle d’ignorer certaines étapes du processus d’apprentissage. Autrement dit, au lieu de forcer le modèle à faire passer les informations par chaque couche, ces raccourcis lui permettent de transmettre directement les informations importantes. L’apprentissage est ainsi plus rapide et plus fiable.

Schéma des connexions résiduelles dans l’architecture ResNet

Fig. 1. Vue des connexions résiduelles dans l’architecture ResNet.

Cette conception contribue à résoudre un problème courant de l’apprentissage profond appelé problème de disparition du gradient. Dans les modèles très profonds, des informations importantes peuvent se perdre lorsqu’elles traversent de nombreuses couches, ce qui complique l’apprentissage du modèle.

Les connexions résiduelles contribuent à éviter ce problème en maintenant une circulation claire des informations du début à la fin. C’est pourquoi le modèle s’appelle ResNet-50 : ResNet signifie réseau résiduel, et le « 50 » fait référence au nombre de couches utilisées pour traiter une image.

Vue d’ensemble du fonctionnement de ResNet-50#

ResNet-50 possède une structure bien organisée qui permet au modèle d’aller en profondeur sans perdre d’informations importantes. Il suit un schéma simple et répétable qui préserve l’efficacité tout en permettant d’obtenir de bonnes performances.

Voici un aperçu plus détaillé du fonctionnement de l’architecture ResNet-50 :

  • Extraction de caractéristiques de base : Le modèle commence par appliquer une opération mathématique appelée convolution. Elle consiste à faire glisser de petits filtres (appelés noyaux) sur l’image afin de produire des cartes de caractéristiques, c’est-à-dire de nouvelles versions de l’image qui mettent en évidence des motifs de base comme les contours ou les textures. C’est ainsi que le modèle commence à extraire des informations visuelles utiles.
  • Apprentissage de caractéristiques complexes : À mesure que les données traversent le réseau, la taille des cartes de caractéristiques diminue. Cela se fait grâce à des techniques comme le pooling ou à l’utilisation de filtres avec des pas plus grands (appelés strides). En parallèle, le réseau crée davantage de cartes de caractéristiques, ce qui l’aide à capturer des motifs de plus en plus complexes, comme des formes, des parties d’objets ou des textures.
  • Compression et expansion des données : Chaque étape compresse les données, les traite, puis les développe à nouveau. Cela aide le modèle à apprendre tout en économisant de la mémoire.
  • Connexions raccourcies : Ce sont des chemins simples qui permettent aux informations d’avancer sans passer par chaque couche. Elles rendent l’apprentissage plus stable et plus efficace.
  • Effectuer une prédiction : À la fin du réseau, toutes les informations apprises sont combinées et transmises à une fonction softmax. Celle-ci produit une distribution de probabilités sur les classes possibles, indiquant la confiance du modèle pour chaque prédiction, par exemple 90 % chat, 9 % chien, 1 % voiture.

Schéma de l’architecture ResNet-50

Fig. 2. L’architecture ResNet-50.

Caractéristiques clés de ResNet-50#

Même si ResNet-50 a été conçu à l’origine pour la classification d’images, sa conception flexible l’a rendu utile dans de nombreux domaines de la vision par ordinateur. Examinons certaines des caractéristiques qui distinguent ResNet-50.

Utiliser ResNet-50 pour la classification d’images#

ResNet-50 est principalement utilisé pour la classification d’images, dont l’objectif est d’attribuer une étiquette à une image. Par exemple, à partir d’une photo, le modèle peut l’identifier comme représentant un chien, un chat ou un avion en fonction de l’objet principal qu’il voit.

Sa conception fiable et sa disponibilité dans des bibliothèques d’apprentissage profond largement utilisées comme PyTorch et TensorFlow ont fait de ResNet-50 un choix précoce populaire pour l’entraînement sur de grands jeux de données d’images. L’un des exemples les plus connus est ImageNet, une immense collection d’images étiquetées utilisée pour évaluer et comparer les modèles de vision par ordinateur.

Bien que des modèles plus récents, comme Ultralytics YOLO11, le surpassent, ResNet-50 est encore couramment utilisé comme référence grâce à son bon équilibre entre précision, vitesse et simplicité.

Utilisation de ResNet-50 pour classer l’image d’un chien

Fig. 3. Exemple d’utilisation de ResNet-50 pour classer un chien.

Détection d’objets grâce aux backbones ResNet-50#

Alors que la classification d’images consiste à identifier l’objet principal d’une image, la détection d’objets va plus loin en trouvant et en étiquetant plusieurs objets dans la même image. Par exemple, dans l’image d’une rue animée, un modèle peut devoir détecter des voitures, des bus et des personnes, puis déterminer où se trouve chacun d’eux.

ResNet-50 est utilisé comme backbone dans certains de ces modèles. Cela signifie qu’il prend en charge la première partie du travail : analyser l’image et en extraire les détails importants qui décrivent ce qu’elle contient et où ces éléments se trouvent. Ces détails sont ensuite transmis à la partie suivante du modèle, appelée tête de détection, qui prend les décisions finales concernant les objets présents dans l’image et leur emplacement.

Des modèles de détection populaires comme Faster R-CNN et DETR utilisent ResNet-50 pour cette étape d’extraction de caractéristiques. Comme il capture efficacement les détails fins ainsi que la structure globale d’une image, il aide ces modèles à produire des prédictions précises, même dans des scènes complexes.

Apprentissage par transfert avec ResNet-50#

Un autre aspect intéressant du modèle ResNet-50 est sa capacité à prendre en charge l’apprentissage par transfert. Cela signifie que le modèle, initialement entraîné sur un grand jeu de données comme ImageNet pour la classification d’images, peut être adapté à de nouvelles tâches avec beaucoup moins de données.

Plutôt que de repartir de zéro, la plupart des couches du modèle sont réutilisées, et seule la couche de classification finale est remplacée et réentraînée pour la nouvelle tâche. Cela permet de gagner du temps et s’avère particulièrement utile lorsque les données étiquetées sont limitées.

Applications de ResNet-50 en vision par ordinateur#

L’architecture de ResNet-50 l’a rendu utile dans un large éventail d’applications de vision par ordinateur. Elle a joué un rôle particulièrement important aux débuts de l’apprentissage profond, en contribuant à faire passer la technologie d’IA appliquée à la vision de la recherche aux usages réels. En résolvant des défis clés, elle a contribué à ouvrir la voie aux modèles plus avancés que nous voyons dans les applications actuelles.

Imagerie médicale grâce à ResNet-50#

ResNet-50 a été l’un des premiers modèles utilisés pour l’imagerie médicale fondée sur l’apprentissage profond. Les chercheurs l’ont exploité pour identifier des signes de maladie sur des radiographies, des IRM et d’autres examens diagnostiques. Par exemple, il a contribué à détecter des tumeurs et à classer des images rétiniennes diabétiques afin de faciliter le diagnostic en ophtalmologie.

Même si des modèles plus avancés sont désormais utilisés dans les outils cliniques, ResNet-50 a joué un rôle clé dans les premières recherches en IA médicale. Sa facilité d’utilisation et sa conception modulaire en ont fait un choix adapté à la création de prototypes de systèmes de diagnostic.

Détection de tumeurs cérébrales dans des examens médicaux basée sur ResNet-50

Fig. 4. Détection de tumeurs cérébrales basée sur ResNet-50.

Automatisation industrielle grâce à ResNet-50#

De même, ResNet-50 a également été appliqué dans des environnements industriels. Par exemple, dans le secteur manufacturier, il a été utilisé dans des recherches et des systèmes pilotes pour détecter les défauts de surface des matériaux tels que l’acier, le béton et les pièces peintes.

Il a également été testé dans des dispositifs visant à identifier les porosités, les fissures ou les dépôts qui se forment pendant le moulage ou l’assemblage. ResNet-50 est bien adapté à ces tâches, car il peut repérer de subtiles différences de texture de surface, une capacité importante pour l’inspection qualité.

Même si des modèles plus avancés comme Ultralytics YOLO11 sont désormais couramment utilisés dans les systèmes de production, ResNet-50 joue encore un rôle important dans la recherche universitaire et l’évaluation comparative, notamment pour les tâches de classification d’images.

Inspection de défauts de surface avec ResNet-50

Fig. 5. Inspection de surface avec ResNet-50.

Avantages et limites de ResNet-50#

Voici quelques-uns des avantages de ResNet-50 :

  • Solides performances de référence : ResNet-50 offre une bonne précision dans un large éventail de tâches, ce qui en fait une référence fiable dans les projets de recherche comme dans les projets appliqués.
  • Bien documenté et largement étudié : Son architecture est bien comprise et documentée en détail, ce qui facilite le dépannage et l’apprentissage pour les développeurs et les chercheurs.
  • Polyvalence dans différents domaines : De l’imagerie médicale au secteur manufacturier, ResNet-50 a été appliqué avec succès à une variété de problèmes réels, démontrant sa flexibilité.

Voici maintenant un aperçu des limites de ResNet-50 :

  • Forte consommation de ressources : ResNet-50 nécessite plus de mémoire et de puissance de calcul que les modèles légers, ce qui peut le rendre moins adapté aux appareils mobiles ou aux applications en temps réel.
  • Surapprentissage sur de petits jeux de données : En raison de sa profondeur et de sa complexité, ResNet-50 peut subir un surapprentissage lorsqu’il est entraîné sur des données limitées sans techniques de régularisation appropriées.
  • Taille d’entrée fixe : ResNet-50 s’attend généralement à recevoir des images d’une taille précise, comme 224×224 pixels. Les images doivent donc souvent être redimensionnées ou recadrées, ce qui peut parfois supprimer des détails importants.

Points clés à retenir#

ResNet-50 a démontré qu’il était possible d’entraîner efficacement des réseaux très profonds tout en conservant de bonnes performances sur les tâches visuelles. Son architecture a fourni un cadre clair et pratique pour créer des modèles plus profonds et fiables.

Après sa publication, les chercheurs ont approfondi cette conception en créant des versions plus profondes comme ResNet-101 et ResNet-152. Globalement, ResNet-50 est un modèle clé qui a contribué à façonner l’utilisation actuelle de l’apprentissage profond en vision par ordinateur.

Rejoins notre communauté grandissante ! Explore notre dépôt GitHub pour en apprendre davantage sur l’IA. Tu veux commencer tes propres projets de vision par ordinateur ? Consulte nos options de licence. Découvre l’IA dans l’agriculture et l’IA de vision dans les soins de santé en consultant nos pages consacrées aux solutions !

Explore solutions

Vision par ordinateur pour l'imagerie aérienne

Vision par ordinateur pour l'imagerie aérienne

Transforme les images de drones et aériennes en informations en temps réel pour l'agriculture, l'aquaculture, la surveillance environnementale, la conservation et l'analyse géospatiale avec Ultralytics YOLO.
En savoir plus
Vision par ordinateur dans l'aérospatiale

Vision par ordinateur dans l'aérospatiale

Apporte l'IA de vision à la surveillance aérienne grâce aux modèles Ultralytics YOLO. Alimente les drones, les flux de travail aérospatiaux, la conservation de l'environnement et les industries géospatiales avec des solutions de vision par ordinateur.
En savoir plus

Protège chaque site avec les modèles Ultralytics YOLO. L'IA de vision alimente la surveillance du périmètre, la détection des menaces, la reconnaissance des plaques d'immatriculation et la sécurité au travail.
En savoir plus
Vision par ordinateur en robotique

Vision par ordinateur en robotique

Donne plus d’intelligence à tes machines avec les modèles Ultralytics YOLO. L’IA visuelle en robotique permet la navigation autonome, la perception, le suivi d’objets et le contrôle en temps réel.
En savoir plus
Vision par ordinateur en logistique

Vision par ordinateur en logistique

Optimise la logistique avec les modèles Ultralytics YOLO. L’IA visuelle permet l’inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Vision par ordinateur dans le commerce de détail

Vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. L’IA visuelle permet le suivi des stocks, la surveillance des rayons, la gestion des files d’attente et l’obtention d’informations plus pertinentes sur les clients.
En savoir plus
La vision par ordinateur dans le secteur de la santé

La vision par ordinateur dans le secteur de la santé

Développe des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans le secteur de la santé accélère l'imagerie médicale, améliore les diagnostics et renforce la surveillance des patients.
En savoir plus
La vision par ordinateur dans l'industrie manufacturière

La vision par ordinateur dans l'industrie manufacturière

Optimise la production industrielle avec les modèles Ultralytics YOLO. L'IA de vision améliore le contrôle qualité, la détection des défauts, le respect des règles relatives aux EPI et l'automatisation des lignes d'assemblage.
En savoir plus
Vision par ordinateur dans l’automobile

Vision par ordinateur dans l’automobile

Applique la vision par ordinateur à l’automobile avec les modèles Ultralytics YOLO. L’IA de vision améliore la sécurité routière, l’aide à la conduite et l’automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Vision par ordinateur dans l’agriculture

Vision par ordinateur dans l’agriculture

Apporte l’IA de vision à l’agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l’agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus
Vision par ordinateur pour l'imagerie aérienne

Vision par ordinateur pour l'imagerie aérienne

Transforme les images de drones et aériennes en informations en temps réel pour l'agriculture, l'aquaculture, la surveillance environnementale, la conservation et l'analyse géospatiale avec Ultralytics YOLO.
En savoir plus
Vision par ordinateur dans l'aérospatiale

Vision par ordinateur dans l'aérospatiale

Apporte l'IA de vision à la surveillance aérienne grâce aux modèles Ultralytics YOLO. Alimente les drones, les flux de travail aérospatiaux, la conservation de l'environnement et les industries géospatiales avec des solutions de vision par ordinateur.
En savoir plus

Protège chaque site avec les modèles Ultralytics YOLO. L'IA de vision alimente la surveillance du périmètre, la détection des menaces, la reconnaissance des plaques d'immatriculation et la sécurité au travail.
En savoir plus
Vision par ordinateur en robotique

Vision par ordinateur en robotique

Donne plus d’intelligence à tes machines avec les modèles Ultralytics YOLO. L’IA visuelle en robotique permet la navigation autonome, la perception, le suivi d’objets et le contrôle en temps réel.
En savoir plus
Vision par ordinateur en logistique

Vision par ordinateur en logistique

Optimise la logistique avec les modèles Ultralytics YOLO. L’IA visuelle permet l’inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Vision par ordinateur dans le commerce de détail

Vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. L’IA visuelle permet le suivi des stocks, la surveillance des rayons, la gestion des files d’attente et l’obtention d’informations plus pertinentes sur les clients.
En savoir plus
La vision par ordinateur dans le secteur de la santé

La vision par ordinateur dans le secteur de la santé

Développe des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans le secteur de la santé accélère l'imagerie médicale, améliore les diagnostics et renforce la surveillance des patients.
En savoir plus
La vision par ordinateur dans l'industrie manufacturière

La vision par ordinateur dans l'industrie manufacturière

Optimise la production industrielle avec les modèles Ultralytics YOLO. L'IA de vision améliore le contrôle qualité, la détection des défauts, le respect des règles relatives aux EPI et l'automatisation des lignes d'assemblage.
En savoir plus
Vision par ordinateur dans l’automobile

Vision par ordinateur dans l’automobile

Applique la vision par ordinateur à l’automobile avec les modèles Ultralytics YOLO. L’IA de vision améliore la sécurité routière, l’aide à la conduite et l’automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Vision par ordinateur dans l’agriculture

Vision par ordinateur dans l’agriculture

Apporte l’IA de vision à l’agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l’agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus
Vision par ordinateur pour l'imagerie aérienne

Vision par ordinateur pour l'imagerie aérienne

Transforme les images de drones et aériennes en informations en temps réel pour l'agriculture, l'aquaculture, la surveillance environnementale, la conservation et l'analyse géospatiale avec Ultralytics YOLO.
En savoir plus
Vision par ordinateur dans l'aérospatiale

Vision par ordinateur dans l'aérospatiale

Apporte l'IA de vision à la surveillance aérienne grâce aux modèles Ultralytics YOLO. Alimente les drones, les flux de travail aérospatiaux, la conservation de l'environnement et les industries géospatiales avec des solutions de vision par ordinateur.
En savoir plus

Protège chaque site avec les modèles Ultralytics YOLO. L'IA de vision alimente la surveillance du périmètre, la détection des menaces, la reconnaissance des plaques d'immatriculation et la sécurité au travail.
En savoir plus
Vision par ordinateur en robotique

Vision par ordinateur en robotique

Donne plus d’intelligence à tes machines avec les modèles Ultralytics YOLO. L’IA visuelle en robotique permet la navigation autonome, la perception, le suivi d’objets et le contrôle en temps réel.
En savoir plus
Vision par ordinateur en logistique

Vision par ordinateur en logistique

Optimise la logistique avec les modèles Ultralytics YOLO. L’IA visuelle permet l’inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Vision par ordinateur dans le commerce de détail

Vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. L’IA visuelle permet le suivi des stocks, la surveillance des rayons, la gestion des files d’attente et l’obtention d’informations plus pertinentes sur les clients.
En savoir plus
La vision par ordinateur dans le secteur de la santé

La vision par ordinateur dans le secteur de la santé

Développe des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans le secteur de la santé accélère l'imagerie médicale, améliore les diagnostics et renforce la surveillance des patients.
En savoir plus
La vision par ordinateur dans l'industrie manufacturière

La vision par ordinateur dans l'industrie manufacturière

Optimise la production industrielle avec les modèles Ultralytics YOLO. L'IA de vision améliore le contrôle qualité, la détection des défauts, le respect des règles relatives aux EPI et l'automatisation des lignes d'assemblage.
En savoir plus
Vision par ordinateur dans l’automobile

Vision par ordinateur dans l’automobile

Applique la vision par ordinateur à l’automobile avec les modèles Ultralytics YOLO. L’IA de vision améliore la sécurité routière, l’aide à la conduite et l’automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Vision par ordinateur dans l’agriculture

Vision par ordinateur dans l’agriculture

Apporte l’IA de vision à l’agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l’agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus

Construisons ensemble l'avenir de l'IA !

Commence ton parcours vers l'avenir de l'apprentissage automatique