YOLO Vision 2026 :
Intégrations

Un guide sur l'architecture U-Net et ses applications

Apprends-en plus sur l'architecture U-Net, comment elle prend en charge la segmentation d'images, ses applications et pourquoi elle est significative dans l'évolution de la vision par ordinateur.

ABAbirami Vina5 min read
Architecture U-Net pour la segmentation d'images

La vision par ordinateur est une branche de l'intelligence artificielle (IA) qui se concentre sur l'analyse de données visuelles. Elle a ouvert la voie à de nombreux systèmes de pointe, tels que l'automatisation du processus d'inspection des produits dans les usines et l'aide à la navigation des véhicules autonomes sur les routes.

L'une des tâches les plus connues en vision par ordinateur est la détection d'objets. Cette tâche permet aux modèles de localiser et d'identifier des objets dans une image à l'aide de boîtes englobantes (bounding boxes). Bien que ces boîtes soient utiles pour diverses applications, elles ne fournissent qu'une estimation approximative de l'emplacement d'un objet.

Cependant, dans des domaines comme la santé, où la précision est cruciale, les cas d'usage de l'IA en vision dépendent de bien plus que de la simple identification d'un objet. Souvent, ils nécessitent également des informations liées à la forme et à la position exactes des objets.

C'est précisément l'objectif de la tâche de vision par ordinateur qu'est la segmentation. Au lieu d'utiliser des boîtes englobantes, les modèles de segmentation détectent les objets au niveau du pixel. Au fil des ans, les chercheurs ont développé des modèles de vision par ordinateur spécialisés pour la segmentation.

L'un de ces modèles est U-Net. Bien que des modèles plus récents et plus avancés aient surpassé ses performances, U-Net occupe une place importante dans l'histoire de la vision par ordinateur. Dans cet article, nous allons examiner de plus près l'architecture U-Net, son fonctionnement, ses domaines d'application et sa comparaison avec les modèles de segmentation plus modernes disponibles aujourd'hui.

Segmentation d'une scène aérienne à l'aide du modèle d'apprentissage profond U-Net

Fig 1. Exemple de segmentation utilisant le modèle d'apprentissage profond U-Net. (Source)

L'histoire de la segmentation d'image#

Avant de plonger dans ce qu'est U-Net, voyons d'abord comment les modèles de segmentation d'images ont évolué.

Initialement, la vision par ordinateur reposait sur des techniques traditionnelles comme la détection de contours, le seuillage ou la croissance de régions pour séparer les objets dans une image. Ces techniques étaient utilisées pour détecter les limites des objets à l'aide de contours, séparer des régions par intensité de pixels et regrouper des pixels similaires. Elles fonctionnaient pour des cas simples, mais échouaient souvent lorsque les images comportaient du bruit, des formes qui se chevauchent ou des limites floues.

Suite à l'essor de l'apprentissage profond en 2012, les chercheurs ont introduit le concept de réseaux entièrement convolutionnels (FCN) en 2014 pour des tâches telles que la segmentation sémantique. Ces modèles ont remplacé certaines parties d'un réseau de neurones convolutionnel pour permettre à l'ordinateur d'analyser une image entière en une seule fois, au lieu de la diviser en morceaux plus petits. Cela a permis au modèle de créer des cartes détaillées qui montrent plus clairement ce que contient une image.

Chronologie de l'évolution des algorithmes de segmentation basés sur l'apprentissage profond

Fig 2. L'évolution des algorithmes de segmentation basés sur l'apprentissage profond. (Source)

S'appuyant sur les FCN, U-Net a été présenté par des chercheurs de l'Université de Fribourg en 2015. Il a été conçu à l'origine pour la segmentation d'images biomédicales. En particulier, U-Net a été conçu pour donner de bons résultats dans les situations où les données annotées sont limitées.

Par ailleurs, des versions ultérieures comme UNet++ et TransUNet ont ajouté des améliorations telles que des couches d'attention et une meilleure extraction de caractéristiques. Les couches d'attention aident le modèle à se concentrer sur les régions clés, tandis qu'une extraction améliorée des caractéristiques capture des informations plus détaillées.

Qu'est-ce qu'U-Net, et comment les caractéristiques circulent-elles à travers le modèle ?#

U-Net est un modèle d'apprentissage profond conçu spécifiquement pour la segmentation d'images. Il prend une image en entrée et produit un masque de segmentation qui classifie chaque pixel en fonction de l'objet ou de la région auquel il appartient.

Le modèle tire son nom de son architecture en forme de U. Il se compose de deux parties principales : un encodeur qui compresse l'image et apprend ses caractéristiques, et un décodeur qui l'élargit pour retrouver la taille d'origine. Cette conception crée une forme de U symétrique, ce qui aide le modèle à comprendre à la fois la structure globale d'une image et ses détails les plus fins.

Une caractéristique cruciale d'U-Net est l'utilisation de connexions de saut (skip connections), qui permettent aux informations de l'encodeur d'être transmises directement au décodeur. Cela signifie que le modèle peut préserver des détails importants qui pourraient être perdus lors de la compression de l'image.

Un aperçu de l'architecture d'U-Net#

Voici un aperçu du fonctionnement de l'architecture d'U-Net :

  • Image d'entrée : U-Net commence par une image 2D, telle qu'un examen médical ou une photo satellite. L'objectif est d'attribuer une étiquette de classe à chaque pixel de l'image.
  • Sous-échantillonnage (Downsampling) : L'image passe par des couches convolutives qui apprennent des caractéristiques visuelles importantes. À mesure que l'image traverse les différentes couches, sa résolution diminue et le modèle identifie des modèles plus larges.
  • Couche goulot d'étranglement (Bottleneck) : Au centre du réseau, les cartes de caractéristiques atteignent leur résolution spatiale la plus faible tout en capturant des caractéristiques sémantiques de haut niveau. En termes simples, cette représentation compressée des cartes de caractéristiques constitue le contexte global de l'entrée.
  • Suréchantillonnage (Upsampling) : Le réseau reconstruit ensuite l'image en augmentant progressivement la résolution. Des convolutions transposées aident à étendre les cartes de caractéristiques vers la taille d'origine.
  • Connexions de saut (Skip connections) : Les cartes de caractéristiques provenant du chemin de sous-échantillonnage sont concaténées avec celles du chemin de suréchantillonnage. Cela permet de préserver les détails spatiaux fins tout en intégrant des informations contextuelles de haut niveau.
  • La sortie est une carte de segmentation : La sortie finale est un masque de segmentation au niveau des pixels correspondant à la taille de l'entrée. Chaque pixel est classé dans une catégorie telle que objet, arrière-plan ou région d'intérêt.

Schéma de l'architecture encodeur-décodeur U-Net

Fig 3. Schéma de l'architecture U-Net. (Source)

Comprendre la différence entre ViT et U-Net#

En explorant U-Net, tu te demandes peut-être en quoi il diffère d'autres modèles d'apprentissage profond, comme le Vision Transformer (ViT), qui peut également effectuer des tâches de segmentation. Bien que les deux modèles puissent accomplir des tâches similaires, ils diffèrent dans leur conception et dans la manière dont ils gèrent la segmentation.

U-Net fonctionne en traitant les images au niveau des pixels via des couches convolutives dans une structure encodeur-décodeur. Il est souvent utilisé pour des tâches nécessitant une segmentation précise, comme les scanners médicaux ou les scènes de voitures autonomes.

D'un autre côté, le Vision Transformer (ViT) divise les images en patchs et les traite simultanément via des mécanismes d'attention. Il utilise l'auto-attention (un mécanisme qui permet au modèle de peser l'importance des différentes parties de l'image les unes par rapport aux autres) pour capturer comment les différentes parties de l'image sont liées, contrairement à l'approche convolutive d'U-Net.

Une autre différence importante est que ViT a généralement besoin de plus de données pour bien fonctionner, mais il excelle dans la détection de modèles complexes. U-Net, en revanche, est performant avec des jeux de données plus petits, est plus rapide à entraîner et nécessite souvent moins de temps d'entraînement.

Applications du modèle U-Net#

Maintenant que nous avons une meilleure compréhension de ce qu'est U-Net et de son fonctionnement, explorons comment U-Net a été appliqué dans différents domaines.

Segmentation d'hémorragie cérébrale en imagerie médicale#

U-Net est devenu une méthode fiable pour la segmentation au niveau des pixels d'images médicales complexes, en particulier à son apogée dans la recherche. Il a été utilisé par les chercheurs pour mettre en évidence des zones clés dans les examens médicaux, telles que les tumeurs et les signes d'hémorragie interne dans les images de CT et d'IRM. Cette approche a considérablement amélioré la précision des diagnostics et simplifié l'analyse de données médicales complexes dans le cadre de la recherche.

Un exemple de l'impact d'U-Net dans la recherche en santé est son utilisation pour identifier les accidents vasculaires cérébraux (AVC) et les hémorragies cérébrales dans les scanners médicaux. Les chercheurs pouvaient utiliser U-Net pour analyser des scanners crâniens et mettre en évidence les zones préoccupantes, permettant une identification plus rapide des cas nécessitant une attention immédiate.

Segmentation de lésions d'AVC hémorragique dans des examens médicaux à l'aide de 3D U-Net

Fig 4. Segmentation de lésions d'AVC hémorragique à l'aide de 3D U-Net. (Source)

Segmentation des cultures en agriculture#

Un autre domaine où les chercheurs ont utilisé U-Net est l'agriculture, notamment pour segmenter les cultures, les mauvaises herbes et le sol. Cela aide les agriculteurs à surveiller la santé des plantes, à estimer les rendements et à prendre de meilleures décisions sur de grandes exploitations. Par exemple, U-Net peut séparer les cultures des mauvaises herbes, rendant l'application d'herbicides plus efficace et réduisant le gaspillage.

Pour relever des défis tels que le flou de mouvement dans les images de drones, les chercheurs ont amélioré U-Net avec des techniques de suppression du flou d'image. Cela garantit une segmentation plus claire, même lorsque les données sont collectées en mouvement, comme lors de relevés aériens.

U-Net séparant les cultures des mauvaises herbes dans un champ agricole

Fig 5. Séparation des cultures et des mauvaises herbes dans les champs agricoles avec U-Net. (Source)

Conduite autonome#

Avant l'introduction de modèles d'IA plus avancés, U-Net a joué un rôle essentiel dans l'exploration de la manière dont la segmentation pouvait améliorer la conduite autonome. Dans les véhicules autonomes, la segmentation sémantique d'U-Net peut être utilisée pour classer chaque pixel d'une image dans des catégories telles que la route, le véhicule, le piéton et les marquages au sol. Cela offre à la voiture une vision claire de son environnement, facilitant une navigation sûre et une prise de décision efficace.

Scène routière avec la zone carrossable segmentée à l'aide d'U-Net

Fig 6. Scène routière où la zone carrossable est segmentée à l'aide d'U-Net. (Source)

Avantages et inconvénients d'U-Net#

Encore aujourd'hui, U-Net reste un bon choix pour la segmentation d'image parmi les chercheurs en raison de son équilibre entre simplicité, précision et adaptabilité. Voici quelques-uns des avantages clés qui le distinguent :

  • Adaptable à différentes modalités : U-Net a été adapté à différents types de données, y compris les scanners médicaux 3D, les images satellites et même les images vidéo.
  • Inférence rapide lorsqu'optimisé : Lorsqu'il est correctement ajusté, U-Net peut s'exécuter efficacement, le rendant adapté aux applications en temps réel ou quasi-temps réel.
  • Open-source et communauté : U-Net est disponible dans les principales bibliothèques d'apprentissage profond et bénéficie du soutien d'une large communauté de développeurs et de chercheurs.

Bien qu'U-Net ait de nombreux atouts, il y a aussi quelques limitations à garder à l'esprit. Voici quelques facteurs à prendre en considération :

  • Sensible à la qualité des données : La performance d'U-Net peut être négativement affectée par des données de faible qualité, telles que des images bruitées ou à basse résolution.
  • Sujet au surapprentissage (overfitting) avec de petits jeux de données : Bien qu'U-Net fonctionne bien avec des données limitées, il risque toujours le surapprentissage s'il n'est pas correctement régularisé, en particulier lorsque le jeu de données est trop petit ou manque de diversité.
  • Ressources computationnelles : U-Net peut être coûteux en termes de calcul, surtout lors du travail avec de grands jeux de données, nécessitant des ressources matérielles importantes pour l'entraînement.

Points clés#

U-Net a été une étape clé dans l'évolution de la segmentation d'image. Il a prouvé que les modèles d'apprentissage profond pouvaient fournir des résultats précis en utilisant des jeux de données plus petits, surtout dans des domaines comme l'imagerie médicale.

Cette percée a ouvert la voie à des applications plus avancées dans divers domaines. À mesure que la vision par ordinateur continue d'évoluer, les modèles de segmentation comme U-Net restent fondamentaux pour permettre aux machines de comprendre et d'interpréter les données visuelles avec une haute précision.

Tu souhaites créer tes propres projets de vision par ordinateur ? Explore notre référentiel GitHub pour approfondir l'IA et consulte nos options de licence. Découvre comment la vision par ordinateur dans la santé améliore l'efficacité et explore l'impact de l'IA dans le commerce de détail en visitant nos pages de solutions ! Rejoins notre communauté en pleine croissance dès maintenant !

Explore solutions

Real-time AI that works with your team

IA dans la robotique

Équipe tes machines plus intelligentes avec les modèles Ultralytics YOLO. La vision par IA dans la robotique propulse la navigation autonome, la perception, le suivi d'objets et le contrôle en temps réel.
En savoir plus
Real-time AI that works with your team

IA dans la logistique

Simplifie la logistique avec les modèles Ultralytics YOLO. La vision par IA permet l'inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Real-time AI that works with your team

IA dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. La vision par IA alimente le suivi des stocks, la surveillance des étagères, la gestion des files d'attente et des informations plus intelligentes sur les clients.
En savoir plus
Real-time AI that works with your team

IA dans la santé

Construis des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans la santé permet une imagerie médicale plus rapide, des diagnostics plus intelligents et une surveillance des patients.
En savoir plus
Real-time AI that works with your team

IA dans la fabrication

Optimise la fabrication avec les modèles Ultralytics YOLO. La vision par IA favorise le contrôle qualité, la détection des défauts, la conformité aux EPI et l'automatisation des chaînes de montage.
En savoir plus
Real-time AI that works with your operation

IA dans l'automobile

Applique la vision par ordinateur dans l'automobile avec les modèles Ultralytics YOLO. L'IA de vision améliore la sécurité routière, l'assistance à la conduite et l'automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Real-time AI tailored to your operation

IA en agriculture

Intègre l'IA de vision à l'agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l'agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus
Real-time AI that works with your team

IA dans la robotique

Équipe tes machines plus intelligentes avec les modèles Ultralytics YOLO. La vision par IA dans la robotique propulse la navigation autonome, la perception, le suivi d'objets et le contrôle en temps réel.
En savoir plus
Real-time AI that works with your team

IA dans la logistique

Simplifie la logistique avec les modèles Ultralytics YOLO. La vision par IA permet l'inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Real-time AI that works with your team

IA dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. La vision par IA alimente le suivi des stocks, la surveillance des étagères, la gestion des files d'attente et des informations plus intelligentes sur les clients.
En savoir plus
Real-time AI that works with your team

IA dans la santé

Construis des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans la santé permet une imagerie médicale plus rapide, des diagnostics plus intelligents et une surveillance des patients.
En savoir plus
Real-time AI that works with your team

IA dans la fabrication

Optimise la fabrication avec les modèles Ultralytics YOLO. La vision par IA favorise le contrôle qualité, la détection des défauts, la conformité aux EPI et l'automatisation des chaînes de montage.
En savoir plus
Real-time AI that works with your operation

IA dans l'automobile

Applique la vision par ordinateur dans l'automobile avec les modèles Ultralytics YOLO. L'IA de vision améliore la sécurité routière, l'assistance à la conduite et l'automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Real-time AI tailored to your operation

IA en agriculture

Intègre l'IA de vision à l'agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l'agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus
Real-time AI that works with your team

IA dans la robotique

Équipe tes machines plus intelligentes avec les modèles Ultralytics YOLO. La vision par IA dans la robotique propulse la navigation autonome, la perception, le suivi d'objets et le contrôle en temps réel.
En savoir plus
Real-time AI that works with your team

IA dans la logistique

Simplifie la logistique avec les modèles Ultralytics YOLO. La vision par IA permet l'inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Real-time AI that works with your team

IA dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. La vision par IA alimente le suivi des stocks, la surveillance des étagères, la gestion des files d'attente et des informations plus intelligentes sur les clients.
En savoir plus
Real-time AI that works with your team

IA dans la santé

Construis des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans la santé permet une imagerie médicale plus rapide, des diagnostics plus intelligents et une surveillance des patients.
En savoir plus
Real-time AI that works with your team

IA dans la fabrication

Optimise la fabrication avec les modèles Ultralytics YOLO. La vision par IA favorise le contrôle qualité, la détection des défauts, la conformité aux EPI et l'automatisation des chaînes de montage.
En savoir plus
Real-time AI that works with your operation

IA dans l'automobile

Applique la vision par ordinateur dans l'automobile avec les modèles Ultralytics YOLO. L'IA de vision améliore la sécurité routière, l'assistance à la conduite et l'automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Real-time AI tailored to your operation

IA en agriculture

Intègre l'IA de vision à l'agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l'agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus

Construisons ensemble le futur de l'IA !

Commence ton aventure avec le futur de l'apprentissage automatique