Guide de l’architecture U-Net et de ses applications
Découvre l’architecture U-Net, son rôle dans la segmentation d’images, ses applications et son importance dans l’évolution de la vision par ordinateur.

La vision par ordinateur est une branche de l’intelligence artificielle (AI) qui se concentre sur l’analyse des données visuelles. Elle a ouvert la voie à de nombreux systèmes de pointe, comme l’automatisation de l’inspection des produits dans les usines et l’aide à la navigation des véhicules autonomes sur les routes.
L’une des tâches de vision par ordinateur les plus connues est la détection d’objets. Cette tâche permet aux modèles de localiser et d’identifier des objets dans une image à l’aide de boîtes englobantes. Bien que les boîtes englobantes soient utiles pour diverses applications, elles ne fournissent qu’une estimation approximative de la position d’un objet.
Cependant, dans des domaines comme la santé, où la précision est essentielle, les cas d’usage de l’IA appliquée à la vision ne reposent pas uniquement sur l’identification d’un objet. Ils nécessitent souvent aussi des informations liées à la forme et à la position exactes des objets.
C’est précisément ce que la tâche de vision par ordinateur appelée segmentation est conçue pour accomplir. Au lieu d’utiliser des boîtes englobantes, les modèles de segmentation détectent les objets au niveau des pixels. Au fil des ans, les chercheurs ont développé des modèles de vision par ordinateur spécialisés dans la segmentation.
U-Net est l’un de ces modèles. Même si des modèles plus récents et plus avancés ont dépassé ses performances, U-Net occupe une place importante dans l’histoire de la vision par ordinateur. Dans cet article, nous examinerons plus en détail l’architecture U-Net, son fonctionnement, ses domaines d’utilisation et sa comparaison avec les modèles de segmentation plus modernes disponibles aujourd’hui.

Fig. 1. Exemple de segmentation à l’aide du modèle d’apprentissage profond U-Net. (Source)
L’histoire de la segmentation d’images#
Avant d’examiner ce qu’est U-Net, commençons par mieux comprendre comment les modèles de segmentation d’images ont évolué.
À l’origine, la vision par ordinateur reposait sur des techniques traditionnelles comme la détection des contours, le seuillage ou la croissance de régions pour séparer les objets d’une image. Ces techniques servaient à détecter les limites des objets à l’aide des contours, à séparer les régions selon l’intensité des pixels et à regrouper les pixels similaires. Elles fonctionnaient dans les cas simples, mais échouaient souvent lorsque les images comportaient du bruit, des formes superposées ou des limites peu claires.
Après l’essor de l’apprentissage profond en 2012, les chercheurs ont introduit en 2014 le concept de réseaux entièrement convolutionnels (FCNs) pour des tâches comme la segmentation sémantique. Ces modèles ont remplacé certaines parties d’un réseau convolutionnel afin de permettre à l’ordinateur d’examiner une image entière en une seule fois, au lieu de la diviser en petits morceaux. Le modèle pouvait ainsi créer des cartes détaillées montrant plus clairement le contenu d’une image.

Fig. 2. Évolution des algorithmes de segmentation fondés sur l’apprentissage profond. (Source)
S’appuyant sur les FCNs, U-Net a été introduit par des chercheurs de l’université de Fribourg en 2015. Il a été conçu à l’origine pour la segmentation d’images biomédicales. U-Net a notamment été conçu pour être performant dans les situations où les données annotées sont limitées.
Entre-temps, des versions ultérieures comme UNet++ et TransUNet ont ajouté des améliorations telles que des couches d’attention et une meilleure extraction des caractéristiques. Les couches d’attention aident le modèle à se concentrer sur les régions clés, tandis que l’extraction améliorée des caractéristiques capture des informations plus détaillées.
Qu’est-ce que U-Net et comment les caractéristiques circulent-elles dans le modèle ?#
U-Net est un modèle d’apprentissage profond conçu spécifiquement pour la segmentation d’images. Il prend une image en entrée et produit un masque de segmentation qui attribue une classe à chaque pixel en fonction de l’objet ou de la région auquel il appartient.
Le modèle tire son nom de son architecture en forme de U. Il se compose de deux parties principales : un encodeur qui compresse l’image et en apprend les caractéristiques, et un décodeur qui la redimensionne jusqu’à sa taille d’origine. Cette conception crée une forme symétrique en U, ce qui aide le modèle à comprendre à la fois la structure globale d’une image et ses détails plus fins.
Une caractéristique essentielle de U-Net est l’utilisation de connexions de saut, qui permettent de transmettre directement au décodeur les informations provenant de l’encodeur. Le modèle peut ainsi préserver des détails importants susceptibles d’être perdus lors de la compression de l’image.
Vue d’ensemble de l’architecture U-Net#
Voici un aperçu du fonctionnement de l’architecture U-Net :
- Image d’entrée : U-Net commence par une image 2D, comme une image médicale ou une photo satellite. L’objectif est d’attribuer une étiquette de classe à chaque pixel de l’image.
- Sous-échantillonnage : L’image traverse des couches convolutionnelles qui apprennent les caractéristiques visuelles importantes. À mesure qu’elle passe dans les différentes couches, sa résolution diminue et le modèle identifie des motifs plus généraux.
- Couche goulot d’étranglement : Au centre du réseau, les cartes de caractéristiques atteignent leur résolution spatiale la plus faible tout en capturant des caractéristiques sémantiques de haut niveau. En d’autres termes, cette représentation compressée des cartes de caractéristiques constitue le contexte global de l’entrée.
- Suréchantillonnage : Le réseau reconstruit ensuite l’image en augmentant progressivement sa résolution. Les convolutions transposées contribuent à redimensionner les cartes de caractéristiques vers leur taille d’origine.
- Connexions de saut : Les cartes de caractéristiques du chemin de sous-échantillonnage sont concaténées avec celles du chemin de suréchantillonnage. Cela aide à préserver les détails spatiaux fins tout en intégrant les informations contextuelles de haut niveau.
- La sortie est une carte de segmentation : La sortie finale est un masque de segmentation pixel par pixel correspondant à la taille de l’entrée. Chaque pixel est classé dans une catégorie comme objet, arrière-plan ou région d’intérêt.

Fig. 3. Schéma de l’architecture U-Net. (Source)
Comprendre la différence entre ViT et U-Net#
En explorant U-Net, tu te demandes peut-être en quoi il diffère d’autres modèles d’apprentissage profond, comme le Vision Transformer (ViT), qui peut également effectuer des tâches de segmentation. Bien que les deux modèles puissent réaliser des tâches similaires, ils diffèrent par leur conception et leur manière de gérer la segmentation.
U-Net traite les images au niveau des pixels au moyen de couches convolutionnelles dans une structure encodeur-décodeur. Il est souvent utilisé pour les tâches nécessitant une segmentation précise, comme l’analyse d’images médicales ou de scènes de conduite autonome.
De son côté, le Vision Transformer (ViT) divise les images en patches et les traite simultanément au moyen de mécanismes d’attention. Il utilise l’auto-attention (un mécanisme qui permet au modèle de pondérer l’importance de différentes parties de l’image les unes par rapport aux autres) pour capturer les relations entre ces parties, contrairement à l’approche convolutionnelle de U-Net.
Une autre différence importante est que ViT nécessite généralement davantage de données pour être performant, mais excelle dans la détection de motifs complexes. U-Net, en revanche, fonctionne bien avec des jeux de données plus petits, est plus rapide à entraîner et nécessite souvent moins de temps d’entraînement.
Applications du modèle U-Net#
Maintenant que nous comprenons mieux ce qu’est U-Net et comment il fonctionne, explorons ses applications dans différents domaines.
Segmentation des hémorragies cérébrales en imagerie médicale#
U-Net est devenu une méthode fiable pour la segmentation au niveau des pixels d’images médicales complexes, en particulier à l’apogée de son utilisation dans la recherche. Les chercheurs l’ont utilisé pour mettre en évidence des zones clés sur des examens médicaux, comme les tumeurs et les signes d’hémorragie interne dans les images de tomodensitométrie et d’IRM. Cette approche a considérablement amélioré la précision des diagnostics et rationalisé l’analyse de données médicales complexes dans les environnements de recherche.
Un exemple de l’impact de U-Net dans la recherche en santé est son utilisation pour identifier les accidents vasculaires cérébraux et les hémorragies cérébrales sur des examens médicaux. Les chercheurs pouvaient utiliser U-Net pour analyser des images de la tête et mettre en évidence les zones préoccupantes, permettant d’identifier plus rapidement les cas nécessitant une prise en charge immédiate.

Fig. 4. Segmentation de lésions d’accidents vasculaires cérébraux hémorragiques à l’aide de 3D U-Net. (Source)
Segmentation des cultures en agriculture#
L’agriculture est un autre domaine dans lequel les chercheurs ont utilisé U-Net, notamment pour segmenter les cultures, les mauvaises herbes et le sol. Il aide les agriculteurs à surveiller la santé des plantes, à estimer les rendements et à prendre de meilleures décisions sur de grandes exploitations. Par exemple, U-Net peut séparer les cultures des mauvaises herbes, ce qui rend l’application d’herbicides plus efficace et réduit le gaspillage.
Pour relever des défis comme le flou de mouvement dans les images prises par drone, les chercheurs ont amélioré U-Net à l’aide de techniques de défloutage d’images. Cela garantit une segmentation plus nette, même lorsque les données sont collectées en mouvement, par exemple lors de relevés aériens.

Fig. 5. Séparation des cultures et des mauvaises herbes dans des champs agricoles avec U-Net. (Source)
Conduite autonome#
Avant l’introduction de modèles d’IA plus avancés, U-Net a joué un rôle essentiel dans l’étude de la manière dont la segmentation pouvait améliorer la conduite autonome. Dans les véhicules autonomes, la segmentation sémantique de U-Net peut servir à classer chaque pixel d’une image dans des catégories comme route, véhicule, piéton et marquage au sol. Cela offre à la voiture une vision claire de son environnement, favorisant une navigation sûre et une prise de décision efficace.

Fig. 6. Scène routière dans laquelle la zone carrossable est segmentée à l’aide de U-Net. (Source)
Avantages et inconvénients de U-Net#
Aujourd’hui encore, U-Net reste un bon choix pour la segmentation d’images chez les chercheurs grâce à son équilibre entre simplicité, précision et adaptabilité. Voici quelques-uns des principaux avantages qui le distinguent :
- Adaptable à différentes modalités : U-Net a été adapté à différents types de données, notamment les examens médicaux 3D, les images satellites et même les images vidéo.
- Inférence rapide après optimisation : Lorsqu’il est correctement réglé, U-Net peut fonctionner efficacement, ce qui le rend adapté aux applications en temps réel ou quasi temps réel.
- Open source et communauté : U-Net est disponible dans les principales bibliothèques d’apprentissage profond et bénéficie du soutien d’une vaste communauté de développeurs et de chercheurs.
Bien que U-Net présente de nombreux atouts, il comporte également quelques limites à garder à l’esprit. Voici certains facteurs à prendre en compte :
- Sensible à la qualité des données : Les performances de U-Net peuvent être affectées négativement par des données de mauvaise qualité, comme des images bruitées ou de faible résolution.
- Sujet au surapprentissage avec de petits jeux de données : Bien que U-Net soit performant avec des données limitées, il risque tout de même le surapprentissage s’il n’est pas correctement régularisé, en particulier lorsque le jeu de données est trop petit ou manque de diversité.
- Ressources informatiques : U-Net peut être coûteux en ressources de calcul, en particulier avec de grands jeux de données, et nécessiter des ressources matérielles importantes pour l’entraînement.
Points clés à retenir#
U-Net a constitué une étape majeure dans l’évolution de la segmentation d’images. Il a démontré que les modèles d’apprentissage profond pouvaient produire des résultats précis avec des jeux de données plus petits, notamment dans des domaines comme l’imagerie médicale.
Cette avancée a ouvert la voie à des applications plus avancées dans divers domaines. Alors que la vision par ordinateur continue d’évoluer, les modèles de segmentation comme U-Net restent fondamentaux pour permettre aux machines de comprendre et d’interpréter les données visuelles avec une grande précision.
Tu souhaites créer tes propres projets de vision par ordinateur ? Explore notre dépôt GitHub pour approfondir tes connaissances en IA et consulte nos options de licence. Découvre comment la vision par ordinateur dans le domaine de la santé améliore l’efficacité et explore l’impact de l’IA dans le commerce de détail en consultant nos pages de solutions ! Rejoins notre communauté dès maintenant !









