Semantic Segmentation
Explore la segmentation sémantique pour comprendre les images au niveau des pixels. Apprends à entraîner et à déployer dès aujourd’hui des modèles de segmentation précis avec Ultralytics YOLO26.
La segmentation sémantique est une tâche de vision par ordinateur qui consiste à diviser une image en régions distinctes en attribuant une classe spécifique à chaque pixel. Contrairement à des tâches plus simples comme la classification d’images, qui attribue une seule étiquette à une image entière, ou la détection d’objets, qui trace des boîtes englobantes autour des objets, la segmentation sémantique fournit une compréhension de la scène au niveau du pixel. Cette analyse granulaire est essentielle pour les applications où la forme et les contours précis d’un objet sont aussi importants que son identité. Elle permet aux machines de « voir » le monde davantage comme les humains, en distinguant les pixels exacts qui composent une route, un piéton ou une tumeur dans une imagerie médicale.
Fonctionnement de la segmentation sémantique#
À la base, la segmentation sémantique traite une image comme une grille de pixels à classifier. Les modèles de deep learning, en particulier les réseaux neuronaux convolutifs (CNNs), constituent l’architecture standard pour cette tâche. Une architecture courante, comme le très utilisé U-Net, adopte une structure encodeur-décodeur. L’encodeur compresse l’image d’entrée pour extraire des caractéristiques de haut niveau (comme les textures et les formes), tandis que le décodeur suréchantillonne ces caractéristiques jusqu’à la résolution d’origine de l’image afin de générer un masque de segmentation précis.
Pour y parvenir, les modèles sont entraînés sur de grands jeux de données annotés, dans lesquels des annotateurs humains ont soigneusement coloré chaque pixel en fonction de sa classe. Des outils comme l’Ultralytics Platform facilitent ce processus en proposant des fonctionnalités d’auto-annotation qui accélèrent la création de données de vérité terrain de haute qualité. Une fois entraîné, le modèle produit un masque dans lequel la valeur de chaque pixel correspond à un ID de classe, « peignant » ainsi l’image d’une signification.
Distinction entre concepts connexes#
Il est courant de confondre la segmentation sémantique avec d’autres tâches au niveau du pixel. Comprendre leurs différences est essentiel pour choisir la bonne approche pour un projet :
- Segmentation d’instances : Alors que la segmentation sémantique traite tous les objets d’une même classe comme une seule entité (par exemple, toutes les « voitures » sont colorées en bleu), la segmentation d’instances distingue les objets individuels (par exemple, la « voiture A » est bleue et la « voiture B » est rouge).
- Segmentation panoptique : Cette approche combine les deux concepts. Elle attribue une classe à chaque pixel (sémantique) tout en séparant les instances individuelles des objets dénombrables (instances), offrant ainsi la compréhension la plus complète de la scène.
Applications concrètes#
La capacité à analyser les données visuelles avec une précision parfaite au niveau du pixel stimule l’innovation dans de nombreux secteurs à forts enjeux :
- IA dans l’automobile : Les véhicules autonomes s’appuient largement sur la segmentation pour se déplacer en toute sécurité. En identifiant les zones carrossables par opposition aux trottoirs et en délimitant précisément les piétons, les voitures et les obstacles, les systèmes de conduite autonome peuvent prendre des décisions critiques en temps réel.
- IA dans la santé : En imagerie médicale, les modèles segmentent les organes, les lésions ou les tumeurs à partir de scanners CT et d’IRM. Cela aide les radiologues à calculer le volume d’une tumeur pour planifier le traitement ou à guider avec une précision extrême les outils de chirurgie robotique.
- IA dans l’agriculture : Les agriculteurs utilisent des images aériennes prises par drone et la segmentation pour surveiller la santé des cultures. En classifiant les pixels comme « culture saine », « mauvaise herbe » ou « sol », les systèmes automatisés peuvent cibler la pulvérisation d’herbicides, réduire l’utilisation de produits chimiques et optimiser le rendement.
Mettre en œuvre la segmentation avec Ultralytics#
Les modèles de segmentation modernes doivent trouver un équilibre entre précision et vitesse, notamment pour l’inférence en temps réel sur les appareils edge. La famille de modèles Ultralytics YOLO26 comprend des modèles de segmentation spécialisés (désignés par un suffixe -seg) qui sont nativement de bout en bout et offrent de meilleures performances que les architectures plus anciennes comme YOLO11.
L’exemple suivant montre comment effectuer une segmentation sur une image à l’aide du package Python ultralytics. Il produit des masques binaires qui délimitent les contours des objets.
from ultralytics import YOLO
# Load a pre-trained YOLO26 segmentation model
model = YOLO("yolo26n-seg.pt")
# Run inference on an image
results = model("https://ultralytics.com/images/bus.jpg")
# Visualize the results
# This will display the image with the segmentation masks overlaid
results[0].show()Défis et perspectives d’avenir#
Malgré des progrès considérables, la segmentation sémantique reste coûteuse en calcul. Générer une classification pour chaque pixel nécessite d’importantes ressources GPU et une grande quantité de mémoire. Les chercheurs travaillent activement à optimiser ces modèles pour améliorer leur efficacité, en explorant des techniques comme la quantification des modèles afin d’exécuter des réseaux lourds sur des téléphones mobiles et des appareils embarqués.
En outre, la nécessité de disposer d’immenses jeux de données étiquetés constitue un goulot d’étranglement. Pour y remédier, le secteur s’oriente vers la génération de données synthétiques et l’apprentissage auto-supervisé, ce qui permet aux modèles d’apprendre à partir d’images brutes sans nécessiter des millions d’annotations manuelles de pixels. À mesure que ces technologies gagnent en maturité, on peut s’attendre à ce que la segmentation devienne encore plus omniprésente dans les caméras intelligentes, la robotique et les applications de réalité augmentée.









