Image Segmentation
Explore la segmentation d'images en vision par ordinateur. Apprends comment Ultralytics YOLO26 fournit des masques précis au niveau du pixel pour la segmentation d'instance, sémantique et panoptique.
La segmentation d'images est une technique sophistiquée en computer vision (CV) qui consiste à diviser une image numérique en plusieurs sous-groupes de pixels, souvent appelés segments d'image ou régions. Contrairement à la classification d'images standard, qui attribue une étiquette unique à une image entière, la segmentation analyse les données visuelles à un niveau beaucoup plus granulaire en attribuant une étiquette de classe spécifique à chaque pixel individuel. Ce processus crée une carte précise au niveau du pixel, permettant aux modèles d'intelligence artificielle (AI) de comprendre non seulement quels objets sont présents, mais aussi exactement où ils se trouvent et quelles sont leurs limites spécifiques.
La mécanique de l'analyse au niveau du pixel#
Pour atteindre cette compréhension haute fidélité, les modèles de segmentation exploitent généralement des architectures d'deep learning (DL), en particulier des Convolutional Neural Networks (CNNs). Ces réseaux agissent comme de puissants extracteurs de caractéristiques, identifiant des motifs tels que les contours, les textures et les formes complexes. Les architectures de segmentation traditionnelles, comme le U-Net classique, emploient souvent une structure encodeur-décodeur. L'encodeur compresse l'image d'entrée pour capturer le contexte sémantique, tandis que le décodeur reconstruit les détails spatiaux pour produire un masque de segmentation final.
Les avancées modernes ont mené à des architectures en temps réel telles que YOLO26, publié en janvier 2026. Ces modèles intègrent les capacités de segmentation directement dans un pipeline de bout en bout, permettant un traitement à haute vitesse sur divers matériels, des GPUs cloud aux appareils de périphérie (edge).
Types principaux de segmentation#
Selon l'objectif spécifique d'un projet, les développeurs choisissent généralement parmi trois techniques de segmentation principales :
- Semantic Segmentation: Cette méthode classe les pixels en fonction de leur catégorie mais ne distingue pas les objets séparés d'une même classe. Par exemple, dans une analyse d'images satellitaires, tous les pixels représentant la « forêt » seraient colorés en vert, traitant la forêt entière comme une entité unique.
- Instance Segmentation: Cette technique identifie et sépare des objets individuels distincts d'intérêt. Dans une scène de rue animée, la segmentation d'instance générerait un masque unique pour « Voiture A », « Voiture B » et « Piéton A », permettant aux systèmes de compter et de suivre des entités spécifiques. C'est une fonctionnalité clé de la famille de modèles Ultralytics YOLO26.
- Panoptic Segmentation: Une approche hybride qui combine la couverture de la segmentation sémantique avec la précision de la segmentation d'instance. Elle attribue une étiquette à chaque pixel, en distinguant les éléments d'arrière-plan amorphes (comme le ciel et la route) tout en identifiant de manière unique les objets de premier plan comptables.
Distinction avec la détection d'objets#
Il est crucial de différencier la segmentation de la détection d'objets. Alors que les algorithmes de détection localisent les éléments à l'aide d'une boîte englobante rectangulaire, ils incluent inévitablement des pixels d'arrière-plan dans cette boîte. La segmentation offre une représentation plus serrée et plus précise en traçant le contour ou le polygone exact de l'objet. Cette différence est essentielle pour des applications comme la préhension robotique, où un bras robotique doit connaître la géométrie précise d'un élément pour le manipuler sans collision.
Applications concrètes#
La précision offerte par la segmentation d'image stimule l'innovation dans divers secteurs :
- Diagnostics médicaux : Dans le domaine de l'analyse d'images médicales, la segmentation est essentielle pour délimiter les structures anatomiques. Les algorithmes analysent les scans IRM pour délimiter les tumeurs ou les frontières des organes, permettant aux chirurgiens de calculer des volumes exacts et de planifier des interventions avec une précision vitale.
- Conduite autonome : Les véhicules autonomes s'appuient sur la segmentation pour naviguer en toute sécurité. En traitant les flux vidéo, l'ordinateur du véhicule peut différencier les voies carrossables des trottoirs et des obstacles. Des organisations de normalisation telles que SAE International définissent des niveaux d'autonomie qui nécessitent cette perception environnementale haute fidélité.
- Agriculture de précision : En IA en agriculture, la segmentation aide les systèmes robotiques à identifier les mauvaises herbes au milieu des cultures. En générant des masques pour des feuilles de plantes spécifiques, les pulvérisateurs automatisés peuvent cibler uniquement les espèces envahissantes, réduisant considérablement l'utilisation d'herbicides.
Implémentation de la segmentation avec Ultralytics YOLO26#
Les développeurs peuvent implémenter efficacement la segmentation d'instance en utilisant le paquet Python ultralytics. L'exemple suivant utilise le modèle YOLO26 de pointe, optimisé à la fois pour la vitesse et la précision.
from ultralytics import YOLO
# Load a pre-trained YOLO26 segmentation model
# 'n' denotes the nano version, optimized for speed
model = YOLO("yolo26n-seg.pt")
# Run inference on an image to generate masks
# The model identifies objects and outlines their shape
results = model("https://ultralytics.com/images/bus.jpg")
# Display the image with segmentation overlays
results[0].show()Pour atteindre de hautes performances sur des tâches personnalisées, les équipes ont souvent besoin de curer des données d'entraînement de haute qualité. La plateforme Ultralytics simplifie ce processus en fournissant des outils pour annoter des images avec des masques polygonaux, gérer des jeux de données et entraîner des modèles dans le cloud, rationalisant l'ensemble du cycle de vie des opérations de machine learning (MLOps). Des bibliothèques comme OpenCV sont également fréquemment utilisées aux côtés de ces modèles pour le prétraitement des images et le post-traitement des masques résultants.






