Panoptic Segmentation
Explore la segmentation panoptique pour unifier la segmentation sémantique et la segmentation d’instances. Découvre comment Ultralytics YOLO26 fournit une compréhension précise des scènes pour les projets d’IA.
La segmentation panoptique est une tâche complète de vision par ordinateur (CV) qui unifie deux formes distinctes d'analyse d'images : la segmentation sémantique et la segmentation d'instances. Alors que les méthodes traditionnelles traitent ces tâches séparément — soit en classant globalement des régions d'arrière-plan comme le « ciel » ou l'« herbe », soit en détectant des objets spécifiques comme une « voiture » ou une « personne » —, la segmentation panoptique les combine dans un cadre unique et cohérent. Cette approche attribue une valeur unique à chaque pixel d'une image, offrant une compréhension complète de la scène qui distingue les objets dénombrables (appelés « things ») des régions d'arrière-plan amorphes (appelées « stuff »). En veillant à ce que chaque pixel soit pris en compte et classifié, cette technique imite plus fidèlement la perception visuelle humaine que les méthodes de détection isolées.
Le concept central : stuff et things#
Pour bien comprendre la segmentation panoptique, il est utile de saisir la dichotomie des informations visuelles qu'elle traite. La tâche divise le monde visuel en deux catégories principales :
- Catégories stuff : Elles représentent des régions amorphes de texture ou de matériau similaire qui ne sont pas dénombrables. Il peut s'agir de routes, d'eau, d'herbe, du ciel et de murs. Dans une analyse panoptique, tous les pixels appartenant à une « route » sont regroupés dans une seule région sémantique, car il est généralement inutile de distinguer le « segment de route A » du « segment de route B ».
- Catégories things : Il s'agit d'objets dénombrables dont la géométrie et les contours sont définis. Parmi les exemples figurent les piétons, les véhicules, les animaux et les outils. Les modèles panoptiques doivent identifier chaque « thing » comme une entité unique, afin que deux personnes côte à côte soient reconnues comme des instances distinctes (par exemple, « Personne A » et « Personne B »), plutôt que comme une masse fusionnée.
Cette distinction est essentielle pour les systèmes avancés d'intelligence artificielle (AI), car elle leur permet de se déplacer dans leur environnement tout en interagissant simultanément avec des objets spécifiques.
Fonctionnement des architectures panoptiques#
Les architectures modernes de segmentation panoptique utilisent généralement un puissant backbone d'apprentissage profond (DL), tel qu'un réseau neuronal convolutif (CNN) ou un Transformer de vision (ViT), pour extraire d'une image des représentations riches des caractéristiques. Le réseau se divise généralement en deux branches, ou « têtes » :
-
Tête sémantique : Cette branche prédit une étiquette de classe pour chaque pixel, générant une carte dense du « stuff » présent dans la scène.
-
Tête d'instances : Parallèlement, cette branche utilise des techniques similaires à la détection d'objets pour localiser les « things » et générer leurs masques.
Un module de fusion ou une étape de post-traitement résout ensuite les conflits entre ces sorties — par exemple, en déterminant si un pixel appartient à une instance de « personne » ou au mur d'« arrière-plan » situé derrière celle-ci — afin de produire une carte de segmentation panoptique finale, sans chevauchement.
Applications concrètes#
La nature holistique de la segmentation panoptique la rend indispensable dans les secteurs où la sécurité et le contexte sont primordiaux.
- Véhicules autonomes : Les voitures autonomes s'appuient sur la perception panoptique pour se déplacer en toute sécurité. Le composant sémantique identifie les surfaces praticables (les routes) et les limites (les trottoirs), tandis que le composant d'instances suit les obstacles dynamiques comme les piétons et les autres véhicules. Cette vision unifiée aide les algorithmes de planification du véhicule à prendre des décisions plus sûres dans des scénarios complexes de gestion du trafic.
- Analyse d'images médicales : En anatomopathologie numérique, l'analyse d'échantillons de tissus nécessite souvent de segmenter la structure générale des tissus (stuff), tout en comptant et en mesurant simultanément certains types de cellules ou les tumeurs (things). Cette analyse détaillée aide les médecins à quantifier précisément les maladies et à établir un diagnostic.
- Robotique : Les robots de service opérant dans des environnements non structurés, comme les habitations ou les entrepôts, doivent distinguer le sol sur lequel ils peuvent se déplacer (l'arrière-plan) des objets qu'ils doivent manipuler ou éviter (les instances).
Mettre en œuvre la segmentation avec Ultralytics#
Bien que l'entraînement panoptique complet puisse être complexe, les développeurs peuvent obtenir une segmentation d'instances de haute précision — un composant essentiel du problème panoptique — avec Ultralytics YOLO26. Ce modèle de pointe offre des performances en temps réel et est optimisé pour le déploiement en périphérie.
L'exemple Python suivant montre comment charger un modèle de segmentation préentraîné et exécuter une inférence pour isoler des objets distincts :
from ultralytics import YOLO
# Load the YOLO26 segmentation model
model = YOLO("yolo26n-seg.pt")
# Run inference on an image to segment individual instances
# The model identifies 'things' and generates pixel-perfect masks
results = model("https://ultralytics.com/images/bus.jpg")
# Display the resulting image with overlaid segmentation masks
results[0].show()Pour les équipes qui cherchent à gérer leurs données d'entraînement et à automatiser le processus d'annotation, l'Ultralytics Platform fournit une suite d'outils pour la gestion des jeux de données et l'entraînement des modèles. Une annotation de données de haute qualité est essentielle pour les tâches de segmentation, car les modèles ont besoin d'étiquettes précises au niveau du pixel pour apprendre efficacement.
Distinction entre les termes associés#
Comprendre les nuances entre les différents types de segmentation est essentiel pour choisir le modèle adapté à ton projet :
- Segmentation sémantique : Elle se concentre uniquement sur la classification des pixels en catégories. Elle répond à la question « à quelle classe appartient ce pixel ? » (par exemple, arbre ou ciel), mais ne peut pas séparer les objets individuels appartenant à une même classe. Si deux voitures se chevauchent, elles apparaissent comme une seule grande masse de « voiture ».
- Segmentation d'instances : Elle se concentre uniquement sur la détection et le masquage des objets dénombrables. Elle répond à la question « de quel objet s'agit-il ? », mais ignore généralement entièrement le contexte de l'arrière-plan.
- Segmentation panoptique : Elle combine les deux. Elle répond aux questions « que représente ce pixel ? » et « à quelle instance d'objet appartient-il ? » pour l'ensemble de l'image, en veillant à ce qu'aucun pixel ne reste non classifié.
Pour approfondir les formats de jeux de données utilisés dans ces tâches, tu peux consulter la documentation du jeu de données COCO, qui constitue une référence standard pour mesurer les performances en segmentation.









