Semantic Mapping
Découvre comment la cartographie sémantique combine la segmentation sémantique, la profondeur, la localisation et la fusion de capteurs pour une navigation robotique plus intelligente avec Ultralytics YOLO26.
La cartographie sémantique est le processus qui consiste à construire une représentation spatiale d’un environnement et à associer des étiquettes de classes significatives — comme route, mur, porte, personne, étagère ou végétation — aux emplacements correspondants. En IA et en robotique, une carte sémantique répond à la fois aux questions « Où se trouve quelque chose ? » et « Qu’est-ce que c’est ? ». Au lieu de représenter une scène uniquement comme un espace occupé et un espace libre, elle fournit des informations contextuelles qui facilitent la navigation, la planification, l’interaction et la compréhension de la scène.
Fonctionnement de la cartographie sémantique#
Un système de cartographie sémantique combine généralement perception, géométrie, localisation et fusion temporelle. Tout d’abord, un modèle de segmentation sémantique classe chaque pixel de l’image. Par exemple, tous les pixels étiquetés « route » forment une région routière, tandis que les pixels étiquetés « voiture » identifient les régions occupées par des véhicules. L’introduction de NVIDIA à la segmentation d’image en robotique illustre comment ces étiquettes par pixel facilitent la perception robotique.
Les étiquettes de pixels seules restent liées à une image bidimensionnelle capturée par une caméra. Le système a besoin de données géométriques, souvent issues d’un LiDAR, de caméras stéréo ou de l’estimation de profondeur, pour associer les pixels à des positions physiques. Le flux de travail d’images RGB-D d’Open3D montre comment des images de couleur et de profondeur enregistrées peuvent produire un nuage de points 3D.
Une projection précise dépend également des paramètres intrinsèques et extrinsèques de la caméra. La documentation d’OpenCV sur l’étalonnage des caméras explique les paramètres utilisés pour relier les pixels de l’image aux points 3D, tandis que la définition du message CameraInfo de ROS standardise ces informations d’étalonnage dans les systèmes robotiques.
Enfin, la fusion des capteurs combine les observations au fil du temps. Les poses du robot et les transformations de coordonnées placent chaque observation étiquetée dans un référentiel cartographique commun. Les transformations de coordonnées tf2 de ROS constituent un mécanisme courant pour gérer ces relations.
Concepts connexes et principales différences#
La cartographie sémantique recoupe plusieurs concepts de vision par ordinateur et de robotique, mais ceux-ci répondent à des problèmes différents :
- Le SLAM visuel estime la position d’une caméra ou d’un robot tout en construisant une carte géométrique. La cartographie sémantique ajoute une signification de classe à cette géométrie. Un système peut donc utiliser le SLAM pour l’estimation de pose et la perception sémantique pour l’étiquetage.
- La cartographie d’occupation indique si les cellules sont libres, occupées ou inconnues. Le guide de cartographie et de localisation de Nav2 explique comment les grilles d’occupation prennent en charge la planification d’itinéraires. Une carte sémantique peut en outre distinguer un mur d’une personne, ou une route praticable d’un trottoir.
- La segmentation d’instances sépare les objets individuels, comme deux voitures différentes. La segmentation sémantique regroupe les deux voitures sous une seule classe de pixels. Les cartes sémantiques peuvent utiliser l’une ou l’autre représentation selon que l’identité des objets doit être conservée.
- La recherche sémantique organise les informations selon leur similarité conceptuelle, tandis que la cartographie sémantique en robotique associe des significations à des emplacements physiques.
Applications concrètes#
Navigation autonome : un robot de livraison peut étiqueter les sols comme praticables, les murs et les bordures comme obstacles, et les personnes comme dangers dynamiques. Ces étiquettes peuvent être converties en coûts de navigation afin que le planificateur privilégie les surfaces sûres au lieu de traiter toutes les régions visibles de manière identique. Le tutoriel de navigation par segmentation sémantique de Nav2 montre comment les masques de classes et les nuages de points enregistrés peuvent mettre à jour la carte de coûts d’un robot.
Conduite urbaine : un véhicule autonome peut projeter les prédictions concernant les routes, trottoirs, bâtiments, végétation, piétons et véhicules dans une carte persistante du monde. Cela aide le système à comprendre les limites des voies, à reconnaître les zones impraticables et à déterminer où des usagers vulnérables de la route peuvent apparaître. Le jeu de données officiel Cityscapes sur les scènes urbaines fournit des images de rues annotées avec précision pour développer ce type de compréhension de scène.
Perception sémantique avec Ultralytics YOLO#
Le flux de travail Ultralytics de segmentation sémantique suivant produit une carte dense des classes à l’aide de YOLO26. Cette sortie peut ensuite être projetée dans une grille 2D ou dans un système de coordonnées mondial 3D par un pipeline de cartographie.
from ultralytics import YOLO
# Load a pretrained semantic segmentation model
model = YOLO("yolo26n-sem.pt")
# Predict a per-pixel class map
results = model("https://ultralytics.com/images/bus.jpg")
# Select the first result and inspect its map dimensions
result = results[0]
class_map = result.semantic_mask.data
print(class_map.shape)
result.save(filename="semantic_scene.jpg")semantic_mask contient un ID de classe pour chaque pixel de l’image. Il fournit la couche de perception sémantique, tandis que la profondeur, l’étalonnage, la localisation et la fusion temporelle restent nécessaires pour construire une carte spatiale persistante. Les jeux de données personnalisés au niveau des pixels peuvent être annotés et gérés avec les outils d’annotation d’Ultralytics Platform.
Considérations pratiques de conception#
Des cartes sémantiques fiables nécessitent des définitions de classes cohérentes, un étalonnage précis des capteurs, des horodatages synchronisés et des données d’entraînement représentatives. La dérive de pose peut placer des étiquettes correctes au mauvais endroit, tandis que les erreurs de segmentation peuvent marquer des obstacles comme des espaces praticables. Les objets dynamiques nécessitent également des règles d’expiration ou de suivi afin qu’un véhicule stationné ou un piéton ne reste pas intégré définitivement à la carte.
Les équipes doivent valider à la fois la précision de la perception et la cohérence spatiale, tester les limites difficiles et les petites structures, conserver si possible la confiance des prédictions et définir la manière dont les observations contradictoires sont mises à jour. Pour la navigation critique pour la sécurité, les informations sémantiques doivent compléter — et non remplacer automatiquement — la détection géométrique des obstacles et les vérifications de collision.









