Visual SLAM (Simultaneous Localization and Mapping)
Découvre comment le SLAM visuel permet la cartographie autonome. Apprends à améliorer la précision avec Ultralytics YOLO26 et à déployer des solutions via la plateforme Ultralytics.
Le SLAM visuel (localisation et cartographie simultanées) est une technique centrale de vision par ordinateur qui permet à un agent, comme un robot ou un appareil mobile, de cartographier simultanément un environnement inconnu et de déterminer sa propre position dans cet espace, en utilisant uniquement des images de caméra. Contrairement aux systèmes SLAM traditionnels qui reposent sur des capteurs laser coûteux, le SLAM visuel utilise des caméras monoculaires, stéréo ou RGB-D standard. En extrayant et en suivant les caractéristiques visuelles dans des images consécutives, le système calcule la trajectoire de la caméra tout en construisant progressivement un nuage de points 3D ou une carte dense de son environnement. Cette technologie est fondamentale pour permettre la navigation autonome et la perception spatiale des machines.
Fonctionnement du SLAM visuel#
Un pipeline de SLAM visuel classique comprend deux composants principaux : le front-end et le back-end. Le front-end traite les données des capteurs, en extrayant les caractéristiques visuelles (identification de coins ou d'arêtes distincts) et en faisant correspondre ces caractéristiques entre les images pour estimer le mouvement de la caméra au fil du temps. Le back-end exploite ces données d'odométrie et applique des algorithmes d'optimisation, comme l'ajustement de faisceaux, afin de corriger la dérive et d'affiner à la fois la carte de l'environnement et la pose estimée de la caméra.
Les avancées majeures de 2024 et 2025 ont fait évoluer le paradigme, des caractéristiques conçues à la main traditionnelles — comme celles utilisées dans des frameworks historiques tels qu'ORB-SLAM3 — vers des approches d'apprentissage profond. Les systèmes modernes utilisent désormais des réseaux neuronaux pour le flux optique dense et la mise en correspondance des caractéristiques, ce qui les rend très résistants au flou de mouvement et aux environnements à faible texture. De plus, de nouvelles techniques de rendu intégrant le 3D Gaussian Splatting et les champs de radiance neuronaux (NeRFs) permettent une cartographie dense photoréaliste en temps réel, qui restitue les détails géométriques complexes bien mieux que les nuages de points standard.
SLAM visuel, SLAM LiDAR et suivi d'objets#
Il est essentiel de comprendre les différences entre les technologies de cartographie et de suivi pour déployer la solution adaptée :
- SLAM visuel et SLAM LiDAR : le SLAM visuel s'appuie sur des capteurs photo peu coûteux pour percevoir des textures visuelles riches, tandis que le SLAM LiDAR utilise des faisceaux laser pour mesurer précisément les distances physiques. Le LiDAR est très précis, mais coûteux et énergivore, tandis que le SLAM visuel est économique et fournit des informations de couleur, mais peut rencontrer des difficultés en cas de faible luminosité.
- SLAM visuel et suivi d'objets : le suivi d'objets isole des entités spécifiques et suit leurs déplacements dans les images vidéo. Le SLAM visuel, quant à lui, suit le mouvement de la caméra par rapport à l'environnement statique pour construire une carte. Ces deux concepts se rejoignent toutefois dans le SLAM sémantique, où des modèles de détection d'objets identifient les objets mobiles afin de les exclure volontairement de la carte statique.
Applications concrètes#
Le SLAM visuel est étroitement intégré aux agents IA modernes et aux systèmes d'informatique spatiale.
- Robotique et drones autonomes : les robots de livraison et les drones utilisent le SLAM visuel pour naviguer dans des environnements sans GPS, comme les entrepôts ou les canyons urbains denses. En construisant des cartes en temps réel, ils peuvent planifier leur trajectoire et éviter les obstacles de manière autonome.
- Réalité augmentée (AR) et réalité virtuelle (VR) : les lunettes intelligentes commerciales s'appuient fortement sur le SLAM visuel pour comprendre la géométrie d'une pièce. Les systèmes de réalité augmentée peuvent ainsi ancrer avec précision des objets numériques, comme un écran virtuel, sur des surfaces physiques afin qu'ils restent stables lorsque l'utilisateur se déplace.
- Systèmes de navigation assistée : les avancées récentes en SLAM sémantique basé sur l'apprentissage profond servent à créer des aides à la navigation portables pour les personnes malvoyantes, afin de leur assurer des itinéraires sûrs en temps réel autour des obstacles physiques mobiles.
Intégration du SLAM sémantique et d'Ultralytics YOLO26#
L'un des principaux défis du SLAM visuel consiste à gérer les environnements dynamiques où les objets mobiles faussent la carte. Le SLAM sémantique résout ce problème en associant le pipeline SLAM traditionnel à des modèles de vision rapides. En utilisant Ultralytics YOLO26 pour la segmentation d'instances ou la détection, le système peut attribuer des étiquettes sémantiques à la scène et filtrer les objets mobiles, ce qui améliore considérablement la précision de la localisation.
Le bloc de code ci-dessous montre comment utiliser Ultralytics YOLO26 pour identifier les coordonnées d'objets mobiles (comme les personnes et les voitures), afin que le moteur de mise en correspondance des caractéristiques SLAM puisse explicitement les ignorer :
from ultralytics import YOLO
# Load Ultralytics YOLO26 to detect dynamic objects in the scene
model = YOLO("yolo26n.pt")
results = model("robot_camera_view.jpg")
# Extract bounding boxes of dynamic objects to exclude them from SLAM maps
for box in results[0].boxes:
if int(box.cls) in [0, 2]: # Example: Class 0 is person, Class 2 is car
print(f"Ignore dynamic feature region at coordinates: {box.xyxy[0]}")En tirant parti du matériel moderne d'IA en périphérie, comme le NVIDIA Jetson, et en intégrant des modèles via la plateforme Ultralytics, les développeurs peuvent entraîner et déployer des algorithmes de vision légers directement avec les pipelines SLAM. Pour approfondir les architectures de cartographie autonome, consulte les publications récentes sur IEEE Xplore ou arXiv, et découvre comment optimiser les pipelines de vision continus dans la documentation Ultralytics.









