Visual SLAM (Simultaneous Localization and Mapping)
Entdecke, wie Visual SLAM autonomes Kartieren ermöglicht. Erfahre, wie du die Genauigkeit mit Ultralytics YOLO26 verbesserst und Lösungen über die Ultralytics Platform bereitstellst.
Visual SLAM (Simultane Lokalisierung und Kartierung) ist eine zentrale Computer-Vision-Technik, mit der ein Agent, etwa ein Roboter oder ein Mobilgerät, mithilfe von Kamerabildern gleichzeitig eine unbekannte Umgebung kartiert und seine eigene Position darin bestimmt. Anders als herkömmliche SLAM-Systeme, die auf teure Lasersensoren angewiesen sind, nutzt Visual SLAM gewöhnliche Mono-, Stereo- oder RGB-D-Kameras. Das System extrahiert und verfolgt visuelle Merkmale über aufeinanderfolgende Bildsequenzen hinweg, berechnet so die Kamerabahn und erstellt nach und nach eine 3D-Punktwolke oder eine dichte Karte der Umgebung. Diese Technologie bildet die Grundlage für autonome Navigation und räumliches Wahrnehmungsvermögen von Maschinen.
So funktioniert Visual SLAM#
Eine typische Visual-SLAM-Pipeline besteht aus zwei Hauptkomponenten: Frontend und Backend. Das Frontend verarbeitet die Sensordaten, extrahiert visuelle Merkmale (und erkennt dabei markante Ecken oder Kanten) und gleicht diese Merkmale zwischen den Einzelbildern ab, um die Kamerabewegung im Zeitverlauf zu schätzen. Das Backend nutzt diese Odometrie-Daten und führt Optimierungsalgorithmen wie die Bundle Adjustment durch, um Drift zu korrigieren und sowohl die Umgebungskarte als auch die geschätzte Kamerapose zu verfeinern.
Durchbrüche aus den Jahren 2024 und 2025 haben den Schwerpunkt von traditionellen, manuell entwickelten Merkmalen – wie denen aus älteren Frameworks wie ORB-SLAM3 – auf Ansätze des Deep Learning verlagert. Moderne Systeme verwenden inzwischen neuronale Netze für dichten optischen Fluss und den Abgleich von Merkmalen. Dadurch sind sie sehr robust gegenüber Bewegungsunschärfe und Umgebungen mit wenigen Texturen. Darüber hinaus ermöglichen neuartige Rendering-Techniken mit 3D Gaussian Splatting und Neural Radiance Fields (NeRFs) eine dichte Kartierung in Echtzeit und mit fotorealistischer Qualität. Dabei werden komplexe geometrische Details deutlich besser erfasst als mit herkömmlichen Punktwolken.
Visual SLAM im Vergleich zu LiDAR-SLAM und Objektverfolgung#
Um die passende Lösung einzusetzen, ist es wichtig, die Unterschiede zwischen Kartierungs- und Verfolgungstechnologien zu verstehen:
- Visual SLAM im Vergleich zu LiDAR-SLAM: Visual SLAM nutzt preisgünstige Kamerasensoren, um vielfältige visuelle Texturen wahrzunehmen. LiDAR-SLAM verwendet hingegen Laserstrahlen, um physische Entfernungen präzise zu messen. LiDAR ist sehr genau, aber teuer und energiehungrig. Visual SLAM ist kostengünstig und liefert Farbinformationen, kann jedoch bei schlechten Lichtverhältnissen Schwierigkeiten haben.
- Visual SLAM im Vergleich zur Objektverfolgung: Bei der Objektverfolgung wird die Bewegung bestimmter Objekte über Videobilder hinweg erkannt und verfolgt. Visual SLAM verfolgt dagegen die Bewegung der Kamera relativ zur unbeweglichen Umgebung, um eine Karte zu erstellen. Die beiden Konzepte kommen jedoch beim semantischen SLAM zusammen: Objekterkennungs modelle identifizieren bewegliche Objekte, damit diese gezielt aus der statischen Karte ausgeschlossen werden können.
Anwendungen in der Praxis#
Visual SLAM ist eng in moderne KI-Agenten und räumliche Computersysteme integriert.
- Robotik und autonome Drohnen: Lieferroboter und Drohnen nutzen Visual SLAM zur Navigation in Umgebungen ohne GPS, etwa in Lagerhäusern oder dicht bebauten Straßenschluchten. Mithilfe von Karten in Echtzeit können sie Routen planen und Hindernissen selbstständig ausweichen.
- Augmented Reality (AR) und Virtual Reality (VR): Kommerzielle Smart Glasses sind stark auf Visual SLAM angewiesen, um die Geometrie eines Raums zu erfassen. So können AR-Systeme digitale Objekte, etwa einen virtuellen Bildschirm, präzise auf physischen Oberflächen verankern, sodass sie stabil bleiben, während sich der Nutzer bewegt.
- Assistenzsysteme für die Navigation: Neuere Entwicklungen im semantischen SLAM mit Deep Learning werden genutzt, um tragbare Navigationshilfen für Menschen mit Sehbehinderung zu entwickeln. Sie ermöglichen eine sichere Routenführung in Echtzeit, bei der bewegliche physische Hindernisse umgangen werden.
Semantisches SLAM und die Integration von Ultralytics YOLO26#
Eine der größten Herausforderungen bei Visual SLAM sind dynamische Umgebungen, in denen sich bewegende Objekte die Karte verfälschen. Semantisches SLAM begegnet diesem Problem, indem es die herkömmliche SLAM-Pipeline mit schnellen Bildverarbeitungsmodellen kombiniert. Mit Ultralytics YOLO26 für die Instanzsegmentierung oder Objekterkennung kann das System die Szene semantisch erfassen und bewegliche Objekte herausfiltern. Das verbessert die Lokalisierungsgenauigkeit erheblich.
Der folgende Codeblock zeigt, wie du mit Ultralytics YOLO26 die Koordinaten beweglicher Objekte (etwa von Personen und Autos) ermittelst, damit die Merkmalsabgleich-Engine von SLAM diese gezielt ignorieren kann:
from ultralytics import YOLO
# Load Ultralytics YOLO26 to detect dynamic objects in the scene
model = YOLO("yolo26n.pt")
results = model("robot_camera_view.jpg")
# Extract bounding boxes of dynamic objects to exclude them from SLAM maps
for box in results[0].boxes:
if int(box.cls) in [0, 2]: # Example: Class 0 is person, Class 2 is car
print(f"Ignore dynamic feature region at coordinates: {box.xyxy[0]}")Mithilfe moderner Edge-KI-Hardware wie NVIDIA Jetson und der Integration von Modellen über die Ultralytics-Plattform können Entwickler leichte Bildverarbeitungsalgorithmen direkt neben SLAM-Pipelines trainieren und bereitstellen. Weitere Informationen zu Architekturen für autonome Kartierung findest du in aktueller Fachliteratur auf IEEE Xplore oder arXiv. Wie du kontinuierliche Bildverarbeitungspipelines optimierst, erfährst du in der Ultralytics-Dokumentation.









