Sensor Fusion
Sensorfusion führt Daten von Kameras, LiDAR, Radar und anderen Sensoren zu einem zuverlässigeren Gesamtbild zusammen, als es ein einzelner Sensor liefern kann, etwa bei selbstfahrenden Autos.
Sensorfusion kombiniert Messwerte mehrerer Sensoren, um ein genaueres, umfassenderes und zuverlässigeres Bild einer Umgebung zu erstellen, als es ein einzelner Sensor liefern kann. In der Bildverarbeitung bedeutet dies häufig, Kamerabilder mit LiDAR, Radar, GPS, Mikrofonen oder inertialen Messeinheiten zusammenzuführen. Das umfassendere Konzept der Sensorfusion unterstützt autonome Maschinen, indem es einander ergänzende Stärken nutzt: Kameras erfassen beispielsweise Farbe und semantische Details, während Radar Entfernung und Geschwindigkeit auch bei schlechter Sicht zuverlässig misst.
So funktioniert Sensorfusion#
Eine Fusionspipeline synchronisiert zunächst die Sensormesswerte, überführt sie in ein gemeinsames Koordinatensystem und schätzt die Unsicherheit jeder Messung. Anschließend kombiniert sie die Informationen auf einer von drei Ebenen:
- Frühe Fusion führt Rohdaten vor der Verarbeitung zusammen. Sie bewahrt Details, erfordert aber eine präzise Ausrichtung.
- Fusion auf Merkmalsebene kombiniert erlernte Repräsentationen nach der Merkmalsextraktion. Neuere Systeme wie die Radar-Kamera-Fusion RCBEVDet und die LiDAR-Kamera-Fusion GAFusion verwenden Vogelperspektiven-Merkmale und Aufmerksamkeit, um Modalitäten aufeinander abzustimmen.
- Späte Fusion kombiniert Ergebnisse wie Begrenzungsrahmen der Objekterkennung, Tiefenschätzungen oder Klassenwahrscheinlichkeiten. Sie ist modular aufgebaut und kann weiterarbeiten, wenn ein Sensor ausfällt.
Zu den traditionellen Methoden der Zustandsschätzung gehören der Kalman-Filter und der erweiterte Kalman-Filter. Moderne Deep-Learning-Systeme lernen zunehmend adaptive Gewichtungen, sodass unzuverlässige Sensoren weniger stark berücksichtigt werden.
Anwendungen in der Praxis#
- Autonome Fahrzeuge: Kameras erkennen Fußgänger und Verkehrsschilder, LiDAR liefert 3D-Geometriedaten und Radar schätzt Bewegungen. Im Februar 2026 beschrieb Waymo den Waymo Driver der sechsten Generation als System, das durch maschinelles Lernen erlernte Datenfusion aus Kamera-, LiDAR-, Radar- und Audioeingaben nutzt, um bei schwierigen Wetterbedingungen Redundanz bereitzustellen.
- Robotik: Mobile Roboter kombinieren Kamera-, Raddrehgeber-, IMU- und Entfernungsmessdaten zur Navigation. Die Kombination von Wahrnehmung mit Visual SLAM hilft einem Roboter, sich selbst zu lokalisieren und zugleich dynamische Umgebungen zu kartieren.
- Industrielle Bildverarbeitungssysteme: Fabriken kombinieren RGB-, Wärmebild-, Vibrations- und Tiefensensoren, um Fehler oder Geräteausfälle zu erkennen, die auf gewöhnlichen Bildern möglicherweise unsichtbar sind.
Sensorfusion mit Ultralytics YOLO#
Ultralytics YOLO26 kann den Kamerawahrnehmungszweig eines Fusionssystems bereitstellen. Dieses Beispiel erzeugt Erkennungen, die mit synchronisierten Radar- oder Tiefenmessungen verknüpft werden können:
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
result = model("https://ultralytics.com/images/bus.jpg")[0]
for box in result.boxes:
label = result.names[int(box.cls)]
print(label, box.xyxy[0].tolist(), box.conf.item())Bei Videos kann der YOLO-Trackingmodus Objektidentitäten verfolgen, bevor Entfernungs- oder Bewegungsschätzungen zusammengeführt werden.
Aktuelle Forschung und bewährte Verfahren#
Forschung aus den Jahren 2024 bis 2026 betont wetterbewusste Fusion, Vogelperspektiven-Repräsentationen, zeitlichen Kontext und einen kontrollierten Leistungsabbau. Neuere Arbeiten untersuchen die Fusion von LiDAR und 4D-Radar bei widrigen Wetterbedingungen, sensoradaptive Fusion und Robustheit gegenüber veralteten oder verzögerten Sensordaten.
Zu den Best Practices gehören eine präzise räumliche Kalibrierung, Hardware-Zeitstempel, eine Gewichtung unter Berücksichtigung von Unsicherheit, Tests mit Sensorausfällen und die Validierung bei unterschiedlichen Wetter- und Lichtverhältnissen. Zeitsynchronisierung und eine konsistente Sensorkonfiguration sind unverzichtbar. Datensätze wie MSU-4S ermöglichen Tests über verschiedene Jahreszeiten hinweg.
Sensorfusion unterscheidet sich von der Sensorintegration, bei der es in erster Linie darum geht, Sensoren mit einem System zu verbinden, und vom multimodalen Lernen, bei dem auch nicht von Sensoren stammende Eingaben wie Text kombiniert werden können. Teams können die Ultralytics Platform nutzen, um Bilddaten zu annotieren, Modelle zu trainieren, Wahrnehmungskomponenten bereitzustellen und sie als Teil einer größeren Fusionspipeline zu überwachen.










