Sensor Fusion
La fusione dei sensori combina i dati di telecamere, LiDAR, radar e altri sensori per ottenere una visione più affidabile di quella fornita da un singolo sensore, come nelle auto a guida autonoma.
La fusione dei sensori combina le misurazioni di più sensori per ottenere una comprensione dell’ambiente più accurata, completa e affidabile di quella fornita da un singolo sensore. Nella visione artificiale, spesso significa unire immagini delle telecamere con LiDAR, radar, GPS, microfoni o unità di misura inerziale. Il più ampio concetto di fusione dei sensori supporta le macchine autonome bilanciando punti di forza complementari: per esempio, le telecamere acquisiscono colori e dettagli semantici, mentre il radar misura distanza e velocità in modo affidabile anche con scarsa visibilità.
Come funziona la fusione dei sensori#
Una pipeline di fusione prima sincronizza le letture dei sensori, le trasforma in un sistema di coordinate condiviso e stima l'incertezza di ciascuna misurazione. Quindi combina le informazioni a uno di tre livelli:
- La fusione precoce unisce gli input grezzi prima dell'elaborazione, conservando i dettagli ma richiedendo un allineamento preciso.
- La fusione a livello di caratteristiche combina rappresentazioni apprese dopo l’estrazione delle caratteristiche. Sistemi recenti come la fusione radar-telecamera RCBEVDet e la fusione LiDAR-telecamera GAFusion usano caratteristiche in vista dall’alto e meccanismi di attenzione per allineare le modalità.
- La fusione tardiva combina output come le caselle di rilevamento degli oggetti, le stime di profondità o le probabilità di classe. È modulare e può continuare a funzionare quando un sensore si guasta.
I metodi tradizionali di stima dello stato includono il filtro di Kalman e il filtro di Kalman esteso. I moderni sistemi di deep learning apprendono sempre più spesso pesi adattivi, in modo che i sensori inaffidabili contribuiscano meno.
Applicazioni nel mondo reale#
- Veicoli autonomi: le telecamere identificano pedoni e segnali stradali, il LiDAR fornisce la geometria 3D e il radar stima il movimento. Nel febbraio 2026, Waymo ha descritto il suo Waymo Driver di sesta generazione come un sistema che usa la fusione basata su apprendimento automatico di input provenienti da telecamere, LiDAR, radar e audio, per fornire ridondanza in condizioni meteorologiche difficili.
- Robotica: i robot mobili fondono i dati di telecamere, encoder delle ruote, IMU e sensori di distanza per la navigazione. Combinare la percezione con lo SLAM visivo aiuta un robot a localizzarsi mentre mappa ambienti dinamici.
- Sistemi di visione industriale: le fabbriche combinano sensori RGB, termici, di vibrazione e di profondità per rilevare difetti o guasti alle apparecchiature che potrebbero essere invisibili nelle immagini normali.
Fusione dei sensori con Ultralytics YOLO#
Ultralytics YOLO26 può fornire il ramo di percezione basato su telecamera di un sistema di fusione. Questo esempio genera rilevamenti associabili a misurazioni radar o di profondità sincronizzate:
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
result = model("https://ultralytics.com/images/bus.jpg")[0]
for box in result.boxes:
label = result.names[int(box.cls)]
print(label, box.xyxy[0].tolist(), box.conf.item())Per i video, la modalità tracking di YOLO può mantenere l'identità degli oggetti prima della fusione con le stime di distanza o movimento.
Ricerca attuale e best practice#
La ricerca del 2024–2026 sottolinea la fusione consapevole delle condizioni meteorologiche, le rappresentazioni in vista dall’alto, il contesto temporale e il degrado progressivo. I lavori recenti esplorano la fusione di LiDAR e radar 4D in condizioni meteorologiche avverse, la fusione adattiva ai sensori e la robustezza ai dati dei sensori obsoleti o ritardati.
Le pratiche consigliate includono una calibrazione spaziale precisa, timestamp hardware, ponderazione basata sull’incertezza, test di perdita dei sensori e convalida in diverse condizioni meteorologiche e di illuminazione. La sincronizzazione temporale e una configurazione coerente dei sensori sono essenziali, mentre dataset come MSU-4S consentono di eseguire test in diverse stagioni.
La fusione dei sensori differisce dall'integrazione dei sensori, che si occupa principalmente di collegare i sensori a un sistema, e dall'apprendimento multimodale, che può combinare input non provenienti da sensori, come il testo. I team possono usare la Ultralytics Platform per annotare dati visivi, addestrare modelli, distribuire componenti di percezione e monitorarli come parte di una pipeline di fusione più ampia.










