Semantic Mapping
Scopri come la mappatura semantica combina segmentazione semantica, profondità, localizzazione e fusione dei sensori per una navigazione robotica più intelligente con Ultralytics YOLO26.
La mappatura semantica è il processo di costruzione di una rappresentazione spaziale di un ambiente e di associazione di etichette di classe significative—come strada, parete, porta, persona, scaffale o vegetazione—alle posizioni al suo interno. Nell'AI e nella robotica, una mappa semantica risponde sia a «Dov'è qualcosa?» sia a «Che cos'è?». Invece di rappresentare una scena soltanto come spazio occupato e libero, fornisce informazioni contestuali che supportano la navigazione, la pianificazione, l'interazione e la comprensione della scena.
Come funziona la mappatura semantica#
Un sistema di mappatura semantica combina in genere percezione, geometria, localizzazione e fusione temporale. Innanzitutto, un modello di segmentazione semantica classifica ogni pixel dell'immagine. Ad esempio, tutti i pixel etichettati come «strada» formano una regione stradale, mentre i pixel etichettati come «auto» identificano le regioni dei veicoli. L'introduzione di NVIDIA alla segmentazione delle immagini nella robotica illustra come queste etichette per-pixel supportino la percezione del robot.
Le sole etichette dei pixel restano legate a un'immagine bidimensionale acquisita dalla fotocamera. Il sistema ha bisogno della geometria, spesso ottenuta da LiDAR, fotocamere stereo o dalla stima della profondità, per associare i pixel a posizioni fisiche. Il flusso di lavoro delle immagini RGB-D di Open3D dimostra come immagini registrate a colori e di profondità possano produrre una nuvola di punti 3D.
Una proiezione accurata dipende anche dai parametri intrinseci ed estrinseci della fotocamera. La documentazione sulla calibrazione delle fotocamere di OpenCV spiega i parametri utilizzati per mettere in relazione i pixel dell'immagine con i punti 3D, mentre la definizione del messaggio CameraInfo di ROS standardizza queste informazioni di calibrazione nei sistemi robotici.
Infine, la fusione dei sensori combina le osservazioni nel tempo. Le pose del robot e le trasformazioni delle coordinate collocano ogni osservazione etichettata in un frame di mappa condiviso. Le trasformazioni delle coordinate tf2 di ROS forniscono un meccanismo comune per mantenere queste relazioni.
Concetti correlati e differenze chiave#
La mappatura semantica presenta punti di contatto con diversi concetti di visione artificiale e robotica, ma questi risolvono problemi differenti:
- SLAM visivo stima la posizione di una fotocamera o di un robot mentre costruisce una mappa geometrica. La mappatura semantica aggiunge il significato delle classi a questa geometria. Un sistema può quindi utilizzare lo SLAM per la stima della posa e la percezione semantica per l'etichettatura.
- La mappatura dell'occupazione descrive se le celle sono libere, occupate o sconosciute. La guida alla mappatura e alla localizzazione di Nav2 spiega come le griglie di occupazione supportino la pianificazione dei percorsi. Una mappa semantica può inoltre distinguere una parete da una persona o una strada percorribile da un marciapiede.
- La segmentazione delle istanze separa i singoli oggetti, ad esempio due auto diverse. La segmentazione semantica raggruppa entrambe le auto sotto un'unica classe di pixel. Le mappe semantiche possono utilizzare l'una o l'altra rappresentazione a seconda che sia necessario preservare l'identità degli oggetti.
- La ricerca semantica organizza le informazioni in base alla similarità concettuale, mentre la mappatura semantica nella robotica associa i significati alle posizioni fisiche.
Applicazioni nel mondo reale#
Navigazione autonoma: un robot per le consegne può etichettare i pavimenti come percorribili, le pareti e i cordoli come ostacoli e le persone come pericoli dinamici. Queste etichette possono essere convertite in costi di navigazione, così il pianificatore preferisce le superfici sicure invece di trattare ogni regione visibile allo stesso modo. Il tutorial sulla navigazione con segmentazione semantica di Nav2 mostra come le maschere delle classi e le nuvole di punti registrate possano aggiornare la costmap di un robot.
Guida urbana: un veicolo autonomo può proiettare le predizioni di strade, marciapiedi, edifici, vegetazione, pedoni e veicoli in una mappa persistente del mondo. Questo aiuta il sistema a comprendere i confini delle corsie, a riconoscere le aree non percorribili e a ragionare su dove possano comparire gli utenti vulnerabili della strada. Il dataset ufficiale di scene urbane Cityscapes fornisce immagini stradali densamente etichettate per sviluppare questo tipo di comprensione della scena.
Percezione semantica con Ultralytics YOLO#
Il seguente flusso di lavoro di segmentazione semantica di Ultralytics produce una mappa densa delle classi utilizzando YOLO26. Questo output può essere successivamente proiettato in una griglia 2D o in un sistema di coordinate del mondo 3D da una pipeline di mappatura.
from ultralytics import YOLO
# Load a pretrained semantic segmentation model
model = YOLO("yolo26n-sem.pt")
# Predict a per-pixel class map
results = model("https://ultralytics.com/images/bus.jpg")
# Select the first result and inspect its map dimensions
result = results[0]
class_map = result.semantic_mask.data
print(class_map.shape)
result.save(filename="semantic_scene.jpg")semantic_mask contiene un ID di classe per ogni pixel dell'immagine. Fornisce il livello di percezione semantica, mentre profondità, calibrazione, localizzazione e fusione temporale sono ancora necessarie per costruire una mappa spaziale persistente. I dataset personalizzati a livello di pixel possono essere etichettati e gestiti con gli strumenti di annotazione di Ultralytics Platform.
Considerazioni pratiche di progettazione#
Mappe semantiche affidabili richiedono definizioni delle classi coerenti, una calibrazione accurata dei sensori, timestamp sincronizzati e dati di addestramento rappresentativi. La deriva della posa può collocare etichette corrette in posizioni errate, mentre gli errori di segmentazione possono contrassegnare gli ostacoli come spazio percorribile. Gli oggetti dinamici richiedono inoltre regole di scadenza o di tracciamento, affinché un veicolo parcheggiato o un pedone non rimanga incorporato permanentemente nella mappa.
I team dovrebbero convalidare sia l'accuratezza della percezione sia la coerenza spaziale, testare i confini difficili e le strutture di piccole dimensioni, conservare ove possibile la confidenza delle predizioni e definire come aggiornare le osservazioni in conflitto. Per la navigazione critica per la sicurezza, le informazioni semantiche dovrebbero integrare—non sostituire automaticamente—il rilevamento geometrico degli ostacoli e i controlli di collisione.









