Semantic Mapping
Scopri come la mappatura semantica combina segmentazione semantica, profondità, localizzazione e fusione di sensori per una navigazione robotica più intelligente con Ultralytics YOLO26.
La mappatura semantica è il processo di costruzione di una rappresentazione spaziale di un ambiente e di associazione di etichette di classe significative — come strada, muro, porta, persona, scaffale o vegetazione — alle posizioni al suo interno. Nell'IA e nella robotica, una mappa semantica risponde sia a "Dov'è qualcosa?" che a "Cos'è?". Invece di rappresentare una scena solo come spazio occupato e libero, fornisce informazioni contestuali che supportano la navigazione, la pianificazione, l'interazione e la comprensione della scena.
Come funziona la mappatura semantica#
Un sistema di mappatura semantica combina tipicamente percezione, geometria, localizzazione e fusione temporale. Innanzitutto, un modello di segmentazione semantica classifica ogni pixel dell'immagine. Tutti i pixel etichettati come "strada", ad esempio, formano una regione stradale, mentre i pixel etichettati come "auto" identificano le regioni dei veicoli. L'introduzione di NVIDIA alla segmentazione delle immagini nella robotica illustra come queste etichette per pixel supportano la percezione del robot.
Le etichette dei pixel da sole rimangono legate all'immagine bidimensionale di una fotocamera. Il sistema necessita di geometria, spesso ottenuta tramite LiDAR, fotocamere stereo o stima della profondità, per associare i pixel a posizioni fisiche. Il flusso di lavoro per immagini RGB-D di Open3D dimostra come immagini a colori e di profondità registrate possano produrre una nuvola di punti 3D.
Una proiezione accurata dipende anche dai parametri intrinseci ed estrinseci della fotocamera. La documentazione sulla calibrazione della fotocamera di OpenCV spiega i parametri utilizzati per mettere in relazione i pixel dell'immagine con i punti 3D, mentre la definizione del messaggio CameraInfo di ROS standardizza queste informazioni di calibrazione nei sistemi robotici.
Infine, la fusione dei sensori combina le osservazioni nel tempo. Le pose del robot e le trasformazioni delle coordinate collocano ciascuna osservazione etichettata in un frame di mappa condiviso. Le trasformazioni di coordinate tf2 di ROS forniscono un meccanismo comune per mantenere queste relazioni.
Concetti correlati e differenze chiave#
La mappatura semantica si sovrappone a diversi concetti di visione artificiale e robotica, ma questi risolvono problemi differenti:
- SLAM visivo stima la posizione di una fotocamera o di un robot mentre costruisce una mappa geometrica. La mappatura semantica aggiunge un significato di classe a quella geometria. Un sistema può quindi utilizzare lo SLAM per la stima della posa e la percezione semantica per l'etichettatura.
- La mappatura di occupazione descrive se le celle sono libere, occupate o sconosciute. La guida alla mappatura e localizzazione di Nav2 spiega come le griglie di occupazione supportano la pianificazione dei percorsi. Una mappa semantica può inoltre distinguere un muro da una persona o una strada carrabile da un marciapiede.
- Segmentazione d'istanza separa oggetti individuali, come due auto differenti. La segmentazione semantica raggruppa entrambe le auto sotto un'unica classe di pixel. Le mappe semantiche possono utilizzare entrambe le rappresentazioni a seconda che l'identità dell'oggetto debba essere preservata.
- La ricerca semantica organizza le informazioni per somiglianza concettuale, mentre la mappatura semantica nella robotica associa significati a posizioni fisiche.
Applicazioni nel mondo reale#
Navigazione autonoma: Un robot di consegna può etichettare i pavimenti come percorribili, i muri e i cordoli come ostacoli e le persone come pericoli dinamici. Queste etichette possono essere tradotte in costi di navigazione in modo che il pianificatore preferisca superfici sicure anziché trattare ogni regione visibile in modo identico. Il tutorial sulla navigazione con segmentazione semantica di Nav2 mostra come le maschere di classe e le nuvole di punti registrate possono aggiornare la costmap di un robot.
Guida urbana: Un veicolo autonomo può proiettare previsioni su strada, marciapiede, edifici, vegetazione, pedoni e veicoli in una mappa del mondo persistente. Ciò aiuta il sistema a comprendere i confini delle corsie, a riconoscere le aree non carrabili e a ragionare su dove potrebbero comparire utenti della strada vulnerabili. Il dataset ufficiale di scene urbane Cityscapes fornisce immagini di strade densamente etichettate per sviluppare questo tipo di comprensione della scena.
Percezione semantica con Ultralytics YOLO#
Il seguente flusso di lavoro di segmentazione semantica di Ultralytics produce una mappa di classe densa utilizzando YOLO26. Tale output può successivamente essere proiettato in una griglia 2D o in un sistema di coordinate del mondo 3D da una pipeline di mappatura.
from ultralytics import YOLO
# Load a pretrained semantic segmentation model
model = YOLO("yolo26n-sem.pt")
# Predict a per-pixel class map
results = model("https://ultralytics.com/images/bus.jpg")
# Select the first result and inspect its map dimensions
result = results[0]
class_map = result.semantic_mask.data
print(class_map.shape)
result.save(filename="semantic_scene.jpg")Il semantic_mask contiene un ID di classe per pixel dell'immagine. Fornisce il livello di percezione semantica, mentre profondità, calibrazione, localizzazione e fusione temporale sono comunque necessarie per costruire una mappa spaziale persistente. I dataset personalizzati a livello di pixel possono essere etichettati e gestiti con gli strumenti di annotazione di Ultralytics Platform.
Considerazioni pratiche di progettazione#
Mappe semantiche affidabili richiedono definizioni di classe coerenti, calibrazione accurata dei sensori, timestamp sincronizzati e dati di addestramento rappresentativi. La deriva della posa può collocare etichette corrette in posizioni errate, mentre gli errori di segmentazione potrebbero contrassegnare gli ostacoli come spazio percorribile. Anche gli oggetti dinamici richiedono regole di scadenza o tracciamento affinché un veicolo parcheggiato o un pedone non rimangano permanentemente incorporati nella mappa.
I team dovrebbero validare sia l'accuratezza della percezione che la coerenza spaziale, testare confini difficili e strutture di piccole dimensioni, conservare la confidenza delle previsioni ove possibile e definire come vengono aggiornate le osservazioni in conflitto. Per la navigazione critica per la sicurezza, le informazioni semantiche dovrebbero integrare — e non sostituire automaticamente — il rilevamento geometrico degli ostacoli e i controlli di collisione.






