Semantic Mapping
Descubre cómo la cartografía semántica combina la segmentación semántica, la profundidad, la localización y la fusión de sensores para una navegación robótica más inteligente con Ultralytics YOLO26.
El mapeo semántico es el proceso de construir una representación espacial de un entorno y asociar etiquetas de clase significativas —como carretera, pared, puerta, persona, estantería o vegetación— a las ubicaciones que contiene. En IA y robótica, un mapa semántico responde tanto a «¿Dónde está algo?» como a «¿Qué es?». En lugar de representar una escena únicamente como espacio ocupado y libre, proporciona información contextual que facilita la navegación, la planificación, la interacción y la comprensión de la escena.
Cómo funciona el mapeo semántico#
Un sistema de mapeo semántico suele combinar percepción, geometría, localización y fusión temporal. Primero, un modelo de segmentación semántica clasifica cada píxel de la imagen. Por ejemplo, todos los píxeles etiquetados como «carretera» forman una región de carretera, mientras que los píxeles etiquetados como «coche» identifican regiones de vehículos. La introducción de NVIDIA a la segmentación de imágenes en robótica ilustra cómo estas etiquetas por píxel permiten la percepción robótica.
Las etiquetas de píxel por sí solas siguen vinculadas a una imagen de cámara bidimensional. El sistema necesita geometría, a menudo procedente de LiDAR, cámaras estéreo o estimación de profundidad, para asociar los píxeles con posiciones físicas. El flujo de trabajo de imágenes RGB-D de Open3D muestra cómo las imágenes registradas de color y profundidad pueden generar una nube de puntos 3D.
La proyección precisa también depende de los parámetros intrínsecos y extrínsecos de la cámara. La documentación de calibración de cámaras de OpenCV explica los parámetros utilizados para relacionar los píxeles de la imagen con puntos 3D, mientras que la definición del mensaje CameraInfo de ROS estandariza esta información de calibración en sistemas robóticos.
Por último, la fusión de sensores combina observaciones a lo largo del tiempo. Las poses del robot y las transformaciones de coordenadas sitúan cada observación etiquetada en un marco de mapa compartido. Las transformaciones de coordenadas tf2 de ROS proporcionan un mecanismo común para mantener estas relaciones.
Conceptos relacionados y diferencias clave#
El mapeo semántico se solapa con varios conceptos de visión por computador y robótica, pero cada uno resuelve problemas diferentes:
- SLAM visual estima la posición de una cámara o un robot mientras construye un mapa geométrico. El mapeo semántico añade significado de clase a esa geometría. Por tanto, un sistema puede utilizar SLAM para estimar la pose y percepción semántica para etiquetar.
- El mapeo de ocupación describe si las celdas están libres, ocupadas o son desconocidas. La guía de mapeo y localización de Nav2 explica cómo las cuadrículas de ocupación facilitan la planificación de rutas. Un mapa semántico también puede distinguir una pared de una persona o una carretera transitable de una acera.
- La segmentación de instancias separa objetos individuales, como dos coches diferentes. La segmentación semántica agrupa ambos coches bajo una única clase de píxel. Los mapas semánticos pueden utilizar cualquiera de las dos representaciones, según sea necesario conservar o no la identidad de los objetos.
- La búsqueda semántica organiza la información según la similitud conceptual, mientras que el mapeo semántico en robótica asocia significados con ubicaciones físicas.
Aplicaciones en el mundo real#
Navegación autónoma: Un robot de reparto puede etiquetar los suelos como transitables, las paredes y los bordillos como obstáculos y las personas como peligros dinámicos. Estas etiquetas pueden traducirse en costes de navegación para que el planificador prefiera superficies seguras, en lugar de tratar todas las regiones visibles de forma idéntica. El tutorial de navegación con segmentación semántica de Nav2 muestra cómo las máscaras de clase y las nubes de puntos registradas pueden actualizar el mapa de costes de un robot.
Conducción urbana: Un vehículo autónomo puede proyectar las predicciones de carreteras, aceras, edificios, vegetación, peatones y vehículos en un mapa persistente del mundo. Esto ayuda al sistema a comprender los límites de los carriles, reconocer las zonas no transitables y razonar sobre dónde pueden aparecer usuarios vulnerables de la vía. El conjunto de datos oficial de escenas urbanas Cityscapes proporciona imágenes de calles densamente etiquetadas para desarrollar este tipo de comprensión de escenas.
Percepción semántica con Ultralytics YOLO#
El siguiente flujo de trabajo de segmentación semántica de Ultralytics produce un mapa de clases denso mediante YOLO26. Posteriormente, una canalización de mapeo puede proyectar ese resultado en una cuadrícula 2D o en un sistema de coordenadas 3D del mundo.
from ultralytics import YOLO
# Load a pretrained semantic segmentation model
model = YOLO("yolo26n-sem.pt")
# Predict a per-pixel class map
results = model("https://ultralytics.com/images/bus.jpg")
# Select the first result and inspect its map dimensions
result = results[0]
class_map = result.semantic_mask.data
print(class_map.shape)
result.save(filename="semantic_scene.jpg")semantic_mask contiene un ID de clase por cada píxel de la imagen. Proporciona la capa de percepción semántica, mientras que la profundidad, la calibración, la localización y la fusión temporal siguen siendo necesarias para construir un mapa espacial persistente. Los conjuntos de datos personalizados a nivel de píxel se pueden etiquetar y gestionar con las herramientas de anotación de Ultralytics Platform.
Consideraciones prácticas de diseño#
Los mapas semánticos fiables requieren definiciones de clase coherentes, una calibración precisa de los sensores, marcas de tiempo sincronizadas y datos de entrenamiento representativos. La deriva de la pose puede situar etiquetas correctas en ubicaciones incorrectas, mientras que los errores de segmentación pueden marcar obstáculos como espacio transitable. Los objetos dinámicos también requieren reglas de caducidad o seguimiento para que un vehículo aparcado o un peatón no permanezcan incrustados permanentemente en el mapa.
Los equipos deben validar tanto la precisión de la percepción como la coherencia espacial, probar límites difíciles y estructuras pequeñas, conservar la confianza de las predicciones cuando sea posible y definir cómo se actualizan las observaciones contradictorias. En la navegación crítica para la seguridad, la información semántica debe complementar —no sustituir automáticamente— la detección geométrica de obstáculos y las comprobaciones de colisión.









