Semantic Mapping
Aprende cómo el mapeo semántico combina la segmentación semántica, la profundidad, la localización y la fusión de sensores para una navegación robótica más inteligente con Ultralytics YOLO26.
El mapeo semántico es el proceso de construir una representación espacial de un entorno y asociar etiquetas de clase significativas —como carretera, pared, puerta, persona, estantería o vegetación— a ubicaciones dentro del mismo. En IA y robótica, un mapa semántico responde tanto a «¿Dónde hay algo?» como a «¿Qué es?». En lugar de representar una escena únicamente como espacio ocupado y libre, proporciona información contextual que facilita la navegación, la planificación, la interacción y la comprensión de la escena.
Cómo funciona el mapeo semántico#
Un sistema de mapeo semántico combina normalmente la percepción, la geometría, la localización y la fusión temporal. En primer lugar, un modelo de segmentación semántica clasifica cada píxel de la imagen. Todos los píxeles etiquetados como «carretera», por ejemplo, forman una región de carretera, mientras que los píxeles etiquetados como «coche» identifican regiones de vehículos. La introducción de NVIDIA a la segmentación de imágenes en robótica ilustra cómo estas etiquetas por píxel respaldan la percepción del robot.
Las etiquetas de píxeles por sí solas siguen vinculadas a una imagen de cámara bidimensional. El sistema necesita geometría, a menudo obtenida mediante LiDAR, cámaras estéreo o estimación de profundidad, para asociar los píxeles con posiciones físicas. El flujo de trabajo de imágenes RGB-D de Open3D demuestra cómo las imágenes de color y profundidad registradas pueden producir una nube de puntos 3D.
Una proyección precisa también depende de los parámetros intrínsecos y extrínsecos de la cámara. La documentación de calibración de cámaras de OpenCV explica los parámetros utilizados para relacionar los píxeles de la imagen con puntos 3D, mientras que la definición del mensaje CameraInfo de ROS estandariza esta información de calibración en sistemas robóticos.
Por último, la fusión de sensores combina las observaciones a lo largo del tiempo. Las poses del robot y las transformaciones de coordenadas sitúan cada observación etiquetada en un marco de referencia de mapa compartido. Las transformaciones de coordenadas tf2 de ROS proporcionan un mecanismo común para mantener estas relaciones.
Conceptos relacionados y diferencias clave#
El mapeo semántico se solapa con varios conceptos de visión por ordenador y robótica, pero resuelven problemas diferentes:
- SLAM visual estima la posición de una cámara o robot mientras construye un mapa geométrico. El mapeo semántico añade significado de clase a esa geometría. Por lo tanto, un sistema puede utilizar SLAM para la estimación de la pose y percepción semántica para el etiquetado.
- El mapeo de ocupación describe si las celdas están libres, ocupadas o son desconocidas. La guía de mapeo y localización de Nav2 explica cómo las cuadrículas de ocupación respaldan la planificación de trayectorias. Un mapa semántico también puede distinguir una pared de una persona o una carretera transitable de una acera.
- La segmentación de instancias separa objetos individuales, como dos coches diferentes. La segmentación semántica agrupa ambos coches bajo una misma clase de píxeles. Los mapas semánticos pueden utilizar cualquiera de las dos representaciones según sea necesario conservar la identidad del objeto.
- La búsqueda semántica organiza la información por similitud conceptual, mientras que el mapeo semántico en robótica asocia significados con ubicaciones físicas.
Aplicaciones en el mundo real#
Navegación autónoma: Un robot de reparto puede etiquetar los suelos como transitables, las paredes y los bordillos como obstáculos, y las personas como peligros dinámicos. Estas etiquetas pueden traducirse en costes de navegación para que el planificador prefiera superficies seguras en lugar de tratar cada región visible de manera idéntica. El tutorial de navegación con segmentación semántica de Nav2 muestra cómo las máscaras de clase y las nubes de puntos registradas pueden actualizar el mapa de costes de un robot.
Conducción urbana: Un vehículo autónomo puede proyectar predicciones de carreteras, aceras, edificios, vegetación, peatones y vehículos en un mapa del mundo persistente. Esto ayuda al sistema a comprender los límites de los carriles, reconocer áreas no transitables y razonar sobre dónde pueden aparecer usuarios vulnerables de la vía. El conjunto de datos oficial de escenas urbanas Cityscapes proporciona imágenes callejeras etiquetadas de forma densa para desarrollar este tipo de comprensión de escenas.
Percepción semántica con Ultralytics YOLO#
El siguiente flujo de trabajo de segmentación semántica de Ultralytics produce un mapa de clases denso utilizando YOLO26. Dicha salida puede proyectarse posteriormente en una cuadrícula 2D o en un sistema de coordenadas espaciales 3D mediante una tubería de mapeo.
from ultralytics import YOLO
# Load a pretrained semantic segmentation model
model = YOLO("yolo26n-sem.pt")
# Predict a per-pixel class map
results = model("https://ultralytics.com/images/bus.jpg")
# Select the first result and inspect its map dimensions
result = results[0]
class_map = result.semantic_mask.data
print(class_map.shape)
result.save(filename="semantic_scene.jpg")El semantic_mask contiene un ID de clase por píxel de imagen. Proporciona la capa de percepción semántica, mientras que la profundidad, la calibración, la localización y la fusión temporal siguen siendo necesarias para construir un mapa espacial persistente. Los conjuntos de datos personalizados a nivel de píxel se pueden etiquetar y gestionar con las herramientas de anotación de Ultralytics Platform.
Consideraciones prácticas de diseño#
Los mapas semánticos fiables requieren definiciones de clases coherentes, calibración precisa de los sensores, marcas de tiempo sincronizadas y datos de entrenamiento representativos. La deriva de la pose puede situar etiquetas correctas en ubicaciones incorrectas, mientras que los errores de segmentación pueden marcar obstáculos como espacio transitable. Los objetos dinámicos también requieren reglas de caducidad o seguimiento para que un vehículo aparcado o un peatón no permanezca incrustado permanentemente en el mapa.
Los equipos deben validar tanto la precisión de la percepción como la consistencia espacial, probar límites difíciles y estructuras pequeñas, conservar la confianza de las predicciones siempre que sea posible y definir cómo se actualizan las observaciones contradictorias. Para la navegación crítica para la seguridad, la información semántica debe complementar —y no reemplazar automáticamente— la detección geométrica de obstáculos y las comprobaciones de colisión.






