Semantic Mapping
Saiba como o mapeamento semântico combina segmentação semântica, profundidade, localização e fusão de sensores para uma navegação robótica mais inteligente com o Ultralytics YOLO26.
O mapeamento semântico é o processo de criar uma representação espacial de um ambiente e associar rótulos de classe significativos — como estrada, parede, porta, pessoa, prateleira ou vegetação — a localizações dentro dele. Em IA e robótica, um mapa semântico responde tanto a “Onde está algo?” como a “O que é?”. Em vez de representar uma cena apenas como espaço ocupado e livre, ele fornece informações contextuais que apoiam a navegação, o planeamento, a interação e a compreensão da cena.
Como funciona o mapeamento semântico#
Um sistema de mapeamento semântico normalmente combina perceção, geometria, localização e fusão temporal. Primeiro, um modelo de segmentação semântica classifica cada pixel da imagem. Por exemplo, todos os pixels identificados como “estrada” formam uma região de estrada, enquanto os pixels identificados como “carro” identificam regiões de veículos. A introdução da NVIDIA à segmentação de imagens em robótica ilustra como estes rótulos por pixel apoiam a perceção robótica.
Os rótulos dos pixels, por si só, continuam associados a uma imagem de câmara bidimensional. O sistema precisa de geometria, frequentemente obtida através de LiDAR, câmaras estéreo ou estimativa de profundidade, para associar os pixels a posições físicas. O fluxo de trabalho de imagens RGB-D do Open3D demonstra como imagens de cor e profundidade registadas podem produzir uma nuvem de pontos 3D.
Uma projeção precisa também depende dos parâmetros intrínsecos e extrínsecos da câmara. A documentação de calibração de câmaras do OpenCV explica os parâmetros utilizados para relacionar os pixels da imagem com pontos 3D, enquanto a definição da mensagem CameraInfo do ROS normaliza estas informações de calibração em sistemas robóticos.
Por fim, a fusão de sensores combina observações ao longo do tempo. As poses do robô e as transformações de coordenadas colocam cada observação rotulada num referencial de mapa partilhado. As transformações de coordenadas tf2 do ROS fornecem um mecanismo comum para manter estas relações.
Conceitos relacionados e principais diferenças#
O mapeamento semântico sobrepõe-se a vários conceitos de visão computacional e robótica, mas estes resolvem problemas diferentes:
- SLAM visual estima a posição de uma câmara ou de um robô enquanto constrói um mapa geométrico. O mapeamento semântico acrescenta significado de classe a essa geometria. Assim, um sistema pode utilizar SLAM para a estimativa da pose e a perceção semântica para a rotulagem.
- O mapeamento de ocupação descreve se as células estão livres, ocupadas ou desconhecidas. O guia de mapeamento e localização do Nav2 explica como as grelhas de ocupação apoiam o planeamento de trajetórias. Um mapa semântico pode ainda distinguir uma parede de uma pessoa ou uma estrada transitável de um passeio.
- A segmentação de instâncias separa objetos individuais, como dois carros diferentes. A segmentação semântica agrupa ambos os carros numa única classe de pixels. Os mapas semânticos podem utilizar qualquer uma das representações, dependendo de ser necessário preservar a identidade dos objetos.
- A pesquisa semântica organiza as informações por semelhança conceptual, enquanto o mapeamento semântico em robótica associa significados a localizações físicas.
Aplicações no mundo real#
Navegação autónoma: Um robô de entregas pode identificar pisos como transitáveis, paredes e lancis como obstáculos e pessoas como perigos dinâmicos. Estes rótulos podem ser convertidos em custos de navegação para que o planeador prefira superfícies seguras, em vez de tratar todas as regiões visíveis de forma idêntica. O tutorial de navegação com segmentação semântica do Nav2 mostra como máscaras de classe e nuvens de pontos registadas podem atualizar o mapa de custos de um robô.
Condução urbana: Um veículo autónomo pode projetar previsões de estradas, passeios, edifícios, vegetação, peões e veículos num mapa persistente do mundo. Isto ajuda o sistema a compreender os limites das faixas de rodagem, reconhecer áreas não transitáveis e raciocinar sobre onde podem surgir utilizadores vulneráveis da estrada. O conjunto de dados oficial de cenas urbanas Cityscapes fornece imagens de ruas densamente rotuladas para desenvolver este tipo de compreensão da cena.
Perceção semântica com Ultralytics YOLO#
O seguinte fluxo de trabalho de segmentação semântica da Ultralytics produz um mapa denso de classes utilizando YOLO26. Posteriormente, esse resultado pode ser projetado numa grelha 2D ou num sistema de coordenadas mundial 3D por um pipeline de mapeamento.
from ultralytics import YOLO
# Load a pretrained semantic segmentation model
model = YOLO("yolo26n-sem.pt")
# Predict a per-pixel class map
results = model("https://ultralytics.com/images/bus.jpg")
# Select the first result and inspect its map dimensions
result = results[0]
class_map = result.semantic_mask.data
print(class_map.shape)
result.save(filename="semantic_scene.jpg")O semantic_mask contém um ID de classe por cada pixel da imagem. Ele fornece a camada de perceção semântica, enquanto a profundidade, a calibração, a localização e a fusão temporal continuam a ser necessárias para construir um mapa espacial persistente. Os conjuntos de dados personalizados ao nível dos pixels podem ser rotulados e geridos com as ferramentas de anotação da Ultralytics Platform.
Considerações práticas de design#
Mapas semânticos fiáveis requerem definições de classes consistentes, calibração precisa dos sensores, marcas temporais sincronizadas e dados de treino representativos. O desvio da pose pode colocar rótulos corretos em localizações incorretas, enquanto erros de segmentação podem identificar obstáculos como espaço transitável. Os objetos dinâmicos também requerem regras de expiração ou rastreamento para que um veículo estacionado ou um peão não permaneça incorporado permanentemente no mapa.
As equipas devem validar tanto a precisão da perceção como a consistência espacial, testar limites difíceis e estruturas pequenas, conservar a confiança das previsões sempre que possível e definir como as observações conflitantes são atualizadas. Para a navegação crítica para a segurança, as informações semânticas devem complementar — e não substituir automaticamente — a deteção geométrica de obstáculos e as verificações de colisão.









