Semantic Mapping
了解语义映射如何将语义分割、深度、定位和传感器融合结合起来,利用 Ultralytics YOLO26 实现更智能的机器人导航。
语义建图是构建环境空间表示并为其中的位置附加有意义的类别标签(例如道路、墙壁、门道、人、货架或植被)的过程。在 AI 和机器人技术中,语义地图既能回答“某物在哪里?”,又能回答“它是什么?”。它不只是将场景表示为占用空间和自由空间,还提供支持导航、规划、交互和场景理解的上下文信息。
语义建图的工作原理#
语义建图系统通常将感知、几何、定位和时间融合结合起来。首先,语义分割模型对每个图像像素进行分类。例如,所有标记为“道路”的像素形成道路区域,而标记为“汽车”的像素则识别出车辆区域。NVIDIA 机器人图像分割简介阐述了这些逐像素标签如何支持机器人感知。
仅凭像素标签仍然局限于二维相机图像。系统需要通常来自 LiDAR、立体相机或深度估计的几何数据,才能将像素与物理位置关联起来。Open3D RGB-D 图像工作流演示了配准的彩色和深度图像如何生成 3D 点云。
精确的投影还取决于相机的内参和外参。OpenCV 相机标定文档解释了用于将图像像素关联到 3D 点的参数,而 ROS 的 CameraInfo 消息定义则规范了机器人系统中的这些标定信息。
最后,传感器融合结合了随时间推移的观测数据。机器人位姿和坐标变换将每个带标签的观测放置在共享的地图坐标系中。ROS tf2 坐标变换提供了一种用于维护这些关系的通用机制。
相关概念与关键区别#
语义建图与多个计算机视觉和机器人概念重叠,但它们解决的是不同的问题:
- 视觉 SLAM 在构建几何地图的同时估计相机或机器人的位置。语义建图为该几何结构添加了类别含义。因此,系统可能会使用 SLAM 进行位姿估计,并使用语义感知进行标注。
- 占用网格建图描述单元格是自由的、被占用的还是未知的。Nav2 建图与定位指南解释了占用网格如何支持路径规划。语义地图还可以额外区分墙壁和人,或者可行驶道路和人行道。
- **实例分割**将各个对象(例如两辆不同的汽车)分离。语义分割则将两辆车归入同一个像素类别。语义地图可能会根据是否需要保留对象身份来使用这两种表示形式中的一种。
- 语义搜索按概念相似性组织信息,而机器人技术中的语义建图则是将含义与物理位置关联起来。
实际应用#
**自主导航:**配送机器人可以将地面标记为可通行,将墙壁和路缘标记为障碍物,将人标记为动态危险。这些标签可以转换为导航成本,使规划器倾向于安全的表面,而不是将每个可见区域都视为相同。Nav2 语义分割导航教程展示了类别掩码和配准点云如何更新机器人的代价地图。
**城市驾驶:**自动驾驶汽车可以将道路、人行道、建筑、植被、行人和车辆预测投影到持久的世界地图中。这有助于系统理解车道边界、识别不可行驶区域,并推断弱势道路使用者可能出现的位置。官方的 Cityscapes 城市场景数据集为开发此类场景理解提供了密集标记的街道图像。
使用 Ultralytics YOLO 进行语义感知#
以下 Ultralytics 语义分割工作流使用 YOLO26 生成密集的类别地图。该输出随后可以由建图管道投影到 2D 网格或 3D 世界坐标系中。
from ultralytics import YOLO
# Load a pretrained semantic segmentation model
model = YOLO("yolo26n-sem.pt")
# Predict a per-pixel class map
results = model("https://ultralytics.com/images/bus.jpg")
# Select the first result and inspect its map dimensions
result = results[0]
class_map = result.semantic_mask.data
print(class_map.shape)
result.save(filename="semantic_scene.jpg")semantic_mask 包含每个图像像素的一个类别 ID。它提供语义感知层,而构建持久的空间地图仍然需要深度、标定、定位和时间融合。可以使用Ultralytics 平台标注工具对自定义像素级数据集进行标注和管理。
实用设计考量#
可靠的语义地图需要一致的类别定义、准确的传感器标定、同步的时间戳和具代表性的训练数据。位姿漂移可能会将正确的标签放到错误的位置,而分割错误可能会将障碍物标记为可通行空间。动态对象还需要过期或跟踪规则,这样停放的车辆或行人就不会永久嵌入地图中。
团队应验证感知精度和空间一致性、测试困难边界和小型结构、尽可能保留预测置信度,并定义如何更新冲突的观测结果。对于安全关键型导航,语义信息应当是对几何障碍物感知和碰撞检查的补充,而不是自动替代。






