Panoptic Segmentation
探索全景分割,统一语义分割和实例分割。了解 Ultralytics YOLO26 如何为 AI 项目提供精准的场景理解。
全景分割是一项综合性的计算机视觉(CV)任务,将两种不同的图像分析形式统一起来:语义分割和实例分割。传统方法通常将这些任务分开处理——要么泛化地对“天空”或“草地”等背景区域进行分类,要么检测“汽车”或“人”等特定对象——而全景分割则将它们整合到一个统一的框架中。这种方法为图像中的每个像素分配唯一值,从而实现完整的场景理解,并区分可计数的对象(称为“things”)和无定形的背景区域(称为“stuff”)。通过确保每个像素都得到处理和分类,这项技术比孤立的检测方法更接近人类的视觉感知方式。
核心概念:Stuff 与 Things#
要充分理解全景分割,了解它所处理的视觉信息二分法会很有帮助。该任务将视觉世界分为两个主要类别:
- Stuff 类别: 这些类别表示具有相似纹理或材质、无法计数的无定形区域。例如道路、水、草地、天空和墙壁。在全景分析中,所有属于“道路”的像素都会被归入同一个语义区域,因为区分“道路片段 A”和“道路片段 B”通常并不重要。
- Things 类别: 这些类别表示具有明确几何形状和边界的可计数对象。例如行人、车辆、动物和工具。全景模型必须将每个“thing”识别为唯一实体,确保并排站立的两个人被识别为两个独立实例(例如“人物 A”和“人物 B”),而不是合并成一个区域。
这种区分对于先进的人工智能(AI)系统至关重要,使系统能够在与特定对象交互的同时导航周围环境。
全景架构的工作原理#
现代全景分割架构通常采用强大的深度学习(DL)骨干网络,例如卷积神经网络(CNN)或视觉 Transformer(ViT),从图像中提取丰富的特征表示。该网络通常分为两个分支或“头”:
-
语义头: 此分支为每个像素预测一个类别标签,生成场景中“stuff”的密集映射。
-
实例头: 与此同时,此分支使用类似于目标检测的技术来定位“things”并为其生成掩码。
随后,融合模块或后处理步骤会解决这些输出之间的冲突——例如判断某个像素属于“人物”实例,还是属于其身后的“背景”墙壁——从而生成最终不重叠的全景分割图。
实际应用#
全景分割的整体性使其成为安全性和上下文至关重要的行业中不可或缺的技术。
- 自动驾驶车辆: 自动驾驶汽车依靠全景感知实现安全导航。语义组件负责识别可行驶表面(道路)和边界(人行道),而实例组件则跟踪行人和其他车辆等动态障碍物。这种统一的视图有助于车辆规划算法在复杂的交通管理场景中做出更安全的决策。
- 医学图像分析: 在数字病理学中,分析组织样本通常需要对整体组织结构(stuff)进行分割,同时对特定细胞类型或肿瘤(things)进行计数和测量。这种详细的分析有助于医生准确量化疾病并进行诊断。
- 机器人技术: 在家庭或仓库等非结构化环境中运行的服务机器人,需要区分可供其行走的地面(背景)与需要操作或避开的对象(实例)。
使用 Ultralytics 实现分割#
虽然完整的全景训练可能较为复杂,但开发者可以使用Ultralytics YOLO26实现高精度的实例分割,这是全景分割这一复杂任务的关键组成部分。这款先进模型可提供实时性能,并针对边缘部署进行了优化。
以下 Python 示例演示了如何加载预训练的分割模型并运行推理,以分离不同的对象:
from ultralytics import YOLO
# Load the YOLO26 segmentation model
model = YOLO("yolo26n-seg.pt")
# Run inference on an image to segment individual instances
# The model identifies 'things' and generates pixel-perfect masks
results = model("https://ultralytics.com/images/bus.jpg")
# Display the resulting image with overlaid segmentation masks
results[0].show()对于希望管理训练数据并自动化标注流程的团队,Ultralytics Platform提供了一套用于数据集管理和模型训练的工具。高质量的数据标注对于分割任务至关重要,因为模型需要精确到像素级的标签才能有效学习。
区分相关术语#
了解不同分割类型之间的细微差异,对于为项目选择合适的模型至关重要:
- 语义分割: 仅关注将像素分类到不同类别中。它回答的是“这个像素属于什么类别?”(例如树、天空),但无法区分同一类别中的独立对象。如果两辆汽车发生重叠,它们会显示为一个大的“汽车”区域。
- 实例分割: 仅关注检测和掩码处理可计数的对象。它回答的是“这是哪个对象?”,但通常会完全忽略背景上下文。
- 全景分割: 将两者结合起来。它会针对整幅图像回答“这个像素是什么?”以及“它属于哪个对象实例?”,确保没有任何像素未被分类。
如需进一步了解这些任务所使用的数据集格式,可以查看COCO 数据集文档。COCO 是衡量分割性能的标准基准。









