Semantic Segmentation
探索用于像素级图像理解的语义分割。立即了解如何使用 Ultralytics YOLO26 训练和部署精准的分割模型。
语义分割是一项计算机视觉任务,通过为每个单独的像素分配特定的类别标签,将图像划分为不同区域。与更简单的任务不同,例如将单个标签分配给整张图像的图像分类,或在对象周围绘制边界框的目标检测,语义分割能够在像素级别理解场景。这种细粒度分析对于对象的精确形状和边界与其身份同等重要的应用至关重要。它让机器能够以更接近人类的方式“看见”世界,分辨出道路、行人或医学扫描中的肿瘤所对应的确切像素。
语义分割的工作原理#
从本质上说,语义分割将图像视为由需要分类的像素组成的网格。深度学习模型,尤其是卷积神经网络(CNNs),是执行此任务的标准架构。典型的架构(例如广泛使用的U-Net)采用编码器-解码器结构。编码器压缩输入图像以提取高层特征(如纹理和形状),而解码器则将这些特征上采样回原始图像分辨率,以生成精确的分割掩码。
为实现这一目标,模型需要在大型标注数据集上进行训练,由人工标注者根据类别为每个像素仔细着色。Ultralytics Platform 等工具提供自动标注功能,加快高质量真实值数据的创建,从而简化了这一过程。训练完成后,模型会输出一个掩码,其中每个像素值都对应一个类别 ID,从而有效地为图像“赋予”含义。
区分相关概念#
人们经常将语义分割与其他像素级任务混淆。了解它们之间的差异是为项目选择正确方法的关键:
- **实例分割:**语义分割会将同一类别的所有对象视为一个整体(例如,所有“汽车”都被着色为蓝色),而实例分割则会区分不同的对象(例如,“汽车 A”为蓝色,“汽车 B”为红色)。
- **全景分割:**它结合了这两种概念。它为每个像素分配类别(语义分割),同时分离可计数对象的各个实例(实例分割),从而提供最全面的场景理解。
实际应用#
以像素级精度解析视觉数据的能力推动着众多高风险行业的创新:
- **汽车领域的 AI:**自动驾驶汽车高度依赖分割来实现安全导航。通过识别与人行道相对的可行驶区域,并精确勾勒出行人、汽车和障碍物的轮廓,自动驾驶系统可以实时做出关键决策。
- **医疗领域的 AI:**在医学成像中,模型会从 CT 扫描和 MRI 中分割出器官、病变或肿瘤。这有助于放射科医生计算肿瘤体积以制定治疗计划,或以极高的精度引导机器人手术工具。
- **农业领域的 AI:**农民利用无人机航拍图像和分割技术监测作物健康状况。通过将像素分类为“健康作物”“杂草”或“土壤”,自动化系统可以针对性地喷洒除草剂,减少化学品用量并优化产量。
使用 Ultralytics 实现分割#
现代分割模型需要在精度与速度之间取得平衡,尤其是在边缘设备上进行实时推理时。Ultralytics YOLO26 模型系列包含专用的分割模型(使用 -seg 后缀标识),这些模型原生支持端到端处理,相较于 YOLO11 等较旧架构,性能更出色。
以下示例演示了如何使用 ultralytics Python 包对图像执行分割。该过程会生成用于勾勒对象边界的二值掩码。
from ultralytics import YOLO
# Load a pre-trained YOLO26 segmentation model
model = YOLO("yolo26n-seg.pt")
# Run inference on an image
results = model("https://ultralytics.com/images/bus.jpg")
# Visualize the results
# This will display the image with the segmentation masks overlaid
results[0].show()挑战与未来方向#
尽管取得了显著进展,语义分割的计算成本仍然很高。为每个像素生成分类结果需要大量的GPU 资源和内存。研究人员正在积极优化这些模型的效率,并探索模型量化等技术,以便在手机和嵌入式设备上运行大型网络。
此外,对海量标注数据集的需求仍是一个瓶颈。为解决这一问题,行业正转向生成合成数据和采用自监督学习,让模型能够从原始图像中学习,而无需数百万个人工像素标签。随着这些技术日趋成熟,我们可以预期分割技术将在智能相机、机器人和增强现实应用中得到更加广泛的应用。









