Interactive Segmentation
了解交互式分割如何使用人机回环提示来隔离对象。探索如何使用 Ultralytics YOLO26 和 Ultralytics Platform 来完成任务。
交互式分割是一种高度协作的计算机视觉方法,人类用户可以通过提供连续或单次输入(例如点击、边界框或文本提示)来引导 AI 模型隔离图像中的特定对象。与全自动化方法不同,这种人机协同技术允许用户准确定义需要分割的内容,在处理模糊的视觉数据、重叠对象或未见过的类别时特别有价值。在过去几年中,基础模型的引入显著提高了这一过程的速度和准确性,使其成为数据标注和精密成像的重要工具。
交互式分割的工作原理#
其核心工作流依赖于提示词概念分割,模型通过解释用户的引导来生成像素级的完美遮罩。用户可以在想要选定的前景对象上放置“正向”点击,在想要排除的背景区域上放置“负向”点击。像Segment Anything Model (SAM)及其后续版本Meta SAM 3等先进模型通过接受多种手势类型 [1]、边界框甚至文本描述来进一步推进这一过程,从而定位视觉搜索。模型根据这些提示计算出最佳边界,用户可以通过额外的点击迭代优化遮罩,直到达到所需的准确度。
实际应用#
交互式分割通过融合人类专业知识与 AI 效率,正在改变各行各业的工作流。
- **医学成像:**在医疗保健中的 AI 领域,医生和放射科医生使用交互式工具来隔离 MRI 和 CT 扫描中的肿瘤、病变或特定器官。医学图像空间建模研究 [2] 表明,交互式点击使医疗专业人员能够快速纠正 AI 预测,从而确保患者诊断所需的严格准确性。
- **地理空间和卫星测绘:**城市规划者和环境科学家使用交互式模型来加速GIS 特征提取 [3]。分析师无需手动描绘复杂的海岸线、农业边界或新基础设施,只需点击几下即可立即生成准确的地理多边形。
- **工业缺陷检测:**对于制造业中的 AI,质量控制工程师可以使用交互式提示来突出显示生产线上的微观缺陷,从而动态调整系统以适应新型缺陷,而无需重新训练整个模型。
交互式分割与实例分割的对比#
虽然这两个概念都涉及在像素级别分离对象,但它们服务于不同的操作目的。实例分割通常是一个全自动过程,其中像Ultralytics YOLO26这样的模型在没有用户干预的情况下检测和勾勒预定义的类别(例如“汽车”、“人”、“狗”)。你可以在我们的实例分割指南中了解有关其工作原理的更多信息。
相反,交互式分割不严格依赖于预定义的类别。它是与类别无关的,这意味着它会分割用户指向的任何内容,使其非常适合主动学习管道,在这些管道中,需要使用Ultralytics Platform等工具快速标注新对象并将其添加到自定义数据集中。
使用 Ultralytics 的示例#
你可以使用PyTorch和 ultralytics Python 软件包在自己的项目中轻松实现交互式分割。在本示例中,我们使用FastSAM通过提供边界框提示来分割特定对象。
from ultralytics import FastSAM
# Load a pretrained FastSAM model
model = FastSAM("FastSAM-s.pt")
# Perform interactive segmentation using a bounding box prompt [x1, y1, x2, y2]
results = model("path/to/image.jpg", bboxes=[100, 100, 300, 300])
# Display the segmented result on screen
results[0].show()此代码片段演示了简单的空间提示如何直接引导模型隔离感兴趣的区域,从而以最少的代码简化复杂的图像分割任务。






