Interactive Segmentation
了解交互式分割如何使用人在环提示来分离对象。了解如何将 Ultralytics YOLO26 和 Ultralytics Platform 用于相关任务。
交互式分割是一种高度协作的计算机视觉方法,人工用户通过连续输入或单次输入(例如点击、边界框或文本提示)来引导 AI 模型分离图像中的特定对象。与完全自动化的方法不同,这种人在回路中的技术允许用户准确界定需要分割的内容,因此在处理含义模糊的视觉数据、重叠对象或未见类别时尤其有价值。过去几年中,基础模型的引入大幅提升了这一过程的速度和准确性,使其成为数据标注和精密成像的重要工具。
交互式分割的工作原理#
从本质上看,该工作流依赖于可提示概念分割,模型会解读用户指导并生成像素级精确的掩码。用户可以在想要选择的前景对象上点击“正向”点,也可以在想要排除的背景区域上点击“负向”点。诸如任意分割模型(SAM)及其后续模型Meta SAM 3等高级模型更进一步,能够接受多种手势类型 [1]、边界框,甚至文本描述,从而定位视觉搜索目标。模型会根据这些提示计算最佳边界,用户则可以通过额外点击反复优化掩码,直到达到所需的准确度。
实际应用#
交互式分割将人类专业知识与 AI 效率相结合,正在改变众多行业的工作流。
- **医学成像:**在医疗领域的 AI中,医生和放射科医师使用交互式工具在 MRI 和 CT 扫描中分离肿瘤、病灶或特定器官。关于医学图像空间建模的研究 [2] 表明,交互式点击可以让医疗专业人员快速修正 AI 预测,确保患者诊断所需的严格精度。
- **地理空间与卫星制图:**城市规划师和环境科学家使用交互式模型加速GIS 特征提取 [3]。无需手动描绘复杂的海岸线、农业边界或新建基础设施,分析人员只需进行几次有策略的点击,即可立即生成准确的地理多边形。
- **工业缺陷检测:**对于制造业中的 AI,质量控制工程师可以使用交互式提示突出生产线上的微小缺陷,并动态适应新的缺陷类型,而无需重新训练整个模型。
交互式分割与实例分割#
虽然这两个概念都涉及在像素级别分离对象,但它们服务于不同的操作目的。实例分割通常是一个完全自动化的过程,模型(例如Ultralytics YOLO26)无需用户干预即可检测并勾勒预定义类别(例如“汽车”“人”“狗”)。你可以在我们的实例分割指南中进一步了解其工作原理。
相比之下,交互式分割并不严格依赖预定义类别。它与类别无关,也就是说,它会分割用户所指向的任何对象,因此非常适合主动学习流水线,在这类流水线中,可以快速标注新对象,并使用Ultralytics Platform等工具将其添加到自定义数据集中。
使用 Ultralytics 的示例#
你可以使用PyTorch和 ultralytics Python 包,在自己的项目中轻松实现交互式分割。在此示例中,我们通过提供边界框提示,使用FastSAM分割特定对象。
from ultralytics import FastSAM
# Load a pretrained FastSAM model
model = FastSAM("FastSAM-s.pt")
# Perform interactive segmentation using a bounding box prompt [x1, y1, x2, y2]
results = model("path/to/image.jpg", bboxes=[100, 100, 300, 300])
# Display the segmented result on screen
results[0].show()此代码片段演示了简单的空间提示如何直接引导模型分离感兴趣区域,并以最少的代码简化复杂的图像分割任务。









