理解可提示概念分割
探索可提示概念分割、了解它与传统方法的区别,以及 YOLOE-26 等相关模型如何实现开放词汇能力。

视觉 AI 正在快速发展,并被广泛用于分析真实环境中的图像和视频。例如,从交通管理系统到零售分析等各种应用,都在集成计算机视觉模型。
在许多此类应用中,视觉模型(例如目标检测模型)经过训练,可以识别预定义的一组对象,包括车辆、人员和设备。在训练期间,这些模型会看到许多带标签的示例,从而学习每种对象的外观,以及如何将其与场景中的其他对象区分开来。
对于分割任务,模型会更进一步,在这些对象周围生成精确到像素级的轮廓。这样,系统就能准确了解每个对象在图像中的位置。
只要系统只需识别训练过的对象,这种方法就能很好地工作。然而,在真实环境中,情况很少如此。
视觉场景通常是动态的。新的对象和视觉概念会出现,环境条件会发生变化,用户也经常希望分割原始训练设置中未包含的对象。
在分割任务中,这些限制尤其明显。随着视觉 AI 持续发展,人们越来越需要能够适应新概念、而无需反复重新训练的灵活分割模型。这正是可提示概念分割(PCS)日益受到关注的原因。
用户无需依赖固定的对象类别列表,而是可以使用文本、视觉提示或示例图像来描述想要分割的内容。随后,这些模型可以识别并分割所有与所述概念匹配的区域,即使该概念在训练期间并未被明确纳入。
本文将介绍可提示概念分割的工作原理、它与传统方法的区别,以及目前的应用场景。
什么是可提示概念分割?#
在大多数情况下,分割模型经过训练,只能识别一小组对象类型。当视觉 AI 系统只需要检测和分割特定对象集合时,这种方法效果很好。
然而,在真实应用中,视觉场景是动态的。新的对象会出现,任务需求会发生变化,用户也经常需要分割原始标签集未包含的概念。要支持这些情况,通常需要收集新的高质量数据和标注,并重新训练模型,这会增加成本并减慢部署速度。
可提示概念分割通过让用户告诉模型要寻找什么,而不是从固定标签列表中进行选择,解决了这一问题。用户描述自己要寻找的对象或概念,模型则高亮图像中所有匹配的区域。这让用户意图更容易与图像中的实际像素建立联系。

图 1. 使用概念提示进行分割的示例(来源)
使用不同类型的提示引导分割#
支持可提示概念分割的模型非常灵活,因为它们可以接受不同类型的输入。换句话说,你可以通过多种方式告诉模型要寻找什么,例如文本描述、视觉提示或示例图像。
下面详细了解每种方法:
- 文本提示: 可以使用“校车”或“肿瘤区域”等短语描述要分割的概念。模型会理解这些词语的含义,并识别匹配的区域。
- 视觉提示: 这类提示使用图像中的点、框或粗略草图作为线索。这些线索会引导模型确定查找位置,并帮助其形成最终边界。
- 图像示例: 参考图像或小范围裁剪图用于表示感兴趣的概念。模型会查找视觉上相似的区域,并根据其外观对这些区域进行分割。
PCS 与传统分割的区别#
在深入了解可提示概念分割的工作原理之前,我们先将它与各种传统对象分割方法进行比较。
PCS 支持开放词汇、提示驱动的模型。它可以处理通过提示描述的新概念,而传统分割无法做到这一点。传统分割方法有多种类型,每种方法都有自己的假设和局限性。
下面简要介绍几种主要的传统分割类型:
- 语义分割:图像中的每个像素都会被标记为道路、建筑物或人员等类别的一部分。具有相同标签的所有像素会被归为一组,因此模型不会区分单个对象实例。
- 实例分割:模型会识别并分割单个对象,因此两个人或两辆车会被视为不同的对象。
- 全景分割:该技术结合语义分割和实例分割,提供场景的完整视图,涵盖背景区域和单个对象。
所有这些方法都依赖预定义的对象类别列表。在这一范围内,它们表现良好,但对范围之外的概念处理得并不好。当需要分割新的特定对象时,通常需要额外的训练数据和模型微调。
PCS 旨在改变这一点。它不再受预定义类别的限制,而是允许你在推理时描述图像中想要分割的内容。
PCS 模型的演进#
接下来,我们来看看分割模型如何逐步发展为可提示概念分割。
标志着分割领域转变的一种热门基础模型是 SAM,即任意分割模型(SAM)。它于 2023 年推出。SAM 不再依赖预定义的对象类别,而是允许用户使用点或边界框等简单的视觉提示来引导分割。
有了 SAM,用户不再需要选择标签,只需指示对象所在的位置,模型就会为其生成掩码。这让分割更加灵活,但用户仍然需要告诉模型在哪里查找。
SAM 2 于 2024 年发布,在这一理念基础上处理更复杂的场景,并将可提示分割扩展到了视频领域。它提升了模型在不同光照条件、对象形状和运动情况下的稳健性,同时仍主要依靠视觉提示来引导分割。
SAM 3 模型是这一演进过程中的最新一步。它于去年发布,是一个将视觉理解与语言引导相结合的统一模型,能够在图像和视频分割任务中保持一致的行为。
有了 SAM 3,用户不再局限于指点或绘制提示,而是可以使用文本描述想要分割的内容,模型会在图像或视频帧中查找与该描述匹配的区域。
分割过程由概念而非固定对象类别引导,从而支持在不同场景和不同时间范围内使用开放词汇。事实上,SAM 3 运行于一个庞大的学习型概念空间之上,该空间以源自 Wikidata 等来源的本体为基础,并通过大规模训练数据不断扩展。

图 2. 提示 SAM 3 并分割单张图像的示例(来源)
与主要依赖几何提示的早期版本相比,SAM 3 朝着更加灵活、概念驱动的分割方向迈进了一步。这使它更适合真实应用,因为其中感兴趣的对象或概念可能会发生变化,并且不一定能预先定义。
探索可提示视觉分割的工作原理#
那么,可提示概念分割是如何工作的呢?它建立在大型预训练视觉模型和视觉语言模型之上。这些模型经过海量图像以及许多配对文本的训练,能够学习一般性的视觉模式和语义含义。
大多数 PCS 模型采用基于 Transformer 的架构,一次处理整张图像,以理解不同区域之间的关系。视觉 Transformer 从图像中提取视觉特征,而文本编码器则将词语转换为模型可以处理的数值表示。
在训练期间,这些模型可以从不同类型的监督信号中学习,包括定义精确对象边界的像素级掩码、粗略定位对象的边界框,以及描述图像中出现内容的图像级标签。使用不同类型的标注数据进行训练,有助于模型同时捕捉细节和更广泛的视觉概念。
在推理时,也就是模型实际用于生成预测时,PCS 会遵循提示驱动的流程。用户通过文本描述、点或框等视觉提示,或示例图像提供引导。模型会将提示和图像编码为共享的内部表示或嵌入,并识别与所述概念相符的区域。
随后,掩码解码器会将这一共享表示转换为精确到像素级的分割掩码。由于模型将视觉特征与语义含义联系起来,即使新概念未被明确纳入训练,它也能对这些概念进行分割。
此外,通常还可以通过调整提示或添加额外引导来优化输出,从而帮助模型处理复杂或模糊的场景。这种迭代过程支持部署期间的实际优化。
可提示概念分割模型通常根据其对此前未见概念的分割能力,以及在不同场景中的稳健表现进行评估。基准测试通常关注掩码质量、泛化能力和计算效率,以反映真实部署需求。
PCS 的实际应用场景#
接下来,我们来看看可提示概念分割已经应用于哪些领域,以及它正在开始产生怎样的实际影响。
用于医学成像的灵活图像分割#
医学成像涉及许多生物结构、疾病和扫描类型,每天都会出现新的病例。传统分割模型难以跟上这种多样性。
PCS 非常适合这一领域,因为它允许临床医生描述想要查找的内容,而不是从简短且固定的列表中进行选择。借助文本短语或视觉提示,PCS 可以直接分割器官或关注区域,而无需针对每项新任务重新训练模型。这让系统更容易应对多样化的临床需求,减少手动绘制掩码的需要,并适用于多种成像类型。
一个很好的例子是 MedSAM-3,它针对医学成像中的文本可提示 PCS 对 SAM 3 架构进行了调整。该模型可以接受明确的解剖学和病理学术语作为提示,例如肝脏或肾脏等器官名称,以及肿瘤或病灶等与病变相关的概念。给定提示后,模型会直接分割医学图像中的对应区域。
MedSAM-3 还集成了多模态大语言模型(MLLMs 或多模态 LLMs),能够同时对文本和图像进行推理。这些模型运行在智能体参与的闭环设置中,通过迭代优化结果,提高对更具挑战性病例的准确性。

图 3. 用于医学图像文本提示肿瘤分割的 MedSAM-3 流程(来源)
MedSAM-3 在 X 射线、MRI、CT、超声和视频数据上都表现良好,突显了 PCS 如何在真实临床环境中支持更加灵活高效的医学成像工作流。
用于机器人手术和自动化的自适应分割#
机器人手术依靠视觉系统跟踪工具并理解快速变化的手术场景。器械移动迅速,光照条件各异,新的工具也可能随时出现,这使得预定义标签系统难以维护。
借助 PCS,机器人可以实时跟踪工具、引导摄像头并执行手术步骤。这减少了手动标注,并让系统更容易适应不同的手术流程。外科医生或自动化系统可以使用“抓手”“手术刀”或“摄像头工具”等文本提示,指示图像中应当分割的对象。

图 4. 机器人手术期间所用手术器械的分割(来源)
使用 Ultralytics YOLOE-26 进行开放词汇分割#
另一个与可提示概念分割相关的有趣前沿模型是我们的 Ultralytics YOLOE-26。该模型将开放词汇、提示驱动的分割引入 Ultralytics YOLO 模型系列。
YOLOE-26 构建于 Ultralytics YOLO26 架构之上,并支持开放词汇实例分割。YOLOE-26 允许用户通过多种方式引导分割。
它支持文本提示,用户可以通过简短且具有视觉依据的短语指定目标对象;同时也支持视觉提示,根据图像线索提供额外引导。此外,YOLOE-26 还包含无提示模式,用于零样本推理。在该模式下,模型无需用户提示,即可从内置词汇表中检测并分割对象。
YOLOE-26 非常适合视频分析、机器人感知和边缘系统等应用。在这些场景中,对象类别可能发生变化,但低延迟和可靠吞吐量仍然至关重要。它对数据标注和数据集整理也特别有用,因为它可以自动完成部分标注流程,从而简化工作流。
可提示概念分割的优缺点#
以下是使用可提示概念分割的一些主要优势:
- 更快的迭代和原型开发: 通过修改提示,而不是重新构建数据集或重新训练模型,就能快速测试新的分割任务,从而加快实验和开发速度。
- 跨领域适应性: 同一个 PCS 模型通常可以应用于医学成像、机器人或视频分析等不同领域,只需对工作流进行极少调整。
- 交互式优化: 用户可以迭代调整提示或添加引导来改进结果,从而更容易处理模糊场景或边界情况,而无需重新训练。
虽然 PCS 具有明显优势,但也需要考虑以下局限性:
- 对提示敏感: 提示的措辞或提供方式发生细微变化,都可能影响输出。过于模糊或过于具体的提示可能导致分割不完整或不正确。
- 行为的可预测性较低: 由于模型会解释提示,而不是从固定标签中进行选择,因此结果在不同场景和输入之间可能有更大差异,这可能会给严格受控的流水线带来问题。
- 概念解释存在歧义: 某些概念具有主观性或定义较为宽泛,可能导致不同用户之间或不同图像中的分割结果不一致。
- 对高度特定目标的可靠性有限:基于提示的模型通常不太适合定义狭窄且针对具体实例的任务,例如缺陷检测,因为这类任务要求精确、一致地识别细微特征。
如何在可提示分割与传统分割之间进行选择#
在探索可提示分割时,你可能会想知道它最适合哪些应用,以及何时应选择像 Ultralytics YOLO26 这样的传统计算机视觉模型来解决要处理的问题。可提示分割适用于一般对象,但不适合要求极高精度和一致性的应用场景。
缺陷检测就是一个很好的例子。在制造业中,缺陷通常细小而不明显,例如轻微划痕、凹痕、错位或表面不规则。这些缺陷还可能因材料、光照和生产条件的不同而存在很大差异。
这些问题很难用简单提示进行描述,对于通用模型来说,要可靠地检测它们则更加困难。总体而言,基于提示的模型往往会漏检缺陷或产生不稳定的结果,而针对缺陷数据专门训练的模型在真实检测系统中可靠得多。
要点总结#
可提示概念分割让视觉系统更容易适应真实世界,因为新的对象和概念随时可能出现。用户不再受固定标签限制,只需描述想要分割的内容,剩下的交给模型完成,从而节省时间并减少手动工作。PCS 仍存在局限,但它已经在改变分割技术的实际应用方式,并且很可能会成为未来视觉系统的核心组成部分。
访问我们的 GitHub 仓库并加入我们的社区,进一步探索 AI。查看我们的解决方案页面,了解机器人领域的 AI和制造业中的计算机视觉。探索我们的许可选项,立即开始使用视觉 AI!









