Ultralytics YOLO27:
视觉 AI

理解可提示概念分割

探索可提示概念分割、了解它与传统方法的区别,以及 YOLOE-26 等相关模型如何实现开放词汇能力。

ABAbirami Vina10 min read
对图像中的目标进行可提示概念分割

视觉 AI 正在快速发展,并被广泛用于分析真实环境中的图像和视频。例如,从交通管理系统到零售分析等各种应用,都在集成计算机视觉模型

在许多此类应用中,视觉模型(例如目标检测模型)经过训练,可以识别预定义的一组对象,包括车辆、人员和设备。在训练期间,这些模型会看到许多带标签的示例,从而学习每种对象的外观,以及如何将其与场景中的其他对象区分开来。

对于分割任务,模型会更进一步,在这些对象周围生成精确到像素级的轮廓。这样,系统就能准确了解每个对象在图像中的位置。

只要系统只需识别训练过的对象,这种方法就能很好地工作。然而,在真实环境中,情况很少如此。

视觉场景通常是动态的。新的对象和视觉概念会出现,环境条件会发生变化,用户也经常希望分割原始训练设置中未包含的对象。

在分割任务中,这些限制尤其明显。随着视觉 AI 持续发展,人们越来越需要能够适应新概念、而无需反复重新训练的灵活分割模型。这正是可提示概念分割(PCS)日益受到关注的原因。

用户无需依赖固定的对象类别列表,而是可以使用文本、视觉提示或示例图像来描述想要分割的内容。随后,这些模型可以识别并分割所有与所述概念匹配的区域,即使该概念在训练期间并未被明确纳入。

本文将介绍可提示概念分割的工作原理、它与传统方法的区别,以及目前的应用场景。

什么是可提示概念分割?#

在大多数情况下,分割模型经过训练,只能识别一小组对象类型。当视觉 AI 系统只需要检测和分割特定对象集合时,这种方法效果很好。

然而,在真实应用中,视觉场景是动态的。新的对象会出现,任务需求会发生变化,用户也经常需要分割原始标签集未包含的概念。要支持这些情况,通常需要收集新的高质量数据和标注,并重新训练模型,这会增加成本并减慢部署速度。

可提示概念分割通过让用户告诉模型要寻找什么,而不是从固定标签列表中进行选择,解决了这一问题。用户描述自己要寻找的对象或概念,模型则高亮图像中所有匹配的区域。这让用户意图更容易与图像中的实际像素建立联系。

使用概念提示分割图像中的对象

图 1. 使用概念提示进行分割的示例(来源

使用不同类型的提示引导分割#

支持可提示概念分割的模型非常灵活,因为它们可以接受不同类型的输入。换句话说,你可以通过多种方式告诉模型要寻找什么,例如文本描述、视觉提示或示例图像。

下面详细了解每种方法:

  • 文本提示: 可以使用“校车”或“肿瘤区域”等短语描述要分割的概念。模型会理解这些词语的含义,并识别匹配的区域。
  • 视觉提示: 这类提示使用图像中的点、框或粗略草图作为线索。这些线索会引导模型确定查找位置,并帮助其形成最终边界。
  • 图像示例: 参考图像或小范围裁剪图用于表示感兴趣的概念。模型会查找视觉上相似的区域,并根据其外观对这些区域进行分割。

PCS 与传统分割的区别#

在深入了解可提示概念分割的工作原理之前,我们先将它与各种传统对象分割方法进行比较。

PCS 支持开放词汇、提示驱动的模型。它可以处理通过提示描述的新概念,而传统分割无法做到这一点。传统分割方法有多种类型,每种方法都有自己的假设和局限性。

下面简要介绍几种主要的传统分割类型:

  • 语义分割:图像中的每个像素都会被标记为道路、建筑物或人员等类别的一部分。具有相同标签的所有像素会被归为一组,因此模型不会区分单个对象实例。
  • 实例分割:模型会识别并分割单个对象,因此两个人或两辆车会被视为不同的对象。
  • 全景分割:该技术结合语义分割和实例分割,提供场景的完整视图,涵盖背景区域和单个对象。

所有这些方法都依赖预定义的对象类别列表。在这一范围内,它们表现良好,但对范围之外的概念处理得并不好。当需要分割新的特定对象时,通常需要额外的训练数据和模型微调。

PCS 旨在改变这一点。它不再受预定义类别的限制,而是允许你在推理时描述图像中想要分割的内容。

PCS 模型的演进#

接下来,我们来看看分割模型如何逐步发展为可提示概念分割。

标志着分割领域转变的一种热门基础模型是 SAM,即任意分割模型(SAM)。它于 2023 年推出。SAM 不再依赖预定义的对象类别,而是允许用户使用点或边界框等简单的视觉提示来引导分割。

有了 SAM,用户不再需要选择标签,只需指示对象所在的位置,模型就会为其生成掩码。这让分割更加灵活,但用户仍然需要告诉模型在哪里查找。

SAM 2 于 2024 年发布,在这一理念基础上处理更复杂的场景,并将可提示分割扩展到了视频领域。它提升了模型在不同光照条件、对象形状和运动情况下的稳健性,同时仍主要依靠视觉提示来引导分割。

SAM 3 模型是这一演进过程中的最新一步。它于去年发布,是一个将视觉理解与语言引导相结合的统一模型,能够在图像和视频分割任务中保持一致的行为。

有了 SAM 3,用户不再局限于指点或绘制提示,而是可以使用文本描述想要分割的内容,模型会在图像或视频帧中查找与该描述匹配的区域。

分割过程由概念而非固定对象类别引导,从而支持在不同场景和不同时间范围内使用开放词汇。事实上,SAM 3 运行于一个庞大的学习型概念空间之上,该空间以源自 Wikidata 等来源的本体为基础,并通过大规模训练数据不断扩展。

提示 SAM 3 分割单张图像

图 2. 提示 SAM 3 并分割单张图像的示例(来源

与主要依赖几何提示的早期版本相比,SAM 3 朝着更加灵活、概念驱动的分割方向迈进了一步。这使它更适合真实应用,因为其中感兴趣的对象或概念可能会发生变化,并且不一定能预先定义。

探索可提示视觉分割的工作原理#

那么,可提示概念分割是如何工作的呢?它建立在大型预训练视觉模型和视觉语言模型之上。这些模型经过海量图像以及许多配对文本的训练,能够学习一般性的视觉模式和语义含义。

大多数 PCS 模型采用基于 Transformer 的架构,一次处理整张图像,以理解不同区域之间的关系。视觉 Transformer 从图像中提取视觉特征,而文本编码器则将词语转换为模型可以处理的数值表示。

在训练期间,这些模型可以从不同类型的监督信号中学习,包括定义精确对象边界的像素级掩码、粗略定位对象的边界框,以及描述图像中出现内容的图像级标签。使用不同类型的标注数据进行训练,有助于模型同时捕捉细节和更广泛的视觉概念。

在推理时,也就是模型实际用于生成预测时,PCS 会遵循提示驱动的流程。用户通过文本描述、点或框等视觉提示,或示例图像提供引导。模型会将提示和图像编码为共享的内部表示或嵌入,并识别与所述概念相符的区域。

随后,掩码解码器会将这一共享表示转换为精确到像素级的分割掩码。由于模型将视觉特征与语义含义联系起来,即使新概念未被明确纳入训练,它也能对这些概念进行分割。

此外,通常还可以通过调整提示或添加额外引导来优化输出,从而帮助模型处理复杂或模糊的场景。这种迭代过程支持部署期间的实际优化。

可提示概念分割模型通常根据其对此前未见概念的分割能力,以及在不同场景中的稳健表现进行评估。基准测试通常关注掩码质量、泛化能力和计算效率,以反映真实部署需求。

PCS 的实际应用场景#

接下来,我们来看看可提示概念分割已经应用于哪些领域,以及它正在开始产生怎样的实际影响。

用于医学成像的灵活图像分割#

医学成像涉及许多生物结构、疾病和扫描类型,每天都会出现新的病例。传统分割模型难以跟上这种多样性。

PCS 非常适合这一领域,因为它允许临床医生描述想要查找的内容,而不是从简短且固定的列表中进行选择。借助文本短语或视觉提示,PCS 可以直接分割器官或关注区域,而无需针对每项新任务重新训练模型。这让系统更容易应对多样化的临床需求,减少手动绘制掩码的需要,并适用于多种成像类型。

一个很好的例子是 MedSAM-3,它针对医学成像中的文本可提示 PCS 对 SAM 3 架构进行了调整。该模型可以接受明确的解剖学和病理学术语作为提示,例如肝脏或肾脏等器官名称,以及肿瘤或病灶等与病变相关的概念。给定提示后,模型会直接分割医学图像中的对应区域。

MedSAM-3 还集成了多模态大语言模型(MLLMs 或多模态 LLMs),能够同时对文本和图像进行推理。这些模型运行在智能体参与的闭环设置中,通过迭代优化结果,提高对更具挑战性病例的准确性。

用于医学图像文本提示肿瘤分割的 MedSAM-3 流程

图 3. 用于医学图像文本提示肿瘤分割的 MedSAM-3 流程(来源

MedSAM-3 在 X 射线、MRI、CT、超声和视频数据上都表现良好,突显了 PCS 如何在真实临床环境中支持更加灵活高效的医学成像工作流。

用于机器人手术和自动化的自适应分割#

机器人手术依靠视觉系统跟踪工具并理解快速变化的手术场景。器械移动迅速,光照条件各异,新的工具也可能随时出现,这使得预定义标签系统难以维护。

借助 PCS,机器人可以实时跟踪工具、引导摄像头并执行手术步骤。这减少了手动标注,并让系统更容易适应不同的手术流程。外科医生或自动化系统可以使用“抓手”“手术刀”或“摄像头工具”等文本提示,指示图像中应当分割的对象。

机器人手术期间的手术器械分割

图 4. 机器人手术期间所用手术器械的分割(来源

使用 Ultralytics YOLOE-26 进行开放词汇分割#

另一个与可提示概念分割相关的有趣前沿模型是我们的 Ultralytics YOLOE-26。该模型将开放词汇、提示驱动的分割引入 Ultralytics YOLO 模型系列。

YOLOE-26 构建于 Ultralytics YOLO26 架构之上,并支持开放词汇实例分割。YOLOE-26 允许用户通过多种方式引导分割。

它支持文本提示,用户可以通过简短且具有视觉依据的短语指定目标对象;同时也支持视觉提示,根据图像线索提供额外引导。此外,YOLOE-26 还包含无提示模式,用于零样本推理。在该模式下,模型无需用户提示,即可从内置词汇表中检测并分割对象。

YOLOE-26 非常适合视频分析、机器人感知和边缘系统等应用。在这些场景中,对象类别可能发生变化,但低延迟和可靠吞吐量仍然至关重要。它对数据标注和数据集整理也特别有用,因为它可以自动完成部分标注流程,从而简化工作流。

可提示概念分割的优缺点#

以下是使用可提示概念分割的一些主要优势:

  • 更快的迭代和原型开发: 通过修改提示,而不是重新构建数据集或重新训练模型,就能快速测试新的分割任务,从而加快实验和开发速度。
  • 跨领域适应性: 同一个 PCS 模型通常可以应用于医学成像、机器人或视频分析等不同领域,只需对工作流进行极少调整。
  • 交互式优化: 用户可以迭代调整提示或添加引导来改进结果,从而更容易处理模糊场景或边界情况,而无需重新训练。

虽然 PCS 具有明显优势,但也需要考虑以下局限性:

  • 对提示敏感: 提示的措辞或提供方式发生细微变化,都可能影响输出。过于模糊或过于具体的提示可能导致分割不完整或不正确。
  • 行为的可预测性较低: 由于模型会解释提示,而不是从固定标签中进行选择,因此结果在不同场景和输入之间可能有更大差异,这可能会给严格受控的流水线带来问题。
  • 概念解释存在歧义: 某些概念具有主观性或定义较为宽泛,可能导致不同用户之间或不同图像中的分割结果不一致。
  • 对高度特定目标的可靠性有限:基于提示的模型通常不太适合定义狭窄且针对具体实例的任务,例如缺陷检测,因为这类任务要求精确、一致地识别细微特征。

如何在可提示分割与传统分割之间进行选择#

在探索可提示分割时,你可能会想知道它最适合哪些应用,以及何时应选择像 Ultralytics YOLO26 这样的传统计算机视觉模型来解决要处理的问题。可提示分割适用于一般对象,但不适合要求极高精度和一致性的应用场景。

缺陷检测就是一个很好的例子。在制造业中,缺陷通常细小而不明显,例如轻微划痕、凹痕、错位或表面不规则。这些缺陷还可能因材料、光照和生产条件的不同而存在很大差异。

这些问题很难用简单提示进行描述,对于通用模型来说,要可靠地检测它们则更加困难。总体而言,基于提示的模型往往会漏检缺陷或产生不稳定的结果,而针对缺陷数据专门训练的模型在真实检测系统中可靠得多。

要点总结#

可提示概念分割让视觉系统更容易适应真实世界,因为新的对象和概念随时可能出现。用户不再受固定标签限制,只需描述想要分割的内容,剩下的交给模型完成,从而节省时间并减少手动工作。PCS 仍存在局限,但它已经在改变分割技术的实际应用方式,并且很可能会成为未来视觉系统的核心组成部分。

访问我们的 GitHub 仓库并加入我们的社区,进一步探索 AI。查看我们的解决方案页面,了解机器人领域的 AI制造业中的计算机视觉。探索我们的许可选项,立即开始使用视觉 AI!

Explore solutions

用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多

让我们共同构建 AI 的未来!

开启你的机器学习未来之旅