Ultralytics YOLO27:
返回 Ultralytics 术语表

Visual Prompting

探索视觉提示如何通过点和框引导 AI 模型。了解 Ultralytics YOLO 和 SAM 如何实现精确分割并加快数据标注。

视觉提示是一种新兴的计算机视觉技术,用户通过提供空间或视觉线索(例如点、边界框或涂鸦)来引导 AI 模型将注意力集中在图像中的特定对象或区域。与主要依赖文本描述的传统提示工程不同,视觉提示能够让用户与人工智能 (AI)系统进行更精确、更直观的交互。该方法利用现代基础模型的能力执行分割和检测等任务,而无需大量重新训练或大型标注数据集。通过有效地“指向”重要内容,用户可以即时将通用模型适配到新任务,从而弥合人类意图与机器感知之间的差距。

视觉提示的机制#

从本质上讲,视觉提示通过将空间信息直接注入模型的处理流水线来工作。当用户点击对象或绘制框时,这些输入会被转换为基于坐标的嵌入,神经网络会将其与图像特征整合。这一过程是任意分割模型 (SAM)等交互式架构的核心,在这些架构中,模型会根据几何提示预测掩码。

视觉提示的灵活性支持多种交互类型:

  • 点提示: 用户点击特定像素以指示感兴趣的对象。随后,模型会将此选择扩展到整个对象边界。
  • 框提示: 绘制一个边界框可提供粗略定位,向模型指示对该区域内的所有内容进行分割或分类。
  • 涂鸦提示: 在对象上绘制的手绘线条有助于消除复杂场景中的歧义,例如对象相互重叠或具有相似纹理时。

CVPR 2024上发表的最新研究表明,视觉提示显著减少了数据标注所需的时间,因为人工标注员可以通过简单点击实时修正模型预测,而不必手动描摹多边形。

视觉提示与文本提示#

虽然这两种技术都旨在引导模型行为,但区分视觉提示与基于文本的方法非常重要。文生图生成或零样本检测依赖自然语言处理 (NLP)来理解语义描述(例如“找到红色汽车”)。然而,语言在描述精确空间位置或抽象形状时可能存在歧义或信息不足。

视觉提示通过将指令锚定在像素空间本身来消除这种歧义。例如,在医学图像分析中,放射科医生点击可疑结节,比尝试通过文本描述其精确坐标和不规则形状要准确得多。通常,最强大的工作流会结合两种方法——使用文本进行语义筛选,使用视觉提示实现空间精度——这一概念称为多模态学习

实际应用#

视觉提示的适应性推动了其在各个行业中的快速应用:

  • 交互式医学诊断: 医生使用视觉提示工具在 MRI 扫描中分离肿瘤或器官。只需点击感兴趣区域,他们就能即时生成 3D 体积测量结果,从而辅助精确的肿瘤检测和手术规划。
  • 智能照片编辑: 在 Adobe Photoshop 等消费级软件或移动应用中,视觉提示为“魔术选择”工具提供支持。用户可以点击人物或对象来移除背景或应用定向滤镜,利用底层的实例分割技术,而无需掌握手动创建蒙版的技能。
  • 机器人操作:机器人领域的人工智能中,机器人可以通过视觉界面接收指令来拾取特定物品。操作员点击机器人摄像头画面中的对象,提供视觉提示,机器人则将其转换为抓取坐标,从而促进仓库中的人在回路自动化。

使用 Ultralytics 实现#

Ultralytics 生态系统支持视觉提示工作流,尤其是通过 FastSAM 和 SAM 等模型。这些模型允许开发者以编程方式传入点或框坐标,以获取分割掩码。

以下示例演示如何使用 ultralytics 包对图像应用点提示,指示模型分割位于特定坐标处的对象。

from ultralytics import SAM

# Load the Segment Anything Model (SAM)
model = SAM("sam2.1_b.pt")

# Apply a visual point prompt to the image
# The 'points' argument accepts [x, y] coordinates
# labels: 1 indicates a foreground point (include), 0 indicates background
results = model("https://ultralytics.com/images/bus.jpg", points=[[300, 350]], labels=[1])

# Display the segmented result
results[0].show()

提升模型敏捷性#

视觉提示代表了向“可提示”计算机视觉的转变,在这种模式下,模型不再是静态的“黑盒”,而是交互式工具。这种能力对于主动学习循环至关重要,模型可以通过整合用户反馈快速改进。

对于希望将这些能力集成到生产环境中的开发者,Ultralytics Platform提供了用于管理数据集和部署能够处理动态输入的模型的工具。随着研究不断推进,我们预计视觉提示与大型语言模型 (LLMs)之间将实现更紧密的集成,使系统能够像处理文本一样流畅地理解视觉输入并进行推理。

Explore solutions

用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多

让我们共同构建 AI 的未来!

开启你的机器学习未来之旅