YOLO Vision 2026:
返回 Ultralytics 词汇表

Grounding

探索 AI 中基础 (Grounding) 的概念。了解如何使用 Ultralytics YOLO26 和 YOLO-World 将自然语言与视觉数据连接,以实现开放词汇检测。

Grounding(基础化/定位)是指人工智能系统将通常源自自然语言的抽象概念连接到物理世界中具体、实物表示(如视觉数据或感官输入)的能力。在计算机视觉的语境下,这意味着模型不只是处理文本;它还能解析诸如“遛狗的人”这样的短语,并精确地在图像或视频流中定位这些实体。这一过程架起了符号推理与像素级感知之间的桥梁,解决了认知科学中的根本symbol grounding problem。通过将语言标记与视觉特征联系起来,grounding 成为现代multimodal AI的基石,使机器能够更直观地与动态的人类环境进行交互。

Grounding 的机制#

在技术层面上,grounding 涉及将来自不同模态的数据对齐到一个共享的高维向量空间中。先进的架构(通常构建于用于natural language processing (NLP)Transformer框架之上)会为文本描述和视觉输入生成被称为embeddings的数值表示。在训练期间,模型会学习最小化文本提示(例如“蓝色双肩包”)的 embedding 与对应视觉区域的 embedding 之间的距离。

这种对齐支持了开放词汇检测(Open-Vocabulary Detection)。与模型仅限于固定类别集的传统监督学习不同,grounding 能够实现zero-shot learning。只要模型理解描述它们的语言,它就能识别出在训练期间从未显式见过的内容。这种灵活性得到了诸如 PyTorch 等深度学习框架的支持,这些框架促进了这些多模态对齐所需的复杂矩阵运算。

实际应用#

Grounding 技术通过允许系统有效解读用户意图并导航非结构化环境,正在重塑各个行业。

  • AI in Robotics 对于执行口头指令的自主智能体而言,grounding 至关重要。如果仓库机器人被告知“拿起顶层货架上的包裹”,它必须将“包裹”和“顶层货架”这些概念对应到其视野中的特定 3D 坐标。这一能力是 robotics research at MIT CSAIL 的主要研究方向,使机器人能够安全地与人类协同作业。
  • Semantic Search 与媒体检索: Grounding 驱动了超越关键词匹配的高级搜索引擎。用户可以用复杂的描述(例如“日落时分左转的骑自行车者”)来查询视频档案,系统则通过 grounding 来检索特定的时间戳。这显著增强了用于安全和媒体管理的video understanding
  • 辅助技术(Assistive Technology): 对于视障用户,grounding 依靠与语音生成相连的强大image recognition,使应用程序能够实时描述周围环境或回答关于环境的问题。

使用 Ultralytics YOLO-World 进行 Grounding#

Ultralytics 生态系统通过像 YOLO-World 这样的专门架构支持 Grounding。虽然标准模型需要基于特定数据集进行训练,但 YOLO-World 允许用户使用文本提示即时定义自定义检测类别。这有效地将自然语言输入“Grounding”到了图像上,而无需重新训练。

以下示例演示了如何使用 ultralytics 包根据自定义文本描述来检测对象:

from ultralytics import YOLO

# Load a pre-trained YOLO-World model for open-vocabulary detection
model = YOLO("yolov8s-world.pt")

# Define custom text prompts (classes) to ground in the image
# The model maps these descriptions to visual features
model.set_classes(["person wearing hat", "blue backpack"])

# Run prediction on an image source to localize the described objects
results = model.predict("https://ultralytics.com/images/bus.jpg")

# Display the results
results[0].show()

区分 Grounding 与相关概念#

为了充分理解 Grounding 的实用性,将其与类似的计算机视觉任务区分开来是很有帮助的:

  • 对比Object Detection 传统的检测模型(例如最先进的 YOLO26)从封闭的预定义类别集(例如 COCO 中的 80 个类别)中识别对象。而 grounding 是开放式的,它根据自由格式的文本来识别对象。
  • 对比Image Captioning 图像描述生成针对整张图片的描述性句子(图片 $\to$ 文本)。而 grounding 通常以相反的方向或双向运行,根据文本输入定位特定的视觉元素(文本 $\to$ 图片区域)。
  • 对比Visual Question Answering (VQA) VQA 涉及回答关于图片的特定问题(例如“这辆车是什么颜色的?”)。Grounding 则专门聚焦于定位步骤——在提及的对象周围绘制bounding box

挑战与未来展望#

尽管取得了进展,grounding 仍然是计算密集型的。将庞大的语言模型与视觉编码器对齐需要大量的GPU resources和高效的内存管理,这也是像 NVIDIA 这样的硬件创新者经常解决的一项挑战。此外,模型可能会受困于语言的歧义性,因此需要庞大的context windows来解析“bat”一词是指运动器材还是指动物。

未来的发展正朝着天生具备多模态特性的统一基础模型迈进。诸如 Ultralytics Platform 之类的工具正在不断演进,以帮助开发者管理这些任务所需的复杂数据集,并为data annotation和模型部署提供简化的工作流。随着这些技术的成熟,我们可以期待 grounding 无缝集成到边缘设备中,从而实现更智能、更具响应能力的 AI 应用。

Explore solutions

Real-time AI that works with your team

机器人技术中的 AI

使用 Ultralytics YOLO 模型为智能机器赋能。机器人技术中的视觉 AI 可推动自主导航、感知、物体跟踪和实时控制。
了解更多
Real-time AI that works with your team

物流中的 AI

使用 Ultralytics YOLO 模型简化物流。视觉 AI 可实现包裹检查、分拣、车辆跟踪和实时仓库安全监控。
了解更多
Real-time AI that works with your team

零售业 AI

使用 Ultralytics YOLO 模型重塑零售业。视觉 AI 推动库存跟踪、货架监控、队列管理和更智能的客户洞察。
了解更多
Real-time AI that works with your team

医疗保健中的 AI

利用 Ultralytics YOLO 模型构建医疗保健解决方案。医疗保健中的视觉 AI 可助力更快速的医学影像分析、更智能的诊断和患者监测。
了解更多
Real-time AI that works with your team

制造业中的 AI

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 推动质量控制、缺陷检测、PPE 合规性和装配线自动化。
了解更多
Real-time AI that works with your operation

汽车中的 AI

将计算机视觉应用于汽车行业,并配合 Ultralytics YOLO 模型。汽车视觉 AI 可提升道路安全、辅助驾驶和车辆自动化,打造更智能的道路。
了解更多
Real-time AI tailored to your operation

农业中的 AI

借助 Ultralytics YOLO 模型,将视觉 AI 引入智慧农业。赋能作物监测、牲畜追踪和精准农业,实现更高、更智能的产量。
了解更多
Real-time AI that works with your team

机器人技术中的 AI

使用 Ultralytics YOLO 模型为智能机器赋能。机器人技术中的视觉 AI 可推动自主导航、感知、物体跟踪和实时控制。
了解更多
Real-time AI that works with your team

物流中的 AI

使用 Ultralytics YOLO 模型简化物流。视觉 AI 可实现包裹检查、分拣、车辆跟踪和实时仓库安全监控。
了解更多
Real-time AI that works with your team

零售业 AI

使用 Ultralytics YOLO 模型重塑零售业。视觉 AI 推动库存跟踪、货架监控、队列管理和更智能的客户洞察。
了解更多
Real-time AI that works with your team

医疗保健中的 AI

利用 Ultralytics YOLO 模型构建医疗保健解决方案。医疗保健中的视觉 AI 可助力更快速的医学影像分析、更智能的诊断和患者监测。
了解更多
Real-time AI that works with your team

制造业中的 AI

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 推动质量控制、缺陷检测、PPE 合规性和装配线自动化。
了解更多
Real-time AI that works with your operation

汽车中的 AI

将计算机视觉应用于汽车行业,并配合 Ultralytics YOLO 模型。汽车视觉 AI 可提升道路安全、辅助驾驶和车辆自动化,打造更智能的道路。
了解更多
Real-time AI tailored to your operation

农业中的 AI

借助 Ultralytics YOLO 模型,将视觉 AI 引入智慧农业。赋能作物监测、牲畜追踪和精准农业,实现更高、更智能的产量。
了解更多
Real-time AI that works with your team

机器人技术中的 AI

使用 Ultralytics YOLO 模型为智能机器赋能。机器人技术中的视觉 AI 可推动自主导航、感知、物体跟踪和实时控制。
了解更多
Real-time AI that works with your team

物流中的 AI

使用 Ultralytics YOLO 模型简化物流。视觉 AI 可实现包裹检查、分拣、车辆跟踪和实时仓库安全监控。
了解更多
Real-time AI that works with your team

零售业 AI

使用 Ultralytics YOLO 模型重塑零售业。视觉 AI 推动库存跟踪、货架监控、队列管理和更智能的客户洞察。
了解更多
Real-time AI that works with your team

医疗保健中的 AI

利用 Ultralytics YOLO 模型构建医疗保健解决方案。医疗保健中的视觉 AI 可助力更快速的医学影像分析、更智能的诊断和患者监测。
了解更多
Real-time AI that works with your team

制造业中的 AI

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 推动质量控制、缺陷检测、PPE 合规性和装配线自动化。
了解更多
Real-time AI that works with your operation

汽车中的 AI

将计算机视觉应用于汽车行业,并配合 Ultralytics YOLO 模型。汽车视觉 AI 可提升道路安全、辅助驾驶和车辆自动化,打造更智能的道路。
了解更多
Real-time AI tailored to your operation

农业中的 AI

借助 Ultralytics YOLO 模型,将视觉 AI 引入智慧农业。赋能作物监测、牲畜追踪和精准农业,实现更高、更智能的产量。
了解更多

让我们一起构建 AI 的未来!

开启你的机器学习未来之旅