Grounding
探索 AI 中基础 (Grounding) 的概念。了解如何使用 Ultralytics YOLO26 和 YOLO-World 将自然语言与视觉数据连接,以实现开放词汇检测。
Grounding(基础化/定位)是指人工智能系统将通常源自自然语言的抽象概念连接到物理世界中具体、实物表示(如视觉数据或感官输入)的能力。在计算机视觉的语境下,这意味着模型不只是处理文本;它还能解析诸如“遛狗的人”这样的短语,并精确地在图像或视频流中定位这些实体。这一过程架起了符号推理与像素级感知之间的桥梁,解决了认知科学中的根本symbol grounding problem。通过将语言标记与视觉特征联系起来,grounding 成为现代multimodal AI的基石,使机器能够更直观地与动态的人类环境进行交互。
Grounding 的机制#
在技术层面上,grounding 涉及将来自不同模态的数据对齐到一个共享的高维向量空间中。先进的架构(通常构建于用于natural language processing (NLP)的Transformer框架之上)会为文本描述和视觉输入生成被称为embeddings的数值表示。在训练期间,模型会学习最小化文本提示(例如“蓝色双肩包”)的 embedding 与对应视觉区域的 embedding 之间的距离。
这种对齐支持了开放词汇检测(Open-Vocabulary Detection)。与模型仅限于固定类别集的传统监督学习不同,grounding 能够实现zero-shot learning。只要模型理解描述它们的语言,它就能识别出在训练期间从未显式见过的内容。这种灵活性得到了诸如 PyTorch 等深度学习框架的支持,这些框架促进了这些多模态对齐所需的复杂矩阵运算。
实际应用#
Grounding 技术通过允许系统有效解读用户意图并导航非结构化环境,正在重塑各个行业。
- AI in Robotics: 对于执行口头指令的自主智能体而言,grounding 至关重要。如果仓库机器人被告知“拿起顶层货架上的包裹”,它必须将“包裹”和“顶层货架”这些概念对应到其视野中的特定 3D 坐标。这一能力是 robotics research at MIT CSAIL 的主要研究方向,使机器人能够安全地与人类协同作业。
- Semantic Search 与媒体检索: Grounding 驱动了超越关键词匹配的高级搜索引擎。用户可以用复杂的描述(例如“日落时分左转的骑自行车者”)来查询视频档案,系统则通过 grounding 来检索特定的时间戳。这显著增强了用于安全和媒体管理的video understanding。
- 辅助技术(Assistive Technology): 对于视障用户,grounding 依靠与语音生成相连的强大image recognition,使应用程序能够实时描述周围环境或回答关于环境的问题。
使用 Ultralytics YOLO-World 进行 Grounding#
Ultralytics 生态系统通过像 YOLO-World 这样的专门架构支持 Grounding。虽然标准模型需要基于特定数据集进行训练,但 YOLO-World 允许用户使用文本提示即时定义自定义检测类别。这有效地将自然语言输入“Grounding”到了图像上,而无需重新训练。
以下示例演示了如何使用 ultralytics 包根据自定义文本描述来检测对象:
from ultralytics import YOLO
# Load a pre-trained YOLO-World model for open-vocabulary detection
model = YOLO("yolov8s-world.pt")
# Define custom text prompts (classes) to ground in the image
# The model maps these descriptions to visual features
model.set_classes(["person wearing hat", "blue backpack"])
# Run prediction on an image source to localize the described objects
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Display the results
results[0].show()区分 Grounding 与相关概念#
为了充分理解 Grounding 的实用性,将其与类似的计算机视觉任务区分开来是很有帮助的:
- 对比Object Detection: 传统的检测模型(例如最先进的 YOLO26)从封闭的预定义类别集(例如 COCO 中的 80 个类别)中识别对象。而 grounding 是开放式的,它根据自由格式的文本来识别对象。
- 对比Image Captioning: 图像描述生成针对整张图片的描述性句子(图片 $\to$ 文本)。而 grounding 通常以相反的方向或双向运行,根据文本输入定位特定的视觉元素(文本 $\to$ 图片区域)。
- 对比Visual Question Answering (VQA): VQA 涉及回答关于图片的特定问题(例如“这辆车是什么颜色的?”)。Grounding 则专门聚焦于定位步骤——在提及的对象周围绘制bounding box。
挑战与未来展望#
尽管取得了进展,grounding 仍然是计算密集型的。将庞大的语言模型与视觉编码器对齐需要大量的GPU resources和高效的内存管理,这也是像 NVIDIA 这样的硬件创新者经常解决的一项挑战。此外,模型可能会受困于语言的歧义性,因此需要庞大的context windows来解析“bat”一词是指运动器材还是指动物。
未来的发展正朝着天生具备多模态特性的统一基础模型迈进。诸如 Ultralytics Platform 之类的工具正在不断演进,以帮助开发者管理这些任务所需的复杂数据集,并为data annotation和模型部署提供简化的工作流。随着这些技术的成熟,我们可以期待 grounding 无缝集成到边缘设备中,从而实现更智能、更具响应能力的 AI 应用。






