Ultralytics YOLO27:
返回 Ultralytics 术语表

Grounding

探索 AI 中 grounding 的基础知识。了解如何使用 Ultralytics YOLO26 和 YOLO-World 将自然语言连接到视觉数据,以进行开放词汇检测。

语义落地是指人工智能系统将抽象概念(通常源自自然语言)与物理世界中的具体、实在表示(例如视觉数据或感官输入)建立联系的能力。在计算机视觉领域,这意味着模型不仅能处理文本,还能解析“一个正在遛狗的人”这样的短语,并在图像或视频流中精确定位这些实体。这一过程弥合了符号推理与像素级感知之间的鸿沟,解决了认知科学中的根本问题——符号落地问题。通过将语言标记与视觉特征关联起来,语义落地成为现代多模态 AI的基石,使机器能够更直观地与动态的人类环境互动。

语义落地的工作机制#

在技术层面,语义落地涉及将来自不同模态的数据对齐到共享的高维向量空间中。先进的架构通常基于用于自然语言处理 (NLP)的 Transformer框架,为文本描述和视觉输入分别生成称为嵌入的数值表示。在训练期间,模型会学习缩小文本提示(例如“蓝色背包”)的嵌入与相应视觉区域的嵌入之间的距离。

这种对齐支持开放词汇检测。传统监督学习中的模型只能识别固定类别集合,而语义落地则支持零样本学习。只要理解描述对象的语言,具备语义落地能力的模型就能识别训练期间从未明确见过的对象。这种灵活性得益于 PyTorch 等深度学习框架,它们能够执行这些多模态对齐所需的复杂矩阵运算。

实际应用#

语义落地技术让系统能够有效理解用户意图并在非结构化环境中导航,正在重塑各个行业。

  • **机器人领域的 AI:**对于执行语音指令的自主智能体而言,语义落地至关重要。如果仓库机器人接到“拿起顶层货架上的包裹”这一指令,它必须将“包裹”和“顶层货架”这两个概念落地到视野中的具体三维坐标。这项能力是 MIT CSAIL 的机器人研究重点关注的方向,可帮助机器人安全地与人类协同工作。
  • **语义搜索与媒体检索:**语义落地支持超越关键词匹配的高级搜索引擎。用户可以使用“日落时向左转弯的骑自行车者”这样的复杂描述查询视频存档,系统则利用语义落地检索出具体时间戳。这能显著提升安防和媒体管理中的视频理解能力。
  • **辅助技术:**对于视障用户,语义落地可以支持应用实时描述周围环境或回答有关环境的问题,其基础是与语音生成相结合的可靠图像识别。

借助 Ultralytics YOLO-World 实现语义落地#

Ultralytics 生态通过 YOLO-World 等专用架构支持语义落地。标准模型需要在特定数据集上进行训练,而 YOLO-World 允许用户利用文本提示即时定义自定义检测类别。这样无需重新训练,就能有效地将自然语言输入“落地”到图像上。

以下示例演示了如何使用 ultralytics 软件包,根据自定义文本描述检测对象:

from ultralytics import YOLO

# Load a pre-trained YOLO-World model for open-vocabulary detection
model = YOLO("yolov8s-world.pt")

# Define custom text prompts (classes) to ground in the image
# The model maps these descriptions to visual features
model.set_classes(["person wearing hat", "blue backpack"])

# Run prediction on an image source to localize the described objects
results = model.predict("https://ultralytics.com/images/bus.jpg")

# Display the results
results[0].show()

区分语义落地与相关概念#

要充分理解语义落地的用途,可以将其与类似的计算机视觉任务区分开来:

  • **与目标检测相比:**传统检测模型(例如最先进的 YOLO26)会从封闭且预先定义的类别集合中识别对象(例如 COCO 中的 80 个类别)。语义落地则没有此类限制,而是根据自由形式的文本识别对象。
  • **与图像描述相比:**图像描述会为整张图像生成描述性句子(图像 $\to$ 文本)。语义落地通常沿相反方向运行或双向运行,根据文本输入定位特定的视觉元素(文本 $\to$ 图像区域)。
  • **与视觉问答 (VQA)相比:**VQA 涉及回答有关图像的具体问题(例如“汽车是什么颜色?”)。语义落地则专注于定位步骤——在所提及对象周围绘制边界框。

挑战与未来展望#

尽管取得了诸多进展,语义落地在计算方面仍然代价高昂。将大规模语言模型与视觉编码器对齐需要大量的 GPU 资源和高效的内存管理,这是 NVIDIA 等硬件创新者经常着力解决的难题。此外,模型可能难以处理语言歧义,需要较大的上下文窗口来判断“bat”一词指的是体育器材还是动物。

未来的发展方向是构建原生支持多模态的统一基础模型。Ultralytics Platform 等工具正在不断发展,帮助开发者管理这些任务所需的复杂数据集,并为数据标注和模型部署提供简化的工作流。随着这些技术日趋成熟,我们可以期待语义落地无缝集成到边缘设备中,从而实现更智能、响应更迅速的 AI 应用。

Explore solutions

用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多
安全领域的计算机视觉

安全领域的计算机视觉

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多
安全领域的计算机视觉

安全领域的计算机视觉

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多
安全领域的计算机视觉

安全领域的计算机视觉

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多

让我们共同构建 AI 的未来!

开启你的机器学习未来之旅