YOLO Vision 2026:
返回 Ultralytics 词汇表

Vision Language Model (VLM)

通过 Ultralytics 探索视觉语言模型 (VLM)。了解它们如何将计算机视觉与 LLM 相结合,从而利用 Ultralytics YOLO26 实现 VQA 和开放词汇检测。

视觉语言模型(VLM)是一种能够同时处理和解释视觉信息(图像或视频)以及文本信息的人工智能。与仅关注像素数据的传统计算机视觉模型,或仅理解文本的大型语言模型(LLM)不同,VLM 架起了这两种模态之间的桥梁。通过在包含图像-文本对的大规模数据集上进行训练,这些模型学会了将视觉特征与语言概念联系起来,从而使它们能够描述图像、回答有关视觉场景的问题,甚至根据它们“看到”的内容执行命令。

视觉语言模型的工作原理#

在其核心部分,VLM 通常由两个主要组件组成:视觉编码器和文本编码器。视觉编码器处理图像以提取特征图和视觉表示,而文本编码器处理语言输入。然后,使用诸如交叉注意力之类的机制将这些不同的数据流融合在一起,以在共享嵌入空间中对齐视觉和文本信息。

2024 年和 2025 年的最新进展已转向更统一的架构,其中单个 Transformer 骨干网络同时处理两种模态。例如,像 Google PaliGemma 2 这样的模型展示了有效整合这些数据流如何增强复杂推理任务的性能。这种对齐使模型能够理解上下文,例如识别出单词“apple”在杂货店图片中指代水果,而在标志中指代一家科技公司。

实际应用#

通过视觉和语言理解世界的能力,在各行各业开辟了广泛的应用前景:

  • 视觉问答(VQA): VLM 被广泛用于医疗诊断以协助放射科医生。医生可能会问系统:“这张 X 光片中有骨折吗?”然后模型会分析医学图像以提供初步评估,从而减少诊断错误。
  • 智能电商搜索:零售环境中,VLM 允许用户使用自然语言描述结合图像来搜索产品。购物者可以上传名人服装的照片并问:“帮我找一件有这种图案但颜色是蓝色的连衣裙,”然后系统使用语义搜索来检索准确的匹配项。
  • 自动生成字幕与无障碍访问: VLM 会自动为网页上的图像生成描述性替代文本,使依赖屏幕阅读器的视障用户更容易访问数字内容。

区分 VLM 与相关概念#

将 VLM 与其他 AI 类别区分开来,有助于理解它们各自的具体作用:

  • VLM 与 LLM: 大型语言模型(如纯文本版本的 GPT-4)仅处理文本数据。虽然它可以生成富有创意的故事或代码,但它无法“看到”图像。VLM 实际上赋予了 LLM 以眼睛。
  • VLM 与目标检测: 传统的目标检测模型(例如早期 YOLO 版本)可以识别对象在哪里以及它们属于什么类别(例如,“Car: 99%”)。VLM 则通过理解关系和属性走得更远,例如“停在消防栓旁边的一辆红色跑车”。
  • VLM 与多模态 AI: 多模态 AI是一个更广泛的伞形术语。虽然所有 VLM 都是多模态的(结合了视觉和语言),但并非所有多模态模型都是 VLM;有些可能会结合音频和文本(如语音转文本)或视频和传感器数据而没有语言组件。

基于 YOLO 的开放词汇检测#

现代 VLM 支持“开放词汇”检测,你能够使用自由形式的文本提示来检测对象,而不是预定义的类别。这是诸如 Ultralytics YOLO-World 等模型的关键特征,它允许进行动态类别定义而无需重新训练。

以下示例演示了如何使用 ultralytics 包来检测文本描述的特定对象:

from ultralytics import YOLOWorld

# Load a model capable of vision-language understanding
model = YOLOWorld("yolov8s-world.pt")

# Define custom classes using natural language text prompts
model.set_classes(["person wearing sunglasses", "red backpack"])

# Run inference to find these text-defined objects in an image
results = model.predict("https://ultralytics.com/images/bus.jpg")

# Display the detection results
results[0].show()

挑战与未来方向#

尽管功能强大,但视觉语言模型面临着巨大的挑战。一个主要问题是幻觉,即模型满怀信心地描述图像中根本不存在的对象或文本。研究人员正在积极致力于诸如人类反馈强化学习(RLHF)之类的技术,以提高基础性和准确性。

另一个挑战是计算成本。训练这些庞大的模型需要大量的GPU 资源。然而,像 Ultralytics YOLO26 这样高效架构的发布正在帮助将先进的视觉功能带到边缘设备。随着我们的前进,我们期望看到 VLM 在机器人智能体中发挥关键作用,使机器人能够根据复杂的言语指令导航和操纵对象。

对于那些对理论基础感兴趣的人,OpenAI 的原始 CLIP 论文为对比语言-图像预训练提供了极好的见解。此外,跟进 CVPR 会议论文对于追踪这些架构的快速演进至关重要。若要试验训练你自己的视觉模型,你可以利用 Ultralytics Platform 来简化数据集管理和模型部署。

Explore solutions

Real-time AI that works with your team

机器人技术中的 AI

使用 Ultralytics YOLO 模型为智能机器赋能。机器人技术中的视觉 AI 可推动自主导航、感知、物体跟踪和实时控制。
了解更多
Real-time AI that works with your team

物流中的 AI

使用 Ultralytics YOLO 模型简化物流。视觉 AI 可实现包裹检查、分拣、车辆跟踪和实时仓库安全监控。
了解更多
Real-time AI that works with your team

零售业 AI

使用 Ultralytics YOLO 模型重塑零售业。视觉 AI 推动库存跟踪、货架监控、队列管理和更智能的客户洞察。
了解更多
Real-time AI that works with your team

医疗保健中的 AI

利用 Ultralytics YOLO 模型构建医疗保健解决方案。医疗保健中的视觉 AI 可助力更快速的医学影像分析、更智能的诊断和患者监测。
了解更多
Real-time AI that works with your team

制造业中的 AI

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 推动质量控制、缺陷检测、PPE 合规性和装配线自动化。
了解更多
Real-time AI that works with your operation

汽车中的 AI

将计算机视觉应用于汽车行业,并配合 Ultralytics YOLO 模型。汽车视觉 AI 可提升道路安全、辅助驾驶和车辆自动化,打造更智能的道路。
了解更多
Real-time AI tailored to your operation

农业中的 AI

借助 Ultralytics YOLO 模型,将视觉 AI 引入智慧农业。赋能作物监测、牲畜追踪和精准农业,实现更高、更智能的产量。
了解更多
Real-time AI that works with your team

机器人技术中的 AI

使用 Ultralytics YOLO 模型为智能机器赋能。机器人技术中的视觉 AI 可推动自主导航、感知、物体跟踪和实时控制。
了解更多
Real-time AI that works with your team

物流中的 AI

使用 Ultralytics YOLO 模型简化物流。视觉 AI 可实现包裹检查、分拣、车辆跟踪和实时仓库安全监控。
了解更多
Real-time AI that works with your team

零售业 AI

使用 Ultralytics YOLO 模型重塑零售业。视觉 AI 推动库存跟踪、货架监控、队列管理和更智能的客户洞察。
了解更多
Real-time AI that works with your team

医疗保健中的 AI

利用 Ultralytics YOLO 模型构建医疗保健解决方案。医疗保健中的视觉 AI 可助力更快速的医学影像分析、更智能的诊断和患者监测。
了解更多
Real-time AI that works with your team

制造业中的 AI

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 推动质量控制、缺陷检测、PPE 合规性和装配线自动化。
了解更多
Real-time AI that works with your operation

汽车中的 AI

将计算机视觉应用于汽车行业,并配合 Ultralytics YOLO 模型。汽车视觉 AI 可提升道路安全、辅助驾驶和车辆自动化,打造更智能的道路。
了解更多
Real-time AI tailored to your operation

农业中的 AI

借助 Ultralytics YOLO 模型,将视觉 AI 引入智慧农业。赋能作物监测、牲畜追踪和精准农业,实现更高、更智能的产量。
了解更多
Real-time AI that works with your team

机器人技术中的 AI

使用 Ultralytics YOLO 模型为智能机器赋能。机器人技术中的视觉 AI 可推动自主导航、感知、物体跟踪和实时控制。
了解更多
Real-time AI that works with your team

物流中的 AI

使用 Ultralytics YOLO 模型简化物流。视觉 AI 可实现包裹检查、分拣、车辆跟踪和实时仓库安全监控。
了解更多
Real-time AI that works with your team

零售业 AI

使用 Ultralytics YOLO 模型重塑零售业。视觉 AI 推动库存跟踪、货架监控、队列管理和更智能的客户洞察。
了解更多
Real-time AI that works with your team

医疗保健中的 AI

利用 Ultralytics YOLO 模型构建医疗保健解决方案。医疗保健中的视觉 AI 可助力更快速的医学影像分析、更智能的诊断和患者监测。
了解更多
Real-time AI that works with your team

制造业中的 AI

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 推动质量控制、缺陷检测、PPE 合规性和装配线自动化。
了解更多
Real-time AI that works with your operation

汽车中的 AI

将计算机视觉应用于汽车行业,并配合 Ultralytics YOLO 模型。汽车视觉 AI 可提升道路安全、辅助驾驶和车辆自动化,打造更智能的道路。
了解更多
Real-time AI tailored to your operation

农业中的 AI

借助 Ultralytics YOLO 模型,将视觉 AI 引入智慧农业。赋能作物监测、牲畜追踪和精准农业,实现更高、更智能的产量。
了解更多

让我们一起构建 AI 的未来!

开启你的机器学习未来之旅