Ultralytics YOLO27:
返回 Ultralytics 术语表

Visual Question Answering (VQA)

探索视觉问答 (VQA),了解其在 CV 和 NLP 交叉领域的应用。了解 Ultralytics YOLO26 如何为实时应用和多模态 AI 提供 VQA 能力。

视觉问答(VQA)是一项复杂的人工智能任务,处于计算机视觉(CV)自然语言处理(NLP)的交汇处。与传统的图像分类不同,传统图像分类只为图片分配一个标签,而 VQA 系统旨在回答有关图像视觉内容的开放式自然语言问题。例如,给定一张厨房的照片,用户可能会问:“炉灶开着吗?”或“碗里有几个苹果?”要正确回答,模型必须理解文本的语义,识别场景中的相关对象,并推理它们的属性和空间关系。

这项能力使 VQA 成为现代多模态 AI的基础组成部分,因为它需要同时处理不同类型的数据。其架构通常包括视觉编码器(例如卷积神经网络(CNN)视觉 Transformer(ViT)),用于从图像中提取特征,以及用于处理语言查询的文本编码器。高级系统会利用注意力机制将文本概念与图像中的特定区域对齐,使 AI 能够在生成答案前“查看”照片中的相关部分。

真实世界中的应用与重要性#

动态查询视觉数据的能力推动了各行业中的变革性应用,增强了自动化程度和可访问性。

  • 辅助技术: VQA 对支持视障人士的应用至关重要。Be My Eyes等工具可以利用 VQA,让用户拍摄周围环境的照片,并提出“这个瓶子里装的是洗发水还是护发素?”或“过马路安全吗?”之类的问题。这种方式将视觉信息转换为语音答案,提升了用户的独立性。
  • 医学诊断:医疗领域的 AI中,VQA 系统通过分析医学影像来辅助放射科医生。医生可能会针对一张 X 光片向系统提问,例如:“左上象限是否有骨折迹象?”美国国立卫生研究院(NIH)的研究人员已探索利用 VQA 简化临床决策并减少诊断错误。
  • 智能监控: 现代安防系统利用安全领域的 AI解析数小时的视频素材。操作人员无需手动查看,而是可以询问:“午夜后有一辆红色卡车进入装卸区吗?”VQA 能够根据具体标准而非通用的运动警报,快速执行异常检测

目标检测在 VQA 中的作用#

虽然一些 VQA 模型采用端到端训练,但许多模型依赖强大的目标检测骨干网络来首先识别场景元素。准确定位对象为推理引擎提供了必要的上下文。Ultralytics YOLO26模型凭借其高精度和实时性能,成为这些处理流程的优秀基础。

例如,开发者可以使用 YOLO26 提取对象类别和边界框,然后将其馈送到大型语言模型(LLM)或专用推理模块中,以回答用户查询。使用Ultralytics Platform管理用于训练这些检测骨干网络的数据集通常更加高效,因为它简化了标注和云端训练流程。

下面的 Python 示例演示了如何使用 Ultralytics YOLO26 从图像中提取视觉上下文(对象及其位置),这是 VQA 工作流程中的主要步骤:

from ultralytics import YOLO

# Load the YOLO26 model (latest generation)
model = YOLO("yolo26n.pt")

# Run inference to detect objects, providing context for VQA
results = model.predict("https://ultralytics.com/images/bus.jpg")

# Display detected classes (e.g., 'bus', 'person') to verify scene understanding
for result in results:
    result.show()  # Visualize the detections

区分 VQA 与相关概念#

为了理解 VQA 的独特范围,有必要将其与类似的视觉语言任务区分开来。

  • VQA 与图像描述:图像描述会生成对整张图像的通用静态描述(例如:“一只狗在公园里玩耍”)。VQA 具有交互性和针对性;它会针对用户的问题提供具体回答,而不是给出宽泛的总结。
  • VQA 与视觉定位:视觉定位专注于定位文本短语中提到的特定对象,并在其周围绘制边界框。VQA 则更进一步,分析所找到对象的属性、动作或数量。
  • VQA 与 OCR:光学字符识别(OCR)严格来说用于从图像中提取文本,而 VQA 可以结合 OCR 来回答“街道标志上写的是什么?”之类的问题。不过,VQA 的主要功能还包括超越单纯文本读取的更广泛场景理解。

研究人员继续利用VQA 数据集等大规模基准推进该领域的发展,该数据集帮助模型在数百万个图像—问题对上实现泛化。随着硬件性能提升并支持更快的推理延迟,VQA 越来越适用于实时移动端和边缘应用。

Explore solutions

用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多

让我们共同构建 AI 的未来!

开启你的机器学习未来之旅