Visual Reasoning
探索人工智能中的视觉推理,了解模型如何推断空间逻辑。发现如何使用 Ultralytics YOLO26 构建高级推理流水线。
人工智能中的视觉推理是指模型分析、解释视觉和空间数据并从中得出逻辑推论的能力。虽然标准的 computer vision (CV) 系统擅长识别场景中存在哪些物体,但视觉推理则更进一步,去理解这些物体如何以及为什么发生交互。受 human cognitive faculty of visual reasoning 的启发并通过标准的 cognitive psychology tests 进行评估,这一能力使 AI 模型能够纯粹基于视觉上下文执行复杂的图像分析、推导空间关系并解决多步骤问题。它是连接 multimodal AI 系统中原始感知与可执行智能的关键组成部分。
核心概念与“图像思维”范式#
从历史上看,机器学习模型在应用逻辑推论之前会将图像数据转换为文本。然而,2024 年和 2025 年的最新发展普及了一种新范式,即模型本质上能够 think with images。通过利用潜在的视觉推理,先进的 vision-language models (VLMs) 能够在得出结论之前生成中间视觉表示——类似于人类如何在 NIH Toolbox spatial parameters 中定义的那样在脑海中构想心理地图。
这种方法通常采用一种称为多模态思维可视化(MVoT)的机制。系统无需仅依赖基于文本的思维链,就可以探索 spatial visualization reasoning 来验证几何变化、评估遮挡并追踪 3D 空间中的连续运动。
视觉推理与相关能力对比#
将视觉推理与其他重叠的 AI 术语区分开来会有所帮助:
- Reasoning Models: 这是一个更广泛的类别,包含专为多步骤逻辑推论(通常在文本、数学或编码中)而设计的模型。视觉推理将这些演绎原则专门应用于视觉和空间数据。
- Visual Question Answering (VQA): VQA 是一种特定应用或任务,其中 AI 针对用户关于图像的提示提供自然语言回答。视觉推理是为 VQA 提供支持的底层认知能力,允许模型根据空间上下文推导正确的答案。
实际应用#
动态解释空间上下文的能力正在物理和数字领域开启变革性的 agentic workflows。
- AI In Robotics And Embodied Intelligence: 自主代理和机器人手臂需要复杂的空间智能来导航复杂的环境。通过利用视觉推理,机器人可以推断出一个易碎物体堆叠在一个重箱子下面,并合乎逻辑地规划一系列移动来取回它而不会造成损坏,这在很大程度上依赖于 evaluating dynamic physical constraints。
- AI In Healthcare Diagnostics: 在医学成像中,从业者使用视觉推理系统来超越基本的 anomaly detection。模型可以评估 3D MRI 扫描,以结构化地推理肿瘤相对于周围器官的生长轨迹,从而为手术规划提供关键的几何上下文。
为推理流水线实现感知#
为了构建有效的推理系统,开发者依靠高速感知模型从物理世界中提取结构化上下文。Ultralytics YOLO26 作为一个强大的基础层,能够快速将像素转换为结构化的 bounding box 坐标和对象类别。然后,这些结构化数据被输入到使用 PyTorch 或 TensorFlow 等框架构建的专用视觉推理引擎中,以评估空间逻辑。
如果你正在为这项任务 comparing YOLO26 and YOLO11,YOLO26 的原生端到端架构可最大限度地减少推理延迟,使其成为实时逻辑管道的理想选择。
以下 Python 代码片段演示了如何使用 Ultralytics YOLO26 提取空间坐标,为下游空间推理提供所需的关键感知输入:
from ultralytics import YOLO
# Load the Ultralytics YOLO26 model to act as the perception layer
model = YOLO("yolo26n.pt")
# Run inference to detect objects in a scene
results = model("https://ultralytics.com/images/bus.jpg")
# Extract structured spatial data for the visual reasoning engine
for result in results:
for box in result.boxes:
cls_name = model.names[int(box.cls)]
# xyxy provides exact spatial coordinates (left, top, right, bottom)
coords = box.xyxy[0].tolist()
print(f"Object: {cls_name}, Spatial Coordinates: {coords}")扩展这些复杂的、多模态的应用需要强大的基础设施。Ultralytics Platform 提供了一个统一的环境,可以无缝注释 spatial intelligence 数据集、在云端训练模型并部署可靠的边缘感知系统。随着该领域向更先进的 agentic frameworks for spatial tasks 发展并得到 advanced vision research 的支持,将高精度 object detection 与逻辑推论相结合代表了人工智能的下一个前沿。






