Spatial Intelligence
探索空间智能如何让 AI 感知并在 3D 世界中导航。了解如何使用 Ultralytics YOLO26 和 Ultralytics Platform 构建具备空间感知能力的系统。
空间智能是指人工智能系统感知、理解并在三维空间中导航物理世界的能力。不同于通常将二维图像作为静态快照进行分析的传统计算机视觉,空间智能涉及对动态环境中的深度、几何结构、运动以及物体之间关系的推理。它赋予机器的不只是“看见”像素的能力,还能理解场景的物理背景,使其更有效地与现实世界交互。这种能力连接了数字视觉数据与物理行动,是先进 AI 代理和机器人系统的基石。
空间智能的核心组成部分#
要实现类似人类的空间理解,AI 系统需要依赖多种相互关联的技术和概念。
- **深度感知与三维重建:**系统必须将摄像头输入的二维数据转换为三维表示。像单目深度估计这样的技术可以让模型根据单张图像预测距离,而三维目标检测则有助于识别该空间中物体的体积和方向。
- **同步定位与建图(SLAM):**这使设备(例如机器人或无人机)能够绘制未知环境的地图,同时跟踪自身在其中的位置。现代方法通常将视觉 SLAM与深度学习相结合,以提高系统在光照条件变化时的鲁棒性。
- **几何推理:**除了检测之外,系统还必须理解物理约束——知道杯子放在桌子上,或者知道必须打开门才能通过。这通常需要使用姿态估计来实时跟踪物体或人体关节的方向。
- **具身 AI:**这一概念将感知与行动联系起来。具身智能体不只是观察;它还会利用空间数据规划运动、避开障碍物并操控物体,这类似于制造车间中机器人领域的 AI的运行方式。
实际应用#
空间智能通过让机器能够在复杂环境中自主运行,正在改变各个行业。
- **自主机器人与物流:**在仓储环境中,机器人利用空间智能穿行于拥挤的通道,使用目标检测识别特定包裹,并将其精准放置到传送带上。机器人必须计算其夹爪与箱子之间的空间关系,以确保牢固抓取而不压坏物品。
- **增强现实(AR)与混合现实:**智能眼镜等设备利用空间计算将数字内容锚定到物理世界。例如,AR 维护应用可以将维修说明直接叠加到特定的发动机部件上。这需要精确的目标跟踪,以确保用户移动头部时图形仍保持对齐。
空间智能与计算机视觉的对比#
尽管二者密切相关,但区分空间智能与计算机视觉很有帮助。计算机视觉是一个更广泛的领域,专注于从数字图像、视频及其他视觉输入中提取有意义的信息。它包括分类或基础二维检测等任务。空间智能是计算机视觉的一个专门子集或演进方向,特别增加了空间和物理规律这两个维度。它从“这是什么物体?”(视觉)发展到“这个物体在哪里、朝向如何,以及我如何与它交互?”(空间智能)。
使用 Ultralytics 实现空间感知#
开发者可以使用 Ultralytics Platform构建空间智能系统的基础。通过在有向边界框(OBB)检测或姿态估计等任务上训练Ultralytics YOLO26等模型,工程师可以为下游机器人或 AR 应用提供必要的几何数据。
下面是一个使用姿态估计模型提取空间关键点的简单示例,这是理解三维空间中人体运动的关键步骤:
from ultralytics import YOLO
# Load a pre-trained YOLO26 pose estimation model
model = YOLO("yolo26n-pose.pt")
# Run inference on an image to detect human keypoints
results = model("path/to/image.jpg")
# Access the keypoints (x, y coordinates and confidence)
for result in results:
# keypoints.xy returns a tensor of shape (N, 17, 2)
keypoints = result.keypoints.xy
print(f"Detected keypoints for {len(keypoints)} persons.")视觉 Transformer(ViT)和基础模型的最新进展正在进一步加速这一领域,使系统无需进行大量再训练,就能将在不同环境中的空间理解能力进行泛化。随着斯坦福 HAI和Google DeepMind等机构的研究不断推进,我们可以期待空间智能成为下一代智能设备的标准功能。









