Stereo Vision
了解立体视觉如何为人工智能提取 3D 深度信息。学习其工作原理、应用场景,以及如何将其与最新的 Ultralytics YOLO26 集成。
立体视觉又称立体成像,是一种用于从数字图像中提取 3D 深度信息的计算机视觉技术。AI 系统通过比较从略有不同的角度拍摄的同一场景的两张或多张 2D 图像——模仿人类的双眼视觉——可以准确计算物体距离。这项能力是空间智能的基础,能够让机器在环境中导航,并安全地与实体物体交互。
立体视觉的工作原理#
这一过程依赖于寻找左右摄像头视图之间的差异。其核心挑战是对应问题,即识别两张图像中完全相同的像素或特征。找到匹配点后,系统会计算水平位移并生成视差图。
在视差图中,位移越大表示物体越近,位移越小则表示物体越远。随后,通过三角测量将此图转换为稠密的 3D 点云。过去,这些计算主要依赖传统数学算法;如今,现代方法越来越多地采用卷积神经网络(CNN)和深度学习,以提高复杂光照或无纹理区域中的特征匹配准确性,近期的 IEEE 计算机视觉研究对此进行了详细介绍。
立体视觉与单目深度估计的比较#
区分立体视觉与仅使用单个摄像头的深度估计技术很重要。单目深度估计使用深度学习模型,根据透视和阴影等视觉线索,从单张 2D 图像预测 3D 结构。相比之下,立体系统利用两个摄像头镜头之间的几何关系直接测量深度。单目方法的计算开销较低,而立体视觉通常能够提供更精确的实时深度测量,这对关键安全系统至关重要。
真实世界中的 AI 应用#
在需要真实世界3D 目标检测和空间感知的各行各业中,立体系统至关重要。
- 自动驾驶导航:像 Waymo 这样的公司开发的自动驾驶技术,会使用立体摄像头实时准确测量行人、其他车辆和障碍物的距离,并将精确的深度数据输入预测建模系统,以规划安全路线。
- 工业机器人自动化:制造机器人使用立体视觉执行复杂的料箱拣选任务。通过计算传送带上散落零件的精确深度和方向,机器人系统可以准确调整夹爪,从而提高智能制造流水线的效率。
- 先进医学影像:手术机器人和诊断系统使用立体摄像头,在微创手术过程中为外科医生提供患者解剖结构的高精度 3D 视图。这一趋势在近期关于医学 AI 的 arXiv 预印本中屡有提及。
将 AI 与立体数据集成#
开发者通常会将立体视觉与目标检测结合使用,同时确定是什么以及有多远。OpenCV 框架常用于生成视差图,并经常集成到更广泛的 PyTorch或 TensorFlow流水线中,由 AI 模型负责感知。下面的概念示例使用 Ultralytics YOLO26检测物体并获取其边界框,随后可以利用这些边界框从关联的 OpenCV 视差图中提取平均距离值。
import cv2
from ultralytics import YOLO
# Load the recommended Ultralytics YOLO26 model for high-speed edge inference
model = YOLO("yolo26n.pt")
# Read the left camera frame (typically used as the primary frame for detection)
left_frame = cv2.imread("left_camera_frame.jpg")
# Run inference to detect objects in the scene
results = model(left_frame)
# Extract bounding boxes to later combine with a stereo disparity map
for result in results:
for box in result.boxes.xyxy:
x1, y1, x2, y2 = map(int, box[:4])
print(f"Detected object bounding box: [{x1}, {y1}, {x2}, {y2}]")
# Depth values can now be extracted from the disparity map within this specific region技术进展与未来趋势#
先进感知模型的训练和部署流程已大幅简化。借助 Ultralytics Platform等工具,团队可以安全地标注立体图像对、训练鲁棒模型,并将模型导出为 TensorRT等经过优化的格式,以便在边缘 AI 设备上进行低延迟推理。
斯坦福视觉与学习实验室等机构的最新进展显示,立体视觉正日益与 Vision Transformer(ViT)以及 Google DeepMind的基础模型相结合,以更快地解决对应问题。此外,随着 Anthropic和 OpenAI等领先机构的多模态 AI 模型不断发展,稳健的 3D 空间数据集成将持续拓展具身 AI 智能体的感知和理解能力。










