Stereo Vision
了解立体视觉如何为 AI 提取 3D 深度信息。学习其工作原理、应用场景,以及如何将其与最新的 Ultralytics YOLO26 集成。
立体视觉,也称为体视,是一种用于从数字图像中提取 3D 深度信息的计算机视觉技术。通过比较从略微不同的角度拍摄同一场景的两个或多个 2D 图像(模仿人类双目视觉),AI 系统可以精确计算到物体的距离。这项能力是空间智能的基础,使机器能够在环境中导航并与物理对象安全交互。
立体视觉的工作原理#
该过程依赖于找出左侧和右侧相机视图之间的差异。这里的核心挑战是对应问题,即识别两幅图像中完全相同的像素或特征。一旦找到匹配的点,系统就会计算水平位移,从而生成视差图。
在视差图中,较大的位移表示较近的物体,而较小的位移表示物体更远。然后,利用三角测量法将该地图转换为密集的 3D 点云。尽管传统数学算法历史上一直驱动着这些计算,但现代方法越来越多地依赖卷积神经网络 (CNN)和深度学习来提高复杂光照或无纹理区域中的特征匹配准确率,正如最近的IEEE 计算机视觉研究中所详述的那样。
立体视觉与单目深度估计的对比#
务必将立体视觉与仅使用单个相机的深度估计技术区分开来。单目深度估计使用深度学习模型,根据透视和阴影等视觉线索从单个 2D 图像预测 3D 结构。相比之下,立体系统使用两个相机镜头之间的几何关系直接测量深度。虽然单目方法的计算量较轻,但立体视觉通常能提供更精确的实时深度测量,这对于关键安全系统至关重要。
现实世界的 AI 应用#
立体系统对于需要现实世界3D 对象检测和空间感知的各个行业至关重要。
- 自动驾驶导航:Waymo等公司开发的自动驾驶技术使用立体相机实时准确地测量到行人、其他车辆和障碍物的距离,并将这些精确的深度数据输入预测建模系统中以规划安全路径。
- 工业机器人自动化:制造机器人使用立体视觉执行复杂的抓取任务。通过计算传送带上散落零件的准确深度和方向,机器人系统可以完美对齐其夹具,从而提高智能制造管道的效率。
- 先进医学影像:手术机器人和诊断系统利用立体相机在微创手术过程中为外科医生提供高度准确的患者解剖结构 3D 视图,这一趋势在关于医学 AI 的最新 arXiv 预印本中经常被强调。
将AI与立体数据集成#
通常,开发者会将立体视觉与物体检测结合使用,以同时找到是什么以及多远。OpenCV 框架通常用于生成视差图,常集成在更广泛的PyTorch或TensorFlow管道中,而 AI 模型则负责处理感知。以下是使用Ultralytics YOLO26检测对象并检索其边界框的概念示例,这些边界框随后可用于从关联的 OpenCV 视差图中提取平均距离值。
import cv2
from ultralytics import YOLO
# Load the recommended Ultralytics YOLO26 model for high-speed edge inference
model = YOLO("yolo26n.pt")
# Read the left camera frame (typically used as the primary frame for detection)
left_frame = cv2.imread("left_camera_frame.jpg")
# Run inference to detect objects in the scene
results = model(left_frame)
# Extract bounding boxes to later combine with a stereo disparity map
for result in results:
for box in result.boxes.xyxy:
x1, y1, x2, y2 = map(int, box[:4])
print(f"Detected object bounding box: [{x1}, {y1}, {x2}, {y2}]")
# Depth values can now be extracted from the disparity map within this specific region进展与未来趋势#
训练和部署高级感知模型变得高度简化。通过使用Ultralytics 平台等工具,团队可以安全地注释立体对、训练稳健的模型,并将它们导出到优化格式(例如TensorRT),以便在边缘 AI 设备上进行低延迟推理。
斯坦福视觉和学习实验室等机构的最新进展表明,将立体视觉与视觉 Transformer (ViT)以及来自Google DeepMind的基础模型相融合,以更快地解决对应问题,已成为一种日益增长的趋势。此外,随着来自Anthropic和OpenAI等领先者的多模态 AI 模型不断发展,稳健 3D 空间数据的集成将继续突破具身 AI 智能体感知和理解的边界。






