3D Object Detection
探索 3D 目标检测,掌握 AI 中的空间感知。了解 Ultralytics YOLO26 如何实现现实场景中的深度、方向和 3D 边界框估计。
3D 对象检测是一项复杂的计算机视觉任务,能够让机器识别、定位并确定三维空间内对象的大小。与传统的 2D 对象检测 不同,后者会在图像中的对象周围绘制平面 边界框,而 3D 对象检测则会估计一个包围对象的长方体(3D 框)。这项技术提供了关键的深度信息、方向(朝向)和精确的空间尺寸,使系统不仅能理解对象 是什么,还能准确理解对象在现实世界中相对于传感器的 位置。对于需要与环境进行物理交互的技术而言,这项能力至关重要。
3D 对象检测的工作原理#
为了感知深度和体积,3D 检测模型通常依赖比标准摄像头所提供的数据更丰富的数据输入。虽然一些先进方法可以从单目(单镜头)图像中推断 3D 结构,但大多数稳健的系统都会利用 LiDAR 传感器、雷达或立体摄像头的数据。这些传感器会生成 点云—表示对象外部表面的海量数据点集合。
该过程包括以下几个关键步骤:
- 数据采集: 传感器捕获场景的几何结构。例如,LiDAR 使用激光脉冲测量距离,从而创建精确的 3D 地图。
- 特征提取: 深度学习模型通常基于 卷积神经网络 (CNNs) 或 Transformers,会处理点云或融合后的图像数据,以识别其中的模式。
- 边界框预测: 模型输出一个 3D 边界框,该边界框由中心坐标 (x, y, z)、尺寸(长度、宽度、高度)和旋转角度(偏航角)定义。
- 分类: 与 图像分类 类似,系统会为检测到的对象分配一个标签(例如“行人”“车辆”)。
2D 与 3D 检测的区别#
区分这两个相关概念非常重要。
- 2D 对象检测: 在平面图像(像素)上运行。它可以告诉你对象位于画面的“左上方”或“右下方”,但如果没有参考标记,就无法有效判断距离或现实世界中的大小。这种检测非常适合识别制造缺陷或分析深度信息不太重要的视频流等任务。
- 3D 对象检测: 在体积空间(体素或点)中运行。它可以提供对象与摄像头之间的距离(深度)、对象的实际尺寸及其方向。这对于在动态环境中避免碰撞至关重要。
实际应用#
从 2D 感知转向 3D 感知,为安全和空间感知至关重要的行业解锁了强大的应用场景。
- 自动驾驶: 自动驾驶汽车高度依赖 3D 检测来安全导航。通过处理 LiDAR 和摄像头采集的数据,车辆可以检测其他汽车、行人和障碍物,并计算它们的精确距离和速度。这使感知系统能够在实时推理场景中预测轨迹,并做出刹车或转向决策。诸如 Waymo 这样的公司利用这些复杂的传感器套件即时绘制城市环境地图。
- 机器人与料箱拣选: 在物流和仓储领域,机器人需要从料箱中拾取形状和大小各异的对象。3D 检测可以让机械臂理解包裹的方向,确定最佳抓取点,并规划无碰撞路径来移动对象。通过自动化复杂的人工任务,这项技术提升了物流领域中的 AI的效率。
使用 Ultralytics 实现对象检测#
虽然完整的 3D 检测通常需要专用的点云架构,但现代 2D 检测器(如 YOLO26)越来越多地被用作伪 3D 工作流中的组件,或通过缩放边界框来估计深度。对于希望在自有数据集上训练模型的开发者,Ultralytics Platform 提供了一个简化的标注和训练环境。
下面是一个使用 Ultralytics Python API 运行标准检测的简单示例,这通常是更大规模感知流水线中的第一步:
import cv2
from ultralytics import YOLO
# Load the YOLO26n model (nano version for speed)
model = YOLO("yolo26n.pt")
# Perform inference on a local image
results = model("path/to/image.jpg")
# Visualize the results
for result in results:
# Plot predictions on the image (returns a numpy array)
im_array = result.plot()
# Display using OpenCV
cv2.imshow("Detections", im_array)
cv2.waitKey(0) # Press any key to close
cv2.destroyAllWindows()挑战与未来趋势#
尽管实用性很高,3D 对象检测仍面临计算成本和传感器费用方面的挑战。在点云中处理数百万个点需要强大的 GPU 算力,因此难以部署到边缘设备上。不过,模型量化和高效神经网络架构等创新正在减轻这一负担。
此外,传感器融合等技术通过将摄像头丰富的颜色信息与 LiDAR 精确的深度数据相结合,正在提升准确率。随着这些技术日趋成熟,我们可以期待 3D 感知集成到更多易于使用的设备中,从增强现实眼镜到智能家居设备。









