One-Stage Object Detectors
探索用于高速实时 AI 的单阶段目标检测器。学习 Ultralytics YOLO26 如何为边缘 AI 和部署提供卓越的准确性和效率。
单阶段目标检测器是一类强大的深度学习架构,旨在以出色的速度和效率执行目标检测任务。与将检测过程分为候选区域生成和后续分类等独立步骤的传统两阶段目标检测器不同,单阶段模型会在单次遍历中分析整张图像。通过将检测构建为直接回归问题,这些网络可以直接从输入像素同时预测边界框坐标和类别概率。这种简化的方法显著降低了计算开销,使单阶段检测器成为需要实时推理并在资源受限的边缘人工智能设备上部署的应用的首选。
核心工作原理#
单阶段检测器的架构通常围绕卷积神经网络 (CNN)展开,该网络充当特征提取的主干网络。当图像流经网络时,模型会生成编码空间和语义信息的特征图网格。
早期实现(例如单次多框检测器 (SSD))依赖于不同尺度的预定义锚框来定位目标。然而,诸如Ultralytics YOLO11和最先进的YOLO26等现代进展在很大程度上转向了无锚框设计。这些较新的架构直接预测目标中心和尺寸,消除了与锚框相关的复杂超参数调优需求。最终输出由用于定位的坐标向量以及表示模型对检测到目标确定性的置信度得分组成。
单阶段与两阶段检测器对比#
区分这两大类模型有助于为特定任务选择合适的工具:
- 单阶段目标检测器:诸如Ultralytics YOLO系列之类的模型优先考虑低推理延迟。它们针对速度进行了优化,非常适合视频流和移动应用。最新版本显著缩小了精度差距,在保持实时性能的同时,通常能够匹配甚至超过较慢模型的精度。
- 两阶段目标检测器:诸如R-CNN 家族等架构首先生成候选区域并对其进行分类。虽然它们在历史上为小型或被遮挡的目标提供了更高的精度,但它们会产生更高的计算成本并且通常较慢,从而限制了其在时间敏感场景中的使用。
实际应用#
单阶段检测器的高效性推动了它们在各行各业的广泛应用,这些行业对即时响应性有着严苛要求:
- 自动驾驶汽车:自动驾驶汽车需要即时处理视频流以识别行人、交通标志和其他车辆。该领域的领导者依靠高速视觉系统安全穿梭于复杂的环境中,通常除了检测之外还会利用目标跟踪。
- 智能制造:在高速装配线上,这些模型通过实时检测缺陷或验证组件放置来执行自动化质量控制。这确保了无瓶颈的生产效率,通常通过Ultralytics 平台集成以便于部署。
- 边缘人工智能与物联网:其轻量级特性使单阶段检测器非常适合Raspberry Pi或NVIDIA Jetson等物联网设备,从而无需持续的云连接即可为远程摄像机和无人机带来先进的智能。
使用Python进行技术实现#
使用现代的高级 API 实现单阶段检测器非常简单。为了确保准确的结果,模型通常会预测多个潜在的边界框,然后根据 交并比 (IoU) 阈值,使用像 非极大值抑制 (NMS) 这样的技术进行过滤,尽管像 Ultralytics YOLO26 这样更新的端到端模型可以原生处理这一点。
以下 Python 示例演示了如何加载最先进的YOLO26模型并在图像上执行推理:
from ultralytics import YOLO
# Load the YOLO26 model, the latest natively end-to-end one-stage detector
model = YOLO("yolo26n.pt")
# Run inference on an image URL to detect objects
results = model("https://ultralytics.com/images/bus.jpg")
# Display the first result with bounding boxes and labels
results[0].show()现代单阶段架构的优势#
单阶段检测器的演进一直专注于克服“精度与速度”的权衡。引入了诸如焦点损失等技术来解决训练过程中的类别不平衡问题,确保模型专注于难以分类的样本,而不是丰富的背景。此外,特征金字塔网络 (FPN)的集成允许这些模型有效地检测不同尺度的目标。
今天,研究人员和开发者可以使用诸如Ultralytics 平台等工具在自定义数据集上轻松训练这些先进架构,该平台简化了从数据标注到模型部署的工作流程。无论是用于农业还是医疗保健,单阶段检测器的易用性正在使强大的计算机视觉功能变得平民化。






