One-Stage Object Detectors
探索用于高速实时 AI 的单阶段目标检测器。了解 Ultralytics YOLO26 如何为边缘 AI 和部署提供领先的准确率与效率。
单阶段目标检测器是一类强大的深度学习架构,旨在以卓越的速度和效率执行目标检测任务。与将检测过程划分为区域提议和后续分类两个独立步骤的传统两阶段目标检测器不同,单阶段模型只需一次前向处理即可分析整幅图像。通过将检测建模为直接回归问题,这些网络可以直接从输入像素同时预测边界框坐标和类别概率。这种简化的方法显著降低了计算开销,使单阶段检测器成为需要实时推理以及部署在资源受限边缘 AI设备上的应用的首选。
核心工作原理#
单阶段检测器的架构通常以卷积神经网络 (CNN)为核心,作为骨干网络执行特征提取。当图像经过网络时,模型会生成特征图网格,其中编码了空间信息和语义信息。
早期实现(例如单阶段多框检测器 (SSD))依赖不同尺度的预定义锚框来定位对象。然而,像Ultralytics YOLO11和最先进的YOLO26这样的现代进展已基本转向无锚框设计。这些新型架构直接预测对象中心点和尺寸,消除了与锚框相关的复杂超参数调优需求。最终输出包括用于定位的坐标向量,以及表示模型对检测对象确信程度的置信度分数。
单阶段与两阶段检测器#
区分这两大类别有助于为特定任务选择合适的工具:
- 单阶段目标检测器:例如Ultralytics YOLO系列的模型优先考虑较低的推理延迟。它们针对速度进行了优化,非常适合视频流和移动应用。近期的迭代版本已显著缩小准确率差距,通常在保持实时性能的同时达到或超过较慢模型的精度。
- 两阶段目标检测器:如R-CNN 系列这样的架构会先生成区域提议,然后再对其进行分类。虽然它们在历史上对小型或被遮挡对象能够提供更高的精度,但也会带来更高的计算成本,而且通常速度较慢,因此在对时效性要求高的场景中应用受限。
实际应用#
单阶段检测器的高效率推动了其在众多行业中的广泛采用,这些行业都对即时响应能力有关键需求:
- 自动驾驶车辆:自动驾驶汽车需要即时处理视频流,以识别行人、交通标志和其他车辆。行业领先者依赖高速视觉系统来安全地应对复杂环境,并且通常会将目标跟踪与检测结合使用。
- 智能制造:在高速装配线上,这些模型通过检测缺陷或实时验证组件位置来执行自动化质量控制。这可以确保生产效率而不会产生瓶颈,并且通常通过Ultralytics Platform集成,以便轻松部署。
- 边缘 AI 与 IoT:它们的轻量特性使单阶段检测器非常适合树莓派或NVIDIA Jetson等 IoT 设备,无需持续连接云端即可为远程摄像头和无人机提供先进的智能能力。
使用 Python 进行技术实现#
使用现代高级 API 实现单阶段检测器非常简单。为确保结果准确,模型通常会预测多个候选框,然后根据交并比 (IoU)阈值,使用非极大值抑制 (NMS)等技术对其进行筛选,不过 Ultralytics YOLO26 等较新的端到端模型可以原生处理这一过程。
下面的 Python 示例演示了如何加载最先进的YOLO26模型并对图像执行推理:
from ultralytics import YOLO
# Load the YOLO26 model, the latest natively end-to-end one-stage detector
model = YOLO("yolo26n.pt")
# Run inference on an image URL to detect objects
results = model("https://ultralytics.com/images/bus.jpg")
# Display the first result with bounding boxes and labels
results[0].show()现代单阶段架构的优势#
单阶段检测器的发展重点一直是克服“准确率与速度”之间的权衡。为了应对训练过程中的类别不平衡问题,人们引入了Focal Loss等技术,确保模型关注难以分类的样本,而不是数量庞大的背景。此外,集成特征金字塔网络 (FPN)使这些模型能够有效检测不同尺度的对象。
如今,研究人员和开发者可以使用Ultralytics Platform等工具,轻松地在自定义数据集上训练这些先进架构;该平台简化了从数据标注到模型部署的工作流程。无论应用于农业还是医疗保健,单阶段检测器的易用性都在推动强大计算机视觉能力的普及。









