Object Detection Architectures
探索从骨干网络到检测头的目标检测架构。了解 Ultralytics YOLO26 如何为实时计算机视觉提供领先的速度和准确率。
目标检测架构是用于识别和定位视觉数据中各类对象的神经网络结构蓝图。在更广泛的计算机视觉(CV)领域中,这些架构通过将原始像素数据处理为有意义的洞察,定义了机器如何“看见”世界。不同于仅为图像添加标签的基础分类模型,目标检测架构旨在为其发现的每个独立对象输出一个边界框、类别标签和置信度分数。这种结构设计决定了模型的速度、准确率和计算效率,因此在为实时推理或高精度分析选择模型时,它是关键因素。
架构的核心组件#
虽然具体设计各不相同,但大多数现代架构都包含三个基本组件:骨干网络、颈部和检测头。骨干网络充当主要的特征提取器。它通常是一个在ImageNet等大型数据集上预训练的卷积神经网络(CNN),负责识别基本形状、边缘和纹理。常见的骨干网络包括ResNet和 CSPDarknet。
颈部将骨干网络连接到最终输出层。它的作用是混合并组合来自骨干网络不同阶段的特征,以确保模型能够检测不同大小的对象——这一概念称为多尺度特征融合。架构通常会在此处使用特征金字塔网络(FPN)或路径聚合网络(PANet),以丰富传递到预测层的语义信息。最后,检测头会处理这些融合后的特征,预测每个对象的具体类别和坐标位置。
演进:两阶段与单阶段#
从历史上看,架构主要分为两大类。两阶段检测器(例如R-CNN 系列)首先提出可能存在对象的感兴趣区域(RoIs),然后在第二步对这些区域进行分类。虽然通常具有较高的准确率,但它们的计算开销往往过大,不适合边缘设备。
相比之下,单阶段检测器将检测视为一个简单的回归问题,在单次前向处理中直接将图像像素映射为边界框坐标和类别概率。这种方法由 YOLO(只看一次)系列率先采用,通过实现实时性能彻底改变了整个行业。现代技术进步最终促成了YOLO26等模型的诞生,它们不仅具备更出色的速度,还采用了端到端、无需 NMS 的架构。通过消除非极大值抑制(NMS)后处理的需求,这些新型架构降低了延迟波动,这对安全关键系统至关重要。
实际应用#
架构的选择会直接影响各行业 AI 解决方案的成效。
- **零售自动化:**在智能超市中,高效的单阶段架构可以实现自动结账系统,立即识别传送带上或购物车中的商品,从而减少等待时间和人为错误。
- **医疗诊断:**高精度架构用于医学图像分析,以检测 X 射线或 MRI 扫描中的肿瘤等异常。在此场景中,架构保留细粒度细节的能力比原始处理速度更为重要。
区分相关术语#
有必要将检测架构与类似的计算机视觉任务区分开来:
- 与图像分类的对比:图像分类架构(如 VGG 或 EfficientNet)会为整张图像分配一个标签(例如“猫”)。它不会告诉你猫在哪里,也不会告诉你图像中是否有多只猫,而这正是检测架构的主要功能。
- **与实例分割的对比:**检测会在对象周围绘制边界框,而实例分割则会识别每个对象精确到像素级的轮廓(掩码)。分割架构通常是检测架构的扩展版本(例如,在检测头中添加掩码分支)。
使用 Ultralytics 实现#
现代框架已经将这些架构的复杂性抽象化,使开发者只需编写少量代码即可利用最先进的设计。使用 ultralytics 软件包,你可以加载预训练的YOLO26模型并立即运行推理。对于希望在云端管理数据集并训练自定义架构的团队,Ultralytics Platform可以简化整个 MLOps 流程。
from ultralytics import YOLO
# Load the YOLO26n model (nano version for speed)
model = YOLO("yolo26n.pt")
# Run inference on an image source
# This uses the model's architecture to detect objects
results = model("https://ultralytics.com/images/bus.jpg")
# Display the results
results[0].show()








