目标检测与 Ultralytics YOLO 模型的发展历程
加入我们,一起回顾目标检测的发展历程。我们将重点介绍 YOLO(只看一次)模型近年来的发展。

计算机视觉是人工智能 (AI) 的一个子领域,专注于教会机器观察和理解图像与视频,这与人类感知现实世界的方式相似。虽然识别物体或识别动作对人类来说是本能,但对机器而言,这些任务需要特定且专业的计算机视觉技术。例如,计算机视觉的一项关键任务是目标检测,即识别和定位图像或视频中的物体。
自 20 世纪 60 年代以来,研究人员一直在努力改进计算机检测物体的能力。早期方法(如模板匹配)会在图像上滑动预定义模板来寻找匹配项。尽管这些方法颇具创新性,但它们难以应对物体大小和方向以及光照的变化。如今,我们拥有先进模型,例如能够以出色的精度检测小型和部分隐藏物体(称为遮挡物体)的 Ultralytics YOLO11。
随着计算机视觉不断发展,回顾这些技术的发展历程非常重要。在本文中,我们将探索目标检测的演进,并深入了解YOLO(只看一次)模型的转变。让我们开始吧!
计算机视觉的起源#
在深入了解目标检测之前,我们先来看看计算机视觉是如何起步的。计算机视觉的起源可以追溯到 20 世纪 50 年代末和 60 年代初,当时科学家开始探索大脑处理视觉信息的方式。在对猫进行的实验中,研究人员 David Hubel 和 Torsten Wiesel 发现,大脑会对边缘和线条等简单图案产生反应。这为特征提取的理念奠定了基础,即视觉系统会先检测和识别图像中的边缘等基本特征,然后再处理更复杂的图案。

图 1。了解猫脑对光条的反应,有助于推动计算机视觉中特征提取的发展。
大约在同一时期,一项能够将实体图像转换为数字格式的新技术出现了,引发了人们对机器处理视觉信息方式的兴趣。1966 年,麻省理工学院 (MIT) 的夏季视觉项目进一步推动了这一领域的发展。尽管该项目并未完全成功,但其目标是创建一个能够在图像中分离前景和背景的系统。对许多视觉 AI 社区成员而言,该项目标志着计算机视觉作为一门科学领域正式起步。
了解目标检测的历史#
随着计算机视觉在 20 世纪 90 年代末和 21 世纪初不断发展,目标检测方法也从模板匹配等基础技术转向了更先进的方法。其中一种流行方法是 Haar Cascade,它被广泛用于人脸检测等任务。该方法通过滑动窗口扫描图像,检查图像各个区域中的边缘或纹理等特定特征,然后将这些特征结合起来检测物体,例如人脸。Haar Cascade 的速度远快于之前的方法。

图 2。使用 Haar Cascade 进行人脸检测。
与此同时,定向梯度直方图 (HOG) 和支持向量机 (SVMs) 等方法也相继出现。HOG 使用滑动窗口技术分析图像小区域中光线和阴影的变化,帮助根据物体的形状识别物体。随后,SVMs 对这些特征进行分类,以确定物体的身份。这些方法提高了精度,但在真实环境中仍然表现不佳,而且与如今的技术相比速度较慢。
对实时目标检测的需求#
在 2010 年代,深度学习和卷积神经网络 (CNNs)的兴起推动了目标检测的重大转变。CNNs 让计算机能够从大量数据中自动学习重要特征,从而大幅提高检测精度。
R-CNN(基于区域的卷积神经网络)等早期模型显著提高了精度,帮助计算机比旧方法更准确地识别物体。
然而,这些模型需要分多个阶段处理图像,因此速度较慢,难以用于自动驾驶汽车或视频监控等领域的实时应用。
为了提高速度,研究人员开发了更高效的模型。Fast R-CNN 和 Faster R-CNN 等模型改进了感兴趣区域的选择方式,并减少了检测所需的步骤。这虽然加快了目标检测速度,但对于许多需要即时结果的实际应用来说仍然不够快。日益增长的实时检测需求推动了更快速、更高效解决方案的发展,使其能够兼顾速度和精度。

图 3。R-CNN、Fast R-CNN 和 Faster R-CNN 的速度对比。
YOLO(只看一次)模型:一个重要里程碑#
YOLO是一种目标检测模型,通过实现图像和视频中多个物体的实时检测,重新定义了计算机视觉,使其与之前的检测方法有明显不同。它不会单独分析每个检测到的物体,而是通过 YOLO 的架构将目标检测视为单一任务,利用 CNNs 一次性预测物体的位置和类别。
该模型会将图像划分为网格,每个部分负责检测其对应区域中的物体。它会对每个区域进行多次预测,并过滤掉置信度较低的结果,只保留准确的结果。

图 4。 YOLO 工作原理概览。
YOLO 引入计算机视觉应用后,目标检测比早期模型更快速、更高效。凭借速度和精度优势,YOLO 很快成为制造业、医疗保健和机器人等行业实时解决方案的热门选择。
另一个需要注意的重要方面是,由于 YOLO 是开源的,开发者和研究人员能够持续改进它,从而推动了更多先进版本的诞生。
从 YOLO 到 Ultralytics YOLO11 的发展历程#
YOLO 模型随着时间推移不断改进,在每个版本的进步基础上持续发展。除了性能提升之外,这些改进还让不同技术水平的用户更容易使用这些模型。
例如,Ultralytics YOLOv5推出后,借助 PyTorch,部署模型变得更加简单,让更多用户能够使用先进 AI。它兼顾了精度和易用性,让更多人无需成为编程专家也能实现目标检测。

图 5。YOLO 模型的演进。
Ultralytics YOLOv8通过增加实例分割等任务的支持,并让模型更加灵活,延续了这一发展势头。现在,无论是基础应用还是更复杂的应用,使用 YOLO 都更加容易,因此它适用于各种场景。
在最新模型 Ultralytics YOLO11 中,模型得到了进一步优化。通过减少参数数量并提高精度,它如今更适合实时任务。无论你是经验丰富的开发者,还是刚接触 AI 的新手,YOLO11 都能提供一种先进且易于使用的目标检测方案。
认识 Ultralytics YOLO11:新功能与改进#
YOLO11 在 Ultralytics 年度混合活动 YOLO Vision 2024 (YV24)上发布,支持与 YOLOv8 相同的计算机视觉任务,例如目标检测、实例分割、图像分类和姿态估计。因此,用户无需调整工作流程即可轻松切换到这一新模型。此外,YOLO11 升级后的架构让预测更加精确。事实上,在 COCO 数据集上,YOLO11m 的平均精度均值 (mAP) 更高,同时参数数量比 YOLOv8m 少 22%。
YOLO11 还经过专门设计,能够在各种平台上高效运行,从智能手机和其他边缘设备到更强大的云系统都能支持。这种灵活性确保它在不同硬件配置下用于实时应用时都能流畅运行。此外,YOLO11 速度更快、效率更高,能够降低计算成本并缩短推理时间。无论你使用的是 Ultralytics Python 软件包还是无代码 Ultralytics HUB,都可以轻松将 YOLO11 集成到现有工作流程中。
YOLO 模型与目标检测的未来#
先进目标检测对实时应用和边缘 AI 的影响已经在各个行业中显现。随着石油和天然气、医疗保健以及零售等行业越来越依赖 AI,对快速、精确目标检测的需求也在持续增长。Ultralytics YOLO11 旨在满足这一需求,即使在计算能力有限的设备上也能实现高性能检测。
随着边缘 AI不断发展,Ultralytics YOLO11 等目标检测模型很可能会变得更加重要,尤其是在速度和精度至关重要的环境中进行实时决策时。随着设计和适应性的持续改进,目标检测的未来有望在各种应用中带来更多创新。
要点总结#
目标检测已经走过了漫长的发展历程,从简单方法演进到如今先进的深度学习技术。YOLO 模型一直是这一进步的核心,在各个行业中实现了更快速、更精确的实时检测。Ultralytics YOLO11 延续了这一传统,通过提升效率、降低计算成本和增强精度,成为各种实时应用的可靠选择。随着 AI 和计算机视觉不断发展,目标检测的未来一片光明,在速度、精度和适应性方面仍有进一步提升的空间。
对 AI 感兴趣吗?加入我们的社区,持续学习!访问我们的 GitHub 代码库,了解我们如何利用 AI 在制造业和医疗等行业创建创新解决方案。🚀









