2025 年目标检测深度学习指南
了解目标检测、其在 AI 中的重要性,以及像 YOLO11 这样的模型如何改变自动驾驶、医疗保健和安防等行业。

许多行业正在迅速将人工智能(AI)解决方案集成到其业务运营中。在当今众多的AI技术中,计算机 vision 是最受欢迎的技术之一。Computer vision 是AI的一个分支,它帮助计算机像人类一样看到并理解图像和视频的内容。它使机器能够识别对象、识别模式并理解它们所看到的内容。
全球计算机 vision 市场价值预计到2032年将增长到1,757.2亿美元。计算机 vision 包含各种任务,使 vision AI 系统能够分析和解释视觉数据。对象检测是计算机 vision 最广泛使用且最重要的任务之一。
对象检测专注于在视觉数据中定位和分类对象。例如,如果你向计算机展示一张奶牛的图片,它就可以检测出奶牛并在其周围绘制一个边界框。这种能力在动物监测、自动驾驶汽车和监控等现实应用中非常有用。
那么,如何执行对象检测呢?一种方法是通过 computer vision 模型。例如,Ultralytics YOLO11 是一个支持对象检测等 computer vision 任务的 computer vision 模型。
在本指南中,我们将探索目标检测及其工作原理。我们还将讨论目标检测和Ultralytics YOLO11的一些实际应用。

图 1. 使用 YOLO11 对对象检测的支持来监测牛群。
什么是目标检测?#
目标检测是一种识别并定位图像或视频中对象的计算机视觉任务。它回答了两个关键问题:“图像中有什么对象?”以及“它们位于哪里?”
你可以将目标检测视为一个包含两个关键步骤的过程。第一步是对象分类,它允许系统识别并标记对象,例如根据学习到的模式识别猫、汽车或人。第二步是定位,它通过在对象周围绘制边界框来确定其位置,指示它在图像中出现的位置。这些步骤共同使机器能够检测并理解场景中的对象。
对象检测的独特之处在于它能够识别对象并精确指出其位置。其他 computer vision 任务则侧重于不同的目标。
例如,图像分类为整个图像分配一个标签。同时,图像分割提供了对不同元素的像素级理解。另一方面,目标检测结合了识别与定位。这使其在实时计数多个对象等任务中特别有用。

图 2. 比较 computer vision 任务。
对象识别与目标检测#
在你探索各种计算机视觉术语时,可能会觉得对象识别和目标检测是可以互换的——但它们的目的不同。理解这种差异的一个好方法是观察人脸检测和人脸识别。
人脸检测是一种目标检测。它识别图像中人脸的存在,并使用边界框标记其位置。它回答了“图像中的人脸在哪里?”这个问题。这项技术通常用于自动对焦人脸的智能手机摄像头,或检测人员在场的安防摄像头。
另一方面,面部识别是对象识别的一种形式。它不仅能检测人脸,还能通过分析独家特征并将其与数据库进行比较来识别它是谁的脸。它回答了“这个人是谁?”这个问题。这是通过面部ID解锁手机或机场安检系统验证身份背后的技术。
简而言之,目标检测查找并定位对象,而对象识别则对它们进行分类和辨识。

图 3. 目标检测与对象识别。图片由作者提供。
许多目标检测模型,例如 Ultralytics YOLO11,旨在支持人脸检测而不是人脸识别。YOLO11 可以高效识别图像中人脸的存在并在其周围绘制边界框,使其适用于监控系统、人群监测和自动照片标记等应用。然而,它无法确定是谁的面孔。YOLO11 可以与专门针对人脸识别训练的模型(例如 Facenet 或 DeepFace)集成,从而在单个系统中实现检测和识别。
了解目标检测的工作原理#
在讨论目标检测的工作原理之前,让我们先仔细看看计算机是如何分析图像的。计算机不是像我们一样看图像,而是将其分解为称为像素的微小方块网格。每个像素都包含计算机可以处理以解释视觉数据的颜色和亮度信息。
为了理解这些像素,算法会根据形状、颜色以及它们的接近程度,将它们归类为有意义的区域。像 Ultralytics YOLO11 这样的目标检测模型可以识别这些像素组中的模式或特征。
例如,自动驾驶汽车不像我们那样看行人 —— 它检测符合行人特征的形状和模式。这些模型依赖于对带有标签的图像数据集的大量训练,使它们能够了解汽车、交通标志和人等对象的独特特征。
典型的目标检测模型有三个关键部分:backbone、neck和head。Backbone用于提取图像中的重要特征。Neck对这些特征进行处理和精炼,而head则负责预测对象位置并进行分类。
优化检测结果并展示结果#
一旦进行了初始检测,就会应用后处理技术来提高准确率并过滤掉冗余预测。例如,移除重叠的边界框,确保只保留最相关的检测结果。此外,会为每个检测到的对象分配置信度得分(表示模型对检测到的对象属于特定类别的确信程度的数值),以指示模型对其预测的确定性。
最后,输出结果会在检测到的对象周围绘制边界框,并附上预测的类别标签和置信度分数。然后,这些结果可用于实际应用中。
流行的目标检测模型#
如今,有许多 computer vision 模型可用,其中最受欢迎的一些是 Ultralytics YOLO 模型。它们以速度、准确率和多功能性而闻名。多年来,这些模型变得更快、更精确,并能够处理更广泛的任务。Ultralytics YOLOv5 的发布通过 PyTorch 等框架使部署变得更容易,使更多人能够使用先进的 vision AI,而无需深厚的技术专业知识。
Ultralytics YOLOv8 在此基础之上引入了实例分割、姿态估计和图像分类等新功能。现在,YOLO11 在多个任务上具有更好的性能,将事情推向了更高的水平。与 YOLOv8m 相比,YOLO11m 的参数减少了 22%,在 COCO 数据集上实现了更高的平均精度均值 (mAP)。简而言之,YOLO11 能够在消耗更少资源的同时以更高的精度识别对象,从而使其更快、更可靠。
无论是人工智能专家还是刚刚起步的新手,Ultralytics YOLO11 都为计算机视觉应用提供了强大且易用的解决方案。
针对目标检测进行自定义模型训练#
训练视觉AI模型涉及帮助计算机识别并理解图像和视频。然而,训练可能是一个耗时的过程。迁移学习利用已经识别出常见模式的预训练模型,从而加快了速度,无需从头开始。
例如,Ultralytics YOLO11 已经在包含各种日常物品的 COCO dataset 上进行了训练。这个预训练模型可以进一步通过自定义训练,来检测原始数据集中可能未包含的特定物体。
要custom-train Ultralytics YOLO11,你需要一个包含要检测的对象图像的标注数据集。例如,如果你想构建一个模型来识别杂货店中不同类型的水果,你可以创建一个包含苹果、香蕉、橙子等标注图像的数据集。准备好数据集后,就可以训练 YOLO11,调整批大小、学习率和训练轮数等参数以优化性能。
通过这种方法,企业可以训练 Ultralytics YOLO11 检测任何事物,从制造业中的缺陷零件到保护项目中的野生动物物种,从而根据自身的确切需求定制模型。
目标检测的应用#
接下来,让我们看一些目标检测的实际用例,以及它是如何改变各个行业的。
自动驾驶中的危险检测#
自动驾驶汽车使用对象检测等 computer vision 任务来安全导航并避开障碍物。这项技术帮助它们识别行人、其他车辆、坑洼和道路危险,使它们能够更好地理解周围环境。通过不断分析环境,它们可以做出快速决策并在交通中安全行驶。

Fig 4. 使用 Ultralytics YOLO11 进行目标检测以识别路面坑洼的示例。
医疗保健中的医学影像分析#
医学影像技术(如X光、MRI、CT扫描和超声波)创建了人体的高详细图像,以帮助诊断和治疗疾病。这些扫描产生了大量数据,医生(如放射科医生和病理学家)必须仔细分析这些数据以检测疾病。然而,详细审查每图像可能很耗时,且人类专家有时可能会因疲劳或时间限制而漏掉细节。
像 Ultralytics YOLO11 这样的目标检测模型可以通过高精度自动识别医学扫描中的关键特征(例如器官、肿瘤或异常情况)来提供帮助。自定义训练的模型可以用边界框突出显示受关注的区域,帮助医生更快地关注潜在问题。这减少了工作量,提高了效率,并提供了快速的见解。

Fig 5. 使用 Ultralytics YOLO11 分析医学图像。
利用人员和异常检测提高安全性#
Object tracking 是 Ultralytics YOLO11 支持的一项计算机视觉任务,能够实现实时监控和安全增强。它在目标检测的基础上,通过识别物体并持续追踪它们在各帧之间的运动来实现这一点。这项技术广泛用于监控系统,以改善各种环境下的安全性。
例如,在学校和日托中心,目标 tracking 可以帮助监控儿童并防止他们走失。在安全应用中,它在检测受限区域的入侵者、监控人群是否拥挤或有可疑行为,以及在检测到未经授权的活动时发送实时警报方面发挥着关键作用。通过在物体移动时进行追踪,由 Ultralytics YOLO11 驱动的 tracking 系统增强了安全性,实现了监控自动化,并能更快地对潜在威胁做出响应。
目标检测的优缺点#
以下是目标检测能为各个行业带来的一些关键好处:
- 自动化: 目标检测有助于减少在监控CCTV录像等任务中对人工监督的需求。
- 与其他AI模型协同工作: 它可以与人脸识别、动作识别和追踪系统集成,以提高准确性和功能。
- 实时处理: 许多目标检测模型(如 Ultralytics YOLO11)快速且高效,非常适合需要即时结果的实时应用。
虽然这些好处突显了目标检测对不同用例的影响,但考虑其实现过程中涉及的挑战也很重要。以下是一些关键挑战:
-
数据隐私: 视觉数据的使用,特别是在监控或医疗保健等敏感领域,可能会引发隐私问题和安全顾虑。
-
遮挡: 目标检测中的遮挡发生在对象被部分遮挡或从视野中隐藏时,使得模型难以准确地检测和分类它们。
-
计算成本高: 高性能模型通常需要功能强大的GPU(图形处理单元)进行处理,这使得实时部署的成本很高。
关键要点#
目标检测是计算机视觉中一项具有变革意义的工具,它帮助机器在图像和视频中检测并定位物体。它正被应用于从自动驾驶汽车到医疗保健等各个领域,使任务变得更简单、更安全、更高效。借助像 Ultralytics YOLO11 这样更新的模型,企业可以轻松创建自定义目标检测模型,以构建专门的计算机视觉应用。
虽然存在隐私问题和对象被遮挡等挑战,但目标检测仍然是一项可靠的技术。它在自动化任务、实时处理视觉数据以及与其他视觉AI工具集成方面的能力,使其成为尖端创新的重要组成部分。
要了解更多信息,请访问我们的 GitHub 仓库并与我们的社区互动。在我们的解决方案页面上探索诸如自动驾驶汽车中的AI和农业中的 computer vision等行业的创新。查看我们的 YOLO 许可选项并将你的 vision AI 项目变为现实。 🚀






