探索使用 Ultralytics YOLO11 进行小目标检测
了解 Ultralytics YOLO11 如何在监控和机器人等现实应用中实现快速、准确的小目标检测。

集成视觉 AI 的无人机可以在距地面数百米的高空飞行,但仍需要检测其视频画面中仅占几个像素的人。事实上,这是机器人、监控和遥感等应用中的常见挑战,因为这些系统必须识别图像中非常小的目标。
但传统的目标检测模型可能难以做到这一点。图像和视频中的小目标所包含的视觉信息非常有限。简单来说,当模型观察这些目标时,几乎没有太多细节可供学习或识别。
在底层,这些模型通常依赖基于卷积神经网络 (CNN) 的架构。图像会经过网络的各个层,并被转换为特征图或简化表示,突出显示相关模式,而不是原始像素。
随着图像在网络中不断深入,这些特征图会变得越来越小。这会加快计算速度,但也意味着精细细节可能会消失。
对于微小目标而言,这些细节至关重要。一旦细节消失,计算机视觉模型可能难以检测到目标,从而导致边界框不够准确或不一致。
实时端到端计算机视觉系统让问题变得更加棘手。高分辨率图像有助于保留细节,但会减慢推理速度并需要更多 GPU 算力。较低分辨率运行速度更快,但小目标会变得更加难以检测。
这会持续考验速度、准确率和硬件限制之间的平衡。得益于近期的技术进步,像 Ultralytics YOLO11 和即将推出的 Ultralytics YOLO26 这样的计算机视觉模型,能够更有效地应对这种权衡。

图 1. 使用 YOLO11 检测航空影像中的小目标(来源)
在本文中,我们将探讨小目标检测为何困难,以及 Ultralytics YOLO11 如何让这一过程更加轻松。让我们开始吧!
什么是小目标检测?它为什么重要?#
小目标检测是计算机视觉中的一项任务,而计算机视觉是 AI 的一个分支,专注于识别和定位仅占图像很小一部分的目标。这些目标在图像中通常只由有限数量的像素表示,而像素是数字图像的最小单位。因此,与更大、更清晰的目标(通常包含更多像素)相比,它们更难检测。
例如,航空影像中的车辆、工厂车间里的工具,或广角监控摄像头拍摄到的人,都可能在图像中呈现为小目标。检测这些目标非常重要,因为它们往往包含关键信息,许多现实应用(例如监控)都依赖这些检测结果才能正常运行。
漏检小目标可能影响系统性能和决策。例如,无人机 (UAV) 监控就是一个很好的例子:漏掉地面上正在移动的小目标,可能会影响导航或跟踪的准确性。
检测小目标所面临的挑战#
早期系统使用手工设计的特征和传统计算机视觉方法,在复杂或多变的场景中表现不佳。即使在今天,深度学习模型的性能已经大幅提升,但当小目标只占图像极小一部分时,检测它们仍然很困难。
接下来,让我们看看在不同现实场景中检测小目标时经常遇到的一些挑战。
尺寸、像素与信息丢失#
小目标包含的像素非常少,这限制了模型在特征提取等阶段能够学习到的视觉细节。因此,边缘、形状和纹理等模式更难检测,小目标也更容易与背景融为一体。
当图像经过神经网络的卷积层时,像素中的视觉信息会逐渐被压缩为特征图。这有助于模型保持高效,但也意味着精细细节会逐渐淡化。

图 2. 特征图表示图像中的视觉模式(来源)
对于小目标,重要线索可能会在检测网络来得及发挥作用之前消失。发生这种情况时,定位会变得不可靠,边界框可能发生偏移、重叠,或完全漏掉目标。
遮挡、尺度变化与上下文#
与尺寸相关的挑战通常也会由遮挡引起。当场景中的其他目标部分遮住目标(尤其是较小的目标)时,就会发生遮挡。
这会缩小目标的可见区域,从而限制目标检测器可利用的信息。即使是轻微遮挡,也可能使检测网络产生混淆,尤其是在与低分辨率输入结合时。一个有趣的例子可以在 VisDrone 等 UAV 数据集中看到:行人、自行车或车辆可能会被建筑物、树木或其他移动目标部分遮挡。

图 3. VisDrone 数据集中展示小目标的示例(来源)
同样,当同一个目标因距离和摄像头位置不同而呈现出很小或相对较大的尺寸时,尺度变化会带来另一层困难。尽管存在这些障碍,检测算法仍必须在不同尺度下识别这些小目标,同时不损失准确性。
上下文在检测中也发挥着重要作用。例如,大目标通常具有清晰的周围环境,可以提供有用的视觉线索。另一方面,小目标通常缺少这些上下文信息,使模式识别更加困难。
小目标检测中的隐藏指标问题#
常见的评估指标(例如交并比 (IoU))用于衡量预测边界框与真实框的重叠程度。IoU 对较大目标效果很好,但对小目标的表现却大不相同。
小目标只占据几个像素,因此预测框即使发生轻微偏移,也可能造成很大的比例误差,并使 IoU 分数大幅下降。这意味着,即使目标在图像中清晰可见,小目标也经常无法达到用于判定预测正确的标准 IoU 阈值。
因此,定位误差更可能被归类为误报或漏报。这些限制促使研究人员重新思考目标检测系统应如何评估和处理小型且难以检测的目标。
多尺度特征:实时小目标检测的关键#
随着研究人员不断改进小目标检测,人们逐渐明确,在多个尺度上保留并表示视觉信息至关重要。近期的 arXiv 研究以及在 IEEE 国际会议和欧洲计算机视觉协会 (ECCV) 等学术会议上发表的论文,也体现了这一认识。
随着图像在神经网络中不断深入,小目标可能丢失细节,甚至完全消失,这也是现代计算机视觉模型(如 Ultralytics YOLO11)高度重视改进特征提取的原因。接下来,让我们了解特征图和特征金字塔网络背后的核心概念,以便更好地理解它们。
特征图与尺度表示#
当输入图像(例如遥感图像)进入神经网络后,会逐渐转换为特征图。这些特征图是图像的简化表示,突出显示边缘、形状和纹理等视觉模式。
随着网络不断加深,这些特征图的空间尺寸会变小。这种缩减有助于模型高效运行并专注于高层信息。然而,尺寸缩小以及深层特征图也会减少空间细节。

图 4. 特征提取是小目标检测的关键。(来源)
虽然大目标能够保留足够的视觉信息以实现准确检测,但小目标可能仅经过几层网络就丢失关键细节。发生这种情况时,模型可能难以识别出小目标的存在。这是深度目标检测模型漏检小目标的主要原因之一。
特征金字塔网络与多尺度学习#
特征金字塔网络通常称为 FPN,它们旨在解决空间细节丢失问题,并作为支持模块组合多个网络层的信息,使模型能够更有效地检测小目标。这一过程也称为特征聚合和特征融合。
浅层提供精细的空间细节,深层则增加语义上下文,从而实现有效的多尺度特征学习。与仅仅放大特征图的简单上采样不同,FPN 能够保留有意义的信息并改进小目标检测。
现代方法在这一理念基础上,采用自适应特征融合和上下文感知设计,进一步增强小目标检测能力。换句话说,FPN 能帮助模型同时看到全局和微小细节。在目标较小时,这种优化至关重要。
目标检测模型如何演进以处理小目标#
下面简要介绍目标检测模型如何随着时间推移不断演进和发展,以更好地检测不同尺寸的目标,包括非常小的目标:
- 早期检测方法: 早期目标检测方法依赖手工设计的特征和源于经典图像处理的基于规则的算法。由于这些特征是固定的,面对不同图像时性能会下降。
- 机器学习和深度学习的引入: 机器学习和深度学习的采用标志着目标检测研究的一次重大转变。神经网络不再依赖预定义规则,而是直接从训练数据中学习视觉表示,从而提高了对不同目标尺寸和场景的适应能力。
- 卷积网络: 这些神经网络能够学习识别图像中的模式。每一层都会捕捉不同的细节,从简单的边缘和颜色开始,然后是形状,最终识别完整目标,因此它们是现代计算机视觉的基础。
- 两阶段目标检测器: Girshick 和 Ren 提出的两阶段检测器(例如 Faster R-CNN)首先生成候选区域,然后对其进行分类。这种方法提高了小目标的检测准确率,但增加了计算成本并降低了实时性能。
- 单阶段目标检测器: 单阶段检测器(例如 SSD(单次检测器)和 YOLO(只看一次)系列,包括 YOLOv3、Ultralytics YOLOv5 以及之后的 Ultralytics YOLOv8)只需一次前向传递即可完成检测。这种设计在保持有竞争力的准确率的同时,显著提高了推理速度。
- 最新的先进模型: 新一代目标检测模型更加重视实时性能和边缘部署。近期发布的 Ultralytics YOLO 模型(如 Ultralytics YOLO11 和即将推出的 Ultralytics YOLO26)旨在平衡高准确率与低延迟推理,因此非常适合在计算能力有限的设备上检测各种尺寸的目标,包括小目标。
使用 Ultralytics YOLO11 检测小目标的应用场景#
现在我们已经更好地理解了小目标检测的工作原理,接下来看看 Ultralytics YOLO11 可以应用于哪些现实场景。
UAV 与航空成像#
想象一架无人机在繁忙的城市街道上空高高飞行。从这个高度看,汽车、自行车,甚至行人都会缩小为屏幕上的几个像素。
UAV 和航空成像模块经常拍摄这样的场景,其中目标很小,且被杂乱的背景包围,这使计算机视觉模型难以检测它们。
在这类场景中,Ultralytics YOLO11 可能是理想的模型选择。例如,搭载 YOLO11 这类模型的无人机可以实时监控交通,检测场景中移动的车辆、自行车骑行者和行人,即使每个目标只占图像很小的一部分。这能够为交通管理、公共安全或城市规划等应用带来更快的决策和更准确的洞察。
机器人与自动化#
机器人通常用于准确性和时效性至关重要的环境中。在仓库、工厂和农场等场所,机器人可能需要识别非常小的目标,例如装配线上的零件、包装上的标签或田间的小植物芽,并迅速做出响应。
检测这类尺寸的目标可能很复杂,尤其是当它们在摄像头画面中只占几个像素,或被其他目标部分遮挡时。忽略这些细节可能会减慢自动化流程,或影响机器人完成任务的能力。
Ultralytics YOLO11 可以在这些场景中发挥作用。其改进的特征提取能力和快速推理速度,使机器人能够实时检测小目标并立即采取行动。
Ultralytics YOLO11 还支持实例分割,这可以帮助机器人更精确地理解目标边界和抓取点,而不仅仅是定位大致的边界框。例如,集成 YOLO11 的机械臂可以发现传送带上的小型组件,分割出它们的精确形状,并在组件移出可触及范围前将其拾起,帮助系统保持高效可靠。
是什么让 Ultralytics YOLO11 在小目标检测方面表现出色#
如今有如此多的计算机视觉模型可供选择,你可能会想知道,Ultralytics YOLO11 的优势在哪里。
以下是 Ultralytics YOLO11 适合需要检测小目标的应用的一些原因:
- 更好的特征提取:YOLO11 采用改进的骨干网络和颈部网络架构来增强特征提取,从而实现更精确的目标检测。
- 生态系统与易用性:Ultralytics Python 软件包是一个提供内置函数的库,可用于加载、训练、验证和部署 YOLO11 等模型。由于这些工作流只需几行代码,团队可以快速试验模型,并针对小目标检测进行微调。
- 针对边缘部署进行了优化: Ultralytics YOLO11 可以在 NVIDIA Jetson、Raspberry Pi 和工业相机系统等边缘设备上高效运行。简单来说,它能够直接在设备上执行实时视觉 AI 任务。
使用 Ultralytics YOLO11 检测小目标的实用策略#
除了使用 Ultralytics YOLO11 这样的模型外,你准备标注数据的方式、整体数据集以及模型训练流程,也会显著影响检测性能。
下面快速概览一下需要重点关注的方面:
- 适当的数据增强: 轻量级数据增强(例如缩放或裁剪)可以帮助模型泛化到新图像。但过于激进的大幅度增强可能会扭曲或移除小目标,使模型更难学习。
- 分析失败案例: 分析模型漏检或误识别目标的位置,有助于建立基线,并确定问题源于数据集、特征提取过程中的信息丢失,还是需要调整训练设置。
- 数据集构成: 你的数据集应包含足够多的小目标示例,让模型能够学习有意义的模式,同时还应保持平衡,避免较大目标在训练期间压过较小目标。
要点总结#
小目标检测之所以困难,是因为目标在经过计算机视觉模型时会丢失细节。Ultralytics YOLO11 改进了这些细节的保留方式,使小目标检测更加可靠,同时不牺牲实时性能。这种平衡让 YOLO11 能够在现实应用中支持准确且高效的检测。
加入不断壮大的社区!访问我们的 GitHub 代码库,进一步了解 AI。访问我们的解决方案页面,探索零售业中的计算机视觉和汽车行业中的 AI等创新。想立即开始使用计算机视觉构建解决方案,请查看我们的许可选项。









