Ultralytics YOLO27:
指南

如何提升模型在小目标上的 mAP:快速指南

了解如何提升模型在小目标上的 mAP,并掌握数据质量、数据增强、训练策略、评估和部署方面的实用技巧。

ABAbirami Vina8 分钟阅读
提升目标检测模型在小目标上的 mAP

随着人工智能(AI)、机器学习和计算机视觉的应用不断增长,目标检测系统已广泛应用于各种场景,从智能交通摄像头到无人机和零售分析工具。这些系统通常需要检测各种尺寸的目标,无论是靠近摄像头的大卡车,还是远处的小行人。

通常,识别大而清晰可见的目标比较容易。相比之下,小目标检测更具挑战性。

当一个物体只占图像中很小一部分时,可供利用的视觉信息就非常有限。交通监控画面中的远处行人,或航拍图像中的小型车辆,可能只有几个像素,但这些像素可能包含关键信息。

像 计算机视觉模型这样的 Ultralytics YOLO 模型依赖视觉模式来识别物体;当这些模式有限或不清晰时,性能就会受到影响。处理过程中可能会丢失重要细节,使预测对定位误差更加敏感。即使边界框只发生轻微偏移,也可能导致原本正确的检测变成漏检。

观察模型性能时,这种差距就很明显。大多数检测和分割模型都能很好地处理中型和大型物体,但小物体往往会拉低整体准确率。

深度学习性能通常使用平均精度均值(mAP)来衡量。该指标同时反映检测的准确性,以及预测框与真实物体的贴合程度。

它综合了精确率和召回率:精确率表示预测出的物体中有多少是正确的,召回率表示实际物体中有多少被成功检测到。计算时会考虑不同置信度,以及交并比(IoU,即衡量预测边界框与真实边界框重叠程度的指标)阈值。

此前,我们探讨过小目标检测,以及它为何对计算机视觉模型来说如此棘手。本文将在此基础上,重点介绍如何提升涉及小物体时的 mAP。开始吧!

为什么小物体更难检测?#

对于涉及目标检测器的应用,小物体的定义取决于它在图像中占据的空间大小,而不一定是人眼看起来有多小。如果物体只占图像中很小一部分,它包含的视觉信息就非常有限,计算机视觉算法也就更难准确检测它。

展示小物体仅占据有限像素区域的示例图像

图 1. 展示小物体仅占据有限像素区域的示例图像(来源)

可用像素越少,边缘、形状和纹理等重要细节就越模糊,也更容易丢失。模型处理图像时,会对图像进行缩放和简化,以突出有用的模式。

这有助于模型理解整体场景,但也可能进一步削弱细节。对于小物体而言,这些细节往往是正确检测的关键。

在查看评估指标时,这些挑战会更加明显。小物体尤其容易受到定位误差的影响。边界框即使只有轻微偏移,也可能低于要求的交并比(IoU)阈值。

发生这种情况时,看起来合理的预测也可能被判定为错误。这会同时降低精确率和召回率,最终拉低平均精度均值(mAP)。

由于这些因素密切相关,提升性能往往需要从整个系统的角度进行考虑。这意味着要仔细平衡图像分辨率、特征提取、模型设计和评估设置,以便更好地保留和解读细微的视觉信息。

数据集质量和标注的重要性#

对于小目标检测,数据集质量往往是对性能影响最大的因素。小物体只占图像中很小一部分,因此模型可用于学习的视觉信息非常有限。因此,训练数据尤为重要。如果数据集中缺少足够清晰且具有代表性的示例,目标检测模型就难以识别稳定的模式。

适用于小目标检测的数据集通常包含高分辨率图像、频繁出现的小目标,以及一致的视觉条件。像 COCO 数据集这样的通用数据集虽然是不错的起点,但往往无法匹配特定实际应用中的目标尺度、密度或背景环境。在这种情况下,收集特定领域的训练数据就成了提升模型性能的必要步骤。

标注质量也起着关键作用。标注通过指定正确的物体标签和边界框位置来确立真实值,模型会以此为依据进行学习和预测。

对于小物体,边界框必须绘制得准确且一致。由于小物体对像素级偏移非常敏感,即使框的位置略有不同,也会明显影响定位精度。

质量差或不一致的标注会显著降低 mAP。如果物体标签错误,模型就会学到错误的模式,从而增加误报。

如果图像中存在物体,但真实标注中漏掉了它,那么评估时正确的检测也可能被计为误报。这两种情况都会降低整体性能。

有意思的是,近期研究表明,在标准基准测试中,小物体的平均精度通常仍处于 20% 到 40% 之间,显著低于较大物体。这一差距凸显了数据集设计和标注一致性对整体检测准确率的重要性。

数据增强有助于提升准确率#

了解数据集质量和标注一致性的重要性后,我们来看看目标检测模型如何更有效地从现有数据中学习。即使很难或成本很高,无法收集更多图像,我们仍然可以通过更充分地利用已有数据来提升性能。

最实用的方法之一是数据增强。它在小目标检测中尤其重要,因为小物体能为模型提供的视觉线索更少。通过在训练期间引入可控变化,数据增强可以帮助模型更好地泛化,而无需收集新数据。

有效的数据增强会着重确保小物体清晰可见。适度缩放、轻微裁剪和图像切片等技术,可以让小物体更加醒目,同时保留其形状和外观。目标是让模型更频繁地看到小物体,并在略有不同的条件下观察它们,同时不改变物体在真实场景中的样子。

不过,应用数据增强时需要谨慎。一些变换可能会降低小物体的可见度,或以真实数据中不太可能出现的方式改变物体外观。发生这种情况时,模型可能难以学习准确的物体边界。

利用生成式 AI 实现更智能的数据增强#

另一种日益流行且颇有意思的数据增强方式,是使用生成式 AI 创建合成训练数据。团队不再只依赖人工采集和标注的图像,现在可以生成逼真的场景,模拟特定环境、物体尺寸、光照条件和背景变化。

用于数据增强的合成航拍图像

图 2. 用于数据增强的合成航拍图像示例(来源)

这种方法对小目标检测尤其有用,因为真实场景中的示例可能难以稳定采集。通过控制小物体在合成图像中的呈现方式,例如调整尺度、密度和位置,可以让模型接触到更广泛的训练场景。

如果与真实数据谨慎结合,合成数据增强可以提升模型鲁棒性、降低数据采集成本,并支持更有针对性的性能改进。

影响小物体 mAP 的模型训练选择#

除了数据集质量和标注一致性,模型训练选择也会显著影响小目标检测性能。

以下是一些值得考虑的关键训练策略:

  • 从预训练模型开始: 预训练模型(例如 Ultralytics YOLO26)已经从大型图像数据集中学到了通用视觉模式。与从头开始训练相比,这提供了一个良好的起点,在数据有限的情况下检测小物体时尤其有帮助。
  • 有策略地使用迁移学习: 迁移学习是指将预训练模型调整为适用于你的特定数据集。它能帮助模型专注于你要检测的小物体,同时减少过拟合(记住训练数据,而不是学习通用模式)。
  • 处理类别不平衡: 如果小物体出现的频率低于较大物体,模型可能会优先学习较大的物体。类别加权或采样策略等技术有助于确保模型不会忽略小物体。
  • 调整置信度和 IoU 阈值: 小物体容易受到轻微定位误差的影响。微调这些阈值有助于在验证和推理期间更准确地评估和解读小目标检测性能。

小目标检测的模型架构考量#

虽然你可以使用通用目标检测模型来处理小目标任务,但也有专门设计用于提升小目标检测效果的模型架构。例如,Ultralytics YOLOv8模型有 P2 变体,专门针对保留精细空间细节进行了优化。

Ultralytics YOLOv8 会在图像经过网络深层时逐步缩小图像,从而以多个尺度处理图像。这有助于模型理解整体场景,但也会减少精细细节。

如果物体本来就很小,重要的视觉信息可能会在这一过程中消失。Ultralytics YOLOv8 的 P2 变体通过在其特征金字塔中使用步长 2 来解决这个问题。

特征金字塔是模型的一部分,它会以多个内部尺度分析图像,从而检测不同大小的物体。步长为 2 时,图像在此阶段的缩小过程更加渐进,因此可以保留更多原始的像素级细节。

由于保留了更多空间细节,小物体在网络内部会保留更多可见结构。这让模型更容易定位和检测仅占据几个像素的物体,有助于提升小物体 mAP。

针对小目标检测的尺寸感知评估#

平均精度均值可以概括模型的整体性能,但并不总能体现模型处理不同尺寸物体的能力。对于小物体,性能往往受定位精度而非单纯分类能力的限制,这意味着边界框的轻微偏移也会显著影响结果。

换句话说,模型可能正确识别了物体类别,但如果预测边界框稍有偏移,检测结果仍可能被判定为错误。由于小物体只覆盖少量像素,即使框的位置略有偏移,也会显著降低预测框与真实框的重叠程度。因此,即使物体识别正确,评估分数也可能下降。

评估小目标检测可能并不简单

图 3. 评估小目标检测可能并不简单(来源)

一种信息量更大的方法是按物体尺寸评估性能。大多数广泛使用的基准测试都会分别报告小型、中型和大型物体的平均精度。

这种按尺寸细分的结果能更清楚地展现模型擅长什么、又在哪些方面表现不佳。实际上,小物体 AP通常低于整体 mAP,凸显出汇总指标可能无法体现的定位难题。

考虑部署限制和实际权衡#

从受控测试环境转向真实世界部署时,模型性能往往会发生变化。图像分辨率、处理速度和可用硬件等因素会带来权衡,并直接影响小目标检测。

例如,提高输入分辨率可以提升小物体 mAP,因为小目标会占据更多像素,并保留更多细节。不过,更高的分辨率也会增加内存使用量和处理时间。这可能减慢推理速度并提高运营成本。

小目标检测的部署挑战

图 4. 小目标检测的部署挑战。图片由作者提供。

硬件选择在权衡这些因素时起着关键作用。性能更强的 GPU 支持使用更大的模型并实现更快的处理速度,但部署环境,尤其是边缘设备,通常受到计算和内存资源的限制。

实时应用还面临另一项限制:要保持低延迟,可能需要缩小模型或降低输入分辨率,这会对小物体召回率造成负面影响。最终,部署决策需要在检测性能、硬件限制、速度要求和总体成本之间取得平衡。

综上:提升模型对小物体的 mAP#

提升小目标检测性能需要采用务实且有条理的方法,尤其是在真实环境中开展工作时。以下是需要牢记的主要步骤概览:

  • 检查数据集质量: 确保数据集中包含足够的小物体示例,尽可能使用高分辨率图像,并反映模型的实际部署条件。
  • 核查标注一致性: 确保边界框准确、完整,且标签一致。标注不一致会直接限制定位性能。
  • 有计划地调整训练设置: 合理调整批次大小、训练轮数和优化设置,确保训练过程中充分体现小物体。
  • 逐步迭代: 进行可控调整,衡量调整带来的影响,并不断改进方法。持续以数据为依据进行迭代,才能逐步稳定提升性能。

要点#

提升小物体 mAP 需要采取有条理、以数据为依据的方法,而不是随意调整参数。真正的改进来自优质数据、一致的标注、谨慎的训练和恰当的评估方法相结合。在实际项目中,持续测试并进行小幅、可衡量的调整,才能逐步实现更出色、更可靠的小目标检测。

加入不断壮大的社区,并探索我们的 GitHub 代码库,获取可亲自实践的 AI 资源。现在就通过我们的许可选项了解如何构建视觉 AI。访问我们的解决方案页面,了解 AI 如何改变农业,以及视觉 AI 如何推动机器人领域的发展。

Explore solutions

航空影像计算机视觉

航空影像计算机视觉

借助 Ultralytics YOLO,将无人机和航空影像转化为实时洞察,应用于农业、水产养殖、环境监测、自然保护和地理空间分析。
了解详情
航空航天中的计算机视觉

航空航天中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 应用于航空监测。借助计算机视觉解决方案,赋能无人机、航空航天工作流、环境保护和地理空间行业。
了解详情
安防领域的计算机视觉

安防领域的计算机视觉

使用 Ultralytics YOLO 模型守护每个场所。视觉 AI 可用于周界监控、威胁检测、车牌识别和工作场所安全。
了解详情
机器人领域的计算机视觉

机器人领域的计算机视觉

使用 Ultralytics YOLO 模型提升智能机器的能力。机器人领域的视觉 AI 可用于自主导航、感知、目标跟踪和实时控制。
了解详情
物流中的计算机视觉

物流中的计算机视觉

借助 Ultralytics YOLO 模型优化物流流程。视觉 AI 可用于包裹检查、分拣、车辆跟踪和仓库安全实时监控。
了解详情
零售中的计算机视觉

零售中的计算机视觉

借助 Ultralytics YOLO 模型重新构想零售。视觉 AI 可用于库存跟踪、货架监控、排队管理和更深入的客户洞察。
了解详情
医疗领域的计算机视觉

医疗领域的计算机视觉

借助 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可加快医学影像处理、优化诊断并监测患者。
了解详情
制造业中的计算机视觉

制造业中的计算机视觉

利用 Ultralytics YOLO 模型优化制造流程。视觉 AI 可用于质量控制、缺陷检测、个人防护装备合规检查和装配线自动化。
了解详情
汽车领域的计算机视觉

汽车领域的计算机视觉

利用 Ultralytics YOLO 模型在汽车领域应用计算机视觉。视觉 AI 可提升道路安全、驾驶辅助和车辆自动化水平,让道路更智能。
了解详情
农业中的计算机视觉

农业中的计算机视觉

借助 Ultralytics YOLO 模型,将视觉 AI 引入智慧农业。为作物监测、牲畜追踪和精准农业提供支持,从而提高产量并实现更智能的生产。
了解详情
航空影像计算机视觉

航空影像计算机视觉

借助 Ultralytics YOLO,将无人机和航空影像转化为实时洞察,应用于农业、水产养殖、环境监测、自然保护和地理空间分析。
了解详情
航空航天中的计算机视觉

航空航天中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 应用于航空监测。借助计算机视觉解决方案,赋能无人机、航空航天工作流、环境保护和地理空间行业。
了解详情
安防领域的计算机视觉

安防领域的计算机视觉

使用 Ultralytics YOLO 模型守护每个场所。视觉 AI 可用于周界监控、威胁检测、车牌识别和工作场所安全。
了解详情
机器人领域的计算机视觉

机器人领域的计算机视觉

使用 Ultralytics YOLO 模型提升智能机器的能力。机器人领域的视觉 AI 可用于自主导航、感知、目标跟踪和实时控制。
了解详情
物流中的计算机视觉

物流中的计算机视觉

借助 Ultralytics YOLO 模型优化物流流程。视觉 AI 可用于包裹检查、分拣、车辆跟踪和仓库安全实时监控。
了解详情
零售中的计算机视觉

零售中的计算机视觉

借助 Ultralytics YOLO 模型重新构想零售。视觉 AI 可用于库存跟踪、货架监控、排队管理和更深入的客户洞察。
了解详情
医疗领域的计算机视觉

医疗领域的计算机视觉

借助 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可加快医学影像处理、优化诊断并监测患者。
了解详情
制造业中的计算机视觉

制造业中的计算机视觉

利用 Ultralytics YOLO 模型优化制造流程。视觉 AI 可用于质量控制、缺陷检测、个人防护装备合规检查和装配线自动化。
了解详情
汽车领域的计算机视觉

汽车领域的计算机视觉

利用 Ultralytics YOLO 模型在汽车领域应用计算机视觉。视觉 AI 可提升道路安全、驾驶辅助和车辆自动化水平,让道路更智能。
了解详情
农业中的计算机视觉

农业中的计算机视觉

借助 Ultralytics YOLO 模型,将视觉 AI 引入智慧农业。为作物监测、牲畜追踪和精准农业提供支持,从而提高产量并实现更智能的生产。
了解详情
航空影像计算机视觉

航空影像计算机视觉

借助 Ultralytics YOLO,将无人机和航空影像转化为实时洞察,应用于农业、水产养殖、环境监测、自然保护和地理空间分析。
了解详情
航空航天中的计算机视觉

航空航天中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 应用于航空监测。借助计算机视觉解决方案,赋能无人机、航空航天工作流、环境保护和地理空间行业。
了解详情
安防领域的计算机视觉

安防领域的计算机视觉

使用 Ultralytics YOLO 模型守护每个场所。视觉 AI 可用于周界监控、威胁检测、车牌识别和工作场所安全。
了解详情
机器人领域的计算机视觉

机器人领域的计算机视觉

使用 Ultralytics YOLO 模型提升智能机器的能力。机器人领域的视觉 AI 可用于自主导航、感知、目标跟踪和实时控制。
了解详情
物流中的计算机视觉

物流中的计算机视觉

借助 Ultralytics YOLO 模型优化物流流程。视觉 AI 可用于包裹检查、分拣、车辆跟踪和仓库安全实时监控。
了解详情
零售中的计算机视觉

零售中的计算机视觉

借助 Ultralytics YOLO 模型重新构想零售。视觉 AI 可用于库存跟踪、货架监控、排队管理和更深入的客户洞察。
了解详情
医疗领域的计算机视觉

医疗领域的计算机视觉

借助 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可加快医学影像处理、优化诊断并监测患者。
了解详情
制造业中的计算机视觉

制造业中的计算机视觉

利用 Ultralytics YOLO 模型优化制造流程。视觉 AI 可用于质量控制、缺陷检测、个人防护装备合规检查和装配线自动化。
了解详情
汽车领域的计算机视觉

汽车领域的计算机视觉

利用 Ultralytics YOLO 模型在汽车领域应用计算机视觉。视觉 AI 可提升道路安全、驾驶辅助和车辆自动化水平,让道路更智能。
了解详情
农业中的计算机视觉

农业中的计算机视觉

借助 Ultralytics YOLO 模型,将视觉 AI 引入智慧农业。为作物监测、牲畜追踪和精准农业提供支持,从而提高产量并实现更智能的生产。
了解详情

让我们携手构建 AI 的未来!

开启你的旅程,迎接机器学习的未来