Ultralytics YOLO27:
Ultralytics YOLO

Ultralytics YOLO26 如何借助 ProgLoss、STAL 和 MuSGD 实现更智能的训练

了解 Ultralytics YOLO26 如何利用 Progressive Loss Balancing、Small-Target-Aware Label Assignment 和 MuSGD 优化器实现更可靠的训练。

ABAbirami Vina7 min read
Ultralytics YOLO26 的训练创新:ProgLoss、STAL 和 MuSGD

上周,我们发布了 Ultralytics YOLO26,为边缘优先的实时计算机视觉模型树立了新标准。与之前的 Ultralytics YOLO models(例如 Ultralytics YOLO11)类似,YOLO26 支持用户熟悉的核心计算机视觉任务,包括目标检测、实例分割和姿态估计。

Ultralytics YOLO26 在图像中分割对象的示例

图 1. 使用 Ultralytics YOLO26 在图像中分割对象的示例。

不过,Ultralytics YOLO26 并不只是一次渐进式更新。虽然支持的任务看起来可能很熟悉,但这个新模型代表了计算机视觉模型训练方式的一次创新性飞跃。借助 YOLO26,关注重点不再局限于推理效率,还包括让训练更加稳定。

Ultralytics YOLO26 在设计时考虑了完整的训练生命周期。这意味着更快的收敛速度、更可靠的训练运行以及更一致的模型行为。这些改进对于真实世界的工作流尤为重要,因为训练可靠性会直接影响模型迭代和部署的速度。

为实现这一目标,Ultralytics YOLO26 引入了多项针对性的训练创新,例如渐进式损失平衡(ProgLoss)、小目标感知标签分配(STAL)和 MuSGD 优化器。这些变化共同改善了学习损失的平衡方式、标签的分配方式以及优化过程随时间变化的表现。

本文将介绍这些机制分别如何工作,以及它们为何能让 Ultralytics YOLO26 更易训练,并在大规模场景下更加可靠。让我们开始吧!

Ultralytics YOLO26:旨在更智能地训练,而不仅仅是更快地运行#

Ultralytics YOLO26 通过移除对非极大值抑制等后处理步骤的依赖,从原生层面简化了整个推理流程。YOLO26 不再生成大量相互重叠的预测结果后再进行筛选,而是直接从网络中生成最终检测结果。

这使 YOLO26 成为端到端模型,预测、重复结果消解和最终输出都在网络内部完成学习。这不仅简化了部署并提升了推理效率,也影响了模型在训练期间的学习方式。

Ultralytics YOLO26 先进的端到端、无 NMS 推理

图 2. YOLO26 提供先进的端到端、无 NMS 推理(来源

在这样的端到端系统中,训练与推理紧密相连。由于没有外部后处理阶段来事后修正预测结果,模型必须在训练期间就学会做出清晰且有信心的决策。

因此,训练目标与推理行为之间的一致性尤为重要。模型训练方式与推理时使用方式之间的任何不匹配,都可能导致学习不稳定或收敛速度变慢。

Ultralytics YOLO26 从一开始就围绕真实世界的使用方式设计训练流程。训练系统不再只关注推理速度,而是旨在支持长时间运行中的稳定学习、从 Nano 到 Extra Large 各种模型尺寸下的一致收敛,以及在多样化数据集上的稳健性能。

Ultralytics YOLO26 中的两个训练头如何改善学习效果#

Ultralytics YOLO26 的一项关键训练创新,建立在之前 YOLO 模型采用的双头训练方法之上。在目标检测模型中,检测头指的是负责进行预测的网络部分。

换句话说,检测头会学习预测对象在图像中的位置以及对象类别。它们通过回归边界框坐标来实现这一点,也就是学习估计输入图像中每个对象的位置和大小。

在训练期间,模型通过最小化损失来学习。损失是衡量预测结果与正确答案或真实标注相差多远的数值指标。损失越低,表示模型预测越接近真实标注;损失越高,则表示误差越大。损失计算会指导模型在训练期间更新参数。

Ultralytics YOLO26 在训练期间使用两个检测头,它们共享同一个底层模型,但用途不同。一对一检测头用于推理阶段。它学习将每个对象与一个明确且有信心的预测结果关联起来,这对于 YOLO26 的端到端、无 NMS 设计至关重要。

另一方面,一对多检测头仅用于训练。它允许多个预测结果与同一个对象关联,从而提供更密集的监督信号。这种更丰富的学习信号有助于稳定训练并提升准确率,尤其是在训练早期阶段。

在 Ultralytics YOLO26 中,两个检测头都使用相同的框回归和分类损失计算方式。早期实现会在整个训练过程中固定平衡这两种损失信号。

然而在实践中,每个检测头的重要性会随时间变化。密集监督在训练早期最有用,而在训练后期,与推理行为保持一致则更加重要。Ultralytics YOLO26 正是围绕这一洞察设计的,这也直接引出了它如何在训练进程中重新平衡学习信号。

Ultralytics YOLO26 使用渐进式损失平衡#

那么,Ultralytics YOLO26 如何在训练期间应对这些不断变化的学习需求?它使用渐进式损失平衡,随时间调整学习信号的权重。

ProgLoss 会随着训练推进,动态调整每个检测头对总损失的贡献比例。在训练早期,一对多检测头会获得更高权重,以稳定学习并提升召回率。随着训练继续进行,平衡会逐渐转向一对一检测头,使训练与推理行为更加一致。

这种渐进式过渡让 Ultralytics YOLO26 能够按照正确的顺序进行学习。渐进式损失平衡不会强迫模型同时优化相互竞争的目标,而是优先使用训练每个阶段最有价值的学习信号。结果是更平滑的收敛、更少的不稳定训练运行,以及更加一致的最终性能。

STAL 如何帮助 Ultralytics YOLO26 学习微小对象#

Ultralytics YOLO26 的另一项有趣训练改进,来自模型如何将训练目标分配给预测结果,这一过程称为标签分配。它负责将真实标注对象与候选预测结果进行匹配,候选预测结果通常称为锚点。

这些匹配关系决定哪些预测结果会获得监督并参与损失计算。Ultralytics YOLO26 在一种已有的标签分配方法——任务对齐学习(TAL)的基础上进行了改进,该方法旨在更好地对齐训练期间的分类和定位。

虽然 TAL 对大多数对象都很有效,但训练过程暴露出了一个重要局限。在匹配过程中,非常小的对象可能会被完全丢弃。实际上,在 640 像素的输入图像中,小于约 8 像素的对象通常无法获得任何锚点分配。发生这种情况时,模型几乎无法获得这些对象的监督信号,因此很难学会可靠地检测它们。

为解决这一问题,Ultralytics YOLO26 引入了小目标感知标签分配(STAL)。STAL 修改了分配流程,确保小对象在训练期间不会被忽略。具体来说,对于小于 8 像素的对象,它强制至少分配四个锚点。这保证了即使是微小对象也能持续参与训练损失计算。

通过加强对小目标的监督,STAL 提升了小目标或远距离对象常见场景中的学习稳定性和检测性能。这一改进对于 边缘优先的 YOLO26 应用尤为重要,例如航空影像、机器人和物联网(IoT)系统,因为其中的对象通常较小、距离较远或部分可见,而可靠检测至关重要。

Ultralytics YOLO26 引入 MuSGD 优化器#

为了支持更加稳定且可预测的训练,Ultralytics YOLO26 还引入了一种名为 MuSGD 的新优化器。该优化器旨在提升端到端检测模型的收敛速度和训练可靠性,尤其适用于模型规模和训练复杂度不断增加的情况。

为了让神经网络能够学习,并在训练期间相应地改变权重,我们会计算误差(也称为“损失”)。因此,模型会使用损失值衡量预测结果的错误程度,计算表示参数应如何变化的梯度,然后更新这些参数以减少误差。随机梯度下降(SGD)是一种广泛使用的优化器,负责执行这些更新,使训练更加高效且易于扩展。

随机梯度下降与梯度下降的对比

图 3. 随机梯度下降与梯度下降的对比(来源

MuSGD 在这一熟悉基础上进一步融入了受 Muon 启发的优化思想。Muon 是一种用于大语言模型训练的方法。这些思想受到近期进展的影响,例如 Moonshot AI 的 Kimi K2;后者通过更具结构化的参数更新展现了更优的训练行为。

Ultralytics YOLO26 使用混合更新策略。部分参数通过结合 Muon 风格更新与 SGD 进行更新,而其他参数仅使用 SGD。这使 YOLO26 能够在优化过程中引入额外结构,同时保持 SGD 已展现出的稳健性和泛化能力。

最终,优化过程更加平滑、收敛速度更快,并且不同模型尺寸下的训练行为更加可预测,使 MuSGD 成为 Ultralytics YOLO26 更易训练且在大规模场景下更加可靠的关键组成部分。

Ultralytics YOLO26 训练创新的意义#

Ultralytics YOLO26 的训练创新与其端到端、无 NMS 和边缘优先等关键特性相结合,使模型更易训练,并在大规模场景下更加可靠。你可能会想知道,这对计算机视觉应用究竟意味着什么。

Ultralytics YOLO26 关键特性一览

图 4. YOLO26 关键特性一览(来源

在实际应用中,它让计算机视觉更容易部署到真正运行它的地方。模型训练更加可预测,在不同尺寸之间扩展时更加一致,也更容易适配新数据集。这减少了实验与部署之间的摩擦,尤其是在可靠性和效率与原始性能同等重要的环境中。

例如,在 机器人和工业视觉应用中,随着环境、传感器或任务发生变化,模型通常需要频繁重新训练。借助 Ultralytics YOLO26,团队可以更快地迭代,而不必担心训练运行不稳定或不同模型尺寸之间的行为不一致。

要点总结#

可靠的计算机视觉系统不仅取决于模型在推理时的表现,也同样取决于模型的训练方式。通过改善学习信号的平衡方式、小对象的处理方式以及优化过程的推进方式,Ultralytics YOLO26 让训练更加稳定,也更易于扩展。这种对可靠训练的重视,有助于团队更顺畅地从实验走向真实世界部署,尤其是在边缘优先的应用中。

想了解 AI?访问我们的 GitHub repository,获取更多信息。加入我们的活跃 community,了解 AI in logisticsvision AI in the automotive industry 等领域的创新。立即开始使用计算机视觉,查看我们的 licensing options

Explore solutions

用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多

让我们共同构建 AI 的未来!

开启你的机器学习未来之旅