Ultralytics YOLO26 更快速的边缘优先设计所带来的影响
了解 Ultralytics YOLO26 如何在边缘端实现更快速度,以及这对需要低延迟和高效率的新一代计算机视觉应用为何重要。

本周早些时候,Ultralytics 正式发布了 Ultralytics YOLO26,这是一款更快、更轻量、更小巧的 YOLO 模型,旨在重新定义计算机视觉系统在边缘端的运行方式。YOLO26 支持与之前 YOLO 模型相同的核心视觉任务,包括目标检测和实例分割。

图 1. 使用 Ultralytics YOLO26 分割目标的示例。
Ultralytics YOLO26 与之前模型之间的根本区别,在于它所针对的运行环境不同。YOLO26 并非主要针对云端图形处理单元(GPUs)或基准测试性能进行优化,而是从零开始,专为在边缘设备和嵌入式硬件上进行真实部署而设计。
随着计算机视觉从研究走向生产,性能限制的现实正变得愈发清晰。边缘环境受到严格延迟预算、有限内存、电力和散热限制的影响,同时还要求系统在各种平台上保持可预测的行为。
在这些场景中,整体系统性能不仅取决于原始推理速度,还取决于整个流水线的运行效率。后处理开销、内存压力和特定平台的执行路径往往会成为瓶颈。
Ultralytics YOLO26 采用更快、边缘优先的方法应对这些挑战,关注整个推理流水线,而不是单个模型指标。通过专注于边缘优化、简化推理流水线并移除不必要的后处理步骤,YOLO26 带来了速度提升,从而降低延迟,并在生产环境中实现更可靠的运行。
本文将探讨 Ultralytics YOLO26 的架构选择如何转化为真实世界的性能提升,以及在边缘端实现更快的速度为何会从根本上改变下一代计算机视觉应用的可能性。
边缘部署的现实#
在边缘运行计算机视觉模型与在云端运行它们有很大不同。在云环境中,系统通常可以使用强大的 GPU、大量内存和稳定的硬件。而在边缘端,这些假设并不成立。
大多数边缘部署运行在多种硬件架构上,而不是 GPU 上。设备通常会针对不同任务使用多个专用处理器,这些处理器更注重效率和低功耗,而非云端 GPU 的原始计算能力。
延迟是另一个主要限制。边缘系统通常需要满足严格的实时要求,即使很小的延迟也可能影响响应能力或安全性。在这些情况下,端到端延迟比原始推理速度更重要。模型在纸面上可能很快,但加入后处理和数据移动后仍可能无法满足要求。
内存也发挥着重要作用。许多边缘设备的内存和共享缓存都很有限。大型中间张量和低效的内存使用可能拖慢系统,即使模型本身很高效。
功耗和散热限制进一步增加了约束。边缘设备通常没有主动散热,并且需要在固定功耗预算内运行。性能不仅要在短时间内快速,还必须高效且可持续。
除此之外,边缘部署还要求一致性。模型必须在不同设备和运行时上表现一致。特定平台的代码或复杂的后处理步骤可能引入细微差异,使系统更难部署和维护。

图 2. 了解边缘部署的限制。图片由作者提供。
这些限制定义了性能在边缘端的真正含义。换句话说,性能由整个流水线决定,而不是由单一指标决定。
为何边缘视觉需要不同的性能模型#
那么,边缘部署的限制与面向边缘构建的计算机视觉模型的要求有什么关系?当模型从研究环境进入真实世界系统后,这种联系就会变得清晰。
在云环境中,性能通常通过推理速度和准确率等基准指标进行衡量。在边缘端,这些指标只能说明部分情况。视觉系统通常运行在异构硬件上,神经网络推理会卸载到专用加速器,而流水线的其他部分则运行在通用处理器上。
在这种情况下,模型速度还不够。模型部署后整个系统的运行表现才是关键。模型单独运行时可能看起来很快,但如果后处理、数据移动或特定平台的步骤增加了开销,整体表现仍可能不达标。
因此,边缘视觉需要一种关注系统级效率而非孤立基准的性能模型。Ultralytics YOLO26 体现了这一转变,专注于边缘优先优化、精简推理以及面向真实部署构建的端到端执行。
速度的基础:边缘优先设计#
在边缘端,性能取决于模型与设备实际硬件架构的匹配程度。优先面向边缘进行设计,可以确保视觉系统在真实平台上可靠运行,而不受可用处理单元具体组合的影响。
边缘优先方法优先考虑在异构硬件上的可预测、高效执行,而不是事后调整原本针对云端 GPU 优化的模型。简单来说,这意味着优先采用能够良好映射到神经网络加速器的操作,尽量减少模型外部的非神经网络工作,并降低可能拖慢端到端执行的不必要复杂性。
Ultralytics YOLO26 的设计充分考虑了这些限制。其架构注重稳定的性能,而不是理想条件下的峰值吞吐量。通过简化执行路径并消除不必要的计算,YOLO26 减少了整个推理流水线的开销,并更充分地利用设备可用的加速能力和内存层级。
这种方法也提升了可靠性。边缘优先优化能够带来更可预测的时序和更少的性能峰值,这对实时系统至关重要。Ultralytics YOLO26 不依赖专用硬件或繁重的后处理来实现速度,而是强调整个推理流水线的效率。
端到端推理与后处理成本#
你可能想知道,消除不必要的后处理步骤意味着什么。要理解这一点,我们先退一步,看看传统目标检测系统是如何工作的。
在许多目标检测流水线中,模型生成预测结果并不意味着推理结束。模型通常会输出大量相互重叠的边界框,这些边界框在使用前还需要经过筛选和优化。这种清理工作通过模型外部运行的后处理步骤完成。
最常见的后处理步骤之一是非极大值抑制,即 NMS。NMS 会比较重叠的边界框,只保留置信度最高的检测结果,并移除指向同一目标的重复结果。虽然这种方法很有效,但它会在推理完成后引入额外计算。

图 3. 了解 NMS。图片由作者提供。
在边缘端,这些额外工作会带来成本。NMS 等后处理步骤并不适合用于神经网络推理的专用加速器,因为这些加速器针对密集型神经网络计算进行了优化,而不是针对控制密集型或内存密集型操作。
因此,NMS 会增加额外的延迟和内存开销,并且其成本会随着检测数量增加而上升。即使模型本身运行很快,NMS 仍可能消耗总运行时间中相当大的一部分。
后处理还会增加系统复杂性。由于后处理位于模型外部,因此必须针对不同运行时和硬件目标分别实现。这通常会导致特定平台的代码路径、不同设备间行为不一致,以及更加脆弱的部署流水线。
更重要的是,后处理破坏了真正端到端性能的概念。测量模型推理速度无法反映系统在生产环境中的运行方式。最终真正重要的是从输入到最终输出的总时间,包括流水线中的每一步。
在这些情况下,后处理会成为边缘端隐藏的瓶颈。它增加延迟、消耗 CPU 资源并使部署复杂化,同时还处于模型本身之外。
Ultralytics YOLO26 如何移除 NMS,以及这为何能让它更快#
YOLO26 移除了 NMS,通过解决重复检测的根本原因来避免在推理后进行清理。模型不再生成许多需要筛选的重叠预测,而是经过训练,直接生成数量更少且置信度更高的最终检测结果。
这是通过改变训练期间学习检测结果的方式实现的。Ultralytics YOLO26 促使目标与预测之间形成更清晰的一对一关系,从源头减少冗余。因此,重复检测会在网络内部得到解决,而不是通过外部后处理处理。
移除 NMS 会立即改善边缘端性能。由于 NMS 无法很好地映射到神经网络加速器,消除 NMS 可以减少内存移动,并避免代价高昂的非神经网络处理步骤。这会降低端到端延迟,使性能更加可预测,尤其是在后处理可能占据总运行时间显著部分的边缘设备上。
这也简化了推理流水线。模型外部的步骤减少后,数据移动更少,组件之间的交接也更少。模型输出已经是最终结果,因此执行过程更加可预测。
移除 DFL,实现真正的端到端性能#
Ultralytics YOLO26 的另一项创新是移除分布焦点损失,即 DFL。早期 YOLO 模型曾使用它进行边界框回归。采用 DFL 的模型并非直接预测单个坐标,而是学习一组可能值的分布,然后根据该分布得出最终边界框。这种方法有助于提升定位准确率,是前几代模型迈出的重要一步。
然而,随着时间推移,DFL 也带来了权衡。预测分布会增加计算量和模型架构的复杂性,这可能拖慢 CPU 上的推理,并使模型更难导出到不同的部署格式。DFL 还施加了固定的回归范围,在检测非常大的目标时可能限制灵活性。
Ultralytics YOLO26 将移除 DFL 作为迈向更简单端到端设计的一部分。边界框回归经过重新设计,变得更加直接,在保持准确率的同时减少不必要的计算。这一变化与 YOLO26 无需 NMS 的方法保持一致。
CPU 推理速度提升 43% 的原因#
在基于 CPU 的基准测试中,YOLO26 相比早期 YOLO 模型展现出明显的性能提升。与 Ultralytics YOLO11 相比,YOLO26 nano 模型的 CPU 推理速度最高提升 43%,这一差异会对真实世界的边缘部署产生显著影响。

图 4. Ultralytics YOLO26 CPU 速度基准测试。
这一提升来自对完整推理流水线的简化,而不是对单个组件进行优化。端到端执行消除了后处理开销,更直接的边界框回归方法减少了计算量,而 CPU 优先的设计选择则提升了通用处理器上的执行效率。
这些变化共同降低了延迟和 CPU 工作负载,并使真实世界边缘硬件上的性能更快、更稳定。
Ultralytics YOLO26 对边缘部署和导出的影响#
Ultralytics YOLO26 的性能提升不止体现在更快的推理上。通过简化模型并减少内存开销,它更易于部署,也能在各种边缘环境中更加可靠地运行。
Ultralytics YOLO26 的端到端设计也简化了导出。由于辅助组件更少且没有外部后处理步骤,导出的模型完全自包含。这减少了特定平台的依赖,并有助于确保模型在不同运行时和硬件目标上的行为一致。
实际应用中,这意味着你可以使用各种导出格式,将 Ultralytics YOLO26 更轻松地部署到摄像头、机器人和嵌入式系统等边缘设备上。导出的内容就是运行的内容,集成步骤更少,部署偏移风险也更低。
更快的边缘推理赋能机器人和工业视觉 AI#
到目前为止,我们已经了解 Ultralytics YOLO26 的边缘优先设计如何在系统层面提升性能。但它真正的影响在于,让视觉 AI 更容易集成到真实世界的应用中。
例如,在机器人和工业环境中,视觉系统通常需要满足严格的实时要求。系统必须使用有限的计算资源,在不依赖云连接的情况下快速且稳定地做出决策。借助 Ultralytics YOLO26,这些要求变得切实可行。
机器人导航和目标操作等应用受益于更低的延迟和更可预测的推理,使机器人能够平稳响应环境变化。同样,在工业环境中,视觉模型可以直接运行在生产线上,用于检测缺陷、跟踪组件和监控流程,而不会引入延迟或额外复杂性。
通过在边缘硬件上实现快速、可靠的推理,Ultralytics YOLO26 有助于让视觉 AI 自然融入机器人和工业系统,而不再成为难以部署和维护的挑战。
要点总结#
Ultralytics YOLO26 专为边缘端打造,因为延迟、内存和可靠性等真实世界限制决定了系统的可能性。通过围绕 CPU 优先执行、端到端推理和更简单的部署进行设计,YOLO26 让视觉 AI 能够切实集成到真实系统中。这种边缘优先方法支持广泛的应用,从机器人和工业视觉到嵌入式 AI 与设备端 AI,在这些场景中,性能和可预测性最为重要。
加入不断壮大的社区,并探索我们的 GitHub 代码仓库,获取实践型 AI 资源。立即开始构建视觉 AI,探索我们的许可选项。访问我们的解决方案页面,了解 AI 在农业中的应用如何改变农业,以及医疗健康领域的视觉 AI如何塑造未来。









