计算机视觉中的剪枝与量化:快速指南
了解剪枝和量化为何对于优化计算机视觉模型以及在边缘设备上实现更快性能至关重要。

随着技术的发展,边缘设备正变得越来越普遍。从跟踪心率的智能手表,到监测街道的空中无人机,边缘系统可以在设备本地实时处理数据。
这种方法通常比将数据发送到云端更快、更安全,尤其适用于涉及个人数据的应用,例如车牌检测或手势跟踪。这些都是计算机视觉的应用示例。计算机视觉是人工智能(AI)的一个分支,能够让机器解读和理解视觉信息。

图 1. 车牌检测示例。(来源)
然而,一个重要的考虑因素是,此类应用需要能够处理繁重计算、占用极少资源并独立运行的视觉 AI 模型。大多数计算机视觉模型都是为高性能系统开发的,因此不太适合直接部署到边缘设备上。
为了弥合这一差距,开发者通常会采用针对性的优化方法,使模型能够在更小型的硬件上高效运行。这些调整对于实际的边缘部署至关重要,因为这类场景的内存和处理能力都有限。
有趣的是,像 Ultralytics YOLO11 这样的计算机视觉模型在设计时就考虑了边缘效率,因此非常适合实时任务。不过,还可以通过剪枝和量化等模型优化技术进一步提升其性能,让模型在受限设备上实现更快的推理并降低资源使用量。
在本文中,我们将深入了解剪枝和量化是什么、它们如何工作,以及如何帮助 YOLO 模型在实际边缘部署中发挥更好的性能。现在就开始吧!
剪枝与量化:模型优化的核心技术#
在准备将视觉 AI 模型部署到边缘设备时,主要目标之一是在不牺牲性能的情况下,让模型轻量且可靠。这通常需要降低模型的大小和计算需求,使其能够在内存、电量或处理能力有限的硬件上高效运行。剪枝和量化就是实现这一目标的两种常见方法。
剪枝是一种 AI 模型优化技术,有助于让神经网络变得更小、更高效。在许多情况下,模型中的某些部分(例如特定连接或节点)对最终预测的贡献并不大。剪枝通过识别并移除这些不太重要的部分来减小模型大小并提升运行速度。
另一方面,量化是一种降低模型所使用数值精度的优化技术。模型不再依赖高精度的 32 位浮点数,而是切换为 8 位整数等更小、更高效的格式。这种变化有助于降低内存使用量并加快推理,也就是模型进行预测的过程。

图 2. 了解剪枝与量化。(来源)
剪枝与量化的工作原理#
现在我们已经更好地理解了剪枝和量化是什么,下面来了解它们各自的工作原理。
剪枝通过一种称为敏感性分析的过程完成。该过程会识别神经网络模型中对最终输出预测贡献最小的部分,例如特定的权重、神经元或通道。移除这些部分通常只会对精度产生极小影响。剪枝后,模型通常需要重新训练,以进一步微调其性能。这个循环可以重复进行,从而在模型大小和精度之间找到合适的平衡。
与此同时,模型量化关注的是模型如何处理数据。量化从校准开始:模型在样本数据上运行,以学习需要处理的数值范围。随后,这些数值会从 32 位浮点格式转换为 8 位整数等低精度格式。

图 3. 量化有助于降低模型大小和复杂度。(来源)
有许多工具可以让你更轻松地在实际 AI 项目中使用剪枝和量化。大多数 AI 框架(例如 PyTorch 和 TensorFlow)都内置了对这些优化技术的支持,使开发者能够将其直接集成到模型部署流程中。
模型完成优化后,ONNX Runtime 等工具可以帮助它在服务器、桌面设备和边缘设备等不同硬件平台上高效运行。此外,Ultralytics 提供了相关集成,使你能够将 YOLO 模型导出为适合量化的格式,从而更轻松地减小模型大小并提升性能。
Ultralytics YOLO 模型优化概述#
YOLO11 等 Ultralytics YOLO 模型因其快速的单阶段目标检测而广受认可,非常适合实时视觉 AI 任务。这些模型本身已经经过设计,足够轻量且高效,适合边缘部署。不过,负责处理视觉特征的层(称为卷积层)在推理过程中仍可能需要相当大的计算能力。
你可能会问:如果 Ultralytics YOLO11 已经针对边缘使用进行了优化,为什么还需要进一步优化?简单来说,并非所有边缘设备都相同。有些设备运行在极其有限的硬件上,例如功耗低于标准 LED 灯泡的小型嵌入式处理器。
在这些情况下,即使是经过精简的 Ultralytics YOLO11,也需要额外优化才能确保运行平稳、性能可靠。剪枝和量化等技术可以减小模型大小并加快推理,同时不会显著影响精度,因此非常适合这类受限环境。
为了让你更轻松地应用这些优化技术,Ultralytics 支持多种集成,可将 YOLO 模型导出为 ONNX、TensorRT、OpenVINO、CoreML 和 PaddlePaddle 等多种格式。每种格式都针对特定类型的硬件和部署环境进行了设计。
例如,ONNX 由于兼容各种工具和平台,因此常用于量化工作流。另一方面,TensorRT 针对 NVIDIA 设备进行了高度优化,并支持使用 INT8 的低精度推理,因此非常适合在边缘 GPU 上进行高速部署。
Ultralytics YOLO 模型优化的典型应用场景#
随着计算机视觉不断拓展到各种实际应用中,经过优化的 YOLO 模型可以在更小、更快的硬件上执行目标检测、实例分割和目标跟踪等任务。接下来,我们将讨论几个应用场景,了解剪枝和量化如何让这些计算机视觉任务更加高效、实用。
Ultralytics YOLO11 驱动的智能监控#
许多工业场所和公共区域都依靠实时监控来保障安全。交通站点、制造场所和大型户外设施等地点需要视觉 AI 系统快速、准确地检测人员或车辆。但这些地点通常网络连接受限、硬件资源有限,因此难以部署大型模型。
在这种情况下,像 Ultralytics YOLO11 这样的优化视觉 AI 模型是很好的解决方案。其紧凑的尺寸和快速性能使其非常适合在低功耗边缘设备上运行,例如嵌入式摄像头或智能传感器。这些模型可以直接在设备上处理视觉数据,从而实时检测安全违规、未经授权的访问或异常活动,无需持续访问云端。

图 4. Ultralytics YOLO11 可用于监控地铁站等公共场所。
使用 Ultralytics YOLO11 提升建筑工地安全性#
建筑工地是节奏快且充满不确定性的环境,其中有重型机械、流动的工人和持续不断的活动。由于日程变化、设备移动,甚至天气突变,现场状况可能迅速改变。在这种动态环境中,保障工人安全可能是一项持续的挑战。
实时监控发挥着关键作用,但传统系统通常依赖云端访问或昂贵的硬件,在现场可能并不实用。这正是 Ultralytics YOLO11 等模型能够发挥作用的地方。YOLO11 可以经过优化,在现场直接运行于小型、高效的边缘设备上,无需互联网连接。
例如,考虑一个占地数英亩、规模较大的建筑工地,如高速公路扩建项目。在这种环境中,人工跟踪每辆车或每件设备可能既困难又耗时。配备摄像头和优化版 Ultralytics YOLO11 模型的无人机可以自动检测和跟踪车辆、监测交通流量,并识别未经授权的进入或不安全驾驶行为等安全问题。

图 5. 分析来自建筑工地的无人机图像。(来源)
计算机视觉中剪枝与量化的优缺点#
以下是剪枝和量化等计算机视觉模型优化方法带来的一些主要优势:
- 经济高效的部署: 更小、更高效的模型可以减少对昂贵高端硬件的需求,让 AI 更易于访问,并能够在不同应用场景中实现规模化部署。
- 更低的延迟: 通过简化模型架构并降低计算开销,这些技术有助于在实时应用中实现更快的响应速度。
- 能源效率: 降低计算负载也会减少功耗,这对于电池供电或移动系统尤其有帮助。
虽然剪枝和量化具有许多优势,但也会带来一些开发者在优化模型时应考虑的权衡。以下是需要注意的一些限制:
- 精度权衡: 如果剪枝过于激进,或使用了极低比特量化,模型精度可能会下降,例如 mAP 等指标会受到影响。
- 硬件限制: 并非所有设备都能同样良好地支持 INT8 等低精度格式。这可能会限制优化模型的部署位置和部署方式。
- 实现复杂度: 要取得良好效果,通常需要进行细致且针对具体模型的调优。开发者可能需要重新训练模型并开展大量测试,以便在提升效率的同时保持性能。
要点总结#
剪枝和量化是帮助 YOLO 模型在边缘设备上实现更好性能的实用技术。它们可以减小模型大小、降低计算需求并加快预测速度,同时不会造成明显的精度损失。
这些优化方法还让开发者能够灵活调整模型,以适应不同类型的硬件,而无需完全重新构建模型。通过一定的调优和测试,将视觉 AI 应用于实际场景会变得更加容易。
加入不断壮大的社区!探索我们的 GitHub 仓库,进一步了解 AI。准备开始你的计算机视觉项目了吗?查看我们的许可选项。访问我们的解决方案页面,了解农业中的 AI和医疗保健领域的视觉 AI!









