返回 Ultralytics 术语表
Neural Processing Unit (NPU)
了解神经处理单元(NPU)如何加速 AI。探索如何在 NPU 上部署 Ultralytics YOLO26,实现高效、低功耗的边缘计算和推理。
神经处理单元 (NPU) 是一种专用硬件电路,专门用于加速人工智能和机器学习算法的执行。与通用处理器不同,NPU 采用专门架构,能够原生处理 深度学习 模型所依赖的复杂并行矩阵运算。通过以极高的效率执行这些计算,NPU 大幅降低了功耗,同时显著改善了 推理延迟。因此,NPU 成为现代手机、笔记本电脑和专用物联网设备的重要组件,因为在这些设备上高效部署复杂模型且避免电池电量快速耗尽至关重要。
NPU 与其他处理器的对比#
要理解 NPU 的价值,可以将它与 AI 领域中其他常见的硬件加速器区分开来:
- 中央处理器 (CPU): 计算机的通用“中枢”。虽然 CPU 能够运行机器学习代码,但它以顺序方式处理任务,因此在执行现代视觉模型所需的大量矩阵乘法时速度较慢且效率较低。
- 图形处理器 (GPU): GPU 专为并行处理而设计,非常擅长处理大规模深度学习工作负载。不过,GPU 功耗较高且会产生大量热量,因此相比依赖电池供电的 边缘计算 设备,它更适合用于云端训练。
- 张量处理器 (TPU): Google 为机器学习开发的专用集成电路。虽然 TPU 的概念与 NPU 类似,但 TPU 通常与大规模 云计算 服务器机架相关,而 NPU 通常直接集成在消费级系统级芯片 (SoCs) 中。
NPU 的实际应用#
NPU 的兴起使用户设备能够直接运行 人工智能 (AI),而不再依赖持续的云连接。
- 智能手机与移动视觉:现代移动设备广泛利用内部 NPU,例如 Apple Neural Engine 或 Qualcomm Hexagon NPU,为计算摄影、实时人脸识别和本地文本翻译提供支持。通过在设备上处理图像数据,这些设备能够延长电池续航时间并确保 数据隐私。
- AI 赋能的笔记本电脑:先进的 PC 处理器现在配备了集成式 NPU,可在 视频会议 期间处理背景虚化和视线校正等后台任务,而不会增加主 CPU 的负担,从而让用户能够流畅地进行多任务处理。
- 边缘 AI 部署:智能监控摄像头和机器人利用专用 NPU,例如 Google Coral Edge TPU 或嵌入式 Intel 硬件,直接在数据源处执行即时 目标检测。这消除了带宽瓶颈,并支持在瞬间做出决策。
使用 Ultralytics YOLO 配合 NPU#
对于希望利用 NPU 的开发者而言,部署计算机视觉模型已经变得非常简单。借助强大的 Ultralytics YOLO26 模型,你可以将训练好的网络导出为针对各种硬件加速器优化的格式。为了简化整个生命周期,Ultralytics Platform 提供了强大的工具,用于云端数据集管理、自动标注,以及将优化后的模型部署到几乎任何 模型部署 环境中。
在本地工作时,你可以使用 ONNX Runtime、PyTorch ExecuTorch 或 TensorFlow Lite 等框架集成来调用 NPU。下面的简短 Python 示例演示了如何将 YOLO 模型导出为 OpenVINO 格式,该格式可以无缝地将计算工作负载委托给 Intel NPU,以加速 实时推理。
from ultralytics import YOLO
# Load the highly recommended Ultralytics YOLO26 Nano model
model = YOLO("yolo26n.pt")
# Export to OpenVINO with int8 quantization for optimal NPU performance
model.export(format="openvino", int8=True)
# Run highly efficient, accelerated inference on the edge device
results = model("path/to/environment_image.jpg")





