在 Intel Core Ultra Series 3(Panther Lake)上借助 OpenVINO 加速 Ultralytics YOLO26
了解如何将 Ultralytics YOLO26 模型导出为 OpenVINO 格式,并在 Intel 硬件上加速推理,包括 CPU、GPU 和 NPU。

过去几年,AI 和计算机视觉已经从实验性技术转变为日常业务运营的重要组成部分。事实上,调查显示,约有 88% 的组织 已经在业务的至少一个环节中使用 AI。
然而,无论是在生产系统还是个人项目中,要将这种采用转化为实际价值,通常取决于模型部署后实际运行的效果。在许多现实场景中,计算机视觉模型(如 Ultralytics YOLO26)会部署在边缘设备和各种硬件上,通常是 CPU、集成 GPU 或 NPU,而不是高端 GPU。
这时性能可能会开始出现差异,优化也变得至关重要。如果没有针对底层硬件进行适当优化,一个环境中运行良好的模型在另一个环境中可能会表现不佳。
为了简化这一过程,Ultralytics Python 软件包支持将 YOLO26 模型导出为 OpenVINO 等优化格式,使其能够在 Intel 硬件上流畅运行,而无需改变你的工作流程。
例如,将 Ultralytics YOLO26 模型导出为 OpenVINO 格式后,它可以在 Intel Core Ultra Series 3 处理器上更高效地运行,GPU 推理速度最高可提升三倍。
在本文中,我们将探讨更新后的 Ultralytics 与 OpenVINO 集成如何让你更轻松地在 Intel Core Ultra Series 3 硬件上部署 YOLO26 模型。让我们开始吧!
Ultralytics x OpenVINO 集成概览#
Ultralytics Python 软件包为训练、运行推理以及部署 YOLO26 等 Ultralytics YOLO 模型提供了统一接口。它支持多种集成,可帮助处理视觉 AI 工作流程的不同环节,从训练和实验到部署和优化。
其中一个专注于部署的集成是 OpenVINO 工具套件,它支持将 Ultralytics YOLO26 模型导出为适用于Intel 硬件的优化格式。此过程会将 YOLO 模型转换为能够在 Intel CPU、GPU 和 NPU 上更高效运行的格式,包括由 Intel® Core™ Ultra™ 系列处理器驱动的系统。
这样,你就可以在不同的 Intel 设备上更顺畅地运行模型,而无需针对每种配置手动调整模型。无论你是在本地计算机、边缘设备还是更大规模的部署环境中工作,都可以重复使用同一个导出模型。
这一集成尤其具有实用性的原因在于,它能够无缝融入现有的 Ultralytics 工作流程。你可以使用与训练和推理相同的接口导出模型,无需额外工具或复杂配置。
导出后,你可以根据所需的控制程度和灵活性,通过 Ultralytics Python 软件包或 OpenVINO Runtime 运行推理。
深入了解 OpenVINO 和 Intel Panther Lake 硬件如何支持 AI 推理#
在了解导出的 Ultralytics YOLO26 模型如何在 Intel 硬件上高效运行之前,我们先退一步,了解 OpenVINO 和 Intel 硬件如何协同工作以实现高效推理。
OpenVINO 是一个开源工具套件,旨在针对 Intel 硬件优化并运行 AI 推理,包括 CPU、集成 GPU 和 NPU。它提供统一运行时,因此同一个模型可以在这些不同的计算单元上运行,而无需重新编写。

图 1。OpenVINO 让模型轻松部署到多个硬件目标上。(来源)
在新款 Intel® Core™ Ultra™ Series 3 处理器(代号 Panther Lake)上,AI 工作负载会在同一处理器内的多个计算单元之间运行。每颗芯片都结合了用于通用任务的 CPU 核心、用于并行处理的集成 GPU,以及专为 AI 推理设计的独立 NPU。
OpenVINO 提供统一 API,让你可以定位这些计算单元中的任意一个,无论是 CPU、GPU 还是 NPU,都无需更改代码。你只需在运行时指定用于推理的设备,就能根据性能和效率需求在三者之间轻松切换。
在 Intel® Core™ Ultra™ 系列上对 Ultralytics YOLO26 进行基准测试#
在探索 Ultralytics 与 OpenVINO 集成时,你可能会想知道:将 YOLO26 导出为 OpenVINO 格式后,模型性能预计能提升多少?
在不同格式和精度级别下对 YOLO26 模型进行基准测试时,推理速度的差异十分明显。例如,在 Panther Lake 处理器 Intel Core Ultra X7 358H 上运行 YOLO26 的 nano 变体(YOLO26n)时,推理时间从 PyTorch FP32 精度下每张图像 25.18 ms,降至集成 NPU 上 OpenVINO 同等精度下的 2.64 ms。
这比原始 PyTorch FP32 基线更快,因此在延迟至关重要的实时应用和边缘应用中,可能会带来显著差异。当在集成 Intel Arc GPU 上运行同一模型时,这些提升会更加明显。

图 2。使用 OpenVINO 在 Intel Panther Lake GPU 上对 Ultralytics YOLO26 推理进行基准测试(来源)

图 3。使用 OpenVINO 在 Intel Panther Lake NPU 上对 Ultralytics YOLO26 推理进行基准测试(来源)
探索将 Ultralytics YOLO26 导出为 OpenVINO 格式的两种方式#
将 YOLO26 模型导出为 OpenVINO 格式主要有两种方式。你可以使用 Ultralytics Python 软件包,也可以直接通过 Ultralytics Platform 导出。Ultralytics Platform 是一个端到端工作空间,用于在同一处构建和管理计算机视觉工作流程。接下来,我们将介绍这两种方法。
使用 Ultralytics Python 软件包导出 YOLO26#
Ultralytics Python 软件包提供了一种直接的方法,可以在基于代码的工作流程中将 YOLO26 模型导出为 OpenVINO 格式。由于训练和推理使用相同的接口,模型导出可以自然地融入现有管道,无需额外工具。
首先,你可以安装 Ultralytics 软件包。在终端或命令提示符中运行命令“pip install ultralytics”即可完成安装。如果你在 Jupyter Notebook 或 Google Colab 等交互式环境中工作,也可以在命令前加上感叹号来运行相同的命令。
安装完成后,你可以加载训练好的 YOLO26 模型,并将其直接导出为 OpenVINO 格式。如下所示,系统会加载预训练的 YOLO26n 模型(yolo26n.pt),然后使用 export 方法将其转换为 OpenVINO 格式。
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
model.export(format="openvino")运行代码后,转换后的模型会保存到一个新目录中,你可以在其中使用该模型进行部署。
在 Ultralytics Platform 上导出 YOLO26#
如果你希望采用更简单的无代码方式,可以直接通过 Ultralytics Platform 导出 YOLO26 模型。该平台将完整的计算机视觉工作流程整合到一个工作空间中,让你无需额外配置即可轻松从训练转向部署。
模型准备就绪后,你可以在平台中打开模型并导航到 Export 选项卡。然后,你可以选择 OpenVINO 作为导出格式,还可以选择调整图像大小或精度等设置。

图 4。在 Ultralytics Platform 中导出 YOLO26 的界面
平台会自动处理转换,因此无需管理脚本、依赖项或环境配置。导出完成后,你可以下载优化后的模型,并将其部署到 Intel CPU、GPU 和 NPU 上。
Ultralytics x OpenVINO 集成支持的部署选项#
将 YOLO26 模型导出为 OpenVINO 格式后,你可以根据工作流程和所需的控制程度选择几种方式运行推理。你可以使用 Ultralytics Python 软件包,以获得更简单的一体化体验;也可以使用原生 OpenVINO Runtime,以实现更高的灵活性和控制力。
使用 Ultralytics Python 软件包运行推理#
将模型导出为 OpenVINO 格式后,你可以使用 Ultralytics Python 软件包运行推理。这种方式适合快速测试和简化部署,因为它使用与训练和导出相同的接口。
使用这种方式时,你可以从模型目录加载导出的 OpenVINO 模型,并对图像或视频等输入运行推理。你还可以通过指定 "intel:cpu"、"intel:gpu" 或 "intel:npu" 等选项来选择运行设备,具体取决于系统中可用的硬件。
下面的代码片段展示了如何加载导出的模型,并在指定 GPU 的情况下对图像运行推理。推理完成后,输出图像会保存到“runs/detect/predict”目录。
ov_model = YOLO("yolo26n_openvino_model/")
results = ov_model("https://ultralytics.com/images/bus.jpg", device="intel:gpu")利用原生 OpenVINO 软件包进行推理#
如果你需要更精细地控制模型在生产环境中的运行方式,可以使用原生 OpenVINO Runtime 进行推理。当你需要将模型集成到大型应用中,或希望微调特定硬件上的推理执行方式时,这种方法非常有用。
OpenVINO 提供了在 Intel CPU、GPU 和 NPU 上运行模型的统一方式,并支持异步执行和高效利用可用计算资源等功能。要完成设置,你可以直接使用导出的模型文件,包括定义模型结构的 .xml 文件和包含训练权重的 .bin 文件。
根据你的使用场景,你还可以调整输入大小或预处理步骤等设置。配置推理包括初始化 OpenVINO Runtime、为目标设备加载并编译模型、准备输入数据,然后运行推理。

图 5。典型 OpenVINO 推理管道示例(来源)
这样,你就可以控制模型的执行方式,以及它如何融入整体部署流程。要详细了解如何使用 OpenVINO Runtime 设置和运行推理,可以参阅官方 Ultralytics文档。
Ultralytics YOLO26 在 Intel 硬件上的实际应用#
Ultralytics 与 OpenVINO 集成的实际价值体现在生产环境中:可靠的低延迟推理可以带来切实的影响。以下是这一集成能够产生显著成效的一些主要行业:
-
制造业:将 Ultralytics YOLO26 导出为 OpenVINO 后,生产线系统可以在 Intel 硬件上自动检测缺少组件、错位或表面损坏等视觉缺陷,从而帮助提升产品质量并减少高昂的错误成本。
-
医疗保健:医学成像和患者监测系统可以在 Intel 硬件上本地运行导出的 Ultralytics YOLO26 模型,在保持可靠推理性能的同时满足严格的数据隐私要求。
-
智慧城市:交通监控和人群分析可以通过在 Intel 驱动的边缘摄像头上运行导出的 Ultralytics YOLO26 模型来部署,从而实现车辆计数、行人跟踪和事件检测等实时洞察。
-
汽车:低延迟和高能效对于驾驶员监控和车内感知至关重要,因此,搭配导出后的 Ultralytics YOLO26 模型的 Intel 硬件非常适合嵌入式汽车系统。
如果你想进一步了解这一集成,欢迎参加 Intel OpenVINO DevCon 系列研讨会:“从标注到部署:使用 Geti、Ultralytics YOLO26 和 OpenVINO™ 构建目标检测管道”。届时,我们的合作伙伴与生态系统经理 Francesco Mattioli 将与 Intel AI 软件布道师 Adrian Boguszewski 一起进行现场演示,详细讲解如何为现实工业场景构建可用于生产的计算机视觉管道。本次研讨会将展示完整的端到端目标检测工作流程,涵盖从数据集创建和模型训练到优化与边缘部署的全过程。
使用 OpenVINO 导出格式的优势#
以下是使用 OpenVINO 导出格式的一些主要优势:
-
易于使用和集成:借助统一 API 和 80 多个教程笔记本,OpenVINO 让你能够更轻松地从实验转向部署,而不会引入显著的复杂性。
-
在不同硬件上运行同一个模型:OpenVINO 让你可以在受支持的 Intel 硬件上使用单个导出模型,将其部署到 CPU、GPU 或 NPU,而无需针对每台设备重写或调整模型。
-
导出时内置优化:导出为 OpenVINO 格式会将 PyTorch 和 TensorFlow 等常用框架中的模型转换为可直接用于推理的优化格式,无需单独执行转换步骤。
-
更充分地利用硬件资源:OpenVINO 支持异步推理以及 Intel 硬件之间的负载均衡,有助于提升现实应用中的效率。
使用 ExecuTorch 和 OpenVINO 后端运行 Ultralytics YOLO26#
如果你要在要求更高的生产环境中部署 Ultralytics YOLO26,还有另一种可选方案,能够结合端侧效率与先进的模型压缩技术。
ExecuTorch 是 PyTorch 的端侧推理框架,支持 OpenVINO 后端,让你可以通过不同的导出和运行时路径在 Intel 硬件上部署 Ultralytics YOLO26。
其工作方式是:ExecuTorch 负责模型导出和运行时执行,而 OpenVINO 作为底层硬件加速层,负责处理 Intel CPU、GPU 或 NPU 上的实际计算。二者协同工作,让你能够同时获得 ExecuTorch 的可移植性和端侧效率,以及 OpenVINO 提供的针对硬件的优化。
要详细了解其工作原理,以及如何开始在 ExecuTorch 和 OpenVINO 后端上使用 Ultralytics YOLO26,请查看 Intel 介绍最新 ExecuTorch 和 OpenVINO更新的博客。
要点总结#
通过 Ultralytics 与 OpenVINO 集成导出 YOLO26 模型,可以提升其在 Intel 硬件上的性能,同时不会增加工作流程的复杂性。你可以从训练直接转向部署,而无需重新设计管道。总体而言,这为你在现实应用中高效运行 Intel CPU、GPU 和 NPU 上的模型提供了一种直接的方法。
加入我们的社区,并探索我们的 GitHub 代码仓库,详细了解 Vision AI。查看我们的许可选项,开始你的计算机视觉项目。对制造业中的 AI或汽车行业中的计算机视觉等创新感兴趣?访问我们的解决方案页面,了解更多信息。






