YOLO12 详解:真实世界的应用与使用场景
探索 YOLO12,最新的计算机视觉模型!了解其以注意力机制为核心的架构和 FlashAttention 技术如何提升各行业的目标检测任务。

计算机视觉是人工智能(AI)的一个分支,帮助机器理解图像和视频。由于 AI 研究人员和开发者不断突破极限,这一领域正以惊人的速度发展。AI 社区始终致力于让模型更快速、更智能、更高效。最新的突破之一是 YOLO12,这是 YOLO(只看一次)模型系列的最新成员,于 2025 年 2 月 18 日发布。
YOLO12 由布法罗大学、纽约州立大学(SUNY)和中国科学院大学的研究人员开发。YOLO12 采用了一种独特的新方法,引入了注意力机制,使模型能够专注于图像中最重要的部分,而不是对所有内容进行同等处理。
它还采用了 FlashAttention,这是一种能够在减少内存使用的同时加快处理速度的技术;此外还引入了区域注意力机制,用于模拟人类自然关注中心物体的方式。
这些改进使 YOLO12n 的准确率比 YOLOv10n 高 2.1%,使 YOLO12m 的准确率比 YOLO11m 高 1.0%。不过,这也带来了权衡——YOLO12n 比 YOLOv10n 慢 9%,YOLO12m 比 YOLO11m 慢 3%。

图 1。使用 YOLO12 检测物体的示例。
本文将探讨 YOLO12 的不同之处、它与之前版本的比较,以及它可以应用的领域。
YOLO12 的发布历程#
YOLO 模型系列是一组专为实时目标检测设计的计算机视觉模型,也就是说,它们能够快速识别并定位图像和视频中的物体。随着时间推移,每个版本都在速度、准确率和效率方面有所提升。
例如,2020 年发布的 Ultralytics YOLOv5 因速度快、易于自定义训练和部署而得到广泛使用。之后,Ultralytics YOLOv8 在此基础上进行了改进,增加了对实例分割和目标跟踪等计算机视觉任务的支持。
最近,Ultralytics YOLO11 专注于改进实时处理,同时保持速度与准确率之间的平衡。例如,YOLO11m 的参数量比 YOLOv8m 少 22%,但在广泛用于评估目标检测模型的 COCO 数据集上,仍然实现了更好的检测性能。
在这些进展的基础上,YOLO12 改变了处理视觉信息的方式。它不再平等地处理图像的所有部分,而是优先关注最相关的区域,从而提高检测准确率。简单来说,YOLO12 延续了以往的改进,同时力求更加精准。
YOLO12 的主要特性#
YOLO12 引入了多项改进,在保持实时处理速度的同时增强了计算机视觉任务的表现。以下是 YOLO12 主要特性的概览:
- 以注意力为核心的架构:YOLO12 不会平等地处理图像的每个部分,而是专注于最重要的区域。这能提高准确率并减少不必要的处理,即使在杂乱的图像中,也能实现更精准、更高效的检测。
- FlashAttention: YOLO12 在减少内存使用的同时加快图像分析速度。借助 FlashAttention(一种内存高效的算法),它能够优化数据处理,减轻硬件负担,让实时任务运行得更加流畅、可靠。
- 残差高效层聚合网络(R-ELAN):YOLO12 使用 R-ELAN 更高效地组织网络层,从而改进模型处理和学习数据的方式。这使训练更加稳定、物体识别更加精准,并降低计算需求,因此能够在不同环境中高效运行。
为了了解这些特性在现实中的运作方式,可以想象一个购物中心。YOLO12 可以帮助跟踪购物者,识别盆栽或促销标牌等店内装饰,并发现放错位置或被遗弃的物品。
其以注意力为核心的架构有助于专注于最重要的细节,而 FlashAttention 则确保它能够快速处理所有内容,同时不会让系统超负荷。这有助于购物中心运营者提升安全性、整理店铺布局并改善整体购物体验。

图 2。使用 YOLO12 检测购物中心中的物体。
不过,YOLO12 也存在一些需要考虑的限制:
- 训练时间更长: 由于其架构设计,YOLO12 所需的训练时间比 Ultralytics YOLO11 更长。
- 导出方面的挑战:部分用户在导出 YOLO12 模型时可能会遇到困难,尤其是在将其集成到特定部署环境中时。
了解 YOLO12 的性能基准#
YOLO12 提供多个变体,每个变体都针对不同需求进行了优化。较小的版本(nano 和 small)优先考虑速度和效率,非常适合移动设备和边缘计算。medium 和 large 版本在速度与准确率之间取得平衡,而 YOLO12x(extra large)则面向工业自动化、医学成像和高级监控系统等高精度应用。
通过这些不同变体,YOLO12 会根据模型规模提供不同级别的性能。基准测试表明,YOLO12 的某些变体在准确率方面优于 YOLOv10 和 Ultralytics YOLO11,实现了更高的平均精度(mAP)。
不过,YOLO12m、YOLO12l 和 YOLO12x 等部分模型处理图像的速度比 YOLO11 慢,体现了检测准确率与速度之间的权衡。尽管如此,YOLO12 仍然保持高效,所需参数量少于许多其他模型,但仍多于 YOLO11。因此,在准确率比原始速度更重要的应用中,它是一个很好的选择。

图 3。比较 Ultralytics YOLO11 和 YOLO12。
通过 Ultralytics Python 软件包使用 YOLO12#
YOLO12 受到 Ultralytics Python 软件包支持,易于使用,初学者和专业人士都能轻松上手。只需几行代码,用户即可加载预训练模型,在图像和视频上运行各种计算机视觉任务,还可以使用自定义数据集训练 YOLO12。Ultralytics Python 软件包简化了整个流程,无需执行复杂的配置步骤。
例如,以下是你使用 YOLO12 进行目标检测时需要执行的步骤:
- 安装 Ultralytics 软件包: 首先,安装 Ultralytics Python 软件包,它提供了高效运行 YOLO12 所需的工具。这样可以确保正确配置所有依赖项。
- 加载预训练的 YOLO12 模型: 根据任务所需的准确率和速度,选择合适的 YOLO12 变体(nano、small、medium、large 或 extra large)。
- 提供图像或视频: 输入你想要分析的图像或视频文件。YOLO12 还可以处理实时视频流,以进行实时检测。
- 运行检测流程: 模型会扫描视觉数据、识别物体,并在物体周围绘制边界框。它会为每个检测到的物体标注预测类别和置信度分数。
- 调整检测设置: 你还可以修改置信度阈值等参数,以微调检测准确率和性能。
- 保存或使用输出结果: 处理后的图像或视频现在包含检测到的物体,可以保存下来,或集成到应用中,用于进一步分析、自动化处理或决策。
这些步骤让 YOLO12 能够轻松应用于各种场景,从监控和零售跟踪到医学成像和自动驾驶车辆。
YOLO12 的实际应用#
得益于对目标检测、实例分割、图像分类、姿态估计和有向物体检测(OBB)的支持,YOLO12 可以用于各种现实世界的应用。

图 4。YOLO12 支持目标检测和实例分割等任务。
不过,正如前文所述,YOLO12 模型优先考虑准确率而非速度,这意味着与早期版本相比,它处理图像所需的时间略长。这种权衡使 YOLO12 非常适合精度比实时速度更重要的应用,例如:
- 医学成像:YOLO12 可以通过自定义训练,高精度地检测 X 射线和 MRI 中的肿瘤或异常情况,因此对于需要进行精确图像分析以辅助诊断的医生和放射科医师来说,它是一个实用工具。
- 制造业质量控制:它可以帮助在生产过程中识别产品缺陷,确保只有高质量产品进入市场,同时减少浪费并提高效率。
- 法证分析:执法机构可以对 YOLO12 进行微调,用于分析监控录像并收集证据。在刑事调查中,精准识别关键细节至关重要。
- 精准农业:农民可以使用 YOLO12 分析作物健康状况,检测疾病或虫害,并监测土壤条件。准确的评估有助于优化农业策略,从而提高产量并改善资源管理。
开始使用 YOLO12#
在运行 YOLO12 之前,务必确保你的系统满足必要的要求。
从技术上来说,YOLO12 可以在任何专用的 GPU(图形处理器)上运行。默认情况下,它不要求使用 FlashAttention,因此大多数 GPU 系统即使不支持 FlashAttention 也能运行。不过,在处理大型数据集或高分辨率图像时,启用 FlashAttention 尤其有用,因为它有助于防止速度下降、减少内存使用并提高处理效率。
要使用 FlashAttention,你需要以下系列之一的 NVIDIA GPU:Turing(T4、Quadro RTX)、Ampere(RTX 30 系列、A30、A40、A100)、Ada Lovelace(RTX 40 系列)或 Hopper(H100、H200)。
考虑到易用性和可访问性,Ultralytics Python 软件包目前尚不支持 FlashAttention 推理,因为其安装过程可能相当复杂。要进一步了解如何开始使用 YOLO12 并优化其性能,请查看官方 Ultralytics 文档。
要点总结#
随着计算机视觉不断发展,模型变得更加精准、高效。YOLO12 通过以注意力为核心的处理方式和 FlashAttention 改进了目标检测、实例分割和图像分类等计算机视觉任务,在提高准确率的同时优化了内存使用。
与此同时,计算机视觉比以往任何时候都更易于使用。YOLO12 可以通过 Ultralytics Python 软件包轻松使用,并且由于其优先考虑准确率而非速度,非常适合医学成像、工业检测和机器人技术等对精度要求较高的应用。
对 AI 感兴趣?欢迎访问我们的 GitHub 代码仓库,并加入我们的社区交流。在我们的解决方案页面上,探索自动驾驶汽车中的 AI和农业中的计算机视觉等领域的创新。查看我们的许可选项,让你的视觉 AI 项目落地。🚀









