企业级安全保障: 符合 ISO 27001 和 SOC 2 Type I 标准。
Ultralytics

Ultralytics 基准测试

YOLO26 在 Ultralytics Platform 的 NVIDIA GPU 上表现如何——测量训练吞吐量和推理延迟,以及内存、功耗、精度和成本效率,让你能为预算和项目周期选择合适的 GPU。

GPU 训练吞吐量

YOLO26 检测在 COCO 上以 640px 进行训练,并在 Platform 上通过所有 NVIDIA GPU 使用 auto-batch。你可以跨设备或按模型大小进行比较,切换图表指标,或按代次进行筛选;该表格完全支持排序。

Compare
Model
Chart metric
Generation
H200 SXM
Hopper
141 GB
490.6
221
40.2 GB
361 W
$4.39
402.3K
B300
Blackwell
288 GB
474.6
411
73.4 GB
457 W
$7.39
231.2K
H200 NVL
Hopper
143 GB
469.3
221
39.8 GB
283 W
$3.39
498.4K
H100 NVL
Hopper
94 GB
432.1
147
26.8 GB
274 W
$3.19
487.6K
H100 SXM
Hopper
80 GB
424.3
123
23.1 GB
315 W
$3.29
464.3K
RTX PRO 6000
Blackwell
96 GB
420.6
149
27.6 GB
319 W
$2.09
724.5K
B200
Blackwell
180 GB
404.9
281
50.4 GB
419 W
$5.89
247.5K
RTX 5090
Blackwell
32 GB
356
49
9.7 GB
304 W
$0.99
1.3M
RTX PRO 5000
Blackwell
48 GB
319.7
73
13.8 GB
220 W
$0.96
1.2M
RTX 4090
Ada
24 GB
306
35
13.5 GB
235 W
$0.69
1.6M
H100 PCIe
Hopper
80 GB
302.4
123
22.6 GB
197 W
$2.89
376.7K
RTX 6000 Ada
Ada
48 GB
294.8
73
13.9 GB
254 W
$0.77
1.4M
A100 SXM
Ampere
80 GB
286.8
123
23.1 GB
342 W
$1.49
692.9K
A100 PCIe
Ampere
80 GB
283.2
123
23.2 GB
328 W
$1.39
733.5K
L40S
Ada
48 GB
265.1
70
13.3 GB
258 W
$0.86
1.1M
L40
Ada
48 GB
255.5
68
13.1 GB
255 W
$0.99
929.1K
RTX PRO 4500
Blackwell
32 GB
249.7
49
11.0 GB
161 W
$0.64
1.4M
RTX A6000
Ampere
48 GB
209.9
73
13.9 GB
278 W
$0.49
1.5M
RTX PRO 4000
Blackwell
24 GB
193.9
35
7.0 GB
141 W
$0.57
1.2M
RTX 3090
Ampere
24 GB
184.8
35
13.3 GB
312 W
$0.46
1.4M
RTX A5000
Ampere
24 GB
171.2
35
7.1 GB
216 W
$0.27
2.3M
A40
Ampere
48 GB
161.2
70
13.4 GB
262 W
$0.44
1.3M
RTX A4500
Ampere
20 GB
149.2
30
9.1 GB
191 W
$0.25
2.1M
RTX 4000 Ada
Ada
20 GB
127.9
30
6.5 GB
98 W
$0.26
1.8M
L4
Ada
24 GB
116
33
10.2 GB
78 W
$0.39
1.1M
RTX 2000 Ada
Ada
16 GB
88
22
4.7 GB
60 W
$0.24
1.3M

训练方法论

我们使用训练吞吐量(即训练期间每秒处理的图像数量)作为衡量标准;它与解决方案所需时间直接相关。每个结果都是在 Ultralytics Platform GPU 上测量的——这就是你一键租用进行云端训练的 NVIDIA 硬件,从入门级工作站显卡到旗舰级数据中心 GPU。我们训练了全部五种尺寸(n/s/m/l/x)的 YOLO26,方便你根据硬件预算匹配模型。

设置。 在 640px 分辨率下,使用 25% 的 COCO 数据集训练 2 个 epoch,采用 AMP 混合精度、单 GPU,并使用 auto-batch (batch=-1) 自动选择内存能容纳的最大 batch。我们报告第二个 epoch 的稳态数据,排除了第一个 epoch 的预热(数据集缓存、CUDA 图捕获)和运行结束时的验证过程。最终的 batch size、峰值 VRAM(包括 CUDA 上下文)和峰值板载功耗均直接从每个 GPU 记录。

成本效率。 每美元处理的图像数 = 吞吐量 × 3600 ÷ 每小时价格,采用 Ultralytics Platform 按需计费价格——这通常会大幅改变排名,因为性价比显卡每美元产生的价值往往高于旗舰级 GPU。在 ultralytics 8.4.68、torch 2.8、CUDA 12.8 环境下测量。另请参阅 TrainBenchmark 模式文档。

GPU 推理速度

在 Platform 上的每款 NVIDIA GPU 上,针对不同格式(PyTorch、ONNX、TensorRT)和精度(FP16、INT8)进行的 YOLO26 检测推理测试,以 batch 1 为单位计时。你可以跨设备或按模型大小比较,切换格式/精度和图表指标,或按代次筛选;可排序表格还显示了精度 (mAP) 和成本效率。

Compare
Model
Format / precision
Chart metric
Generation
H200 NVL
Hopper
3.18
315
0.395
5.3 MB
1.32 GB
$3.39
334.1K
H100 NVL
Hopper
4.40
227
0.395
5.3 MB
1.21 GB
$3.19
256.5K
RTX 5090
Blackwell
4.41
227
0.395
5.3 MB
1.16 GB
$0.99
824K
RTX PRO 6000
Blackwell
4.55
220
0.395
5.3 MB
1.36 GB
$2.09
378.8K
L4
Ada
4.98
201
0.395
5.3 MB
0.85 GB
$0.39
1.9M
H200 SXM
Hopper
5.01
200
0.395
5.3 MB
1.30 GB
$4.39
163.8K
RTX PRO 5000
Blackwell
5.39
185
0.395
5.3 MB
1.01 GB
$0.96
695.3K
B300
Blackwell
5.44
184
0.395
5.3 MB
1.73 GB
$7.39
89.5K
Apple M5 Pro
Apple Silicon
MPS
5.67
177
0.395
5.3 MB
L40S
Ada
6.17
162
0.395
5.3 MB
1.17 GB
$0.86
678.6K
H100 SXM
Hopper
6.36
157
0.395
5.3 MB
1.18 GB
$3.29
172K
RTX 4090
Ada
6.67
150
0.395
5.3 MB
1.00 GB
$0.69
781.6K
RTX 6000 Ada
Ada
7.25
138
0.395
5.3 MB
1.19 GB
$0.77
645.2K
RTX PRO 4500
Blackwell
7.40
135
0.395
5.3 MB
0.88 GB
$0.64
760.5K
RTX A6000
Ampere
7.74
129
0.395
5.3 MB
0.87 GB
$0.49
948.5K
H100 PCIe
Hopper
7.92
126
0.395
5.3 MB
1.10 GB
$2.89
157.2K
A40
Ampere
7.96
126
0.395
5.3 MB
0.96 GB
$0.44
1M
RTX A5000
Ampere
8.25
121
0.395
5.3 MB
0.78 GB
$0.27
1.6M
B200
Blackwell
8.38
119
0.395
5.3 MB
$5.89
72.9K
RTX 2000 Ada
Ada
8.41
119
0.395
5.3 MB
0.62 GB
$0.24
1.8M
RTX PRO 4000
Blackwell
8.57
117
0.395
5.3 MB
0.83 GB
$0.57
737.1K
A100 SXM
Ampere
8.72
115
0.395
5.3 MB
1.34 GB
$1.49
276.9K
L40
Ada
8.76
114
0.395
5.3 MB
1.26 GB
$0.99
414.9K
RTX 4000 Ada
Ada
8.87
113
0.395
5.3 MB
0.61 GB
$0.26
1.6M
RTX 3090
Ampere
8.92
112
0.395
5.3 MB
0.84 GB
$0.46
877.3K
RTX A4500
Ampere
10.13
99
0.395
5.3 MB
0.61 GB
$0.25
1.4M
A100 PCIe
Ampere
11.04
91
0.395
5.3 MB
1.34 GB
$1.39
234.6K

推理方法论

我们使用推理延迟(即 batch 1 下每张图像的毫秒数)作为衡量标准;这是实时部署所关心的核心指标。每种 YOLO26 尺寸都被导出为所示的格式和精度,然后我们在你进行部署时所使用的同一款 Ultralytics Platform GPU 上,对稳态预测进行计时(排除预热,运行时间采用 sigma 裁剪)。

格式与精度。 在 NVIDIA GPU 上:PyTorch FP16、ONNX FP16 和 TensorRT FP16/INT8(通过 NVIDIA ModelOpt 的 TensorRT 11.1.0.106)。INT8 在 COCO128 上进行校准;精度(COCO val2017 上的 mAP50-95)每种格式/精度测量一次并按行显示,因此速度与精度的权衡非常明确。INT8 在较大、计算受限的模型上收益最高——在最小的模型上,其量化开销可能与 FP16 持平或稍显逊色。ONNX 推理在 Ada/Ampere/Hopper GPU 上运行(onnxruntime 尚无 Blackwell 内核)。

Apple Silicon。 Mac 设备(例如 Apple M5 Pro)在本地进行性能分析并合并到表格中——选择一种格式即可将其与云端 GPU 直接比较,或按 Apple Silicon 代次筛选。CoreML 在 Neural Engine(苹果最快的路径,约为 CPU 的 3 倍)上运行,PyTorch 在 MPS GPU 上运行,ONNX 在 CPU 上运行;每一行的 Backend 列指明了运行时环境。CoreML 使用 coremltools 在 ANE 上计时——这是相对于主机的屏幕计时,而非 iPhone 设备数据。自有硬件没有租赁价格,因此成本效率(每美元图像数)仅针对 GPU 计算。

成本效率。 每美元推理次数 = FPS × 3600 ÷ 每小时价格,采用 Ultralytics Platform 按需计费价格。在 ultralytics 8.4.71、torch 2.12、CUDA 13.2 环境下测量。另请参阅 PredictBenchmark 模式文档。

Ready to build your next vision AI project?

Built on Ultralytics open source with 134.2k+ GitHub stars. Start training models in minutes.