GPU 训练吞吐量
YOLO26 检测在 COCO 上以 640px 进行训练,并在 Platform 上通过所有 NVIDIA GPU 使用 auto-batch。你可以跨设备或按模型大小进行比较,切换图表指标,或按代次进行筛选;该表格完全支持排序。
H200 SXM | 141 GB | 490.6 | 221 | 40.2 GB | 361 W | $4.39 | 402.3K | |
B300 | 288 GB | 474.6 | 411 | 73.4 GB | 457 W | $7.39 | 231.2K | |
H200 NVL | 143 GB | 469.3 | 221 | 39.8 GB | 283 W | $3.39 | 498.4K | |
H100 NVL | 94 GB | 432.1 | 147 | 26.8 GB | 274 W | $3.19 | 487.6K | |
H100 SXM | 80 GB | 424.3 | 123 | 23.1 GB | 315 W | $3.29 | 464.3K | |
RTX PRO 6000 | 96 GB | 420.6 | 149 | 27.6 GB | 319 W | $2.09 | 724.5K | |
B200 | 180 GB | 404.9 | 281 | 50.4 GB | 419 W | $5.89 | 247.5K | |
RTX 5090 | 32 GB | 356 | 49 | 9.7 GB | 304 W | $0.99 | 1.3M | |
RTX PRO 5000 | 48 GB | 319.7 | 73 | 13.8 GB | 220 W | $0.96 | 1.2M | |
RTX 4090 | 24 GB | 306 | 35 | 13.5 GB | 235 W | $0.69 | 1.6M | |
H100 PCIe | 80 GB | 302.4 | 123 | 22.6 GB | 197 W | $2.89 | 376.7K | |
RTX 6000 Ada | 48 GB | 294.8 | 73 | 13.9 GB | 254 W | $0.77 | 1.4M | |
A100 SXM | 80 GB | 286.8 | 123 | 23.1 GB | 342 W | $1.49 | 692.9K | |
A100 PCIe | 80 GB | 283.2 | 123 | 23.2 GB | 328 W | $1.39 | 733.5K | |
L40S | 48 GB | 265.1 | 70 | 13.3 GB | 258 W | $0.86 | 1.1M | |
L40 | 48 GB | 255.5 | 68 | 13.1 GB | 255 W | $0.99 | 929.1K | |
RTX PRO 4500 | 32 GB | 249.7 | 49 | 11.0 GB | 161 W | $0.64 | 1.4M | |
RTX A6000 | 48 GB | 209.9 | 73 | 13.9 GB | 278 W | $0.49 | 1.5M | |
RTX PRO 4000 | 24 GB | 193.9 | 35 | 7.0 GB | 141 W | $0.57 | 1.2M | |
RTX 3090 | 24 GB | 184.8 | 35 | 13.3 GB | 312 W | $0.46 | 1.4M | |
RTX A5000 | 24 GB | 171.2 | 35 | 7.1 GB | 216 W | $0.27 | 2.3M | |
A40 | 48 GB | 161.2 | 70 | 13.4 GB | 262 W | $0.44 | 1.3M | |
RTX A4500 | 20 GB | 149.2 | 30 | 9.1 GB | 191 W | $0.25 | 2.1M | |
RTX 4000 Ada | 20 GB | 127.9 | 30 | 6.5 GB | 98 W | $0.26 | 1.8M | |
L4 | 24 GB | 116 | 33 | 10.2 GB | 78 W | $0.39 | 1.1M | |
RTX 2000 Ada | 16 GB | 88 | 22 | 4.7 GB | 60 W | $0.24 | 1.3M |
训练方法论
我们使用训练吞吐量(即训练期间每秒处理的图像数量)作为衡量标准;它与解决方案所需时间直接相关。每个结果都是在 Ultralytics Platform GPU 上测量的——这就是你一键租用进行云端训练的 NVIDIA 硬件,从入门级工作站显卡到旗舰级数据中心 GPU。我们训练了全部五种尺寸(n/s/m/l/x)的 YOLO26,方便你根据硬件预算匹配模型。
设置。 在 640px 分辨率下,使用 25% 的 COCO 数据集训练 2 个 epoch,采用 AMP 混合精度、单 GPU,并使用 auto-batch (batch=-1) 自动选择内存能容纳的最大 batch。我们报告第二个 epoch 的稳态数据,排除了第一个 epoch 的预热(数据集缓存、CUDA 图捕获)和运行结束时的验证过程。最终的 batch size、峰值 VRAM(包括 CUDA 上下文)和峰值板载功耗均直接从每个 GPU 记录。
成本效率。 每美元处理的图像数 = 吞吐量 × 3600 ÷ 每小时价格,采用 Ultralytics Platform 按需计费价格——这通常会大幅改变排名,因为性价比显卡每美元产生的价值往往高于旗舰级 GPU。在 ultralytics 8.4.68、torch 2.8、CUDA 12.8 环境下测量。另请参阅 Train 和 Benchmark 模式文档。
GPU 推理速度
在 Platform 上的每款 NVIDIA GPU 上,针对不同格式(PyTorch、ONNX、TensorRT)和精度(FP16、INT8)进行的 YOLO26 检测推理测试,以 batch 1 为单位计时。你可以跨设备或按模型大小比较,切换格式/精度和图表指标,或按代次筛选;可排序表格还显示了精度 (mAP) 和成本效率。
H200 NVL | — | 3.18 | 315 | 0.395 | 5.3 MB | 1.32 GB | $3.39 | 334.1K | |
H100 NVL | — | 4.40 | 227 | 0.395 | 5.3 MB | 1.21 GB | $3.19 | 256.5K | |
RTX 5090 | — | 4.41 | 227 | 0.395 | 5.3 MB | 1.16 GB | $0.99 | 824K | |
RTX PRO 6000 | — | 4.55 | 220 | 0.395 | 5.3 MB | 1.36 GB | $2.09 | 378.8K | |
L4 | — | 4.98 | 201 | 0.395 | 5.3 MB | 0.85 GB | $0.39 | 1.9M | |
H200 SXM | — | 5.01 | 200 | 0.395 | 5.3 MB | 1.30 GB | $4.39 | 163.8K | |
RTX PRO 5000 | — | 5.39 | 185 | 0.395 | 5.3 MB | 1.01 GB | $0.96 | 695.3K | |
B300 | — | 5.44 | 184 | 0.395 | 5.3 MB | 1.73 GB | $7.39 | 89.5K | |
Apple M5 Pro | MPS | 5.67 | 177 | 0.395 | 5.3 MB | — | — | — | |
L40S | — | 6.17 | 162 | 0.395 | 5.3 MB | 1.17 GB | $0.86 | 678.6K | |
H100 SXM | — | 6.36 | 157 | 0.395 | 5.3 MB | 1.18 GB | $3.29 | 172K | |
RTX 4090 | — | 6.67 | 150 | 0.395 | 5.3 MB | 1.00 GB | $0.69 | 781.6K | |
RTX 6000 Ada | — | 7.25 | 138 | 0.395 | 5.3 MB | 1.19 GB | $0.77 | 645.2K | |
RTX PRO 4500 | — | 7.40 | 135 | 0.395 | 5.3 MB | 0.88 GB | $0.64 | 760.5K | |
RTX A6000 | — | 7.74 | 129 | 0.395 | 5.3 MB | 0.87 GB | $0.49 | 948.5K | |
H100 PCIe | — | 7.92 | 126 | 0.395 | 5.3 MB | 1.10 GB | $2.89 | 157.2K | |
A40 | — | 7.96 | 126 | 0.395 | 5.3 MB | 0.96 GB | $0.44 | 1M | |
RTX A5000 | — | 8.25 | 121 | 0.395 | 5.3 MB | 0.78 GB | $0.27 | 1.6M | |
B200 | — | 8.38 | 119 | 0.395 | 5.3 MB | — | $5.89 | 72.9K | |
RTX 2000 Ada | — | 8.41 | 119 | 0.395 | 5.3 MB | 0.62 GB | $0.24 | 1.8M | |
RTX PRO 4000 | — | 8.57 | 117 | 0.395 | 5.3 MB | 0.83 GB | $0.57 | 737.1K | |
A100 SXM | — | 8.72 | 115 | 0.395 | 5.3 MB | 1.34 GB | $1.49 | 276.9K | |
L40 | — | 8.76 | 114 | 0.395 | 5.3 MB | 1.26 GB | $0.99 | 414.9K | |
RTX 4000 Ada | — | 8.87 | 113 | 0.395 | 5.3 MB | 0.61 GB | $0.26 | 1.6M | |
RTX 3090 | — | 8.92 | 112 | 0.395 | 5.3 MB | 0.84 GB | $0.46 | 877.3K | |
RTX A4500 | — | 10.13 | 99 | 0.395 | 5.3 MB | 0.61 GB | $0.25 | 1.4M | |
A100 PCIe | — | 11.04 | 91 | 0.395 | 5.3 MB | 1.34 GB | $1.39 | 234.6K |
推理方法论
我们使用推理延迟(即 batch 1 下每张图像的毫秒数)作为衡量标准;这是实时部署所关心的核心指标。每种 YOLO26 尺寸都被导出为所示的格式和精度,然后我们在你进行部署时所使用的同一款 Ultralytics Platform GPU 上,对稳态预测进行计时(排除预热,运行时间采用 sigma 裁剪)。
格式与精度。 在 NVIDIA GPU 上:PyTorch FP16、ONNX FP16 和 TensorRT FP16/INT8(通过 NVIDIA ModelOpt 的 TensorRT 11.1.0.106)。INT8 在 COCO128 上进行校准;精度(COCO val2017 上的 mAP50-95)每种格式/精度测量一次并按行显示,因此速度与精度的权衡非常明确。INT8 在较大、计算受限的模型上收益最高——在最小的模型上,其量化开销可能与 FP16 持平或稍显逊色。ONNX 推理在 Ada/Ampere/Hopper GPU 上运行(onnxruntime 尚无 Blackwell 内核)。
Apple Silicon。 Mac 设备(例如 Apple M5 Pro)在本地进行性能分析并合并到表格中——选择一种格式即可将其与云端 GPU 直接比较,或按 Apple Silicon 代次筛选。CoreML 在 Neural Engine(苹果最快的路径,约为 CPU 的 3 倍)上运行,PyTorch 在 MPS GPU 上运行,ONNX 在 CPU 上运行;每一行的 Backend 列指明了运行时环境。CoreML 使用 coremltools 在 ANE 上计时——这是相对于主机的屏幕计时,而非 iPhone 设备数据。自有硬件没有租赁价格,因此成本效率(每美元图像数)仅针对 GPU 计算。
成本效率。 每美元推理次数 = FPS × 3600 ÷ 每小时价格,采用 Ultralytics Platform 按需计费价格。在 ultralytics 8.4.71、torch 2.12、CUDA 13.2 环境下测量。另请参阅 Predict 和 Benchmark 模式文档。
Train on the Best GPUs for Less
26 NVIDIA GPUs starting at $0.24/hr — from Ampere to Blackwell. No markup, no minimums, no commitment.
Ready to build your next vision AI project?
Built on Ultralytics open source with 134.2k+ GitHub stars. Start training models in minutes.