Ultralyticsベンチマーク
YOLO26がUltralytics PlatformのNVIDIA GPUでどのように動作するか。トレーニングスループットと推論レイテンシ、メモリ、電力、精度、コスト効率を測定し、予算とスケジュールに適したGPUを選択できます。
GPUトレーニングスループット
Platform上のすべてのNVIDIA GPUにおいて、COCOデータセットで640px、自動バッチ(auto-batch)を使用してトレーニングされたYOLO26検出モデル。デバイス間やモデルサイズごとの比較、チャート指標の切り替え、世代によるフィルタリングが可能で、テーブルは完全にソート可能です。
H200 SXM | 141 GB | 490.6 | 221 | 40.2 GB | 361 W | $4.39 | 402.3K | |
B300 | 288 GB | 474.6 | 411 | 73.4 GB | 457 W | $7.39 | 231.2K | |
H200 NVL | 143 GB | 469.3 | 221 | 39.8 GB | 283 W | $3.39 | 498.4K | |
H100 NVL | 94 GB | 432.1 | 147 | 26.8 GB | 274 W | $3.19 | 487.6K | |
H100 SXM | 80 GB | 424.3 | 123 | 23.1 GB | 315 W | $3.29 | 464.3K | |
RTX PRO 6000 | 96 GB | 420.6 | 149 | 27.6 GB | 319 W | $2.09 | 724.5K | |
B200 | 180 GB | 404.9 | 281 | 50.4 GB | 419 W | $5.89 | 247.5K | |
RTX 5090 | 32 GB | 356 | 49 | 9.7 GB | 304 W | $0.99 | 1.3M | |
RTX PRO 5000 | 48 GB | 319.7 | 73 | 13.8 GB | 220 W | $0.96 | 1.2M | |
RTX 4090 | 24 GB | 306 | 35 | 13.5 GB | 235 W | $0.69 | 1.6M | |
H100 PCIe | 80 GB | 302.4 | 123 | 22.6 GB | 197 W | $2.89 | 376.7K | |
RTX 6000 Ada | 48 GB | 294.8 | 73 | 13.9 GB | 254 W | $0.77 | 1.4M | |
A100 SXM | 80 GB | 286.8 | 123 | 23.1 GB | 342 W | $1.49 | 692.9K | |
A100 PCIe | 80 GB | 283.2 | 123 | 23.2 GB | 328 W | $1.39 | 733.5K | |
L40S | 48 GB | 265.1 | 70 | 13.3 GB | 258 W | $0.86 | 1.1M | |
L40 | 48 GB | 255.5 | 68 | 13.1 GB | 255 W | $0.99 | 929.1K | |
RTX PRO 4500 | 32 GB | 249.7 | 49 | 11.0 GB | 161 W | $0.64 | 1.4M | |
RTX A6000 | 48 GB | 209.9 | 73 | 13.9 GB | 278 W | $0.49 | 1.5M | |
RTX PRO 4000 | 24 GB | 193.9 | 35 | 7.0 GB | 141 W | $0.57 | 1.2M | |
RTX 3090 | 24 GB | 184.8 | 35 | 13.3 GB | 312 W | $0.46 | 1.4M | |
RTX A5000 | 24 GB | 171.2 | 35 | 7.1 GB | 216 W | $0.27 | 2.3M | |
A40 | 48 GB | 161.2 | 70 | 13.4 GB | 262 W | $0.44 | 1.3M | |
RTX A4500 | 20 GB | 149.2 | 30 | 9.1 GB | 191 W | $0.25 | 2.1M | |
RTX 4000 Ada | 20 GB | 127.9 | 30 | 6.5 GB | 98 W | $0.26 | 1.8M | |
L4 | 24 GB | 116 | 33 | 10.2 GB | 78 W | $0.39 | 1.1M | |
RTX 2000 Ada | 16 GB | 88 | 22 | 4.7 GB | 60 W | $0.24 | 1.3M |
トレーニング手法
指標として、トレーニング中に処理される画像枚数であるトレーニングスループットを使用します。これは解決までの時間に直接相関します。すべての結果はUltralytics PlatformのGPUで測定されます。これは、クラウドトレーニング用にワンクリックでレンタルできるNVIDIAハードウェアと同じもので、エントリーレベルのワークステーションカードからフラッグシップのデータセンターGPUまでを含みます。YOLO26の5つの全サイズ(n/s/m/l/x)をトレーニングし、ハードウェア予算に合ったモデルを選択できるようにしています。
設定 640pxのCOCOの25%で2エポック、AMP混合精度、シングルGPU、auto-batch(batch=-1)を使用し、メモリに収まる最大バッチサイズを選択します。定常状態の2エポック目を報告し、最初のエポックのウォームアップ(データセットキャッシング、CUDAグラフキャプチャ)と実行終了時の検証パスは除外します。決定されたバッチサイズ、ピークVRAM(CUDAコンテキストを含む)、ピークボード電力は、各GPUから直接記録されます。
コスト効率 1ドルあたりの画像処理枚数 = スループット × 3600 ÷ 時間単価。Ultralytics Platformのオンデマンド価格を使用します。コスト効率の高いカードはフラッグシップGPUよりも1ドルあたりの収益が高いため、ランキングが劇的に変わることがよくあります。ultralytics 8.4.68、torch 2.8、CUDA 12.8で測定。TrainおよびBenchmarkモードのドキュメントも併せて参照してください。
GPU推論速度
Platform上のあらゆるNVIDIA GPUにおける、フォーマット(PyTorch、ONNX、TensorRT)および精度(FP16、INT8)ごとのYOLO26検出推論(バッチサイズ1で測定)。デバイス間やモデルサイズごとの比較、フォーマット/精度やチャート指標の切り替え、世代によるフィルタリングが可能です。ソート可能なテーブルには精度(mAP)とコスト効率も表示されます。
H200 NVL | — | 3.18 | 315 | 0.395 | 5.3 MB | 1.32 GB | $3.39 | 334.1K | |
H100 NVL | — | 4.40 | 227 | 0.395 | 5.3 MB | 1.21 GB | $3.19 | 256.5K | |
RTX 5090 | — | 4.41 | 227 | 0.395 | 5.3 MB | 1.16 GB | $0.99 | 824K | |
RTX PRO 6000 | — | 4.55 | 220 | 0.395 | 5.3 MB | 1.36 GB | $2.09 | 378.8K | |
L4 | — | 4.98 | 201 | 0.395 | 5.3 MB | 0.85 GB | $0.39 | 1.9M | |
H200 SXM | — | 5.01 | 200 | 0.395 | 5.3 MB | 1.30 GB | $4.39 | 163.8K | |
RTX PRO 5000 | — | 5.39 | 185 | 0.395 | 5.3 MB | 1.01 GB | $0.96 | 695.3K | |
B300 | — | 5.44 | 184 | 0.395 | 5.3 MB | 1.73 GB | $7.39 | 89.5K | |
Apple M5 Pro | MPS | 5.67 | 177 | 0.395 | 5.3 MB | — | — | — | |
L40S | — | 6.17 | 162 | 0.395 | 5.3 MB | 1.17 GB | $0.86 | 678.6K | |
H100 SXM | — | 6.36 | 157 | 0.395 | 5.3 MB | 1.18 GB | $3.29 | 172K | |
RTX 4090 | — | 6.67 | 150 | 0.395 | 5.3 MB | 1.00 GB | $0.69 | 781.6K | |
RTX 6000 Ada | — | 7.25 | 138 | 0.395 | 5.3 MB | 1.19 GB | $0.77 | 645.2K | |
RTX PRO 4500 | — | 7.40 | 135 | 0.395 | 5.3 MB | 0.88 GB | $0.64 | 760.5K | |
RTX A6000 | — | 7.74 | 129 | 0.395 | 5.3 MB | 0.87 GB | $0.49 | 948.5K | |
H100 PCIe | — | 7.92 | 126 | 0.395 | 5.3 MB | 1.10 GB | $2.89 | 157.2K | |
A40 | — | 7.96 | 126 | 0.395 | 5.3 MB | 0.96 GB | $0.44 | 1M | |
RTX A5000 | — | 8.25 | 121 | 0.395 | 5.3 MB | 0.78 GB | $0.27 | 1.6M | |
B200 | — | 8.38 | 119 | 0.395 | 5.3 MB | — | $5.89 | 72.9K | |
RTX 2000 Ada | — | 8.41 | 119 | 0.395 | 5.3 MB | 0.62 GB | $0.24 | 1.8M | |
RTX PRO 4000 | — | 8.57 | 117 | 0.395 | 5.3 MB | 0.83 GB | $0.57 | 737.1K | |
A100 SXM | — | 8.72 | 115 | 0.395 | 5.3 MB | 1.34 GB | $1.49 | 276.9K | |
L40 | — | 8.76 | 114 | 0.395 | 5.3 MB | 1.26 GB | $0.99 | 414.9K | |
RTX 4000 Ada | — | 8.87 | 113 | 0.395 | 5.3 MB | 0.61 GB | $0.26 | 1.6M | |
RTX 3090 | — | 8.92 | 112 | 0.395 | 5.3 MB | 0.84 GB | $0.46 | 877.3K | |
RTX A4500 | — | 10.13 | 99 | 0.395 | 5.3 MB | 0.61 GB | $0.25 | 1.4M | |
A100 PCIe | — | 11.04 | 91 | 0.395 | 5.3 MB | 1.34 GB | $1.39 | 234.6K |
推論手法
指標として、バッチサイズ1での画像あたりのミリ秒数である推論レイテンシを使用します。これはリアルタイムのデプロイにおいて重要な指標です。各YOLO26サイズを表示されたフォーマットと精度にエクスポートし、デプロイ先となるUltralytics PlatformのGPU上で、定常状態の予測時間を計測します(ウォームアップを除外、実行ごとの時間をシグマクリップ)。
フォーマットと精度 NVIDIA GPU上では、PyTorch FP16、ONNX FP16、TensorRT FP16/INT8(NVIDIA ModelOpt経由のTensorRT 11.1.0.106)を使用します。INT8はCOCO128でキャリブレーションされています。精度(COCO val2017でのmAP50-95)はフォーマット/精度ごとに1回測定され、行ごとに表示されるため、速度と精度のトレードオフが明確になります。INT8は大規模で計算負荷の高いモデルで最も効果を発揮します。最小のモデルでは量子化オーバーヘッドがFP16と同等か、わずかに遅くなる場合があります。ONNX推論はAda/Ampere/Hopper GPUで実行されます(onnxruntimeはまだBlackwellカーネルに対応していません)。
Apple Silicon Macデバイス(例:Apple M5 Pro)はローカルでプロファイリングされ、テーブルにマージされます。フォーマットを選択してクラウドGPUと直接比較するか、Apple Silicon世代でフィルタリングしてください。CoreMLはNeural Engine(最も高速なAppleのパス、CPUの約3倍)上で、PyTorchはMPS GPU上で、ONNXはCPU上で実行されます。各行のBackend列にはランタイムが記載されています。CoreMLはANE上でcoremltoolsを使用してタイミングを計測しています。これはホスト画面上の相対的な値であり、iPhoneデバイスの数値ではありません。所有ハードウェアにはレンタル価格がないため、コスト効率(img/$)はGPUのみの計算です。
コスト効率 1ドルあたりの推論回数 = FPS × 3600 ÷ 時間単価。Ultralytics Platformのオンデマンド価格を使用します。ultralytics 8.4.71、torch 2.12、CUDA 13.2で測定。PredictおよびBenchmarkモードのドキュメントも併せて参照してください。
Train on the Best GPUs for Less
26 NVIDIA GPUs starting at $0.24/hr — from Ampere to Blackwell. No markup, no minimums, no commitment.
Ready to build your next vision AI project?
Built on Ultralytics open source with 134.2k+ GitHub stars. Start training models in minutes.