Ultralytics Kıyaslamaları
YOLO26'nın Ultralytics Platformu'ndaki NVIDIA GPU'larda nasıl performans gösterdiği — ölçülen eğitim verimliliği ve çıkarım gecikmesi; bellek, güç, doğruluk ve maliyet verimliliği ile birlikte, böylece bütçene ve zaman çizelgene uygun GPU'yu seçebilirsin.
GPU Eğitim Verimliliği
Platformdaki her NVIDIA GPU üzerinde COCO'da 640px'te ve otomatik toplu işleme (auto-batch) ile eğitilmiş YOLO26 tespiti. Cihazlar arasında veya model boyutuna göre karşılaştır, grafik metriğini değiştir veya nesile göre filtrele; tablo tamamen sıralanabilir.
H200 SXM | 141 GB | 490.6 | 221 | 40.2 GB | 361 W | $4.39 | 402.3K | |
B300 | 288 GB | 474.6 | 411 | 73.4 GB | 457 W | $7.39 | 231.2K | |
H200 NVL | 143 GB | 469.3 | 221 | 39.8 GB | 283 W | $3.39 | 498.4K | |
H100 NVL | 94 GB | 432.1 | 147 | 26.8 GB | 274 W | $3.19 | 487.6K | |
H100 SXM | 80 GB | 424.3 | 123 | 23.1 GB | 315 W | $3.29 | 464.3K | |
RTX PRO 6000 | 96 GB | 420.6 | 149 | 27.6 GB | 319 W | $2.09 | 724.5K | |
B200 | 180 GB | 404.9 | 281 | 50.4 GB | 419 W | $5.89 | 247.5K | |
RTX 5090 | 32 GB | 356 | 49 | 9.7 GB | 304 W | $0.99 | 1.3M | |
RTX PRO 5000 | 48 GB | 319.7 | 73 | 13.8 GB | 220 W | $0.96 | 1.2M | |
RTX 4090 | 24 GB | 306 | 35 | 13.5 GB | 235 W | $0.69 | 1.6M | |
H100 PCIe | 80 GB | 302.4 | 123 | 22.6 GB | 197 W | $2.89 | 376.7K | |
RTX 6000 Ada | 48 GB | 294.8 | 73 | 13.9 GB | 254 W | $0.77 | 1.4M | |
A100 SXM | 80 GB | 286.8 | 123 | 23.1 GB | 342 W | $1.49 | 692.9K | |
A100 PCIe | 80 GB | 283.2 | 123 | 23.2 GB | 328 W | $1.39 | 733.5K | |
L40S | 48 GB | 265.1 | 70 | 13.3 GB | 258 W | $0.86 | 1.1M | |
L40 | 48 GB | 255.5 | 68 | 13.1 GB | 255 W | $0.99 | 929.1K | |
RTX PRO 4500 | 32 GB | 249.7 | 49 | 11.0 GB | 161 W | $0.64 | 1.4M | |
RTX A6000 | 48 GB | 209.9 | 73 | 13.9 GB | 278 W | $0.49 | 1.5M | |
RTX PRO 4000 | 24 GB | 193.9 | 35 | 7.0 GB | 141 W | $0.57 | 1.2M | |
RTX 3090 | 24 GB | 184.8 | 35 | 13.3 GB | 312 W | $0.46 | 1.4M | |
RTX A5000 | 24 GB | 171.2 | 35 | 7.1 GB | 216 W | $0.27 | 2.3M | |
A40 | 48 GB | 161.2 | 70 | 13.4 GB | 262 W | $0.44 | 1.3M | |
RTX A4500 | 20 GB | 149.2 | 30 | 9.1 GB | 191 W | $0.25 | 2.1M | |
RTX 4000 Ada | 20 GB | 127.9 | 30 | 6.5 GB | 98 W | $0.26 | 1.8M | |
L4 | 24 GB | 116 | 33 | 10.2 GB | 78 W | $0.39 | 1.1M | |
RTX 2000 Ada | 16 GB | 88 | 22 | 4.7 GB | 60 W | $0.24 | 1.3M |
Eğitim metodolojisi
Ölçüt olarak eğitim sırasında saniyede işlenen görüntü sayısı olan eğitim verimliliğini kullanıyoruz; bu doğrudan çözüme ulaşma süresiyle ilişkilidir. Her sonuç, bulut eğitiminde tek tıkla kiraladığın NVIDIA donanımıyla aynı olan Ultralytics Platform GPU'larında ölçülür. YOLO26 modelini beş boyutta da (n/s/m/l/x) eğitiyoruz, böylece donanım bütçene uygun bir model seçebilirsin.
Ayarlar. 640px'te COCO'nun %25'i üzerinde 2 epoch, AMP karma hassasiyet, tek GPU ve belleğe sığan en büyük yığını seçen auto-batch (batch=-1) kullanımı. İlk epoch ısınma (veri kümesi önbelleğe alma, CUDA grafiği yakalama) ve çalışma sonu doğrulama geçişini dışarıda bırakan, kararlı durumdaki ikinci epoch'u raporluyoruz. Çözülen yığın boyutu, (CUDA bağlamı dahil) tepe VRAM ve tepe kart gücü doğrudan her GPU'dan kaydedilir.
Maliyet verimliliği. Dolar başına görüntü = verimlilik × 3600 ÷ saatlik fiyat, Ultralytics Platformu talep üzerine fiyatlandırma kullanılarak; değer odaklı kartlar, amiral gemisi GPU'lardan dolar başına daha fazla getiri sağladığından sıralamayı genellikle önemli ölçüde değiştirir. ultralytics 8.4.68, torch 2.8, CUDA 12.8 üzerinde ölçülmüştür. Ayrıca Train ve Benchmark modu belgelerine bakabilirsin.
GPU Çıkarım Hızı
Platformdaki her NVIDIA GPU üzerinde formatlar (PyTorch, ONNX, TensorRT) ve hassasiyetler (FP16, INT8) genelinde, 1 yığın boyutunda zamanlanmış YOLO26 tespit çıkarımı. Cihazlar arasında veya model boyutuna göre karşılaştır, format/hassasiyet ve grafik metriğini değiştir veya nesile göre filtrele; sıralanabilir tablo ayrıca doğruluğu (mAP) ve maliyet verimliliğini de gösterir.
H200 NVL | — | 3.18 | 315 | 0.395 | 5.3 MB | 1.32 GB | $3.39 | 334.1K | |
H100 NVL | — | 4.40 | 227 | 0.395 | 5.3 MB | 1.21 GB | $3.19 | 256.5K | |
RTX 5090 | — | 4.41 | 227 | 0.395 | 5.3 MB | 1.16 GB | $0.99 | 824K | |
RTX PRO 6000 | — | 4.55 | 220 | 0.395 | 5.3 MB | 1.36 GB | $2.09 | 378.8K | |
L4 | — | 4.98 | 201 | 0.395 | 5.3 MB | 0.85 GB | $0.39 | 1.9M | |
H200 SXM | — | 5.01 | 200 | 0.395 | 5.3 MB | 1.30 GB | $4.39 | 163.8K | |
RTX PRO 5000 | — | 5.39 | 185 | 0.395 | 5.3 MB | 1.01 GB | $0.96 | 695.3K | |
B300 | — | 5.44 | 184 | 0.395 | 5.3 MB | 1.73 GB | $7.39 | 89.5K | |
Apple M5 Pro | MPS | 5.67 | 177 | 0.395 | 5.3 MB | — | — | — | |
L40S | — | 6.17 | 162 | 0.395 | 5.3 MB | 1.17 GB | $0.86 | 678.6K | |
H100 SXM | — | 6.36 | 157 | 0.395 | 5.3 MB | 1.18 GB | $3.29 | 172K | |
RTX 4090 | — | 6.67 | 150 | 0.395 | 5.3 MB | 1.00 GB | $0.69 | 781.6K | |
RTX 6000 Ada | — | 7.25 | 138 | 0.395 | 5.3 MB | 1.19 GB | $0.77 | 645.2K | |
RTX PRO 4500 | — | 7.40 | 135 | 0.395 | 5.3 MB | 0.88 GB | $0.64 | 760.5K | |
RTX A6000 | — | 7.74 | 129 | 0.395 | 5.3 MB | 0.87 GB | $0.49 | 948.5K | |
H100 PCIe | — | 7.92 | 126 | 0.395 | 5.3 MB | 1.10 GB | $2.89 | 157.2K | |
A40 | — | 7.96 | 126 | 0.395 | 5.3 MB | 0.96 GB | $0.44 | 1M | |
RTX A5000 | — | 8.25 | 121 | 0.395 | 5.3 MB | 0.78 GB | $0.27 | 1.6M | |
B200 | — | 8.38 | 119 | 0.395 | 5.3 MB | — | $5.89 | 72.9K | |
RTX 2000 Ada | — | 8.41 | 119 | 0.395 | 5.3 MB | 0.62 GB | $0.24 | 1.8M | |
RTX PRO 4000 | — | 8.57 | 117 | 0.395 | 5.3 MB | 0.83 GB | $0.57 | 737.1K | |
A100 SXM | — | 8.72 | 115 | 0.395 | 5.3 MB | 1.34 GB | $1.49 | 276.9K | |
L40 | — | 8.76 | 114 | 0.395 | 5.3 MB | 1.26 GB | $0.99 | 414.9K | |
RTX 4000 Ada | — | 8.87 | 113 | 0.395 | 5.3 MB | 0.61 GB | $0.26 | 1.6M | |
RTX 3090 | — | 8.92 | 112 | 0.395 | 5.3 MB | 0.84 GB | $0.46 | 877.3K | |
RTX A4500 | — | 10.13 | 99 | 0.395 | 5.3 MB | 0.61 GB | $0.25 | 1.4M | |
A100 PCIe | — | 11.04 | 91 | 0.395 | 5.3 MB | 1.34 GB | $1.39 | 234.6K |
Çıkarım metodolojisi
Ölçüt olarak 1 yığın boyutunda görüntü başına milisaniye cinsinden çıkarım gecikmesini kullanıyoruz; gerçek zamanlı dağıtımın önemsediği şey budur. Her YOLO26 boyutu, gösterilen formata ve hassasiyete aktarılır, ardından dağıtım yaptığın aynı Ultralytics Platform GPU'larında kararlı durum tahmini (ısınma hariç, çalışma başına süreler sigma-kırpılmış) zamanlanır.
Formatlar ve hassasiyet. NVIDIA GPU'larda: PyTorch FP16, ONNX FP16 ve TensorRT FP16/INT8 (NVIDIA ModelOpt aracılığıyla TensorRT 11.1.0.106). INT8, COCO128 üzerinde kalibre edilmiştir; doğruluk (COCO val2017 üzerinde mAP50-95) format/hassasiyet başına bir kez ölçülür ve satır başına gösterilir, böylece hız↔doğruluk dengesi açıktır. INT8, daha büyük, işlem gücü sınırlı modellerde en iyi sonucu verir; en küçük modellerde ise niceleme yükü FP16 ile eşleşebilir veya biraz gerisinde kalabilir. ONNX çıkarımı Ada/Ampere/Hopper GPU'larında çalışır (onnxruntime henüz Blackwell çekirdeklerine sahip değildir).
Apple Silicon. Mac cihazları (örn. Apple M5 Pro) yerel olarak profillenir ve tabloya birleştirilir; bunları bulut GPU'larıyla doğrudan karşılaştırmak için bir format seç veya Apple Silicon nesline göre filtrele. CoreML, Neural Engine üzerinde (en hızlı Apple yolu, ~3× CPU), PyTorch MPS GPU üzerinde ve ONNX CPU üzerinde çalışır; her satırın Backend sütunu çalışma zamanını adlandırır. CoreML, ANE üzerinde coremltools ile zamanlanır; bu bir iPhone cihaz numarası değil, göreceli bir ana bilgisayar ekranıdır. Sahip olunan donanımın kiralama ücreti yoktur, bu nedenle maliyet verimliliği (img/$) sadece GPU'ya özeldir.
Maliyet verimliliği. Dolar başına çıkarım = FPS × 3600 ÷ saatlik fiyat, Ultralytics Platformu talep üzerine fiyatlandırma kullanılarak. ultralytics 8.4.71, torch 2.12, CUDA 13.2 üzerinde ölçülmüştür. Ayrıca Predict ve Benchmark modu belgelerine bakabilirsin.
Train on the Best GPUs for Less
26 NVIDIA GPUs starting at $0.24/hr — from Ampere to Blackwell. No markup, no minimums, no commitment.
Ready to build your next vision AI project?
Built on Ultralytics open source with 134.4k+ GitHub stars. Start training models in minutes.