Benchmark di Ultralytics
Come si comporta YOLO26 sulle GPU NVIDIA della piattaforma Ultralytics: throughput di addestramento misurato e latenza di inferenza, con memoria, potenza, precisione ed efficienza dei costi, così puoi scegliere la GPU giusta per il tuo budget e le tue tempistiche.
Throughput di Addestramento GPU
Rilevamento YOLO26 addestrato su COCO a 640px con auto-batch su ogni GPU NVIDIA sulla piattaforma. Confronta tra dispositivi o per dimensione del modello, cambia la metrica del grafico o filtra per generazione; la tabella è completamente ordinabile.
H200 SXM | 141 GB | 490.6 | 221 | 40.2 GB | 361 W | $4.39 | 402.3K | |
B300 | 288 GB | 474.6 | 411 | 73.4 GB | 457 W | $7.39 | 231.2K | |
H200 NVL | 143 GB | 469.3 | 221 | 39.8 GB | 283 W | $3.39 | 498.4K | |
H100 NVL | 94 GB | 432.1 | 147 | 26.8 GB | 274 W | $3.19 | 487.6K | |
H100 SXM | 80 GB | 424.3 | 123 | 23.1 GB | 315 W | $3.29 | 464.3K | |
RTX PRO 6000 | 96 GB | 420.6 | 149 | 27.6 GB | 319 W | $2.09 | 724.5K | |
B200 | 180 GB | 404.9 | 281 | 50.4 GB | 419 W | $5.89 | 247.5K | |
RTX 5090 | 32 GB | 356 | 49 | 9.7 GB | 304 W | $0.99 | 1.3M | |
RTX PRO 5000 | 48 GB | 319.7 | 73 | 13.8 GB | 220 W | $0.96 | 1.2M | |
RTX 4090 | 24 GB | 306 | 35 | 13.5 GB | 235 W | $0.69 | 1.6M | |
H100 PCIe | 80 GB | 302.4 | 123 | 22.6 GB | 197 W | $2.89 | 376.7K | |
RTX 6000 Ada | 48 GB | 294.8 | 73 | 13.9 GB | 254 W | $0.77 | 1.4M | |
A100 SXM | 80 GB | 286.8 | 123 | 23.1 GB | 342 W | $1.49 | 692.9K | |
A100 PCIe | 80 GB | 283.2 | 123 | 23.2 GB | 328 W | $1.39 | 733.5K | |
L40S | 48 GB | 265.1 | 70 | 13.3 GB | 258 W | $0.86 | 1.1M | |
L40 | 48 GB | 255.5 | 68 | 13.1 GB | 255 W | $0.99 | 929.1K | |
RTX PRO 4500 | 32 GB | 249.7 | 49 | 11.0 GB | 161 W | $0.64 | 1.4M | |
RTX A6000 | 48 GB | 209.9 | 73 | 13.9 GB | 278 W | $0.49 | 1.5M | |
RTX PRO 4000 | 24 GB | 193.9 | 35 | 7.0 GB | 141 W | $0.57 | 1.2M | |
RTX 3090 | 24 GB | 184.8 | 35 | 13.3 GB | 312 W | $0.46 | 1.4M | |
RTX A5000 | 24 GB | 171.2 | 35 | 7.1 GB | 216 W | $0.27 | 2.3M | |
A40 | 48 GB | 161.2 | 70 | 13.4 GB | 262 W | $0.44 | 1.3M | |
RTX A4500 | 20 GB | 149.2 | 30 | 9.1 GB | 191 W | $0.25 | 2.1M | |
RTX 4000 Ada | 20 GB | 127.9 | 30 | 6.5 GB | 98 W | $0.26 | 1.8M | |
L4 | 24 GB | 116 | 33 | 10.2 GB | 78 W | $0.39 | 1.1M | |
RTX 2000 Ada | 16 GB | 88 | 22 | 4.7 GB | 60 W | $0.24 | 1.3M |
Metodologia di addestramento
Usiamo il throughput di addestramento — immagini elaborate al secondo durante l'addestramento — come metro di paragone; è direttamente correlato al time-to-solution. Ogni risultato è misurato sulle GPU della Piattaforma Ultralytics — lo stesso hardware NVIDIA che noleggi per l'addestramento in cloud con un clic, dalle schede workstation entry-level fino alle GPU flagship dei data center. Addestriamo YOLO26 in tutte e cinque le dimensioni (n/s/m/l/x) in modo che tu possa adattare un modello al tuo budget hardware.
Impostazioni. 2 epoche sul 25% di COCO a 640px, precisione mista AMP, GPU singola, con auto-batch (batch=-1) che seleziona il batch più grande che rientra nella memoria. Riportiamo la seconda epoca a regime, che esclude il riscaldamento della prima epoca (caching del dataset, cattura del grafo CUDA) e il passaggio di validazione di fine esecuzione. La dimensione del batch risolta, il picco di VRAM (incluso il contesto CUDA) e il picco di potenza della scheda sono registrati direttamente da ogni GPU.
Efficienza dei costi. Immagini per dollaro = throughput × 3600 ÷ prezzo orario, utilizzando i prezzi on-demand della piattaforma Ultralytics — spesso riordina drasticamente la classifica, poiché le schede value rendono più delle GPU flagship per dollaro. Misurato su ultralytics 8.4.68, torch 2.8, CUDA 12.8. Vedi anche la documentazione sulle modalità Train e Benchmark.
Velocità di Inferenza GPU
Inferenza di rilevamento YOLO26 tra formati (PyTorch, ONNX, TensorRT) e precisioni (FP16, INT8) su ogni GPU NVIDIA sulla piattaforma, cronometrata al batch 1. Confronta tra dispositivi o per dimensione del modello, cambia il formato/precisione e la metrica del grafico, o filtra per generazione; la tabella ordinabile mostra anche la precisione (mAP) e l'efficienza dei costi.
H200 NVL | — | 3.18 | 315 | 0.395 | 5.3 MB | 1.32 GB | $3.39 | 334.1K | |
H100 NVL | — | 4.40 | 227 | 0.395 | 5.3 MB | 1.21 GB | $3.19 | 256.5K | |
RTX 5090 | — | 4.41 | 227 | 0.395 | 5.3 MB | 1.16 GB | $0.99 | 824K | |
RTX PRO 6000 | — | 4.55 | 220 | 0.395 | 5.3 MB | 1.36 GB | $2.09 | 378.8K | |
L4 | — | 4.98 | 201 | 0.395 | 5.3 MB | 0.85 GB | $0.39 | 1.9M | |
H200 SXM | — | 5.01 | 200 | 0.395 | 5.3 MB | 1.30 GB | $4.39 | 163.8K | |
RTX PRO 5000 | — | 5.39 | 185 | 0.395 | 5.3 MB | 1.01 GB | $0.96 | 695.3K | |
B300 | — | 5.44 | 184 | 0.395 | 5.3 MB | 1.73 GB | $7.39 | 89.5K | |
Apple M5 Pro | MPS | 5.67 | 177 | 0.395 | 5.3 MB | — | — | — | |
L40S | — | 6.17 | 162 | 0.395 | 5.3 MB | 1.17 GB | $0.86 | 678.6K | |
H100 SXM | — | 6.36 | 157 | 0.395 | 5.3 MB | 1.18 GB | $3.29 | 172K | |
RTX 4090 | — | 6.67 | 150 | 0.395 | 5.3 MB | 1.00 GB | $0.69 | 781.6K | |
RTX 6000 Ada | — | 7.25 | 138 | 0.395 | 5.3 MB | 1.19 GB | $0.77 | 645.2K | |
RTX PRO 4500 | — | 7.40 | 135 | 0.395 | 5.3 MB | 0.88 GB | $0.64 | 760.5K | |
RTX A6000 | — | 7.74 | 129 | 0.395 | 5.3 MB | 0.87 GB | $0.49 | 948.5K | |
H100 PCIe | — | 7.92 | 126 | 0.395 | 5.3 MB | 1.10 GB | $2.89 | 157.2K | |
A40 | — | 7.96 | 126 | 0.395 | 5.3 MB | 0.96 GB | $0.44 | 1M | |
RTX A5000 | — | 8.25 | 121 | 0.395 | 5.3 MB | 0.78 GB | $0.27 | 1.6M | |
B200 | — | 8.38 | 119 | 0.395 | 5.3 MB | — | $5.89 | 72.9K | |
RTX 2000 Ada | — | 8.41 | 119 | 0.395 | 5.3 MB | 0.62 GB | $0.24 | 1.8M | |
RTX PRO 4000 | — | 8.57 | 117 | 0.395 | 5.3 MB | 0.83 GB | $0.57 | 737.1K | |
A100 SXM | — | 8.72 | 115 | 0.395 | 5.3 MB | 1.34 GB | $1.49 | 276.9K | |
L40 | — | 8.76 | 114 | 0.395 | 5.3 MB | 1.26 GB | $0.99 | 414.9K | |
RTX 4000 Ada | — | 8.87 | 113 | 0.395 | 5.3 MB | 0.61 GB | $0.26 | 1.6M | |
RTX 3090 | — | 8.92 | 112 | 0.395 | 5.3 MB | 0.84 GB | $0.46 | 877.3K | |
RTX A4500 | — | 10.13 | 99 | 0.395 | 5.3 MB | 0.61 GB | $0.25 | 1.4M | |
A100 PCIe | — | 11.04 | 91 | 0.395 | 5.3 MB | 1.34 GB | $1.39 | 234.6K |
Metodologia di inferenza
Usiamo la latenza di inferenza — millisecondi per immagine al batch 1 — come metro di paragone; è ciò che conta per il deployment in tempo reale. Ogni dimensione di YOLO26 viene esportata nel formato e nella precisione mostrati, quindi cronometriamo la predizione a regime (riscaldamento escluso, tempi per esecuzione sigma-clipped) sulle stesse GPU della Piattaforma Ultralytics su cui effettui il deployment.
Formati e precisione. Su GPU NVIDIA: PyTorch FP16, ONNX FP16 e TensorRT FP16/INT8 (TensorRT 11.1.0.106 tramite NVIDIA ModelOpt). INT8 è calibrato su COCO128; la precisione (mAP50-95 su COCO val2017) è misurata una volta per formato/precisione e mostrata per riga, quindi il compromesso velocità↔precisione è esplicito. INT8 ripaga meglio sui modelli più grandi vincolati dal calcolo — sui modelli più piccoli il suo sovraccarico di quantizzazione può eguagliare o superare leggermente FP16. L'inferenza ONNX gira su GPU Ada/Ampere/Hopper (onnxruntime non ha ancora kernel Blackwell).
Apple Silicon. I dispositivi Mac (es. Apple M5 Pro) vengono profilati localmente e uniti nella tabella — scegli un formato per confrontarli direttamente con le GPU cloud, o filtra per la generazione Apple Silicon. CoreML gira sul Neural Engine (il percorso Apple più veloce, ~3× CPU), PyTorch sulla GPU MPS e ONNX sulla CPU; la colonna Backend di ogni riga nomina il runtime. CoreML è cronometrato con coremltools sull'ANE — uno schermo host relativo, non un numero da dispositivo iPhone. L'hardware di proprietà non ha costi di noleggio, quindi l'efficienza dei costi (img/$) è solo GPU.
Efficienza dei costi. Inferenze per dollaro = FPS × 3600 ÷ prezzo orario, utilizzando i prezzi on-demand della piattaforma Ultralytics. Misurato su ultralytics 8.4.71, torch 2.12, CUDA 13.2. Vedi anche la documentazione sulle modalità Predict e Benchmark.
Train on the Best GPUs for Less
26 NVIDIA GPUs starting at $0.24/hr — from Ampere to Blackwell. No markup, no minimums, no commitment.
Ready to build your next vision AI project?
Built on Ultralytics open source with 134.4k+ GitHub stars. Start training models in minutes.