Sicurezza pronta per l'azienda: Conforme a ISO 27001 + SOC 2 Type I.

Benchmark di Ultralytics

Come si comporta YOLO26 sulle GPU NVIDIA della piattaforma Ultralytics: throughput di addestramento misurato e latenza di inferenza, con memoria, potenza, precisione ed efficienza dei costi, così puoi scegliere la GPU giusta per il tuo budget e le tue tempistiche.

Throughput di Addestramento GPU

Rilevamento YOLO26 addestrato su COCO a 640px con auto-batch su ogni GPU NVIDIA sulla piattaforma. Confronta tra dispositivi o per dimensione del modello, cambia la metrica del grafico o filtra per generazione; la tabella è completamente ordinabile.

Compare
Model
Chart metric
Generation
H200 SXM
Hopper
141 GB
490.6
221
40.2 GB
361 W
$4.39
402.3K
B300
Blackwell
288 GB
474.6
411
73.4 GB
457 W
$7.39
231.2K
H200 NVL
Hopper
143 GB
469.3
221
39.8 GB
283 W
$3.39
498.4K
H100 NVL
Hopper
94 GB
432.1
147
26.8 GB
274 W
$3.19
487.6K
H100 SXM
Hopper
80 GB
424.3
123
23.1 GB
315 W
$3.29
464.3K
RTX PRO 6000
Blackwell
96 GB
420.6
149
27.6 GB
319 W
$2.09
724.5K
B200
Blackwell
180 GB
404.9
281
50.4 GB
419 W
$5.89
247.5K
RTX 5090
Blackwell
32 GB
356
49
9.7 GB
304 W
$0.99
1.3M
RTX PRO 5000
Blackwell
48 GB
319.7
73
13.8 GB
220 W
$0.96
1.2M
RTX 4090
Ada
24 GB
306
35
13.5 GB
235 W
$0.69
1.6M
H100 PCIe
Hopper
80 GB
302.4
123
22.6 GB
197 W
$2.89
376.7K
RTX 6000 Ada
Ada
48 GB
294.8
73
13.9 GB
254 W
$0.77
1.4M
A100 SXM
Ampere
80 GB
286.8
123
23.1 GB
342 W
$1.49
692.9K
A100 PCIe
Ampere
80 GB
283.2
123
23.2 GB
328 W
$1.39
733.5K
L40S
Ada
48 GB
265.1
70
13.3 GB
258 W
$0.86
1.1M
L40
Ada
48 GB
255.5
68
13.1 GB
255 W
$0.99
929.1K
RTX PRO 4500
Blackwell
32 GB
249.7
49
11.0 GB
161 W
$0.64
1.4M
RTX A6000
Ampere
48 GB
209.9
73
13.9 GB
278 W
$0.49
1.5M
RTX PRO 4000
Blackwell
24 GB
193.9
35
7.0 GB
141 W
$0.57
1.2M
RTX 3090
Ampere
24 GB
184.8
35
13.3 GB
312 W
$0.46
1.4M
RTX A5000
Ampere
24 GB
171.2
35
7.1 GB
216 W
$0.27
2.3M
A40
Ampere
48 GB
161.2
70
13.4 GB
262 W
$0.44
1.3M
RTX A4500
Ampere
20 GB
149.2
30
9.1 GB
191 W
$0.25
2.1M
RTX 4000 Ada
Ada
20 GB
127.9
30
6.5 GB
98 W
$0.26
1.8M
L4
Ada
24 GB
116
33
10.2 GB
78 W
$0.39
1.1M
RTX 2000 Ada
Ada
16 GB
88
22
4.7 GB
60 W
$0.24
1.3M

Metodologia di addestramento

Usiamo il throughput di addestramento — immagini elaborate al secondo durante l'addestramento — come metro di paragone; è direttamente correlato al time-to-solution. Ogni risultato è misurato sulle GPU della Piattaforma Ultralytics — lo stesso hardware NVIDIA che noleggi per l'addestramento in cloud con un clic, dalle schede workstation entry-level fino alle GPU flagship dei data center. Addestriamo YOLO26 in tutte e cinque le dimensioni (n/s/m/l/x) in modo che tu possa adattare un modello al tuo budget hardware.

Impostazioni. 2 epoche sul 25% di COCO a 640px, precisione mista AMP, GPU singola, con auto-batch (batch=-1) che seleziona il batch più grande che rientra nella memoria. Riportiamo la seconda epoca a regime, che esclude il riscaldamento della prima epoca (caching del dataset, cattura del grafo CUDA) e il passaggio di validazione di fine esecuzione. La dimensione del batch risolta, il picco di VRAM (incluso il contesto CUDA) e il picco di potenza della scheda sono registrati direttamente da ogni GPU.

Efficienza dei costi. Immagini per dollaro = throughput × 3600 ÷ prezzo orario, utilizzando i prezzi on-demand della piattaforma Ultralytics — spesso riordina drasticamente la classifica, poiché le schede value rendono più delle GPU flagship per dollaro. Misurato su ultralytics 8.4.68, torch 2.8, CUDA 12.8. Vedi anche la documentazione sulle modalità Train e Benchmark.

Velocità di Inferenza GPU

Inferenza di rilevamento YOLO26 tra formati (PyTorch, ONNX, TensorRT) e precisioni (FP16, INT8) su ogni GPU NVIDIA sulla piattaforma, cronometrata al batch 1. Confronta tra dispositivi o per dimensione del modello, cambia il formato/precisione e la metrica del grafico, o filtra per generazione; la tabella ordinabile mostra anche la precisione (mAP) e l'efficienza dei costi.

Compare
Model
Format / precision
Chart metric
Generation
H200 NVL
Hopper
3.18
315
0.395
5.3 MB
1.32 GB
$3.39
334.1K
H100 NVL
Hopper
4.40
227
0.395
5.3 MB
1.21 GB
$3.19
256.5K
RTX 5090
Blackwell
4.41
227
0.395
5.3 MB
1.16 GB
$0.99
824K
RTX PRO 6000
Blackwell
4.55
220
0.395
5.3 MB
1.36 GB
$2.09
378.8K
L4
Ada
4.98
201
0.395
5.3 MB
0.85 GB
$0.39
1.9M
H200 SXM
Hopper
5.01
200
0.395
5.3 MB
1.30 GB
$4.39
163.8K
RTX PRO 5000
Blackwell
5.39
185
0.395
5.3 MB
1.01 GB
$0.96
695.3K
B300
Blackwell
5.44
184
0.395
5.3 MB
1.73 GB
$7.39
89.5K
Apple M5 Pro
Apple Silicon
MPS
5.67
177
0.395
5.3 MB
L40S
Ada
6.17
162
0.395
5.3 MB
1.17 GB
$0.86
678.6K
H100 SXM
Hopper
6.36
157
0.395
5.3 MB
1.18 GB
$3.29
172K
RTX 4090
Ada
6.67
150
0.395
5.3 MB
1.00 GB
$0.69
781.6K
RTX 6000 Ada
Ada
7.25
138
0.395
5.3 MB
1.19 GB
$0.77
645.2K
RTX PRO 4500
Blackwell
7.40
135
0.395
5.3 MB
0.88 GB
$0.64
760.5K
RTX A6000
Ampere
7.74
129
0.395
5.3 MB
0.87 GB
$0.49
948.5K
H100 PCIe
Hopper
7.92
126
0.395
5.3 MB
1.10 GB
$2.89
157.2K
A40
Ampere
7.96
126
0.395
5.3 MB
0.96 GB
$0.44
1M
RTX A5000
Ampere
8.25
121
0.395
5.3 MB
0.78 GB
$0.27
1.6M
B200
Blackwell
8.38
119
0.395
5.3 MB
$5.89
72.9K
RTX 2000 Ada
Ada
8.41
119
0.395
5.3 MB
0.62 GB
$0.24
1.8M
RTX PRO 4000
Blackwell
8.57
117
0.395
5.3 MB
0.83 GB
$0.57
737.1K
A100 SXM
Ampere
8.72
115
0.395
5.3 MB
1.34 GB
$1.49
276.9K
L40
Ada
8.76
114
0.395
5.3 MB
1.26 GB
$0.99
414.9K
RTX 4000 Ada
Ada
8.87
113
0.395
5.3 MB
0.61 GB
$0.26
1.6M
RTX 3090
Ampere
8.92
112
0.395
5.3 MB
0.84 GB
$0.46
877.3K
RTX A4500
Ampere
10.13
99
0.395
5.3 MB
0.61 GB
$0.25
1.4M
A100 PCIe
Ampere
11.04
91
0.395
5.3 MB
1.34 GB
$1.39
234.6K

Metodologia di inferenza

Usiamo la latenza di inferenza — millisecondi per immagine al batch 1 — come metro di paragone; è ciò che conta per il deployment in tempo reale. Ogni dimensione di YOLO26 viene esportata nel formato e nella precisione mostrati, quindi cronometriamo la predizione a regime (riscaldamento escluso, tempi per esecuzione sigma-clipped) sulle stesse GPU della Piattaforma Ultralytics su cui effettui il deployment.

Formati e precisione. Su GPU NVIDIA: PyTorch FP16, ONNX FP16 e TensorRT FP16/INT8 (TensorRT 11.1.0.106 tramite NVIDIA ModelOpt). INT8 è calibrato su COCO128; la precisione (mAP50-95 su COCO val2017) è misurata una volta per formato/precisione e mostrata per riga, quindi il compromesso velocità↔precisione è esplicito. INT8 ripaga meglio sui modelli più grandi vincolati dal calcolo — sui modelli più piccoli il suo sovraccarico di quantizzazione può eguagliare o superare leggermente FP16. L'inferenza ONNX gira su GPU Ada/Ampere/Hopper (onnxruntime non ha ancora kernel Blackwell).

Apple Silicon. I dispositivi Mac (es. Apple M5 Pro) vengono profilati localmente e uniti nella tabella — scegli un formato per confrontarli direttamente con le GPU cloud, o filtra per la generazione Apple Silicon. CoreML gira sul Neural Engine (il percorso Apple più veloce, ~3× CPU), PyTorch sulla GPU MPS e ONNX sulla CPU; la colonna Backend di ogni riga nomina il runtime. CoreML è cronometrato con coremltools sull'ANE — uno schermo host relativo, non un numero da dispositivo iPhone. L'hardware di proprietà non ha costi di noleggio, quindi l'efficienza dei costi (img/$) è solo GPU.

Efficienza dei costi. Inferenze per dollaro = FPS × 3600 ÷ prezzo orario, utilizzando i prezzi on-demand della piattaforma Ultralytics. Misurato su ultralytics 8.4.71, torch 2.12, CUDA 13.2. Vedi anche la documentazione sulle modalità Predict e Benchmark.

Ready to build your next vision AI project?

Built on Ultralytics open source with 134.4k+ GitHub stars. Start training models in minutes.