Sécurité prête pour l'entreprise : Conforme ISO 27001 + SOC 2 Type I.
Ultralytics

Benchmarks Ultralytics

Comment YOLO26 se comporte sur les GPU NVIDIA de la plateforme Ultralytics — débit d'entraînement et latence d'inférence mesurés, avec mémoire, puissance, précision et rentabilité, pour que tu puisses choisir le bon GPU pour ton budget et ton calendrier.

Débit d'entraînement GPU

Détection YOLO26 entraînée sur COCO en 640px avec auto-batch sur chaque GPU NVIDIA de la plateforme. Compare entre les appareils ou par taille de modèle, change la métrique du graphique ou filtre par génération ; le tableau est entièrement triable.

Compare
Model
Chart metric
Generation
H200 SXM
Hopper
141 GB
490.6
221
40.2 GB
361 W
$4.39
402.3K
B300
Blackwell
288 GB
474.6
411
73.4 GB
457 W
$7.39
231.2K
H200 NVL
Hopper
143 GB
469.3
221
39.8 GB
283 W
$3.39
498.4K
H100 NVL
Hopper
94 GB
432.1
147
26.8 GB
274 W
$3.19
487.6K
H100 SXM
Hopper
80 GB
424.3
123
23.1 GB
315 W
$3.29
464.3K
RTX PRO 6000
Blackwell
96 GB
420.6
149
27.6 GB
319 W
$2.09
724.5K
B200
Blackwell
180 GB
404.9
281
50.4 GB
419 W
$5.89
247.5K
RTX 5090
Blackwell
32 GB
356
49
9.7 GB
304 W
$0.99
1.3M
RTX PRO 5000
Blackwell
48 GB
319.7
73
13.8 GB
220 W
$0.96
1.2M
RTX 4090
Ada
24 GB
306
35
13.5 GB
235 W
$0.69
1.6M
H100 PCIe
Hopper
80 GB
302.4
123
22.6 GB
197 W
$2.89
376.7K
RTX 6000 Ada
Ada
48 GB
294.8
73
13.9 GB
254 W
$0.77
1.4M
A100 SXM
Ampere
80 GB
286.8
123
23.1 GB
342 W
$1.49
692.9K
A100 PCIe
Ampere
80 GB
283.2
123
23.2 GB
328 W
$1.39
733.5K
L40S
Ada
48 GB
265.1
70
13.3 GB
258 W
$0.86
1.1M
L40
Ada
48 GB
255.5
68
13.1 GB
255 W
$0.99
929.1K
RTX PRO 4500
Blackwell
32 GB
249.7
49
11.0 GB
161 W
$0.64
1.4M
RTX A6000
Ampere
48 GB
209.9
73
13.9 GB
278 W
$0.49
1.5M
RTX PRO 4000
Blackwell
24 GB
193.9
35
7.0 GB
141 W
$0.57
1.2M
RTX 3090
Ampere
24 GB
184.8
35
13.3 GB
312 W
$0.46
1.4M
RTX A5000
Ampere
24 GB
171.2
35
7.1 GB
216 W
$0.27
2.3M
A40
Ampere
48 GB
161.2
70
13.4 GB
262 W
$0.44
1.3M
RTX A4500
Ampere
20 GB
149.2
30
9.1 GB
191 W
$0.25
2.1M
RTX 4000 Ada
Ada
20 GB
127.9
30
6.5 GB
98 W
$0.26
1.8M
L4
Ada
24 GB
116
33
10.2 GB
78 W
$0.39
1.1M
RTX 2000 Ada
Ada
16 GB
88
22
4.7 GB
60 W
$0.24
1.3M

Méthodologie d'entraînement

Nous utilisons le débit d'entraînement — images traitées par seconde pendant l'entraînement — comme mesure de référence ; cela est directement corrélé au temps nécessaire à la solution. Chaque résultat est mesuré sur les GPU de la plateforme Ultralytics — le même matériel NVIDIA que tu loues pour l'entraînement cloud en un clic, des cartes de station de travail d'entrée de gamme jusqu'aux GPU phares des centres de données. Nous entraînons YOLO26 dans les cinq tailles (n/s/m/l/x) pour que tu puisses faire correspondre un modèle à ton budget matériel.

Paramètres. 2 époques sur 25% de COCO à 640px, précision mixte AMP, GPU unique, avec auto-batch (batch=-1) sélectionnant le plus grand lot tenant en mémoire. Nous rapportons la deuxième époque en régime permanent, ce qui exclut l'échauffement de la première époque (mise en cache du jeu de données, capture de graphe CUDA) et la passe de validation de fin d'exécution. La taille de lot résolue, la VRAM de crête (incluant le contexte CUDA) et la puissance de crête de la carte sont enregistrées directement depuis chaque GPU.

Rentabilité. Images par dollar = débit × 3600 ÷ prix horaire, en utilisant la tarification à la demande de la plateforme Ultralytics — cela réorganise souvent le classement de manière spectaculaire, car les cartes rapportant de la valeur surpassent les GPU phares par dollar. Mesuré sur ultralytics 8.4.68, torch 2.8, CUDA 12.8. Voir aussi la doc des modes Train et Benchmark.

Vitesse d'inférence GPU

Inférence de détection YOLO26 à travers les formats (PyTorch, ONNX, TensorRT) et les précisions (FP16, INT8) sur chaque GPU NVIDIA de la plateforme, chronométrée au lot 1. Compare entre les appareils ou par taille de modèle, change le format/précision et la métrique du graphique, ou filtre par génération ; le tableau triable montre également la précision (mAP) et la rentabilité.

Compare
Model
Format / precision
Chart metric
Generation
H200 NVL
Hopper
3.18
315
0.395
5.3 MB
1.32 GB
$3.39
334.1K
H100 NVL
Hopper
4.40
227
0.395
5.3 MB
1.21 GB
$3.19
256.5K
RTX 5090
Blackwell
4.41
227
0.395
5.3 MB
1.16 GB
$0.99
824K
RTX PRO 6000
Blackwell
4.55
220
0.395
5.3 MB
1.36 GB
$2.09
378.8K
L4
Ada
4.98
201
0.395
5.3 MB
0.85 GB
$0.39
1.9M
H200 SXM
Hopper
5.01
200
0.395
5.3 MB
1.30 GB
$4.39
163.8K
RTX PRO 5000
Blackwell
5.39
185
0.395
5.3 MB
1.01 GB
$0.96
695.3K
B300
Blackwell
5.44
184
0.395
5.3 MB
1.73 GB
$7.39
89.5K
Apple M5 Pro
Apple Silicon
MPS
5.67
177
0.395
5.3 MB
L40S
Ada
6.17
162
0.395
5.3 MB
1.17 GB
$0.86
678.6K
H100 SXM
Hopper
6.36
157
0.395
5.3 MB
1.18 GB
$3.29
172K
RTX 4090
Ada
6.67
150
0.395
5.3 MB
1.00 GB
$0.69
781.6K
RTX 6000 Ada
Ada
7.25
138
0.395
5.3 MB
1.19 GB
$0.77
645.2K
RTX PRO 4500
Blackwell
7.40
135
0.395
5.3 MB
0.88 GB
$0.64
760.5K
RTX A6000
Ampere
7.74
129
0.395
5.3 MB
0.87 GB
$0.49
948.5K
H100 PCIe
Hopper
7.92
126
0.395
5.3 MB
1.10 GB
$2.89
157.2K
A40
Ampere
7.96
126
0.395
5.3 MB
0.96 GB
$0.44
1M
RTX A5000
Ampere
8.25
121
0.395
5.3 MB
0.78 GB
$0.27
1.6M
B200
Blackwell
8.38
119
0.395
5.3 MB
$5.89
72.9K
RTX 2000 Ada
Ada
8.41
119
0.395
5.3 MB
0.62 GB
$0.24
1.8M
RTX PRO 4000
Blackwell
8.57
117
0.395
5.3 MB
0.83 GB
$0.57
737.1K
A100 SXM
Ampere
8.72
115
0.395
5.3 MB
1.34 GB
$1.49
276.9K
L40
Ada
8.76
114
0.395
5.3 MB
1.26 GB
$0.99
414.9K
RTX 4000 Ada
Ada
8.87
113
0.395
5.3 MB
0.61 GB
$0.26
1.6M
RTX 3090
Ampere
8.92
112
0.395
5.3 MB
0.84 GB
$0.46
877.3K
RTX A4500
Ampere
10.13
99
0.395
5.3 MB
0.61 GB
$0.25
1.4M
A100 PCIe
Ampere
11.04
91
0.395
5.3 MB
1.34 GB
$1.39
234.6K

Méthodologie d'inférence

Nous utilisons la latence d'inférence — millisecondes par image au lot 1 — comme mesure de référence ; c'est ce qui importe pour le déploiement en temps réel. Chaque taille de YOLO26 est exportée dans le format et la précision indiqués, puis nous chronométrons la prédiction en régime permanent (échauffement exclu, temps par exécution écrêtés par sigma) sur les mêmes GPU de la plateforme Ultralytics sur lesquels tu déploies.

Formats et précision. Sur les GPU NVIDIA : PyTorch FP16, ONNX FP16 et TensorRT FP16/INT8 (TensorRT 11.1.0.106 via NVIDIA ModelOpt). L'INT8 est calibré sur COCO128 ; la précision (mAP50-95 sur COCO val2017) est mesurée une fois par format/précision et affichée par ligne, donc le compromis vitesse↔précision est explicite. L'INT8 est plus avantageux sur les modèles plus grands limités par le calcul — sur les plus petits modèles, son surcoût de quantification peut égaler ou être légèrement en retrait par rapport au FP16. L'inférence ONNX s'exécute sur les GPU Ada/Ampere/Hopper (onnxruntime n'a pas encore de noyaux Blackwell).

Apple Silicon. Les appareils Mac (ex: Apple M5 Pro) sont profilés localement et fusionnés dans le tableau — choisis un format pour les comparer directement aux GPU cloud, ou filtre par la génération Apple Silicon. CoreML s'exécute sur le Neural Engine (le chemin Apple le plus rapide, ~3× CPU), PyTorch sur le GPU MPS, et ONNX sur le CPU ; la colonne Backend de chaque ligne nomme l'environnement d'exécution. CoreML est chronométré avec coremltools sur l'ANE — un écran hôte relatif, pas un numéro d'appareil iPhone. Le matériel possédé n'a pas de prix de location, donc la rentabilité (img/$) est uniquement GPU.

Rentabilité. Inférences par dollar = FPS × 3600 ÷ prix horaire, en utilisant la tarification à la demande de la plateforme Ultralytics. Mesuré sur ultralytics 8.4.71, torch 2.12, CUDA 13.2. Voir aussi la doc des modes Predict et Benchmark.

Ready to build your next vision AI project?

Built on Ultralytics open source with 134.2k+ GitHub stars. Start training models in minutes.