Benchmarks Ultralytics
Comment YOLO26 se comporte sur les GPU NVIDIA de la plateforme Ultralytics — débit d'entraînement et latence d'inférence mesurés, avec mémoire, puissance, précision et rentabilité, pour que tu puisses choisir le bon GPU pour ton budget et ton calendrier.
Débit d'entraînement GPU
Détection YOLO26 entraînée sur COCO en 640px avec auto-batch sur chaque GPU NVIDIA de la plateforme. Compare entre les appareils ou par taille de modèle, change la métrique du graphique ou filtre par génération ; le tableau est entièrement triable.
H200 SXM | 141 GB | 490.6 | 221 | 40.2 GB | 361 W | $4.39 | 402.3K | |
B300 | 288 GB | 474.6 | 411 | 73.4 GB | 457 W | $7.39 | 231.2K | |
H200 NVL | 143 GB | 469.3 | 221 | 39.8 GB | 283 W | $3.39 | 498.4K | |
H100 NVL | 94 GB | 432.1 | 147 | 26.8 GB | 274 W | $3.19 | 487.6K | |
H100 SXM | 80 GB | 424.3 | 123 | 23.1 GB | 315 W | $3.29 | 464.3K | |
RTX PRO 6000 | 96 GB | 420.6 | 149 | 27.6 GB | 319 W | $2.09 | 724.5K | |
B200 | 180 GB | 404.9 | 281 | 50.4 GB | 419 W | $5.89 | 247.5K | |
RTX 5090 | 32 GB | 356 | 49 | 9.7 GB | 304 W | $0.99 | 1.3M | |
RTX PRO 5000 | 48 GB | 319.7 | 73 | 13.8 GB | 220 W | $0.96 | 1.2M | |
RTX 4090 | 24 GB | 306 | 35 | 13.5 GB | 235 W | $0.69 | 1.6M | |
H100 PCIe | 80 GB | 302.4 | 123 | 22.6 GB | 197 W | $2.89 | 376.7K | |
RTX 6000 Ada | 48 GB | 294.8 | 73 | 13.9 GB | 254 W | $0.77 | 1.4M | |
A100 SXM | 80 GB | 286.8 | 123 | 23.1 GB | 342 W | $1.49 | 692.9K | |
A100 PCIe | 80 GB | 283.2 | 123 | 23.2 GB | 328 W | $1.39 | 733.5K | |
L40S | 48 GB | 265.1 | 70 | 13.3 GB | 258 W | $0.86 | 1.1M | |
L40 | 48 GB | 255.5 | 68 | 13.1 GB | 255 W | $0.99 | 929.1K | |
RTX PRO 4500 | 32 GB | 249.7 | 49 | 11.0 GB | 161 W | $0.64 | 1.4M | |
RTX A6000 | 48 GB | 209.9 | 73 | 13.9 GB | 278 W | $0.49 | 1.5M | |
RTX PRO 4000 | 24 GB | 193.9 | 35 | 7.0 GB | 141 W | $0.57 | 1.2M | |
RTX 3090 | 24 GB | 184.8 | 35 | 13.3 GB | 312 W | $0.46 | 1.4M | |
RTX A5000 | 24 GB | 171.2 | 35 | 7.1 GB | 216 W | $0.27 | 2.3M | |
A40 | 48 GB | 161.2 | 70 | 13.4 GB | 262 W | $0.44 | 1.3M | |
RTX A4500 | 20 GB | 149.2 | 30 | 9.1 GB | 191 W | $0.25 | 2.1M | |
RTX 4000 Ada | 20 GB | 127.9 | 30 | 6.5 GB | 98 W | $0.26 | 1.8M | |
L4 | 24 GB | 116 | 33 | 10.2 GB | 78 W | $0.39 | 1.1M | |
RTX 2000 Ada | 16 GB | 88 | 22 | 4.7 GB | 60 W | $0.24 | 1.3M |
Méthodologie d'entraînement
Nous utilisons le débit d'entraînement — images traitées par seconde pendant l'entraînement — comme mesure de référence ; cela est directement corrélé au temps nécessaire à la solution. Chaque résultat est mesuré sur les GPU de la plateforme Ultralytics — le même matériel NVIDIA que tu loues pour l'entraînement cloud en un clic, des cartes de station de travail d'entrée de gamme jusqu'aux GPU phares des centres de données. Nous entraînons YOLO26 dans les cinq tailles (n/s/m/l/x) pour que tu puisses faire correspondre un modèle à ton budget matériel.
Paramètres. 2 époques sur 25% de COCO à 640px, précision mixte AMP, GPU unique, avec auto-batch (batch=-1) sélectionnant le plus grand lot tenant en mémoire. Nous rapportons la deuxième époque en régime permanent, ce qui exclut l'échauffement de la première époque (mise en cache du jeu de données, capture de graphe CUDA) et la passe de validation de fin d'exécution. La taille de lot résolue, la VRAM de crête (incluant le contexte CUDA) et la puissance de crête de la carte sont enregistrées directement depuis chaque GPU.
Rentabilité. Images par dollar = débit × 3600 ÷ prix horaire, en utilisant la tarification à la demande de la plateforme Ultralytics — cela réorganise souvent le classement de manière spectaculaire, car les cartes rapportant de la valeur surpassent les GPU phares par dollar. Mesuré sur ultralytics 8.4.68, torch 2.8, CUDA 12.8. Voir aussi la doc des modes Train et Benchmark.
Vitesse d'inférence GPU
Inférence de détection YOLO26 à travers les formats (PyTorch, ONNX, TensorRT) et les précisions (FP16, INT8) sur chaque GPU NVIDIA de la plateforme, chronométrée au lot 1. Compare entre les appareils ou par taille de modèle, change le format/précision et la métrique du graphique, ou filtre par génération ; le tableau triable montre également la précision (mAP) et la rentabilité.
H200 NVL | — | 3.18 | 315 | 0.395 | 5.3 MB | 1.32 GB | $3.39 | 334.1K | |
H100 NVL | — | 4.40 | 227 | 0.395 | 5.3 MB | 1.21 GB | $3.19 | 256.5K | |
RTX 5090 | — | 4.41 | 227 | 0.395 | 5.3 MB | 1.16 GB | $0.99 | 824K | |
RTX PRO 6000 | — | 4.55 | 220 | 0.395 | 5.3 MB | 1.36 GB | $2.09 | 378.8K | |
L4 | — | 4.98 | 201 | 0.395 | 5.3 MB | 0.85 GB | $0.39 | 1.9M | |
H200 SXM | — | 5.01 | 200 | 0.395 | 5.3 MB | 1.30 GB | $4.39 | 163.8K | |
RTX PRO 5000 | — | 5.39 | 185 | 0.395 | 5.3 MB | 1.01 GB | $0.96 | 695.3K | |
B300 | — | 5.44 | 184 | 0.395 | 5.3 MB | 1.73 GB | $7.39 | 89.5K | |
Apple M5 Pro | MPS | 5.67 | 177 | 0.395 | 5.3 MB | — | — | — | |
L40S | — | 6.17 | 162 | 0.395 | 5.3 MB | 1.17 GB | $0.86 | 678.6K | |
H100 SXM | — | 6.36 | 157 | 0.395 | 5.3 MB | 1.18 GB | $3.29 | 172K | |
RTX 4090 | — | 6.67 | 150 | 0.395 | 5.3 MB | 1.00 GB | $0.69 | 781.6K | |
RTX 6000 Ada | — | 7.25 | 138 | 0.395 | 5.3 MB | 1.19 GB | $0.77 | 645.2K | |
RTX PRO 4500 | — | 7.40 | 135 | 0.395 | 5.3 MB | 0.88 GB | $0.64 | 760.5K | |
RTX A6000 | — | 7.74 | 129 | 0.395 | 5.3 MB | 0.87 GB | $0.49 | 948.5K | |
H100 PCIe | — | 7.92 | 126 | 0.395 | 5.3 MB | 1.10 GB | $2.89 | 157.2K | |
A40 | — | 7.96 | 126 | 0.395 | 5.3 MB | 0.96 GB | $0.44 | 1M | |
RTX A5000 | — | 8.25 | 121 | 0.395 | 5.3 MB | 0.78 GB | $0.27 | 1.6M | |
B200 | — | 8.38 | 119 | 0.395 | 5.3 MB | — | $5.89 | 72.9K | |
RTX 2000 Ada | — | 8.41 | 119 | 0.395 | 5.3 MB | 0.62 GB | $0.24 | 1.8M | |
RTX PRO 4000 | — | 8.57 | 117 | 0.395 | 5.3 MB | 0.83 GB | $0.57 | 737.1K | |
A100 SXM | — | 8.72 | 115 | 0.395 | 5.3 MB | 1.34 GB | $1.49 | 276.9K | |
L40 | — | 8.76 | 114 | 0.395 | 5.3 MB | 1.26 GB | $0.99 | 414.9K | |
RTX 4000 Ada | — | 8.87 | 113 | 0.395 | 5.3 MB | 0.61 GB | $0.26 | 1.6M | |
RTX 3090 | — | 8.92 | 112 | 0.395 | 5.3 MB | 0.84 GB | $0.46 | 877.3K | |
RTX A4500 | — | 10.13 | 99 | 0.395 | 5.3 MB | 0.61 GB | $0.25 | 1.4M | |
A100 PCIe | — | 11.04 | 91 | 0.395 | 5.3 MB | 1.34 GB | $1.39 | 234.6K |
Méthodologie d'inférence
Nous utilisons la latence d'inférence — millisecondes par image au lot 1 — comme mesure de référence ; c'est ce qui importe pour le déploiement en temps réel. Chaque taille de YOLO26 est exportée dans le format et la précision indiqués, puis nous chronométrons la prédiction en régime permanent (échauffement exclu, temps par exécution écrêtés par sigma) sur les mêmes GPU de la plateforme Ultralytics sur lesquels tu déploies.
Formats et précision. Sur les GPU NVIDIA : PyTorch FP16, ONNX FP16 et TensorRT FP16/INT8 (TensorRT 11.1.0.106 via NVIDIA ModelOpt). L'INT8 est calibré sur COCO128 ; la précision (mAP50-95 sur COCO val2017) est mesurée une fois par format/précision et affichée par ligne, donc le compromis vitesse↔précision est explicite. L'INT8 est plus avantageux sur les modèles plus grands limités par le calcul — sur les plus petits modèles, son surcoût de quantification peut égaler ou être légèrement en retrait par rapport au FP16. L'inférence ONNX s'exécute sur les GPU Ada/Ampere/Hopper (onnxruntime n'a pas encore de noyaux Blackwell).
Apple Silicon. Les appareils Mac (ex: Apple M5 Pro) sont profilés localement et fusionnés dans le tableau — choisis un format pour les comparer directement aux GPU cloud, ou filtre par la génération Apple Silicon. CoreML s'exécute sur le Neural Engine (le chemin Apple le plus rapide, ~3× CPU), PyTorch sur le GPU MPS, et ONNX sur le CPU ; la colonne Backend de chaque ligne nomme l'environnement d'exécution. CoreML est chronométré avec coremltools sur l'ANE — un écran hôte relatif, pas un numéro d'appareil iPhone. Le matériel possédé n'a pas de prix de location, donc la rentabilité (img/$) est uniquement GPU.
Rentabilité. Inférences par dollar = FPS × 3600 ÷ prix horaire, en utilisant la tarification à la demande de la plateforme Ultralytics. Mesuré sur ultralytics 8.4.71, torch 2.12, CUDA 13.2. Voir aussi la doc des modes Predict et Benchmark.
Train on the Best GPUs for Less
26 NVIDIA GPUs starting at $0.24/hr — from Ampere to Blackwell. No markup, no minimums, no commitment.
Ready to build your next vision AI project?
Built on Ultralytics open source with 134.2k+ GitHub stars. Start training models in minutes.