Бенчмарки Ultralytics
Как YOLO26 работает на NVIDIA GPU платформы Ultralytics — измерение пропускной способности при обучении и задержки при инференсе с учетом памяти, питания, точности и экономической эффективности, чтобы ты мог выбрать подходящий GPU для своего бюджета и графика.
Пропускная способность GPU при обучении
Детекция YOLO26, обученная на COCO при 640px с auto-batch на каждом NVIDIA GPU на платформе. Сравнивай устройства или модели по размеру, переключай метрики на графике или фильтруй по поколению; таблицу можно полностью сортировать.
H200 SXM | 141 GB | 490.6 | 221 | 40.2 GB | 361 W | $4.39 | 402.3K | |
B300 | 288 GB | 474.6 | 411 | 73.4 GB | 457 W | $7.39 | 231.2K | |
H200 NVL | 143 GB | 469.3 | 221 | 39.8 GB | 283 W | $3.39 | 498.4K | |
H100 NVL | 94 GB | 432.1 | 147 | 26.8 GB | 274 W | $3.19 | 487.6K | |
H100 SXM | 80 GB | 424.3 | 123 | 23.1 GB | 315 W | $3.29 | 464.3K | |
RTX PRO 6000 | 96 GB | 420.6 | 149 | 27.6 GB | 319 W | $2.09 | 724.5K | |
B200 | 180 GB | 404.9 | 281 | 50.4 GB | 419 W | $5.89 | 247.5K | |
RTX 5090 | 32 GB | 356 | 49 | 9.7 GB | 304 W | $0.99 | 1.3M | |
RTX PRO 5000 | 48 GB | 319.7 | 73 | 13.8 GB | 220 W | $0.96 | 1.2M | |
RTX 4090 | 24 GB | 306 | 35 | 13.5 GB | 235 W | $0.69 | 1.6M | |
H100 PCIe | 80 GB | 302.4 | 123 | 22.6 GB | 197 W | $2.89 | 376.7K | |
RTX 6000 Ada | 48 GB | 294.8 | 73 | 13.9 GB | 254 W | $0.77 | 1.4M | |
A100 SXM | 80 GB | 286.8 | 123 | 23.1 GB | 342 W | $1.49 | 692.9K | |
A100 PCIe | 80 GB | 283.2 | 123 | 23.2 GB | 328 W | $1.39 | 733.5K | |
L40S | 48 GB | 265.1 | 70 | 13.3 GB | 258 W | $0.86 | 1.1M | |
L40 | 48 GB | 255.5 | 68 | 13.1 GB | 255 W | $0.99 | 929.1K | |
RTX PRO 4500 | 32 GB | 249.7 | 49 | 11.0 GB | 161 W | $0.64 | 1.4M | |
RTX A6000 | 48 GB | 209.9 | 73 | 13.9 GB | 278 W | $0.49 | 1.5M | |
RTX PRO 4000 | 24 GB | 193.9 | 35 | 7.0 GB | 141 W | $0.57 | 1.2M | |
RTX 3090 | 24 GB | 184.8 | 35 | 13.3 GB | 312 W | $0.46 | 1.4M | |
RTX A5000 | 24 GB | 171.2 | 35 | 7.1 GB | 216 W | $0.27 | 2.3M | |
A40 | 48 GB | 161.2 | 70 | 13.4 GB | 262 W | $0.44 | 1.3M | |
RTX A4500 | 20 GB | 149.2 | 30 | 9.1 GB | 191 W | $0.25 | 2.1M | |
RTX 4000 Ada | 20 GB | 127.9 | 30 | 6.5 GB | 98 W | $0.26 | 1.8M | |
L4 | 24 GB | 116 | 33 | 10.2 GB | 78 W | $0.39 | 1.1M | |
RTX 2000 Ada | 16 GB | 88 | 22 | 4.7 GB | 60 W | $0.24 | 1.3M |
Методология обучения
Мы используем пропускную способность при обучении — количество изображений, обрабатываемых в секунду во время обучения — в качестве критерия; он напрямую коррелирует со временем достижения результата. Каждый результат измерен на GPU платформы Ultralytics — том же оборудовании NVIDIA, которое ты арендуешь для облачного обучения в один клик, от начальных карт для рабочих станций до флагманских GPU для дата-центров. Мы обучаем YOLO26 во всех пяти размерах (n/s/m/l/x), чтобы ты мог подобрать модель под бюджет своего оборудования.
Настройки. 2 эпохи на 25% COCO при 640px, смешанная точность AMP, один GPU, с auto-batch (batch=-1), выбирающим самый большой размер батча, помещающийся в память. Мы сообщаем данные за установившуюся вторую эпоху, исключая прогрев первой эпохи (кэширование набора данных, захват графа CUDA) и валидационный проход в конце запуска. Определенный размер батча, пиковая VRAM (включая контекст CUDA) и пиковая мощность платы записываются напрямую с каждого GPU.
Экономическая эффективность. Изображений на доллар = пропускная способность × 3600 ÷ почасовая цена, используя цены по запросу платформы Ultralytics — это часто радикально меняет рейтинг, так как бюджетные карты приносят больше выгоды на доллар, чем флагманские GPU. Измерено на ultralytics 8.4.68, torch 2.8, CUDA 12.8. См. также документацию по режимам Train и Benchmark.
Скорость инференса на GPU
Инференс детекции YOLO26 для разных форматов (PyTorch, ONNX, TensorRT) и точностей (FP16, INT8) на каждом NVIDIA GPU на платформе, замер при батче 1. Сравнивай устройства или модели по размеру, переключай формат/точность и метрики на графике или фильтруй по поколению; сортируемая таблица также показывает точность (mAP) и экономическую эффективность.
H200 NVL | — | 3.18 | 315 | 0.395 | 5.3 MB | 1.32 GB | $3.39 | 334.1K | |
H100 NVL | — | 4.40 | 227 | 0.395 | 5.3 MB | 1.21 GB | $3.19 | 256.5K | |
RTX 5090 | — | 4.41 | 227 | 0.395 | 5.3 MB | 1.16 GB | $0.99 | 824K | |
RTX PRO 6000 | — | 4.55 | 220 | 0.395 | 5.3 MB | 1.36 GB | $2.09 | 378.8K | |
L4 | — | 4.98 | 201 | 0.395 | 5.3 MB | 0.85 GB | $0.39 | 1.9M | |
H200 SXM | — | 5.01 | 200 | 0.395 | 5.3 MB | 1.30 GB | $4.39 | 163.8K | |
RTX PRO 5000 | — | 5.39 | 185 | 0.395 | 5.3 MB | 1.01 GB | $0.96 | 695.3K | |
B300 | — | 5.44 | 184 | 0.395 | 5.3 MB | 1.73 GB | $7.39 | 89.5K | |
Apple M5 Pro | MPS | 5.67 | 177 | 0.395 | 5.3 MB | — | — | — | |
L40S | — | 6.17 | 162 | 0.395 | 5.3 MB | 1.17 GB | $0.86 | 678.6K | |
H100 SXM | — | 6.36 | 157 | 0.395 | 5.3 MB | 1.18 GB | $3.29 | 172K | |
RTX 4090 | — | 6.67 | 150 | 0.395 | 5.3 MB | 1.00 GB | $0.69 | 781.6K | |
RTX 6000 Ada | — | 7.25 | 138 | 0.395 | 5.3 MB | 1.19 GB | $0.77 | 645.2K | |
RTX PRO 4500 | — | 7.40 | 135 | 0.395 | 5.3 MB | 0.88 GB | $0.64 | 760.5K | |
RTX A6000 | — | 7.74 | 129 | 0.395 | 5.3 MB | 0.87 GB | $0.49 | 948.5K | |
H100 PCIe | — | 7.92 | 126 | 0.395 | 5.3 MB | 1.10 GB | $2.89 | 157.2K | |
A40 | — | 7.96 | 126 | 0.395 | 5.3 MB | 0.96 GB | $0.44 | 1M | |
RTX A5000 | — | 8.25 | 121 | 0.395 | 5.3 MB | 0.78 GB | $0.27 | 1.6M | |
B200 | — | 8.38 | 119 | 0.395 | 5.3 MB | — | $5.89 | 72.9K | |
RTX 2000 Ada | — | 8.41 | 119 | 0.395 | 5.3 MB | 0.62 GB | $0.24 | 1.8M | |
RTX PRO 4000 | — | 8.57 | 117 | 0.395 | 5.3 MB | 0.83 GB | $0.57 | 737.1K | |
A100 SXM | — | 8.72 | 115 | 0.395 | 5.3 MB | 1.34 GB | $1.49 | 276.9K | |
L40 | — | 8.76 | 114 | 0.395 | 5.3 MB | 1.26 GB | $0.99 | 414.9K | |
RTX 4000 Ada | — | 8.87 | 113 | 0.395 | 5.3 MB | 0.61 GB | $0.26 | 1.6M | |
RTX 3090 | — | 8.92 | 112 | 0.395 | 5.3 MB | 0.84 GB | $0.46 | 877.3K | |
RTX A4500 | — | 10.13 | 99 | 0.395 | 5.3 MB | 0.61 GB | $0.25 | 1.4M | |
A100 PCIe | — | 11.04 | 91 | 0.395 | 5.3 MB | 1.34 GB | $1.39 | 234.6K |
Методология инференса
Мы используем задержку инференса — миллисекунды на изображение при батче 1 — в качестве критерия; это то, что важно для развертывания в реальном времени. Каждый размер YOLO26 экспортируется в показанный формат и точность, затем мы замеряем установившееся предсказание (прогрев исключен, время прогона ограничено сигмой) на тех же GPU платформы Ultralytics, на которых ты развертываешь модель.
Форматы и точность. На NVIDIA GPU: PyTorch FP16, ONNX FP16 и TensorRT FP16/INT8 (TensorRT 11.1.0.106 через NVIDIA ModelOpt). INT8 калибруется на COCO128; точность (mAP50-95 на COCO val2017) измеряется один раз для каждого формата/точности и отображается в строке, поэтому баланс между скоростью и точностью виден явно. INT8 дает наибольший выигрыш на более крупных, вычислительно сложных моделях — на самых маленьких моделях его накладные расходы на квантование могут соответствовать FP16 или немного отставать от него. Инференс ONNX работает на GPU Ada/Ampere/Hopper (onnxruntime пока не имеет ядер Blackwell).
Apple Silicon. Устройства Mac (например, Apple M5 Pro) профилируются локально и объединяются в таблицу — выбери формат, чтобы сравнить их напрямую с облачными GPU, или отфильтруй по поколению Apple Silicon. CoreML работает на Neural Engine (самый быстрый путь Apple, ~3× CPU), PyTorch на GPU MPS, а ONNX на CPU; столбец Backend в каждой строке называет среду выполнения. CoreML замеряется с помощью coremltools на ANE — это относительный показатель хоста, а не число для устройства iPhone. У собственного оборудования нет цены аренды, поэтому экономическая эффективность (img/$) рассчитывается только для GPU.
Экономическая эффективность. Инференсов на доллар = FPS × 3600 ÷ почасовая цена, используя цены по запросу платформы Ultralytics. Измерено на ultralytics 8.4.71, torch 2.12, CUDA 13.2. См. также документацию по режимам Predict и Benchmark.
Train on the Best GPUs for Less
26 NVIDIA GPUs starting at $0.24/hr — from Ampere to Blackwell. No markup, no minimums, no commitment.
Ready to build your next vision AI project?
Built on Ultralytics open source with 134.4k+ GitHub stars. Start training models in minutes.