Benchmarks da Ultralytics
Como o YOLO26 se comporta nas GPUs NVIDIA da Ultralytics Platform — taxa de transferência de treinamento e latência de inferência medidas, com memória, energia, precisão e custo-benefício, para que possas escolher a GPU certa para o teu orçamento e cronograma.
Taxa de Transferência de Treinamento de GPU
Detecção com YOLO26 treinado no COCO a 640px com auto-batch em todas as GPUs NVIDIA na Platform. Compara entre dispositivos ou por tamanho de modelo, alterna a métrica do gráfico ou filtra por geração; a tabela é totalmente ordenável.
H200 SXM | 141 GB | 490.6 | 221 | 40.2 GB | 361 W | $4.39 | 402.3K | |
B300 | 288 GB | 474.6 | 411 | 73.4 GB | 457 W | $7.39 | 231.2K | |
H200 NVL | 143 GB | 469.3 | 221 | 39.8 GB | 283 W | $3.39 | 498.4K | |
H100 NVL | 94 GB | 432.1 | 147 | 26.8 GB | 274 W | $3.19 | 487.6K | |
H100 SXM | 80 GB | 424.3 | 123 | 23.1 GB | 315 W | $3.29 | 464.3K | |
RTX PRO 6000 | 96 GB | 420.6 | 149 | 27.6 GB | 319 W | $2.09 | 724.5K | |
B200 | 180 GB | 404.9 | 281 | 50.4 GB | 419 W | $5.89 | 247.5K | |
RTX 5090 | 32 GB | 356 | 49 | 9.7 GB | 304 W | $0.99 | 1.3M | |
RTX PRO 5000 | 48 GB | 319.7 | 73 | 13.8 GB | 220 W | $0.96 | 1.2M | |
RTX 4090 | 24 GB | 306 | 35 | 13.5 GB | 235 W | $0.69 | 1.6M | |
H100 PCIe | 80 GB | 302.4 | 123 | 22.6 GB | 197 W | $2.89 | 376.7K | |
RTX 6000 Ada | 48 GB | 294.8 | 73 | 13.9 GB | 254 W | $0.77 | 1.4M | |
A100 SXM | 80 GB | 286.8 | 123 | 23.1 GB | 342 W | $1.49 | 692.9K | |
A100 PCIe | 80 GB | 283.2 | 123 | 23.2 GB | 328 W | $1.39 | 733.5K | |
L40S | 48 GB | 265.1 | 70 | 13.3 GB | 258 W | $0.86 | 1.1M | |
L40 | 48 GB | 255.5 | 68 | 13.1 GB | 255 W | $0.99 | 929.1K | |
RTX PRO 4500 | 32 GB | 249.7 | 49 | 11.0 GB | 161 W | $0.64 | 1.4M | |
RTX A6000 | 48 GB | 209.9 | 73 | 13.9 GB | 278 W | $0.49 | 1.5M | |
RTX PRO 4000 | 24 GB | 193.9 | 35 | 7.0 GB | 141 W | $0.57 | 1.2M | |
RTX 3090 | 24 GB | 184.8 | 35 | 13.3 GB | 312 W | $0.46 | 1.4M | |
RTX A5000 | 24 GB | 171.2 | 35 | 7.1 GB | 216 W | $0.27 | 2.3M | |
A40 | 48 GB | 161.2 | 70 | 13.4 GB | 262 W | $0.44 | 1.3M | |
RTX A4500 | 20 GB | 149.2 | 30 | 9.1 GB | 191 W | $0.25 | 2.1M | |
RTX 4000 Ada | 20 GB | 127.9 | 30 | 6.5 GB | 98 W | $0.26 | 1.8M | |
L4 | 24 GB | 116 | 33 | 10.2 GB | 78 W | $0.39 | 1.1M | |
RTX 2000 Ada | 16 GB | 88 | 22 | 4.7 GB | 60 W | $0.24 | 1.3M |
Metodologia de treinamento
Usamos a taxa de transferência de treinamento — imagens processadas por segundo durante o treinamento — como referência; ela correlaciona-se diretamente com o tempo de conclusão. Cada resultado é medido nas GPUs da Ultralytics Platform — o mesmo hardware NVIDIA que alugas para treinamento na nuvem com um clique, desde placas de workstation de entrada até GPUs emblemáticas de data center. Treinamos o YOLO26 em todos os cinco tamanhos (n/s/m/l/x) para que possas adequar um modelo ao teu orçamento de hardware.
Configurações. 2 épocas em 25% do COCO a 640px, precisão mista AMP, GPU única, com auto-batch (batch=-1) selecionando o maior lote que cabe na memória. Relatamos a segunda época em estado estacionário, que exclui o aquecimento da primeira época (cache do conjunto de dados, captura de grafo CUDA) e a validação do final da execução. O tamanho do lote resolvido, o pico de VRAM (incluindo o contexto CUDA) e o pico de energia da placa são registrados diretamente de cada GPU.
Custo-benefício. Imagens por dólar = taxa de transferência × 3600 ÷ preço por hora, usando o preço sob demanda da Ultralytics Platform — isso frequentemente reordena o ranking drasticamente, já que placas com melhor valor superam GPUs emblemáticas por dólar. Medido no ultralytics 8.4.68, torch 2.8, CUDA 12.8. Vê também a documentação dos modos Train e Benchmark.
Velocidade de Inferência de GPU
Inferência de detecção YOLO26 entre formatos (PyTorch, ONNX, TensorRT) e precisões (FP16, INT8) em todas as GPUs NVIDIA na Platform, cronometrada no batch 1. Compara entre dispositivos ou por tamanho de modelo, alterna o formato/precisão e a métrica do gráfico, ou filtra por geração; a tabela ordenável também mostra precisão (mAP) e custo-benefício.
H200 NVL | — | 3.18 | 315 | 0.395 | 5.3 MB | 1.32 GB | $3.39 | 334.1K | |
H100 NVL | — | 4.40 | 227 | 0.395 | 5.3 MB | 1.21 GB | $3.19 | 256.5K | |
RTX 5090 | — | 4.41 | 227 | 0.395 | 5.3 MB | 1.16 GB | $0.99 | 824K | |
RTX PRO 6000 | — | 4.55 | 220 | 0.395 | 5.3 MB | 1.36 GB | $2.09 | 378.8K | |
L4 | — | 4.98 | 201 | 0.395 | 5.3 MB | 0.85 GB | $0.39 | 1.9M | |
H200 SXM | — | 5.01 | 200 | 0.395 | 5.3 MB | 1.30 GB | $4.39 | 163.8K | |
RTX PRO 5000 | — | 5.39 | 185 | 0.395 | 5.3 MB | 1.01 GB | $0.96 | 695.3K | |
B300 | — | 5.44 | 184 | 0.395 | 5.3 MB | 1.73 GB | $7.39 | 89.5K | |
Apple M5 Pro | MPS | 5.67 | 177 | 0.395 | 5.3 MB | — | — | — | |
L40S | — | 6.17 | 162 | 0.395 | 5.3 MB | 1.17 GB | $0.86 | 678.6K | |
H100 SXM | — | 6.36 | 157 | 0.395 | 5.3 MB | 1.18 GB | $3.29 | 172K | |
RTX 4090 | — | 6.67 | 150 | 0.395 | 5.3 MB | 1.00 GB | $0.69 | 781.6K | |
RTX 6000 Ada | — | 7.25 | 138 | 0.395 | 5.3 MB | 1.19 GB | $0.77 | 645.2K | |
RTX PRO 4500 | — | 7.40 | 135 | 0.395 | 5.3 MB | 0.88 GB | $0.64 | 760.5K | |
RTX A6000 | — | 7.74 | 129 | 0.395 | 5.3 MB | 0.87 GB | $0.49 | 948.5K | |
H100 PCIe | — | 7.92 | 126 | 0.395 | 5.3 MB | 1.10 GB | $2.89 | 157.2K | |
A40 | — | 7.96 | 126 | 0.395 | 5.3 MB | 0.96 GB | $0.44 | 1M | |
RTX A5000 | — | 8.25 | 121 | 0.395 | 5.3 MB | 0.78 GB | $0.27 | 1.6M | |
B200 | — | 8.38 | 119 | 0.395 | 5.3 MB | — | $5.89 | 72.9K | |
RTX 2000 Ada | — | 8.41 | 119 | 0.395 | 5.3 MB | 0.62 GB | $0.24 | 1.8M | |
RTX PRO 4000 | — | 8.57 | 117 | 0.395 | 5.3 MB | 0.83 GB | $0.57 | 737.1K | |
A100 SXM | — | 8.72 | 115 | 0.395 | 5.3 MB | 1.34 GB | $1.49 | 276.9K | |
L40 | — | 8.76 | 114 | 0.395 | 5.3 MB | 1.26 GB | $0.99 | 414.9K | |
RTX 4000 Ada | — | 8.87 | 113 | 0.395 | 5.3 MB | 0.61 GB | $0.26 | 1.6M | |
RTX 3090 | — | 8.92 | 112 | 0.395 | 5.3 MB | 0.84 GB | $0.46 | 877.3K | |
RTX A4500 | — | 10.13 | 99 | 0.395 | 5.3 MB | 0.61 GB | $0.25 | 1.4M | |
A100 PCIe | — | 11.04 | 91 | 0.395 | 5.3 MB | 1.34 GB | $1.39 | 234.6K |
Metodologia de inferência
Usamos a latência de inferência — milissegundos por imagem no batch 1 — como referência; é o que importa para a implantação em tempo real. Cada tamanho de YOLO26 é exportado para o formato e precisão mostrados, então cronometramos a previsão em estado estacionário (aquecimento excluído, tempos por execução com corte sigma) nas mesmas GPUs da Ultralytics Platform onde fazes a implantação.
Formatos & precisão. Em GPUs NVIDIA: PyTorch FP16, ONNX FP16 e TensorRT FP16/INT8 (TensorRT 11.1.0.106 via NVIDIA ModelOpt). O INT8 é calibrado no COCO128; a precisão (mAP50-95 no COCO val2017) é medida uma vez por formato/precisão e mostrada por linha, para que o trade-off entre velocidade↔precisão seja explícito. O INT8 compensa mais em modelos maiores, limitados pela computação — nos menores modelos, seu overhead de quantização pode se igualar ou ficar ligeiramente atrás do FP16. A inferência ONNX é executada em GPUs Ada/Ampere/Hopper (o onnxruntime ainda não possui kernels Blackwell).
Apple Silicon. Dispositivos Mac (ex: Apple M5 Pro) são perfilados localmente e mesclados na tabela — escolhe um formato para compará-los diretamente com as GPUs em nuvem, ou filtra pela geração Apple Silicon. CoreML roda no Neural Engine (o caminho mais rápido da Apple, ~3× CPU), PyTorch no GPU MPS e ONNX na CPU; a coluna Backend de cada linha nomeia o tempo de execução. O CoreML é cronometrado com coremltools no ANE — uma tela de host relativa, não um número de dispositivo iPhone. Hardware próprio não possui preço de aluguel, portanto, o custo-benefício (img/$) é apenas para GPU.
Custo-benefício. Inferências por dólar = FPS × 3600 ÷ preço por hora, usando o preço sob demanda da Ultralytics Platform. Medido no ultralytics 8.4.71, torch 2.12, CUDA 13.2. Vê também a documentação dos modos Predict e Benchmark.
Train on the Best GPUs for Less
26 NVIDIA GPUs starting at $0.24/hr — from Ampere to Blackwell. No markup, no minimums, no commitment.
Ready to build your next vision AI project?
Built on Ultralytics open source with 134.2k+ GitHub stars. Start training models in minutes.