Segurança pronta para empresas: Em conformidade com ISO 27001 + SOC 2 Tipo I.
Ultralytics

Benchmarks da Ultralytics

Como o YOLO26 se comporta nas GPUs NVIDIA da Ultralytics Platform — taxa de transferência de treinamento e latência de inferência medidas, com memória, energia, precisão e custo-benefício, para que possas escolher a GPU certa para o teu orçamento e cronograma.

Taxa de Transferência de Treinamento de GPU

Detecção com YOLO26 treinado no COCO a 640px com auto-batch em todas as GPUs NVIDIA na Platform. Compara entre dispositivos ou por tamanho de modelo, alterna a métrica do gráfico ou filtra por geração; a tabela é totalmente ordenável.

Compare
Model
Chart metric
Generation
H200 SXM
Hopper
141 GB
490.6
221
40.2 GB
361 W
$4.39
402.3K
B300
Blackwell
288 GB
474.6
411
73.4 GB
457 W
$7.39
231.2K
H200 NVL
Hopper
143 GB
469.3
221
39.8 GB
283 W
$3.39
498.4K
H100 NVL
Hopper
94 GB
432.1
147
26.8 GB
274 W
$3.19
487.6K
H100 SXM
Hopper
80 GB
424.3
123
23.1 GB
315 W
$3.29
464.3K
RTX PRO 6000
Blackwell
96 GB
420.6
149
27.6 GB
319 W
$2.09
724.5K
B200
Blackwell
180 GB
404.9
281
50.4 GB
419 W
$5.89
247.5K
RTX 5090
Blackwell
32 GB
356
49
9.7 GB
304 W
$0.99
1.3M
RTX PRO 5000
Blackwell
48 GB
319.7
73
13.8 GB
220 W
$0.96
1.2M
RTX 4090
Ada
24 GB
306
35
13.5 GB
235 W
$0.69
1.6M
H100 PCIe
Hopper
80 GB
302.4
123
22.6 GB
197 W
$2.89
376.7K
RTX 6000 Ada
Ada
48 GB
294.8
73
13.9 GB
254 W
$0.77
1.4M
A100 SXM
Ampere
80 GB
286.8
123
23.1 GB
342 W
$1.49
692.9K
A100 PCIe
Ampere
80 GB
283.2
123
23.2 GB
328 W
$1.39
733.5K
L40S
Ada
48 GB
265.1
70
13.3 GB
258 W
$0.86
1.1M
L40
Ada
48 GB
255.5
68
13.1 GB
255 W
$0.99
929.1K
RTX PRO 4500
Blackwell
32 GB
249.7
49
11.0 GB
161 W
$0.64
1.4M
RTX A6000
Ampere
48 GB
209.9
73
13.9 GB
278 W
$0.49
1.5M
RTX PRO 4000
Blackwell
24 GB
193.9
35
7.0 GB
141 W
$0.57
1.2M
RTX 3090
Ampere
24 GB
184.8
35
13.3 GB
312 W
$0.46
1.4M
RTX A5000
Ampere
24 GB
171.2
35
7.1 GB
216 W
$0.27
2.3M
A40
Ampere
48 GB
161.2
70
13.4 GB
262 W
$0.44
1.3M
RTX A4500
Ampere
20 GB
149.2
30
9.1 GB
191 W
$0.25
2.1M
RTX 4000 Ada
Ada
20 GB
127.9
30
6.5 GB
98 W
$0.26
1.8M
L4
Ada
24 GB
116
33
10.2 GB
78 W
$0.39
1.1M
RTX 2000 Ada
Ada
16 GB
88
22
4.7 GB
60 W
$0.24
1.3M

Metodologia de treinamento

Usamos a taxa de transferência de treinamento — imagens processadas por segundo durante o treinamento — como referência; ela correlaciona-se diretamente com o tempo de conclusão. Cada resultado é medido nas GPUs da Ultralytics Platform — o mesmo hardware NVIDIA que alugas para treinamento na nuvem com um clique, desde placas de workstation de entrada até GPUs emblemáticas de data center. Treinamos o YOLO26 em todos os cinco tamanhos (n/s/m/l/x) para que possas adequar um modelo ao teu orçamento de hardware.

Configurações. 2 épocas em 25% do COCO a 640px, precisão mista AMP, GPU única, com auto-batch (batch=-1) selecionando o maior lote que cabe na memória. Relatamos a segunda época em estado estacionário, que exclui o aquecimento da primeira época (cache do conjunto de dados, captura de grafo CUDA) e a validação do final da execução. O tamanho do lote resolvido, o pico de VRAM (incluindo o contexto CUDA) e o pico de energia da placa são registrados diretamente de cada GPU.

Custo-benefício. Imagens por dólar = taxa de transferência × 3600 ÷ preço por hora, usando o preço sob demanda da Ultralytics Platform — isso frequentemente reordena o ranking drasticamente, já que placas com melhor valor superam GPUs emblemáticas por dólar. Medido no ultralytics 8.4.68, torch 2.8, CUDA 12.8. Vê também a documentação dos modos Train e Benchmark.

Velocidade de Inferência de GPU

Inferência de detecção YOLO26 entre formatos (PyTorch, ONNX, TensorRT) e precisões (FP16, INT8) em todas as GPUs NVIDIA na Platform, cronometrada no batch 1. Compara entre dispositivos ou por tamanho de modelo, alterna o formato/precisão e a métrica do gráfico, ou filtra por geração; a tabela ordenável também mostra precisão (mAP) e custo-benefício.

Compare
Model
Format / precision
Chart metric
Generation
H200 NVL
Hopper
3.18
315
0.395
5.3 MB
1.32 GB
$3.39
334.1K
H100 NVL
Hopper
4.40
227
0.395
5.3 MB
1.21 GB
$3.19
256.5K
RTX 5090
Blackwell
4.41
227
0.395
5.3 MB
1.16 GB
$0.99
824K
RTX PRO 6000
Blackwell
4.55
220
0.395
5.3 MB
1.36 GB
$2.09
378.8K
L4
Ada
4.98
201
0.395
5.3 MB
0.85 GB
$0.39
1.9M
H200 SXM
Hopper
5.01
200
0.395
5.3 MB
1.30 GB
$4.39
163.8K
RTX PRO 5000
Blackwell
5.39
185
0.395
5.3 MB
1.01 GB
$0.96
695.3K
B300
Blackwell
5.44
184
0.395
5.3 MB
1.73 GB
$7.39
89.5K
Apple M5 Pro
Apple Silicon
MPS
5.67
177
0.395
5.3 MB
L40S
Ada
6.17
162
0.395
5.3 MB
1.17 GB
$0.86
678.6K
H100 SXM
Hopper
6.36
157
0.395
5.3 MB
1.18 GB
$3.29
172K
RTX 4090
Ada
6.67
150
0.395
5.3 MB
1.00 GB
$0.69
781.6K
RTX 6000 Ada
Ada
7.25
138
0.395
5.3 MB
1.19 GB
$0.77
645.2K
RTX PRO 4500
Blackwell
7.40
135
0.395
5.3 MB
0.88 GB
$0.64
760.5K
RTX A6000
Ampere
7.74
129
0.395
5.3 MB
0.87 GB
$0.49
948.5K
H100 PCIe
Hopper
7.92
126
0.395
5.3 MB
1.10 GB
$2.89
157.2K
A40
Ampere
7.96
126
0.395
5.3 MB
0.96 GB
$0.44
1M
RTX A5000
Ampere
8.25
121
0.395
5.3 MB
0.78 GB
$0.27
1.6M
B200
Blackwell
8.38
119
0.395
5.3 MB
$5.89
72.9K
RTX 2000 Ada
Ada
8.41
119
0.395
5.3 MB
0.62 GB
$0.24
1.8M
RTX PRO 4000
Blackwell
8.57
117
0.395
5.3 MB
0.83 GB
$0.57
737.1K
A100 SXM
Ampere
8.72
115
0.395
5.3 MB
1.34 GB
$1.49
276.9K
L40
Ada
8.76
114
0.395
5.3 MB
1.26 GB
$0.99
414.9K
RTX 4000 Ada
Ada
8.87
113
0.395
5.3 MB
0.61 GB
$0.26
1.6M
RTX 3090
Ampere
8.92
112
0.395
5.3 MB
0.84 GB
$0.46
877.3K
RTX A4500
Ampere
10.13
99
0.395
5.3 MB
0.61 GB
$0.25
1.4M
A100 PCIe
Ampere
11.04
91
0.395
5.3 MB
1.34 GB
$1.39
234.6K

Metodologia de inferência

Usamos a latência de inferência — milissegundos por imagem no batch 1 — como referência; é o que importa para a implantação em tempo real. Cada tamanho de YOLO26 é exportado para o formato e precisão mostrados, então cronometramos a previsão em estado estacionário (aquecimento excluído, tempos por execução com corte sigma) nas mesmas GPUs da Ultralytics Platform onde fazes a implantação.

Formatos & precisão. Em GPUs NVIDIA: PyTorch FP16, ONNX FP16 e TensorRT FP16/INT8 (TensorRT 11.1.0.106 via NVIDIA ModelOpt). O INT8 é calibrado no COCO128; a precisão (mAP50-95 no COCO val2017) é medida uma vez por formato/precisão e mostrada por linha, para que o trade-off entre velocidade↔precisão seja explícito. O INT8 compensa mais em modelos maiores, limitados pela computação — nos menores modelos, seu overhead de quantização pode se igualar ou ficar ligeiramente atrás do FP16. A inferência ONNX é executada em GPUs Ada/Ampere/Hopper (o onnxruntime ainda não possui kernels Blackwell).

Apple Silicon. Dispositivos Mac (ex: Apple M5 Pro) são perfilados localmente e mesclados na tabela — escolhe um formato para compará-los diretamente com as GPUs em nuvem, ou filtra pela geração Apple Silicon. CoreML roda no Neural Engine (o caminho mais rápido da Apple, ~3× CPU), PyTorch no GPU MPS e ONNX na CPU; a coluna Backend de cada linha nomeia o tempo de execução. O CoreML é cronometrado com coremltools no ANE — uma tela de host relativa, não um número de dispositivo iPhone. Hardware próprio não possui preço de aluguel, portanto, o custo-benefício (img/$) é apenas para GPU.

Custo-benefício. Inferências por dólar = FPS × 3600 ÷ preço por hora, usando o preço sob demanda da Ultralytics Platform. Medido no ultralytics 8.4.71, torch 2.12, CUDA 13.2. Vê também a documentação dos modos Predict e Benchmark.

Ready to build your next vision AI project?

Built on Ultralytics open source with 134.2k+ GitHub stars. Start training models in minutes.