GPU 학습 처리량
Platform의 모든 NVIDIA GPU에서 640px 크기의 COCO 데이터셋으로 학습된 YOLO26 탐지 모델에 auto-batch를 적용했습니다. 장치별 또는 모델 크기별로 비교하거나 차트 지표를 전환하고, 세대별로 필터링할 수 있습니다. 표는 자유롭게 정렬 가능합니다.
H200 SXM | 141 GB | 490.6 | 221 | 40.2 GB | 361 W | $4.39 | 402.3K | |
B300 | 288 GB | 474.6 | 411 | 73.4 GB | 457 W | $7.39 | 231.2K | |
H200 NVL | 143 GB | 469.3 | 221 | 39.8 GB | 283 W | $3.39 | 498.4K | |
H100 NVL | 94 GB | 432.1 | 147 | 26.8 GB | 274 W | $3.19 | 487.6K | |
H100 SXM | 80 GB | 424.3 | 123 | 23.1 GB | 315 W | $3.29 | 464.3K | |
RTX PRO 6000 | 96 GB | 420.6 | 149 | 27.6 GB | 319 W | $2.09 | 724.5K | |
B200 | 180 GB | 404.9 | 281 | 50.4 GB | 419 W | $5.89 | 247.5K | |
RTX 5090 | 32 GB | 356 | 49 | 9.7 GB | 304 W | $0.99 | 1.3M | |
RTX PRO 5000 | 48 GB | 319.7 | 73 | 13.8 GB | 220 W | $0.96 | 1.2M | |
RTX 4090 | 24 GB | 306 | 35 | 13.5 GB | 235 W | $0.69 | 1.6M | |
H100 PCIe | 80 GB | 302.4 | 123 | 22.6 GB | 197 W | $2.89 | 376.7K | |
RTX 6000 Ada | 48 GB | 294.8 | 73 | 13.9 GB | 254 W | $0.77 | 1.4M | |
A100 SXM | 80 GB | 286.8 | 123 | 23.1 GB | 342 W | $1.49 | 692.9K | |
A100 PCIe | 80 GB | 283.2 | 123 | 23.2 GB | 328 W | $1.39 | 733.5K | |
L40S | 48 GB | 265.1 | 70 | 13.3 GB | 258 W | $0.86 | 1.1M | |
L40 | 48 GB | 255.5 | 68 | 13.1 GB | 255 W | $0.99 | 929.1K | |
RTX PRO 4500 | 32 GB | 249.7 | 49 | 11.0 GB | 161 W | $0.64 | 1.4M | |
RTX A6000 | 48 GB | 209.9 | 73 | 13.9 GB | 278 W | $0.49 | 1.5M | |
RTX PRO 4000 | 24 GB | 193.9 | 35 | 7.0 GB | 141 W | $0.57 | 1.2M | |
RTX 3090 | 24 GB | 184.8 | 35 | 13.3 GB | 312 W | $0.46 | 1.4M | |
RTX A5000 | 24 GB | 171.2 | 35 | 7.1 GB | 216 W | $0.27 | 2.3M | |
A40 | 48 GB | 161.2 | 70 | 13.4 GB | 262 W | $0.44 | 1.3M | |
RTX A4500 | 20 GB | 149.2 | 30 | 9.1 GB | 191 W | $0.25 | 2.1M | |
RTX 4000 Ada | 20 GB | 127.9 | 30 | 6.5 GB | 98 W | $0.26 | 1.8M | |
L4 | 24 GB | 116 | 33 | 10.2 GB | 78 W | $0.39 | 1.1M | |
RTX 2000 Ada | 16 GB | 88 | 22 | 4.7 GB | 60 W | $0.24 | 1.3M |
학습 방법론
학습 중 초당 처리되는 이미지 수인 **학습 처리량(training throughput)**을 기준으로 삼으며, 이는 해결 시간과 직접적인 관련이 있습니다. 모든 결과는 Ultralytics Platform GPU에서 측정되었습니다. 이는 클라우드 학습을 위해 클릭 한 번으로 대여할 수 있는 것과 동일한 NVIDIA 하드웨어로, 엔트리 레벨 워크스테이션 카드부터 플래그십 데이터 센터 GPU까지 포함합니다. 모든 5가지 크기(n/s/m/l/x)의 YOLO26 모델을 학습시켜 하드웨어 예산에 맞는 모델을 찾을 수 있도록 했습니다.
설정. 640px 크기의 COCO 데이터셋 25%를 사용하여 2 에포크 학습, AMP 혼합 정밀도, 단일 GPU 환경이며, auto-batch(batch=-1)를 통해 메모리에 맞는 최대 배치 크기를 자동으로 선택합니다. 첫 번째 에포크의 워밍업(데이터셋 캐싱, CUDA 그래프 캡처)과 런 종료 시의 검증 과정을 제외한 안정 상태의 두 번째 에포크 결과를 보고합니다. 계산된 배치 크기, 피크 VRAM(CUDA 컨텍스트 포함), 피크 보드 전력은 각 GPU에서 직접 기록됩니다.
비용 효율성. 이미지당 비용 = 처리량 × 3600 ÷ 시간당 가격으로 계산하며, Ultralytics Platform의 온디맨드 가격을 사용합니다. 이는 가성비 카드가 플래그십 GPU보다 달러당 더 높은 효율을 보이는 경우가 많아 순위가 크게 바뀔 수 있습니다. ultralytics 8.4.68, torch 2.8, CUDA 12.8에서 측정되었습니다. 학습(Train) 및 벤치마크(Benchmark) 모드 문서를 참조하십시오.
GPU 추론 속도
Platform의 모든 NVIDIA GPU에서 다양한 형식(PyTorch, ONNX, TensorRT) 및 정밀도(FP16, INT8)별로 배치 크기 1 기준으로 측정한 YOLO26 탐지 추론 속도입니다. 장치별 또는 모델 크기별 비교, 형식/정밀도 및 차트 지표 전환, 세대별 필터링이 가능하며, 정렬 가능한 표에서 정확도(mAP)와 비용 효율성도 확인할 수 있습니다.
H200 NVL | — | 3.18 | 315 | 0.395 | 5.3 MB | 1.32 GB | $3.39 | 334.1K | |
H100 NVL | — | 4.40 | 227 | 0.395 | 5.3 MB | 1.21 GB | $3.19 | 256.5K | |
RTX 5090 | — | 4.41 | 227 | 0.395 | 5.3 MB | 1.16 GB | $0.99 | 824K | |
RTX PRO 6000 | — | 4.55 | 220 | 0.395 | 5.3 MB | 1.36 GB | $2.09 | 378.8K | |
L4 | — | 4.98 | 201 | 0.395 | 5.3 MB | 0.85 GB | $0.39 | 1.9M | |
H200 SXM | — | 5.01 | 200 | 0.395 | 5.3 MB | 1.30 GB | $4.39 | 163.8K | |
RTX PRO 5000 | — | 5.39 | 185 | 0.395 | 5.3 MB | 1.01 GB | $0.96 | 695.3K | |
B300 | — | 5.44 | 184 | 0.395 | 5.3 MB | 1.73 GB | $7.39 | 89.5K | |
Apple M5 Pro | MPS | 5.67 | 177 | 0.395 | 5.3 MB | — | — | — | |
L40S | — | 6.17 | 162 | 0.395 | 5.3 MB | 1.17 GB | $0.86 | 678.6K | |
H100 SXM | — | 6.36 | 157 | 0.395 | 5.3 MB | 1.18 GB | $3.29 | 172K | |
RTX 4090 | — | 6.67 | 150 | 0.395 | 5.3 MB | 1.00 GB | $0.69 | 781.6K | |
RTX 6000 Ada | — | 7.25 | 138 | 0.395 | 5.3 MB | 1.19 GB | $0.77 | 645.2K | |
RTX PRO 4500 | — | 7.40 | 135 | 0.395 | 5.3 MB | 0.88 GB | $0.64 | 760.5K | |
RTX A6000 | — | 7.74 | 129 | 0.395 | 5.3 MB | 0.87 GB | $0.49 | 948.5K | |
H100 PCIe | — | 7.92 | 126 | 0.395 | 5.3 MB | 1.10 GB | $2.89 | 157.2K | |
A40 | — | 7.96 | 126 | 0.395 | 5.3 MB | 0.96 GB | $0.44 | 1M | |
RTX A5000 | — | 8.25 | 121 | 0.395 | 5.3 MB | 0.78 GB | $0.27 | 1.6M | |
B200 | — | 8.38 | 119 | 0.395 | 5.3 MB | — | $5.89 | 72.9K | |
RTX 2000 Ada | — | 8.41 | 119 | 0.395 | 5.3 MB | 0.62 GB | $0.24 | 1.8M | |
RTX PRO 4000 | — | 8.57 | 117 | 0.395 | 5.3 MB | 0.83 GB | $0.57 | 737.1K | |
A100 SXM | — | 8.72 | 115 | 0.395 | 5.3 MB | 1.34 GB | $1.49 | 276.9K | |
L40 | — | 8.76 | 114 | 0.395 | 5.3 MB | 1.26 GB | $0.99 | 414.9K | |
RTX 4000 Ada | — | 8.87 | 113 | 0.395 | 5.3 MB | 0.61 GB | $0.26 | 1.6M | |
RTX 3090 | — | 8.92 | 112 | 0.395 | 5.3 MB | 0.84 GB | $0.46 | 877.3K | |
RTX A4500 | — | 10.13 | 99 | 0.395 | 5.3 MB | 0.61 GB | $0.25 | 1.4M | |
A100 PCIe | — | 11.04 | 91 | 0.395 | 5.3 MB | 1.34 GB | $1.39 | 234.6K |
추론 방법론
배치 크기 1에서의 이미지당 밀리초 단위인 **추론 지연 시간(inference latency)**을 기준으로 삼으며, 이는 실시간 배포(deployment) 환경에서 중요한 지표입니다. 각 YOLO26 모델 크기를 표시된 형식 및 정밀도로 내보낸 후, 배포 대상인 Ultralytics Platform GPU와 동일한 환경에서(워밍업 제외, 실행별 시간 시그마 클리핑 적용) 안정적인 상태의 예측 시간을 측정합니다.
형식 및 정밀도. NVIDIA GPU 환경: PyTorch FP16, ONNX FP16 및 TensorRT FP16/INT8(NVIDIA ModelOpt를 통한 TensorRT 11.1.0.106). INT8은 COCO128로 보정되었으며, 정확도(mAP50-95, COCO val2017 기준)는 형식/정밀도당 1회 측정하여 각 행에 표시하므로 속도와 정확도 간의 상충 관계를 명확히 알 수 있습니다. INT8은 연산 집약적인 대형 모델에서 가장 효과적이며, 가장 작은 모델에서는 양자화 오버헤드가 FP16과 비슷하거나 약간 뒤처질 수 있습니다. ONNX 추론은 Ada/Ampere/Hopper GPU에서 실행됩니다(onnxruntime은 아직 Blackwell 커널을 지원하지 않음).
Apple Silicon. Mac 장치(예: Apple M5 Pro)는 로컬에서 프로파일링되어 표에 병합되었습니다. 형식을 선택하여 클라우드 GPU와 직접 비교하거나 Apple Silicon 세대별로 필터링하십시오. CoreML은 Neural Engine(가장 빠른 Apple 경로, CPU 대비 약 3배)에서, PyTorch는 MPS GPU에서, ONNX는 CPU에서 실행됩니다. 각 행의 Backend 열에 런타임이 명시되어 있습니다. CoreML은 ANE에서 coremltools로 측정되었으며, 이는 iPhone 장치가 아닌 호스트 화면 기준의 상대적 값입니다. 소유 하드웨어는 대여 비용이 없으므로 비용 효율성(img/$)은 GPU 비용만 고려합니다.
비용 효율성. 추론당 비용 = FPS × 3600 ÷ 시간당 가격으로 계산하며, Ultralytics Platform의 온디맨드 가격을 사용합니다. ultralytics 8.4.71, torch 2.12, CUDA 13.2에서 측정되었습니다. 예측(Predict) 및 벤치마크(Benchmark) 모드 문서를 참조하십시오.
Train on the Best GPUs for Less
26 NVIDIA GPUs starting at $0.24/hr — from Ampere to Blackwell. No markup, no minimums, no commitment.
Ready to build your next vision AI project?
Built on Ultralytics open source with 134.2k+ GitHub stars. Start training models in minutes.