엔터프라이즈급 보안: ISO 27001 + SOC 2 Type I 규정을 준수합니다.
Ultralytics

Ultralytics 벤치마크

YOLO26이 Ultralytics Platform의 NVIDIA GPU에서 어떻게 작동하는지 보여줍니다. 측정된 학습 처리량과 추론 지연 시간, 메모리, 전력, 정확도 및 비용 효율성을 확인하여 예산과 일정에 맞는 최적의 GPU를 선택할 수 있습니다.

GPU 학습 처리량

Platform의 모든 NVIDIA GPU에서 640px 크기의 COCO 데이터셋으로 학습된 YOLO26 탐지 모델에 auto-batch를 적용했습니다. 장치별 또는 모델 크기별로 비교하거나 차트 지표를 전환하고, 세대별로 필터링할 수 있습니다. 표는 자유롭게 정렬 가능합니다.

Compare
Model
Chart metric
Generation
H200 SXM
Hopper
141 GB
490.6
221
40.2 GB
361 W
$4.39
402.3K
B300
Blackwell
288 GB
474.6
411
73.4 GB
457 W
$7.39
231.2K
H200 NVL
Hopper
143 GB
469.3
221
39.8 GB
283 W
$3.39
498.4K
H100 NVL
Hopper
94 GB
432.1
147
26.8 GB
274 W
$3.19
487.6K
H100 SXM
Hopper
80 GB
424.3
123
23.1 GB
315 W
$3.29
464.3K
RTX PRO 6000
Blackwell
96 GB
420.6
149
27.6 GB
319 W
$2.09
724.5K
B200
Blackwell
180 GB
404.9
281
50.4 GB
419 W
$5.89
247.5K
RTX 5090
Blackwell
32 GB
356
49
9.7 GB
304 W
$0.99
1.3M
RTX PRO 5000
Blackwell
48 GB
319.7
73
13.8 GB
220 W
$0.96
1.2M
RTX 4090
Ada
24 GB
306
35
13.5 GB
235 W
$0.69
1.6M
H100 PCIe
Hopper
80 GB
302.4
123
22.6 GB
197 W
$2.89
376.7K
RTX 6000 Ada
Ada
48 GB
294.8
73
13.9 GB
254 W
$0.77
1.4M
A100 SXM
Ampere
80 GB
286.8
123
23.1 GB
342 W
$1.49
692.9K
A100 PCIe
Ampere
80 GB
283.2
123
23.2 GB
328 W
$1.39
733.5K
L40S
Ada
48 GB
265.1
70
13.3 GB
258 W
$0.86
1.1M
L40
Ada
48 GB
255.5
68
13.1 GB
255 W
$0.99
929.1K
RTX PRO 4500
Blackwell
32 GB
249.7
49
11.0 GB
161 W
$0.64
1.4M
RTX A6000
Ampere
48 GB
209.9
73
13.9 GB
278 W
$0.49
1.5M
RTX PRO 4000
Blackwell
24 GB
193.9
35
7.0 GB
141 W
$0.57
1.2M
RTX 3090
Ampere
24 GB
184.8
35
13.3 GB
312 W
$0.46
1.4M
RTX A5000
Ampere
24 GB
171.2
35
7.1 GB
216 W
$0.27
2.3M
A40
Ampere
48 GB
161.2
70
13.4 GB
262 W
$0.44
1.3M
RTX A4500
Ampere
20 GB
149.2
30
9.1 GB
191 W
$0.25
2.1M
RTX 4000 Ada
Ada
20 GB
127.9
30
6.5 GB
98 W
$0.26
1.8M
L4
Ada
24 GB
116
33
10.2 GB
78 W
$0.39
1.1M
RTX 2000 Ada
Ada
16 GB
88
22
4.7 GB
60 W
$0.24
1.3M

학습 방법론

학습 중 초당 처리되는 이미지 수인 **학습 처리량(training throughput)**을 기준으로 삼으며, 이는 해결 시간과 직접적인 관련이 있습니다. 모든 결과는 Ultralytics Platform GPU에서 측정되었습니다. 이는 클라우드 학습을 위해 클릭 한 번으로 대여할 수 있는 것과 동일한 NVIDIA 하드웨어로, 엔트리 레벨 워크스테이션 카드부터 플래그십 데이터 센터 GPU까지 포함합니다. 모든 5가지 크기(n/s/m/l/x)의 YOLO26 모델을 학습시켜 하드웨어 예산에 맞는 모델을 찾을 수 있도록 했습니다.

설정. 640px 크기의 COCO 데이터셋 25%를 사용하여 2 에포크 학습, AMP 혼합 정밀도, 단일 GPU 환경이며, auto-batch(batch=-1)를 통해 메모리에 맞는 최대 배치 크기를 자동으로 선택합니다. 첫 번째 에포크의 워밍업(데이터셋 캐싱, CUDA 그래프 캡처)과 런 종료 시의 검증 과정을 제외한 안정 상태의 두 번째 에포크 결과를 보고합니다. 계산된 배치 크기, 피크 VRAM(CUDA 컨텍스트 포함), 피크 보드 전력은 각 GPU에서 직접 기록됩니다.

비용 효율성. 이미지당 비용 = 처리량 × 3600 ÷ 시간당 가격으로 계산하며, Ultralytics Platform의 온디맨드 가격을 사용합니다. 이는 가성비 카드가 플래그십 GPU보다 달러당 더 높은 효율을 보이는 경우가 많아 순위가 크게 바뀔 수 있습니다. ultralytics 8.4.68, torch 2.8, CUDA 12.8에서 측정되었습니다. 학습(Train)벤치마크(Benchmark) 모드 문서를 참조하십시오.

GPU 추론 속도

Platform의 모든 NVIDIA GPU에서 다양한 형식(PyTorch, ONNX, TensorRT) 및 정밀도(FP16, INT8)별로 배치 크기 1 기준으로 측정한 YOLO26 탐지 추론 속도입니다. 장치별 또는 모델 크기별 비교, 형식/정밀도 및 차트 지표 전환, 세대별 필터링이 가능하며, 정렬 가능한 표에서 정확도(mAP)와 비용 효율성도 확인할 수 있습니다.

Compare
Model
Format / precision
Chart metric
Generation
H200 NVL
Hopper
3.18
315
0.395
5.3 MB
1.32 GB
$3.39
334.1K
H100 NVL
Hopper
4.40
227
0.395
5.3 MB
1.21 GB
$3.19
256.5K
RTX 5090
Blackwell
4.41
227
0.395
5.3 MB
1.16 GB
$0.99
824K
RTX PRO 6000
Blackwell
4.55
220
0.395
5.3 MB
1.36 GB
$2.09
378.8K
L4
Ada
4.98
201
0.395
5.3 MB
0.85 GB
$0.39
1.9M
H200 SXM
Hopper
5.01
200
0.395
5.3 MB
1.30 GB
$4.39
163.8K
RTX PRO 5000
Blackwell
5.39
185
0.395
5.3 MB
1.01 GB
$0.96
695.3K
B300
Blackwell
5.44
184
0.395
5.3 MB
1.73 GB
$7.39
89.5K
Apple M5 Pro
Apple Silicon
MPS
5.67
177
0.395
5.3 MB
L40S
Ada
6.17
162
0.395
5.3 MB
1.17 GB
$0.86
678.6K
H100 SXM
Hopper
6.36
157
0.395
5.3 MB
1.18 GB
$3.29
172K
RTX 4090
Ada
6.67
150
0.395
5.3 MB
1.00 GB
$0.69
781.6K
RTX 6000 Ada
Ada
7.25
138
0.395
5.3 MB
1.19 GB
$0.77
645.2K
RTX PRO 4500
Blackwell
7.40
135
0.395
5.3 MB
0.88 GB
$0.64
760.5K
RTX A6000
Ampere
7.74
129
0.395
5.3 MB
0.87 GB
$0.49
948.5K
H100 PCIe
Hopper
7.92
126
0.395
5.3 MB
1.10 GB
$2.89
157.2K
A40
Ampere
7.96
126
0.395
5.3 MB
0.96 GB
$0.44
1M
RTX A5000
Ampere
8.25
121
0.395
5.3 MB
0.78 GB
$0.27
1.6M
B200
Blackwell
8.38
119
0.395
5.3 MB
$5.89
72.9K
RTX 2000 Ada
Ada
8.41
119
0.395
5.3 MB
0.62 GB
$0.24
1.8M
RTX PRO 4000
Blackwell
8.57
117
0.395
5.3 MB
0.83 GB
$0.57
737.1K
A100 SXM
Ampere
8.72
115
0.395
5.3 MB
1.34 GB
$1.49
276.9K
L40
Ada
8.76
114
0.395
5.3 MB
1.26 GB
$0.99
414.9K
RTX 4000 Ada
Ada
8.87
113
0.395
5.3 MB
0.61 GB
$0.26
1.6M
RTX 3090
Ampere
8.92
112
0.395
5.3 MB
0.84 GB
$0.46
877.3K
RTX A4500
Ampere
10.13
99
0.395
5.3 MB
0.61 GB
$0.25
1.4M
A100 PCIe
Ampere
11.04
91
0.395
5.3 MB
1.34 GB
$1.39
234.6K

추론 방법론

배치 크기 1에서의 이미지당 밀리초 단위인 **추론 지연 시간(inference latency)**을 기준으로 삼으며, 이는 실시간 배포(deployment) 환경에서 중요한 지표입니다. 각 YOLO26 모델 크기를 표시된 형식 및 정밀도로 내보낸 후, 배포 대상인 Ultralytics Platform GPU와 동일한 환경에서(워밍업 제외, 실행별 시간 시그마 클리핑 적용) 안정적인 상태의 예측 시간을 측정합니다.

형식 및 정밀도. NVIDIA GPU 환경: PyTorch FP16, ONNX FP16 및 TensorRT FP16/INT8(NVIDIA ModelOpt를 통한 TensorRT 11.1.0.106). INT8은 COCO128로 보정되었으며, 정확도(mAP50-95, COCO val2017 기준)는 형식/정밀도당 1회 측정하여 각 행에 표시하므로 속도와 정확도 간의 상충 관계를 명확히 알 수 있습니다. INT8은 연산 집약적인 대형 모델에서 가장 효과적이며, 가장 작은 모델에서는 양자화 오버헤드가 FP16과 비슷하거나 약간 뒤처질 수 있습니다. ONNX 추론은 Ada/Ampere/Hopper GPU에서 실행됩니다(onnxruntime은 아직 Blackwell 커널을 지원하지 않음).

Apple Silicon. Mac 장치(예: Apple M5 Pro)는 로컬에서 프로파일링되어 표에 병합되었습니다. 형식을 선택하여 클라우드 GPU와 직접 비교하거나 Apple Silicon 세대별로 필터링하십시오. CoreML은 Neural Engine(가장 빠른 Apple 경로, CPU 대비 약 3배)에서, PyTorch는 MPS GPU에서, ONNX는 CPU에서 실행됩니다. 각 행의 Backend 열에 런타임이 명시되어 있습니다. CoreML은 ANE에서 coremltools로 측정되었으며, 이는 iPhone 장치가 아닌 호스트 화면 기준의 상대적 값입니다. 소유 하드웨어는 대여 비용이 없으므로 비용 효율성(img/$)은 GPU 비용만 고려합니다.

비용 효율성. 추론당 비용 = FPS × 3600 ÷ 시간당 가격으로 계산하며, Ultralytics Platform의 온디맨드 가격을 사용합니다. ultralytics 8.4.71, torch 2.12, CUDA 13.2에서 측정되었습니다. 예측(Predict)벤치마크(Benchmark) 모드 문서를 참조하십시오.

Ready to build your next vision AI project?

Built on Ultralytics open source with 134.2k+ GitHub stars. Start training models in minutes.