이제 Ultralytics YOLO26이 단안 깊이 추정을 지원합니다.
단일 RGB 이미지로부터 스테레오 장치나 LiDAR 없이 픽셀 단위의 미터법 스케일 깊이를 예측하는 Ultralytics YOLO26의 새로운 깊이 추정 태스크에 대해 알아보세요.

지금까지 YOLO 파이프라인에 깊이(depth)를 추가하려면 직접 조합해야 했습니다. 기존 방식은 탐지(detection)를 위해 YOLO를 실행하고, MiDaS나 Depth Anything 같은 다른 프로젝트의 별도 깊이 모델과 결합하는 것이었습니다. 이는 두 번째 의존성, 두 번째 프레임워크, 그리고 조율해야 할 두 가지 입출력 형식을 의미했습니다.
Ultralytics YOLO26에서 단안 깊이 추정(monocular depth estimation)이 이제 기본 태스크로 지원됩니다. 단일 RGB 이미지만으로 탐지, 세그멘테이션(segmentation), 포즈(pose)와 동일한 패키지, 워크플로우, 내보내기 경로를 사용하여 모든 픽셀의 거리 값을 생성합니다.
Link to this section깊이 추정이란 무엇인가요?#
깊이 추정은 두 번째 카메라나 추가 센서 없이 단일 RGB 이미지로부터 픽셀별 깊이 맵을 예측합니다. 각 출력 픽셀은 카메라에서 해당 표면 점까지의 추정 거리를 나타내는 미터 단위의 깊이 값을 가집니다.
출력은 (H, W) 형태의 밀집된 부동소수점 맵으로 입력에 정렬되어 있으며, 각 픽셀은 상대적인 가깝고 먼 순서가 아니라 카메라로부터의 절대 거리(미터 단위)를 가집니다.
깊이는 고유한 체크포인트를 가진 독립형 태스크이며, 그 출력은 깊이 맵 단독으로 바운딩 박스나 세그멘테이션 마스크를 반환하지 않습니다. 따라서 탐지와 깊이를 결합하려면 두 개의 모델과 두 번의 순방향 패스(forward pass)를 실행해야 합니다. 기존 방식과의 차이점은 이제 둘 다 단일 패키지 안에 있으며, 첫 번째와 나란히 유지 관리해야 하는 두 번째 프레임워크를 요구하는 대신 하나의 설치, 하나의 학습 및 예측 인터페이스, 하나의 내보내기 경로, 그리고 추적해야 할 단일 버전을 공유한다는 점입니다.
이 픽셀별 출력은 장애물 및 자유 공간 탐지, 여유 공간 확인, 장면 레이아웃 파악, 무엇이 무엇 앞에 있는지 이해하는 데 깊이를 유용하게 만듭니다.
그림 1. 안전 및 규정 준수 모니터링을 위한 Ultralytics YOLO26 깊이 추정.
Ultralytics YOLO26은 약 219만 개의 실내 및 실외 이미지로 구성된 광범위한 다중 데이터셋 혼합으로 학습된 yolo26n-depth부터 yolo26x-depth까지 다섯 가지 사전 학습된 깊이 모델을 제공합니다. NYU Depth V2 세트에서 이들은 나노 모델의 0.882 δ1 정확도부터 초대형 모델의 0.933까지 다양하므로, 배포 대상에 맞는 속도와 정확도 간의 절전 타협점을 선택할 수 있습니다.
Link to this section설계상 제한 없는 깊이#
대부분의 깊이 모델은 0~10미터와 같이 고정된 범위로 예측을 제한하며, 이는 실내 장면에는 잘 작동하지만 실외에서는 실패합니다. 대신 Ultralytics는 엄격한 차단 없이 개방형 로그 스케일로 깊이를 예측합니다.
이 차이는 테스트에서 나타납니다. 제한된 모델은 혼합된 실내 및 실외 데이터로 학습할 때 거의 즉시 정체되며, 객체가 80미터 떨어져 있을 수 있는 KITTI와 같은 장거리 데이터셋에서는 성능이 무너집니다. YOLO26의 접근 방식에는 이러한 상한선이 없으므로 더 많은 데이터로 계속 개선되며 몇 센티미터에서 수백 미터까지 유지됩니다. KITTI에서 δ1은 80m 범위에서 0.942에 도달합니다. 즉, 하나의 모델 패밀리가 탁상용 장면과 고속도로 장면을 모두 훌륭하게 처리합니다.
Link to this sectionUltralytics YOLO26 깊이 대 Depth Anything V2 비교#
현재 YOLO와 함께 Depth Anything을 실행하고 있다면 차이점은 속도와 그에 따르는 연산 비용입니다. YOLO26 깊이는 Depth Anything V2 Base보다 최대 20.3배, Depth Anything V2 Small보다 7.7배 더 빠르게 실행되며, 나노 모델 기준 10M 미만의 훨씬 작은 모델 크기로 DA V2의 작은 체크포인트인 약 24M와 비교됩니다.
그림 2. Depth Anything V2 대비 Ultralytics YOLO26 깊이 속도 벤치마크.
그 격차가 바로 이 설계의 핵심입니다. Depth Anything V2의 모델은 실질적으로 더 큽니다. YOLO26-Depth는 프레임당 연산 비용이 적고 해당 모델이 도달할 수 없는 하드웨어에 배포할 수 있는 크기와 속도로 강력한 깊이 성능을 발휘하도록 제작되었습니다. NYU Depth V2 및 KITTI의 모델별 정확도 수치는 문서에 공개되어 있으므로 실제 요구 사항에 맞춰 확인할 수 있습니다.
Link to this section실행되는 곳#
이 크기 차이가 깊이가 실제로 적용될 수 있는 위치를 결정합니다. 깊이를 평가하는 대부분의 팀은 아이디어가 부족한 것이 아니라 연산 능력이 부족합니다. 저전력 드론, 4족 보행 로봇, 웨어러블, 블랙박스, 회의용 하드웨어, 산업용 PC는 모두 정확도 한계에 도달하기 전에 전력 및 비용 한계에 부딪힙니다.
깊이는 5가지 사전 학습된 모델로 제공되므로 벤치마크에서 우승하는 크기가 아닌 타겟에 맞는 크기를 선택할 수 있습니다. 깊이는 기본 YOLO26 태스크이므로 ONNX, TensorRT, CoreML, NCNN, LiteRT와 같은 형식으로 탐지, 세그멘테이션, 포즈와 동일한 내보내기 경로를 사용합니다.
Link to this sectionUltralytics YOLO26 깊이 시작하기#
Ultralytics Python 패키지는 깊이를 포함한 모든 YOLO26 태스크에서 학습, 검증, 추론 실행을 위한 단일 통합 인터페이스를 제공합니다. 사전 학습된 깊이 모델을 실행하는 것은 단일 명령어로 가능합니다.
from ultralytics import YOLO
from ultralytics import YOLO
# Load a model
model = YOLO("yolo26n-depth.pt") # load an official model
model = YOLO("path/to/best.pt") # load a custom model
# Predict with the model
results = model("https://ultralytics.com/images/bus.jpg") # predict on an image
# Access the results
for result in results:
depth_map = result.depth.data.cpu().numpy() # torch.Tensor → NumPy float32, shape (H, W), meters또는 CLI에서:
yolo depth predict model=yolo26n-depth.pt source='https://ultralytics.com/images/bus.jpg' # predict with official model
yolo depth predict model=path/to/best.pt source='https://ultralytics.com/images/bus.jpg' # predict with custom model절대 거리는 카메라와 장면에 따라 다릅니다. 깊이 맵의 형태는 맞지만 스케일이 맞지 않는 경우, model.calibrate()는 나머지 네트워크를 변경하지 않고 몇 초 만에 약 100개의 라벨이 지정된 프레임에서 모델의 깊이 헤드에 스케일과 오프셋이라는 두 개의 변수만 맞춥니다.
Link to this section데이터 자체로 파인튜닝(fine-tuning)하기#
사전 학습된 깊이 모델을 자체 카메라나 도메인에 맞게 조정하려면 사전 학습된 가중치에서 시작하여 AdamW를 사용하고, 파인튜닝이 모델을 덮어쓰는 대신 정교화하도록 학습률을 처음부터 시작하는 기본값보다 훨씬 낮게 설정하십시오.
from ultralytics import YOLO
from ultralytics import YOLO
model = YOLO("yolo26s-depth.pt") # start from pretrained weights
model.train(
data="path/to/your_dataset.yaml",
epochs=20,
imgsz=640,
optimizer="AdamW",
lr0=1e-4, # ~100x below the from-scratch default
warmup_bias_lr=1e-4, # keep warmup gentle too
)기본 로그 헤드가 제한되어 있지 않기 때문에 max_depth 튜닝 없이 데이터셋이 단거리이든 장거리이든 즉시 작동합니다. 특정 카메라에 대해 절대 스케일만 맞지 않는 경우, model.calibrate()는 네트워크 가중치를 건드리지 않고 몇 초 만에 소규모의 라벨이 지정된 분할에서 가볍고 닫힌 형태(closed-form)의 보정을 수행합니다.
데이터셋은 각 RGB 이미지를 일치하는 폴더 구조의 .npy 깊이 파일과 쌍을 이루며, Ultralytics는 NYU Depth V2, KITTI, Hypersim, SUN RGB-D, ARKitScenes에 대한 기본 제공 설정을 제공하므로 대부분의 팀이 표준 벤치마크에 대해 즉시 검증을 시작할 수 있습니다.
자세한 내용은 퀵스타트 가이드를 확인하세요.
Link to this section깊이 추정의 주요 사용 사례#
이 새로운 기능은 단일 일반 카메라로 작동할 수 있으므로, 단안 깊이 추정은 스테레오 또는 라이다(LiDAR) 설정의 비용, 전력 소비 또는 캘리브레이션 오버헤드를 정당화할 수 없는 제품과 산업에 무궁무진한 기회를 열어줍니다. 이 기능을 활용할 수 있는 주요 산업과 사용 사례를 살펴보겠습니다.
- 로보틱스 및 자율 내비게이션. 모바일 로봇과 드론은 단일 온보드 카메라로 장애물 거리와 자유 공간을 추정하여 전용 깊이 하드웨어 없이 실시간 경로 계획을 지원합니다.
- 산업 및 물류 인식. 두 번째 센서를 추가하는 것이 실용적이지 않은 모든 곳에서 단일 고정 카메라를 통해 여유 공간 확인, 자유 공간 탐지, 선반 또는 통로 컨텍스트를 파악합니다.
- 안전 및 규정 준수 모니터링. 지게차 및 창고 안전 구역, 철도 사고 감지, 기존 CCTV에서의 쓰러진 사람 및 방치된 물체 감지: 기존 안전 인증 센서를 대체하는 것이 아니라 이미 설치된 카메라 피드에 거리 컨텍스트를 추가합니다.
- 인프라 및 자산 검사. 가공 송전선 여유 공간 분석, 드론 기반 자산 및 부식 검사, 항공 측량 작업 등 동일한 모델 가족군이 근접 세부 정보와 장거리 장면을 모두 처리해야 하는 경우에 유용합니다.
- 운전자 지원 및 자동차 인식. 장거리의 제한 없는 깊이 출력을 통해 근접 실내 장면을 처리하는 동일한 모델 가족군이 80m 이상의 주행 장면으로 일반화됩니다.
- AR 및 공간 콘텐츠. 실제 장면에 가상 객체를 그럴듯하게 배치하거나 깊이 인식 효과를 적용하는 것은 모든 픽셀이 실제로 카메라에서 얼마나 떨어져 있는지 아는 것부터 시작됩니다.
Link to this section모든 YOLO26 배포에 깊이 추정 도입하기#
이제 깊이 추정이 기본 YOLO26 태스크가 되었으므로, 팀은 탐지, 세그멘테이션, 포즈에서 이미 익숙한 동일한 train, val, predict, export 워크플로우를 사용하여 모든 산업 분야의 모든 RGB 카메라에서 픽셀별 거리를 활용할 수 있으며 유지 관리해야 할 타사 의존성을 하나 줄일 수 있습니다.
따라서 Ultralytics YOLO26 깊이로 배포를 계획할 때 명심해야 할 몇 가지 주요 사항을 살펴보겠습니다.
- Ultralytics YOLO Depth는 RGB 카메라용으로 제작되었습니다. 웹캠, 휴대폰, 산업용 카메라, 드론을 포함한 모든 표준 카메라가 작동합니다. 그러나 라이다 포인트 클라우드, 레이더, 소나, 열화상 및 다중 스펙트럼 대역, 또는 메시 및 IFC 데이터와 같은 다른 모달리티는 모델의 입력 형식을 벗어납니다.
- 인지 결정을 위한 미터 단위 거리. 출력은 미터 단위의 실제 거리이므로 내비게이션, 여유 공간 확보, 모니터링에 매우 적합합니다. 그러나 인증된 공차가 필요한 모든 애플리케이션의 경우 전용 계측 장비가 올바른 도구로 남아 있습니다.
- 이미지별 추정. 깊이는 다른 모든 YOLO26 태스크와 일관되게 각 프레임에서 독립적으로 실행되므로 변경 없이 기존 프레임별 파이프라인에 통합됩니다. 시퀀스에 대한 추론은 애플리케이션 레이어에 유지됩니다.
- Ultralytics YOLO26-Depth는 텍스처가 있고 불투명한 표면에서 가장 강력합니다. 유리, 거울, 고인 물, 광택이 나는 금속, 탁 트인 하늘은 단일 카메라 방식에서는 본질적으로 모호하므로 환경을 대표하는 장면에서 검증하는 것이 좋습니다.
비전 AI에 대해 더 알고 싶으신가요? 라이선스 옵션을 살펴보고 프로젝트에 컴퓨터 비전을 도입해 보세요. GitHub 리포지토리를 방문하여 Ultralytics의 전체 태스크와 통합 기능을 확인하고, Ultralytics Platform을 확인하여 자체 엔드투엔드 비전 AI 워크플로우를 구축해 보세요.






