O Ultralytics YOLO26 agora suporta estimativa de profundidade monocular
Aprende como a nova tarefa de estimativa de profundidade no Ultralytics YOLO26 prevê profundidade métrica por pixel a partir de uma única imagem RGB, sem necessidade de sistema estéreo ou LiDAR.

Até agora, adicionar profundidade a um pipeline YOLO significava montá-lo por conta própria. O padrão estabelecido era executar o YOLO para detecção e pareá-lo com um modelo de profundidade separado de outro projeto, como MiDaS ou Depth Anything. Isso significava uma segunda dependência, um segundo framework e dois conjuntos de formatos de entrada e saída para conciliar.
A estimativa de profundidade monocular agora é uma tarefa nativa no Ultralytics YOLO26. Uma única imagem RGB produz um valor de distância para cada pixel, usando o mesmo pacote, fluxo de trabalho e caminho de exportação da detecção, segmentação e pose.
Link to this sectionO que é estimativa de profundidade?#
A estimativa de profundidade prevê um mapa de profundidade por pixel a partir de uma única imagem RGB, sem o envolvimento de uma segunda câmera ou sensor adicional. Cada pixel de saída contém um valor de profundidade em metros, representando a distância estimada da câmera até aquele ponto da superfície.
A saída é um mapa de ponto flutuante denso com formato (H, W), alinhado à entrada, onde cada pixel carrega uma distância absoluta em metros; uma distância da câmera, e não uma ordem relativa do que está mais perto ou mais longe.
A profundidade é uma tarefa independente com seu próprio checkpoint, e sua saída é apenas o mapa de profundidade; ela não retorna caixas delimitadoras (bounding boxes) nem máscaras de segmentação. Portanto, combinar detecção com profundidade requer a execução de dois modelos e duas passagens de inferência (forward passes). O que difere da prática anterior é que ambos agora residem em um único pacote, compartilhando uma única instalação, uma única interface de treinamento e predição, um único caminho de exportação e uma única versão para rastrear, em vez de exigir a manutenção de um segundo framework junto ao primeiro.
Essa saída por pixel é o que torna a profundidade útil para a detecção de obstáculos e espaço livre, verificação de folga, layout de cena e para entender o que está na frente de quê.
Fig 1. Estimativa de profundidade do Ultralytics YOLO26 para monitoramento de segurança e conformidade.
O Ultralytics YOLO26 inclui cinco modelos de profundidade pré-treinados, desde o yolo26n-depth até o yolo26x-depth, treinados em uma ampla mistura de múltiplos datasets abrangendo aproximadamente 2,19 milhões de imagens internas e externas. No conjunto NYU Depth V2, eles variam de 0,882 de acurácia δ1 no modelo nano até 0,933 no modelo extra-grande, para que possas escolher o equilíbrio entre velocidade e acurácia que melhor se adapta ao teu alvo de implantação.
Link to this sectionProfundidade ilimitada por design#
A maioria dos modelos de profundidade limita suas previsões a um intervalo fixo, como 0–10 metros, o que funciona bem para cenas internas, mas falha em ambientes externos. Em vez disso, o Ultralytics prevê a profundidade em uma escala logarítmica aberta, sem um corte rígido.
A diferença aparece nos testes. Um modelo limitado estabiliza quase imediatamente quando treinado com dados mistos de ambientes internos e externos, e falha em datasets de maior alcance, como o KITTI, onde os objetos podem estar a 80 metros de distância. A abordagem do YOLO26 não tem esse limite, portanto, ela continua melhorando com mais dados e se sustenta desde alguns centímetros até algumas centenas de metros. No KITTI, o δ1 atinge 0,942 a uma distância de 80 m. Isso significa que uma única família de modelos lida igualmente bem com uma cena de mesa e uma cena de rodovia.
Link to this sectionComparando a profundidade do Ultralytics YOLO26 com o Depth Anything V2#
Se estás a usar o Depth Anything juntamente com o YOLO hoje, a diferença é a velocidade e a fatura de computação que a acompanha. A profundidade do YOLO26 é executada até 20,3× mais rápido do que o Depth Anything V2 Base e 7,7× mais rápido do que o Depth Anything V2 Small, a partir de um modelo muito menor, com menos de 10M de parâmetros na versão nano, em comparação com cerca de 24M para o checkpoint menor do DA V2.
Fig 2. Testes de benchmark de velocidade para a profundidade do Ultralytics YOLO26 em comparação com o Depth Anything V2.
Essa lacuna é o objetivo do design. Os modelos do Depth Anything V2 são substancialmente maiores; o YOLO26-Depth foi construído para fornecer um forte desempenho de profundidade a um tamanho e velocidade que custam menos computação por frame e podem ser implantados em hardwares que esses modelos não conseguem alcançar. Os números de acurácia por modelo no NYU Depth V2 e no KITTI estão publicados na documentação, para que os possas verificar em relação ao requisito que realmente tens.
Link to this sectionOnde ele é executado#
Essa diferença de tamanho é o que determina onde a profundidade pode realmente ser aplicada. A maioria das equipes que avalia profundidade não tem falta de ideias; tem falta de computação. Drones de baixa potência, robôs quadrúpedes, wearables, câmeras veiculares (dashcams), hardware de conferência e PCs industriais atingem um limite de energia e custo antes de atingirem um limite de acurácia.
A profundidade é fornecida como cinco modelos pré-treinados, para que possas escolher o tamanho que se adapta ao alvo em vez do tamanho que vence um benchmark. Como a profundidade é uma tarefa nativa do YOLO26, ela usa o mesmo caminho de exportação da detecção, segmentação e pose com os seguintes formatos: ONNX, TensorRT, CoreML, NCNN, LiteRT.
Link to this sectionComeçando com a profundidade do Ultralytics YOLO26#
O pacote Python do Ultralytics fornece uma interface única e unificada para treinar, validar e executar inferência em todas as tarefas do YOLO26, incluindo a profundidade. Executar um modelo de profundidade pré-treinado requer apenas um comando:
from ultralytics import YOLO
from ultralytics import YOLO
# Load a model
model = YOLO("yolo26n-depth.pt") # load an official model
model = YOLO("path/to/best.pt") # load a custom model
# Predict with the model
results = model("https://ultralytics.com/images/bus.jpg") # predict on an image
# Access the results
for result in results:
depth_map = result.depth.data.cpu().numpy() # torch.Tensor → NumPy float32, shape (H, W), metersOu a partir da CLI:
yolo depth predict model=yolo26n-depth.pt source='https://ultralytics.com/images/bus.jpg' # predict with official model
yolo depth predict model=path/to/best.pt source='https://ultralytics.com/images/bus.jpg' # predict with custom modelAbsolute distance depends on your camera and your scene. If the shape of the depth map is right but the scale is off, model.calibrate() fits just two variables in the model's depth head, a scale and an offset, on around 100 labeled frames, in seconds, with no training and no change to the rest of the network.
Link to this sectionFine-tuning com os teus próprios dados#
Para adaptar um modelo de profundidade pré-treinado à tua própria câmera ou domínio, começa a partir dos pesos pré-treinados, usa AdamW e reduz a taxa de aprendizado (learning rate) bem abaixo do padrão de treinamento do zero, para que o fine-tuning refine o modelo em vez de sobrescrevê-lo:
from ultralytics import YOLO
from ultralytics import YOLO
model = YOLO("yolo26s-depth.pt") # start from pretrained weights
model.train(
data="path/to/your_dataset.yaml",
epochs=20,
imgsz=640,
optimizer="AdamW",
lr0=1e-4, # ~100x below the from-scratch default
warmup_bias_lr=1e-4, # keep warmup gentle too
)Como a cabeça logarítmica padrão é ilimitada, isto funciona nativamente quer o teu dataset seja de curto alcance ou de longo alcance, sem a necessidade de ajustar max_depth. Se apenas a escala absoluta estiver incorreta para a tua câmera específica, model.calibrate() ajusta uma correção leve e de forma fechada (closed-form) num pequeno split rotulado, em segundos, sem tocar nos pesos da rede.
Os datasets associam cada imagem RGB a um arquivo de profundidade .npy numa estrutura de pastas correspondente, e o Ultralytics inclui configurações nativas para NYU Depth V2, KITTI, Hypersim, SUN RGB-D e ARKitScenes, para que a maioria das equipes possa começar a validar imediatamente contra um benchmark padrão.
Para mais informações, confere o nosso guia de início rápido.
Link to this sectionCasos de uso principais para a estimativa de profundidade#
Como este novo recurso pode funcionar a partir de uma única câmera comum, a estimativa de profundidade monocular abre inúmeras oportunidades para produtos e indústrias que de outra forma não conseguiriam justificar o custo, o consumo de energia ou a sobrecarga de calibração de uma configuração estéreo ou LiDAR. Vamos então dar uma olhada em algumas indústrias e casos de uso principais que podem se beneficiar desse recurso:
- Robótica e navegação autônoma. Robôs móveis e drones podem estimar a distância de obstáculos e o espaço livre a partir de uma única câmera embarcada, apoiando o planejamento de caminhos em tempo real sem hardware de profundidade dedicado.
- Consciência industrial e logística. Verificação de folgas, detecção de espaço livre e contexto de prateleiras ou corredores a partir de uma única câmera fixa, em qualquer lugar onde adicionar um segundo sensor não seja prático.
- Monitoramento de segurança e conformidade. Zonas de segurança para empilhadeiras e armazéns, detecção de incidentes ferroviários, detecção de pessoas caídas e objetos esquecidos em CFTV existente: contexto de distância adicionado a feeds de câmeras que já estão instalados, juntamente com sensores certificados para segurança existentes, em vez de substituí-los.
- Inspeção de infraestrutura e ativos. Análise de folga de linhas aéreas, inspeção de ativos e corrosão baseada em drones e trabalhos de levantamento aéreo, onde a mesma família de modelos deve lidar tanto com detalhes de perto quanto com cenas de longo alcance.
- Assistência ao motorista e percepção automotiva. A saída de profundidade ilimitada de longo alcance significa que a mesma família de modelos que lida com uma cena interna de perto também se generaliza para cenas de direção de 80 m+.
- AR e conteúdo espacial. Posicionar objetos virtuais de forma crível em uma cena real, ou aplicar efeitos conscientes da profundidade, começa por saber a distância exata de cada pixel em relação à câmera.
Link to this sectionLevando a estimativa de profundidade para todas as implantações do YOLO26#
Com a estimativa de profundidade agora sendo uma tarefa nativa do YOLO26, as equipes podem aproveitar a distância por pixel de qualquer câmera RGB em todos os setores, usando o mesmo fluxo de trabalho de treino (train), validação (val), predição (predict) e exportação (export) que já conhecem da detecção, segmentação e pose, com menos uma dependência de terceiros para manter.
Portanto, enquanto dimensionas a tua implantação com a profundidade do Ultralytics YOLO26, vamos dar uma olhada em alguns pontos importantes a ter em mente:
- O Ultralytics YOLO Depth foi construído para câmeras RGB. Qualquer câmera padrão funciona, incluindo webcams, telefones, câmeras industriais ou drones. No entanto, outras modalidades como nuvens de pontos LiDAR, radar, sonar, bandas térmicas e multiespectrais, ou dados de malha (mesh) e IFC, ficam fora do formato de entrada do modelo.
- Distância métrica para decisões de percepção. A saída é uma distância real em metros, tornando-a ideal para navegação, folga e monitoramento. No entanto, para qualquer aplicação onde seja necessária uma tolerância certificada, o equipamento de metrologia dedicado continua a ser o instrumento correto.
- Inferência por imagem. A profundidade é executada em cada frame de forma independente, consistente com todas as outras tarefas do YOLO26, encaixando-se portanto em um pipeline existente por frame sem alterações. O raciocínio ao longo de uma sequência permanece na tua camada de aplicação.
- O Ultralytics YOLO26-Depth é mais forte em superfícies texturizadas e opacas. Vidro, espelhos, água parada, metal polido e céu aberto são inerentemente ambíguos para qualquer método de câmera única, por isso vale a pena validar em cenas representativas do teu ambiente.
Curioso sobre IA de visão? Explora as nossas opções de licenciamento para trazer visão computacional para os teus projetos. Visita o nosso repositório no GitHub para descobrir toda a gama de tarefas e integrações do Ultralytics, e confere a Ultralytics Platform para começares a construir os teus próprios fluxos de trabalho de IA de visão de ponta a ponta.






