YOLO Vision 2026:
Ultralytics YOLO

O Ultralytics YOLO26 agora suporta a estimativa de profundidade monocular

Descobre como a nova tarefa de estimativa de profundidade do Ultralytics YOLO26 prevê a profundidade por píxel, à escala métrica, a partir de uma única imagem RGB, sem necessidade de um sistema estéreo ou LiDAR.

NUNuvola Ladi6 min read
O Ultralytics YOLO26 agora suporta a estimativa de profundidade monocular

Até agora, adicionar profundidade a um pipeline YOLO significava montá-lo por conta própria. O padrão estabelecido era executar o YOLO para detecção e combiná-lo com um modelo de profundidade separado de outro projeto, como o MiDaS ou o Depth Anything. Isso significava uma segunda dependência, um segundo framework e dois conjuntos de formatos de entrada e saída para compatibilizar.

A estimativa de profundidade monocular é agora uma tarefa nativa do Ultralytics YOLO26. Uma única imagem RGB produz um valor de distância para cada pixel, usando o mesmo pacote, fluxo de trabalho e caminho de exportação da detecção, segmentação e pose.

O que é estimativa de profundidade?#

A estimativa de profundidade prevê um mapa de profundidade por pixel a partir de uma única imagem RGB, sem envolver uma segunda câmera ou um sensor adicional. Cada pixel de saída contém um valor de profundidade em metros, representando a distância estimada entre a câmera e esse ponto da superfície.

A saída é um mapa denso de valores float com forma (H, W), alinhado à entrada, em que cada pixel contém uma distância absoluta em metros: a distância da câmera, não uma ordenação relativa do que está mais perto ou mais longe.

A profundidade é uma tarefa independente, com seu próprio checkpoint, e sua saída é apenas o mapa de profundidade; ela não retorna caixas delimitadoras nem máscaras de segmentação. Portanto, combinar detecção com profundidade exige executar dois modelos e duas passagens forward. A diferença em relação à prática anterior é que agora ambos ficam dentro de um único pacote, compartilhando uma instalação, uma interface de treino e predição, um caminho de exportação e uma única versão para acompanhar, em vez de exigir que um segundo framework seja mantido paralelamente ao primeiro.

Essa saída por pixel é o que torna a profundidade útil para detecção de obstáculos e de espaço livre, verificação de folgas, compreensão do layout da cena e identificação do que está à frente de quê.

Frame 1077243491 Fig. 1. Estimativa de profundidade do Ultralytics YOLO26 para monitorização de segurança e conformidade.

O Ultralytics YOLO26 inclui cinco modelos de profundidade pré-treinados, de yolo26n-depth a yolo26x-depth, treinados numa ampla combinação de vários conjuntos de dados, abrangendo aproximadamente 2,19 milhões de imagens de ambientes internos e externos. No conjunto NYU Depth V2, eles variam de uma precisão δ1 de 0,882 no modelo nano a 0,933 no modelo extra-large, permitindo escolher o equilíbrio entre velocidade e precisão adequado ao seu destino de implementação.

Profundidade ilimitada por conceção#

A maioria dos modelos de profundidade limita as previsões a um alcance fixo, como 0–10 metros, o que funciona bem em cenas internas, mas falha em ambientes externos. Em vez disso, o Ultralytics prevê a profundidade numa escala logarítmica aberta, sem um limite rígido.

A diferença aparece nos testes. Um modelo limitado estabiliza quase imediatamente quando treinado com dados mistos de ambientes internos e externos e desmorona em conjuntos de dados de maior alcance, como o KITTI, onde os objetos podem estar a 80 metros de distância. A abordagem do Ultralytics YOLO26 não tem esse teto, por isso continua a melhorar com mais dados e mantém o desempenho desde alguns centímetros até algumas centenas de metros. No KITTI, δ1 chega a 0,942 num alcance de 80 m. Isso significa que uma única família de modelos lida igualmente bem com uma cena de mesa e uma cena de autoestrada.

Comparação entre a profundidade do Ultralytics YOLO26 e o Depth Anything V2#

Se hoje você executa o Depth Anything em conjunto com o YOLO, a diferença está na velocidade e no custo computacional associado. A profundidade do Ultralytics YOLO26 é até 20,3× mais rápida que o Depth Anything V2 Base e 7,7× mais rápida que o Depth Anything V2 Small, a partir de um modelo muito menor: menos de 10 milhões de parâmetros no modelo nano, contra aproximadamente 24 milhões no checkpoint menor do DA V2.

Screenshot 2026-07-29 at 15.02.18 Fig. 2. Benchmarks de velocidade da profundidade do Ultralytics YOLO26 em comparação com o Depth Anything V2.

Essa diferença é o objetivo do design. Os modelos do Depth Anything V2 são substancialmente maiores; o Ultralytics YOLO26-Depth foi criado para oferecer um forte desempenho em profundidade com um tamanho e uma velocidade que exigem menos computação por frame e permitem a implementação em hardware ao qual esses modelos não conseguem chegar. Os valores de precisão por modelo no NYU Depth V2 e no KITTI estão publicados na documentação, para que você possa compará-los com o requisito que realmente tem.

Onde é executado#

Essa diferença de tamanho é o que determina onde a profundidade pode realmente ser utilizada. A maioria das equipas que avalia profundidade não tem falta de ideias; tem falta de capacidade computacional. Drones de baixo consumo, robôs quadrúpedes, dispositivos vestíveis, dashcams, hardware para videoconferência e PCs industriais atingem um limite de energia e custo antes de atingirem um limite de precisão.

A profundidade inclui cinco modelos pré-treinados, permitindo escolher o tamanho adequado ao destino em vez do tamanho que vence um benchmark. Como a profundidade é uma tarefa nativa do Ultralytics YOLO26, ela usa o mesmo caminho de exportação da detecção, segmentação e pose, com os seguintes formatos: ONNX, TensorRT, CoreML, NCNN, LiteRT.

Começando a usar a profundidade do Ultralytics YOLO26#

O pacote Python do Ultralytics oferece uma interface única e unificada para treinar, validar e executar inferência em todas as tarefas do YOLO26, incluindo profundidade. Executar um modelo de profundidade pré-treinado requer um único comando:

from ultralytics import YOLO

from ultralytics import YOLO

# Load a model
model = YOLO("yolo26n-depth.pt")  # load an official model
model = YOLO("path/to/best.pt")  # load a custom model

# Predict with the model
results = model("https://ultralytics.com/images/bus.jpg")  # predict on an image

# Access the results
for result in results:
    depth_map = result.depth.data.cpu().numpy()  # torch.Tensor → NumPy float32, shape (H, W), meters

Ou pela CLI:

yolo depth predict model=yolo26n-depth.pt source='https://ultralytics.com/images/bus.jpg'  # predict with official model
yolo depth predict model=path/to/best.pt source='https://ultralytics.com/images/bus.jpg'   # predict with custom model

A distância absoluta depende da sua câmera e da sua cena. Se a forma do mapa de profundidade estiver correta, mas a escala estiver errada, model.calibrate() ajusta apenas duas variáveis na cabeça de profundidade do modelo — uma escala e um deslocamento — usando cerca de 100 frames anotados, em segundos, sem treino e sem alterar o restante da rede.

Ajuste fino com os seus próprios dados#

Para adaptar um modelo de profundidade pré-treinado à sua câmera ou domínio, comece pelos pesos pré-treinados, use AdamW e reduza a taxa de aprendizagem bem abaixo do valor padrão usado no treino do zero, para que o ajuste fino refine o modelo em vez de o substituir:

from ultralytics import YOLO

from ultralytics import YOLO
model = YOLO("yolo26s-depth.pt")  # start from pretrained weights
model.train(
    data="path/to/your_dataset.yaml",
    epochs=20,
    imgsz=640,
    optimizer="AdamW",
    lr0=1e-4,  # ~100x below the from-scratch default
    warmup_bias_lr=1e-4,  # keep warmup gentle too
)

Como a cabeça logarítmica padrão é ilimitada, isto funciona imediatamente tanto para conjuntos de dados de curto alcance como de longo alcance, sem precisar de ajuste de max_depth. Se apenas a escala absoluta estiver errada para a sua câmera específica, model.calibrate() ajusta uma correção leve e de forma fechada num pequeno subconjunto anotado, em segundos, sem tocar nos pesos da rede.

Os conjuntos de dados associam cada imagem RGB a um ficheiro de profundidade .npy numa estrutura de pastas correspondente, e o Ultralytics inclui configurações integradas para NYU Depth V2, KITTI, Hypersim, SUN RGB-D e ARKitScenes, para que a maioria das equipas possa começar imediatamente a validar com base num benchmark padrão.

Principais casos de utilização da estimativa de profundidade#

Como esta nova funcionalidade pode funcionar a partir de uma única câmera comum, a estimativa de profundidade monocular abre inúmeras oportunidades para produtos e setores que, de outra forma, não poderiam justificar o custo, o consumo de energia ou a sobrecarga de calibração de uma configuração estéreo ou LiDAR. Então, veja alguns setores e casos de utilização importantes que podem beneficiar desta funcionalidade:

  • Robótica e navegação autónoma. Robôs móveis e drones podem estimar a distância até aos obstáculos e o espaço livre a partir de uma única câmera integrada, apoiando o planeamento de rotas em tempo real sem hardware de profundidade dedicado.
  • Perceção industrial e logística. Verificação de folgas, deteção de espaço livre e compreensão de prateleiras ou corredores a partir de uma única câmera fixa, em qualquer situação em que adicionar um segundo sensor não seja prático.
  • Monitorização de segurança e conformidade. Zonas de segurança para empilhadores e armazéns, deteção de incidentes ferroviários, deteção de pessoas caídas e de objetos deixados para trás em sistemas CCTV existentes: contexto de distância acrescentado a feeds de câmeras já instaladas, juntamente com sensores existentes certificados para segurança, e não em substituição deles.
  • Inspeção de infraestruturas e ativos. Análise de folgas em linhas aéreas, inspeção de ativos e corrosão com drones e levantamentos aéreos, em que a mesma família de modelos precisa de lidar tanto com detalhes em grande plano como com cenas de longo alcance.
  • Assistência ao condutor e perceção automóvel. Uma saída de profundidade ilimitada e de longo alcance significa que a mesma família de modelos que lida com uma cena interna em grande plano também generaliza para cenas de condução a mais de 80 m.
  • AR e conteúdo espacial. Colocar objetos virtuais de forma convincente numa cena real ou aplicar efeitos sensíveis à profundidade começa por saber a que distância cada pixel realmente está da câmera.

Levando a estimativa de profundidade a todas as implementações do Ultralytics YOLO26#

Com a estimativa de profundidade agora como tarefa nativa do Ultralytics YOLO26, as equipas podem utilizar a distância por pixel de qualquer câmera RGB em vários setores, usando o mesmo fluxo de treino, validação, predição e exportação que já conhecem da detecção, segmentação e pose, além de terem uma dependência de terceiros a menos para manter.

Por isso, ao definir a sua implementação com a profundidade do Ultralytics YOLO26, veja alguns pontos importantes a ter em mente:

  • O Ultralytics YOLO Depth foi criado para câmeras RGB. Qualquer câmera padrão funciona, incluindo webcams, telefones, câmeras industriais ou drones. No entanto, outras modalidades, como nuvens de pontos LiDAR, radar, sonar, bandas térmicas e multiespectrais ou dados de malha e IFC, estão fora do formato de entrada do modelo.
  • Distância métrica para decisões de perceção. A saída é uma distância real em metros, o que a torna adequada para navegação, verificação de folgas e monitorização. No entanto, para qualquer aplicação que exija uma tolerância certificada, o equipamento de metrologia dedicado continua a ser o instrumento adequado.
  • Inferência por imagem. A profundidade é executada independentemente em cada frame, de forma consistente com todas as outras tarefas do Ultralytics YOLO26, podendo assim ser integrada num pipeline existente por frame sem alterações. O raciocínio ao longo de uma sequência continua na camada da sua aplicação.
  • O Ultralytics YOLO26-Depth apresenta o melhor desempenho em superfícies texturizadas e opacas. Vidro, espelhos, água parada, metal polido e céu aberto são inerentemente ambíguos para qualquer método baseado numa única câmera, por isso vale a pena validar o modelo em cenas representativas do seu ambiente.

Tem curiosidade sobre IA para visão? Explore as nossas opções de licenciamento para levar a visão computacional aos seus projetos. Visite o nosso repositório no GitHub para descobrir toda a gama de tarefas e integrações do Ultralytics e consulte a Ultralytics Platform para começar a criar os seus próprios fluxos de trabalho de IA para visão de ponta a ponta.

Explore solutions

Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais
Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais
Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais

Vamos construir juntos o futuro da IA!

Começa a tua jornada com o futuro da aprendizagem automática