Ultralytics YOLO26 ahora admite la estimación de profundidad monocular
Aprende cómo la nueva tarea de estimación de profundidad en Ultralytics YOLO26 predice la profundidad a escala métrica por píxel a partir de una única imagen RGB, sin necesidad de un equipo estéreo ni LiDAR.

Hasta ahora, añadir profundidad a un flujo de trabajo de YOLO significaba montarlo tú mismo. El patrón establecido consistía en ejecutar YOLO para la detección y combinarlo con un modelo de profundidad independiente de otro proyecto, como MiDaS o Depth Anything. Eso implicaba una segunda dependencia, un segundo marco de trabajo y dos conjuntos de formatos de entrada y salida que debían conciliarse.
La estimación de profundidad monocular es ahora una tarea nativa en Ultralytics YOLO26. Una sola imagen RGB produce un valor de distancia para cada píxel, utilizando el mismo paquete, flujo de trabajo y ruta de exportación que la detección, la segmentación y la estimación de poses.
Link to this section¿Qué es la estimación de profundidad?#
La estimación de profundidad predice un mapa de profundidad por píxel a partir de una única imagen RGB, sin necesidad de una segunda cámara ni de sensores adicionales. Cada píxel de salida contiene un valor de profundidad en metros, que representa la distancia estimada desde la cámara hasta ese punto de la superficie.
La salida es un mapa denso de valores de tipo flotante con la forma (H, W), alineado con la entrada, donde cada píxel transporta una distancia absoluta en metros; una distancia desde la cámara, no un orden relativo de lo que está más cerca o más lejos.
La profundidad es una tarea independiente con su propio punto de control (checkpoint), y su salida es exclusivamente el mapa de profundidad; no devuelve cuadros delimitadores (bounding boxes) ni máscaras de segmentación. Por lo tanto, combinar la detección con la profundidad requiere ejecutar dos modelos y dos pasadas de inferencia (forward passes). Lo que difiere de la práctica anterior es que ahora ambos se encuentran dentro de un único paquete, compartiendo una sola instalación, una única interfaz de entrenamiento y predicción, una ruta de exportación común y una sola versión a seguir, en lugar de requerir el mantenimiento de un segundo marco de trabajo junto al primero.
Esa salida por píxel es lo que hace que la profundidad sea útil para la detección de obstáculos y espacio libre, la comprobación de gálibo o clearance, la disposición de la escena y la comprensión de qué hay delante de qué.
Fig 1. Estimación de profundidad de Ultralytics YOLO26 para la supervisión de seguridad y conformidad.
Ultralytics YOLO26 incluye cinco modelos de profundidad preentrenados, desde yolo26n-depth hasta yolo26x-depth, entrenados con una amplia combinación de múltiples conjuntos de datos que abarca aproximadamente 2.19 millones de imágenes de interiores y exteriores. En el conjunto NYU Depth V2, varían desde una precisión δ1 de 0.882 en el modelo nano hasta 0.933 en el modelo extra grande, para que puedas elegir el equilibrio entre velocidad y precisión que mejor se adapte a tu objetivo de despliegue.
Link to this sectionProfundidad ilimitada por diseño#
La mayoría de los modelos de profundidad limitan sus predicciones a un rango fijo, como de 0 a 10 metros, lo cual funciona bien para escenas de interiores, pero falla en exteriores. En su lugar, Ultralytics predice la profundidad en una escala logarítmica abierta, sin un límite rígido.
La diferencia se nota en las pruebas. Un modelo limitado se estanca casi de inmediato cuando se entrena con datos mixtos de interiores y exteriores, y fracasa en conjuntos de datos de mayor alcance como KITTI, donde los objetos pueden estar a 80 metros de distancia. El enfoque de YOLO26 no tiene ese límite, por lo que sigue mejorando con más datos y se mantiene fiable desde unos pocos centímetros hasta unos cientos de metros. En KITTI, el valor δ1 alcanza 0.942 a una distancia de 80 m. Esto significa que una misma familia de modelos gestiona igual de bien una escena sobre una mesa y una escena en una autopista.
Link to this sectionComparativa entre la profundidad de Ultralytics YOLO26 y Depth Anything V2#
Si actualmente utilizas Depth Anything junto con YOLO, la diferencia radica en la velocidad y en el coste de cómputo que conlleva. La profundidad de YOLO26 se ejecuta hasta 20.3 veces más rápido que Depth Anything V2 Base y 7.7 veces más rápido que Depth Anything V2 Small, a partir de un modelo mucho más pequeño, con menos de 10M de parámetros en su versión nano, frente a los aproximadamente 24M del punto de control más pequeño de DA V2.
Fig 2. Pruebas comparativas de velocidad (benchmarks) de la profundidad de Ultralytics YOLO26 frente a Depth Anything V2.
Esa brecha es el propósito del diseño. Los modelos de Depth Anything V2 son sustancialmente más grandes; YOLO26-Depth está diseñado para ofrecer un alto rendimiento de profundidad con un tamaño y una velocidad que consumen menos recursos de cómputo por fotograma y se pueden desplegar en hardware al que esos modelos no pueden llegar. Las cifras de precisión por modelo en NYU Depth V2 y KITTI están publicadas en la documentación, por lo que puedes comprobarlas en función de los requisitos reales que tengas.
Link to this sectionDónde se ejecuta#
Esa diferencia de tamaño es lo que determina dónde se puede aplicar realmente la profundidad. La mayoría de los equipos que evalúan la profundidad no carecen de ideas, sino de potencia de cálculo. Los drones de baja potencia, los robots cuadrúpedos, los dispositivos wearables, las cámaras de salpicadero (dashcams), el hardware de videoconferencia y los ordenadores industriales alcanzan un límite de consumo energético y coste antes de alcanzar un límite de precisión.
La profundidad se distribuye en cinco modelos preentrenados, para que puedas elegir el tamaño que se adapte al objetivo en lugar del tamaño que gane en una prueba comparativa (benchmark). Debido a que la profundidad es una tarea nativa de YOLO26, utiliza la misma ruta de exportación que la detección, la segmentación y la estimación de poses con los siguientes formatos: ONNX, TensorRT, CoreML, NCNN, LiteRT.
Link to this sectionPrimeros pasos con la profundidad de Ultralytics YOLO26#
El paquete de Python de Ultralytics proporciona una interfaz única y unificada para entrenar, validar y ejecutar inferencias en todas las tareas de YOLO26, incluida la profundidad. Ejecutar un modelo de profundidad preentrenado requiere un solo comando:
from ultralytics import YOLO
from ultralytics import YOLO
# Load a model
model = YOLO("yolo26n-depth.pt") # load an official model
model = YOLO("path/to/best.pt") # load a custom model
# Predict with the model
results = model("https://ultralytics.com/images/bus.jpg") # predict on an image
# Access the results
for result in results:
depth_map = result.depth.data.cpu().numpy() # torch.Tensor → NumPy float32, shape (H, W), metersO desde la interfaz de línea de comandos (CLI):
yolo depth predict model=yolo26n-depth.pt source='https://ultralytics.com/images/bus.jpg' # predict with official model
yolo depth predict model=path/to/best.pt source='https://ultralytics.com/images/bus.jpg' # predict with custom modelLa distancia absoluta depende de tu cámara y de tu escena. Si la forma del mapa de profundidad es correcta pero la escala no es la adecuada, model.calibrate() ajusta solo dos variables en la cabecera de profundidad del modelo (una escala y un desplazamiento) utilizando unos 100 fotogramas etiquetados, en cuestión de segundos, sin necesidad de entrenamiento y sin modificar el resto de la red.
Link to this sectionAjuste fino (fine-tuning) con tus propios datos#
Para adaptar un modelo de profundidad preentrenado a tu propia cámara o dominio, parte de los pesos preentrenados, utiliza AdamW y reduce la tasa de aprendizaje (learning rate) muy por debajo del valor predeterminado de entrenamiento desde cero, de modo que el ajuste fino refine el modelo en lugar de sobrescribirlo:
from ultralytics import YOLO
from ultralytics import YOLO
model = YOLO("yolo26s-depth.pt") # start from pretrained weights
model.train(
data="path/to/your_dataset.yaml",
epochs=20,
imgsz=640,
optimizer="AdamW",
lr0=1e-4, # ~100x below the from-scratch default
warmup_bias_lr=1e-4, # keep warmup gentle too
)Dado que la cabecera logarítmica predeterminada no tiene límites, esto funciona de forma inmediata, tanto si tu conjunto de datos es de corto alcance como de largo alcance, sin necesidad de ajustar max_depth. Si solo falla la escala absoluta para tu cámara específica, model.calibrate() ajusta una corrección ligera y de forma cerrada (closed-form) en una pequeña división de datos etiquetados, en cuestión de segundos, sin tocar los pesos de la red.
Los conjuntos de datos vinculan cada imagen RGB con un archivo de profundidad .npy en una estructura de carpetas coincidente, y Ultralytics incluye configuraciones integradas para NYU Depth V2, KITTI, Hypersim, SUN RGB-D y ARKitScenes, por lo que la mayoría de los equipos pueden empezar a validar frente a un estándar de referencia de inmediato.
Para obtener más información, echa un vistazo a nuestra guía de inicio rápido.
Link to this sectionCasos de uso clave para la estimación de profundidad#
Dado que esta nueva función puede funcionar con una sola cámara corriente, la estimación de profundidad monocular abre innumerables oportunidades para productos e industrias que de otro modo no podrían justificar el coste, el consumo de energía o la complejidad de calibración de una configuración estéreo o con LiDAR. Echemos un vistazo a algunas industrias y casos de uso clave que pueden beneficiarse de esta función:
- Robótica y navegación autónoma. Los robots móviles y los drones pueden estimar la distancia a los obstáculos y el espacio libre a partir de una única cámara integrada, lo que facilita la planificación de rutas en tiempo real sin necesidad de hardware de profundidad dedicado.
- Conciencia industrial y logística. Comprobación de gálibo (clearance), detección de espacio libre y contexto de estanterías o pasillos a partir de una única cámara fija, en cualquier lugar donde añadir un segundo sensor no sea práctico.
- Supervisión de seguridad y conformidad. Zonas de seguridad para carretillas elevadoras y almacenes, detección de incidentes ferroviarios, detección de personas caídas y objetos abandonados en circuitos cerrados de televisión (CCTV) existentes: contexto de distancia añadido a fuentes de vídeo de cámaras ya instaladas, complementando a los sensores certificados de seguridad existentes en lugar de sustituirlos.
- Inspección de infraestructuras y activos. Análisis de gálibo de líneas aéreas, inspección de activos y corrosión mediante drones, y trabajos de levantamiento aéreo, donde la misma familia de modelos debe gestionar tanto los detalles de cerca como las escenas de largo alcance.
- Asistencia al conductor y percepción en automoción. Una salida de profundidad ilimitada y de largo alcance significa que la misma familia de modelos que gestiona una escena de interior cercana también se generaliza a escenas de conducción a más de 80 m.
- Realidad aumentada (AR) y contenido espacial. Colocar objetos virtuales de forma creíble en una escena real, o aplicar efectos conscientes de la profundidad, comienza por saber a qué distancia real se encuentra cada píxel de la cámara.
Link to this sectionLlevando la estimación de profundidad a cada despliegue de YOLO26#
With depth estimation now a native YOLO26 task, teams can leverage per-pixel distance from any RGB camera across industries, using the same train, val, predict, and export workflow they already know from detection, segmentation, and pose, and one less third-party dependency to maintain.
Por lo tanto, mientras planificas tu despliegue con la profundidad de Ultralytics YOLO26, echemos un vistazo a algunos puntos clave que debes tener en cuenta:
- Ultralytics YOLO Depth está diseñado para cámaras RGB. Cualquier cámara estándar funciona, incluidas webcams, teléfonos, cámaras industriales o drones. Sin embargo, otras modalidades como nubes de puntos LiDAR, radar, sónar, bandas térmicas y multiespectrales, o datos de mallas e IFC quedan fuera del formato de entrada del modelo.
- Distancia métrica para decisiones de percepción. La salida es una distancia real en metros, lo que la hace muy adecuada para la navegación, la comprobación de gálibo y la supervisión. Sin embargo, para cualquier aplicación en la que se requiera una tolerancia certificada, el equipo de metrología especializado sigue siendo el instrumento adecuado.
- Inferencia por imagen. La profundidad se ejecuta en cada fotograma de forma independiente, de manera coherente con cualquier otra tarea de YOLO26, integrándose por tanto en un flujo de trabajo existente por fotograma sin modificaciones. El razonamiento a lo largo de una secuencia se mantiene en la capa de tu aplicación.
- Ultralytics YOLO26-Depth ofrece su máximo rendimiento en superficies texturizadas y opacas. El vidrio, los espejos, el agua estancada, el metal pulido y el cielo abierto son intrínsecamente ambiguos para cualquier método de una sola cámara, por lo que vale la pena validarlo en escenas representativas de tu entorno.
¿Tienes curiosidad por la IA de visión? Explora nuestras opciones de licencia para llevar la visión artificial a tus proyectos. Visita nuestro repositorio de GitHub para descubrir toda la gama de tareas e integraciones de Ultralytics, y consulta Ultralytics Platform para empezar a construir tus propios flujos de trabajo de IA de visión de extremo a extremo.






