YOLO Vision 2026:
Ultralytics YOLO

Ultralytics YOLO26 ahora admite la estimación monocular de profundidad

Descubre cómo la nueva tarea de estimación de profundidad de Ultralytics YOLO26 predice la profundidad por píxel a escala métrica a partir de una única imagen RGB, sin necesidad de un sistema estéreo ni LiDAR.

NUNuvola Ladi6 min read
Ultralytics YOLO26 ahora admite la estimación monocular de profundidad

Hasta ahora, añadir profundidad a una canalización de YOLO implicaba montarla por tu cuenta. El patrón establecido consistía en ejecutar YOLO para la detección y combinarlo con un modelo de profundidad independiente de otro proyecto, como MiDaS o Depth Anything. Esto suponía una segunda dependencia, un segundo framework y dos conjuntos de formatos de entrada y salida que había que compatibilizar.

La estimación de profundidad monocular ya es una tarea nativa de Ultralytics YOLO26. Una sola imagen RGB produce un valor de distancia para cada píxel, utilizando el mismo paquete, flujo de trabajo y ruta de exportación que la detección, la segmentación y la pose.

¿Qué es la estimación de profundidad?#

La estimación de profundidad predice un mapa de profundidad por píxel a partir de una sola imagen RGB, sin necesidad de una segunda cámara ni de sensores adicionales. Cada píxel de salida contiene un valor de profundidad en metros que representa la distancia estimada desde la cámara hasta ese punto de la superficie.

La salida es un mapa denso de valores de tipo float con forma (H, W), alineado con la entrada, donde cada píxel contiene una distancia absoluta en metros: una distancia desde la cámara, no un orden relativo de qué está más cerca o más lejos.

La profundidad es una tarea independiente con su propio checkpoint y su salida es únicamente el mapa de profundidad; no devuelve cuadros delimitadores ni máscaras de segmentación. Por tanto, combinar detección y profundidad requiere ejecutar dos modelos y dos pasadas hacia delante. Lo que cambia respecto a la práctica anterior es que ahora ambas tareas se encuentran dentro de un único paquete, comparten una instalación, una interfaz de entrenamiento y predicción, una ruta de exportación y una única versión que supervisar, en lugar de tener que mantener un segundo framework junto al primero.

Esta salida por píxel es lo que hace que la profundidad resulte útil para detectar obstáculos y espacio libre, comprobar holguras, analizar la distribución de la escena y comprender qué elementos están delante de otros.

Frame 1077243491 Fig. 1. Estimación de profundidad de Ultralytics YOLO26 para la supervisión de seguridad y cumplimiento normativo.

Ultralytics YOLO26 incluye cinco modelos de profundidad preentrenados, desde yolo26n-depth hasta yolo26x-depth, entrenados con una amplia combinación de varios conjuntos de datos que abarca aproximadamente 2,19 millones de imágenes de interiores y exteriores. En el conjunto NYU Depth V2, sus valores van desde una precisión δ1 de 0,882 en el modelo nano hasta 0,933 en el modelo extra-large, para que puedas elegir el equilibrio entre velocidad y precisión que mejor se ajuste a tu objetivo de despliegue.

Profundidad ilimitada por diseño#

La mayoría de los modelos de profundidad limitan sus predicciones a un rango fijo, como 0–10 metros, lo que funciona bien en escenas de interior, pero falla en exteriores. En su lugar, Ultralytics predice la profundidad en una escala logarítmica abierta, sin un límite estricto.

La diferencia se aprecia en las pruebas. Un modelo limitado alcanza una meseta casi de inmediato cuando se entrena con datos mixtos de interior y exterior, y se viene abajo con conjuntos de datos de mayor alcance como KITTI, donde los objetos pueden estar a 80 metros. El enfoque de Ultralytics YOLO26 no tiene ese techo, por lo que sigue mejorando con más datos y mantiene el rendimiento desde unos pocos centímetros hasta varios cientos de metros. En KITTI, δ1 alcanza 0,942 a un alcance de 80 m. Esto significa que una misma familia de modelos gestiona igual de bien una escena de sobremesa y una escena de autopista.

Comparación entre la profundidad de Ultralytics YOLO26 y Depth Anything V2#

Si actualmente ejecutas Depth Anything junto con YOLO, la diferencia está en la velocidad y en el coste computacional asociado. La profundidad de Ultralytics YOLO26 funciona hasta 20,3 veces más rápido que Depth Anything V2 Base y 7,7 veces más rápido que Depth Anything V2 Small, con un modelo mucho más pequeño: menos de 10 M de parámetros en nano, frente a aproximadamente 24 M en el checkpoint más pequeño de DA V2.

Screenshot 2026-07-29 at 15.02.18 Fig. 2. Comparativa de velocidad de la profundidad de Ultralytics YOLO26 frente a Depth Anything V2.

Esa diferencia es precisamente el objetivo del diseño. Los modelos de Depth Anything V2 son bastante más grandes; Ultralytics YOLO26-Depth está diseñado para ofrecer un sólido rendimiento de profundidad con un tamaño y una velocidad que reducen el coste computacional por fotograma y permiten desplegarlo en hardware al que esos modelos no pueden llegar. Las cifras de precisión por modelo en NYU Depth V2 y KITTI están publicadas en la documentación, para que puedas compararlas con el requisito que realmente tienes.

Dónde se ejecuta#

Esa diferencia de tamaño es lo que determina dónde se puede utilizar realmente la profundidad. A la mayoría de los equipos que evalúan la profundidad no les faltan ideas, sino capacidad de cómputo. Los drones de bajo consumo, los robots cuadrúpedos, los dispositivos ponibles, las cámaras de salpicadero, el hardware para videoconferencias y los PC industriales alcanzan antes un límite de potencia y coste que un límite de precisión.

La profundidad incluye cinco modelos preentrenados, para que puedas elegir el tamaño que se ajuste al objetivo en lugar del tamaño que gane una comparativa. Como la profundidad es una tarea nativa de Ultralytics YOLO26, utiliza la misma ruta de exportación que la detección, la segmentación y la pose con los siguientes formatos: ONNX, TensorRT, CoreML, NCNN, LiteRT.

Primeros pasos con la profundidad de Ultralytics YOLO26#

El paquete de Python de Ultralytics proporciona una interfaz única y unificada para entrenar, validar y ejecutar inferencias en todas las tareas de YOLO26, incluida la profundidad. Ejecutar un modelo de profundidad preentrenado requiere un único comando:

from ultralytics import YOLO

from ultralytics import YOLO

# Load a model
model = YOLO("yolo26n-depth.pt")  # load an official model
model = YOLO("path/to/best.pt")  # load a custom model

# Predict with the model
results = model("https://ultralytics.com/images/bus.jpg")  # predict on an image

# Access the results
for result in results:
    depth_map = result.depth.data.cpu().numpy()  # torch.Tensor → NumPy float32, shape (H, W), meters

O desde la CLI:

yolo depth predict model=yolo26n-depth.pt source='https://ultralytics.com/images/bus.jpg'  # predict with official model
yolo depth predict model=path/to/best.pt source='https://ultralytics.com/images/bus.jpg'   # predict with custom model

La distancia absoluta depende de tu cámara y de tu escena. Si la forma del mapa de profundidad es correcta, pero la escala no lo es, model.calibrate() ajusta solo dos variables del cabezal de profundidad del modelo —una escala y un desplazamiento— utilizando unos 100 fotogramas etiquetados, en cuestión de segundos, sin entrenamiento y sin modificar el resto de la red.

Ajuste fino con tus propios datos#

Para adaptar un modelo de profundidad preentrenado a tu propia cámara o dominio, parte de los pesos preentrenados, utiliza AdamW y reduce la tasa de aprendizaje muy por debajo del valor predeterminado desde cero para que el ajuste fino refine el modelo en lugar de sobrescribirlo:

from ultralytics import YOLO

from ultralytics import YOLO
model = YOLO("yolo26s-depth.pt")  # start from pretrained weights
model.train(
    data="path/to/your_dataset.yaml",
    epochs=20,
    imgsz=640,
    optimizer="AdamW",
    lr0=1e-4,  # ~100x below the from-scratch default
    warmup_bias_lr=1e-4,  # keep warmup gentle too
)

Como el cabezal logarítmico predeterminado no tiene límites, esto funciona directamente tanto si tu conjunto de datos es de corto alcance como de largo alcance, sin necesidad de ajustar max_depth. Si solo falla la escala absoluta para tu cámara concreta, model.calibrate() ajusta una corrección ligera de forma cerrada en una pequeña partición etiquetada, en cuestión de segundos y sin modificar los pesos de la red.

Los conjuntos de datos asocian cada imagen RGB con un archivo de profundidad .npy en una estructura de carpetas equivalente, y Ultralytics incluye configuraciones integradas para NYU Depth V2, KITTI, Hypersim, SUN RGB-D y ARKitScenes, de modo que la mayoría de los equipos pueden empezar a validar inmediatamente con una comparativa estándar.

Principales casos de uso de la estimación de profundidad#

Como esta nueva funcionalidad puede funcionar con una sola cámara convencional, la estimación de profundidad monocular abre innumerables oportunidades para productos e industrias que, de otro modo, no podrían justificar el coste, el consumo energético o la sobrecarga de calibración de una configuración estéreo o LiDAR. Veamos algunos sectores y casos de uso clave que pueden beneficiarse de esta funcionalidad:

  • Robótica y navegación autónoma. Los robots móviles y los drones pueden estimar la distancia a los obstáculos y el espacio libre con una sola cámara integrada, lo que permite planificar rutas en tiempo real sin hardware de profundidad específico.
  • Supervisión industrial y logística. Comprobación de holguras, detección de espacio libre y contexto de estanterías o pasillos desde una sola cámara fija, allí donde no resulte práctico añadir un segundo sensor.
  • Supervisión de seguridad y cumplimiento normativo. Zonas de seguridad para carretillas elevadoras y almacenes, detección de incidentes ferroviarios y detección de personas caídas y objetos olvidados en sistemas CCTV existentes: contexto de distancia añadido a canales de cámara ya instalados, junto con sensores existentes certificados para seguridad, no en sustitución de estos.
  • Inspección de infraestructuras y activos. Análisis de la distancia de seguridad de líneas aéreas, inspección de activos y corrosión mediante drones y trabajos de levantamiento aéreo, donde la misma familia de modelos debe gestionar tanto los detalles a corta distancia como las escenas de largo alcance.
  • Asistencia al conductor y percepción automovilística. La salida de profundidad de largo alcance y sin límites permite que la misma familia de modelos que gestiona una escena interior de cerca también se generalice a escenas de conducción a más de 80 m.
  • RA y contenido espacial. Colocar objetos virtuales de forma creíble en una escena real o aplicar efectos conscientes de la profundidad empieza por saber a qué distancia se encuentra realmente cada píxel de la cámara.

Lleva la estimación de profundidad a todos los despliegues de Ultralytics YOLO26#

Ahora que la estimación de profundidad es una tarea nativa de Ultralytics YOLO26, los equipos pueden aprovechar la distancia por píxel de cualquier cámara RGB en distintos sectores, utilizando el mismo flujo de entrenamiento, validación, predicción y exportación que ya conocen de la detección, la segmentación y la pose, y manteniendo una dependencia de terceros menos.

Así que, mientras defines tu despliegue con la profundidad de Ultralytics YOLO26, veamos algunos puntos clave que debes tener en cuenta:

  • Ultralytics YOLO Depth está diseñado para cámaras RGB. Cualquier cámara estándar sirve, incluidas webcams, teléfonos, cámaras industriales o drones. Sin embargo, otras modalidades, como nubes de puntos LiDAR, radar, sonar, bandas térmicas y multiespectrales o datos de mallas e IFC, quedan fuera del formato de entrada del modelo.
  • Distancia métrica para decisiones de percepción. La salida es una distancia real en metros, por lo que resulta adecuada para navegación, comprobación de holguras y supervisión. Sin embargo, para cualquier aplicación que requiera una tolerancia certificada, el equipo de metrología específico sigue siendo el instrumento adecuado.
  • Inferencia por imagen. La profundidad se ejecuta de forma independiente en cada fotograma, de manera coherente con cualquier otra tarea de Ultralytics YOLO26, por lo que se integra en una canalización existente por fotograma sin cambios. El razonamiento a través de una secuencia permanece en la capa de aplicación.
  • Ultralytics YOLO26-Depth ofrece mejores resultados en superficies con textura y opacas. El vidrio, los espejos, el agua estancada, el metal pulido y el cielo abierto son intrínsecamente ambiguos para cualquier método basado en una sola cámara, por lo que conviene validarlo con escenas representativas de tu entorno.

¿Te interesa la IA de visión? Explora nuestras opciones de licencia para incorporar la visión artificial a tus proyectos. Visita nuestro repositorio de GitHub para descubrir todas las tareas e integraciones de Ultralytics y consulta Ultralytics Platform para empezar a crear tus propios flujos de trabajo de IA de visión de extremo a extremo.

Explore solutions

Visión por computadora para imágenes aéreas

Visión por computadora para imágenes aéreas

Transforma imágenes de drones y aéreas en información en tiempo real para agricultura, acuicultura, supervisión ambiental, conservación y análisis geoespacial con Ultralytics YOLO.
Más información
Visión artificial en la industria aeroespacial

Visión artificial en la industria aeroespacial

Lleva la IA de visión al monitoreo aéreo con los modelos Ultralytics YOLO. Potencia drones, flujos de trabajo aeroespaciales, conservación ambiental e industrias geoespaciales con soluciones de visión artificial.
Más información

Protege cada sitio con los modelos Ultralytics YOLO. La IA de visión potencia el monitoreo perimetral, la detección de amenazas, el reconocimiento de matrículas y la seguridad laboral.
Más información
Visión artificial en robótica

Visión artificial en robótica

Impulsa máquinas más inteligentes con los modelos de Ultralytics YOLO. La IA de visión en robótica permite la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Visión artificial en logística

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La IA de visión permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad de los almacenes en tiempo real.
Más información
Visión artificial en comercio minorista

Visión artificial en comercio minorista

Reinventa el comercio minorista con los modelos de Ultralytics YOLO. La IA de visión impulsa el seguimiento del inventario, la supervisión de estanterías, la gestión de colas y un conocimiento más inteligente de los clientes.
Más información
Visión por computador en el sector sanitario

Visión por computador en el sector sanitario

Crea soluciones sanitarias con modelos de Ultralytics YOLO. La IA de visión en el sector sanitario permite obtener imágenes médicas más rápidamente, diagnósticos más inteligentes y supervisar a los pacientes.
Más información
Visión por computador en la fabricación

Visión por computador en la fabricación

Optimiza la fabricación con modelos de Ultralytics YOLO. La IA de visión impulsa el control de calidad, la detección de defectos, el cumplimiento del PPE y la automatización de las líneas de montaje.
Más información
Visión artificial en el sector automovilístico

Visión artificial en el sector automovilístico

Aplica visión artificial en el sector automovilístico con modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para conseguir carreteras más inteligentes.
Más información
Visión artificial en agricultura

Visión artificial en agricultura

Lleva la IA de visión a la agricultura inteligente con modelos de Ultralytics YOLO. Impulsa la supervisión de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas mayores e inteligentes.
Más información
Visión por computadora para imágenes aéreas

Visión por computadora para imágenes aéreas

Transforma imágenes de drones y aéreas en información en tiempo real para agricultura, acuicultura, supervisión ambiental, conservación y análisis geoespacial con Ultralytics YOLO.
Más información
Visión artificial en la industria aeroespacial

Visión artificial en la industria aeroespacial

Lleva la IA de visión al monitoreo aéreo con los modelos Ultralytics YOLO. Potencia drones, flujos de trabajo aeroespaciales, conservación ambiental e industrias geoespaciales con soluciones de visión artificial.
Más información

Protege cada sitio con los modelos Ultralytics YOLO. La IA de visión potencia el monitoreo perimetral, la detección de amenazas, el reconocimiento de matrículas y la seguridad laboral.
Más información
Visión artificial en robótica

Visión artificial en robótica

Impulsa máquinas más inteligentes con los modelos de Ultralytics YOLO. La IA de visión en robótica permite la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Visión artificial en logística

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La IA de visión permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad de los almacenes en tiempo real.
Más información
Visión artificial en comercio minorista

Visión artificial en comercio minorista

Reinventa el comercio minorista con los modelos de Ultralytics YOLO. La IA de visión impulsa el seguimiento del inventario, la supervisión de estanterías, la gestión de colas y un conocimiento más inteligente de los clientes.
Más información
Visión por computador en el sector sanitario

Visión por computador en el sector sanitario

Crea soluciones sanitarias con modelos de Ultralytics YOLO. La IA de visión en el sector sanitario permite obtener imágenes médicas más rápidamente, diagnósticos más inteligentes y supervisar a los pacientes.
Más información
Visión por computador en la fabricación

Visión por computador en la fabricación

Optimiza la fabricación con modelos de Ultralytics YOLO. La IA de visión impulsa el control de calidad, la detección de defectos, el cumplimiento del PPE y la automatización de las líneas de montaje.
Más información
Visión artificial en el sector automovilístico

Visión artificial en el sector automovilístico

Aplica visión artificial en el sector automovilístico con modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para conseguir carreteras más inteligentes.
Más información
Visión artificial en agricultura

Visión artificial en agricultura

Lleva la IA de visión a la agricultura inteligente con modelos de Ultralytics YOLO. Impulsa la supervisión de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas mayores e inteligentes.
Más información
Visión por computadora para imágenes aéreas

Visión por computadora para imágenes aéreas

Transforma imágenes de drones y aéreas en información en tiempo real para agricultura, acuicultura, supervisión ambiental, conservación y análisis geoespacial con Ultralytics YOLO.
Más información
Visión artificial en la industria aeroespacial

Visión artificial en la industria aeroespacial

Lleva la IA de visión al monitoreo aéreo con los modelos Ultralytics YOLO. Potencia drones, flujos de trabajo aeroespaciales, conservación ambiental e industrias geoespaciales con soluciones de visión artificial.
Más información

Protege cada sitio con los modelos Ultralytics YOLO. La IA de visión potencia el monitoreo perimetral, la detección de amenazas, el reconocimiento de matrículas y la seguridad laboral.
Más información
Visión artificial en robótica

Visión artificial en robótica

Impulsa máquinas más inteligentes con los modelos de Ultralytics YOLO. La IA de visión en robótica permite la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Visión artificial en logística

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La IA de visión permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad de los almacenes en tiempo real.
Más información
Visión artificial en comercio minorista

Visión artificial en comercio minorista

Reinventa el comercio minorista con los modelos de Ultralytics YOLO. La IA de visión impulsa el seguimiento del inventario, la supervisión de estanterías, la gestión de colas y un conocimiento más inteligente de los clientes.
Más información
Visión por computador en el sector sanitario

Visión por computador en el sector sanitario

Crea soluciones sanitarias con modelos de Ultralytics YOLO. La IA de visión en el sector sanitario permite obtener imágenes médicas más rápidamente, diagnósticos más inteligentes y supervisar a los pacientes.
Más información
Visión por computador en la fabricación

Visión por computador en la fabricación

Optimiza la fabricación con modelos de Ultralytics YOLO. La IA de visión impulsa el control de calidad, la detección de defectos, el cumplimiento del PPE y la automatización de las líneas de montaje.
Más información
Visión artificial en el sector automovilístico

Visión artificial en el sector automovilístico

Aplica visión artificial en el sector automovilístico con modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para conseguir carreteras más inteligentes.
Más información
Visión artificial en agricultura

Visión artificial en agricultura

Lleva la IA de visión a la agricultura inteligente con modelos de Ultralytics YOLO. Impulsa la supervisión de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas mayores e inteligentes.
Más información

¡Construyamos juntos el futuro de la IA!

Comienza tu recorrido hacia el futuro del aprendizaje automático