¿Qué es la estimación de profundidad monocular? Introducción
Descubre cómo funciona la estimación de profundidad monocular, cómo se compara con los métodos de profundidad basados en sensores y cómo permite una percepción 3D escalable en sistemas de visión.

Los coches autónomos están diseñados para comprender lo que ocurre a su alrededor y poder conducir de forma segura. Esto implica ir más allá de simplemente reconocer objetos como peatones u otros vehículos.
También necesitan saber a qué distancia están esos objetos para responder correctamente. Sin embargo, dotar a las máquinas de esta percepción de la distancia no es sencillo. A diferencia de los humanos, no perciben la profundidad de forma natural a partir de las imágenes y hay que enseñarles explícitamente a hacerlo.
Una de las razones es que la mayoría de las cámaras capturan el mundo como imágenes planas y bidimensionales. Convertir esas imágenes en algo que refleje la profundidad y la estructura 3D del mundo real es complicado, especialmente cuando los sistemas deben funcionar de forma fiable en condiciones cotidianas.
Curiosamente, la visión artificial, una rama de la IA centrada en interpretar y comprender datos visuales, permite que las máquinas comprendan mejor el mundo a partir de imágenes. Por ejemplo, la estimación de profundidad monocular es una técnica de visión artificial que estima la distancia de los objetos utilizando únicamente la imagen de una cámara.
Al aprender indicios visuales como el tamaño de los objetos, la perspectiva, la textura y el sombreado, estos modelos pueden predecir la profundidad sin depender de sensores adicionales como LiDAR (detección y medición de distancias) o cámaras estereoscópicas. En este artículo, analizaremos qué es la estimación de profundidad monocular, cómo funciona y algunas de sus aplicaciones en el mundo real. ¡Empecemos!
Una introducción rápida a la estimación de profundidad monocular#
La estimación de profundidad monocular permite a una máquina comprender a qué distancia están los objetos utilizando una sola imagen. Como solo depende de una cámara, este enfoque ofrece varias ventajas, como un coste menor y unos requisitos de hardware más sencillos.
Por ejemplo, puede utilizarse en robots domésticos asequibles que funcionan con una sola cámara. Incluso a partir de una única imagen, el sistema robótico puede identificar qué paredes están más cerca y qué puertas están más lejos, e inferir la profundidad general del espacio.
A menudo, una sola imagen no contiene información a la escala correcta, por lo que la estimación de profundidad monocular suele centrarse en la profundidad relativa. En otras palabras, puede determinar qué objetos están más cerca y cuáles más lejos, aunque no se conozcan las distancias exactas.
Cuando un modelo se entrena con datos que contienen distancias de referencia o profundidad absoluta, como las mediciones de profundidad obtenidas de sensores como LiDAR, puede aprender a predecir distancias en unidades del mundo real, como metros. Sin este tipo de datos de referencia, el modelo aún puede inferir la profundidad relativa, pero no puede estimar de forma fiable las distancias absolutas.
La salida de la estimación de profundidad monocular suele ser un mapa de profundidad, es decir, una imagen en la que cada píxel representa lo cerca o lejos que está esa parte de la escena. Un mapa de profundidad proporciona a los sistemas de visión una comprensión básica de la estructura 3D del entorno.

Fig. 1. Ejemplo de un mapa de profundidad predicho creado mediante estimación de profundidad monocular (Fuente)
De los sensores a las imágenes: estimación de profundidad#
La estimación de profundidad puede abordarse de varias formas, dependiendo de los sensores disponibles, las limitaciones del hardware y los requisitos de precisión. Los métodos tradicionales suelen depender de varios puntos de vista o de sensores especializados para medir directamente la distancia.
Un enfoque habitual es la visión estereoscópica, que estima la profundidad comparando dos imágenes sincronizadas capturadas desde puntos de vista ligeramente diferentes. Al medir la diferencia entre los puntos correspondientes de ambas imágenes, el sistema puede inferir a qué distancia están los objetos de la cámara.
Otro enfoque son los sistemas RGB-D (rojo, verde, azul y profundidad), que utilizan sensores de profundidad activos para medir directamente la distancia en cada píxel. Estos sistemas pueden proporcionar información de profundidad precisa en entornos controlados, pero requieren hardware adicional.
Por su parte, los métodos basados en LiDAR utilizan pulsos láser para generar representaciones tridimensionales precisas de una escena. Aunque los sensores LiDAR son muy precisos, suelen ser caros y añaden una complejidad considerable al hardware.
En cambio, la estimación de profundidad monocular infiere la profundidad utilizando únicamente una imagen RGB. Como no depende de varias cámaras ni de sensores especializados, es más fácil de implementar a gran escala y constituye una buena opción cuando el coste y los recursos de hardware son limitados.
Aprendizaje de la profundidad a partir de una sola imagen#
Al estimar la profundidad a partir de una sola imagen, los modelos de profundidad monocular aprenden a reconocer indicios visuales que los humanos utilizan instintivamente para juzgar la distancia. Estos indicios incluyen las líneas de perspectiva, el tamaño de los objetos, la densidad de la textura, la superposición de objetos y el sombreado, que proporcionan pistas sobre la distancia de los objetos respecto a la cámara.
Estos indicios funcionan conjuntamente para crear una sensación de profundidad. Los objetos que parecen más pequeños o están parcialmente ocluidos suelen estar más lejos, mientras que los detalles más nítidos y una apariencia visual más grande suelen indicar que algo está más cerca.
Para aprender estos patrones, los modelos de profundidad monocular se entrenan con conjuntos de datos de imágenes a gran escala, a menudo acompañados de información de profundidad obtenida de otras fuentes, como LiDAR o sistemas estereoscópicos. Durante el entrenamiento, los modelos aprenden cómo se relacionan los indicios visuales con la profundidad, lo que les permite inferir la distancia a partir de una sola imagen durante la inferencia.
Con datos de entrenamiento diversos, los modelos de visión modernos pueden generalizar este conocimiento aprendido a una amplia variedad de entornos, incluidas escenas interiores y exteriores, y pueden gestionar puntos de vista desconocidos.
Un vistazo a varias técnicas de estimación de profundidad monocular#
A continuación, analizaremos los principales enfoques utilizados para estimar la profundidad a partir de una sola imagen y cómo han evolucionado estos métodos con el tiempo.
Enfoques clásicos y basados en la geometría#
Los primeros métodos de estimación de profundidad se basaban en reglas visuales sencillas vinculadas a la geometría de la cámara. Se utilizaban indicios como la perspectiva, el tamaño de los objetos y el hecho de que un objeto bloqueara a otro para estimar la distancia.
Por ejemplo, cuando dos objetos similares aparecían con tamaños diferentes, se suponía que el más pequeño estaba más lejos. Estos enfoques funcionaban razonablemente bien en entornos controlados, donde factores como la iluminación, la posición de la cámara y la disposición de la escena se mantenían constantes.
Sin embargo, en escenas del mundo real, estas suposiciones suelen fallar. Las variaciones de iluminación, los cambios de punto de vista y la mayor complejidad de la escena pueden dar lugar a estimaciones de profundidad poco fiables, lo que limita la eficacia de los métodos clásicos en entornos no controlados.
Primeros enfoques de aprendizaje automático#
Los primeros métodos de aprendizaje automático aportaron más flexibilidad a la estimación de profundidad al aprender patrones directamente de los datos. En lugar de depender únicamente de reglas geométricas fijas, estos modelos intentaban aprender la relación entre la información visual y la distancia, tratando la predicción de profundidad como un problema de regresión basado en indicios como bordes, texturas y cambios de color.
La selección de estas características era una parte clave del proceso. Los ingenieros tenían que decidir qué señales visuales extraer y cómo representarlas, y el rendimiento del modelo dependía en gran medida de esas decisiones.
Aunque este enfoque funcionaba mejor que los métodos anteriores, seguía teniendo limitaciones. Si las características seleccionadas carecían de contexto importante, las predicciones de profundidad eran menos precisas. A medida que las escenas se volvían más complejas y variadas, estos modelos solían tener dificultades para producir resultados fiables.
Algoritmos de aprendizaje profundo#
La mayoría de los sistemas modernos de estimación de profundidad monocular utilizan aprendizaje profundo, es decir, redes neuronales con muchas capas capaces de aprender patrones complejos a partir de los datos. Estos modelos aprenden a predecir la profundidad directamente a partir de imágenes y producen mapas de profundidad.
Muchos enfoques se construyen utilizando redes neuronales convolucionales (CNNs), un tipo de red neuronal diseñado para procesar imágenes detectando patrones como bordes y formas. Estos modelos suelen utilizar una arquitectura de codificador-decodificador: el codificador extrae características visuales de la imagen y el decodificador convierte esas características en un mapa de profundidad. Procesar la imagen a varias escalas ayuda al modelo a captar la disposición general de la escena y, al mismo tiempo, límites claros de los objetos.
Los modelos más recientes se centran en comprender las relaciones entre distintas partes de una imagen. Los modelos basados en Transformer y los modelos Transformer de visión (ViT) utilizan mecanismos de atención que permiten al modelo identificar qué regiones de una imagen son más relevantes y relacionar entre sí zonas alejadas. Esto ayuda al modelo a construir una comprensión más coherente de la profundidad en toda la escena.
Algunos sistemas combinan ambas ideas. Los modelos híbridos CNN–Transformer utilizan CNNs para captar detalles locales precisos y Transformers para modelar el contexto global de la escena. Aunque esto suele mejorar la precisión, normalmente requiere más recursos computacionales, como memoria y capacidad de procesamiento adicionales.
Por qué la comprensión de la profundidad es importante para los sistemas de IA de visión#
Al aprender sobre la estimación de profundidad monocular, quizá te preguntes por qué comprender la profundidad es una parte tan importante de los sistemas de IA basados en visión.
Cuando un sistema puede estimar a qué distancia están los objetos y las superficies, comprende mejor cómo está distribuida una escena y cómo se relacionan sus distintos elementos. Este tipo de percepción espacial es esencial para tomar decisiones fiables, especialmente en aplicaciones del mundo real como la conducción autónoma.
La información de profundidad también aporta un contexto valioso a otras tareas de visión artificial. Por ejemplo, la detección de objetos, respaldada por modelos como Ultralytics YOLO26, puede indicar a un sistema qué hay presente en una escena, pero la profundidad ayuda a responder dónde se encuentran esos objetos con respecto a la cámara y entre sí.
En conjunto, estas capacidades permiten una amplia variedad de aplicaciones de IA de visión, como crear mapas 3D, navegar por entornos complejos y comprender una escena en su totalidad.
Los robots y los vehículos autónomos dependen de esta información para desplazarse de forma segura, evitar obstáculos y reaccionar a los cambios en tiempo real. Por ejemplo, el enfoque de conducción basada únicamente en visión de Tesla utiliza imágenes de cámaras combinadas con estimación de profundidad, en lugar de LiDAR, para comprender a qué distancia están los objetos y cómo están situados en la carretera.
Cómo funcionan los modelos de estimación de profundidad monocular#
Aunque las arquitecturas de los modelos varían, la mayoría de los modelos de estimación de profundidad monocular siguen un proceso similar para convertir una sola imagen en un mapa de profundidad. Este es un resumen rápido de los pasos clave:
- Entrada y preprocesamiento: El flujo de trabajo comienza con una imagen de entrada. Antes de introducirla en el modelo, la imagen original normalmente se redimensiona, se normaliza y se convierte en un tensor, un formato que las redes neuronales utilizan para procesar datos de imagen de forma eficiente.
- Extracción de características: Una red codificadora analiza la imagen para extraer características visuales relevantes. Estas características capturan información como texturas, límites de los objetos y la disposición general de la escena. La mayoría de los modelos funcionan a varias escalas para comprender tanto los detalles precisos como la estructura global.
- Razonamiento sobre la profundidad: Utilizando las características extraídas, el modelo combina los detalles locales con el contexto global para razonar sobre las relaciones espaciales de la escena. En esta fase, aprende qué regiones de la imagen están más cerca de la cámara y cuáles están más lejos.
- Generación del mapa de profundidad: A continuación, un decodificador convierte esta información en un mapa de profundidad denso. A cada píxel de la imagen se le asigna un valor de profundidad, a menudo combinando predicciones de distintas escalas para mejorar la precisión y la coherencia.
Cómo se entrenan los modelos de estimación de profundidad monocular#
El proceso que acabamos de analizar presupone que ya disponemos de un modelo entrenado o preentrenado. Pero ¿cómo funciona realmente el entrenamiento de un modelo de estimación de profundidad monocular?
El entrenamiento comienza preparando los datos de imagen para que la red pueda procesarlos de forma eficiente. Las imágenes de entrada se redimensionan y normalizan a una escala uniforme, y después se introducen en el modelo para generar un mapa de profundidad predicho que estima la distancia en cada píxel.
A continuación, el mapa de profundidad predicho se compara con datos de profundidad de referencia mediante una función de pérdida, que mide cuánto se aleja la predicción del modelo de la profundidad de referencia real. Este valor de pérdida representa el error actual del modelo y proporciona una señal para mejorarlo.
Un optimizador utiliza esta señal para actualizar el modelo ajustando sus pesos internos. Para ello, el optimizador calcula el gradiente, que describe cómo cambia la pérdida con respecto a cada parámetro del modelo, y aplica estas actualizaciones repetidamente durante varias épocas, es decir, pasadas completas por el conjunto de datos de entrenamiento.
Este proceso iterativo de entrenamiento mediante aprendizaje supervisado se guía por hiperparámetros como la tasa de aprendizaje, que controla el tamaño de cada paso de actualización, y el tamaño del lote, que determina cuántas imágenes se procesan a la vez. Como el entrenamiento implica un gran número de operaciones matemáticas, normalmente se acelera utilizando una unidad de procesamiento gráfico (GPU), adecuada para el cálculo en paralelo.
Una vez completado el entrenamiento, el modelo se evalúa utilizando métricas de evaluación estándar en un conjunto de validación, formado por imágenes que no se utilizaron durante el entrenamiento. Esta evaluación ayuda a medir hasta qué punto el modelo generaliza a datos nuevos.
A continuación, el modelo entrenado puede reutilizarse o ajustarse para nuevos escenarios. En conjunto, este proceso de entrenamiento permite a los modelos de estimación de profundidad monocular producir estimaciones de profundidad coherentes, esenciales para tareas posteriores como la reconstrucción 3D y la implementación en el mundo real.
Exploración de los modelos más avanzados y las tendencias de investigación#
La estimación de profundidad monocular ha mejorado rápidamente a medida que los modelos han aprendido a comprender escenas completas en lugar de solo pequeños detalles visuales. Los primeros enfoques solían producir mapas de profundidad irregulares, especialmente en entornos complejos.
Los modelos más recientes, como se observa en investigaciones recientes publicadas en arXiv, se centran más en el contexto global, lo que da lugar a predicciones de profundidad de aspecto más estable y realista. Modelos conocidos como MiDaS y DPT impulsaron este cambio al aprender la profundidad a partir de conjuntos de datos diversos y de alta resolución, y generalizar bien en muchas escenas.
Los modelos más recientes, incluidos ZoeDepth y Depth Anything V2, se basan en este trabajo para mejorar la coherencia de escala manteniendo un rendimiento sólido en una amplia variedad de entornos. Este tipo de progreso suele medirse utilizando conjuntos de datos de referencia habituales como KITTI y NYU, que abarcan escenas exteriores e interiores.
Otra tendencia clara es equilibrar la precisión con la practicidad. Los modelos más pequeños están optimizados para la velocidad y pueden ejecutarse en tiempo real en dispositivos periféricos o móviles, mientras que los modelos más grandes priorizan una mayor resolución y precisión de profundidad a larga distancia.
Aplicaciones de la estimación de profundidad monocular#
A continuación, repasaremos algunos ejemplos del mundo real que muestran cómo se utiliza la estimación de profundidad monocular para razonar sobre la estructura 3D de una escena a partir de una sola imagen.
En todos estos casos, es importante tener presente que la información de profundidad es una estimación inferida a partir de indicios visuales, no una medición precisa. Esto hace que la estimación de profundidad monocular sea útil para comprender la disposición relativa y las relaciones espaciales, pero no sustituya a los sensores diseñados para medir la distancia con precisión, como LiDAR o los sistemas estereoscópicos.
Cartografía y navegación del terreno mediante drones#
Los drones suelen operar en entornos donde las señales GPS no son fiables, como bosques, obras de construcción, zonas de desastre o áreas urbanas densas. Para volar con seguridad en estas condiciones, necesitan comprender el terreno circundante y saber a qué distancia están los obstáculos. En el pasado, esto normalmente requería añadir sensores como LiDAR o cámaras estereoscópicas, lo que incrementaba el peso, el consumo energético y el coste total.
La estimación de profundidad monocular es una alternativa más sencilla. Utilizando únicamente una cámara RGB, los drones pueden estimar la profundidad a partir de imágenes y construir una comprensión 3D básica de su entorno. Esto les permite detectar obstáculos como edificios, árboles o cambios repentinos del terreno y ajustar su trayectoria de vuelo en tiempo real.
Estas estimaciones de profundidad respaldan tareas de navegación clave, como evitar obstáculos, controlar la altitud y aterrizar de forma segura. Como resultado, los drones ligeros pueden realizar tareas de cartografía, inspección y navegación sin depender de sensores de profundidad especializados.

Fig. 2. La estimación de profundidad monocular puede utilizarse para analizar imágenes capturadas por drones (Fuente)
Completar los puntos ciegos de los vehículos de carreras autónomos#
Los vehículos autónomos suelen depender en gran medida de sensores LiDAR, que utilizan pulsos láser para medir la distancia y construir una vista 3D de la carretera. Aunque es muy preciso, LiDAR puede tener dificultades con cambios bruscos de rasante, pendientes pronunciadas, oclusiones o cambios repentinos en el cabeceo del vehículo, y en ocasiones devuelve datos de profundidad dispersos o ausentes.
La estimación de profundidad monocular puede ayudar a completar estas carencias proporcionando información de profundidad densa a partir de una sola imagen RGB, incluso cuando los datos de LiDAR están incompletos. Imagina una situación en la que un coche autónomo se aproxima a gran velocidad a la cima de una colina. Los haces de LiDAR pueden sobrepasar la carretera más allá de la cima, dejando incertidumbre sobre lo que hay delante.
Sin embargo, la estimación de profundidad basada en cámaras aún puede inferir la forma de la carretera a partir de indicios visuales como la perspectiva y la textura, ayudando al vehículo a mantener una percepción fiable hasta que los datos de LiDAR se estabilicen. Juntos, LiDAR y la estimación de profundidad monocular permiten obtener una percepción más estable y un control más seguro en condiciones de conducción difíciles.

Fig. 3. Visualización del uso de la estimación de profundidad monocular para carreras autónomas (Fuente)
Navegación robótica y evitación de obstáculos#
Los robots suelen operar en lugares donde no hay mapas detallados disponibles y las condiciones cambian constantemente. Para desplazarse con seguridad, necesitan percibir de forma fiable cuánto espacio tienen a su alrededor y dónde se encuentran los obstáculos.
La estimación de profundidad monocular puede proporcionar esta percepción espacial utilizando una sola cámara RGB, sin depender de hardware pesado o caro. Al aprender indicios visuales como la escala y la perspectiva, los modelos de estimación de profundidad pueden generar mapas de profundidad densos del entorno. Esto ofrece a los robots una visión clara de la distancia hasta las superficies y los objetos.
En particular, cuando la información de profundidad se combina con tareas de visión artificial como la detección de objetos y la segmentación semántica, los robots pueden obtener una visión más completa de su entorno. Pueden identificar objetos, comprender su distancia y decidir por dónde es seguro desplazarse. Esto permite evitar obstáculos, detectar el espacio libre y planificar trayectorias en tiempo real.

Fig. 4. Detección de objetos mediante estimación de profundidad monocular y detección de objetos (Fuente)
Ventajas y desventajas de la estimación de profundidad monocular#
Estas son algunas de las principales ventajas de utilizar la estimación de profundidad monocular:
- Ligera y eficiente en consumo energético: Utilizar una sola cámara reduce el peso del sistema y el consumo energético, algo especialmente importante para robots móviles, drones y sistemas integrados.
- Adecuada para la fusión de sensores: La profundidad monocular puede complementar otros sensores, como LiDAR o el radar, rellenando carencias o proporcionando redundancia.
- Funciona en muchos entornos: El mismo enfoque basado en cámaras puede utilizarse en interiores, exteriores y distintas plataformas sin necesidad de cambiar el hardware.
Aunque la estimación de profundidad monocular ofrece ventajas claras, estas son algunas limitaciones que debes tener en cuenta:
- Menor precisión que los sensores activos: Aunque mejora rápidamente, la estimación de profundidad monocular generalmente no puede igualar la precisión absoluta de LiDAR o de los sensores de luz estructurada en condiciones controladas.
- Sensibilidad a las condiciones de iluminación: El rendimiento puede degradarse en entornos con poca luz, sombras intensas, deslumbramiento o escenas con poca textura.
- Dificultades de generalización: Un modelo entrenado en un entorno no siempre se transfiere de forma fiable a dominios no vistos sin adaptación o ajuste fino.
Cuándo no debes confiar en la estimación de profundidad monocular#
Aunque la estimación de profundidad monocular es un área de investigación interesante, es importante comprender dónde puede utilizarse en la práctica y dónde no. Las distancias que produce son estimaciones basadas en lo que el modelo ve en una imagen, no mediciones exactas tomadas del mundo real.
Por este motivo, la calidad de los resultados puede variar en función de factores como la iluminación, la complejidad de la escena y el grado de similitud entre la escena y los datos con los que se entrenó el modelo. La estimación de profundidad monocular suele ser adecuada para indicar qué está más cerca y qué está más lejos, pero no es fiable cuando necesitas distancias exactas.
En situaciones en las que la precisión es realmente importante, como los sistemas críticos para la seguridad, la inspección industrial o los robots que necesitan interactuar con objetos con gran precisión, la profundidad debe medirse directamente. Sensores como LiDAR, el radar, las cámaras estereoscópicas o los sistemas de luz estructurada están diseñados para ello y proporcionan información de distancia mucho más fiable.
La estimación de profundidad monocular también puede tener dificultades en condiciones visualmente complejas. La mala iluminación, las sombras intensas, las superficies reflectantes o transparentes, la niebla, el humo o las escenas con muy poca textura visual pueden hacer que las estimaciones de profundidad sean menos fiables. Estimar la profundidad a grandes distancias es otro caso en el que los sensores especializados suelen funcionar mejor.
En lo que respecta a las soluciones del mundo real, la estimación de profundidad monocular funciona mejor como herramienta de apoyo que como solución independiente. Puede aportar un contexto espacial útil, ayudar a cubrir las carencias cuando otros sensores tienen limitaciones y mejorar la comprensión general de la escena. Sin embargo, no debería ser la única fuente de información sobre la profundidad cuando la precisión, la seguridad o unos requisitos estrictos de fiabilidad sean importantes.
Conclusiones clave#
La estimación de profundidad monocular es una técnica de visión por ordenador que permite a las máquinas estimar a qué distancia se encuentran los objetos utilizando únicamente la imagen de una cámara. Al aprender indicios visuales como la perspectiva, el tamaño de los objetos, la textura y el sombreado, estos modelos de IA pueden inferir la estructura 3D de una escena sin depender de sensores como LiDAR o cámaras estereoscópicas. Esto convierte la estimación de profundidad monocular en un enfoque rentable y escalable para aplicaciones como la conducción autónoma, la robótica y la comprensión de escenas 3D.
Para descubrir más sobre la IA de visión, visita nuestro repositorio de GitHub y únete a nuestra comunidad. Consulta nuestras páginas de soluciones para obtener más información sobre la IA en robótica y la visión por ordenador en la fabricación. Descubre nuestras opciones de licencia y empieza hoy mismo a utilizar la visión por ordenador.









