Depth Bleeding
Aprende qué es el sangrado de profundidad, cómo distorsiona los mapas de profundidad en los límites de los objetos y explora métodos para detectar y reducir este artefacto de estimación de profundidad.
El sangrado de profundidad es un artefacto del mapa de profundidad en el que una distancia estimada se extiende incorrectamente a través del límite entre dos superficies. Por ejemplo, los píxeles pertenecientes a una persona cercana podrían recibir la profundidad de una pared lejana, o la profundidad de la persona podría extenderse al fondo. Esto es importante en la estimación de profundidad, donde cada píxel debería describir la distancia desde la cámara hasta la superficie visible correspondiente.
El artefacto se aprecia sobre todo en las discontinuidades de profundidad: ubicaciones donde un objeto ocluye a otro objeto situado a una distancia considerablemente distinta. En lugar de conservar una transición nítida, el mapa de profundidad produce un borde desplazado, una franja de valores mezclados o una forma en primer plano que parece más ancha o más estrecha de lo que realmente es.
Cómo se produce el sangrado de profundidad#
El sangrado de profundidad puede afectar a los mapas de profundidad producidos por redes neuronales, visión estereoscópica, cámaras de luz estructurada, sensores de tiempo de vuelo y sistemas basados en LiDAR. Entre las causas habituales se incluyen:
- Predicción de profundidad a baja resolución seguida de una interpolación convencional
- Suavizado espacial que elimina estructuras finas y bordes nítidos
- Funciones de pérdida de entrenamiento dominadas por regiones grandes y uniformes en lugar de límites estrechos
- Correspondencia estereoscópica ambigua alrededor de oclusiones o superficies sin textura
- Desalineación entre las imágenes RGB y las etiquetas de profundidad de referencia
- Mediciones del sensor que combinan los retornos del primer plano y del fondo
En los sistemas estereoscópicos, las ventanas de correspondencia pueden abarcar píxeles a ambos lados del límite de un objeto. La guía de posfiltrado de disparidad de OpenCV explica que los errores suelen concentrarse cerca de las discontinuidades de profundidad y las regiones parcialmente ocluidas.
El aumento de resolución puede introducir un problema similar. Un píxel de profundidad de baja resolución puede representar varias superficies, mientras que una interpolación bilineal sencilla mezcla su valor con el de los píxeles vecinos. El filtrado guiado o consciente de los bordes puede reducir este efecto, aunque los bordes de color no siempre son verdaderos bordes de profundidad. El flujo de trabajo de nube de puntos de ARKit de Apple muestra el aumento guiado de resolución de un mapa de profundidad de escena de menor resolución.
Términos relacionados y diferencias clave#
El sangrado de profundidad se solapa con varios problemas de calidad de profundidad, pero cada uno describe un patrón de fallo diferente:
- Desenfoque del límite: Una transición nítida se vuelve gradual. El sangrado de profundidad significa específicamente que un valor incorrecto cruza a otra superficie; un límite desenfocado puede cambiar de forma apreciable o no la forma aparente de un objeto.
- Píxeles volantes: Aparecen puntos 3D aislados e inestables alrededor de las siluetas, a menudo porque una medición del sensor mezcla dos superficies. El sangrado suele formar una región o franja más continua.
- Confusión de profundidad: Los valores de profundidad de objetos separados se solapan o se vuelven difíciles de distinguir, mientras que el sangrado enfatiza la extensión del valor de una superficie a otra.
- Copia de textura: La textura RGB se reproduce incorrectamente como detalle geométrico cuando el refinamiento de profundidad guiado por el color trata cada borde de la imagen como un borde de profundidad.
- Fuga de datos: Un problema no relacionado de aprendizaje automático en el que el entrenamiento utiliza indebidamente información que no está disponible durante la inferencia en el mundo real.
El sangrado de profundidad también puede afectar a los mapas de disparidad. La documentación de Apple sobre profundidad y disparidad explica cómo se utilizan la correspondencia estereoscópica y el paralaje para inferir la distancia relativa.
Impacto en el mundo real#
-
Recogida robótica: Un robot de almacén puede utilizar la profundidad para localizar el borde de una caja y seleccionar un punto de agarre. Si la profundidad de la estantería del fondo se filtra en la caja, la forma reconstruida puede parecer abollada o demasiado estrecha, lo que provoca una mala colocación del agarre. Esto es especialmente importante para la visión artificial en robótica, donde pequeños errores geométricos pueden afectar a las acciones físicas.
-
Conducción autónoma: El sangrado alrededor de un peatón, ciclista o vehículo puede distorsionar la distancia al obstáculo y la forma de una nube de puntos generada. La detección de objetos 3D posterior puede estimar entonces una extensión o ubicación inexactas. El benchmark de visión KITTI proporciona escenas de conducción reales con datos de sensores relacionados con la cámara y la profundidad para evaluar estos sistemas.
El sangrado de profundidad también es importante en la realidad aumentada. Unos límites incorrectos pueden hacer que un objeto virtual aparezca delante de muebles reales cuando debería quedar ocluido detrás de ellos. Por tanto, la confianza del sensor resulta útil: el mapa de confianza de profundidad de ARKit de Apple asigna información de confianza a las mediciones de profundidad, especialmente alrededor de superficies reflectantes o absorbentes de luz difíciles de procesar.
Inspección de las predicciones de profundidad#
La tarea de estimación de profundidad de Ultralytics YOLO produce un mapa de profundidad denso alineado con una imagen de entrada. Un breve flujo de trabajo de predicción facilita la inspección visual de los límites entre el primer plano y el fondo:
from ultralytics import YOLO
# Load a pretrained Ultralytics YOLO26 depth model
model = YOLO("yolo26n-depth.pt")
# Predict, select the first result, and save its visualization
results = model("https://ultralytics.com/images/bus.jpg")
result = results[0]
result.save(filename="depth_result.jpg")Este flujo de trabajo de YOLO26 guarda un resultado visual que se puede examinar para detectar halos, siluetas ensanchadas, huecos ausentes y bordes suavizados. Para realizar pruebas más amplias, la guía del conjunto de datos de profundidad de Ultralytics explica el formato emparejado de RGB y profundidad por píxel, mientras que la evaluación de profundidad de iBims-1 se centra específicamente en las transiciones nítidas y las superficies planas. El benchmark oficial de iBims-1 resulta especialmente útil porque el error medio de toda la imagen puede ocultar defectos estrechos en los límites, pero importantes desde el punto de vista operativo.
Detección y mitigación#
Una mitigación eficaz comienza con etiquetas de profundidad de alta resolución y cuidadosamente alineadas. Entre las prácticas útiles se incluyen las funciones de pérdida conscientes de los bordes, las características multiescala, el refinamiento guiado por segmentación, el filtrado por confianza y la validación en objetos finos y transiciones marcadas entre el primer plano y el fondo. Cuando se dispone de la confianza del sensor, los píxeles de los límites con baja confianza se pueden rechazar o tratar por separado en lugar de suavizarlos sin más. Sin embargo, el filtrado debe evaluarse cuidadosamente porque las directrices de Apple sobre datos de profundidad filtrados señalan que el suavizado y el relleno de huecos alteran las mediciones originales.
Los equipos deberían comparar los bordes RGB con las discontinuidades de profundidad, inspeccionar las nubes de puntos reconstruidas y supervisar las escenas de producción con muchos límites, en lugar de basarse únicamente en métricas medias por píxel. El flujo de trabajo de validación de Ultralytics permite evaluar los modelos de forma sistemática, mientras que Ultralytics Platform proporciona herramientas para gestionar conjuntos de datos, entrenar modelos, implementar flujos de trabajo y supervisar sistemas de visión artificial.






