Guía sobre la arquitectura U-Net y sus aplicaciones
Descubre la arquitectura U-Net, cómo facilita la segmentación de imágenes, sus aplicaciones y por qué es importante en la evolución de la visión por computador.

La visión por computador es una rama de la inteligencia artificial (AI) que se centra en analizar datos visuales. Ha allanado el camino para muchos sistemas de vanguardia, como la automatización del proceso de inspección de productos en fábricas y la ayuda a vehículos autónomos para navegar por las carreteras.
Una de las tareas de visión por computador más conocidas es la detección de objetos. Esta tarea permite a los modelos localizar e identificar objetos dentro de una imagen mediante cuadros delimitadores. Aunque los cuadros delimitadores son útiles para diversas aplicaciones, solo proporcionan una estimación aproximada de la ubicación de un objeto.
Sin embargo, en campos como la sanidad, donde la precisión es crucial, los casos de uso de la IA para visión dependen de algo más que identificar un objeto. A menudo, también requieren información relacionada con la forma y la posición exactas de los objetos.
Eso es precisamente lo que hace la tarea de visión por computador denominada segmentación. En lugar de utilizar cuadros delimitadores, los modelos de segmentación detectan objetos a nivel de píxel. Con el paso de los años, los investigadores han desarrollado modelos de visión por computador especializados en segmentación.
Uno de esos modelos es U-Net. Aunque modelos más nuevos y avanzados han superado su rendimiento, U-Net ocupa un lugar importante en la historia de la visión por computador. En este artículo, analizaremos más de cerca la arquitectura U-Net, cómo funciona, dónde se ha utilizado y cómo se compara con los modelos de segmentación más modernos disponibles actualmente.

Fig. 1. Un ejemplo de segmentación mediante el modelo de aprendizaje profundo U-Net. (Fuente)
Historia de la segmentación de imágenes#
Antes de profundizar en qué es U-Net, veamos primero cómo evolucionaron los modelos de segmentación de imágenes.
Inicialmente, la visión por computador se basaba en técnicas tradicionales como la detección de bordes, la umbralización o el crecimiento de regiones para separar objetos en una imagen. Estas técnicas se utilizaban para detectar los límites de los objetos mediante bordes, separar regiones según la intensidad de los píxeles y agrupar píxeles similares. Funcionaban en casos sencillos, pero a menudo fallaban cuando las imágenes contenían ruido, formas superpuestas o límites poco claros.
Tras el auge del aprendizaje profundo en 2012, los investigadores introdujeron en 2014 el concepto de redes totalmente convolucionales (FCNs) para tareas como la segmentación semántica. Estos modelos sustituyeron ciertas partes de una red convolucional para permitir que el ordenador analizara una imagen completa de una vez, en lugar de dividirla en fragmentos más pequeños. Esto hizo posible que el modelo crease mapas detallados que muestran con mayor claridad lo que hay en una imagen.

Fig. 2. Evolución de los algoritmos de segmentación basados en aprendizaje profundo. (Fuente)
A partir de las FCNs, investigadores de la Universidad de Friburgo introdujeron U-Net en 2015. Originalmente, se diseñó para la segmentación de imágenes biomédicas. En particular, U-Net se diseñó para funcionar bien en situaciones en las que los datos anotados son limitados.
Mientras tanto, versiones posteriores como UNet++ y TransUNet incorporaron mejoras como capas de atención y una mejor extracción de características. Las capas de atención ayudan al modelo a centrarse en regiones clave, mientras que la extracción de características mejorada captura información más detallada.
¿Qué es U-Net y cómo fluyen las características por el modelo?#
U-Net es un modelo de aprendizaje profundo creado específicamente para la segmentación de imágenes. Recibe una imagen como entrada y produce una máscara de segmentación que clasifica cada píxel según el objeto o la región a la que pertenece.
El modelo recibe su nombre de su arquitectura en forma de U. Consta de dos partes principales: un codificador que comprime la imagen y aprende sus características, y un decodificador que la vuelve a ampliar hasta su tamaño original. Este diseño crea una forma de U simétrica que ayuda al modelo a comprender tanto la estructura general de una imagen como sus detalles más precisos.
Una característica fundamental de U-Net es el uso de conexiones de salto, que permiten pasar directamente información del codificador al decodificador. Esto significa que el modelo puede conservar detalles importantes que podrían perderse al comprimir la imagen.
Descripción general de la arquitectura U-Net#
Este es un resumen del funcionamiento de la arquitectura U-Net:
- Imagen de entrada: U-Net comienza con una imagen 2D, como una exploración médica o una fotografía de satélite. El objetivo es asignar una etiqueta de clase a cada píxel de la imagen.
- Submuestreo: La imagen pasa por capas convolucionales que aprenden características visuales importantes. A medida que la imagen atraviesa distintas capas, su resolución disminuye y el modelo identifica patrones más generales.
- Capa de cuello de botella: En el centro de la red, los mapas de características alcanzan su resolución espacial más baja mientras capturan características semánticas de alto nivel. En pocas palabras, esta representación comprimida de los mapas de características constituye el contexto general de la entrada.
- Sobremuestreo: A continuación, la red reconstruye la imagen aumentando gradualmente la resolución. Las convoluciones transpuestas ayudan a ampliar los mapas de características hasta aproximarlos de nuevo al tamaño original.
- Conexiones de salto: Los mapas de características de la ruta de submuestreo se concatenan con los de la ruta de sobremuestreo. Esto ayuda a conservar los detalles espaciales precisos mientras se integra información contextual de alto nivel.
- La salida es un mapa de segmentación: La salida final es una máscara de segmentación píxel a píxel que coincide con el tamaño de la entrada. Cada píxel se clasifica en una categoría como objeto, fondo o región de interés.

Fig. 3. Diagrama de la arquitectura U-Net. (Fuente)
Comprender la diferencia entre ViT y U-Net#
Al explorar U-Net, quizá te preguntes en qué se diferencia de otros modelos de aprendizaje profundo, como el Transformer de visión (ViT), que también puede realizar tareas de segmentación. Aunque ambos modelos pueden realizar tareas similares, difieren en su construcción y en la forma en que gestionan la segmentación.
U-Net procesa las imágenes a nivel de píxel mediante capas convolucionales en una estructura de codificador-decodificador. Suele utilizarse para tareas que requieren una segmentación precisa, como las exploraciones médicas o las escenas de vehículos autónomos.
Por otro lado, el Transformer de visión (ViT) divide las imágenes en parches y los procesa simultáneamente mediante mecanismos de atención. Utiliza la autoatención (un mecanismo que permite al modelo ponderar la importancia de distintas partes de la imagen entre sí) para captar cómo se relacionan unas partes de la imagen con otras, a diferencia del enfoque convolucional de U-Net.
Otra diferencia importante es que ViT generalmente necesita más datos para funcionar bien, pero es excelente a la hora de detectar patrones complejos. U-Net, en cambio, funciona bien con conjuntos de datos más pequeños, se entrena más rápido y a menudo requiere menos tiempo de entrenamiento.
Aplicaciones del modelo U-Net#
Ahora que comprendemos mejor qué es U-Net y cómo funciona, exploremos cómo se ha aplicado U-Net en distintos ámbitos.
Segmentación de hemorragias cerebrales en imágenes médicas#
U-Net se convirtió en un método fiable para la segmentación a nivel de píxel de imágenes médicas complejas, especialmente durante su apogeo en la investigación. Los investigadores lo utilizaron para resaltar áreas clave en exploraciones médicas, como tumores y signos de hemorragia interna en imágenes de CT y MRI. Este enfoque mejoró significativamente la precisión de los diagnósticos y agilizó el análisis de datos médicos complejos en entornos de investigación.
Un ejemplo del impacto de U-Net en la investigación sanitaria es su uso para identificar accidentes cerebrovasculares y hemorragias cerebrales en exploraciones médicas. Los investigadores podían utilizar U-Net para analizar exploraciones de la cabeza y resaltar áreas preocupantes, lo que permitía identificar más rápidamente los casos que requerían atención inmediata.

Fig. 4. Segmentación de lesiones de ictus hemorrágico mediante 3D U-Net. (Fuente)
Segmentación de cultivos en agricultura#
Otro ámbito en el que los investigadores han utilizado U-Net es la agricultura, especialmente para segmentar cultivos, malas hierbas y suelo. Ayuda a los agricultores a supervisar la salud de las plantas, estimar el rendimiento y tomar mejores decisiones en grandes explotaciones. Por ejemplo, U-Net puede separar los cultivos de las malas hierbas, haciendo más eficiente la aplicación de herbicidas y reduciendo los residuos.
Para abordar problemas como el desenfoque por movimiento en imágenes de drones, los investigadores han mejorado U-Net con técnicas de desenfoque de imágenes. Esto garantiza una segmentación más clara, incluso cuando los datos se recopilan mientras hay movimiento, como durante los estudios aéreos.

Fig. 5. Separación de cultivos y malas hierbas en campos agrícolas con U-Net. (Fuente)
Conducción autónoma#
Antes de que se introdujeran modelos de IA más avanzados, U-Net desempeñó un papel fundamental en la exploración de cómo la segmentación podía mejorar la conducción autónoma. En los vehículos autónomos, la segmentación semántica de U-Net puede utilizarse para clasificar cada píxel de una imagen en categorías como carretera, vehículo, peatón y marcas viales. Esto proporciona al coche una visión clara de su entorno, lo que facilita una navegación segura y una toma de decisiones eficaz.

Fig. 6. Escena de carretera en la que el área transitable se segmenta mediante U-Net. (Fuente)
Ventajas y desventajas de U-Net#
Incluso hoy, U-Net sigue siendo una buena opción para la segmentación de imágenes entre los investigadores gracias a su equilibrio entre sencillez, precisión y adaptabilidad. Estas son algunas de las principales ventajas que lo distinguen:
- Adaptable a distintas modalidades: U-Net se ha adaptado a distintos tipos de datos, incluidas exploraciones médicas 3D, imágenes de satélite e incluso fotogramas de vídeo.
- Inferencia rápida cuando está optimizado: Cuando se ajusta correctamente, U-Net puede ejecutarse de forma eficiente, por lo que resulta adecuado para aplicaciones en tiempo real o casi en tiempo real.
- Código abierto y comunidad: U-Net está disponible en las principales bibliotecas de aprendizaje profundo y cuenta con el respaldo de una amplia comunidad de desarrolladores e investigadores.
Aunque U-Net tiene muchos puntos fuertes, también presenta algunas limitaciones que conviene tener en cuenta. Estos son algunos factores que debes considerar:
- Sensible a la calidad de los datos: El rendimiento de U-Net puede verse afectado negativamente por datos de baja calidad, como imágenes ruidosas o de baja resolución.
- Propenso al sobreajuste con conjuntos de datos pequeños: Aunque U-Net funciona bien con datos limitados, sigue existiendo riesgo de sobreajuste si no se regulariza correctamente, especialmente cuando el conjunto de datos es demasiado pequeño o carece de diversidad.
- Recursos computacionales: U-Net puede ser costoso desde el punto de vista computacional, especialmente al trabajar con conjuntos de datos grandes, ya que requiere recursos de hardware considerables para el entrenamiento.
Conclusiones clave#
U-Net ha sido un hito fundamental en la evolución de la segmentación de imágenes. Demostró que los modelos de aprendizaje profundo pueden ofrecer resultados precisos utilizando conjuntos de datos más pequeños, especialmente en ámbitos como la obtención de imágenes médicas.
Este avance ha allanado el camino para aplicaciones más avanzadas en diversos campos. A medida que la visión por computador continúa evolucionando, los modelos de segmentación como U-Net siguen siendo fundamentales para permitir que las máquinas comprendan e interpreten datos visuales con gran precisión.
¿Quieres crear tus propios proyectos de visión por computador? Explora nuestro repositorio de GitHub para profundizar en la IA y consulta nuestras opciones de licencia. Descubre cómo la visión por computador en la sanidad mejora la eficiencia y explora el impacto de la IA en el comercio minorista visitando nuestras páginas de soluciones. ¡Únete ahora a nuestra creciente comunidad!









