Ultralytics YOLO27:
IA visual

¿Qué es Mask R-CNN y cómo funciona?

Descubre cómo se puede utilizar Mask R-CNN para segmentar objetos con precisión en imágenes y vídeos para diversas aplicaciones en distintos sectores.

ABAbirami Vina10 min read
Segmentación de instancias con Mask R-CNN

Innovaciones como los robots en almacenes, los coches autónomos que circulan de forma segura por calles concurridas, los drones que supervisan los cultivos y los sistemas de IA que inspeccionan productos en fábricas son cada vez más habituales a medida que aumenta la adopción de la IA. Una tecnología clave que impulsa estas innovaciones es la visión por ordenador, una rama de la IA que permite a las máquinas comprender e interpretar datos visuales.

Por ejemplo, la detección de objetos es una tarea de visión por ordenador que ayuda a identificar y localizar objetos en imágenes mediante cuadros delimitadores. Aunque los cuadros delimitadores proporcionan información útil, solo ofrecen una estimación aproximada de la posición de un objeto y no pueden captar su forma o sus límites exactos. Esto los hace menos eficaces en aplicaciones que requieren una identificación precisa.

Para resolver este problema, los investigadores desarrollaron modelos de segmentación que captan los contornos exactos de los objetos y proporcionan detalles a nivel de píxel para lograr una detección y un análisis más precisos.

Mask R-CNN es uno de estos modelos. Presentado en 2017 por Facebook AI Research (FAIR), se basa en modelos anteriores como R-CNN, Fast R-CNN y Faster R-CNN. Como hito importante en la historia de la visión por ordenador, Mask R-CNN allanó el camino para modelos más avanzados, como Ultralytics YOLO11.

En este artículo, veremos qué es Mask R-CNN, cómo funciona, cuáles son sus aplicaciones y qué mejoras surgieron después, hasta llegar a Ultralytics YOLO11.

Descripción general de Mask R-CNN#

Mask R-CNN, cuyo nombre significa red neuronal convolucional basada en regiones para máscaras, es un modelo de aprendizaje profundo diseñado para tareas de visión por ordenador como la detección de objetos y la segmentación de instancias.

La segmentación de instancias va más allá de la detección de objetos tradicional, ya que no solo identifica los objetos de una imagen, sino que también delimita cada uno con precisión. Asigna una etiqueta única a cada objeto detectado y capta su forma exacta a nivel de píxel. Este enfoque detallado permite distinguir claramente entre objetos superpuestos y gestionar con precisión formas complejas.

Mask R-CNN se basa en Faster R-CNN, que detecta y etiqueta objetos, pero no define sus formas exactas. Mask R-CNN mejora este proceso al identificar los píxeles exactos que componen cada objeto, lo que permite realizar un análisis de imágenes mucho más detallado y preciso.

Comparación entre la detección de objetos y la segmentación de instancias

Fig. 1. Comparación entre la detección de objetos y la segmentación de instancias.

Un vistazo a la arquitectura de Mask R-CNN y su funcionamiento#

Mask R-CNN sigue un enfoque paso a paso para detectar y segmentar objetos con precisión. Primero extrae las características clave mediante una red neuronal profunda (un modelo de varias capas que aprende a partir de los datos); después identifica posibles áreas de objetos con una red de propuesta de regiones (un componente que sugiere regiones que probablemente contengan objetos); y, por último, perfecciona estas áreas creando máscaras de segmentación detalladas (contornos precisos de los objetos) que captan la forma exacta de cada objeto.

A continuación, repasaremos cada paso para comprender mejor cómo funciona Mask R-CNN.

Descripción general de la arquitectura de Mask R-CNN

Fig. 2. Descripción general de la arquitectura de Mask R-CNN (fuente: researchgate.net).

Comenzando por la extracción de características#

El primer paso de la arquitectura de Mask R-CNN consiste en descomponer la imagen en sus partes clave para que el modelo pueda entender qué contiene. Piensa en cómo miras una foto y percibes de forma natural detalles como formas, colores y bordes. El modelo hace algo parecido mediante una red neuronal profunda llamada «backbone» (normalmente ResNet-50 o ResNet-101), que actúa como sus ojos para explorar la imagen y captar los detalles clave.

Como los objetos de las imágenes pueden ser muy pequeños o muy grandes, Mask R-CNN utiliza una Feature Pyramid Network. Es como disponer de distintas lupas que permiten al modelo ver tanto los detalles más pequeños como la imagen general, garantizando que se detecten objetos de todos los tamaños.

Una vez extraídas las características importantes, el modelo pasa a localizar los posibles objetos de la imagen, sentando las bases para un análisis posterior.

Sugerir posibles áreas de la imagen que contienen objetos#

Una vez procesada la imagen para extraer sus características clave, entra en acción la red de propuesta de regiones. Esta parte del modelo examina la imagen y sugiere áreas que probablemente contengan objetos.

Lo hace generando varias ubicaciones posibles de objetos llamadas anclajes. A continuación, la red evalúa estos anclajes y selecciona los más prometedores para analizarlos con más detalle. De este modo, el modelo se centra solo en las áreas con más probabilidades de ser relevantes, en lugar de comprobar cada punto de la imagen.

Diagrama de una red de propuesta de regiones

Fig. 3. Ejemplo de una red de propuesta de regiones.

Mejora de las características extraídas#

Una vez identificadas las áreas clave, el siguiente paso consiste en perfeccionar los detalles extraídos de estas regiones. Los modelos anteriores utilizaban un método llamado ROI Pooling (agrupación de regiones de interés) para obtener características de cada área, pero esta técnica a veces provocaba ligeras desalineaciones al cambiar el tamaño de las regiones, lo que la hacía menos eficaz, especialmente con objetos pequeños o superpuestos.

Mask R-CNN mejora este proceso mediante una técnica denominada ROI Align (alineación de regiones de interés). En lugar de redondear las coordenadas como hace ROI Pooling, ROI Align utiliza interpolación bilineal para estimar los valores de los píxeles con mayor precisión. La interpolación bilineal calcula un nuevo valor de píxel promediando los valores de sus cuatro vecinos más cercanos, lo que crea transiciones más suaves. Así, las características permanecen correctamente alineadas con la imagen original, lo que da lugar a una detección y una segmentación de objetos más precisas.

Por ejemplo, en un partido de fútbol, dos jugadores que están cerca podrían confundirse entre sí porque sus cuadros delimitadores se solapan. ROI Align ayuda a separarlos manteniendo sus formas diferenciadas.

Diagrama de cómo Mask R-CNN utiliza ROI Align

Fig. 4. Mask R-CNN utiliza ROI Align.

Clasificación de objetos y predicción de sus máscaras#

Una vez que ROI Align procesa la imagen, el siguiente paso consiste en clasificar los objetos y ajustar sus ubicaciones con precisión. El modelo examina cada región extraída y decide qué objeto contiene. Asigna una puntuación de probabilidad a distintas categorías y elige la que mejor encaja.

Al mismo tiempo, ajusta los cuadros delimitadores para que se adapten mejor a los objetos. Es posible que los cuadros iniciales no estén colocados de forma ideal, por lo que este proceso mejora la precisión al garantizar que cada cuadro rodee estrechamente el objeto detectado.

Por último, Mask R-CNN da un paso adicional: genera en paralelo una máscara de segmentación detallada para cada objeto.

Mask R-CNN y sus aplicaciones en tiempo real#

Cuando apareció este modelo, despertó mucho entusiasmo en la comunidad de IA y pronto empezó a utilizarse en diversas aplicaciones. Su capacidad para detectar y segmentar objetos en tiempo real supuso un antes y un después en distintos sectores.

Por ejemplo, seguir a animales en peligro de extinción en la naturaleza es una tarea compleja. Muchas especies se desplazan por bosques densos, lo que dificulta su seguimiento por parte de los conservacionistas. Los métodos tradicionales utilizan cámaras trampa, drones e imágenes por satélite, pero revisar todos estos datos manualmente requiere mucho tiempo. Las identificaciones erróneas y los avistamientos que pasan desapercibidos pueden ralentizar los esfuerzos de conservación.

Al reconocer características únicas como las rayas de un tigre, las manchas de una jirafa o la forma de las orejas de un elefante, Mask R-CNN puede detectar y segmentar animales en imágenes y vídeos con mayor precisión. Incluso cuando los árboles ocultan parcialmente a los animales o estos están muy juntos, el modelo puede separarlos e identificar cada uno de forma individual, lo que hace que la supervisión de la fauna sea más rápida y fiable.

Detección y segmentación de animales mediante Mask R-CNN

Fig. 5. Detección y segmentación de animales mediante Mask R-CNN.

Limitaciones de Mask R-CNN#

A pesar de su importancia histórica en la detección y segmentación de objetos, Mask R-CNN también presenta algunas desventajas importantes. Estos son algunos desafíos relacionados con Mask R-CNN:

  • Alta demanda computacional: Depende de GPU potentes, lo que puede hacer que su ejecución sea costosa y lenta al procesar grandes cantidades de datos.
  • Menor velocidad de procesamiento: Su proceso de varias etapas lo hace más lento que modelos más rápidos en tiempo real, como YOLO, por lo que puede no ser ideal para tareas sensibles al tiempo.
  • Dependencia de datos de alta calidad: El modelo funciona mejor con imágenes claras y bien etiquetadas. Las imágenes borrosas o con poca iluminación pueden reducir considerablemente su precisión.
  • Implementación compleja: La arquitectura de varias etapas puede ser difícil de configurar y optimizar, especialmente al trabajar con conjuntos de datos grandes o recursos limitados.

De Mask R-CNN a Ultralytics YOLO11#

Mask R-CNN era excelente para las tareas de segmentación, pero muchos sectores buscaban adoptar la visión por ordenador dando prioridad a la velocidad y al rendimiento en tiempo real. Esta necesidad llevó a los investigadores a desarrollar modelos de una sola etapa que detectan objetos en una única pasada, mejorando considerablemente la eficiencia.

A diferencia del proceso de varias etapas de Mask R-CNN, los modelos de visión por ordenador de una sola etapa, como YOLO (You Only Look Once), se centran en tareas de visión por ordenador en tiempo real. En lugar de gestionar la detección y la segmentación por separado, los modelos YOLO pueden analizar una imagen de una sola vez. Esto los hace ideales para aplicaciones como la conducción autónoma, la sanidad, la fabricación y la robótica, donde la toma rápida de decisiones es crucial.

En particular, Ultralytics YOLO11 lleva este concepto un paso más allá al ser rápido y preciso. Utiliza un 22 % menos de parámetros que YOLOv8m, pero aun así alcanza una mayor precisión media promedio (mAP) en el conjunto de datos COCO, lo que significa que detecta los objetos con mayor precisión. Su mayor velocidad de procesamiento lo convierte en una buena opción para aplicaciones en tiempo real en las que cada milisegundo cuenta.

Rendimiento de Ultralytics YOLO11 en comparación con otros modelos

Fig. 6. Rendimiento de YOLO11 en comparación con otros modelos.

Conclusiones clave#

Al repasar la historia de la visión por ordenador, Mask R-CNN se reconoce como un avance importante en la detección y segmentación de objetos. Ofrece resultados muy precisos incluso en entornos complejos gracias a su detallado proceso de varias etapas.

Sin embargo, este mismo proceso lo hace más lento que los modelos en tiempo real, como YOLO. A medida que aumenta la necesidad de velocidad y eficiencia, muchas aplicaciones utilizan ahora modelos de una sola etapa como Ultralytics YOLO11, que ofrecen una detección de objetos rápida y precisa. Aunque Mask R-CNN es importante para comprender la evolución de la visión por ordenador, la tendencia hacia las soluciones en tiempo real pone de manifiesto la creciente demanda de soluciones de visión por ordenador más rápidas y eficientes.

¡Únete a nuestra creciente comunidad! Explora nuestro repositorio de GitHub para aprender más sobre IA. ¿Listo para empezar tus propios proyectos de visión por ordenador? Consulta nuestras opciones de licencia. Descubre la IA en la agricultura y la IA de visión en la sanidad visitando nuestras páginas de soluciones.

Explore solutions

Visión por computadora para imágenes aéreas

Visión por computadora para imágenes aéreas

Transforma imágenes de drones y aéreas en información en tiempo real para agricultura, acuicultura, supervisión ambiental, conservación y análisis geoespacial con Ultralytics YOLO.
Más información
Visión artificial en la industria aeroespacial

Visión artificial en la industria aeroespacial

Lleva la IA de visión al monitoreo aéreo con los modelos Ultralytics YOLO. Potencia drones, flujos de trabajo aeroespaciales, conservación ambiental e industrias geoespaciales con soluciones de visión artificial.
Más información

Protege cada sitio con los modelos Ultralytics YOLO. La IA de visión potencia el monitoreo perimetral, la detección de amenazas, el reconocimiento de matrículas y la seguridad laboral.
Más información
Visión artificial en robótica

Visión artificial en robótica

Impulsa máquinas más inteligentes con los modelos de Ultralytics YOLO. La IA de visión en robótica permite la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Visión artificial en logística

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La IA de visión permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad de los almacenes en tiempo real.
Más información
Visión artificial en comercio minorista

Visión artificial en comercio minorista

Reinventa el comercio minorista con los modelos de Ultralytics YOLO. La IA de visión impulsa el seguimiento del inventario, la supervisión de estanterías, la gestión de colas y un conocimiento más inteligente de los clientes.
Más información
Visión por computador en el sector sanitario

Visión por computador en el sector sanitario

Crea soluciones sanitarias con modelos de Ultralytics YOLO. La IA de visión en el sector sanitario permite obtener imágenes médicas más rápidamente, diagnósticos más inteligentes y supervisar a los pacientes.
Más información
Visión por computador en la fabricación

Visión por computador en la fabricación

Optimiza la fabricación con modelos de Ultralytics YOLO. La IA de visión impulsa el control de calidad, la detección de defectos, el cumplimiento del PPE y la automatización de las líneas de montaje.
Más información
Visión artificial en el sector automovilístico

Visión artificial en el sector automovilístico

Aplica visión artificial en el sector automovilístico con modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para conseguir carreteras más inteligentes.
Más información
Visión artificial en agricultura

Visión artificial en agricultura

Lleva la IA de visión a la agricultura inteligente con modelos de Ultralytics YOLO. Impulsa la supervisión de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas mayores e inteligentes.
Más información
Visión por computadora para imágenes aéreas

Visión por computadora para imágenes aéreas

Transforma imágenes de drones y aéreas en información en tiempo real para agricultura, acuicultura, supervisión ambiental, conservación y análisis geoespacial con Ultralytics YOLO.
Más información
Visión artificial en la industria aeroespacial

Visión artificial en la industria aeroespacial

Lleva la IA de visión al monitoreo aéreo con los modelos Ultralytics YOLO. Potencia drones, flujos de trabajo aeroespaciales, conservación ambiental e industrias geoespaciales con soluciones de visión artificial.
Más información

Protege cada sitio con los modelos Ultralytics YOLO. La IA de visión potencia el monitoreo perimetral, la detección de amenazas, el reconocimiento de matrículas y la seguridad laboral.
Más información
Visión artificial en robótica

Visión artificial en robótica

Impulsa máquinas más inteligentes con los modelos de Ultralytics YOLO. La IA de visión en robótica permite la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Visión artificial en logística

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La IA de visión permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad de los almacenes en tiempo real.
Más información
Visión artificial en comercio minorista

Visión artificial en comercio minorista

Reinventa el comercio minorista con los modelos de Ultralytics YOLO. La IA de visión impulsa el seguimiento del inventario, la supervisión de estanterías, la gestión de colas y un conocimiento más inteligente de los clientes.
Más información
Visión por computador en el sector sanitario

Visión por computador en el sector sanitario

Crea soluciones sanitarias con modelos de Ultralytics YOLO. La IA de visión en el sector sanitario permite obtener imágenes médicas más rápidamente, diagnósticos más inteligentes y supervisar a los pacientes.
Más información
Visión por computador en la fabricación

Visión por computador en la fabricación

Optimiza la fabricación con modelos de Ultralytics YOLO. La IA de visión impulsa el control de calidad, la detección de defectos, el cumplimiento del PPE y la automatización de las líneas de montaje.
Más información
Visión artificial en el sector automovilístico

Visión artificial en el sector automovilístico

Aplica visión artificial en el sector automovilístico con modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para conseguir carreteras más inteligentes.
Más información
Visión artificial en agricultura

Visión artificial en agricultura

Lleva la IA de visión a la agricultura inteligente con modelos de Ultralytics YOLO. Impulsa la supervisión de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas mayores e inteligentes.
Más información
Visión por computadora para imágenes aéreas

Visión por computadora para imágenes aéreas

Transforma imágenes de drones y aéreas en información en tiempo real para agricultura, acuicultura, supervisión ambiental, conservación y análisis geoespacial con Ultralytics YOLO.
Más información
Visión artificial en la industria aeroespacial

Visión artificial en la industria aeroespacial

Lleva la IA de visión al monitoreo aéreo con los modelos Ultralytics YOLO. Potencia drones, flujos de trabajo aeroespaciales, conservación ambiental e industrias geoespaciales con soluciones de visión artificial.
Más información

Protege cada sitio con los modelos Ultralytics YOLO. La IA de visión potencia el monitoreo perimetral, la detección de amenazas, el reconocimiento de matrículas y la seguridad laboral.
Más información
Visión artificial en robótica

Visión artificial en robótica

Impulsa máquinas más inteligentes con los modelos de Ultralytics YOLO. La IA de visión en robótica permite la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Visión artificial en logística

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La IA de visión permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad de los almacenes en tiempo real.
Más información
Visión artificial en comercio minorista

Visión artificial en comercio minorista

Reinventa el comercio minorista con los modelos de Ultralytics YOLO. La IA de visión impulsa el seguimiento del inventario, la supervisión de estanterías, la gestión de colas y un conocimiento más inteligente de los clientes.
Más información
Visión por computador en el sector sanitario

Visión por computador en el sector sanitario

Crea soluciones sanitarias con modelos de Ultralytics YOLO. La IA de visión en el sector sanitario permite obtener imágenes médicas más rápidamente, diagnósticos más inteligentes y supervisar a los pacientes.
Más información
Visión por computador en la fabricación

Visión por computador en la fabricación

Optimiza la fabricación con modelos de Ultralytics YOLO. La IA de visión impulsa el control de calidad, la detección de defectos, el cumplimiento del PPE y la automatización de las líneas de montaje.
Más información
Visión artificial en el sector automovilístico

Visión artificial en el sector automovilístico

Aplica visión artificial en el sector automovilístico con modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para conseguir carreteras más inteligentes.
Más información
Visión artificial en agricultura

Visión artificial en agricultura

Lleva la IA de visión a la agricultura inteligente con modelos de Ultralytics YOLO. Impulsa la supervisión de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas mayores e inteligentes.
Más información

¡Construyamos juntos el futuro de la IA!

Comienza tu recorrido hacia el futuro del aprendizaje automático