Ultralytics YOLO27:
IA visual

¿Qué es R-CNN? Una breve descripción general

Descubre R-CNN y su impacto en la detección de objetos. Analizaremos sus componentes principales, aplicaciones y papel en el avance de técnicas como Fast R-CNN y YOLO.

ABAbirami Vina9 min read
Cómo R-CNN realiza la detección de objetos basada en regiones

La detección de objetos es una tarea de visión artificial que puede reconocer y localizar objetos en imágenes o vídeos para aplicaciones como la conducción autónoma, la vigilancia y la obtención de imágenes médicas. Los primeros métodos de detección de objetos, como el detector Viola-Jones y el Histograma de gradientes orientados (HOG) con Máquinas de vectores de soporte (SVM), dependían de características diseñadas manualmente y ventanas deslizantes. Estos métodos solían tener dificultades para detectar objetos con precisión en escenas complejas con múltiples objetos de distintas formas y tamaños.

Las redes neuronales convolucionales basadas en regiones (R-CNN) han cambiado la forma de abordar la detección de objetos. Es un hito importante en la historia de la visión artificial. Para entender cómo surgieron modelos como Ultralytics YOLOv8, primero debemos comprender modelos como R-CNN.

Creada por Ross Girshick y su equipo, la arquitectura del modelo R-CNN genera propuestas de regiones, extrae características con una red neuronal convolucional preentrenada (CNN), clasifica objetos y refina los cuadros delimitadores. Aunque pueda parecer complicado, al final de este artículo entenderás claramente cómo funciona R-CNN y por qué ha tenido tanto impacto. ¡Vamos a verlo!

¿Cómo funciona R-CNN?#

El proceso de detección de objetos del modelo R-CNN consta de tres pasos principales: generar propuestas de regiones, extraer características y clasificar objetos mientras se refinan sus cuadros delimitadores. Vamos a repasar cada paso.

Diagrama de cómo funciona R-CNN

Fig. 1. Cómo funciona R-CNN.

Propuestas de regiones: la base de RCNN#

En el primer paso, el modelo R-CNN analiza la imagen para crear numerosas propuestas de regiones. Las propuestas de regiones son áreas potenciales que podrían contener objetos. Se utilizan métodos como Selective Search para examinar distintos aspectos de la imagen, como el color, la textura y la forma, y dividirla en diferentes partes. Selective Search comienza dividiendo la imagen en partes más pequeñas y, después, fusiona las que son similares para formar áreas de interés más grandes. Este proceso continúa hasta generar unas 2.000 propuestas de regiones.

Diagrama de cómo funciona Selective Search

Fig. 2. Cómo funciona Selective Search.

Estas propuestas de regiones ayudan a identificar todos los puntos posibles en los que podría estar presente un objeto. En los pasos siguientes, el modelo puede procesar eficazmente las áreas más relevantes al centrarse en estas zonas concretas en lugar de en toda la imagen. El uso de propuestas de regiones equilibra la exhaustividad con la eficiencia computacional.

Extracción de características de la imagen: capturar los detalles#

El siguiente paso del proceso de detección de objetos del modelo R-CNN consiste en extraer características de las propuestas de regiones. Cada propuesta de región se redimensiona a un tamaño uniforme que espera la CNN (por ejemplo, 224x224 píxeles). El redimensionado ayuda a la CNN a procesar cada propuesta de forma eficiente. Antes de deformarla, el tamaño de cada propuesta de región se amplía ligeramente para incluir 16 píxeles de contexto adicional alrededor de la región y proporcionar más información circundante para extraer mejor las características.

Una vez redimensionadas, estas propuestas de regiones se introducen en una CNN como AlexNet, que normalmente se ha preentrenado con un conjunto de datos grande como ImageNet. La CNN procesa cada región para extraer vectores de características de alta dimensionalidad que capturan detalles importantes, como bordes, texturas y patrones. Estos vectores de características condensan la información esencial de las regiones. Transforman los datos de imagen sin procesar en un formato que el modelo puede utilizar para análisis posteriores. La clasificación y localización precisas de los objetos en las siguientes etapas dependen de esta conversión esencial de la información visual en datos significativos.

Extracción de características de una propuesta de región mediante AlexNet

Fig. 3. Extraer características de una propuesta de región mediante AlexNet.

Clasificación de objetos: identificar los objetos detectados#

El tercer paso consiste en clasificar los objetos dentro de estas regiones. Esto significa determinar la categoría o clase de cada objeto encontrado en las propuestas. A continuación, los vectores de características extraídos pasan por un clasificador de aprendizaje automático.

En el caso de R-CNN, las Máquinas de vectores de soporte (SVM) se utilizan habitualmente para este fin. Cada SVM se entrena para reconocer una clase de objeto específica mediante el análisis de los vectores de características y la decisión de si una región concreta contiene un ejemplar de esa clase. En esencia, para cada categoría de objeto hay un clasificador específico que comprueba si cada propuesta de región contiene ese objeto concreto.

Durante el entrenamiento, los clasificadores reciben datos etiquetados con muestras positivas y negativas:

  • Muestras positivas: regiones que contienen el objeto objetivo.
  • Muestras negativas: regiones sin el objeto.

Los clasificadores aprenden a distinguir entre estas muestras. La regresión de cuadros delimitadores refina aún más la posición y el tamaño de los objetos detectados al ajustar los cuadros delimitadores propuestos inicialmente para que coincidan mejor con los límites reales del objeto. El modelo R-CNN puede identificar y localizar objetos con precisión al combinar la clasificación con la regresión de cuadros delimitadores.

Ejemplo de regresión de cuadros delimitadores

Fig. 4. Un ejemplo de regresión de cuadros delimitadores. (fuente: towardsdatascience.com)

Unirlo todo: refinar las detecciones con NMS#

Después de los pasos de clasificación y regresión de cuadros delimitadores, el modelo suele generar varios cuadros delimitadores superpuestos para el mismo objeto. Se aplica la supresión de no máximos (NMS) para refinar estas detecciones y conservar los cuadros más precisos. El modelo elimina los cuadros redundantes y superpuestos aplicando NMS y conserva únicamente las detecciones con mayor confianza.

NMS funciona evaluando las puntuaciones de confianza (que indican la probabilidad de que un objeto detectado esté realmente presente) de todos los cuadros delimitadores y suprimiendo aquellos que se superponen significativamente con cuadros de puntuación más alta.

Ejemplo de supresión de no máximos

Fig. 5. Un ejemplo de supresión de no máximos. (fuente: towardsdatascience.com)

Estos son los pasos de NMS:

  • Ordenación: los cuadros delimitadores se ordenan por sus puntuaciones de confianza en orden descendente.
  • Selección: se selecciona el cuadro con la puntuación más alta y se eliminan todos los cuadros que se superponen significativamente con él (según la intersección sobre unión, IoU).
  • Iteración: este proceso se repite con el siguiente cuadro con mayor puntuación y continúa hasta haber procesado todos los cuadros.

En conjunto, el modelo R-CNN detecta objetos generando propuestas de regiones, extrayendo características con una CNN, clasificando objetos y refinando sus posiciones mediante la regresión de cuadros delimitadores, y utilizando la supresión de no máximos (NMS) para conservar únicamente las detecciones más precisas.

R-CNN es un hito en la detección de objetos#

R-CNN es un modelo emblemático en la historia de la detección de objetos porque introdujo un nuevo enfoque que mejoró considerablemente la precisión y el rendimiento. Antes de R-CNN, los modelos de detección de objetos tenían dificultades para equilibrar velocidad y precisión. El método de R-CNN, que genera propuestas de regiones y utiliza CNN para extraer características, permite localizar e identificar objetos con precisión dentro de las imágenes.

R-CNN allanó el camino para modelos como Fast R-CNN, Faster R-CNN y Mask R-CNN, que mejoraron aún más la eficiencia y la precisión. Al combinar el aprendizaje profundo con el análisis basado en regiones, R-CNN estableció un nuevo estándar en el campo y abrió posibilidades para diversas aplicaciones del mundo real.

Transformar la obtención de imágenes médicas con R-CNN#

Un caso de uso interesante de R-CNN es la obtención de imágenes médicas. Los modelos R-CNN se han utilizado para detectar y clasificar distintos tipos de tumores, como los tumores cerebrales, en exploraciones médicas como las resonancias magnéticas y las tomografías computarizadas. El uso del modelo R-CNN en la obtención de imágenes médicas mejora la precisión del diagnóstico y ayuda a los radiólogos a identificar tumores malignos en una fase temprana. La capacidad de R-CNN para detectar incluso tumores pequeños y en fases iniciales puede marcar una diferencia significativa en el tratamiento y el pronóstico de enfermedades como el cáncer.

Detección de tumores cerebrales mediante R-CNN

Fig. 6. Detección de tumores cerebrales mediante RCNN.

El modelo R-CNN puede aplicarse a otras tareas de obtención de imágenes médicas además de la detección de tumores. Por ejemplo, puede identificar fracturas, detectar enfermedades de la retina en exploraciones oculares y analizar imágenes pulmonares para detectar afecciones como la neumonía y la COVID-19. Independientemente del problema médico, la detección temprana puede conducir a mejores resultados para los pacientes. Al aplicar la precisión de R-CNN para identificar y localizar anomalías, los proveedores de servicios sanitarios pueden mejorar la fiabilidad y la rapidez de los diagnósticos médicos. Al agilizar el proceso de diagnóstico mediante la detección de objetos, los pacientes pueden beneficiarse de planes de tratamiento oportunos y precisos.

Limitaciones de R-CNN y sus sucesores#

Aunque es impresionante, R-CNN presenta ciertos inconvenientes, como una elevada complejidad computacional y tiempos de inferencia lentos. Estos inconvenientes hacen que el modelo R-CNN no sea adecuado para aplicaciones en tiempo real. Separar las propuestas de regiones y las clasificaciones en pasos distintos puede dar lugar a un rendimiento menos eficiente.

Con el paso de los años, han surgido diversos modelos de detección de objetos que han abordado estas limitaciones. Fast R-CNN combina las propuestas de regiones y la extracción de características de la CNN en un único paso, lo que acelera el proceso. Faster R-CNN introduce una red de propuestas de regiones (RPN) para agilizar la generación de propuestas, mientras que Mask R-CNN añade segmentación a nivel de píxel para obtener detecciones más detalladas.

Comparación de R-CNN, Fast R-CNN, Faster R-CNN y Mask R-CNN

Fig. 7. Comparación de R-CNN, Fast R-CNN, Faster R-CNN y Mask R-CNN.

Por aproximadamente la misma época que Faster R-CNN, la serie YOLO (Solo miras una vez) empezó a impulsar la detección de objetos en tiempo real. Los modelos YOLO predicen cuadros delimitadores y probabilidades de clase en una sola pasada por la red. Por ejemplo, Ultralytics YOLOv8 ofrece una precisión y una velocidad mejoradas, con funciones avanzadas para muchas tareas de visión artificial.

Conclusiones clave#

RCNN cambió las reglas del juego en la visión artificial al demostrar cómo el aprendizaje profundo puede transformar la detección de objetos. Su éxito inspiró muchas ideas nuevas en el campo. Aunque han surgido modelos más recientes, como Faster R-CNN y YOLO, para corregir las deficiencias de RCNN, su contribución constituye un hito enorme que es importante recordar.

A medida que continúe la investigación, veremos modelos de detección de objetos aún mejores y más rápidos. Estos avances no solo mejorarán la forma en que las máquinas entienden el mundo, sino que también impulsarán el progreso en muchos sectores. ¡El futuro de la detección de objetos es apasionante!

¿Quieres seguir explorando la IA? ¡Forma parte de la comunidad de Ultralytics! Explora nuestro repositorio de GitHub para conocer nuestras últimas innovaciones en inteligencia artificial. Descubre nuestras soluciones de IA para sectores tan diversos como la agricultura y la fabricación. ¡Únete a nosotros para aprender y avanzar!

Explore solutions

Visión por computadora para imágenes aéreas

Visión por computadora para imágenes aéreas

Transforma imágenes de drones y aéreas en información en tiempo real para agricultura, acuicultura, supervisión ambiental, conservación y análisis geoespacial con Ultralytics YOLO.
Más información
Visión artificial en la industria aeroespacial

Visión artificial en la industria aeroespacial

Lleva la IA de visión al monitoreo aéreo con los modelos Ultralytics YOLO. Potencia drones, flujos de trabajo aeroespaciales, conservación ambiental e industrias geoespaciales con soluciones de visión artificial.
Más información

Protege cada sitio con los modelos Ultralytics YOLO. La IA de visión potencia el monitoreo perimetral, la detección de amenazas, el reconocimiento de matrículas y la seguridad laboral.
Más información
Visión artificial en robótica

Visión artificial en robótica

Impulsa máquinas más inteligentes con los modelos de Ultralytics YOLO. La IA de visión en robótica permite la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Visión artificial en logística

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La IA de visión permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad de los almacenes en tiempo real.
Más información
Visión artificial en comercio minorista

Visión artificial en comercio minorista

Reinventa el comercio minorista con los modelos de Ultralytics YOLO. La IA de visión impulsa el seguimiento del inventario, la supervisión de estanterías, la gestión de colas y un conocimiento más inteligente de los clientes.
Más información
Visión por computador en el sector sanitario

Visión por computador en el sector sanitario

Crea soluciones sanitarias con modelos de Ultralytics YOLO. La IA de visión en el sector sanitario permite obtener imágenes médicas más rápidamente, diagnósticos más inteligentes y supervisar a los pacientes.
Más información
Visión por computador en la fabricación

Visión por computador en la fabricación

Optimiza la fabricación con modelos de Ultralytics YOLO. La IA de visión impulsa el control de calidad, la detección de defectos, el cumplimiento del PPE y la automatización de las líneas de montaje.
Más información
Visión artificial en el sector automovilístico

Visión artificial en el sector automovilístico

Aplica visión artificial en el sector automovilístico con modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para conseguir carreteras más inteligentes.
Más información
Visión artificial en agricultura

Visión artificial en agricultura

Lleva la IA de visión a la agricultura inteligente con modelos de Ultralytics YOLO. Impulsa la supervisión de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas mayores e inteligentes.
Más información
Visión por computadora para imágenes aéreas

Visión por computadora para imágenes aéreas

Transforma imágenes de drones y aéreas en información en tiempo real para agricultura, acuicultura, supervisión ambiental, conservación y análisis geoespacial con Ultralytics YOLO.
Más información
Visión artificial en la industria aeroespacial

Visión artificial en la industria aeroespacial

Lleva la IA de visión al monitoreo aéreo con los modelos Ultralytics YOLO. Potencia drones, flujos de trabajo aeroespaciales, conservación ambiental e industrias geoespaciales con soluciones de visión artificial.
Más información

Protege cada sitio con los modelos Ultralytics YOLO. La IA de visión potencia el monitoreo perimetral, la detección de amenazas, el reconocimiento de matrículas y la seguridad laboral.
Más información
Visión artificial en robótica

Visión artificial en robótica

Impulsa máquinas más inteligentes con los modelos de Ultralytics YOLO. La IA de visión en robótica permite la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Visión artificial en logística

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La IA de visión permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad de los almacenes en tiempo real.
Más información
Visión artificial en comercio minorista

Visión artificial en comercio minorista

Reinventa el comercio minorista con los modelos de Ultralytics YOLO. La IA de visión impulsa el seguimiento del inventario, la supervisión de estanterías, la gestión de colas y un conocimiento más inteligente de los clientes.
Más información
Visión por computador en el sector sanitario

Visión por computador en el sector sanitario

Crea soluciones sanitarias con modelos de Ultralytics YOLO. La IA de visión en el sector sanitario permite obtener imágenes médicas más rápidamente, diagnósticos más inteligentes y supervisar a los pacientes.
Más información
Visión por computador en la fabricación

Visión por computador en la fabricación

Optimiza la fabricación con modelos de Ultralytics YOLO. La IA de visión impulsa el control de calidad, la detección de defectos, el cumplimiento del PPE y la automatización de las líneas de montaje.
Más información
Visión artificial en el sector automovilístico

Visión artificial en el sector automovilístico

Aplica visión artificial en el sector automovilístico con modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para conseguir carreteras más inteligentes.
Más información
Visión artificial en agricultura

Visión artificial en agricultura

Lleva la IA de visión a la agricultura inteligente con modelos de Ultralytics YOLO. Impulsa la supervisión de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas mayores e inteligentes.
Más información
Visión por computadora para imágenes aéreas

Visión por computadora para imágenes aéreas

Transforma imágenes de drones y aéreas en información en tiempo real para agricultura, acuicultura, supervisión ambiental, conservación y análisis geoespacial con Ultralytics YOLO.
Más información
Visión artificial en la industria aeroespacial

Visión artificial en la industria aeroespacial

Lleva la IA de visión al monitoreo aéreo con los modelos Ultralytics YOLO. Potencia drones, flujos de trabajo aeroespaciales, conservación ambiental e industrias geoespaciales con soluciones de visión artificial.
Más información

Protege cada sitio con los modelos Ultralytics YOLO. La IA de visión potencia el monitoreo perimetral, la detección de amenazas, el reconocimiento de matrículas y la seguridad laboral.
Más información
Visión artificial en robótica

Visión artificial en robótica

Impulsa máquinas más inteligentes con los modelos de Ultralytics YOLO. La IA de visión en robótica permite la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Visión artificial en logística

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La IA de visión permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad de los almacenes en tiempo real.
Más información
Visión artificial en comercio minorista

Visión artificial en comercio minorista

Reinventa el comercio minorista con los modelos de Ultralytics YOLO. La IA de visión impulsa el seguimiento del inventario, la supervisión de estanterías, la gestión de colas y un conocimiento más inteligente de los clientes.
Más información
Visión por computador en el sector sanitario

Visión por computador en el sector sanitario

Crea soluciones sanitarias con modelos de Ultralytics YOLO. La IA de visión en el sector sanitario permite obtener imágenes médicas más rápidamente, diagnósticos más inteligentes y supervisar a los pacientes.
Más información
Visión por computador en la fabricación

Visión por computador en la fabricación

Optimiza la fabricación con modelos de Ultralytics YOLO. La IA de visión impulsa el control de calidad, la detección de defectos, el cumplimiento del PPE y la automatización de las líneas de montaje.
Más información
Visión artificial en el sector automovilístico

Visión artificial en el sector automovilístico

Aplica visión artificial en el sector automovilístico con modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para conseguir carreteras más inteligentes.
Más información
Visión artificial en agricultura

Visión artificial en agricultura

Lleva la IA de visión a la agricultura inteligente con modelos de Ultralytics YOLO. Impulsa la supervisión de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas mayores e inteligentes.
Más información

¡Construyamos juntos el futuro de la IA!

Comienza tu recorrido hacia el futuro del aprendizaje automático