Ultralytics YOLO27:
Guías

¿Qué es ResNet-50 y cuál es su relevancia en la visión artificial?

Descubre cómo la arquitectura de ResNet-50 permite clasificar imágenes en aplicaciones del mundo real en los sectores sanitario y manufacturero, así como en sistemas autónomos.

ABAbirami Vina10 min read
Arquitectura de ResNet-50 para la clasificación de imágenes

El análisis automatizado de imágenes es cada vez más habitual en aplicaciones como la detección de coches que circulan a gran velocidad o el análisis de imágenes médicas. La tecnología que impulsa estas innovaciones es la visión por ordenador o la IA de visión. Es una rama de la inteligencia artificial (AI) que permite a las máquinas interpretar y comprender imágenes y vídeos, de forma muy similar a los humanos.

Para crear estas soluciones de visión por ordenador, los desarrolladores recurren a modelos de IA de visión capaces de aprender a partir de grandes cantidades de datos visuales. Con el paso de los años, los investigadores han desarrollado modelos más nuevos y avanzados, con un rendimiento impresionante en tareas de IA de visión como la clasificación de imágenes (asignar etiquetas a imágenes), la detección de objetos (localizar e identificar objetos dentro de imágenes) y la segmentación de instancias (detectar objetos y delinear sus formas exactas).

Sin embargo, echar la vista atrás y comprender los primeros modelos puede ayudar a entender cómo funcionan los sistemas actuales de visión por ordenador. Por ejemplo, un caso clave es ResNet-50, un modelo influyente que introdujo la idea de las conexiones de atajo, rutas sencillas que ayudan al modelo a aprender de forma más rápida y precisa.

Esta innovación hizo posible entrenar eficazmente redes neuronales mucho más profundas, lo que produjo mejoras significativas en la clasificación de imágenes y dio forma al diseño de muchos de los modelos posteriores. En este artículo exploraremos ResNet-50, su funcionamiento y su relevancia en la evolución de la visión por ordenador. ¡Empecemos!

¿Qué es ResNet-50?#

ResNet-50 es un modelo de visión por ordenador basado en un tipo de red neuronal llamada red neuronal convolucional (CNN). Las CNN están diseñadas para ayudar a los ordenadores a comprender la información visual mediante el aprendizaje de patrones en las imágenes, como bordes, colores o formas, y el uso de esos patrones para reconocer y clasificar objetos.

Presentado en 2015 por investigadores de Microsoft Research, ResNet-50 se convirtió rápidamente en uno de los modelos más influyentes del sector gracias a su precisión y eficiencia en tareas de reconocimiento de imágenes a gran escala.

Una característica clave de ResNet-50 es el uso de conexiones residuales, también conocidas como conexiones de atajo. Son rutas sencillas que permiten al modelo saltarse algunos pasos del proceso de aprendizaje. En otras palabras, en lugar de obligar al modelo a pasar la información por todas y cada una de las capas, estos atajos le permiten transferir los detalles importantes de forma más directa. Esto hace que el aprendizaje sea más rápido y fiable.

Diagrama de las conexiones residuales en la arquitectura ResNet

Fig. 1. Un vistazo a las conexiones residuales en la arquitectura ResNet.

Este diseño ayuda a resolver un problema habitual del aprendizaje profundo llamado problema del gradiente evanescente. En los modelos muy profundos, la información importante puede perderse al atravesar muchas capas, lo que dificulta el aprendizaje del modelo.

Las conexiones residuales ayudan a evitarlo al mantener un flujo de información claro de principio a fin. Por eso el modelo se llama ResNet-50: ResNet significa Red Residual, y el «50» hace referencia al número de capas que utiliza para procesar una imagen.

Descripción general del funcionamiento de ResNet-50#

ResNet-50 tiene una estructura bien organizada que permite al modelo profundizar sin perder información importante. Sigue un patrón sencillo y repetible que mantiene la eficiencia y, al mismo tiempo, permite obtener un alto rendimiento.

Veamos más de cerca cómo funciona la arquitectura de ResNet-50:

  • Extracción de características básica: El modelo comienza aplicando una operación matemática llamada convolución. Esta consiste en deslizar pequeños filtros (llamados kernels) sobre la imagen para generar mapas de características, versiones nuevas de la imagen que resaltan patrones básicos como bordes o texturas. Así es como el modelo empieza a captar información visual útil.
  • Aprendizaje de características complejas: A medida que los datos avanzan por la red, el tamaño de los mapas de características se reduce. Esto se consigue mediante técnicas como el pooling o el uso de filtros con pasos más grandes (llamados strides). Al mismo tiempo, la red crea más mapas de características, lo que le ayuda a captar patrones cada vez más complejos, como formas, partes de objetos o texturas.
  • Compresión y expansión de datos: Cada etapa comprime los datos, los procesa y después los vuelve a expandir. Esto ayuda al modelo a aprender y, al mismo tiempo, ahorra memoria.
  • Conexiones de atajo: Son rutas sencillas que permiten que la información avance sin pasar por todas las capas. Hacen que el aprendizaje sea más estable y eficiente.
  • Realización de una predicción: Al final de la red, toda la información aprendida se combina y pasa por una función softmax. Esto genera una distribución de probabilidad sobre las clases posibles, que indica la confianza del modelo en cada predicción; por ejemplo, 90 % gato, 9 % perro y 1 % coche.

Diagrama de la arquitectura de ResNet-50

Fig. 2. La arquitectura de ResNet-50.

Características clave de ResNet-50#

Aunque ResNet-50 se diseñó originalmente para la clasificación de imágenes, su diseño flexible lo ha hecho útil en muchas áreas de la visión por ordenador. Veamos algunas de las características que hacen destacar a ResNet-50.

Uso de ResNet-50 para la clasificación de imágenes#

ResNet-50 se utiliza principalmente para la clasificación de imágenes, cuyo objetivo es asignar una etiqueta a una imagen. Por ejemplo, dada una foto, el modelo puede etiquetarla como perro, gato o avión según el objeto principal que detecte.

Su diseño fiable y su disponibilidad en bibliotecas de aprendizaje profundo muy utilizadas, como PyTorch y TensorFlow, convirtieron a ResNet-50 en una opción inicial popular para entrenar con grandes conjuntos de datos de imágenes. Uno de los ejemplos más conocidos es ImageNet, una enorme colección de imágenes etiquetadas que se utiliza para evaluar y comparar modelos de visión por ordenador.

Aunque los modelos más nuevos, como Ultralytics YOLO11, ofrecen un rendimiento superior, ResNet-50 se sigue utilizando habitualmente como referencia gracias a su sólido equilibrio entre precisión, velocidad y simplicidad.

Uso de ResNet-50 para clasificar una imagen de un perro

Fig. 3. Ejemplo del uso de ResNet-50 para clasificar un perro.

Detección de objetos mediante backbones ResNet-50#

Mientras que la clasificación de imágenes consiste en identificar el objeto principal de una imagen, la detección de objetos va un paso más allá al encontrar y etiquetar varios objetos en la misma imagen. Por ejemplo, en una imagen de una calle concurrida, un modelo podría tener que detectar coches, autobuses y personas, y determinar dónde se encuentra cada uno.

ResNet-50 se utiliza como backbone en algunos de estos modelos. Esto significa que se encarga de la primera parte del trabajo: analizar la imagen y extraer los detalles importantes que describen qué contiene y dónde se encuentra. Estos detalles se pasan después a la siguiente parte del modelo, llamada cabeza de detección, que toma las decisiones finales sobre qué objetos hay en la imagen y dónde están.

Modelos de detección populares como Faster R-CNN y DETR utilizan ResNet-50 para este paso de extracción de características. Como captura bien tanto los detalles minuciosos como la disposición general de una imagen, ayuda a estos modelos a realizar predicciones precisas, incluso en escenas complejas.

Aprendizaje por transferencia con ResNet-50#

Otro aspecto interesante del modelo ResNet-50 es su capacidad para admitir el aprendizaje por transferencia. Esto significa que el modelo, entrenado originalmente con un conjunto de datos grande como ImageNet para la clasificación de imágenes, puede adaptarse a tareas nuevas con muchos menos datos.

En lugar de empezar desde cero, se reutiliza la mayoría de las capas del modelo y solo se sustituye y se vuelve a entrenar la capa de clasificación final para la tarea nueva. Esto ahorra tiempo y resulta especialmente útil cuando los datos etiquetados son limitados.

Aplicaciones de ResNet-50 en la visión por ordenador#

La arquitectura de ResNet-50 la hizo útil para una amplia variedad de aplicaciones de visión por ordenador. Fue especialmente importante en los primeros años del aprendizaje profundo, ya que ayudó a trasladar la tecnología de IA de visión de la investigación al uso en el mundo real. Al resolver desafíos clave, contribuyó a allanar el camino para los modelos más avanzados que vemos en las aplicaciones actuales.

Imágenes médicas impulsadas por ResNet-50#

ResNet-50 fue uno de los primeros modelos utilizados en el análisis de imágenes médicas basado en aprendizaje profundo. Los investigadores lo han empleado para identificar patrones de enfermedades en radiografías, resonancias magnéticas y otras exploraciones diagnósticas. Por ejemplo, ha ayudado a detectar tumores y clasificar imágenes de retinas diabéticas para apoyar el diagnóstico en oftalmología.

Aunque actualmente se utilizan modelos más avanzados en herramientas clínicas, ResNet-50 desempeñó un papel clave en las primeras investigaciones sobre IA médica. Su facilidad de uso y su diseño modular lo convirtieron en una opción adecuada para crear prototipos de sistemas de diagnóstico.

Detección de tumores cerebrales en exploraciones médicas basada en ResNet-50

Fig. 4. Detección de tumores cerebrales basada en ResNet-50.

Automatización industrial impulsada por ResNet-50#

Del mismo modo, ResNet-50 también se ha aplicado en entornos industriales. Por ejemplo, en la fabricación, se ha utilizado en investigaciones y sistemas piloto para detectar defectos superficiales en materiales como acero, hormigón y piezas pintadas.

También se ha probado en configuraciones para identificar agujeros, grietas o depósitos que se forman durante la fundición o el ensamblaje. ResNet-50 es especialmente adecuado para estas tareas porque puede detectar diferencias sutiles en la textura de las superficies, una capacidad importante para la inspección de calidad.

Aunque actualmente los modelos más avanzados, como Ultralytics YOLO11, se utilizan habitualmente en sistemas de producción, ResNet-50 sigue desempeñando un papel importante en la investigación académica y la evaluación comparativa, especialmente en tareas de clasificación de imágenes.

Inspección de defectos superficiales mediante ResNet-50

Fig. 5. Inspección de superficies mediante ResNet-50.

Ventajas y limitaciones de ResNet-50#

Estas son algunas de las ventajas de ResNet-50:

  • Rendimiento sólido como referencia: ResNet-50 ofrece una precisión sólida en una amplia variedad de tareas, lo que lo convierte en una referencia de confianza tanto en proyectos de investigación como aplicados.
  • Bien documentado y ampliamente estudiado: Su arquitectura se comprende bien y está documentada exhaustivamente, lo que facilita la resolución de problemas y el aprendizaje a desarrolladores e investigadores.
  • Versátil en distintos ámbitos: Desde el análisis de imágenes médicas hasta la fabricación, ResNet-50 se ha aplicado con éxito a diversos problemas del mundo real, demostrando su flexibilidad.

Por otro lado, estas son algunas de las limitaciones de ResNet-50:

  • Alto consumo de recursos: ResNet-50 requiere más memoria y potencia de cálculo que los modelos ligeros, lo que puede hacerlo menos adecuado para dispositivos móviles o aplicaciones en tiempo real.
  • Sobreajuste en conjuntos de datos pequeños: Debido a su profundidad y complejidad, ResNet-50 puede sobreajustarse cuando se entrena con datos limitados sin las técnicas de regularización adecuadas.
  • Tamaño de entrada fijo: ResNet-50 suele esperar imágenes de un tamaño específico, como 224×224 píxeles, por lo que a menudo es necesario cambiar su tamaño o recortarlas, lo que en ocasiones puede eliminar detalles importantes.

Conclusiones clave#

ResNet-50 demostró que las redes muy profundas podían entrenarse eficazmente y seguir ofreciendo un rendimiento sólido en tareas visuales. Su arquitectura proporcionó un marco claro y práctico para crear modelos más profundos que funcionaran de forma fiable.

Tras su lanzamiento, los investigadores ampliaron el diseño y crearon versiones más profundas, como ResNet-101 y ResNet-152. En conjunto, ResNet-50 es un modelo clave que ayudó a definir la forma en que se utiliza actualmente el aprendizaje profundo en la visión por ordenador.

¡Únete a nuestra creciente comunidad! Explora nuestro repositorio de GitHub para aprender más sobre IA. ¿Listo para empezar tus propios proyectos de visión por ordenador? Consulta nuestras opciones de licencia. Descubre la IA en la agricultura y la IA de visión en la sanidad visitando nuestras páginas de soluciones.

Explore solutions

Visión por computadora para imágenes aéreas

Visión por computadora para imágenes aéreas

Transforma imágenes de drones y aéreas en información en tiempo real para agricultura, acuicultura, supervisión ambiental, conservación y análisis geoespacial con Ultralytics YOLO.
Más información
Visión artificial en la industria aeroespacial

Visión artificial en la industria aeroespacial

Lleva la IA de visión al monitoreo aéreo con los modelos Ultralytics YOLO. Potencia drones, flujos de trabajo aeroespaciales, conservación ambiental e industrias geoespaciales con soluciones de visión artificial.
Más información

Protege cada sitio con los modelos Ultralytics YOLO. La IA de visión potencia el monitoreo perimetral, la detección de amenazas, el reconocimiento de matrículas y la seguridad laboral.
Más información
Visión artificial en robótica

Visión artificial en robótica

Impulsa máquinas más inteligentes con los modelos de Ultralytics YOLO. La IA de visión en robótica permite la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Visión artificial en logística

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La IA de visión permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad de los almacenes en tiempo real.
Más información
Visión artificial en comercio minorista

Visión artificial en comercio minorista

Reinventa el comercio minorista con los modelos de Ultralytics YOLO. La IA de visión impulsa el seguimiento del inventario, la supervisión de estanterías, la gestión de colas y un conocimiento más inteligente de los clientes.
Más información
Visión por computador en el sector sanitario

Visión por computador en el sector sanitario

Crea soluciones sanitarias con modelos de Ultralytics YOLO. La IA de visión en el sector sanitario permite obtener imágenes médicas más rápidamente, diagnósticos más inteligentes y supervisar a los pacientes.
Más información
Visión por computador en la fabricación

Visión por computador en la fabricación

Optimiza la fabricación con modelos de Ultralytics YOLO. La IA de visión impulsa el control de calidad, la detección de defectos, el cumplimiento del PPE y la automatización de las líneas de montaje.
Más información
Visión artificial en el sector automovilístico

Visión artificial en el sector automovilístico

Aplica visión artificial en el sector automovilístico con modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para conseguir carreteras más inteligentes.
Más información
Visión artificial en agricultura

Visión artificial en agricultura

Lleva la IA de visión a la agricultura inteligente con modelos de Ultralytics YOLO. Impulsa la supervisión de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas mayores e inteligentes.
Más información
Visión por computadora para imágenes aéreas

Visión por computadora para imágenes aéreas

Transforma imágenes de drones y aéreas en información en tiempo real para agricultura, acuicultura, supervisión ambiental, conservación y análisis geoespacial con Ultralytics YOLO.
Más información
Visión artificial en la industria aeroespacial

Visión artificial en la industria aeroespacial

Lleva la IA de visión al monitoreo aéreo con los modelos Ultralytics YOLO. Potencia drones, flujos de trabajo aeroespaciales, conservación ambiental e industrias geoespaciales con soluciones de visión artificial.
Más información

Protege cada sitio con los modelos Ultralytics YOLO. La IA de visión potencia el monitoreo perimetral, la detección de amenazas, el reconocimiento de matrículas y la seguridad laboral.
Más información
Visión artificial en robótica

Visión artificial en robótica

Impulsa máquinas más inteligentes con los modelos de Ultralytics YOLO. La IA de visión en robótica permite la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Visión artificial en logística

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La IA de visión permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad de los almacenes en tiempo real.
Más información
Visión artificial en comercio minorista

Visión artificial en comercio minorista

Reinventa el comercio minorista con los modelos de Ultralytics YOLO. La IA de visión impulsa el seguimiento del inventario, la supervisión de estanterías, la gestión de colas y un conocimiento más inteligente de los clientes.
Más información
Visión por computador en el sector sanitario

Visión por computador en el sector sanitario

Crea soluciones sanitarias con modelos de Ultralytics YOLO. La IA de visión en el sector sanitario permite obtener imágenes médicas más rápidamente, diagnósticos más inteligentes y supervisar a los pacientes.
Más información
Visión por computador en la fabricación

Visión por computador en la fabricación

Optimiza la fabricación con modelos de Ultralytics YOLO. La IA de visión impulsa el control de calidad, la detección de defectos, el cumplimiento del PPE y la automatización de las líneas de montaje.
Más información
Visión artificial en el sector automovilístico

Visión artificial en el sector automovilístico

Aplica visión artificial en el sector automovilístico con modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para conseguir carreteras más inteligentes.
Más información
Visión artificial en agricultura

Visión artificial en agricultura

Lleva la IA de visión a la agricultura inteligente con modelos de Ultralytics YOLO. Impulsa la supervisión de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas mayores e inteligentes.
Más información
Visión por computadora para imágenes aéreas

Visión por computadora para imágenes aéreas

Transforma imágenes de drones y aéreas en información en tiempo real para agricultura, acuicultura, supervisión ambiental, conservación y análisis geoespacial con Ultralytics YOLO.
Más información
Visión artificial en la industria aeroespacial

Visión artificial en la industria aeroespacial

Lleva la IA de visión al monitoreo aéreo con los modelos Ultralytics YOLO. Potencia drones, flujos de trabajo aeroespaciales, conservación ambiental e industrias geoespaciales con soluciones de visión artificial.
Más información

Protege cada sitio con los modelos Ultralytics YOLO. La IA de visión potencia el monitoreo perimetral, la detección de amenazas, el reconocimiento de matrículas y la seguridad laboral.
Más información
Visión artificial en robótica

Visión artificial en robótica

Impulsa máquinas más inteligentes con los modelos de Ultralytics YOLO. La IA de visión en robótica permite la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Visión artificial en logística

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La IA de visión permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad de los almacenes en tiempo real.
Más información
Visión artificial en comercio minorista

Visión artificial en comercio minorista

Reinventa el comercio minorista con los modelos de Ultralytics YOLO. La IA de visión impulsa el seguimiento del inventario, la supervisión de estanterías, la gestión de colas y un conocimiento más inteligente de los clientes.
Más información
Visión por computador en el sector sanitario

Visión por computador en el sector sanitario

Crea soluciones sanitarias con modelos de Ultralytics YOLO. La IA de visión en el sector sanitario permite obtener imágenes médicas más rápidamente, diagnósticos más inteligentes y supervisar a los pacientes.
Más información
Visión por computador en la fabricación

Visión por computador en la fabricación

Optimiza la fabricación con modelos de Ultralytics YOLO. La IA de visión impulsa el control de calidad, la detección de defectos, el cumplimiento del PPE y la automatización de las líneas de montaje.
Más información
Visión artificial en el sector automovilístico

Visión artificial en el sector automovilístico

Aplica visión artificial en el sector automovilístico con modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para conseguir carreteras más inteligentes.
Más información
Visión artificial en agricultura

Visión artificial en agricultura

Lleva la IA de visión a la agricultura inteligente con modelos de Ultralytics YOLO. Impulsa la supervisión de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas mayores e inteligentes.
Más información

¡Construyamos juntos el futuro de la IA!

Comienza tu recorrido hacia el futuro del aprendizaje automático