YOLO Vision 2026:
Guías

¿Qué es ResNet-50 y cuál es su relevancia en la visión artificial?

Descubre cómo la arquitectura de ResNet-50 permite la clasificación de imágenes en aplicaciones del mundo real en los sectores de la salud, la fabricación y los sistemas autónomos.

ABAbirami Vina5 min read
Arquitectura ResNet-50 para clasificación de imágenes

El análisis automatizado de imágenes es cada vez más común en aplicaciones como la detección de vehículos con exceso de velocidad o el análisis de imágenes médicas. La tecnología que impulsa estas innovaciones es la computer vision o inteligencia artificial visual. Es una rama de la inteligencia artificial (AI) que permite a las máquinas interpretar y comprender imágenes y vídeos, de forma muy similar a como lo hacen los humanos.

Para construir tales computer vision solutions, los desarrolladores confían en modelos de IA visual que pueden aprender de grandes cantidades de datos visuales. Con los años, los investigadores han desarrollado modelos más nuevos y avanzados con un rendimiento impresionante en vision AI tasks como la clasificación de imágenes (asignar etiquetas a las imágenes), la detección de objetos (localizar e identificar objetos dentro de las imágenes) y la segmentación de instancias (detectar objetos y delinear sus formas exactas).

Sin embargo, mirar atrás y entender los modelos anteriores puede ayudar a comprender cómo funcionan los sistemas de visión artificial actuales. Por ejemplo, un caso clave es ResNet-50, un modelo influyente que introdujo la idea de las conexiones de acceso directo (shortcut connections): vías sencillas que ayudan al modelo a aprender más rápido y con mayor precisión.

Esta innovación hizo posible entrenar redes neuronales mucho más profundas de manera eficaz, lo que condujo a mejoras significativas en la image classification y dio forma al diseño de muchos modelos posteriores. En este artículo, exploraremos ResNet-50, cómo funciona y su relevancia en la evolución de la computer vision. ¡Empecemos!

¿Qué es ResNet-50?#

ResNet-50 es un modelo de computer vision basado en un tipo de red neuronal llamada Convolutional Neural Network (CNN). Las redes CNN están diseñadas para ayudar a los ordenadores a comprender la información visual mediante el aprendizaje de patrones en las imágenes, como bordes, colores o formas, y el uso de esos patrones para reconocer y clasificar objetos.

Presentado en 2015 por investigadores de Microsoft Research, ResNet-50 se convirtió rápidamente en uno de los modelos más impactantes del campo debido a su precisión y eficiencia en tareas de reconocimiento de imágenes a gran escala.

Una característica clave de ResNet-50 es el uso de conexiones residuales, también conocidas como conexiones de acceso directo (shortcut connections). Son vías sencillas que permiten al modelo saltarse algunos pasos en el proceso de aprendizaje. En otras palabras, en lugar de obligar al modelo a pasar la información por cada capa, estos atajos le permiten llevar los detalles importantes hacia adelante de forma más directa. Esto hace que el aprendizaje sea más rápido y fiable.

Diagram of residual connections in the ResNet architecture

Fig 1. Un vistazo a las conexiones residuales en la arquitectura de ResNet.

Este diseño ayuda a resolver un problema común en el aprendizaje profundo llamado problema del desvanecimiento del gradiente (vanishing gradient problem). En modelos muy profundos, la información importante puede perderse a medida que se mueve a través de muchas capas, lo que dificulta el aprendizaje del modelo.

Las conexiones residuales ayudan a evitar esto manteniendo un flujo claro de información de principio a fin. Por eso el modelo se llama ResNet-50: ResNet significa Residual Network (Red Residual), y el «50» se refiere al número de capas que utiliza para procesar una imagen.

Una visión general de cómo funciona ResNet-50#

ResNet-50 tiene una estructura bien organizada que permite al modelo ser profundo sin perder información importante. Sigue un patrón sencillo y repetible que mantiene la eficiencia sin dejar de permitir un alto rendimiento.

Aquí tienes un vistazo más de cerca a cómo funciona la arquitectura de ResNet-50:

  • Basic feature extraction: El modelo comienza aplicando una operación matemática llamada convolución. Esto implica deslizar pequeños filtros (llamados núcleos o kernels) sobre la imagen para producir mapas de características, que son nuevas versiones de la imagen que resaltan patrones básicos como bordes o texturas. Así es como el modelo empieza a captar información visual útil.
  • Aprendizaje de características complejas: A medida que los datos se mueven a través de la red, el tamaño de los mapas de características disminuye. Esto se consigue mediante técnicas como el pooling o el uso de filtros con pasos más grandes (llamados strides). Al mismo tiempo, la red crea más mapas de características, lo que le ayuda a captar patrones cada vez más complejos, como formas, partes de objetos o texturas.
  • Compresión y expansión de datos: Cada etapa comprime los datos, los procesa y luego los vuelve a expandir. Esto ayuda al modelo a aprender mientras ahorra memoria.
  • Conexiones de acceso directo (shortcut connections): Son vías sencillas que permiten que la información se adelante en lugar de pasar por cada capa. Hacen que el aprendizaje sea más estable y eficiente.
  • Making a prediction: Al final de la red, toda la información aprendida se combina y se pasa a través de una función softmax. Esto genera una distribución de probabilidad sobre las clases posibles, lo que indica la confianza del modelo en cada predicción; por ejemplo, 90 % gato, 9 % perro, 1 % coche.

Diagram of the ResNet-50 architecture

Fig 2. La arquitectura de ResNet-50.

Características clave de ResNet-50#

Aunque ResNet-50 se diseñó originalmente para la clasificación de imágenes, su diseño flexible lo ha hecho útil en muchas áreas de la visión artificial. Echemos un vistazo a algunas de las características que hacen que ResNet-50 destaque.

Uso de ResNet-50 para la clasificación de imágenes#

ResNet-50 se utiliza principalmente para la image classification, donde el objetivo es asignar una etiqueta a una imagen. Por ejemplo, dada una foto, el modelo puede etiquetarla como perro, gato o avión en función del objeto principal que ve.

Su diseño fiable y su disponibilidad en bibliotecas de aprendizaje profundo muy utilizadas como PyTorch y TensorFlow convirtieron a ResNet-50 en una opción inicial muy popular para el entrenamiento en grandes conjuntos de datos de imágenes. Uno de los ejemplos más conocidos es ImageNet, una enorme colección de imágenes etiquetadas que se utiliza para evaluar y comparar modelos de computer vision.

Aunque los modelos más nuevos, como Ultralytics YOLO11, lo superan, ResNet-50 se sigue utilizando habitualmente como punto de referencia gracias a su sólido equilibrio entre precisión, velocidad y simplicidad.

Using ResNet-50 to classify an image of a dog

Fig 3. Un ejemplo de uso de ResNet-50 para clasificar un perro.

Detección de objetos habilitada por backbones ResNet-50#

Mientras que la clasificación de imágenes consiste en identificar el objeto principal de una foto, la object detection va un paso más allá al encontrar y etiquetar varios objetos en la misma imagen. Por ejemplo, en la imagen de una calle concurrida, un modelo puede necesitar detectar coches, autobuses y personas, y averiguar dónde está cada uno.

ResNet-50 se utiliza como backbone en algunos de estos modelos. Eso significa que se encarga de la primera parte del trabajo: analizar la imagen y extraer los detalles importantes que describen qué hay en ella y dónde. Estos detalles se pasan después a la siguiente parte del modelo, llamada cabeza de detección (detection head), que toma las decisiones finales sobre qué objetos hay en la imagen y dónde se encuentran.

Modelos de detección populares como Faster R-CNN y DETR utilizan ResNet-50 para este paso de extracción de características. Como hace un buen trabajo capturando tanto los detalles finos como el diseño general de una imagen, ayuda a estos modelos a realizar predicciones precisas, incluso en escenas complejas.

Transfer learning con ResNet-50#

Otro aspecto interesante del modelo ResNet-50 es su capacidad para admitir el transfer learning. Esto significa que el modelo, entrenado originalmente en un gran conjunto de datos como ImageNet para la clasificación de imágenes, se puede adaptar a nuevas tareas con muchos menos datos.

En lugar de empezar desde cero, se reutilizan la mayoría de las capas del modelo y solo se sustituye y reentrena la última capa de clasificación para la nueva tarea. Esto ahorra tiempo y es especialmente útil cuando los datos etiquetados son limitados.

Aplicaciones de visión artificial de ResNet-50#

La arquitectura de ResNet-50 la hizo útil para una amplia gama de aplicaciones de visión artificial. Fue especialmente importante en los inicios del aprendizaje profundo, ayudando a llevar la tecnología de IA visual desde la investigación hasta el uso en el mundo real. Al resolver retos clave, ayudó a allanar el camino para los modelos más avanzados que vemos en las aplicaciones actuales.

Imagen médica impulsada por ResNet-50#

ResNet-50 fue uno de los primeros modelos utilizados en imágenes médicas basadas en aprendizaje profundo. Los investigadores lo han aprovechado para identificar patrones de enfermedades en radiografías, resonancias magnéticas y otras exploraciones de diagnóstico. Por ejemplo, ha ayudado a detectar tumores y a clasificar diabetic retinal images para apoyar el diagnóstico en oftalmología.

Aunque ahora se utilizan modelos más avanzados en herramientas clínicas, ResNet-50 desempeñó un papel clave en las primeras investigaciones de IA médica. Su facilidad de uso y diseño modular lo convirtieron en una opción adecuada para crear prototipos de sistemas de diagnóstico.

Brain tumor detection in medical scans based on ResNet-50

Fig 4. Detección de tumores cerebrales basada en ResNet-50.

Automatización industrial impulsada por ResNet-50#

De igual modo, ResNet-50 también se ha aplicado en entornos industriales. Por ejemplo, en la fabricación, se ha utilizado en sistemas de investigación y piloto para detect surface defects on materials como acero, hormigón y piezas pintadas.

También se ha probado en configuraciones para identificar agujeros de insectos, grietas o depósitos que se forman durante la fundición o el montaje. ResNet-50 es muy adecuado para estas tareas porque puede detectar diferencias sutiles en la textura de la superficie, una capacidad importante para la inspección de calidad.

Aunque modelos más avanzados como Ultralytics YOLO11 se utilizan ahora habitualmente en sistemas de producción, ResNet-50 sigue desempeñando un papel importante en la investigación académica y la evaluación comparativa, especialmente para tareas de clasificación de imágenes.

Surface defect inspection using ResNet-50

Fig 5. Inspección de superficies con ResNet-50.

Beneficios y limitaciones de ResNet-50#

Aquí tienes un vistazo a algunas de las ventajas de ResNet-50:

  • Rendimiento de referencia sólido: ResNet-50 ofrece una precisión sólida en una amplia gama de tareas, lo que lo convierte en un punto de referencia de confianza tanto en investigación como en proyectos aplicados.
  • Bien documentado y ampliamente estudiado: Su arquitectura es bien conocida y está minuciosamente documentada, lo que facilita la resolución de problemas y el aprendizaje a desarrolladores e investigadores.
  • Versátil en todos los dominios: Desde la imagen médica hasta la fabricación, ResNet-50 se ha aplicado con éxito a una gran variedad de problemas del mundo real, demostrando su flexibilidad.

Mientras tanto, aquí tienes un vistazo a las limitaciones de ResNet-50:

  • Uso elevado de recursos: ResNet-50 requiere más memoria y potencia de cálculo que los modelos ligeros, lo que puede hacerlo menos adecuado para dispositivos móviles o aplicaciones en tiempo real.
  • Overfitting on small datasets: Debido a su profundidad y complejidad, ResNet-50 puede sufrir sobreajuste (overfitting) cuando se entrena con datos limitados sin técnicas de regularización adecuadas.
  • Tamaño de entrada fijo: ResNet-50 suele esperar que las imágenes tengan un tamaño específico, como 224×224 píxeles, por lo que a menudo es necesario redimensionar o recortar las imágenes, lo que a veces puede eliminar detalles importantes.

Conclusiones clave#

ResNet-50 demostró que las redes muy profundas podían entrenarse eficazmente y, al mismo tiempo, ofrecer un rendimiento sólido en tareas visuales. Su arquitectura ofrecía un marco claro y práctico para construir modelos más profundos que funcionaran de forma fiable.

Tras su lanzamiento, los investigadores ampliaron el diseño, creando versiones más profundas como ResNet-101 y ResNet-152. En general, ResNet-50 es un modelo clave que ayudó a dar forma a la forma en que se utiliza el aprendizaje profundo en la visión artificial hoy en día.

¡Únete a nuestra creciente community! Explora nuestro GitHub repository para obtener más información sobre la IA. ¿Todo listo para empezar tus propios proyectos de computer vision? Consulta nuestras licensing options. ¡Descubre la AI in agriculture y la vision AI in healthcare visitando nuestras páginas de soluciones!

Explore solutions

Real-time AI that works with your team

IA en robótica

Potencia máquinas más inteligentes con modelos Ultralytics YOLO. La IA de visión en robótica impulsa la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Real-time AI that works with your team

IA en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La visión artificial por IA permite la inspección de paquetes, clasificación, seguimiento de vehículos y monitoreo de seguridad en almacenes en tiempo real.
Más información
Real-time AI that works with your team

IA en el sector minorista

Reimagina el comercio minorista con los modelos de Ultralytics YOLO. La visión artificial por IA potencia el seguimiento de inventario, el monitoreo de estantes, la gestión de colas y mejores perspectivas sobre los clientes.
Más información
Real-time AI that works with your team

IA en la atención sanitaria

Crea soluciones de salud con los modelos de Ultralytics YOLO. La IA de visión en la sanidad potencia imágenes médicas más rápidas, diagnósticos más inteligentes y supervisión de pacientes.
Más información
Real-time AI that works with your team

IA en la fabricación

Optimiza la fabricación con los modelos de Ultralytics YOLO. La visión artificial por IA impulsa el control de calidad, la detección de defectos, el cumplimiento del uso de PPE y la automatización de la línea de montaje.
Más información
Real-time AI that works with your operation

IA en automoción

Aplica la visión artificial en el sector automotriz con los modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para carreteras más inteligentes.
Más información
Real-time AI tailored to your operation

IA en agricultura

Lleva la visión artificial a la agricultura inteligente con los modelos de Ultralytics YOLO. Potencia el seguimiento de cultivos, el control del ganado y la agricultura de precisión para obtener rendimientos mayores y más inteligentes.
Más información
Real-time AI that works with your team

IA en robótica

Potencia máquinas más inteligentes con modelos Ultralytics YOLO. La IA de visión en robótica impulsa la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Real-time AI that works with your team

IA en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La visión artificial por IA permite la inspección de paquetes, clasificación, seguimiento de vehículos y monitoreo de seguridad en almacenes en tiempo real.
Más información
Real-time AI that works with your team

IA en el sector minorista

Reimagina el comercio minorista con los modelos de Ultralytics YOLO. La visión artificial por IA potencia el seguimiento de inventario, el monitoreo de estantes, la gestión de colas y mejores perspectivas sobre los clientes.
Más información
Real-time AI that works with your team

IA en la atención sanitaria

Crea soluciones de salud con los modelos de Ultralytics YOLO. La IA de visión en la sanidad potencia imágenes médicas más rápidas, diagnósticos más inteligentes y supervisión de pacientes.
Más información
Real-time AI that works with your team

IA en la fabricación

Optimiza la fabricación con los modelos de Ultralytics YOLO. La visión artificial por IA impulsa el control de calidad, la detección de defectos, el cumplimiento del uso de PPE y la automatización de la línea de montaje.
Más información
Real-time AI that works with your operation

IA en automoción

Aplica la visión artificial en el sector automotriz con los modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para carreteras más inteligentes.
Más información
Real-time AI tailored to your operation

IA en agricultura

Lleva la visión artificial a la agricultura inteligente con los modelos de Ultralytics YOLO. Potencia el seguimiento de cultivos, el control del ganado y la agricultura de precisión para obtener rendimientos mayores y más inteligentes.
Más información
Real-time AI that works with your team

IA en robótica

Potencia máquinas más inteligentes con modelos Ultralytics YOLO. La IA de visión en robótica impulsa la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Real-time AI that works with your team

IA en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La visión artificial por IA permite la inspección de paquetes, clasificación, seguimiento de vehículos y monitoreo de seguridad en almacenes en tiempo real.
Más información
Real-time AI that works with your team

IA en el sector minorista

Reimagina el comercio minorista con los modelos de Ultralytics YOLO. La visión artificial por IA potencia el seguimiento de inventario, el monitoreo de estantes, la gestión de colas y mejores perspectivas sobre los clientes.
Más información
Real-time AI that works with your team

IA en la atención sanitaria

Crea soluciones de salud con los modelos de Ultralytics YOLO. La IA de visión en la sanidad potencia imágenes médicas más rápidas, diagnósticos más inteligentes y supervisión de pacientes.
Más información
Real-time AI that works with your team

IA en la fabricación

Optimiza la fabricación con los modelos de Ultralytics YOLO. La visión artificial por IA impulsa el control de calidad, la detección de defectos, el cumplimiento del uso de PPE y la automatización de la línea de montaje.
Más información
Real-time AI that works with your operation

IA en automoción

Aplica la visión artificial en el sector automotriz con los modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para carreteras más inteligentes.
Más información
Real-time AI tailored to your operation

IA en agricultura

Lleva la visión artificial a la agricultura inteligente con los modelos de Ultralytics YOLO. Potencia el seguimiento de cultivos, el control del ganado y la agricultura de precisión para obtener rendimientos mayores y más inteligentes.
Más información

¡Construyamos juntos el futuro de la IA!

Comienza tu viaje con el futuro del aprendizaje automático