Ultralytics YOLO27:
Guías

¿Qué es EfficientNet? Una descripción general rápida

¡Descubre la arquitectura de EfficientNet y la magia de su escalado compuesto! Explora EfficientNet B0-B7 para lograr una eficiencia de primer nivel en clasificación y segmentación de imágenes.

ABAbirami Vina9 min read
Descripción general de la arquitectura de EfficientNet

En 2019, investigadores de Google AI presentaron EfficientNet, un modelo de visión por ordenador de vanguardia creado para reconocer objetos y patrones en imágenes. Se diseñó principalmente para la clasificación de imágenes, que consiste en asignar una imagen a una de varias categorías predefinidas. Sin embargo, hoy EfficientNet también sirve como columna vertebral para tareas más complejas, como la detección de objetos, la segmentación y el aprendizaje por transferencia.

Antes de EfficientNet, estos modelos de aprendizaje automático e inteligencia artificial para visión intentaban mejorar la precisión añadiendo más capas o aumentando el tamaño de esas capas. Las capas son los pasos de un modelo de red neuronal (un tipo de modelo de aprendizaje profundo inspirado en el cerebro humano) que procesan datos para aprender patrones y mejorar la precisión.

Estos cambios crearon una disyuntiva: los modelos de IA tradicionales se hicieron más grandes y lentos, mientras que la precisión adicional solía ser mínima en comparación con el aumento considerable de potencia de cálculo necesario.

EfficientNet adoptó un enfoque diferente. Aumentó conjuntamente la profundidad (número de capas), la anchura (número de unidades de cada capa) y la resolución de la imagen (nivel de detalle de las imágenes de entrada) de forma equilibrada. Este método, denominado escalado compuesto, utiliza de forma fiable toda la potencia de procesamiento disponible. El resultado es un modelo más pequeño y rápido que puede rendir mejor que modelos anteriores como ResNet o DenseNet.

Hoy, los modelos de visión por ordenador más recientes, como Ultralytics YOLO11, ofrecen mayor precisión, velocidad y eficiencia. Aun así, EfficientNet sigue siendo un hito importante que influyó en el diseño de muchas arquitecturas avanzadas.

En este artículo, desglosaremos EfficientNet en cinco minutos y veremos cómo funciona, qué lo hace único y por qué sigue siendo relevante en la visión por ordenador. ¡Empecemos!

¿Qué es EfficientNet?#

Antes de diseñar EfficientNet, la mayoría de los modelos de reconocimiento de imágenes mejoraban la precisión ajustando sus capas o aumentando el tamaño de la imagen de entrada para capturar más detalles. Aunque estas estrategias mejoraban los resultados, también hacían que los modelos fueran más pesados y exigentes. Esto significaba que necesitaban más memoria y hardware más potente.

En lugar de cambiar capas individuales, EfficientNet escala conjuntamente la profundidad, la anchura y la resolución de la imagen mediante un método denominado escalado compuesto. Este enfoque permite que el modelo crezca de forma eficiente sin sobrecargar ningún aspecto concreto.

La arquitectura de EfficientNet procesa las imágenes mediante una serie de bloques, cada uno construido a partir de módulos más pequeños. El número de módulos de cada bloque depende del tamaño del modelo.

Los bloques de construcción de EfficientNet

Fig. 1. Los bloques de construcción de EfficientNet. (Fuente)

Las versiones más pequeñas utilizan menos módulos, mientras que las versiones más grandes repiten los módulos con mayor frecuencia. Este diseño flexible permite a EfficientNet ofrecer una gran precisión y eficiencia en una amplia variedad de aplicaciones, desde dispositivos móviles hasta sistemas a gran escala.

Cómo funciona el escalado compuesto#

El método de escalado compuesto amplía la profundidad, la anchura y la resolución de la imagen de un modelo, pero las mantiene equilibradas. Esto permite utilizar la potencia de cálculo de forma eficiente. La serie comienza con un modelo base más pequeño denominado EfficientNet-B0, que sirve de fundamento para todas las demás versiones.

A partir de B0, los modelos escalan hasta variantes más grandes denominadas EfficientNet-B1 a EfficientNet-B7. En cada paso, la red incorpora capas adicionales, aumenta el número de canales (unidades utilizadas para el procesamiento) y gestiona imágenes de entrada de mayor resolución. La magnitud del crecimiento en cada paso viene determinada por un parámetro denominado coeficiente compuesto, que garantiza que la profundidad, la anchura y la resolución aumenten en proporciones fijas en lugar de hacerlo de forma independiente.

El escalado compuesto aumenta la anchura, la profundidad y la resolución de imagen de un modelo

Fig. 2. El escalado compuesto aumenta la anchura, la profundidad y la resolución de imagen de un modelo. (Fuente)

Arquitectura de EfficientNet#

A continuación, veamos la arquitectura de EfficientNet.

Se basa en MobileNetV2, un modelo ligero de visión por ordenador optimizado para dispositivos móviles e integrados. En su núcleo se encuentra el bloque MobileNet de convolución con cuello de botella invertido (MBConv), una capa especial que procesa los datos de imagen como una convolución estándar, pero con menos cálculos. Este bloque hace que el modelo sea rápido y consuma menos memoria.

Dentro de cada bloque MBConv hay un módulo de compresión y excitación (SE). Este módulo ajusta la intensidad de los distintos canales de la red. Refuerza la intensidad de los canales esenciales y reduce la de los demás. El módulo ayuda a la red a centrarse en las características más importantes de una imagen e ignorar el resto. El modelo EfficientNet también utiliza una función de activación Swish (una función matemática que ayuda a la red a aprender patrones), lo que le permite detectar patrones en imágenes mejor que los métodos anteriores.

Además, utiliza DropConnect, mediante el cual algunas conexiones dentro de la red se desactivan aleatoriamente durante el entrenamiento. Este método de regularización estocástica (una técnica de aleatorización para evitar que el modelo memorice los datos de entrenamiento en lugar de generalizar) reduce el sobreajuste al obligar a la red a aprender representaciones de características más robustas (patrones más sólidos y generales en los datos) que se transfieren mejor a datos no vistos.

Arquitectura de EfficientNet-B0

Fig. 3. Arquitectura de EfficientNet-B0 (Fuente)

Breve descripción general de las variantes del modelo EfficientNet#

Ahora que entendemos mejor cómo funcionan los modelos EfficientNet, hablemos de las distintas variantes del modelo.

Los modelos EfficientNet escalan de B0 a B7, empezando por B0 como modelo base que equilibra velocidad y precisión. Cada versión aumenta la profundidad, la anchura y la resolución de imagen, mejorando la precisión. Sin embargo, también requieren más potencia de cálculo, desde B1 y B2 hasta B6 y B7, de alto rendimiento.

Mientras que los modelos EfficientNet-B3 y EfficientNet-B4 logran un equilibrio para imágenes más grandes, B5 suele elegirse para conjuntos de datos complejos que requieren precisión. Más allá de estos modelos, el modelo más reciente, EfficientNet V2, puede mejorar la velocidad de entrenamiento, gestionar mejor los conjuntos de datos pequeños y está optimizado para hardware moderno.

Aplicaciones de EfficientNet#

EfficientNet puede producir resultados precisos utilizando menos memoria y potencia de procesamiento que muchos otros modelos. Esto lo hace útil en numerosos ámbitos, desde la investigación científica hasta los productos que las personas utilizan a diario.

Análisis de imágenes médicas#

Las imágenes médicas, como las tomografías computarizadas de los pulmones, suelen contener detalles sutiles que son fundamentales para un diagnóstico preciso. Los modelos de IA pueden ayudar a analizar estas imágenes para descubrir patrones que a los humanos podría resultarles difícil detectar. Una adaptación de EfficientNet para este fin es MONAI (Red médica abierta para IA) EfficientNet, diseñada específicamente para el análisis de imágenes médicas.

A partir de la arquitectura de EfficientNet, los investigadores también han desarrollado Lung-EffNet, un modelo que clasifica tomografías computarizadas de los pulmones para detectar tumores. Puede categorizar los tumores como benignos, malignos o normales, y ha alcanzado una precisión comunicada superior al 99 % en entornos experimentales.

Clasificación de tumores mediante Lung-EffNet

Fig. 4. Clasificación de tumores mediante Lung-EffNet. (Fuente)

Detección de objetos en tiempo real#

La detección de objetos es el proceso de encontrar objetos en una imagen y determinar su ubicación. Es una parte fundamental de aplicaciones como los sistemas de seguridad, los coches autónomos y los drones.

EfficientNet adquirió importancia en este ámbito porque ofrecía una forma muy eficiente de extraer características de las imágenes. Su método para escalar la profundidad, la anchura y la resolución demostró que los modelos podían ser precisos sin resultar demasiado pesados o lentos. Por eso muchos sistemas de detección, como EfficientDet, utilizan EfficientNet como columna vertebral.

Los modelos más recientes, como Ultralytics YOLO11, comparten el objetivo de combinar velocidad y precisión. Esta tendencia hacia modelos eficientes recibió una gran influencia de ideas procedentes de arquitecturas como EfficientNet.

Ventajas y desventajas de EfficientNet#

Estas son algunas ventajas de utilizar EfficientNet en proyectos de visión por ordenador:

  • Gran precisión con menos parámetros: EfficientNet puede ofrecer una precisión similar o superior a la de modelos anteriores como ResNet o DenseNet. Sin embargo, utiliza menos parámetros, lo que hace que sea más rápido de entrenar y más fácil de implementar.
  • Familia de modelos escalable: Desde B0 hasta B7, puedes elegir una versión que se ajuste a tu hardware y a tus requisitos de precisión sin cambiar la red base.
  • Adecuado para el aprendizaje por transferencia: EfficientNet puede ofrecer un rendimiento fiable como modelo de aprendizaje por transferencia, que es un proceso de reentrenamiento de un modelo preentrenado para una tarea personalizada. Puede funcionar como columna vertebral para diversas tareas de visión por ordenador. También ha mostrado buenos resultados al ajustarse mediante fine-tuning. Por ejemplo, alcanzó una precisión de vanguardia en CIFAR-100, un conjunto de datos de clasificación de imágenes ampliamente utilizado, con muchos menos parámetros que los modelos anteriores.

Aunque utilizar EfficientNet ofrece numerosas ventajas, estas son algunas de sus limitaciones que debes tener en cuenta:

  • Requiere más memoria: Las versiones como EfficientNet-B6 y EfficientNet-B7 necesitan mucha memoria de GPU.
  • Escalado ajustado para ImageNet: La configuración de escalado se diseñó para el conjunto de datos ImageNet, por lo que el rendimiento puede disminuir en conjuntos de datos muy diferentes sin un ajuste adicional. Esto es especialmente cierto en el caso de conjuntos de datos pequeños, ya que la arquitectura y el escalado de EfficientNet se diseñaron para un conjunto de datos grande y diverso como ImageNet, que proporciona datos suficientes para justificar su profundidad y anchura.
  • Más lento en cierto hardware: EfficientNet utiliza capas denominadas MBConv, diseñadas para ofrecer eficiencia en hardware moderno. En GPU o CPU más antiguas, estas capas pueden ejecutarse más lentamente.

Conclusiones clave#

EfficientNet cambió la forma en que crecen los modelos de visión por ordenador al mantener equilibradas la profundidad, la anchura y la resolución de imagen. Sigue siendo un modelo importante y también ha influido en arquitecturas más recientes. En particular, ocupa un lugar relevante en la historia de la visión por ordenador.

Únete a nuestra comunidad y explora más sobre IA en nuestro repositorio de GitHub. Consulta nuestras páginas de soluciones para leer sobre la IA en el sector sanitario y la visión por ordenador en el sector de la automoción. Descubre nuestras opciones de licencia y empieza hoy mismo a crear con visión por ordenador.

Explore solutions

Visión por computadora para imágenes aéreas

Visión por computadora para imágenes aéreas

Transforma imágenes de drones y aéreas en información en tiempo real para agricultura, acuicultura, supervisión ambiental, conservación y análisis geoespacial con Ultralytics YOLO.
Más información
Visión artificial en la industria aeroespacial

Visión artificial en la industria aeroespacial

Lleva la IA de visión al monitoreo aéreo con los modelos Ultralytics YOLO. Potencia drones, flujos de trabajo aeroespaciales, conservación ambiental e industrias geoespaciales con soluciones de visión artificial.
Más información

Protege cada sitio con los modelos Ultralytics YOLO. La IA de visión potencia el monitoreo perimetral, la detección de amenazas, el reconocimiento de matrículas y la seguridad laboral.
Más información
Visión artificial en robótica

Visión artificial en robótica

Impulsa máquinas más inteligentes con los modelos de Ultralytics YOLO. La IA de visión en robótica permite la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Visión artificial en logística

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La IA de visión permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad de los almacenes en tiempo real.
Más información
Visión artificial en comercio minorista

Visión artificial en comercio minorista

Reinventa el comercio minorista con los modelos de Ultralytics YOLO. La IA de visión impulsa el seguimiento del inventario, la supervisión de estanterías, la gestión de colas y un conocimiento más inteligente de los clientes.
Más información
Visión por computador en el sector sanitario

Visión por computador en el sector sanitario

Crea soluciones sanitarias con modelos de Ultralytics YOLO. La IA de visión en el sector sanitario permite obtener imágenes médicas más rápidamente, diagnósticos más inteligentes y supervisar a los pacientes.
Más información
Visión por computador en la fabricación

Visión por computador en la fabricación

Optimiza la fabricación con modelos de Ultralytics YOLO. La IA de visión impulsa el control de calidad, la detección de defectos, el cumplimiento del PPE y la automatización de las líneas de montaje.
Más información
Visión artificial en el sector automovilístico

Visión artificial en el sector automovilístico

Aplica visión artificial en el sector automovilístico con modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para conseguir carreteras más inteligentes.
Más información
Visión artificial en agricultura

Visión artificial en agricultura

Lleva la IA de visión a la agricultura inteligente con modelos de Ultralytics YOLO. Impulsa la supervisión de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas mayores e inteligentes.
Más información
Visión por computadora para imágenes aéreas

Visión por computadora para imágenes aéreas

Transforma imágenes de drones y aéreas en información en tiempo real para agricultura, acuicultura, supervisión ambiental, conservación y análisis geoespacial con Ultralytics YOLO.
Más información
Visión artificial en la industria aeroespacial

Visión artificial en la industria aeroespacial

Lleva la IA de visión al monitoreo aéreo con los modelos Ultralytics YOLO. Potencia drones, flujos de trabajo aeroespaciales, conservación ambiental e industrias geoespaciales con soluciones de visión artificial.
Más información

Protege cada sitio con los modelos Ultralytics YOLO. La IA de visión potencia el monitoreo perimetral, la detección de amenazas, el reconocimiento de matrículas y la seguridad laboral.
Más información
Visión artificial en robótica

Visión artificial en robótica

Impulsa máquinas más inteligentes con los modelos de Ultralytics YOLO. La IA de visión en robótica permite la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Visión artificial en logística

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La IA de visión permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad de los almacenes en tiempo real.
Más información
Visión artificial en comercio minorista

Visión artificial en comercio minorista

Reinventa el comercio minorista con los modelos de Ultralytics YOLO. La IA de visión impulsa el seguimiento del inventario, la supervisión de estanterías, la gestión de colas y un conocimiento más inteligente de los clientes.
Más información
Visión por computador en el sector sanitario

Visión por computador en el sector sanitario

Crea soluciones sanitarias con modelos de Ultralytics YOLO. La IA de visión en el sector sanitario permite obtener imágenes médicas más rápidamente, diagnósticos más inteligentes y supervisar a los pacientes.
Más información
Visión por computador en la fabricación

Visión por computador en la fabricación

Optimiza la fabricación con modelos de Ultralytics YOLO. La IA de visión impulsa el control de calidad, la detección de defectos, el cumplimiento del PPE y la automatización de las líneas de montaje.
Más información
Visión artificial en el sector automovilístico

Visión artificial en el sector automovilístico

Aplica visión artificial en el sector automovilístico con modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para conseguir carreteras más inteligentes.
Más información
Visión artificial en agricultura

Visión artificial en agricultura

Lleva la IA de visión a la agricultura inteligente con modelos de Ultralytics YOLO. Impulsa la supervisión de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas mayores e inteligentes.
Más información
Visión por computadora para imágenes aéreas

Visión por computadora para imágenes aéreas

Transforma imágenes de drones y aéreas en información en tiempo real para agricultura, acuicultura, supervisión ambiental, conservación y análisis geoespacial con Ultralytics YOLO.
Más información
Visión artificial en la industria aeroespacial

Visión artificial en la industria aeroespacial

Lleva la IA de visión al monitoreo aéreo con los modelos Ultralytics YOLO. Potencia drones, flujos de trabajo aeroespaciales, conservación ambiental e industrias geoespaciales con soluciones de visión artificial.
Más información

Protege cada sitio con los modelos Ultralytics YOLO. La IA de visión potencia el monitoreo perimetral, la detección de amenazas, el reconocimiento de matrículas y la seguridad laboral.
Más información
Visión artificial en robótica

Visión artificial en robótica

Impulsa máquinas más inteligentes con los modelos de Ultralytics YOLO. La IA de visión en robótica permite la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Visión artificial en logística

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La IA de visión permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad de los almacenes en tiempo real.
Más información
Visión artificial en comercio minorista

Visión artificial en comercio minorista

Reinventa el comercio minorista con los modelos de Ultralytics YOLO. La IA de visión impulsa el seguimiento del inventario, la supervisión de estanterías, la gestión de colas y un conocimiento más inteligente de los clientes.
Más información
Visión por computador en el sector sanitario

Visión por computador en el sector sanitario

Crea soluciones sanitarias con modelos de Ultralytics YOLO. La IA de visión en el sector sanitario permite obtener imágenes médicas más rápidamente, diagnósticos más inteligentes y supervisar a los pacientes.
Más información
Visión por computador en la fabricación

Visión por computador en la fabricación

Optimiza la fabricación con modelos de Ultralytics YOLO. La IA de visión impulsa el control de calidad, la detección de defectos, el cumplimiento del PPE y la automatización de las líneas de montaje.
Más información
Visión artificial en el sector automovilístico

Visión artificial en el sector automovilístico

Aplica visión artificial en el sector automovilístico con modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para conseguir carreteras más inteligentes.
Más información
Visión artificial en agricultura

Visión artificial en agricultura

Lleva la IA de visión a la agricultura inteligente con modelos de Ultralytics YOLO. Impulsa la supervisión de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas mayores e inteligentes.
Más información

¡Construyamos juntos el futuro de la IA!

Comienza tu recorrido hacia el futuro del aprendizaje automático