Qu’est-ce qu’EfficientNet ? Bref aperçu
Comprends l’architecture EfficientNet et la puissance de sa mise à l’échelle composée ! Explore EfficientNet B0-B7 pour une efficacité de premier ordre en classification et segmentation d’images.

En 2019, des chercheurs de Google AI ont présenté EfficientNet, un modèle de pointe de vision par ordinateur conçu pour reconnaître des objets et des motifs dans les images. Il a principalement été conçu pour la classification d’images, qui consiste à attribuer une image à l’une de plusieurs catégories prédéfinies. Cependant, aujourd’hui, EfficientNet sert également de backbone pour des tâches plus complexes comme la détection d’objets, la segmentation et l’apprentissage par transfert.
Avant EfficientNet, les modèles d’apprentissage automatique et d’IA appliquée à la vision cherchaient à améliorer la précision en ajoutant davantage de couches ou en augmentant la taille de ces couches. Les couches sont les étapes d’un modèle de réseau neuronal (un type de modèle d’apprentissage profond inspiré du cerveau humain) qui traitent les données pour apprendre des motifs et améliorer la précision.
Ces changements ont créé un compromis : les modèles d’IA traditionnels devenaient plus volumineux et plus lents, tandis que le gain de précision restait souvent minime par rapport à l’augmentation importante de la puissance de calcul requise.
EfficientNet a adopté une approche différente. Il a augmenté simultanément la profondeur (le nombre de couches), la largeur (le nombre d’unités dans chaque couche) et la résolution des images (le niveau de détail des images d’entrée), de manière équilibrée. Cette méthode, appelée mise à l’échelle composée, utilise efficacement toute la puissance de traitement disponible. Le résultat est un modèle plus petit et plus rapide, capable d’obtenir de meilleures performances que des modèles plus anciens comme ResNet ou DenseNet.
Aujourd’hui, des modèles de vision par ordinateur plus récents comme Ultralytics YOLO11 offrent une meilleure précision, davantage de rapidité et une plus grande efficacité. Malgré cela, EfficientNet reste une étape importante qui a influencé la conception de nombreuses architectures avancées.
Dans cet article, nous allons découvrir EfficientNet en cinq minutes : son fonctionnement, ce qui le rend unique et les raisons pour lesquelles il reste important en vision par ordinateur. Commençons !
Qu’est-ce qu’EfficientNet ?#
Avant la conception d’EfficientNet, la plupart des modèles de reconnaissance d’images amélioraient leur précision en ajustant leurs couches ou en augmentant la taille des images d’entrée afin de capturer davantage de détails. Même si ces stratégies amélioraient les résultats, elles rendaient également les modèles plus lourds et plus exigeants. Ils nécessitaient donc davantage de mémoire et un matériel plus performant.
Au lieu de modifier des couches individuelles, EfficientNet met à l’échelle simultanément la profondeur, la largeur et la résolution des images à l’aide d’une méthode appelée mise à l’échelle composée. Cette approche permet au modèle de grandir efficacement sans surcharger un aspect particulier.
L’architecture EfficientNet traite les images à travers une série de blocs, chacun étant constitué de modules plus petits. Le nombre de modules dans chaque bloc dépend de la taille du modèle.

Fig. 1. Les blocs de construction d’EfficientNet. (Source)
Les versions plus petites utilisent moins de modules, tandis que les versions plus grandes répètent les modules plus souvent. Cette conception flexible permet à EfficientNet d’offrir une grande précision et une bonne efficacité dans un large éventail d’applications, des appareils mobiles aux systèmes à grande échelle.
Fonctionnement de la mise à l’échelle composée#
La méthode de mise à l’échelle composée augmente la profondeur, la largeur et la résolution des images d’un modèle tout en les maintenant en équilibre. Cela permet d’utiliser efficacement la puissance de calcul. La série commence par un modèle de référence plus petit appelé EfficientNet-B0, qui sert de base à toutes les autres versions.
À partir de B0, les modèles évoluent vers des variantes plus grandes nommées EfficientNet-B1 à EfficientNet-B7. À chaque étape, le réseau gagne des couches supplémentaires, augmente le nombre de canaux (les unités utilisées pour le traitement) et traite des images d’entrée à plus haute résolution. L’ampleur de la croissance à chaque étape est déterminée par un paramètre appelé coefficient composé, qui garantit que la profondeur, la largeur et la résolution augmentent selon des proportions fixes plutôt qu’indépendamment.

Fig. 2. La mise à l’échelle composée augmente la largeur, la profondeur et la résolution des images d’un modèle. (Source)
Architecture EfficientNet#
Examinons maintenant l’architecture d’EfficientNet.
Il repose sur MobileNetV2, un modèle léger de vision par ordinateur optimisé pour les appareils mobiles et embarqués. Au cœur de ce modèle se trouve le bloc de convolution à goulot d’étranglement inversé mobile (MBConv), une couche spéciale qui traite les données d’image comme une convolution standard, mais avec moins de calculs. Ce bloc rend le modèle à la fois rapide et plus économe en mémoire.
À l’intérieur de chacun des blocs MBConv se trouve un module de recalibrage par squeeze-and-excitation (SE). Ce module ajuste l’intensité des différents canaux du réseau. Il renforce les canaux essentiels et réduit l’intensité des autres. Il aide ainsi le réseau à se concentrer sur les caractéristiques les plus importantes d’une image tout en ignorant le reste. Le modèle EfficientNet utilise également une fonction d’activation Swish (une fonction mathématique qui aide le réseau à apprendre des motifs), ce qui lui permet de mieux repérer les motifs dans les images que les méthodes plus anciennes.
En outre, il utilise DropConnect, une méthode dans laquelle certaines connexions internes au réseau sont désactivées aléatoirement pendant l’entraînement. Cette méthode de régularisation stochastique (une technique de randomisation qui empêche le modèle de mémoriser les données d’entraînement au lieu de généraliser) réduit le surapprentissage en forçant le réseau à apprendre des représentations de caractéristiques plus robustes (des motifs plus solides et plus généraux dans les données), qui se transfèrent mieux à des données inédites.

Fig. 3. Architecture d’EfficientNet-B0 (Source)
Bref aperçu des variantes du modèle EfficientNet#
Maintenant que nous comprenons mieux le fonctionnement des modèles EfficientNet, examinons les différentes variantes de modèles.
Les modèles EfficientNet vont de B0 à B7, B0 servant de référence pour équilibrer rapidité et précision. Chaque version augmente la profondeur, la largeur et la résolution des images, ce qui améliore la précision. Toutefois, elles nécessitent également davantage de puissance de calcul, des versions B1 et B2 aux versions B6 et B7 plus performantes.
Les modèles EfficientNet-B3 et EfficientNet-B4 offrent un compromis pour les images plus grandes, tandis que B5 est souvent choisi pour les jeux de données complexes qui exigent de la précision. Au-delà de ces modèles, le modèle le plus récent, EfficientNet V2, peut accélérer l’entraînement, mieux gérer les petits jeux de données et être optimisé pour le matériel moderne.
Applications d’EfficientNet#
EfficientNet peut produire des résultats précis tout en utilisant moins de mémoire et de puissance de traitement que de nombreux autres modèles. Il est donc utile dans de nombreux domaines, de la recherche scientifique aux produits utilisés au quotidien.
Analyse d’images médicales#
Les images médicales, comme les scanners des poumons, contiennent souvent des détails subtils essentiels à un diagnostic précis. Les modèles d’IA peuvent aider à analyser ces images afin de révéler des motifs difficiles à détecter pour les humains. Une adaptation d’EfficientNet destinée à cet usage est MONAI (réseau médical ouvert pour l’IA) EfficientNet, spécifiquement conçu pour l’analyse d’images médicales.
En s’appuyant sur l’architecture d’EfficientNet, des chercheurs ont également développé Lung-EffNet, un modèle qui classe les scanners pulmonaires afin de détecter les tumeurs. Il peut classer les tumeurs comme bénignes, malignes ou normales, avec une précision annoncée supérieure à 99 % dans des conditions expérimentales.

Fig. 4. Classification d’images de tumeurs à l’aide de Lung-EffNet. (Source)
Détection d’objets en temps réel#
La détection d’objets consiste à trouver des objets dans une image et à déterminer leur emplacement. Il s’agit d’un élément essentiel d’applications comme les systèmes de sécurité, les voitures autonomes et les drones.
EfficientNet est devenu important dans ce domaine, car il offrait une méthode très efficace pour extraire des caractéristiques des images. Sa méthode de mise à l’échelle de la profondeur, de la largeur et de la résolution a montré comment les modèles pouvaient être précis sans être trop lourds ou trop lents. C’est pourquoi de nombreux systèmes de détection, comme EfficientDet, utilisent EfficientNet comme backbone.
Les modèles plus récents, comme Ultralytics YOLO11, poursuivent le même objectif : associer rapidité et précision. Cette tendance vers des modèles efficaces a été fortement influencée par les idées issues d’architectures comme EfficientNet.
Avantages et inconvénients d’EfficientNet#
Voici quelques avantages de l’utilisation d’EfficientNet dans les projets de vision par ordinateur :
- Grande précision avec moins de paramètres : EfficientNet peut offrir une précision similaire ou supérieure à celle de modèles plus anciens comme ResNet ou DenseNet. Toutefois, il utilise moins de paramètres, ce qui le rend plus rapide à entraîner et plus facile à déployer.
- Famille de modèles évolutive : Avec des versions allant de B0 à B7, tu peux choisir une version adaptée à ton matériel et à tes exigences de précision sans modifier le réseau de référence.
- Adapté à l’apprentissage par transfert : EfficientNet peut offrir des performances fiables pour l’apprentissage par transfert, un processus qui consiste à réentraîner un modèle préentraîné pour une tâche personnalisée. Il peut servir de backbone pour diverses tâches de vision par ordinateur. Il a également obtenu de très bons résultats après un ajustement fin. Par exemple, il a atteint une précision de pointe sur CIFAR-100, un jeu de données de classification d’images largement utilisé, avec nettement moins de paramètres que les modèles précédents.
Même si l’utilisation d’EfficientNet présente de nombreux avantages, voici certaines de ses limites à garder à l’esprit :
- Nécessite davantage de mémoire : Des versions comme EfficientNet-B6 et EfficientNet-B7 nécessitent beaucoup de mémoire GPU.
- Mise à l’échelle optimisée pour ImageNet : Les paramètres de mise à l’échelle ont été conçus pour le jeu de données ImageNet, de sorte que les performances peuvent diminuer sur des jeux de données très différents sans ajustement fin. Cela est particulièrement vrai pour les petits jeux de données, car l’architecture et la mise à l’échelle d’EfficientNet ont été conçues pour un jeu de données vaste et diversifié comme ImageNet, qui fournit suffisamment de données pour justifier sa profondeur et sa largeur.
- Plus lent sur certains matériels : EfficientNet utilise des couches appelées MBConv, conçues pour être efficaces sur le matériel moderne. Sur les GPU ou CPU plus anciens, ces couches peuvent s’exécuter plus lentement.
Points clés à retenir#
EfficientNet a changé la manière dont les modèles de vision par ordinateur évoluent, en maintenant un équilibre entre profondeur, largeur et résolution des images. Il reste un modèle important et a également influencé des architectures plus récentes. Il occupe notamment une place significative dans l’histoire de la vision par ordinateur.
Rejoins notre communauté et notre dépôt GitHub pour en découvrir davantage sur l’IA. Consulte nos pages de solutions pour en savoir plus sur l’IA dans le secteur de la santé et la vision par ordinateur dans l’automobile. Découvre nos options de licence et commence dès aujourd’hui à développer avec la vision par ordinateur !









