Vision Mamba
Découvre Vision Mamba, une alternative aux Transformer à complexité linéaire. Découvre comment les modèles d’espace d’états (SSM) améliorent l’efficacité de la vision par ordinateur haute résolution.
Vision Mamba représente une évolution majeure des architectures d’apprentissage profond pour la vision par ordinateur, qui s’éloignent de la prédominance des mécanismes d’attention utilisés dans les Transformers. Il s’agit d’une adaptation de l’architecture Mamba — conçue à l’origine pour modéliser efficacement des séquences en traitement du langage naturel —, spécialement adaptée aux tâches visuelles. En exploitant les modèles à espace d’états (SSMs), Vision Mamba offre une solution de complexité linéaire, contrairement à la complexité quadratique des couches classiques d’auto-attention. Il peut ainsi traiter plus efficacement les images haute résolution, ce qui le rend particulièrement intéressant lorsque les ressources de calcul sont limitées ou qu’il faut capturer les dépendances à longue portée dans les données visuelles sans l’importante empreinte mémoire généralement associée aux Transformers de vision (ViT).
Fonctionnement de Vision Mamba#
Vision Mamba repose essentiellement sur le principe du balayage sélectif des données. Les réseaux neuronaux convolutifs (CNNs) classiques traitent les images à l’aide de fenêtres glissantes locales, excellentes pour détecter les textures et les contours, mais peu adaptées à la compréhension du contexte global. À l’inverse, les Transformers utilisent l’attention globale pour relier chaque pixel (ou patch) à tous les autres, ce qui fournit un excellent contexte, mais devient coûteux en calcul lorsque la résolution de l’image augmente. Vision Mamba comble cet écart en transformant les images en séquences et en les traitant à l’aide d’espaces d’états sélectifs. Le modèle peut ainsi condenser l’information visuelle dans un état de taille fixe, conserver les détails pertinents sur de longues distances dans la séquence d’images et éliminer le bruit sans importance.
L’architecture comprend généralement un mécanisme de balayage bidirectionnel. Comme les images sont des structures 2D, et non des séquences par nature comme le texte, Vision Mamba balaie les patches de l’image dans les deux sens (et parfois selon différents parcours) afin de comprendre les relations spatiales quel que soit l’ordre de balayage. Cette approche permet au modèle d’obtenir des champs récepteurs globaux comparables à ceux des Transformers, tout en offrant des vitesses d’inférence plus élevées et une consommation mémoire réduite, avec des résultats souvent comparables aux meilleurs résultats de référence, notamment sur ImageNet.
Applications concrètes#
L’efficacité de Vision Mamba le rend particulièrement pertinent pour les environnements aux ressources limitées et les tâches haute résolution.
- Analyse d’images médicales : En radiologie, par exemple, l’analyse d’IRM ou de tomodensitométries haute résolution exige de détecter des anomalies subtiles parfois éloignées les unes des autres dans une grande image. Vision Mamba peut traiter efficacement ces fichiers d’analyse d’images médicales sans les goulots d’étranglement mémoire qui affectent souvent les Transformers classiques, aidant ainsi les médecins à repérer les tumeurs ou les fractures avec une grande précision.
- Navigation autonome sur les appareils périphériques : Les voitures autonomes et les drones s’appuient sur l’informatique en périphérie pour traiter les flux vidéo en temps réel. La mise à l’échelle linéaire de Vision Mamba permet à ces systèmes de traiter plus efficacement des vidéos à fréquence d’images élevée pour la détection d’objets et la segmentation sémantique que les modèles Transformer lourds, garantissant des temps de réaction plus courts pour les décisions critiques en matière de sécurité.
Vision Mamba vs. Transformers de vision (ViT)#
Bien que les deux architectures visent à capturer le contexte global, leur fonctionnement diffère fondamentalement.
- Transformer de vision (ViT) : S’appuie sur le mécanisme d’attention, qui calcule la relation entre chaque paire de patches de l’image. Cela entraîne une complexité quadratique ($O(N^2)$) : doubler la taille de l’image quadruple donc le coût de calcul.
- Vision Mamba : Utilise des modèles à espace d’états (SSMs) pour traiter les jetons visuels de manière linéaire ($O(N)$). Il maintient un état courant qui est mis à jour à mesure qu’il voit de nouveaux patches, ce qui lui permet de mieux s’adapter aux résolutions plus élevées tout en conservant une précision comparable.
Exemple : flux de travail d’inférence efficace#
Vision Mamba est une architecture spécifique, mais ses principes d’efficacité concordent avec les objectifs des modèles modernes en temps réel comme Ultralytics YOLO26. Les utilisateurs qui recherchent des tâches de vision optimisées peuvent s’appuyer sur la plateforme Ultralytics pour l’entraînement et le déploiement. Voici un exemple utilisant le package ultralytics pour effectuer une inférence et illustrer la simplicité d’utilisation de modèles de vision hautement optimisés.
from ultralytics import YOLO
# Charger un modèle YOLO26 préentraîné (optimisé pour la vitesse et la précision)
model = YOLO("yolo26n.pt") # 'n' pour nano, pour privilégier l’efficacité
# Effectuer une inférence sur une image
results = model.predict("path/to/image.jpg")
# Afficher les résultats
results[0].show()Principaux avantages et perspectives d’avenir#
L’introduction des architectures basées sur Mamba dans la vision par ordinateur témoigne d’une évolution vers une IA davantage adaptée au matériel. En réduisant la surcharge de calcul associée à l’attention globale, les chercheurs ouvrent la voie au déploiement d’agents IA avancés sur des appareils plus petits.
Des recherches récentes, comme l’article sur VMamba et les progrès de l’apprentissage profond efficace, mettent en évidence le potentiel de ces modèles à remplacer les réseaux de base traditionnels pour des tâches allant de la compréhension vidéo à la détection d’objets 3D. À mesure que la communauté affine les stratégies de balayage et l’intégration avec les couches convolutionnelles, Vision Mamba est bien placé pour devenir un composant standard de la boîte à outils d’apprentissage profond, aux côtés des CNNs et des Transformers.









