YOLO Vision 2026 :
Retour au glossaire Ultralytics

Vision Mamba

Explore Vision Mamba, une alternative à complexité linéaire aux Transformers. Apprends comment les State Space Models (SSM) améliorent l'efficacité pour la vision par ordinateur haute résolution.

Vision Mamba représente une évolution significative dans les architectures de deep learning pour la vision par ordinateur, s'éloignant de la domination des mécanismes d'attention présents dans les Transformers. C'est une adaptation de l'architecture Mamba — conçue à l'origine pour la modélisation de séquences efficace dans le traitement du langage naturel — adaptée spécifiquement aux tâches visuelles. En s'appuyant sur les State Space Models (SSMs), Vision Mamba offre une alternative à complexité linéaire à la complexité quadratique des couches d'auto-attention traditionnelles. Cela lui permet de traiter des images haute résolution plus efficacement, ce qui le rend particulièrement précieux pour les applications où les ressources de calcul sont limitées ou où les dépendances à long terme dans les données visuelles doivent être capturées sans l'empreinte mémoire lourde typique des Vision Transformers (ViT).

Comment fonctionne Vision Mamba#

Au cœur de Vision Mamba se trouve le concept du balayage sélectif des données. Les Convolutional Neural Networks (CNNs) traditionnels traitent les images à l'aide de fenêtres glissantes locales, qui sont excellentes pour détecter les textures et les contours mais peinent avec le contexte global. Inversement, les Transformers utilisent l'attention globale pour relier chaque pixel (ou patch) à chaque autre pixel, ce qui fournit un excellent contexte mais devient coûteux en calcul à mesure que la résolution de l'image augmente. Vision Mamba comble cet écart en aplatissant les images en séquences et en les traitant à l'aide d'espaces d'états sélectifs. Cela permet au modèle de compresser l'information visuelle en un état de taille fixe, conservant les détails pertinents sur de longues distances dans la séquence d'images tout en rejetant le bruit non pertinent.

L'architecture implique généralement un mécanisme de balayage bidirectionnel. Étant donné que les images sont des structures 2D et ne sont pas intrinsèquement séquentielles comme le texte, Vision Mamba balaie les patchs d'image dans les directions avant et arrière (et parfois selon des chemins variables) pour s'ensurer que les relations spatiales sont comprises quel que soit l'ordre de balayage. Cette approche permet au modèle d'atteindre des receptive fields globaux similaires à ceux des Transformers mais avec des vitesses d'inférence plus rapides et une utilisation de la mémoire plus faible, rivalisant souvent avec les résultats de pointe sur des benchmarks comme ImageNet.

Applications concrètes#

L'efficacité de Vision Mamba le rend très pertinent pour les environnements aux ressources limitées et les tâches haute résolution.

  • Analyse d'images médicales : Dans des domaines comme la radiologie, l'analyse de scans IRM ou CT haute résolution nécessite de détecter des anomalies subtiles qui peuvent être spatialement distantes dans une grande image. Vision Mamba peut traiter ces grands fichiers d'medical image analysis efficacement sans les goulets d'étranglement de mémoire qui affectent souvent les Transformers standard, aidant les médecins à identifier des tumeurs ou des fractures avec une haute précision.
  • Navigation autonome sur les appareils de périphérie : Les voitures autonomes et les drones s'appuient sur l'edge computing pour traiter les flux vidéo en temps réel. La mise à l'échelle linéaire de Vision Mamba permet à ces systèmes de gérer des entrées vidéo à haute fréquence d'images pour l'object detection et la semantic segmentation plus efficacement que les modèles Transformer lourds, garantissant des temps de réaction plus rapides pour les décisions critiques en matière de sécurité.

Vision Mamba vs Vision Transformers (ViT)#

Bien que les deux architectures visent à capturer le contexte global, elles diffèrent fondamentalement dans leur fonctionnement.

  • Vision Transformer (ViT) : Repose sur l'attention mechanism, qui calcule la relation entre chaque paire de patchs d'image. Cela entraîne une complexité quadratique ($O(N^2)$), ce qui signifie que doubler la taille de l'image quadruple le coût de calcul.
  • Vision Mamba : Utilise les State Space Models (SSMs) pour traiter les jetons visuels de manière linéaire ($O(N)$). Il maintient un état dynamique qui se met à jour au fur et à mesure qu'il voit de nouveaux patchs, ce qui lui permet de s'adapter beaucoup mieux aux résolutions plus élevées tout en maintenant une accuracy comparable.

Exemple : Workflow d'inférence efficace#

Bien que Vision Mamba soit une architecture spécifique, ses principes d'efficacité s'alignent sur les objectifs des modèles modernes en temps réel tels que Ultralytics YOLO26. Les utilisateurs recherchant des tâches de vision optimisées peuvent tirer parti de la Ultralytics Platform pour l'entraînement et le déploiement. Ci-dessous se trouve un exemple utilisant le paquet ultralytics pour exécuter l'inférence, démontrant la facilité d'utilisation de modèles de vision hautement optimisés.

from ultralytics import YOLO

# Load a pre-trained YOLO26 model (optimized for speed and accuracy)
model = YOLO("yolo26n.pt")  # 'n' for nano, emphasizing efficiency

# Run inference on an image
results = model.predict("path/to/image.jpg")

# Display the results
results[0].show()

Principaux avantages et perspectives d'avenir#

L'introduction d'architectures basées sur Mamba dans la vision par ordinateur signale un passage vers une IA plus consciente du matériel. En réduisant la surcharge de calcul associée à l'global attention, les chercheurs ouvrent la porte au déploiement d'AI agents avancés sur des appareils plus petits.

Des recherches récentes, telles que le VMamba paper et les développements dans l'efficient deep learning, mettent en évidence le potentiel de ces modèles pour remplacer les backbones traditionnels dans des tâches allant de la video understanding à la 3D object detection. Alors que la communauté continue d'affiner les stratégies de balayage et l'intégration avec les convolutional layers, Vision Mamba est en passe de devenir un composant standard de la boîte à outils de deep learning aux côtés des CNNs et des Transformers.

Explore solutions

Real-time AI that works with your team

IA dans la robotique

Équipe tes machines plus intelligentes avec les modèles Ultralytics YOLO. La vision par IA dans la robotique propulse la navigation autonome, la perception, le suivi d'objets et le contrôle en temps réel.
En savoir plus
Real-time AI that works with your team

IA dans la logistique

Simplifie la logistique avec les modèles Ultralytics YOLO. La vision par IA permet l'inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Real-time AI that works with your team

IA dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. La vision par IA alimente le suivi des stocks, la surveillance des étagères, la gestion des files d'attente et des informations plus intelligentes sur les clients.
En savoir plus
Real-time AI that works with your team

IA dans la santé

Construis des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans la santé permet une imagerie médicale plus rapide, des diagnostics plus intelligents et une surveillance des patients.
En savoir plus
Real-time AI that works with your team

IA dans la fabrication

Optimise la fabrication avec les modèles Ultralytics YOLO. La vision par IA favorise le contrôle qualité, la détection des défauts, la conformité aux EPI et l'automatisation des chaînes de montage.
En savoir plus
Real-time AI that works with your operation

IA dans l'automobile

Applique la vision par ordinateur dans l'automobile avec les modèles Ultralytics YOLO. L'IA de vision améliore la sécurité routière, l'assistance à la conduite et l'automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Real-time AI tailored to your operation

IA en agriculture

Intègre l'IA de vision à l'agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l'agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus
Real-time AI that works with your team

IA dans la robotique

Équipe tes machines plus intelligentes avec les modèles Ultralytics YOLO. La vision par IA dans la robotique propulse la navigation autonome, la perception, le suivi d'objets et le contrôle en temps réel.
En savoir plus
Real-time AI that works with your team

IA dans la logistique

Simplifie la logistique avec les modèles Ultralytics YOLO. La vision par IA permet l'inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Real-time AI that works with your team

IA dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. La vision par IA alimente le suivi des stocks, la surveillance des étagères, la gestion des files d'attente et des informations plus intelligentes sur les clients.
En savoir plus
Real-time AI that works with your team

IA dans la santé

Construis des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans la santé permet une imagerie médicale plus rapide, des diagnostics plus intelligents et une surveillance des patients.
En savoir plus
Real-time AI that works with your team

IA dans la fabrication

Optimise la fabrication avec les modèles Ultralytics YOLO. La vision par IA favorise le contrôle qualité, la détection des défauts, la conformité aux EPI et l'automatisation des chaînes de montage.
En savoir plus
Real-time AI that works with your operation

IA dans l'automobile

Applique la vision par ordinateur dans l'automobile avec les modèles Ultralytics YOLO. L'IA de vision améliore la sécurité routière, l'assistance à la conduite et l'automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Real-time AI tailored to your operation

IA en agriculture

Intègre l'IA de vision à l'agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l'agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus
Real-time AI that works with your team

IA dans la robotique

Équipe tes machines plus intelligentes avec les modèles Ultralytics YOLO. La vision par IA dans la robotique propulse la navigation autonome, la perception, le suivi d'objets et le contrôle en temps réel.
En savoir plus
Real-time AI that works with your team

IA dans la logistique

Simplifie la logistique avec les modèles Ultralytics YOLO. La vision par IA permet l'inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Real-time AI that works with your team

IA dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. La vision par IA alimente le suivi des stocks, la surveillance des étagères, la gestion des files d'attente et des informations plus intelligentes sur les clients.
En savoir plus
Real-time AI that works with your team

IA dans la santé

Construis des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans la santé permet une imagerie médicale plus rapide, des diagnostics plus intelligents et une surveillance des patients.
En savoir plus
Real-time AI that works with your team

IA dans la fabrication

Optimise la fabrication avec les modèles Ultralytics YOLO. La vision par IA favorise le contrôle qualité, la détection des défauts, la conformité aux EPI et l'automatisation des chaînes de montage.
En savoir plus
Real-time AI that works with your operation

IA dans l'automobile

Applique la vision par ordinateur dans l'automobile avec les modèles Ultralytics YOLO. L'IA de vision améliore la sécurité routière, l'assistance à la conduite et l'automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Real-time AI tailored to your operation

IA en agriculture

Intègre l'IA de vision à l'agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l'agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus

Construisons ensemble le futur de l'IA !

Commence ton aventure avec le futur de l'apprentissage automatique