Multi-Object Tracking (MOT)
Explore le suivi multi-objets (MOT) en vision par ordinateur. Découvre comment détecter et suivre des entités avec Ultralytics YOLO26 pour la conduite autonome, le commerce de détail et bien plus.
Le suivi multi-objets (MOT) est une tâche dynamique de vision par ordinateur (CV) qui consiste à détecter plusieurs entités distinctes dans un flux vidéo et à préserver leur identité au fil du temps. Contrairement à la détection d'objets standard, qui traite chaque image comme un instantané isolé, le MOT introduit une dimension temporelle à l'intelligence artificielle (AI). En attribuant un numéro d'identification (ID) unique à chaque instance détectée — comme un piéton précis dans une foule ou un véhicule sur une autoroute — les algorithmes de MOT permettent aux systèmes de suivre les trajectoires, d'analyser les comportements et de comprendre les interactions. Cette capacité est fondamentale pour la compréhension vidéo moderne et permet aux machines de percevoir la continuité dans un environnement changeant.
Fonctionnement du MOT#
La plupart des systèmes de suivi contemporains reposent sur un paradigme de « suivi par détection ». Cette approche sépare le processus en deux étapes principales : identifier ce qui se trouve dans l'image, puis associer ces résultats aux objets connus des images précédentes.
-
Détection : À chaque image, un modèle haute performance comme YOLO26 analyse l'image pour localiser les objets et génère des boîtes englobantes ainsi que les probabilités de classe.
-
Prédiction du mouvement : Pour anticiper le prochain déplacement d'un objet, les algorithmes utilisent souvent un filtre de Kalman. Cet outil mathématique estime l'état d'un système dynamique — comme sa vitesse et sa position — afin de réduire la zone de recherche dans l'image suivante.
-
Association des données : Le système associe les nouvelles détections aux trajectoires existantes. Des méthodes d'optimisation comme l'algorithme hongrois résolvent ce problème d'affectation en minimisant le coût des correspondances, en s'appuyant souvent sur l'intersection sur union (IoU) pour mesurer le chevauchement spatial.
-
Ré-identification (ReID) : Lorsque des obstructions visuelles se produisent — un phénomène appelé occlusion — les systèmes de suivi avancés utilisent des représentations vectorielles visuelles pour reconnaître l'objet lorsqu'il réapparaît. Cela aide à éviter le « changement d'ID », en garantissant que le système comprend que la voiture qui sort d'un tunnel est la même que celle qui y est entrée.
Distinguer le MOT du suivi d'un objet unique#
Bien que la terminologie soit similaire, le suivi multi-objets (MOT) diffère considérablement du suivi d'un objet unique (SOT). Le SOT se concentre sur le suivi d'une cible précise initialisée dans la première image, en ignorant souvent toutes les autres entités. À l'inverse, le MOT doit gérer un nombre inconnu et variable de cibles, qui peuvent entrer dans la scène ou en sortir à tout moment. Le MOT est donc plus exigeant sur le plan computationnel, car il nécessite une logique robuste pour gérer l'initialisation et la terminaison des trajectoires, ainsi que les interactions complexes entre plusieurs corps en mouvement.
Applications concrètes#
La capacité à suivre plusieurs entités simultanément stimule l'innovation dans plusieurs secteurs industriels majeurs.
- Conduite autonome : Les voitures autonomes dépendent fortement du MOT pour se déplacer en toute sécurité. En suivant les piétons, les cyclistes et les autres véhicules, les systèmes autonomes peuvent prédire les positions futures afin d'éviter les collisions. Cela implique souvent de fusionner les données provenant de caméras et de capteurs LiDAR pour une fiabilité maximale.
- Analyse du commerce de détail : Dans les magasins physiques, les détaillants utilisent l'AI dans le commerce de détail pour cartographier les parcours des clients. Les algorithmes de MOT génèrent des cartes de chaleur de la fréquentation, ce qui aide les responsables à optimiser l'agencement des magasins et à améliorer la gestion des files d'attente pendant les heures de pointe.
- Analyse sportive : Les équipes professionnelles utilisent le MOT pour analyser les déplacements des joueurs et les formations de l'équipe. En suivant chaque joueur sur le terrain, les entraîneurs peuvent extraire des métriques détaillées sur la vitesse, la distance parcourue et le positionnement tactique à l'aide de techniques d'estimation de pose.
Implémenter le MOT avec Python#
Ultralytics simplifie l'implémentation du suivi avec des modèles de pointe. La méthode track() intègre parfaitement la logique de détection et de suivi, en prenant en charge des algorithmes comme ByteTrack et BoT-SORT. L'exemple ci-dessous montre comment suivre des véhicules dans une vidéo à l'aide du modèle YOLO26 recommandé.
from ultralytics import YOLO
# Load the official YOLO26 small model
model = YOLO("yolo26s.pt")
# Track objects in a video file (or use '0' for webcam)
# The 'persist=True' argument keeps track IDs consistent between frames
results = model.track(source="traffic_analysis.mp4", show=True, persist=True)
# Print the IDs of objects tracked in the first frame
if results[0].boxes.id is not None:
print(f"Tracked IDs: {results[0].boxes.id.int().tolist()}")Défis du suivi multi-objets#
Malgré les progrès réalisés, le MOT reste un domaine difficile. L'occlusion constitue une difficulté majeure : lorsque des objets se croisent ou se cachent derrière des obstacles, préserver leur identité est complexe. Les scènes très fréquentées, comme un marathon animé ou une volée d'oiseaux, mettent à l'épreuve les limites des algorithmes d'association des données. En outre, maintenir des vitesses d'inférence en temps réel lors du traitement de flux vidéo haute résolution nécessite des architectures de modèles efficaces et souvent du matériel spécialisé, comme les appareils NVIDIA Jetson.
Pour relever ces défis, les chercheurs étudient des approches d'apprentissage profond de bout en bout qui unifient la détection et le suivi au sein d'un seul réseau, tout en exploitant la plateforme Ultralytics pour annoter des jeux de données complexes et entraîner des modèles personnalisés robustes.









