Pose Estimation
Apprends comment l'estimation de pose utilise des points clés pour suivre le mouvement. Explore les applications réelles et commence avec Ultralytics YOLO26 pour des résultats rapides et précis.
L'estimation de pose est une technique de computer vision spécialisée qui va au-delà de la simple détection de la présence d'objets pour comprendre leur structure géométrique et leur orientation physique. Alors que la détection d'objets standard trace un simple rectangle autour d'un sujet, l'estimation de pose identifie des points sémantiques spécifiques, appelés keypoints, tels que les articulations d'un corps humain (coudes, genoux, épaules) ou les coins structurels d'un véhicule. En cartographiant ces repères, les modèles de machine learning peuvent reconstruire une représentation squelettique du sujet, permettant aux systèmes d'interpréter le langage corporelle, la dynamique des mouvements et le positionnement précis dans l'espace 2D ou 3D.
Mécanismes fondamentaux : Top-Down vs Bottom-Up#
L'estimation de pose moderne s'appuie largement sur des architectures de deep learning sophistiquées, utilisant souvent des Convolutional Neural Networks (CNNs) pour traiter les données visuelles. Les algorithmes suivent généralement l'une des deux stratégies principales pour identifier les keypoints :
- Approches descendantes (Top-Down) : Cette méthode emploie d'abord un modèle de détection d'objets pour localiser les instances individuelles dans des bounding boxes. Une fois qu'une personne ou un objet est détouré de l'image plus grande, l'estimateur de pose prédit les keypoints dans cette région spécifique. Cette approche est souvent très précise mais peut souffrir d'une latence d'inférence plus élevée à mesure que le nombre de sujets dans le cadre augmente.
- Approches ascendantes (Bottom-Up) : Inversement, cette stratégie détecte tous les keypoints potentiels dans l'image entière simultanément (par exemple, en trouvant chaque « genou gauche » dans une foule), puis utilise des algorithmes d'association pour les regrouper en squelettes individuels. Cette méthode est généralement privilégiée pour l'inférence en temps réel dans des scènes bondées car le coût de calcul reste relativement constant, peu importe le nombre de personnes présentes.
Les modèles de pointe comme YOLO26 utilisent des architectures de bout en bout avancées qui équilibrent ces besoins, offrant une estimation de pose à haute vitesse adaptée au déploiement sur des appareils d'edge AI et des plateformes mobiles.
Distinction des termes liés à la vision par ordinateur#
Il est utile de différencier l'estimation de pose des autres tâches de reconnaissance visuelle pour comprendre sa valeur unique dans les flux de travail de computer vision :
- Object Detection : Se concentre sur l'identification de ce qu'est un objet et de l'endroit où il se trouve, en affichant une boîte rectangulaire. Il traite le sujet comme un objet rigide sans comprendre son articulation interne.
- Instance Segmentation : Génère un masque parfait au pixel près qui délimite la forme précise de l'objet. Bien que la segmentation fournisse des limites, elle n'identifie pas explicitement les articulations ou les liaisons squelettiques requises pour l'analyse cinématique.
- Pose Estimation : Cible spécifiquement la structure interne, en cartographiant les connexions entre des repères prédéterminés (par exemple, de la hanche au genou) pour analyser la posture et l'action.
Applications concrètes#
La capacité à numériser les mouvements humains et d'objets a conduit à des applications transformatrices dans diverses industries, souvent entraînées à l'aide d'outils tels que l'Ultralytics Platform pour gérer de grands ensembles de données de keypoints annotés.
Soins de santé et rééducation#
Dans le domaine médical, l'AI in healthcare utilise l'estimation de pose pour surveiller la rééducation des patients à distance. En suivant les angles articulaires et l'amplitude des mouvements, les systèmes automatisés peuvent s'assurer que les patients effectuent correctement leurs exercices de physiothérapie à la maison. Cela réduit le risque de nouvelle blessure et permet aux cliniciens de quantifier les progrès de la récupération sans avoir besoin d'équipements de laboratoire coûteux.
Analytique sportive#
Les entraîneurs et les athlètes tirent parti des sports analytics pour optimiser leurs performances. Les modèles d'estimation de pose peuvent analyser le plan de swing d'un golfeur, la longueur de foulée d'un coureur ou la biomécanique d'un lanceur sans avoir besoin des combinaisons de marqueurs intrusives utilisées dans la capture de mouvement traditionnelle. Cela fournit un retour immédiat et basé sur les données pour améliorer la technique et prévenir les blessures de surutilisation.
Commerce de détail et analyse comportementale#
Dans les environnements commerciaux, les systèmes d'AI in retail utilisent la détection de pose pour comprendre le comportement des clients, comme attraper des produits sur des étagères hautes ou s'attarder dans des allées spécifiques. Ces données aident à optimiser l'agencement des magasins et à améliorer la gestion des stocks en corrélant les actions physiques avec les décisions d'achat.
Exemple de code : Estimation de pose avec Ultralytics YOLO26#
La mise en œuvre de l'estimation de pose est simple avec les frameworks Python modernes. L'exemple suivant montre comment utiliser le package ultralytics pour charger un modèle YOLO26 pré-entraîné (le successeur de YOLO11) et détecter les keypoints humains dans une image.
from ultralytics import YOLO
# Load the YOLO26 pose model (nano version for speed)
model = YOLO("yolo26n-pose.pt")
# Perform inference on an image source
# The model identifies bounding boxes and specific keypoints (joints)
results = model("https://ultralytics.com/images/bus.jpg")
# Print the xy coordinates of detected keypoints
print(results[0].keypoints.xy)
# Visualize the skeletal results directly
results[0].show()





