Qu’est-ce qu’OpenPose ? À la découverte d’une avancée majeure dans l’estimation de pose
Découvre comment OpenPose peut être utilisé pour l’estimation de pose dans les applications de vision par ordinateur. Apprends-en plus sur ses fonctionnalités et son importance pour l’IA visuelle.

Aujourd’hui, les images et les caméras sont partout : intégrées à nos téléphones, à nos maisons et même aux espaces publics. Nous ne comptons pas sur elles uniquement pour capturer des moments, mais aussi pour nous aider à comprendre le monde qui nous entoure et à interagir avec lui.
En coulisses, la vision par ordinateur, une sous-discipline de l’intelligence artificielle (AI), rend tout cela possible en permettant aux machines d’interpréter les données visuelles. Elle permet aux systèmes de détecter des objets, de reconnaître des visages et de suivre des mouvements, jouant ainsi un rôle essentiel dans bon nombre des technologies que nous utilisons au quotidien.
Grâce aux avancées récentes de l’AI, les modèles de vision par ordinateur peuvent désormais analyser et extraire des données et des informations plus complexes. L’estimation de pose en est un exemple : il s’agit d’une tâche de vision par ordinateur axée sur la compréhension des mouvements humains.
Elle fonctionne en identifiant des points clés du corps, comme les épaules, les coudes et les genoux, dans des images ou des vidéos. Cela permet d’analyser la façon dont les personnes bougent et rend possibles des applications dans le suivi de la condition physique, l’animation, la santé et bien d’autres domaines.
Parmi les nombreux outils développés pour l’estimation de pose, OpenPose se distingue comme une avancée majeure. Créé par des chercheurs du Perceptual Computing Lab de l’université Carnegie Mellon, il a été l’un des premiers systèmes open source capables de détecter les poses corporelles complètes, y compris les mains, les pieds et les points clés du visage, pour plusieurs personnes en temps réel à l’aide d’une simple caméra (avec jusqu’à 135 points clés par personne).
Dans cet article, nous allons explorer OpenPose, son fonctionnement et son importance en tant qu’étape majeure de la vision par ordinateur.

Fig 1. Estimation de pose pour plusieurs personnes avec OpenPose.
Retour sur l’histoire de l’estimation de pose#
Avant l’adoption généralisée de l’AI, le suivi des mouvements humains dans les vidéos nécessitait du matériel spécialisé. Dans des secteurs comme le cinéma et l’animation, les acteurs portaient souvent des combinaisons dotées de marqueurs réfléchissants afin que les caméras puissent capturer leurs mouvements dans un environnement de studio contrôlé.
Bien que ces techniques de capture de mouvement fondées sur des marqueurs soient précises, elles étaient également coûteuses et limitées à des configurations spécifiques. À mesure que la vision par ordinateur progressait, les chercheurs ont cherché des moyens de suivre les mouvements du corps sans utiliser de marqueurs. Ils utilisaient les contours, les formes et des modèles pour repérer les silhouettes humaines dans les images.
Ces premiers systèmes fonctionnaient dans des situations simples et prévisibles, mais peinaient face aux scénarios du monde réel. Ils produisaient souvent de mauvais résultats lorsque les personnes bougeaient de façon imprévisible ou lorsque plusieurs personnes apparaissaient dans une image.
À la fin des années 2010, l’apprentissage profond a profondément transformé l’estimation de pose. Les modèles d’AI appliquée à la vision pouvaient être entraînés sur de vastes jeux de données de poses humaines. Au lieu de s’appuyer sur des contours et des modèles, les modèles ont appris à reconnaître les articulations et la structure du corps en étudiant des milliers d’images annotées. L’estimation de pose est ainsi devenue plus précise, plus flexible et plus utile dans un éventail plus large de contextes.

Fig 2. Évolution des modèles d’estimation de pose humaine de 2017 à 2023.
OpenPose : le point de départ de l’estimation de pose moderne#
OpenPose a été publié pour la première fois en 2017 et est capable d’estimer simultanément les poses de plusieurs personnes dans une seule image. Contrairement aux systèmes plus anciens, OpenPose ne nécessite ni combinaisons spéciales ni marqueurs. Il fonctionne avec des caméras standard et peut traiter des images et des vidéos en temps réel. Ces fonctionnalités ont rendu l’estimation de pose plus accessible aux développeurs et aux chercheurs.
Les bases posées par OpenPose pour la vision par ordinateur ont permis à d’autres de concevoir de nouvelles architectures pour diverses applications. Aujourd’hui, des modèles d’AI appliquée à la vision comme Ultralytics YOLOv8 et Ultralytics YOLO11, qui prennent en charge les tâches d’estimation de pose, offrent des résultats plus rapides et une latence réduite.

Fig 3. Utilisation de YOLO11 pour l’estimation de pose.
Cependant, OpenPose constitue un excellent point de départ si tu t’intéresses à l’évolution de l’estimation de pose. Il a introduit des concepts clés sur lesquels de nombreux systèmes plus récents s’appuient encore aujourd’hui.
Principales fonctionnalités d’OpenPose#
Maintenant que nous comprenons mieux pourquoi OpenPose est important, examinons de plus près ce qu’il peut réellement faire.
Au cœur des fonctionnalités d’OpenPose se trouve ce que l’on appelle la détection de points clés. Les points clés sont des repères précis du corps humain, comme le bout du nez, le centre des épaules, les coudes, les poignets, les hanches, les genoux et les chevilles. OpenPose peut détecter jusqu’à 135 de ces points par personne, y compris des zones détaillées comme les doigts et les traits du visage.
Lorsque ces points sont reliés, ils forment une représentation simplifiée du corps humain : tu peux la considérer comme un squelette numérique. Ce contour squelettique indique non seulement où se trouve une personne, mais aussi sa posture : assise, debout, en train de saluer, de sourire ou de marcher. Les ordinateurs peuvent interpréter visuellement les mouvements humains à l’aide de ces squelettes, un peu comme nous comprenons instinctivement le langage corporel d’une personne.
Le suivi squelettique est particulièrement utile, car il élimine le bruit et les distractions de l’arrière-plan, permettant au système de se concentrer uniquement sur la posture et les mouvements humains. Au lieu d’analyser chaque pixel, OpenPose se concentre sur des points pertinents qui révèlent comment une personne bouge ou interagit.
En extrayant ces informations structurées à partir d’images ou de vidéos du quotidien, OpenPose permet de créer des applications qui réagissent aux gestes, surveillent l’activité physique, évaluent les signaux émotionnels ou animent même des personnages numériques.
Comment fonctionne OpenPose ?#
Voici un aperçu de la manière dont OpenPose détecte et relie les points clés du corps humain à partir d’une entrée visuelle :
- Commence par une image : OpenPose prend une seule image provenant d’une photo, d’une vidéo ou d’un flux de caméra en direct.
- Repère les parties importantes du corps : Le système recherche les points clés du corps, comme le nez, les coudes, les poignets, les genoux et les chevilles. Ils sont marqués là où le système estime avec suffisamment de confiance qu’une partie du corps se trouve.
- Détermine quelles parties vont ensemble : Ensuite, OpenPose vérifie comment les points clés sont reliés. Il utilise des calculs mathématiques pour déterminer quelles articulations appartiennent à la même personne, par exemple en associant un poignet au coude et à l’épaule droits.
- Dessine un squelette pour chaque personne : Après avoir regroupé les points clés, OpenPose les relie pour former une « silhouette en bâtons » représentant la pose de chaque personne. Cela fonctionne même lorsque plusieurs personnes apparaissent dans la même image.
- Renvoie les données de pose : Enfin, il fournit les positions exactes de tous les points clés détectés. Ceux-ci peuvent servir à suivre les mouvements, à reconnaître les gestes ou à créer des outils interactifs, le tout en temps réel.

Fig 4. Détection et suivi des points clés humains avec OpenPose.
Applications de l’estimation de pose dans différents secteurs avec OpenPose#
OpenPose a été l’un des premiers outils avancés à rendre l’estimation de pose pratique pour diverses applications concrètes. Bien qu’il soit aujourd’hui peu utilisé dans les solutions de vision par ordinateur en temps réel, il a joué un rôle important dans les premiers travaux menés dans des domaines comme le sport, le divertissement, l’éducation et la sécurité.
Examinons de plus près comment il a contribué à ouvrir la voie dans ces domaines.
Estimation de pose avec OpenPose pour la condition physique et le sport#
Lorsque tu regardes un match de baseball, il est facile de comprendre ce qui se passe : tu reconnais instantanément un lancer, une frappe ou un vol de base. En tant qu’êtres humains, nous lisons intuitivement les mouvements du corps et les interprétons sans grand effort. Pour les machines, en revanche, reconnaître ces actions est beaucoup plus complexe. Elles ont besoin d’informations précises sur la façon dont chaque partie du corps se déplace dans l’espace.
OpenPose a constitué une avancée majeure dans ce domaine de la vision par ordinateur. Il s’agissait d’un outil pratique pour analyser la gestuelle sportive dans différents contextes.
De nombreux projets de recherche ont utilisé OpenPose pour décomposer des mouvements comme les frappes et les sauts, allant même jusqu’à classer des actions spécifiques au baseball en fonction des mouvements des joueurs. Comme il fonctionnait dans des environnements ouverts avec des vidéos standard, il permettait aux chercheurs de tester le fonctionnement de tels systèmes dans des situations réelles d’entraînement ou de coaching.
Ces premières études ont contribué à poser les bases des outils de suivi des performances désormais utilisés dans les technologies sportives.

Fig 5. Exemple de pipeline de classification des actions au baseball avec OpenPose.
Utilisation d’OpenPose dans les systèmes de sécurité et de sûreté#
De même, des chercheurs ont utilisé OpenPose pour étudier comment le suivi de pose vidéo pouvait contribuer à la surveillance de la sécurité. Il a été testé pour détecter des comportements tels que des chutes, des gestes inhabituels ou des schémas de mouvement dans des espaces publics.
Comme il fonctionnait avec des caméras standard, OpenPose a facilité les premières expérimentations dans des environnements comme les hôpitaux et les pôles de transport. Ces études ont contribué au développement de modèles plus récents, désormais utilisés dans les systèmes de vidéosurveillance, de détection des chutes et d’intervention d’urgence.

Fig 6. Détection des chutes rendue possible par OpenPose.
Avantages et inconvénients d’OpenPose#
Voici un aperçu de certains avantages offerts par OpenPose :
- Utile pour la recherche et le prototypage : Il a été largement utilisé dans la recherche universitaire, notamment dans des domaines comme l’interaction humain-machine, la biomécanique et l’analyse comportementale.
- Prise en charge multiplateforme : Il peut fonctionner sous Windows, Linux et macOS, avec la prise en charge des unités centrales de traitement (CPUs) et des unités de traitement graphique (GPUs).
- Capacité de traitement hors ligne : Il peut fonctionner dans des environnements sans accès à Internet, ce qui le rend idéal pour les contextes sensibles en matière de confidentialité, comme la santé ou l’éducation.
Bien qu’OpenPose ait représenté une avancée majeure, il présente également des limites techniques importantes à garder à l’esprit. Voici quelques-uns des principaux défis associés à OpenPose :
- Besoins élevés en calcul : L’exécution d’OpenPose en temps réel nécessite un GPU puissant et des ressources informatiques importantes.
- Sensible à l’environnement : Les performances peuvent diminuer en cas de faible luminosité, dans les espaces bondés ou lorsque les angles de caméra ne sont pas idéaux.
- Plus lourd que les modèles récents : Comparé aux modèles d’estimation de pose plus récents, OpenPose est relativement volumineux et plus lent. Il est peu adapté au déploiement sur des appareils aux ressources limitées, comme les smartphones, les tablettes ou les systèmes embarqués.
Points clés à retenir#
OpenPose a joué un rôle important en rendant l’estimation de pose plus accessible. Il a montré qu’il était possible de suivre les mouvements du corps avec une simple caméra, sans recourir à des combinaisons ou à du matériel spécialisé.
Il a posé les bases de nombreuses applications concrètes dans les domaines de la santé, de l’éducation, du divertissement et de la recherche. Alors que les modèles plus récents offrent désormais des vitesses supérieures et une exécution plus légère, OpenPose reste une référence essentielle pour comprendre l’évolution de l’estimation de pose.
Rejoins notre communauté et consulte notre dépôt GitHub pour en savoir plus sur l’AI. Si tu souhaites créer tes propres solutions de vision par ordinateur, découvre nos options de licence. Consulte également les ressources sur la vision par ordinateur dans le secteur de la santé et l’AI dans la logistique pour découvrir leur impact !









