Ultralytics YOLO27 :
Vision par IA

L’IA de vision rend possible la technologie de reconnaissance des gestes sans contact

Découvre comment les modèles de vision par ordinateur alimentent la technologie de reconnaissance des gestes pour détecter, suivre et comprendre les gestes des mains dans diverses applications.

ABAbirami Vina13 min read
L’IA de vision au service de la reconnaissance des gestes sans contact

À mesure que la technologie évolue, notre manière d'interagir avec elle évolue elle aussi. Les premières machines reposaient sur l'effort physique et les commandes mécaniques, tandis que l'informatique moderne a introduit les écrans tactiles et la saisie vocale.

Désormais, la reconnaissance des gestes constitue une nouvelle étape, en utilisant les mouvements naturels comme interface utilisateur. Un simple signe de la main, un pincement ou un geste rapide de la main peut déjà contrôler des applications, des écrans et des machines.

Cette interaction sans contact peut être rendue possible par la vision par ordinateur, une branche de l'IA qui aide les machines à voir et à interpréter ce qu'une caméra capture. Les systèmes de vision par IA peuvent être intégrés aux smartphones, aux casques de réalité virtuelle (VR) et de réalité augmentée (AR), aux voitures et aux appareils domestiques intelligents, où les gestes peuvent remplacer les pressions, les clics et les boutons pour une expérience utilisateur plus fluide.

Le contrôle sans contact devient de plus en plus courant dans la vie quotidienne. Sur les lieux de travail et dans les espaces partagés, éviter le contact physique peut améliorer l'hygiène et la sécurité. De nombreux produits numériques évoluent également vers une interaction mains libres, et les gestes offrent un moyen simple et intuitif de contrôler les appareils sans les toucher.

Dans cet article, nous allons découvrir ce qu'est la reconnaissance des gestes, comment la vision par ordinateur la rend plus précise et où elle est utilisée dans des applications concrètes. C'est parti !

Qu'est-ce que la reconnaissance des gestes ?#

La reconnaissance des gestes est une technologie de détection qui permet aux machines de comprendre les gestes humains, comme les signes de la main ou les mouvements du corps, et de les convertir en actions numériques. Au lieu d'appuyer sur un écran ou sur des boutons, tu peux contrôler les appareils par des mouvements simples et naturels.

Les interactions deviennent ainsi plus intuitives, ce qui explique pourquoi la saisie fondée sur les gestes est adoptée dans de nombreux systèmes de contrôle reposant sur le machine learning et l'IA. En particulier, la reconnaissance des gestes de la main est l'une des formes de reconnaissance des gestes les plus utilisées et repose souvent sur la vision par ordinateur.

En termes simples, une solution de vision par IA peut repérer les mains dans un flux vidéo, suivre leurs mouvements ou leurs changements de forme, puis associer ces schémas à un geste connu pour déclencher une action à l'écran.

Un élément clé de ces solutions est un modèle de vision par ordinateur, entraîné sur des jeux de données d'images ou de vidéos annotées montrant différents gestes de la main. Grâce à des données d'entraînement diversifiées et à une évaluation rigoureuse, le modèle peut mieux se généraliser à différents utilisateurs, conditions d'éclairage et arrière-plans, ce qui l'aide à reconnaître les gestes de manière plus fiable dans des environnements réels.

Données utilisées pour entraîner un modèle de vision par ordinateur à détecter les points clés des gestes

Fig. 1. Données utilisées pour entraîner un modèle de vision par ordinateur à détecter les points clés des gestes (Source)

Exploration des différents types de gestes et de l'interaction homme-machine#

Avant d'examiner plus en détail le rôle de la vision par ordinateur dans la reconnaissance des gestes, prenons un peu de recul pour observer les types de gestes que ces systèmes reconnaissent généralement.

Dans la plupart des cas, les gestes se répartissent en deux catégories : statiques et dynamiques. Les gestes statiques sont des positions fixes de la main, comme un pouce levé, un signe d'arrêt ou un signe de paix. Comme ils n'impliquent aucun mouvement, ils peuvent souvent être reconnus à partir d'une seule image.

Les gestes dynamiques impliquent quant à eux un mouvement dans le temps, comme faire signe de la main ou faire glisser la main dans l'air. Pour les reconnaître, un système de vision par IA doit analyser plusieurs images afin de suivre le mouvement de la main et de comprendre la direction et le rythme du geste.

Le rôle des algorithmes de vision par ordinateur dans la reconnaissance des gestes#

Les systèmes de reconnaissance des gestes peuvent être conçus de différentes manières. Certains systèmes de saisie utilisent des capteurs portables, comme des gants ou des dispositifs de suivi fixés au poignet, pour capturer les mouvements de la main.

Ces dispositifs peuvent être précis, mais ils ne sont pas toujours pratiques. Les appareils portables doivent être portés, installés, rechargés et entretenus, et peuvent sembler contraignants dans les espaces partagés ou lors d'une utilisation quotidienne.

C'est pourquoi de nombreux systèmes de pointe s'appuient plutôt sur la vision par ordinateur. Grâce à des caméras RGB standard et à des capteurs de profondeur ou à temps de vol, les appareils peuvent capturer en temps réel les mouvements des mains et du corps sans que les utilisateurs aient à porter de dispositifs supplémentaires. La reconnaissance des gestes fondée sur la vision convient donc parfaitement aux smartphones, aux voitures, aux téléviseurs intelligents et aux casques AR et VR.

Par exemple, des modèles de vision par ordinateur comme Ultralytics YOLO11 et le prochain Ultralytics YOLO26 prennent en charge des tâches telles que la détection d'objets, le suivi d'objets et l'estimation de pose. Ces fonctionnalités peuvent servir à détecter les mains dans chaque image, à suivre leur mouvement au fil du temps et à cartographier des points clés comme le bout des doigts et les articulations. Il devient ainsi possible de reconnaître des gestes comme une paume levée pour mettre en pause, un pincement pour zoomer, un glissement pour parcourir les menus ou un geste de pointage pour sélectionner un élément en AR et VR.

Tâches de vision par ordinateur utilisées pour la reconnaissance des interactions homme-machine#

Voici un aperçu de quelques-unes des principales tâches de vision par ordinateur utilisées pour la reconnaissance des gestes :

  • Détection d'objets : cette tâche sert à localiser les mains dans une image ou une image vidéo, généralement en traçant des boîtes englobantes autour d'elles. Elle aide le système à se concentrer sur la zone du geste et à ignorer les détails inutiles de l'arrière-plan.
  • Suivi d'objets : s'appuyant sur la détection d'objets, cette tâche suit les mains détectées sur plusieurs images et conserve leur identité au fil du temps. Elle est particulièrement utile pour les gestes dynamiques, où le mouvement et la direction sont essentiels.
  • Estimation de pose : au lieu de se concentrer sur les boîtes englobantes, l'estimation de pose identifie les points clés de la main, comme le bout des doigts, les articulations et le poignet. Ces repères créent un squelette simple de la main qui capture la position des doigts et les mouvements subtils, permettant une classification plus détaillée des gestes.
  • Segmentation d'instances : cette tâche vise à séparer chaque main de l'arrière-plan au niveau des pixels en générant un masque pour chaque main visible. Elle est utile dans les scènes encombrées, lorsque les mains se chevauchent ou lorsque plusieurs mains apparaissent dans l'image.

De nombreuses solutions de vision par IA utilisent ces tâches ensemble dans le cadre d'un pipeline unique. Par exemple, un système peut commencer par la détection d'objets pour trouver les mains, puis utiliser le suivi pour les suivre d'une image à l'autre lors de gestes dynamiques.

Si le geste dépend de la position des doigts, l'estimation de pose peut ajouter des points clés pour obtenir davantage de détails, tandis que la segmentation d'instances peut aider à isoler chaque main plus précisément dans les scènes encombrées ou lorsque plusieurs mains se chevauchent. Ensemble, ces étapes fournissent des informations sur la position et le mouvement, rendant la reconnaissance des gestes plus précise et plus fiable.

Fonctionnement de la reconnaissance des gestes fondée sur la vision#

Maintenant que nous comprenons mieux les tâches de vision par ordinateur qui sous-tendent la reconnaissance des gestes, examinons étape par étape le fonctionnement d'un système fondé sur la vision.

Un système classique commence par capturer une vidéo à partir d'une caméra, parfois accompagnée de données de profondeur si l'appareil les prend en charge. Les images sont ensuite prétraitées à l'aide du traitement d'image afin que le modèle puisse les traiter de manière cohérente, par exemple en les redimensionnant, en les stabilisant ou en réduisant le bruit et le flou de mouvement.

Ensuite, le système identifie les mains dans l'image à l'aide de la détection ou de la segmentation, puis les suit au fil du temps. Si l'application nécessite davantage de détails, elle peut également effectuer une estimation de pose pour extraire des points clés comme le bout des doigts et les articulations. À partir de ces informations, le modèle classe le geste, qu'il s'agisse d'une position sur une seule image, comme un pouce levé, ou d'un schéma de mouvement, comme un glissement.

Enfin, le geste reconnu est associé à une action dans l'interface, comme faire défiler, zoomer, sélectionner un élément, régler le volume ou contrôler des interactions AR et VR. Le pipeline exact peut varier : les applications simples utilisent moins d'étapes, tandis que les applications plus complexes combinent détection, suivi et estimation de pose pour une meilleure précision.

Applications de la reconnaissance des gestes fondée sur la vision#

Voyons maintenant comment la reconnaissance des gestes est utilisée dans des applications concrètes pour comprendre les positions des mains.

Interaction fondée sur les gestes avec les systèmes d'infodivertissement automobile#

La reconnaissance des gestes commence à apparaître dans les interfaces des véhicules intelligents, notamment dans les systèmes d'infodivertissement. Elle offre un moyen pratique de contrôler certaines fonctionnalités avec de simples mouvements de la main, ce qui peut réduire la fréquence à laquelle les conducteurs doivent atteindre les écrans tactiles ou les boutons physiques. Par exemple, un geste rapide peut servir à régler le volume, gérer des appels ou parcourir les menus à l'écran.

Un conducteur effectuant des gestes de la main dans la zone de détection d'un système d'infodivertissement

Fig. 2. Un conducteur effectuant des gestes de la main dans la zone de détection d'un système d'infodivertissement (Source)

Interactions commandées par les gestes dans les jeux vidéo#

Dans les jeux vidéo et les expériences immersives, le contrôle fondé sur les gestes transforme la manière dont les utilisateurs interagissent avec les mondes virtuels. Au lieu de dépendre uniquement de manettes ou de joysticks, les joueurs peuvent utiliser des mouvements naturels de la main pour parcourir les menus, saisir des objets virtuels, contrôler des personnages ou déclencher des actions dans un jeu.

Jouer à des jeux vidéo avec des gestes de la main

Fig. 3. Jouer à des jeux vidéo avec des gestes de la main (Source).

Ce type d'interaction sans contact peut sembler plus fluide, en particulier en AR et VR. Par conséquent, le suivi des mains et le contrôle par gestes deviennent des fonctionnalités courantes des casques VR et de réalité mixte.

Un contrôle gestuel fluide pour les appareils domestiques intelligents#

Les appareils domestiques intelligents, comme les téléviseurs intelligents, les enceintes et les éclairages connectés, commencent à prendre en charge le contrôle par gestes pour des actions rapides et sans contact. D'un simple mouvement de la main, tu peux allumer les lumières, régler le volume ou déclencher des commandes de base sans avoir à atteindre les interrupteurs ou les télécommandes.

Par exemple, dans les installations de divertissement à domicile, des caméras de profondeur intégrées ou connectées peuvent reconnaître des gestes comme faire glisser la main, pointer ou lever la main. Cela peut faciliter la navigation dans les menus, la modification des paramètres ou la confirmation de sélections depuis l'autre côté de la pièce. En coulisses, les modèles de vision par ordinateur traitent le flux de la caméra en temps réel pour détecter et interpréter ces gestes.

Contrôle robotique par les gestes grâce à l'intelligence artificielle#

Imagine une situation dans une usine où un opérateur doit guider un robot tout en transportant des pièces, en portant des gants ou en se tenant à une distance de sécurité d'un équipement en mouvement. Dans ces situations, atteindre des boutons ou un panneau de commande peut être lent, voire dangereux.

En revanche, les systèmes de contrôle fondés sur les gestes peuvent offrir un moyen plus pratique et mains libres d'interagir avec ces machines. Cela est particulièrement utile pour les robots collaboratifs, ou cobots, conçus pour travailler aux côtés des humains.

Au lieu de se rendre jusqu'à un panneau de commande, les opérateurs peuvent utiliser de simples signaux de la main pour démarrer, arrêter ou guider un robot à distance. Cela réduit la dépendance aux commandes physiques et peut favoriser des processus de travail plus sûrs dans l'atelier.

Les systèmes avancés de contrôle fondés sur la vision, rendus possibles par des modèles de deep learning ou des algorithmes d'apprentissage, peuvent également aller au-delà des commandes de base. Ils peuvent interpréter des mouvements plus fins de la main et réagir avec fluidité à de petits changements de direction ainsi qu'à des indications et à une automatisation plus précises.

Une main robotique analysant le geste d'un utilisateur

Fig. 4. Une main robotique analysant le geste d'un utilisateur (Source)

Avantages et inconvénients de la technologie de reconnaissance des gestes#

Voici quelques avantages clés de l'utilisation de la technologie de reconnaissance des gestes :

  • Accessibilité améliorée : les gestes peuvent offrir une solution alternative aux utilisateurs qui ont des difficultés à utiliser des claviers, des écrans tactiles ou des manettes.
  • Fonctionnement à distance : les gestes peuvent être reconnus depuis l'autre côté d'une pièce, ce qui est utile pour les téléviseurs intelligents, les bornes et les appareils domestiques.
  • Flexibilité entre les appareils : des ensembles de gestes similaires peuvent fonctionner sur des téléphones, des voitures, des écrans intelligents et des casques AR ou VR, garantissant une interaction cohérente.

Dans le même temps, quelques difficultés concrètes peuvent affecter la précision et la cohérence. Voici certains facteurs à prendre en compte :

  • Problèmes d'éclairage et de qualité de caméra : une faible luminosité, les reflets, les ombres ou les caméras à basse résolution peuvent réduire les performances de reconnaissance. Cela peut à son tour affecter le contrôle des mouvements.
  • Variations entre les utilisateurs : les personnes effectuent naturellement les gestes de manière différente, et les différences de taille des mains, de souplesse des doigts ou d'accessoires peuvent affecter la précision.
  • Limites liées aux mouvements rapides : les gestes rapides peuvent provoquer un flou de mouvement ou amener le modèle à manquer des images clés, en particulier avec les caméras ayant une fréquence d'images faible.

Points clés à retenir#

La technologie de reconnaissance des gestes est sortie des laboratoires de recherche et fait désormais partie des appareils et des innovations du quotidien. Plus précisément, la vision par ordinateur permet un contrôle sans contact dans les jeux vidéo, la robotique, les maisons intelligentes et les systèmes automobiles. À mesure que les modèles de vision s'améliorent, ces interfaces sans contact deviendront probablement plus faciles à concevoir et plus largement utilisées.

Découvre notre communauté et notre dépôt GitHub pour en savoir plus sur les modèles de vision par ordinateur. Explore nos pages de solutions pour découvrir des applications comme l'IA dans l'agriculture et la vision par ordinateur dans la logistique. Consulte nos options de licence et commence à créer ton propre modèle de vision par IA.

Explore solutions

Vision par ordinateur pour l'imagerie aérienne

Vision par ordinateur pour l'imagerie aérienne

Transforme les images de drones et aériennes en informations en temps réel pour l'agriculture, l'aquaculture, la surveillance environnementale, la conservation et l'analyse géospatiale avec Ultralytics YOLO.
En savoir plus
Vision par ordinateur dans l'aérospatiale

Vision par ordinateur dans l'aérospatiale

Apporte l'IA de vision à la surveillance aérienne grâce aux modèles Ultralytics YOLO. Alimente les drones, les flux de travail aérospatiaux, la conservation de l'environnement et les industries géospatiales avec des solutions de vision par ordinateur.
En savoir plus

Protège chaque site avec les modèles Ultralytics YOLO. L'IA de vision alimente la surveillance du périmètre, la détection des menaces, la reconnaissance des plaques d'immatriculation et la sécurité au travail.
En savoir plus
Vision par ordinateur en robotique

Vision par ordinateur en robotique

Donne plus d’intelligence à tes machines avec les modèles Ultralytics YOLO. L’IA visuelle en robotique permet la navigation autonome, la perception, le suivi d’objets et le contrôle en temps réel.
En savoir plus
Vision par ordinateur en logistique

Vision par ordinateur en logistique

Optimise la logistique avec les modèles Ultralytics YOLO. L’IA visuelle permet l’inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Vision par ordinateur dans le commerce de détail

Vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. L’IA visuelle permet le suivi des stocks, la surveillance des rayons, la gestion des files d’attente et l’obtention d’informations plus pertinentes sur les clients.
En savoir plus
La vision par ordinateur dans le secteur de la santé

La vision par ordinateur dans le secteur de la santé

Développe des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans le secteur de la santé accélère l'imagerie médicale, améliore les diagnostics et renforce la surveillance des patients.
En savoir plus
La vision par ordinateur dans l'industrie manufacturière

La vision par ordinateur dans l'industrie manufacturière

Optimise la production industrielle avec les modèles Ultralytics YOLO. L'IA de vision améliore le contrôle qualité, la détection des défauts, le respect des règles relatives aux EPI et l'automatisation des lignes d'assemblage.
En savoir plus
Vision par ordinateur dans l’automobile

Vision par ordinateur dans l’automobile

Applique la vision par ordinateur à l’automobile avec les modèles Ultralytics YOLO. L’IA de vision améliore la sécurité routière, l’aide à la conduite et l’automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Vision par ordinateur dans l’agriculture

Vision par ordinateur dans l’agriculture

Apporte l’IA de vision à l’agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l’agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus
Vision par ordinateur pour l'imagerie aérienne

Vision par ordinateur pour l'imagerie aérienne

Transforme les images de drones et aériennes en informations en temps réel pour l'agriculture, l'aquaculture, la surveillance environnementale, la conservation et l'analyse géospatiale avec Ultralytics YOLO.
En savoir plus
Vision par ordinateur dans l'aérospatiale

Vision par ordinateur dans l'aérospatiale

Apporte l'IA de vision à la surveillance aérienne grâce aux modèles Ultralytics YOLO. Alimente les drones, les flux de travail aérospatiaux, la conservation de l'environnement et les industries géospatiales avec des solutions de vision par ordinateur.
En savoir plus

Protège chaque site avec les modèles Ultralytics YOLO. L'IA de vision alimente la surveillance du périmètre, la détection des menaces, la reconnaissance des plaques d'immatriculation et la sécurité au travail.
En savoir plus
Vision par ordinateur en robotique

Vision par ordinateur en robotique

Donne plus d’intelligence à tes machines avec les modèles Ultralytics YOLO. L’IA visuelle en robotique permet la navigation autonome, la perception, le suivi d’objets et le contrôle en temps réel.
En savoir plus
Vision par ordinateur en logistique

Vision par ordinateur en logistique

Optimise la logistique avec les modèles Ultralytics YOLO. L’IA visuelle permet l’inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Vision par ordinateur dans le commerce de détail

Vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. L’IA visuelle permet le suivi des stocks, la surveillance des rayons, la gestion des files d’attente et l’obtention d’informations plus pertinentes sur les clients.
En savoir plus
La vision par ordinateur dans le secteur de la santé

La vision par ordinateur dans le secteur de la santé

Développe des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans le secteur de la santé accélère l'imagerie médicale, améliore les diagnostics et renforce la surveillance des patients.
En savoir plus
La vision par ordinateur dans l'industrie manufacturière

La vision par ordinateur dans l'industrie manufacturière

Optimise la production industrielle avec les modèles Ultralytics YOLO. L'IA de vision améliore le contrôle qualité, la détection des défauts, le respect des règles relatives aux EPI et l'automatisation des lignes d'assemblage.
En savoir plus
Vision par ordinateur dans l’automobile

Vision par ordinateur dans l’automobile

Applique la vision par ordinateur à l’automobile avec les modèles Ultralytics YOLO. L’IA de vision améliore la sécurité routière, l’aide à la conduite et l’automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Vision par ordinateur dans l’agriculture

Vision par ordinateur dans l’agriculture

Apporte l’IA de vision à l’agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l’agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus
Vision par ordinateur pour l'imagerie aérienne

Vision par ordinateur pour l'imagerie aérienne

Transforme les images de drones et aériennes en informations en temps réel pour l'agriculture, l'aquaculture, la surveillance environnementale, la conservation et l'analyse géospatiale avec Ultralytics YOLO.
En savoir plus
Vision par ordinateur dans l'aérospatiale

Vision par ordinateur dans l'aérospatiale

Apporte l'IA de vision à la surveillance aérienne grâce aux modèles Ultralytics YOLO. Alimente les drones, les flux de travail aérospatiaux, la conservation de l'environnement et les industries géospatiales avec des solutions de vision par ordinateur.
En savoir plus

Protège chaque site avec les modèles Ultralytics YOLO. L'IA de vision alimente la surveillance du périmètre, la détection des menaces, la reconnaissance des plaques d'immatriculation et la sécurité au travail.
En savoir plus
Vision par ordinateur en robotique

Vision par ordinateur en robotique

Donne plus d’intelligence à tes machines avec les modèles Ultralytics YOLO. L’IA visuelle en robotique permet la navigation autonome, la perception, le suivi d’objets et le contrôle en temps réel.
En savoir plus
Vision par ordinateur en logistique

Vision par ordinateur en logistique

Optimise la logistique avec les modèles Ultralytics YOLO. L’IA visuelle permet l’inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Vision par ordinateur dans le commerce de détail

Vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. L’IA visuelle permet le suivi des stocks, la surveillance des rayons, la gestion des files d’attente et l’obtention d’informations plus pertinentes sur les clients.
En savoir plus
La vision par ordinateur dans le secteur de la santé

La vision par ordinateur dans le secteur de la santé

Développe des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans le secteur de la santé accélère l'imagerie médicale, améliore les diagnostics et renforce la surveillance des patients.
En savoir plus
La vision par ordinateur dans l'industrie manufacturière

La vision par ordinateur dans l'industrie manufacturière

Optimise la production industrielle avec les modèles Ultralytics YOLO. L'IA de vision améliore le contrôle qualité, la détection des défauts, le respect des règles relatives aux EPI et l'automatisation des lignes d'assemblage.
En savoir plus
Vision par ordinateur dans l’automobile

Vision par ordinateur dans l’automobile

Applique la vision par ordinateur à l’automobile avec les modèles Ultralytics YOLO. L’IA de vision améliore la sécurité routière, l’aide à la conduite et l’automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Vision par ordinateur dans l’agriculture

Vision par ordinateur dans l’agriculture

Apporte l’IA de vision à l’agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l’agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus

Construisons ensemble l'avenir de l'IA !

Commence ton parcours vers l'avenir de l'apprentissage automatique