Action Recognition
Explore comment la reconnaissance des actions identifie les comportements dans les vidéos. Apprends à utiliser Ultralytics YOLO26 pour l’estimation de pose et à créer des systèmes IA intelligents pour les tâches HAR.
La reconnaissance d’actions, également appelée reconnaissance de l’activité humaine (HAR), est un sous-domaine dynamique de la vision par ordinateur (CV) qui vise à identifier et à classer des comportements ou mouvements spécifiques effectués par des sujets dans des données vidéo. Alors que la détection d’objets traditionnelle répond à la question « que contient l’image ? », la reconnaissance d’actions s’intéresse à une question plus complexe : « que se passe-t-il au fil du temps ? ». En analysant des séquences d’images plutôt que des images statiques, les modèles de machine learning (ML) peuvent distinguer des activités complexes telles que « marcher », « faire du vélo », « tomber » ou « se serrer la main », ce qui en fait un composant essentiel pour créer des systèmes intelligents capables de comprendre les intentions et le contexte humains.
Concepts et techniques fondamentaux#
La reconnaissance des actions exige qu’un modèle traite à la fois les informations spatiales (l’apparence des objets ou des personnes) et les informations temporelles (la manière dont ils se déplacent au fil du temps). Pour y parvenir, les systèmes modernes d’intelligence artificielle (AI) utilisent souvent des architectures spécialisées qui vont au-delà des réseaux de neurones convolutifs (CNNs) classiques.
- Estimation de pose : une technique puissante grâce à laquelle le modèle suit des points clés spécifiques du corps humain, comme les coudes, les genoux et les épaules. Les variations géométriques de ces points clés au fil du temps fournissent un signal fiable pour classer les actions, indépendamment de la complexité de l’arrière-plan.
- Modélisation temporelle : les algorithmes utilisent des structures telles que les réseaux de neurones récurrents (RNNs) ou les réseaux à mémoire court terme-long terme (LSTM) pour mémoriser les images précédentes et prédire les actions futures. Plus récemment, les Transformers vidéo ont gagné en popularité grâce à leur capacité à gérer les dépendances à longue portée dans les flux vidéo.
- Réseaux à deux flux : cette approche traite en parallèle les caractéristiques spatiales (images RGB) et les caractéristiques temporelles (souvent à l’aide du flux optique), puis fusionne les données pour effectuer la classification finale.
Applications concrètes#
La capacité à interpréter automatiquement les mouvements humains possède un potentiel transformateur dans divers secteurs, en améliorant la sécurité, l’efficacité et l’expérience utilisateur.
- AI dans le secteur de la santé : la reconnaissance d’actions est essentielle aux systèmes de surveillance des patients. Elle permet par exemple de détecter automatiquement les chutes dans les maisons de retraite et d’alerter immédiatement le personnel si un patient s’effondre. Elle est également utilisée pour la rééducation physique à distance, où des coachs basés sur l’AI analysent la posture d’un patient pendant ses exercices afin de vérifier qu’il effectue les mouvements correctement et en toute sécurité.
- Surveillance intelligente et sécurité : au-delà de la simple détection de mouvements, les systèmes de sécurité avancés utilisent la reconnaissance d’actions pour identifier des comportements suspects, comme les bagarres, le vol à l’étalage ou les entrées non autorisées, tout en ignorant les activités anodines. Cela réduit les fausses alertes et améliore la surveillance de sécurité en temps réel.
Mettre en œuvre l’analyse des actions avec Ultralytics#
Un workflow courant consiste d’abord à détecter les personnes et leur pose squelettique, puis à analyser le mouvement de leurs articulations. Le modèle Ultralytics YOLO26 offre une vitesse et une précision de pointe pour l’étape initiale d’estimation de pose, qui constitue la base de nombreux pipelines de reconnaissance d’actions.
L’exemple suivant montre comment extraire des points clés squelettiques d’une image vidéo à l’aide de Python :
from ultralytics import YOLO
# Load the YOLO26 pose estimation model
model = YOLO("yolo26n-pose.pt")
# Run inference on an image to detect person keypoints
results = model("https://ultralytics.com/images/bus.jpg")
# Process results
for result in results:
# Access the keypoints (x, y, visibility)
if result.keypoints is not None:
print(f"Detected keypoints shape: {result.keypoints.data.shape}")Distinction entre les termes associés#
Il est important de distinguer la reconnaissance d’actions des tâches similaires de vision par ordinateur afin de garantir l’application des méthodes appropriées.
- Reconnaissance d’actions et suivi d’objets : le suivi d’objets vise à conserver l’identité d’un objet ou d’une personne spécifique au fil de ses déplacements entre les images (par exemple : « La personne A se trouve à la coordonnée X »). La reconnaissance d’actions interprète le comportement du sujet suivi (par exemple : « La personne A court »).
- Reconnaissance d’actions et compréhension vidéo : alors que la reconnaissance d’actions identifie des actes physiques spécifiques, la compréhension vidéo est un concept plus large qui consiste à appréhender l’ensemble du récit, du contexte et des relations causales présents dans une scène vidéo.
Défis et tendances futures#
Le développement de modèles robustes de reconnaissance d’actions présente des difficultés, notamment en raison du besoin de jeux de données vidéo volumineux et annotés, comme Kinetics-400 ou UCF101. L’annotation de données vidéo prend beaucoup plus de temps que celle d’images statiques. Pour y remédier, des outils comme l’Ultralytics Platform contribuent à rationaliser le workflow d’annotation et d’entraînement.
Par ailleurs, l’efficacité computationnelle est essentielle. Le traitement de vidéos haute résolution en temps réel nécessite d’importantes ressources matérielles. Le secteur s’oriente de plus en plus vers l’Edge AI, en optimisant les modèles pour qu’ils s’exécutent directement sur les caméras et les appareils mobiles afin de réduire la latence et l’utilisation de la bande passante. Les progrès futurs visent à améliorer la généralisation des modèles, afin de permettre aux systèmes de reconnaître des actions même depuis des points de vue sur lesquels ils n’ont pas été explicitement entraînés.









