Pose Estimation
Scopri come la stima della posa utilizza i keypoint per tracciare il movimento. Esplora le applicazioni del mondo reale e inizia con Ultralytics YOLO26 per risultati rapidi e precisi.
L'estimazione della posa è una tecnica di computer vision specializzata che va oltre la semplice rilevamento della presenza di oggetti per comprendere la loro struttura geometrica e l'orientamento fisico. Mentre lo object detection standard disegna un semplice riquadro rettangolare attorno a un soggetto, l'estimazione della posa identifica specifici punti semantici, noti come keypoints, come le articolazioni sul corpo umano (gomiti, ginocchia, spalle) o gli angoli strutturali su un veicolo. Mappando questi punti di riferimento, i modelli di machine learning possono ricostruire una rappresentazione scheletrica del soggetto, consentendo ai sistemi di interpretare il linguaggio del corpo, le dinamiche di movimento e il posizionamento preciso nello spazio 2D o 3D.
Meccanismi principali: Top-Down vs. Bottom-Up#
La moderna estimazione della posa si basa fortemente su sofisticate architetture di deep learning, utilizzando spesso Convolutional Neural Networks (CNNs) per elaborare i dati visivi. Gli algoritmi seguono generalmente una di due strategie principali per identificare i keypoints:
- Approcci Top-Down: Questo metodo impiega inizialmente un modello di object detection per individuare singole istanze all'interno di bounding boxes. Una volta che una persona o un oggetto viene ritagliato dall'immagine più grande, l'estimatore della posa prevede i keypoints all'interno di quella specifica regione. Questo approccio è spesso estremamente accurato ma può soffrire di una maggiore inference latency all'aumentare del numero di soggetti nell'inquadratura.
- Approcci Bottom-Up: Al contrario, questa strategia rileva simultaneamente tutti i potenziali keypoints nell'intera immagine (ad esempio, trovando ogni "ginocchio sinistro" in una folla) e utilizza quindi algoritmi di associazione per raggrupparli in singoli scheletri. Questo metodo è generalmente preferito per il real-time inference in scene affollate perché il costo computazionale rimane relativamente costante indipendentemente da quante persone siano presenti.
I modelli all'avanguardia come YOLO26 utilizzano architetture end-to-end avanzate che bilanciano queste esigenze, fornendo un'estimazione della posa ad alta velocità adatta all'implementazione su dispositivi edge AI e piattaforme mobili.
Distinguere i termini correlati alla computer vision#
È utile differenziare l'estimazione della posa da altre attività di riconoscimento visivo per comprenderne il valore unico nei flussi di lavoro di computer vision:
- Object Detection: Si concentra sull'identificare cosa e dove sia un oggetto, restituendo una scatola rettangolare. Tratta il soggetto come un oggetto rigido senza comprenderne l'articolazione interna.
- Instance Segmentation: Genera una maschera perfetta al pixel che delinea la forma precisa dell'oggetto. Sebbene la segmentazione fornisca i confini, non identifica esplicitamente le articolazioni o i collegamenti scheletrici richiesti per il kinematic analysis.
- Pose Estimation: Mira specificamente alla struttura interna, mappando le connessioni tra punti di riferimento predeterminati (ad esempio, dall'anca al ginocchio) per analizzare la postura e l'azione.
Applicazioni nel mondo reale#
La capacità di digitalizzare il movimento umano e degli oggetti ha portato ad applicazioni trasformative in vari settori, spesso addestrate utilizzando strumenti come la Ultralytics Platform per gestire grandi dataset di keypoints annotati.
Sanità e riabilitazione#
In campo medico, la AI in healthcare utilizza l'estimazione della posa per monitorare la riabilitazione dei pazienti da remoto. Tracciando gli angoli delle articolazioni e l'ampiezza di movimento, i sistemi automatizzati possono garantire che i pazienti eseguano correttamente gli physical therapy exercises a casa. Questo riduce il rischio di re-infortunio e consente ai clinici di quantificare i progressi della guarigione senza la necessità di costose attrezzature da laboratorio.
Analisi sportiva#
Gli allenatori e gli atleti sfruttano la sports analytics per ottimizzare le prestazioni. I modelli di estimazione della posa possono analizzare il piano di swing di un golfista, la lunghezza della falcata di un runner o la biomeccanica di un lanciatore senza la necessità di tute con marcatori intrusive utilizzate nel tradizionale motion capture. Ciò fornisce un feedback immediato basato sui dati per migliorare la tecnica e prevenire lesioni da usura.
Vendita al dettaglio e analisi del comportamento#
Negli ambienti commerciali, i sistemi di AI in retail utilizzano il rilevamento della posa per comprendere il comportamento dei clienti, come l'afferrare prodotti su scaffali alti o il soffermarsi in corridoi specifici. Questi dati aiutano a ottimizzare la disposizione dei negozi e a migliorare la inventory management correlando le azioni fisiche con le decisioni di acquisto.
Esempio di codice: Stima della posa con Ultralytics YOLO26#
Implementare l'estimazione della posa è semplice con i moderni framework Python. Il seguente esempio dimostra come utilizzare il pacchetto ultralytics per caricare un modello YOLO26 pre-addestrato (il successore di YOLO11) e rilevare i keypoints umani in un'immagine.
from ultralytics import YOLO
# Load the YOLO26 pose model (nano version for speed)
model = YOLO("yolo26n-pose.pt")
# Perform inference on an image source
# The model identifies bounding boxes and specific keypoints (joints)
results = model("https://ultralytics.com/images/bus.jpg")
# Print the xy coordinates of detected keypoints
print(results[0].keypoints.xy)
# Visualize the skeletal results directly
results[0].show()





