Pose Estimation
Scopri come la stima della posa utilizza i keypoint per tracciare i movimenti. Esplora le applicazioni del mondo reale e inizia a usare Ultralytics YOLO26 per ottenere risultati rapidi e accurati.
La stima della posa è una tecnica specializzata di visione artificiale che va oltre il semplice rilevamento della presenza di oggetti, consentendo di comprenderne la struttura geometrica e l'orientamento fisico. Mentre il normale rilevamento degli oggetti disegna un semplice riquadro rettangolare attorno a un soggetto, la stima della posa identifica punti semantici specifici, noti come punti chiave, ad esempio le articolazioni del corpo umano (gomiti, ginocchia, spalle) o gli angoli strutturali di un veicolo. Mappando questi punti di riferimento, i modelli di machine learning possono ricostruire una rappresentazione scheletrica del soggetto, consentendo ai sistemi di interpretare il linguaggio del corpo, le dinamiche del movimento e il posizionamento preciso nello spazio 2D o 3D.
Meccanismi fondamentali: approcci top-down e bottom-up#
La moderna stima della posa si basa fortemente su architetture avanzate di deep learning, che spesso utilizzano reti neurali convoluzionali (CNNs) per elaborare i dati visivi. Gli algoritmi seguono generalmente una delle due strategie principali per identificare i punti chiave:
- Approcci top-down: questo metodo utilizza innanzitutto un modello di rilevamento degli oggetti per individuare le singole istanze all'interno dei riquadri di delimitazione. Una volta ritagliata una persona o un oggetto dall'immagine più ampia, lo stimatore della posa prevede i punti chiave all'interno di quella specifica regione. Questo approccio è spesso molto preciso, ma può presentare una maggiore latenza di inferenza all'aumentare del numero di soggetti nell'inquadratura.
- Approcci bottom-up: al contrario, questa strategia rileva simultaneamente tutti i potenziali punti chiave nell'intera immagine (ad esempio, individuando ogni "ginocchio sinistro" in una folla) e utilizza quindi algoritmi di associazione per raggrupparli in scheletri individuali. Questo metodo è generalmente preferito per l'inferenza in tempo reale nelle scene affollate, perché il costo computazionale rimane relativamente costante indipendentemente dal numero di persone presenti.
Modelli all'avanguardia come YOLO26 utilizzano architetture end-to-end avanzate che bilanciano queste esigenze, offrendo una stima della posa ad alta velocità, adatta alla distribuzione su dispositivi di edge AI e piattaforme mobili.
Distinzione tra termini correlati della visione artificiale#
Per comprenderne il valore esclusivo nei flussi di lavoro di visione artificiale, è utile distinguere la stima della posa da altre attività di riconoscimento visivo:
- Rilevamento degli oggetti: si concentra sull'identificare che cosa è un oggetto e dove si trova, producendo un riquadro rettangolare. Tratta il soggetto come un oggetto rigido, senza comprenderne l'articolazione interna.
- Segmentazione delle istanze: genera una maschera precisa a livello di pixel che delinea la forma esatta dell'oggetto. Sebbene la segmentazione fornisca i contorni, non identifica esplicitamente le articolazioni o i collegamenti scheletrici necessari per l'analisi cinematica.
- Stima della posa: mira specificamente alla struttura interna, mappando le connessioni tra punti di riferimento predefiniti (ad esempio, dall'anca al ginocchio) per analizzare la postura e l'azione.
Applicazioni nel mondo reale#
La capacità di digitalizzare il movimento umano e quello degli oggetti ha portato ad applicazioni trasformative in vari settori, spesso addestrate utilizzando strumenti come la Ultralytics Platform per gestire grandi set di dati contenenti punti chiave annotati.
Assistenza sanitaria e riabilitazione#
In ambito medico, l'AI nell'assistenza sanitaria utilizza la stima della posa per monitorare da remoto la riabilitazione dei pazienti. Tracciando gli angoli articolari e l'ampiezza del movimento, i sistemi automatizzati possono verificare che i pazienti eseguano correttamente a casa gli esercizi di fisioterapia. Ciò riduce il rischio di nuove lesioni e consente ai medici di quantificare i progressi della guarigione senza dover ricorrere a costose apparecchiature di laboratorio.
Analisi dello sport#
Allenatori e atleti sfruttano l'analisi dello sport per ottimizzare le prestazioni. I modelli di stima della posa possono analizzare il piano dello swing di un golfista, la lunghezza della falcata di un corridore o la biomeccanica di un lanciatore senza ricorrere alle ingombranti tute con marcatori utilizzate nel tradizionale motion capture. Ciò fornisce un feedback immediato basato sui dati per migliorare la tecnica e prevenire gli infortuni da sovraccarico.
Analisi del commercio al dettaglio e del comportamento#
Negli ambienti commerciali, i sistemi di AI nel commercio al dettaglio utilizzano il rilevamento della posa per comprendere il comportamento dei clienti, ad esempio quando prendono prodotti dagli scaffali alti o si soffermano in determinate corsie. Questi dati aiutano a ottimizzare la disposizione dei negozi e a migliorare la gestione dell'inventario, mettendo in relazione le azioni fisiche con le decisioni di acquisto.
Esempio di codice: stima della posa con Ultralytics YOLO26#
Implementare la stima della posa è semplice con i moderni framework Python. L'esempio seguente mostra come utilizzare il pacchetto ultralytics per caricare un modello YOLO26 preaddestrato (il successore di YOLO11) e rilevare i punti chiave umani in un'immagine.
from ultralytics import YOLO
# Load the YOLO26 pose model (nano version for speed)
model = YOLO("yolo26n-pose.pt")
# Perform inference on an image source
# The model identifies bounding boxes and specific keypoints (joints)
results = model("https://ultralytics.com/images/bus.jpg")
# Print the xy coordinates of detected keypoints
print(results[0].keypoints.xy)
# Visualize the skeletal results directly
results[0].show()








