La guida completa agli strumenti di stima della posa
Scopri come gli strumenti di stima della posa possono essere utilizzati per rilevare i punti chiave del corpo in immagini e video, stimare pose 2D e 3D e alimentare diverse applicazioni di vision AI.

Noi esseri umani leggiamo istintivamente i movimenti. Quando qualcuno si sporge in avanti, gira la testa o solleva un braccio, puoi capire immediatamente cosa sta facendo. È un’abilità silenziosa, quasi inconscia, che influenza il modo in cui interagiamo con le persone ed esploriamo il mondo.
Poiché la tecnologia diventa sempre più parte della vita quotidiana, è naturale voler fare in modo che i nostri dispositivi comprendano i movimenti con la stessa naturalezza con cui li comprendiamo noi. I recenti progressi nell’intelligenza artificiale, in particolare quelli basati sul deep learning, lo stanno rendendo possibile. Nello specifico, la visione artificiale aiuta le macchine a estrarre significato da immagini e video e sta guidando questo progresso.
Ad esempio, la stima della posa è un’attività comune di visione artificiale che predice la posizione di punti chiave del corpo predefiniti (come spalle, gomiti, fianchi e ginocchia) in un’immagine o in un fotogramma video. Questi punti chiave possono essere collegati utilizzando una definizione fissa dello scheletro per formare una rappresentazione semplificata della posa.
I modelli di visione artificiale come Ultralytics YOLO11 e il prossimo Ultralytics YOLO26 supportano attività come la stima della posa e possono alimentare applicazioni in tempo reale, tra cui il feedback sulla tecnica nel fitness e nello sport, il monitoraggio della sicurezza e le esperienze interattive di realtà aumentata.

Figura 1. Uno sguardo all’uso di Ultralytics YOLO11 per la stima della posa (Fonte)
In questo articolo analizzeremo in dettaglio gli strumenti per la stima della posa e vedremo come funziona, dove viene utilizzata e quali sono alcuni dei principali modelli e delle librerie disponibili oggi. Iniziamo!
Che cos'è la stima della posa?#
La stima della posa è una tecnica di visione artificiale che aiuta un sistema a comprendere come è posizionata una persona o un oggetto in un’immagine o in un video. Invece di analizzare ogni pixel allo stesso modo, predice un insieme di punti di riferimento coerenti, come testa, spalle, gomiti, fianchi, ginocchia e caviglie.
La maggior parte dei modelli restituisce le coordinate di questi punti chiave e un punteggio che riflette la probabilità che ogni previsione sia corretta. I punti chiave possono quindi essere collegati utilizzando una struttura scheletrica predefinita per formare una semplice rappresentazione della posa.
Quando vengono applicati fotogramma per fotogramma ai video, i punti chiave risultanti possono essere associati nel tempo per stimare il movimento. Questo abilita applicazioni come la verifica della tecnica, l’analisi dei movimenti e l’interazione basata sui gesti.

Figura 2. Un esempio di stima della posa (Fonte)
La necessità di strumenti per la stima della posa#
Il movimento umano contiene moltissime informazioni. Il modo in cui una persona si piega, allunga un braccio o sposta il peso può rivelare intenzioni, sforzo, stanchezza o persino il rischio di infortunio. Fino a poco tempo fa, acquisire un livello di dettaglio simile richiedeva generalmente sensori specializzati, tute per il motion capture o ambienti di laboratorio controllati.
La stima della posa cambia le cose. Estrarre i principali punti di riferimento del corpo da normali immagini e video consente ai computer di analizzare i movimenti utilizzando telecamere standard. Questo rende l’analisi dei movimenti più accessibile, scalabile e pratica da utilizzare in contesti reali.
Ecco alcuni modi in cui la stima della posa può avere un impatto:
- Luoghi di lavoro più sicuri: i sistemi basati sulla visione possono essere utilizzati per rilevare posture rischiose, sforzi ripetitivi o tecniche di sollevamento non sicure prima che si verifichino infortuni.
- Allenamento fitness e sportivo migliore: le soluzioni di IA basate sulla visione possono valutare tecnica, equilibrio e movimento in tempo reale, fornendo agli utenti un feedback immediato senza dispositivi indossabili.
- Sanità e riabilitazione: il personale clinico può monitorare da remoto i progressi del recupero, la postura e l’ampiezza dei movimenti utilizzando semplici registrazioni video.
- Esperienze interattive: la stima della posa facilita il compito degli avatar digitali e degli ambienti immersivi nel seguire e riflettere con precisione i movimenti umani.
L’evoluzione degli algoritmi per la stima della posa#
L’idea di stimare le pose esiste da molti anni. I primi approcci utilizzavano semplici modelli geometrici e regole definite manualmente e funzionavano generalmente solo in condizioni controllate.
Ad esempio, un sistema poteva funzionare bene quando una persona rimaneva ferma in una posizione fissa, ma andare in difficoltà quando iniziava a camminare, girarsi o interagire con oggetti in scene reali. Questi metodi spesso faticavano a gestire i movimenti naturali, i cambiamenti dell’angolazione della telecamera, gli sfondi disordinati e le occlusioni parziali.
La stima della posa moderna si affida al deep learning per gestire queste difficoltà. Addestrando reti neurali convoluzionali su grandi dataset annotati, i modelli apprendono pattern visivi che li aiutano a rilevare i punti chiave in modo più affidabile tra pose, persone e ambienti diversi.
Con un numero maggiore di esempi, il modello migliora le proprie previsioni e diventa più efficace nel generalizzare a nuove scene. Grazie a questi progressi, la stima della posa supporta oggi un’ampia gamma di casi d’uso pratici, tra cui il monitoraggio e l’ergonomia sul luogo di lavoro e l’analisi sportiva, in cui allenatori e analisti studiano come si muovono gli atleti.
Tipi di tecniche di stima della posa#
La stima della posa può assumere forme diverse, a seconda del contesto e di ciò che devi misurare. Ecco i principali tipi che incontrerai:
- Stima della posa 2D: questo approccio rileva i punti chiave del corpo in un’immagine bidimensionale o in un fotogramma video. Funziona bene con le telecamere standard ed è efficiente dal punto di vista computazionale, risultando adatto ad attività come il monitoraggio di base dei movimenti, l’analisi della postura e il feedback in tempo reale sulla tecnica.
- Stima della posa 3D: stimando la profondità oltre alle coordinate dell’immagine, la stima della posa 3D fornisce una comprensione spaziale del movimento del corpo. È particolarmente utile quando contano i movimenti in avanti e all’indietro, come nell’analisi sportiva, nella riabilitazione, nella biomeccanica e nell’animazione. Nello specifico, la stima della posa umana 3D acquisisce le posizioni e i movimenti delle articolazioni nello spazio 3D, riducendo l’ambiguità che può verificarsi con le proiezioni 2D.
- Stima della posa di una singola persona: questi sistemi sono progettati per monitorare una persona alla volta. Tendono a funzionare meglio in contesti controllati o semi-controllati, in cui il soggetto è chiaramente visibile, come nelle applicazioni per esercizi guidati, nelle videochiamate o nelle configurazioni per l’analisi dei movimenti.
- Stima della posa di più persone: progettato per scene con più persone, questo approccio rileva e monitora contemporaneamente le pose di diversi individui. È particolarmente utile in ambienti affollati come luoghi di lavoro, palestre, spazi pubblici e attività di gruppo, dove i soggetti possono sovrapporsi o oscurarsi a vicenda.

Figura 3. Comprendere il movimento umano nello spazio 3D rispetto allo spazio dell’immagine 2D (Fonte)
Come funzionano i modelli di stima della posa umana#
La stima della posa può essere applicata a molti tipi di oggetti, ma per semplicità concentriamoci sulla stima della posa umana.
La maggior parte dei sistemi di stima della posa umana viene addestrata su dataset annotati, in cui le parti principali del corpo sono contrassegnate in grandi raccolte di immagini e fotogrammi video. Utilizzando questi esempi, il modello apprende i pattern visivi associati a punti di riferimento del corpo umano come spalle, gomiti, fianchi, ginocchia e caviglie, così da poter prevedere con precisione i punti chiave in nuove scene.
Un altro aspetto fondamentale è l’architettura di inferenza del modello, che determina come rileva i punti chiave e li assembla in pose complete. Alcuni sistemi rilevano prima ogni persona e stimano poi i punti chiave all’interno della regione di ciascuna persona, mentre altri rilevano i punti chiave nell’intera immagine e li raggruppano successivamente per individuo. I design single-stage più recenti possono prevedere le pose in un solo passaggio, bilanciando velocità e accuratezza per l’uso in tempo reale.
Vediamo ora nel dettaglio i diversi approcci alla stima della posa.
Stima della posa bottom-up#
In un approccio bottom-up, il modello esamina l’intera immagine e individua prima i punti chiave del corpo, come testa, spalle, gomiti, fianchi, ginocchia e caviglie. In questa fase non cerca di separare le persone. Rileva semplicemente tutti i punti chiave o le articolazioni del corpo definite dallo scheletro della posa nella scena.
Successivamente, il sistema esegue un secondo passaggio per collegare i punti. Collega i punti chiave che appartengono alla stessa persona e li raggruppa in scheletri completi, uno per persona. Poiché non deve rilevare prima ogni singola persona, i metodi bottom-up spesso funzionano bene nelle scene affollate, in cui le persone si sovrappongono, appaiono con dimensioni diverse o sono parzialmente nascoste.
Rilevamento della posa top-down#
Al contrario, i sistemi top-down iniziano rilevando prima ogni persona presente nell’immagine. Posizionano un riquadro di delimitazione attorno a ogni individuo e trattano ciascun riquadro come una regione distinta da analizzare.
Una volta isolata una persona, il modello prevede i punti chiave del corpo all’interno di quella regione. Questa configurazione passo dopo passo produce spesso risultati molto accurati, soprattutto quando nella scena sono presenti poche persone e ciascuna è chiaramente visibile.
Stima della posa single-stage o ibrida#
I modelli single-stage, talvolta chiamati ibridi, prevedono le pose in un solo passaggio. Invece di eseguire prima il rilevamento della persona e poi la stima dei punti chiave, restituiscono contemporaneamente la posizione della persona e i punti chiave del corpo.
Poiché tutto avviene in un singolo modulo, questi modelli sono spesso più veloci ed efficienti, il che li rende adatti a usi in tempo reale come il monitoraggio dei movimenti dal vivo e il motion capture. Modelli come Ultralytics YOLO11 si basano su questa idea e puntano a bilanciare velocità e previsioni affidabili dei punti chiave.
Addestramento e valutazione dei modelli di stima della posa#
Indipendentemente dall’approccio utilizzato, un modello di stima della posa deve comunque essere addestrato e testato con attenzione prima di risultare affidabile nel mondo reale. In genere apprende da grandi raccolte di immagini (e talvolta video) in cui i punti chiave del corpo sono etichettati, così da poter gestire pose, angolazioni della telecamera e ambienti diversi.
Alcuni dataset per la stima della posa noti includono COCO Keypoints, MPII Human Pose, CrowdPose e OCHuman. Quando questi dataset non riflettono le condizioni che il modello dovrà affrontare in fase di deployment, gli ingegneri raccolgono e annotano spesso immagini aggiuntive dall’ambiente di destinazione, come il reparto di una fabbrica, una palestra o una clinica.

Figura 4. Diverse pose stimate utilizzando la visione artificiale (Fonte)
Dopo l’addestramento, le prestazioni del modello vengono valutate su benchmark standard per misurare accuratezza e robustezza e guidare ulteriori ottimizzazioni per l’uso nel mondo reale. I risultati vengono spesso riportati utilizzando la precisione media media, comunemente indicata come mAP, che riassume le prestazioni su diverse soglie di confidenza confrontando le pose previste con la verità di riferimento annotata.
In molti benchmark per la posa, una posa prevista viene associata a una posa di riferimento utilizzando la Similarità dei punti chiave dell’oggetto (OKS). OKS misura quanto i punti chiave previsti siano vicini a quelli annotati, tenendo conto di fattori come la scala della persona e la difficoltà tipica di localizzazione di ciascun punto chiave.
I modelli di posa restituiscono anche punteggi di confidenza per le persone rilevate e per i singoli punti chiave. Questi punteggi riflettono il livello di confidenza del modello e vengono utilizzati per classificare e filtrare le previsioni, un aspetto particolarmente importante in condizioni difficili come occlusioni, motion blur o angolazioni insolite della telecamera.
Strumenti e librerie popolari per la stima della posa#
Oggi sono disponibili molti strumenti per la stima della posa, ognuno dei quali bilancia velocità, accuratezza e facilità d’uso. Ecco alcuni degli strumenti e delle librerie più utilizzati:
- Ultralytics YOLO11: sviluppato come modello di IA per la visione open source all’avanguardia, YOLO11 si basa su modelli precedenti come Ultralytics YOLOv8. Migliora velocità, accuratezza ed efficienza complessiva supportando diverse attività di visione artificiale, tra cui la stima della posa. Grazie alle prestazioni elevate su numerose piattaforme, dai laptop ai dispositivi edge, YOLO11 è un’ottima opzione per molti deployment nel mondo reale.
- Ultralytics YOLO26: questo prossimo modello di nuova generazione è progettato per essere più leggero, compatto e veloce, mantenendo comunque un’accuratezza elevata. È pensato per l’uso in tempo reale e per un deployment più semplice e supporta attività come il rilevamento degli oggetti, la segmentazione delle istanze e la stima della posa, con dimensioni dei modelli adatte a tutto, dai dispositivi edge ai sistemi più grandi.
- MediaPipe: è un framework multipiattaforma per la creazione di pipeline di visione e machine learning. È leggero e funziona in modo efficiente su dispositivi mobili, tablet e applicazioni web; include inoltre soluzioni e modelli pronti all’uso per la posa del corpo intero, i punti di riferimento del volto e il tracciamento delle mani.
- OpenPose: questo sistema open source end-to-end per la stima della posa è noto soprattutto per il rilevamento dei punti chiave di più persone. Può stimare contemporaneamente i punti chiave del corpo, delle mani e del volto ed è comunemente utilizzato nella ricerca, nell’animazione e nell’analisi dei movimenti.
- MMPose: MMPose è un toolkit per la stima della posa basato su PyTorch, proveniente dall’ecosistema OpenMMLab. Fornisce molte implementazioni di modelli, utility per l’addestramento e opzioni di configurazione, che lo rendono utile per la sperimentazione e la personalizzazione avanzata.
- HRNet e AlphaPose: sono modelli di stima della posa meno recenti, ancora utilizzati oggi nella ricerca. HRNet è un’architettura di modello per la posa che mantiene caratteristiche dell’immagine ad alta risoluzione per tutta la rete, aiutando a localizzare con precisione i punti chiave. AlphaPose è un sistema ampiamente utilizzato per la stima della posa di più persone, comunemente adottato quando è necessaria un’accuratezza elevata in scene affollate o complesse.
Applicazioni reali dell’analisi e della stima della posa#
La stima della posa viene utilizzata sempre più spesso per trasformare i normali video in informazioni utili sui movimenti. Monitorando i punti chiave del corpo fotogramma per fotogramma, questi sistemi possono dedurre postura, movimento e comportamento fisico dai feed delle telecamere, rendendo questa tecnologia pratica in molti contesti reali.
Ad esempio, nell’assistenza sanitaria e nella riabilitazione, il monitoraggio della posa può aiutare il personale clinico a osservare e misurare come si muove un paziente durante la terapia e il recupero. Estraendo i punti di riferimento del corpo da normali registrazioni video, può essere utilizzato per valutare postura, ampiezza dei movimenti e pattern complessivi del movimento nel tempo. Queste misurazioni possono supportare e ottimizzare le valutazioni cliniche tradizionali e, in alcuni casi, facilitare il monitoraggio dei progressi senza la necessità di sensori indossabili o apparecchiature specializzate.
Analogamente, nello sport e nella radiodiffusione, la stima della posa può analizzare i movimenti degli atleti direttamente dai feed video. Un esempio interessante è Hawk-Eye, un sistema di monitoraggio basato su telecamere utilizzato negli sport professionistici per l’arbitraggio e la grafica televisiva. Fornisce anche il tracciamento scheletrico stimando i punti chiave del corpo di un atleta dalle riprese delle telecamere.
Scegliere lo strumento giusto per la stima della posa#
La scelta dello strumento giusto per la stima della posa inizia dalla comprensione delle esigenze del tuo progetto di visione artificiale. Alcune applicazioni danno priorità alla velocità in tempo reale, mentre altre richiedono maggiore accuratezza e dettaglio.
Anche il dispositivo di deployment di destinazione fa la differenza. Le app mobili e i dispositivi edge richiedono generalmente modelli leggeri ed efficienti, mentre i modelli più grandi sono spesso più adatti a server o ambienti cloud.
Inoltre, anche la facilità d’uso può avere un ruolo. Una buona documentazione, un deployment fluido e il supporto per l’addestramento personalizzato possono semplificare il tuo progetto.
In poche parole, strumenti diversi eccellono in aree diverse. Ad esempio, i modelli Ultralytics YOLO offrono un equilibrio pratico tra velocità, accuratezza e facilità di deployment per molte applicazioni reali di stima della posa.

Figura 5. Stima della posa degli animali utilizzando Ultralytics YOLO11 (Fonte)
Punti chiave#
La stima della posa aiuta i computer a comprendere i movimenti umani rilevando i punti chiave del corpo in immagini e video. Modelli come YOLO11 e YOLO26 semplificano la creazione di applicazioni in tempo reale per ambiti come sport, assistenza sanitaria, sicurezza sul luogo di lavoro ed esperienze interattive. Con il continuo aumento della velocità e dell’accuratezza dei modelli, è probabile che la stima della posa diventi una funzionalità comune in molti sistemi di IA per la visione.
Vuoi saperne di più sull’IA? Dai un’occhiata alla nostra community e al nostro repository GitHub. Esplora le nostre pagine sulle soluzioni per scoprire di più sull’IA nella robotica e sulla visione artificiale nella produzione. Scopri le nostre opzioni di licenza e inizia oggi a sviluppare con la visione artificiale!









