Ultralytics YOLO27:
AI per la visione

La vision AI abilita la tecnologia di riconoscimento dei gesti senza contatto

Scopri come i modelli di computer vision alimentano la tecnologia di riconoscimento dei gesti per rilevare, seguire e comprendere i gesti delle mani in diverse applicazioni.

ABAbirami Vina12 min read
La vision AI alimenta il riconoscimento dei gesti senza contatto

Con l'evolversi della tecnologia, evolve anche il modo in cui interagiamo con essa. Le prime macchine dipendevano dallo sforzo fisico e dai controlli meccanici, mentre l'informatica moderna ha introdotto i touchscreen e l'input vocale.

Ora, il riconoscimento dei gesti rappresenta il passo successivo, utilizzando movimenti naturali come interfaccia utente. Un semplice saluto con la mano, un gesto di pizzicamento o un rapido segnale della mano possono già controllare app, schermi e macchine.

Questa interazione senza contatto può essere resa possibile dalla computer vision, un ramo dell'AI che aiuta le macchine a vedere e interpretare ciò che cattura una fotocamera. I sistemi di Vision AI possono essere integrati in smartphone, visori per la realtà virtuale (VR) e la realtà aumentata (AR), automobili e dispositivi per la smart home, dove i gesti possono sostituire tocchi, clic e pulsanti per un'esperienza utente più fluida.

Il controllo senza contatto sta diventando sempre più comune nella vita quotidiana. Negli ambienti di lavoro e negli spazi condivisi, evitare il contatto fisico può migliorare l'igiene e la sicurezza. Molti prodotti digitali si stanno inoltre orientando verso l'interazione a mani libere, e i gesti offrono un modo semplice e intuitivo per controllare i dispositivi senza toccarli.

In questo articolo esploreremo cos'è il riconoscimento dei gesti, come la computer vision lo rende più accurato e dove viene utilizzato nelle applicazioni del mondo reale. Iniziamo!

Cos'è il riconoscimento dei gesti?#

Il riconoscimento dei gesti è una tecnologia di rilevamento che consente alle macchine di comprendere i gesti umani, come i segnali delle mani o i movimenti del corpo, e di convertirli in azioni digitali. Invece di toccare uno schermo o premere pulsanti, gli utenti possono controllare i dispositivi attraverso movimenti semplici e naturali.

Questo rende le interazioni più intuitive ed è il motivo per cui l'input basato sui gesti viene adottato in molti sistemi di controllo basati sul machine learning e sull'AI. In particolare, il riconoscimento dei gesti delle mani è una delle forme di riconoscimento dei gesti più utilizzate e spesso si basa sulla computer vision.

In parole semplici, una soluzione di Vision AI può individuare le mani nel flusso video di una fotocamera, seguirne i movimenti o i cambiamenti di forma e confrontare questi schemi con un gesto noto per attivare un'azione sullo schermo.

Una componente fondamentale di queste soluzioni è un modello di computer vision, addestrato su dataset di immagini o video annotati che mostrano diversi gesti delle mani. Con dati di addestramento diversificati e una valutazione accurata, il modello può generalizzare meglio tra utenti, condizioni di illuminazione e sfondi diversi, aiutandolo a riconoscere i gesti in modo più affidabile negli ambienti reali.

Dati utilizzati per addestrare un modello di computer vision a rilevare i keypoint dei gesti

Fig. 1. Dati utilizzati per addestrare un modello di computer vision a rilevare i keypoint dei gesti (Fonte)

Esplorazione dei diversi tipi di gesti e dell'interazione uomo-computer#

Prima di esaminare più da vicino il ruolo della computer vision nel riconoscimento dei gesti, facciamo un passo indietro e osserviamo i tipi di gesti che questi sistemi riconoscono generalmente.

Nella maggior parte dei casi, i gesti rientrano in due categorie: statici e dinamici. I gesti statici sono pose fisse della mano, come il pollice in su, il segnale di stop o il segno della pace. Poiché non comportano movimento, spesso possono essere riconosciuti da un singolo fotogramma.

I gesti dinamici, invece, implicano un movimento nel tempo, come salutare con la mano o fare uno swipe nell'aria. Per riconoscerli, un sistema di Vision AI deve analizzare più fotogrammi, così da seguire il movimento della mano e comprendere la direzione e la tempistica del gesto.

Il ruolo degli algoritmi di computer vision nel riconoscimento dei gesti#

I sistemi di riconoscimento dei gesti possono essere realizzati in modi diversi. Alcuni sistemi di input utilizzano sensori indossabili, come guanti o tracker montati sul polso, per acquisire il movimento della mano.

Queste configurazioni possono essere accurate, ma non sono sempre pratiche. I dispositivi indossabili devono essere indossati, configurati, ricaricati e sottoposti a manutenzione, oltre a poter risultare limitanti negli spazi condivisi o nell'uso quotidiano.

Per questo molti sistemi all'avanguardia si affidano invece alla computer vision. Con fotocamere RGB standard e sensori di profondità o time-of-flight, i dispositivi possono acquisire i movimenti delle mani e del corpo in tempo reale senza che gli utenti debbano indossare dispositivi aggiuntivi. Questo rende il riconoscimento dei gesti basato sulla visione particolarmente adatto a smartphone, automobili, smart TV e visori AR e VR.

Ad esempio, i modelli di computer vision come Ultralytics YOLO11 e l'imminente Ultralytics YOLO26 supportano attività come il rilevamento degli oggetti, il tracciamento degli oggetti e la stima della posa. Queste funzionalità possono essere utilizzate per rilevare le mani in ogni fotogramma, seguirne il movimento nel tempo e mappare keypoint come le punte delle dita e le articolazioni. Ciò consente di riconoscere gesti come un palmo sollevato per mettere in pausa, un pizzicamento per ingrandire, uno swipe per navigare nei menu o un gesto di indicazione per selezionare un elemento in AR e VR.

Attività di computer vision utilizzate per il riconoscimento dell'interazione uomo-macchina#

Ecco una panoramica di alcune delle principali attività di computer vision utilizzate nel riconoscimento dei gesti:

  • Rilevamento degli oggetti: questa attività viene utilizzata per individuare le mani in un'immagine o in un fotogramma video, generalmente disegnando BBox intorno a esse. Aiuta il sistema a concentrarsi sull'area del gesto e a ignorare i dettagli non necessari dello sfondo.
  • Tracciamento degli oggetti: basandosi sul rilevamento degli oggetti, questa attività segue le mani rilevate attraverso più fotogrammi e ne mantiene l'identità nel tempo. È particolarmente utile per i gesti dinamici, nei quali movimento e direzione sono fondamentali.
  • Stima della posa: invece di concentrarsi sui BBox, la stima della posa identifica i keypoint sulla mano, come la punta delle dita, le nocche e il polso. Questi punti di riferimento creano uno scheletro semplice della mano che cattura la posizione delle dita e i movimenti più sottili, consentendo una classificazione più dettagliata dei gesti.
  • Segmentazione delle istanze: questa attività mira a separare ogni mano dallo sfondo a livello di pixel, generando una maschera per ogni mano visibile. È utile nelle scene affollate, quando le mani si sovrappongono o quando nel fotogramma compaiono più mani.

Molte soluzioni di Vision AI utilizzano insieme queste attività come parte di un'unica pipeline. Ad esempio, un sistema potrebbe iniziare con il rilevamento degli oggetti per individuare le mani, quindi utilizzare il tracciamento per seguirle attraverso i fotogrammi nei gesti dinamici.

Se il gesto dipende dalla posizione delle dita, la stima della posa può aggiungere keypoint per ottenere dettagli più precisi, mentre la segmentazione delle istanze può aiutare a isolare ogni mano con maggiore precisione nelle scene affollate o quando più mani si sovrappongono. Insieme, questi passaggi forniscono informazioni sia sulla posizione sia sul movimento, rendendo il riconoscimento dei gesti più accurato e affidabile.

Come funziona il riconoscimento dei gesti basato sulla visione#

Ora che comprendiamo meglio le attività di computer vision alla base del riconoscimento dei gesti, osserviamo passo dopo passo come funziona un sistema basato sulla visione.

Un sistema tipico inizia acquisendo video da una fotocamera, talvolta insieme ai dati di profondità se il dispositivo li supporta. I fotogrammi vengono quindi preelaborati mediante l'elaborazione delle immagini per renderli più facili da gestire in modo coerente per il modello, ad esempio ridimensionandoli, stabilizzandoli o riducendo il rumore e la sfocatura da movimento.

Successivamente, il sistema identifica le mani nel fotogramma utilizzando il rilevamento o la segmentazione e le segue nel tempo mediante il tracciamento. Se l'applicazione richiede dettagli più fini, può anche eseguire la stima della posa per estrarre keypoint come le punte delle dita e le articolazioni. Utilizzando queste informazioni, il modello classifica il gesto, che si tratti di una posa in un singolo fotogramma, come il pollice in su, o di uno schema di movimento, come uno swipe.

Infine, il gesto riconosciuto viene associato a un'azione nell'interfaccia, come scorrere, ingrandire, selezionare un elemento, regolare il volume o controllare le interazioni AR e VR. La pipeline esatta può variare: le applicazioni più semplici utilizzano meno passaggi, mentre quelle più complesse combinano rilevamento, tracciamento e stima della posa per una maggiore accuratezza.

Applicazioni del riconoscimento dei gesti basato sulla visione#

Vediamo ora come il riconoscimento dei gesti viene utilizzato nelle applicazioni del mondo reale per comprendere le posizioni delle mani.

Interazione basata sui gesti con i sistemi di infotainment delle automobili#

Il riconoscimento dei gesti sta iniziando a comparire nelle interfacce dei veicoli intelligenti, soprattutto nei sistemi di infotainment. È un modo pratico per controllare determinate funzionalità con semplici movimenti delle mani, riducendo la frequenza con cui i conducenti devono raggiungere touchscreen o pulsanti fisici. Ad esempio, un gesto rapido può essere utilizzato per regolare il volume, gestire le chiamate o navigare nei menu visualizzati sullo schermo.

Un conducente esegue gesti con le mani nell'area di rilevamento di un sistema di infotainment

Fig. 2. Un conducente esegue gesti con le mani nell'area di rilevamento di un sistema di infotainment (Fonte)

Interazioni basate sui gesti nei videogiochi#

Nei videogiochi e nelle esperienze immersive, il controllo basato sui gesti sta cambiando il modo in cui le persone interagiscono con i mondi virtuali. Invece di affidarsi esclusivamente a controller o joystick, i giocatori possono utilizzare movimenti naturali delle mani per navigare nei menu, raccogliere oggetti virtuali, controllare i personaggi o attivare azioni nel gioco.

Giocare utilizzando i gesti delle mani

Fig. 3. Giocare utilizzando i gesti delle mani (Fonte).

Questo tipo di interazione senza contatto può risultare più fluido, soprattutto in AR e VR. Di conseguenza, il tracciamento delle mani e il controllo tramite gesti stanno diventando funzionalità comuni nei visori VR e per la realtà mista.

Controllo dei gesti fluido per i dispositivi smart home#

I dispositivi smart home, come smart TV, altoparlanti e luci connesse, stanno iniziando a supportare il controllo basato sui gesti per azioni rapide e senza contatto. Con un semplice movimento della mano, gli utenti possono accendere le luci, regolare il volume o attivare comandi di base senza raggiungere interruttori o telecomandi.

Ad esempio, negli impianti di intrattenimento domestico, le fotocamere di profondità integrate o collegate possono riconoscere gesti come swipe, indicare o sollevare una mano. Questo può semplificare la navigazione nei menu, la modifica delle impostazioni o la conferma delle selezioni da una parte all'altra della stanza. In background, i modelli di computer vision elaborano in tempo reale il flusso della fotocamera per rilevare e interpretare questi gesti.

Controllo dei gesti nella robotica abilitato dall'intelligenza artificiale#

Immagina una situazione in fabbrica in cui un lavoratore debba guidare un robot mentre trasporta componenti, indossa guanti o si trova a distanza di sicurezza da apparecchiature in movimento. In questi contesti, raggiungere pulsanti o un pannello di controllo può essere lento o persino pericoloso.

Al contrario, i sistemi di controllo basati sui gesti possono offrire un modo più pratico e a mani libere per interagire con queste macchine. Questo è particolarmente utile per i robot collaborativi, o cobot, progettati per lavorare al fianco delle persone.

Invece di avvicinarsi a un pannello di controllo, gli operatori possono utilizzare semplici segnali con le mani per avviare, arrestare o guidare un robot a distanza. Ciò riduce la dipendenza dai controlli fisici e può favorire flussi di lavoro più sicuri nell'area produttiva.

I sistemi di controllo avanzati basati sulla visione, abilitati da modelli di deep learning o da algoritmi di apprendimento, possono inoltre andare oltre i comandi di base. Possono interpretare movimenti più fini della mano e reagire fluidamente a piccoli cambiamenti di direzione, nonché a istruzioni e automazioni più precise.

Una mano robotica analizza il gesto di un utente

Fig. 4. Una mano robotica analizza il gesto di un utente (Fonte)

Vantaggi e svantaggi della tecnologia di riconoscimento dei gesti#

Ecco alcuni vantaggi principali dell'utilizzo della tecnologia di riconoscimento dei gesti:

  • Accessibilità migliorata: i gesti possono offrire un'alternativa agli utenti che hanno difficoltà a utilizzare tastiere, touchscreen o controller.
  • Funzionamento a distanza: i gesti possono essere riconosciuti da un punto qualsiasi della stanza, una caratteristica utile per smart TV, chioschi e dispositivi domestici.
  • Flessibilità tra dispositivi: set di gesti simili possono funzionare su telefoni, automobili, display intelligenti e visori AR o VR, rendendo l'interazione coerente.

Allo stesso tempo, esistono alcune difficoltà del mondo reale che possono influire su accuratezza e coerenza. Ecco alcuni fattori da considerare:

  • Problemi di illuminazione e qualità della fotocamera: scarsa illuminazione, riflessi, ombre o fotocamere a bassa risoluzione possono ridurre le prestazioni del riconoscimento. Questo, a sua volta, può influire sul controllo del movimento.
  • Variazioni tra gli utenti: le persone eseguono naturalmente i gesti in modo diverso e le differenze nelle dimensioni delle mani, nella flessibilità delle dita o negli accessori possono influire sull'accuratezza.
  • Limiti nei movimenti rapidi: i gesti veloci possono introdurre sfocatura da movimento o far sì che il modello perda fotogrammi fondamentali, soprattutto con fotocamere con una frequenza dei fotogrammi inferiore.

Punti chiave#

La tecnologia di riconoscimento dei gesti è andata oltre i laboratori di ricerca e oggi fa parte dei dispositivi e delle innovazioni di uso quotidiano. In particolare, la computer vision abilita il controllo senza contatto nei videogiochi, nella robotica, nelle smart home e nei sistemi automobilistici. Con il miglioramento dei modelli di visione, queste interfacce senza contatto diventeranno probabilmente più facili da realizzare e saranno utilizzate più diffusamente.

Scopri la nostra community e il nostro repository GitHub per saperne di più sui modelli di computer vision. Esplora le nostre pagine dedicate alle soluzioni per conoscere applicazioni come l'AI in agricoltura e la computer vision nella logistica. Consulta le nostre opzioni di licenza e inizia a costruire il tuo modello di Vision AI.

Explore solutions

Visione artificiale per immagini aeree

Visione artificiale per immagini aeree

Traduci immagini di droni e aeree in informazioni in tempo reale per agricoltura, acquacoltura, monitoraggio ambientale, conservazione e analisi geospaziale con Ultralytics YOLO.
Scopri di più
Computer vision nel settore aerospaziale

Computer vision nel settore aerospaziale

Porta la visione artificiale al monitoraggio aereo con i modelli Ultralytics YOLO. Potenzia droni, flussi di lavoro aerospaziali, conservazione ambientale e industrie geospaziali con soluzioni di computer vision.
Scopri di più

Proteggi ogni sito con i modelli Ultralytics YOLO. La visione artificiale alimenta il monitoraggio del perimetro, il rilevamento delle minacce, il riconoscimento delle targhe e la sicurezza sul lavoro.
Scopri di più
Computer vision nella robotica

Computer vision nella robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica abilita la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Computer vision nella logistica

Computer vision nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza nei magazzini in tempo reale.
Scopri di più
Computer vision nel commercio al dettaglio

Computer vision nel commercio al dettaglio

Reinventa il commercio al dettaglio con i modelli Ultralytics YOLO. La Vision AI potenzia il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e analisi più intelligenti dei clienti.
Scopri di più
Computer vision nel settore sanitario

Computer vision nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La Vision AI nel settore sanitario abilita imaging medico più rapido, diagnosi più intelligenti e monitoraggio dei pazienti.
Scopri di più
Computer vision nella produzione

Computer vision nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI supporta il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione delle linee di assemblaggio.
Scopri di più
Computer vision nel settore automobilistico

Computer vision nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, i sistemi di assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Computer vision in agricoltura

Computer vision in agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Abilita il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per raccolti più abbondanti e intelligenti.
Scopri di più
Visione artificiale per immagini aeree

Visione artificiale per immagini aeree

Traduci immagini di droni e aeree in informazioni in tempo reale per agricoltura, acquacoltura, monitoraggio ambientale, conservazione e analisi geospaziale con Ultralytics YOLO.
Scopri di più
Computer vision nel settore aerospaziale

Computer vision nel settore aerospaziale

Porta la visione artificiale al monitoraggio aereo con i modelli Ultralytics YOLO. Potenzia droni, flussi di lavoro aerospaziali, conservazione ambientale e industrie geospaziali con soluzioni di computer vision.
Scopri di più

Proteggi ogni sito con i modelli Ultralytics YOLO. La visione artificiale alimenta il monitoraggio del perimetro, il rilevamento delle minacce, il riconoscimento delle targhe e la sicurezza sul lavoro.
Scopri di più
Computer vision nella robotica

Computer vision nella robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica abilita la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Computer vision nella logistica

Computer vision nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza nei magazzini in tempo reale.
Scopri di più
Computer vision nel commercio al dettaglio

Computer vision nel commercio al dettaglio

Reinventa il commercio al dettaglio con i modelli Ultralytics YOLO. La Vision AI potenzia il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e analisi più intelligenti dei clienti.
Scopri di più
Computer vision nel settore sanitario

Computer vision nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La Vision AI nel settore sanitario abilita imaging medico più rapido, diagnosi più intelligenti e monitoraggio dei pazienti.
Scopri di più
Computer vision nella produzione

Computer vision nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI supporta il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione delle linee di assemblaggio.
Scopri di più
Computer vision nel settore automobilistico

Computer vision nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, i sistemi di assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Computer vision in agricoltura

Computer vision in agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Abilita il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per raccolti più abbondanti e intelligenti.
Scopri di più
Visione artificiale per immagini aeree

Visione artificiale per immagini aeree

Traduci immagini di droni e aeree in informazioni in tempo reale per agricoltura, acquacoltura, monitoraggio ambientale, conservazione e analisi geospaziale con Ultralytics YOLO.
Scopri di più
Computer vision nel settore aerospaziale

Computer vision nel settore aerospaziale

Porta la visione artificiale al monitoraggio aereo con i modelli Ultralytics YOLO. Potenzia droni, flussi di lavoro aerospaziali, conservazione ambientale e industrie geospaziali con soluzioni di computer vision.
Scopri di più

Proteggi ogni sito con i modelli Ultralytics YOLO. La visione artificiale alimenta il monitoraggio del perimetro, il rilevamento delle minacce, il riconoscimento delle targhe e la sicurezza sul lavoro.
Scopri di più
Computer vision nella robotica

Computer vision nella robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica abilita la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Computer vision nella logistica

Computer vision nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza nei magazzini in tempo reale.
Scopri di più
Computer vision nel commercio al dettaglio

Computer vision nel commercio al dettaglio

Reinventa il commercio al dettaglio con i modelli Ultralytics YOLO. La Vision AI potenzia il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e analisi più intelligenti dei clienti.
Scopri di più
Computer vision nel settore sanitario

Computer vision nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La Vision AI nel settore sanitario abilita imaging medico più rapido, diagnosi più intelligenti e monitoraggio dei pazienti.
Scopri di più
Computer vision nella produzione

Computer vision nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI supporta il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione delle linee di assemblaggio.
Scopri di più
Computer vision nel settore automobilistico

Computer vision nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, i sistemi di assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Computer vision in agricoltura

Computer vision in agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Abilita il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per raccolti più abbondanti e intelligenti.
Scopri di più

Costruiamo insieme il futuro dell'AI!

Inizia il tuo percorso verso il futuro del machine learning