Scoprire come funzionano le applicazioni della computer vision
Approfondisci con noi le applicazioni della computer vision. Illustreremo anche diverse attività di computer vision, come il rilevamento degli oggetti e la segmentazione.

Quando abbiamo esplorato la storia dei modelli di computer vision, abbiamo visto come la computer vision si sia evoluta e quale percorso abbia portato ai modelli avanzati di visione che abbiamo oggi. I modelli moderni come Ultralytics YOLOv8 supportano molteplici attività di computer vision e vengono utilizzati in varie applicazioni entusiasmanti.
In questo articolo daremo un'occhiata alle nozioni di base della computer vision e dei modelli di visione. Vedremo come funzionano e quali sono le loro diverse applicazioni in vari settori. Le innovazioni nella computer vision sono ovunque e plasmano silenziosamente il nostro mondo. Scopriamole una alla volta!
Che cos'è la computer vision?#
L'intelligenza artificiale (AI) è un termine generico che comprende molte tecnologie mirate a replicare una parte dell'intelligenza umana. La computer vision è uno di questi sottocampi dell'AI. La computer vision mira a dotare le macchine di occhi capaci di vedere, osservare e comprendere ciò che le circonda.
Proprio come la vista umana, le soluzioni di computer vision mirano a distinguere gli oggetti, calcolare le distanze e rilevare i movimenti. Tuttavia, a differenza degli esseri umani, che possono contare su una vita intera di esperienze per vedere e comprendere, i computer si affidano a enormi quantità di dati, telecamere ad alta definizione e algoritmi complessi.

Fig. 1. Confronto tra vista umana e computer vision.
I sistemi di computer vision possono elaborare e analizzare dati visivi come immagini e video a velocità e con precisione incredibili. La capacità di analizzare rapidamente e con precisione enormi quantità di informazioni visive rende la computer vision uno strumento potente in vari settori, dalla produzione all'assistenza sanitaria.
I modelli di visione supportano diverse attività di computer vision#
I modelli di computer vision sono il cuore di qualsiasi applicazione di computer vision. Sono essenzialmente algoritmi computazionali basati su tecniche di deep learning, progettati per dare alle macchine la capacità di interpretare e comprendere le informazioni visive. I modelli di visione consentono di svolgere attività fondamentali di computer vision, dalla classificazione delle immagini al rilevamento degli oggetti. Esaminiamo più da vicino alcune di queste attività e i relativi casi d'uso.
Classificazione delle immagini#
La classificazione delle immagini consiste nel categorizzare ed etichettare le immagini in classi o categorie predefinite. Un modello di visione come YOLOv8 può essere addestrato su grandi dataset di immagini etichettate. Durante l'addestramento, il modello impara a riconoscere i pattern e le caratteristiche associati a ciascuna classe. Una volta addestrato, può prevedere la categoria di immagini nuove e mai viste prima analizzandone le caratteristiche e confrontandole con i pattern appresi.

Fig. 2. Un esempio di classificazione delle immagini. (fonte: towardsdatascience.com)
Esistono diversi tipi di classificazione delle immagini. Ad esempio, quando si lavora con immagini mediche, si può usare la classificazione binaria per dividere le immagini in due gruppi, come sano o malato. Un altro tipo è la classificazione multiclass. Può aiutare a classificare le immagini in molti gruppi, ad esempio per classificare diversi animali in una fattoria, come maiali, capre e mucche. Oppure, se vuoi classificare gli animali in gruppi e sottogruppi, distinguendoli prima in mammiferi e uccelli e poi in specie come leoni, tigri, aquile e passeri, la classificazione gerarchica sarebbe l'opzione migliore.
Rilevamento degli oggetti#
Il rilevamento degli oggetti è il processo di identificazione e localizzazione degli oggetti nelle immagini e nei fotogrammi video tramite la computer vision. Comprende due attività: la localizzazione degli oggetti, che disegna riquadri di delimitazione intorno agli oggetti, e la classificazione degli oggetti, che identifica la categoria di ciascun oggetto. Sulla base delle annotazioni dei riquadri di delimitazione, un modello di visione può imparare a riconoscere i pattern e le caratteristiche specifici di ogni categoria di oggetti e prevedere la presenza e la posizione di questi oggetti in immagini nuove e mai viste prima.
Fig. 3. Rilevamento degli oggetti con YOLOv8 utilizzato per rilevare giocatori su un campo da calcio.
Il rilevamento degli oggetti ha numerosi casi d'uso in diversi settori, dallo sport alla biologia marina. Ad esempio, nel commercio al dettaglio, la tecnologia Just Walk Out di Amazon utilizza il rilevamento degli oggetti per automatizzare il pagamento identificando gli articoli presi dai clienti. La combinazione di computer vision e dati dei sensori consente ai clienti di prendere i loro articoli e uscire senza fare la fila.
Ecco uno sguardo più da vicino a come funziona:
- Le telecamere montate sul soffitto riprendono i clienti mentre si spostano nel negozio e queste riprese video vengono elaborate in tempo reale dai modelli di visione.
- Il rilevamento degli oggetti viene utilizzato per rilevare il prodotto esatto che un cliente prende e mette nel carrello, aggiornando di conseguenza il carrello virtuale.
- I sensori di peso sugli scaffali migliorano la precisione rilevando la rimozione o il riposizionamento degli articoli.
- Quando il cliente esce dal negozio, il rilevamento degli oggetti e la tecnologia di riconoscimento facciale possono essere utilizzati per confermare che il cliente sia uscito; i suoi dati di pagamento, come quelli della carta di credito, possono quindi essere utilizzati per addebitargli automaticamente l'importo.
Segmentazione semantica e per istanze#
La segmentazione semantica e la segmentazione per istanze sono attività di computer vision che aiutano a suddividere le immagini in segmenti significativi. La segmentazione semantica classifica i pixel in base al loro significato semantico e tratta tutti gli oggetti appartenenti a una categoria come un'unica entità con la stessa etichetta. È adatta a etichettare oggetti non numerabili come "il cielo" o "l'oceano", oppure raggruppamenti come "le foglie" o "l'erba".
La segmentazione per istanze, invece, è in grado di distinguere diverse istanze della stessa classe assegnando un'etichetta univoca a ciascun oggetto rilevato. Puoi utilizzare la segmentazione per istanze per segmentare oggetti numerabili, quando il numero e l'indipendenza degli oggetti sono importanti. Consente un'identificazione e una differenziazione più precise.
Fig. 4. Un esempio di segmentazione semantica e per istanze.
Possiamo comprendere più chiaramente la differenza tra segmentazione semantica e segmentazione per istanze con un esempio relativo alle auto a guida autonoma. La segmentazione semantica è ottima per le attività che richiedono la comprensione del contenuto di una scena e può essere utilizzata nei veicoli autonomi per classificare gli elementi della strada, come gli attraversamenti pedonali e i segnali stradali. La segmentazione per istanze, invece, può essere utilizzata nei veicoli autonomi per distinguere i singoli pedoni, veicoli e ostacoli.
Stima della posa#
La stima della posa è un'attività di computer vision incentrata sul rilevamento e sul tracciamento dei punti chiave della posa di un oggetto in immagini o video. Viene utilizzata più comunemente per la stima della posa umana, con punti chiave che includono aree come spalle e ginocchia. Stimare la posa di una persona ci aiuta a comprendere e riconoscere azioni e movimenti fondamentali per varie applicazioni.

Fig. 5. Un esempio di stima della posa con YOLOv8.
La stima della posa può essere utilizzata nello sport per analizzare i movimenti degli atleti. La NBA utilizza la stima della posa per studiare i movimenti e le posizioni dei giocatori durante la partita. Tracciando punti chiave come spalle, gomiti, ginocchia e caviglie, la stima della posa fornisce informazioni dettagliate sui movimenti dei giocatori. Queste informazioni aiutano gli allenatori a sviluppare strategie migliori, ottimizzare i programmi di allenamento e apportare modifiche in tempo reale durante le partite. Inoltre, i dati possono aiutare a monitorare la stanchezza dei giocatori e il rischio di infortuni, migliorando la salute e le prestazioni complessive dei giocatori.
Rilevamento degli oggetti con riquadri di delimitazione orientati#
Il rilevamento degli oggetti con riquadri di delimitazione orientati (OBB) utilizza rettangoli ruotati per identificare e localizzare con precisione gli oggetti in un'immagine. A differenza dei riquadri di delimitazione standard, allineati agli assi dell'immagine, gli OBB ruotano per adattarsi all'orientamento dell'oggetto. Questo li rende particolarmente utili per gli oggetti che non sono perfettamente orizzontali o verticali. Sono ideali per individuare e isolare con precisione gli oggetti ruotati, evitando sovrapposizioni in ambienti affollati.
Fig. 6. Un esempio di rilevamento di riquadri di delimitazione orientati su un'immagine aerea di imbarcazioni con YOLOv8.
Nella sorveglianza marittima, identificare e tracciare le navi è fondamentale per la sicurezza e la gestione delle risorse. Il rilevamento con OBB può essere utilizzato per localizzare con precisione le navi, anche quando sono molto ravvicinate o orientate secondo angolazioni diverse. Aiuta a monitorare le rotte di navigazione, gestire il traffico marittimo e ottimizzare le operazioni portuali. Può inoltre contribuire alla risposta alle catastrofi, identificando e valutando rapidamente i danni a navi e infrastrutture dopo eventi come uragani o fuoriuscite di petrolio.
Tracciamento degli oggetti#
Finora abbiamo parlato di attività di computer vision che riguardano le immagini. Il tracciamento degli oggetti è un'attività di computer vision che consente di seguire un oggetto attraverso i fotogrammi di un video. Inizia identificando l'oggetto nel primo fotogramma tramite algoritmi di rilevamento, quindi ne segue continuamente la posizione mentre si muove nel video. Il tracciamento degli oggetti comprende tecniche come il rilevamento degli oggetti, l'estrazione delle caratteristiche e la previsione del movimento per mantenere accurato il tracciamento.

Fig. 7. Utilizzo di YOLOv8 per tracciare i pesci.
I modelli di visione come YOLOv8 possono essere utilizzati per tracciare i pesci nella biologia marina. Utilizzando telecamere subacquee, i ricercatori possono monitorare i movimenti e i comportamenti dei pesci nei loro habitat naturali. Il processo inizia rilevando i singoli pesci nei primi fotogrammi e seguendone poi le posizioni per tutta la durata del video. Il tracciamento dei pesci aiuta gli scienziati a comprendere i modelli migratori, i comportamenti sociali e le interazioni con l'ambiente. Supporta inoltre pratiche di pesca sostenibili fornendo informazioni sulla distribuzione e sull'abbondanza dei pesci.
Uno sguardo finale alla computer vision#
La computer vision sta cambiando attivamente il modo in cui utilizziamo la tecnologia e interagiamo con il mondo. Utilizzando modelli di deep learning e algoritmi complessi per comprendere immagini e video, la computer vision aiuta i settori a ottimizzare numerosi processi. Le attività di computer vision, come il rilevamento e il tracciamento degli oggetti, stanno rendendo possibile la creazione di soluzioni che prima non avremmo nemmeno immaginato. Con il continuo miglioramento della tecnologia di computer vision, il futuro riserva molte altre applicazioni innovative!
Impariamo e cresciamo insieme! Esplora il nostro repository GitHub per scoprire i nostri contributi all'AI. Scopri come stiamo ridefinendo settori come le auto a guida autonoma e l'agricoltura con l'AI. 🚀









