Tutto quello che devi sapere sulle attività di computer vision
Scopri come funzionano attività di computer vision come il tracciamento degli oggetti, la segmentazione delle istanze e la classificazione delle immagini e come Ultralytics YOLO11 le supporta.

Grazie alle fotocamere e ai progressi dell'intelligenza artificiale (AI), oggi computer e macchine sono in grado di vedere il mondo in modo simile agli esseri umani. Per esempio, possono riconoscere le persone, tracciare gli oggetti e persino comprendere il contesto di ciò che accade in un video.
In particolare, la computer vision è il ramo dell'AI che consente alle macchine di comprendere e interpretare le informazioni visive provenienti dal mondo che le circonda. La computer vision comprende diverse attività, ciascuna progettata per estrarre un tipo specifico di informazione da immagini o video. Per esempio, il rilevamento degli oggetti aiuta a identificare e localizzare elementi diversi in un'immagine, mentre altre attività come il tracking, la segmentazione e la stima della posa aiutano le macchine a comprendere con maggiore precisione movimenti, forme e posizioni.
La attività di computer vision utilizzata per una determinata applicazione dipende dal tipo di informazioni di cui hai bisogno. I modelli di computer vision come Ultralytics YOLO11 supportano diverse attività di computer vision, rendendolo una scelta affidabile per sviluppare sistemi di Vision AI per applicazioni reali.
In questa guida esamineremo più da vicino le attività di computer vision supportate da modelli come YOLO11. Vedremo come funziona ciascuna attività e come viene utilizzata in diversi settori. Iniziamo!
Cosa sono le attività di computer vision?#
Le attività di computer vision mirano a replicare in modi diversi le capacità della vista umana. Possono aiutare le macchine a rilevare gli oggetti, tracciarne i movimenti, stimare le pose e persino delineare i singoli elementi in immagini e video. In genere, le attività di computer vision sono abilitate da modelli che suddividono i dati visivi in parti più piccole, così da poter interpretare più chiaramente ciò che sta accadendo.
I modelli di Vision AI come i modelli Ultralytics YOLO supportano più attività, tra cui rilevamento, tracking e segmentazione, all'interno di un unico framework. Grazie a questa versatilità, i modelli YOLO11 sono facili da adottare per un'ampia varietà di casi d'uso.

Fig. 1. Attività di computer vision supportate da Ultralytics YOLO11.
Un buon esempio è rappresentato dall'analisi sportiva. YOLO11 può essere utilizzato per rilevare ogni giocatore in campo mediante il rilevamento degli oggetti, quindi può seguirlo per tutta la partita con il tracking degli oggetti. Nel frattempo, le funzionalità di stima della posa di YOLO11 possono aiutare ad analizzare i movimenti e le tecniche dei giocatori, mentre la segmentazione delle istanze può separare ogni giocatore dallo sfondo, aumentando la precisione dell'analisi.
Nel loro insieme, queste attività di computer vision abilitate da YOLO11 creano un quadro completo di ciò che accade durante la partita, fornendo alle squadre informazioni più approfondite sulle prestazioni dei giocatori, sulle tattiche e sulla strategia complessiva.
Panoramica delle attività di computer vision supportate da Ultralytics YOLO11#
Ora che abbiamo visto cosa sono le attività di computer vision, analizziamo più nel dettaglio ciascuna di quelle supportate da YOLO11, utilizzando esempi reali.
Il supporto di Ultralytics YOLO11 per la classificazione delle immagini#
Quando guardi una foto, la maggior parte delle persone riesce facilmente a capire se raffigura un cane, una montagna o un segnale stradale, perché tutti abbiamo imparato che aspetto hanno in genere questi elementi. La classificazione delle immagini aiuta le macchine a fare lo stesso, insegnando loro a classificare ed etichettare un'immagine in base al suo oggetto principale, che sia una "car," una "banana" o una "x-ray with fracture." Questa etichetta aiuta i sistemi di computer vision a comprendere il contenuto visivo, così da poter reagire o prendere decisioni di conseguenza.
Un'applicazione interessante di questa attività di computer vision è il monitoraggio della fauna selvatica. La classificazione delle immagini può essere utilizzata per identificare diverse specie animali a partire da foto scattate in natura. Etichettando automaticamente le immagini, i ricercatori possono monitorare le popolazioni, seguire i modelli migratori e identificare più facilmente le specie a rischio, contribuendo agli sforzi di conservazione.

Fig. 2. Un esempio di utilizzo di YOLO11 per la classificazione delle immagini.
Le funzionalità di rilevamento degli oggetti di Ultralytics YOLO11#
Sebbene la classificazione delle immagini sia utile per ottenere un'idea generale del contenuto di un'immagine, assegna una sola etichetta all'intera immagine. Quando sono necessarie informazioni dettagliate, come la posizione precisa e l'identità di più oggetti, il rilevamento degli oggetti diventa essenziale.
Il rilevamento degli oggetti è il processo di identificazione e localizzazione dei singoli oggetti all'interno di un'immagine, spesso disegnando riquadri di delimitazione attorno a essi. Ultralytics YOLO11 offre prestazioni particolarmente elevate nel rilevamento degli oggetti in tempo reale, rendendolo ideale per un'ampia gamma di applicazioni.
Prendiamo, per esempio, le soluzioni di computer vision utilizzate nei negozi al dettaglio per rifornire gli scaffali. Il rilevamento degli oggetti può aiutare a contare frutta, verdura e altri articoli, garantendo un inventario accurato. Nei campi agricoli, la stessa tecnologia può monitorare la maturazione delle colture per aiutare gli agricoltori a determinare il momento migliore per la raccolta, distinguendo persino i prodotti maturi da quelli acerbi.
Fig. 3. Rilevamento della frutta con Ultralytics YOLO11.
Utilizzo di YOLO11 per la segmentazione delle istanze#
Il rilevamento degli oggetti utilizza riquadri di delimitazione per identificare e localizzare gli oggetti in un'immagine, ma non ne cattura la forma esatta. È qui che entra in gioco la segmentazione delle istanze. Invece di disegnare un riquadro attorno a un oggetto, la segmentazione delle istanze ne traccia il contorno preciso.
Puoi pensarla in questo modo: invece di indicare semplicemente che "c'è una mela in quest'area", delinea e riempie con precisione la forma esatta della mela. Questo processo dettagliato aiuta i sistemi di AI a comprendere chiaramente i confini di un oggetto, soprattutto quando gli oggetti sono vicini tra loro.
La segmentazione delle istanze può essere applicata a molte applicazioni, dalle ispezioni delle infrastrutture ai rilevamenti geologici. Per esempio, i dati provenienti dai rilevamenti geologici possono essere analizzati utilizzando YOLO11 per segmentare crepe o anomalie superficiali, grandi e piccole. Tracciando confini precisi attorno a queste anomalie, gli ingegneri possono individuare i problemi e affrontarli prima dell'avvio di un progetto.

Fig. 4. Segmentazione delle crepe abilitata da YOLO11.
Tracking degli oggetti: seguire gli oggetti tra i fotogrammi con YOLO11#
Finora, le attività di computer vision esaminate si sono concentrate su ciò che è presente in una singola immagine. Tuttavia, quando si tratta di video, abbiamo bisogno di informazioni che vadano oltre un singolo fotogramma. A questo scopo si può utilizzare l'attività di tracking degli oggetti.
La capacità di tracking degli oggetti di YOLO11 può seguire un oggetto specifico, come una persona o un'auto, mentre si muove attraverso una serie di fotogrammi video. Anche se cambia l'angolazione della fotocamera o compaiono altri oggetti, il sistema continua a seguire lo stesso obiettivo.
Questo è fondamentale per le applicazioni che richiedono un monitoraggio nel tempo, come il tracking delle auto nel traffico. YOLO11 può infatti tracciare con precisione i veicoli, seguendo ogni auto per aiutare a stimarne la velocità in tempo reale. Per questo il tracking degli oggetti è un componente essenziale di sistemi come quelli per il monitoraggio del traffico.

Fig. 5. Il supporto di YOLO11 per il tracking degli oggetti può essere utilizzato per la stima della velocità.
Rilevamento dei riquadri di delimitazione orientati (OBB) con YOLO11#
Gli oggetti nel mondo reale non sono sempre perfettamente allineati: possono essere inclinati, disposti lateralmente o posizionati con angolazioni insolite. Per esempio, nelle immagini satellitari, navi ed edifici appaiono spesso ruotati.
I metodi tradizionali di rilevamento degli oggetti utilizzano riquadri rettangolari fissi che non si adattano all'orientamento di un oggetto, rendendo difficile catturare con precisione queste forme ruotate. Il rilevamento dei riquadri di delimitazione orientati (OBB) risolve questo problema utilizzando riquadri che ruotano per adattarsi perfettamente a un oggetto, allineandosi al suo angolo per un rilevamento più preciso.
Per il monitoraggio dei porti, il supporto di YOLO11 per il rilevamento OBB può aiutare a identificare e tracciare con precisione le imbarcazioni indipendentemente dal loro orientamento, garantendo un monitoraggio adeguato di ogni nave che entra o esce dal porto. Questo rilevamento preciso fornisce informazioni in tempo reale sulla posizione e sui movimenti delle imbarcazioni, fondamentali per gestire porti trafficati e prevenire collisioni.

Fig. 6. Rilevamento delle imbarcazioni con il rilevamento OBB e YOLO11.
Stima della posa e YOLO11: tracking dei punti chiave#
La stima della posa è una tecnica di computer vision che traccia punti chiave, come articolazioni, arti o altri indicatori, per comprendere come si muove un oggetto. Invece di trattare un intero oggetto o corpo come un'unica unità completa, questo metodo lo scompone nelle sue parti fondamentali. Ciò consente di analizzare nel dettaglio movimenti, gesti e interazioni.
Un'applicazione comune di questa tecnologia è la stima della posa umana. Tracciando in tempo reale le posizioni delle diverse parti del corpo, offre un quadro chiaro di come si muove una persona. Queste informazioni possono essere utilizzate per vari scopi, dal riconoscimento dei gesti e dal monitoraggio delle attività all'analisi delle prestazioni sportive.
Analogamente, nella riabilitazione fisica, i terapisti possono utilizzare la stima della posa umana e YOLO11 per monitorare i movimenti dei pazienti durante gli esercizi. Questo aiuta a garantire che ogni movimento venga eseguito correttamente, monitorando al contempo i progressi nel tempo.

Fig. 7. YOLO11 può monitorare un allenamento mediante la stima della posa.
Analisi del supporto di YOLO11 per diverse attività di computer vision#
Ora che abbiamo analizzato in dettaglio tutte le attività di computer vision supportate da YOLO11, vediamo come YOLO11 le supporta.
YOLO11 non è un unico modello: è una suite di varianti di modelli specializzati, ciascuna progettata per una specifica attività di computer vision. Questo rende YOLO11 uno strumento versatile, adattabile a un'ampia gamma di applicazioni. Puoi anche eseguire il fine-tuning di questi modelli su dataset personalizzati per affrontare le sfide specifiche dei tuoi progetti.
Ecco le varianti dei modelli YOLO11 preaddestrate per attività di visione specifiche:
- YOLO11: questo modello rileva ed etichetta più oggetti in tempo reale, rendendolo ideale per il riconoscimento visivo ad alta velocità.
- YOLO11-seg: questa variante si concentra sulla segmentazione, utilizzando maschere dettagliate per separare gli oggetti dallo sfondo.
- YOLO11-obb: questo modello è progettato per rilevare oggetti ruotati disegnando riquadri di delimitazione allineati all'orientamento di ciascun oggetto.
- YOLO11-cls: questa variante classifica le immagini assegnando una singola etichetta di categoria in base al contenuto complessivo.
- YOLO11-pose: questo modello stima i punti chiave del corpo per tracciare postura, posizione degli arti e movimento.
Ogni variante è disponibile in dimensioni diverse, consentendoti di scegliere il giusto equilibrio tra velocità e accuratezza in base alle tue esigenze specifiche.
Punti chiave#
Le attività di computer vision stanno cambiando il modo in cui le macchine comprendono e interagiscono con il mondo. Scomponendo immagini e video nei loro elementi chiave, queste tecnologie semplificano l'analisi dettagliata di oggetti, movimenti e interazioni.
Dal miglioramento della sicurezza stradale e delle prestazioni sportive all'ottimizzazione dei processi industriali, modelli come YOLO11 possono fornire informazioni in tempo reale che favoriscono l'innovazione. Con la continua evoluzione della Vision AI, è probabile che questa tecnologia svolga un ruolo sempre più importante nel modo in cui interpretiamo e utilizziamo ogni giorno i dati visivi.
Unisciti alla nostra community e visita il nostro repository GitHub per vedere l'AI in azione. Esplora le nostre opzioni di licenza e scopri di più sull'AI in agricoltura e sulla computer vision nella produzione nelle nostre pagine dedicate alle soluzioni.









