Esplorare vari tipi di dati per le applicazioni di visione AI
Scopri come i tipi di dati visivi come l'imaging termico, LiDAR e le immagini a infrarossi abilitano diverse applicazioni di visione artificiale in vari settori.

Tecnologie come i droni un tempo erano limitate e accessibili solo a ricercatori e specialisti, ma oggi l'hardware all'avanguardia sta diventando accessibile a un pubblico più vasto. Questo cambiamento sta trasformando il modo in cui raccogliamo dati visivi. Grazie a tecnologie più accessibili, ora possiamo catturare immagini e video da una varietà di fonti, oltre alle tradizionali fotocamere.
In parallelo, l'analisi delle immagini, resa possibile dalla computer vision, una branca dell'intelligenza artificiale (AI), si sta evolvendo rapidamente, consentendo alle macchine di interpretare ed elaborare i dati visivi in modo più efficace. Questo progresso ha aperto nuove possibilità per l'automazione, il rilevamento degli oggetti e l'analisi in tempo reale. Le macchine possono ora riconoscere pattern, tracciare movimenti e dare un senso a input visivi complessi.
Alcuni tipi chiave di visual data includono immagini RGB (Rosso, Verde, Blu), comunemente utilizzate per il riconoscimento degli oggetti, l'imaging termico, che aiuta a rilevare le firme termiche in condizioni di scarsa illuminazione, e i dati di profondità, che consentono alle macchine di comprendere ambienti 3D. Ognuno di questi tipi di dati svolge un ruolo vitale nell'alimentare varie applicazioni di vision AI, che vanno dalla sorveglianza all'medical imaging.
In questo articolo esploreremo i principali tipi di dati visivi utilizzati nella vision AI e vedremo come ciascuno contribuisca a migliorare accuratezza, efficienza e prestazioni in vari settori. Iniziamo!
Il tipo più comune di dataset di immagini e video per l'AI#
Tipicamente, quando usi uno smartphone per scattare una foto o guardare filmati di videosorveglianza, stai lavorando con immagini RGB. RGB sta per rosso, verde e blu, e sono i tre canali di colore che rappresentano le informazioni visive nelle immagini digitali.
Le immagini e i video RGB sono tipi di dati visivi strettamente correlati utilizzati nella computer vision, entrambi catturati tramite fotocamere standard. La differenza principale è che le immagini catturano un singolo momento, mentre i video sono una sequenza di fotogrammi che mostrano come le cose cambiano nel tempo.
Le immagini RGB sono generalmente utilizzate per computer vision tasks come object detection, segmentazione delle istanze e stima della posa, supportate da modelli come Ultralytics YOLO11. Queste applicazioni si basano sull'identificazione di pattern, forme o caratteristiche specifiche in un singolo fotogramma.
I video, d'altra parte, sono essenziali quando il movimento o il tempo sono un fattore determinante, come per il riconoscimento dei gesti, la videosorveglianza o il tracciamento delle azioni. Poiché i video possono essere considerati una serie di immagini, i modelli di visione artificiale come Ultralytics YOLO11 li elaborano fotogramma per fotogramma per comprendere il movimento e il comportamento nel corso del tempo.
Ad esempio, puoi usare Ultralytics YOLO11 per analizzare immagini o video RGB per rilevare erbacce e contare le piante nei campi agricoli. Questo migliora il monitoraggio delle colture e aiuta a tracciare i cambiamenti nei cicli di crescita per una gestione agricola più efficiente.

Fig 1. YOLO11 può rilevare e contare le piante per un monitoraggio delle colture più intelligente.
Dati di profondità nella vision AI: LiDAR e percezione 3D#
I dati di profondità aggiungono una terza dimensione alle informazioni visive indicando la distanza degli oggetti dalla fotocamera o dal sensore. A differenza delle immagini RGB che capture color e texture, i dati di profondità forniscono un contesto spaziale. Mostrano la distanza tra gli oggetti e la fotocamera, rendendo possibile l'interpretazione del layout 3D di una scena.
Questo tipo di dati viene catturato utilizzando tecnologie come LiDAR, visione stereo (utilizzando due fotocamere per imitare la percezione della profondità umana) e fotocamere Time-of-Flight (che misurano il tempo necessario alla luce per viaggiare verso un oggetto e tornare indietro).
Tra questi, il LiDAR (Light Detection and Ranging) è spesso il più affidabile per la misurazione della profondità. Funziona emettendo rapidi impulsi laser e misurando quanto tempo impiegano a rimbalzare. Il risultato è una mappa 3D altamente accurata, nota come nuvola di punti, che evidenzia la forma, la posizione e la distanza degli oggetti in tempo reale.
Il ruolo crescente del LiDAR nei sistemi di vision AI#
La tecnologia LiDAR può essere suddivisa in due tipi principali, ciascuno progettato per applicazioni e ambienti specifici. Ecco un'analisi più approfondita di entrambi i tipi:
- LiDAR aerotrasportato: Tipicamente utilizzato per la mappatura di grandi aree, gli scanner LiDAR aerotrasportati sono montati su drones o velivoli per acquisire dati ad alta risoluzione per la mappatura topografica su larga scala. È ideale per rilevare terreni, foreste e paesaggi.
- Terrestrial LiDAR: Questo tipo di dati LiDAR viene raccolto da sensori montati su veicoli o piattaforme fisse per applicazioni come il monitoraggio delle infrastrutture, l'edilizia e la mappatura interna. Fornisce dati estremamente dettagliati per aree più piccole e localizzate, rendendolo utile per attività come la pianificazione urbana e il rilevamento di strutture specifiche.
Un'applicazione di grande impatto dei dati LiDAR è nei veicoli autonomi (autonomous vehicles), dove svolge un ruolo chiave in attività come il rilevamento della corsia, l'evitamento delle collisioni e l'identificazione degli oggetti vicini. Il LiDAR genera mappe 3D dettagliate e in tempo reale dell'ambiente, consentendo al veicolo di vedere gli oggetti, calcolarne la distanza e navigare in sicurezza.

Fig 2. La tecnologia LiDAR consente ai veicoli autonomi di mappare la profondità e rilevare oggetti.
Utilizzo di dati termici e a infrarossi nelle applicazioni AI#
Le immagini RGB catturano ciò che vediamo nello spettro della luce visibile; tuttavia, altre tecnologie di imaging, come quella termica e a infrarossi, vanno oltre. L'imaging a infrarossi cattura la luce infrarossa emessa o riflessa dagli oggetti, rendendolo utile in condizioni di scarsa illuminazione.
L'imaging termico, al contrario, rileva il calore emesso dagli oggetti e mostra le differenze di temperatura, consentendo di operare nell'oscurità totale o attraverso fumo, nebbia e altre ostruzioni. Questo tipo di dati è particolarmente utile per monitorare e rilevare anomalie, specialmente nei settori in cui le variazioni di temperatura possono segnalare potenziali problemi.
Un esempio interessante è l'imaging termico utilizzato per monitorare i componenti elettrici (electrical components) alla ricerca di segni di surriscaldamento. Rilevando le differenze di temperatura, le termocamere possono identificare i problemi prima che portino a guasti alle apparecchiature, incendi o costosi danni.

Fig 3. Un esempio di imaging termico utilizzato per monitorare i componenti elettrici.
Allo stesso modo, le immagini a infrarossi possono aiutare a rilevare perdite in tubazioni o isolamenti identificando differenze di temperatura che indicano gas o fluidi in fuga, il che è cruciale per prevenire situazioni pericolose e migliorare l'efficienza energetica.
Imaging multispettrale e iperspettrale nell'AI#
Mentre l'imaging a infrarossi e termico catturano aspetti specifici dello spettro elettromagnetico, l'imaging multispettrale raccoglie la luce da alcuni intervalli di lunghezze d'onda selezionati, ciascuno scelto per uno scopo specifico, come rilevare la vegetazione sana o identificare i materiali superficiali.
L'imaging iperspettrale fa un passo avanti catturando la luce attraverso centinaia di intervalli di lunghezze d'onda molto stretti e continui. Ciò fornisce una firma luminosa dettagliata per ogni pixel nell'immagine, offrendo una comprensione molto più profonda di qualsiasi materiale osservato.

Fig 4. Confronto tra imaging multispettrale e iperspettrale.
Sia l'imaging multispettrale che quello iperspettrale utilizzano sensori e filtri speciali per catturare la luce a diverse lunghezze d'onda. I dati vengono poi organizzati in una struttura 3D chiamata cubo spettrale, con ogni strato che rappresenta una lunghezza d'onda diversa.
I modelli di intelligenza artificiale possono analizzare questi dati per rilevare caratteristiche che le normali telecamere o l'occhio umano non possono vedere. Ad esempio, nel plant phenotyping, l'imaging iperspettrale può essere utilizzato per monitorare la salute e la crescita delle piante rilevando sottili cambiamenti nelle loro foglie o steli, come carenze di nutrienti o stress. Questo aiuta i ricercatori a valutare la salute delle piante e a ottimizzare le pratiche agricole senza bisogno di metodi invasivi.
Analisi dell'imaging radar e sonar tramite AI#
L'imaging radar e sonar sono tecnologie che rilevano e mappano oggetti inviando segnali e analizzandone i riflessi, in modo simile al LiDAR. A differenza dell'imaging RGB, che si basa sulle onde luminose per catturare informazioni visive, il radar utilizza onde elettromagnetiche, tipicamente onde radio, mentre il sonar utilizza onde sonore. Entrambi i sistemi radar e sonar emettono impulsi e misurano il tempo necessario affinché il segnale rimbalzi da un oggetto, fornendo informazioni su distanza, dimensioni e velocità.
L'imaging radar è particolarmente utile quando la visibilità è scarsa, come durante nebbia, pioggia o di notte. Poiché non si basa sulla luce, può rilevare aerei, veicoli o terreni nell'oscurità totale. Ciò rende il radar una scelta affidabile nell'aviazione, nel monitoraggio meteorologico e nella navigazione autonoma.
In confronto, l'imaging sonar è comunemente usato in ambienti sottomarini dove la luce non può arrivare. Utilizza onde sonore che viaggiano attraverso l'acqua e rimbalzano sugli oggetti sommersi, consentendo il rilevamento di sottomarini, la mappatura dei fondali oceanici e l'esecuzione di missioni di salvataggio subacquee. I progressi nella computer vision stanno ora consentendo un ulteriore miglioramento del underwater detection combinando i dati del sonar con un'analisi intelligente per un rilevamento e un processo decisionale migliorati.

Fig 5. Come un sistema SONAR usa impulsi a ultrasuoni per misurare la profondità del mare. (Fonte: bbc.co.uk)
Dati visivi sintetici e simulati per l'addestramento di modelli AI#
Finora, i diversi tipi di dati di cui abbiamo discusso sono quelli che possono essere raccolti dal mondo reale. Tuttavia, i dati visivi sintetici e simulati sono entrambi tipi di contenuto artificiale. I dati sintetici vengono generati da zero utilizzando la modellazione 3D (3D modeling) o l'AI generativa per produrre immagini o video dall'aspetto realistico.

Fig 6. Uno sguardo alle immagini generate sinteticamente.
I dati simulati sono simili ma comportano la creazione di ambienti virtuali che replicano il comportamento del mondo fisico, inclusi riflessi di luce, formazione di ombre e movimento degli oggetti. Mentre tutti i dati visivi simulati sono sintetici, non tutti i dati sintetici sono simulati. La differenza fondamentale è che i dati simulati replicano un comportamento realistico, non solo l'aspetto.
Questi tipi di dati sono utili per l'addestramento dei computer vision models, in particolare quando i dati del mondo reale sono difficili da raccogliere o quando è necessario simulare situazioni specifiche e rare. Gli sviluppatori possono creare interi scenari, scegliere tipi di oggetti, posizioni e illuminazione, e aggiungere automaticamente etichette come bounding box per l'addestramento. Questo aiuta a costruire dataset ampi e diversificati rapidamente, senza la necessità di foto reali o etichettatura manuale, che può essere costosa e richiedere molto tempo.
Ad esempio, nel settore sanitario, i dati sintetici possono essere utilizzati per addestrare modelli a segmentare le cellule del cancro al seno, dove raccogliere ed etichettare grandi dataset di immagini reali è difficile. I dati sintetici e simulati offrono flessibilità e controllo, colmando le lacune laddove le risorse visive del mondo reale sono limitate.
Scegliere il tipo giusto di dati visivi per la tua applicazione AI#
Ora che abbiamo esaminato come funzionano i diversi tipi di dati visivi e cosa possono fare, diamo un'occhiata più da vicino a quali tipi di dati sono migliori per attività specifiche:
- Immagini RGB: È perfetto per attività generali di computer vision come l'classificazione delle immagini (image classification) e la object detection. Cattura colore e texture ma è limitato in condizioni difficili come scarsa illuminazione o visibilità ridotta.
- Imaging LiDAR: Questo tipo di imaging offre una mappatura 3D ad alta precisione utilizzando impulsi laser. È ottimo per applicazioni che richiedono misurazioni accurate della distanza, come robotica, veicoli autonomi e ispezione di infrastrutture.
- Imaging termico: Poiché può rilevare differenze di temperatura, è utile in condizioni di scarsa visibilità, come il monitoraggio notturno, la lotta antincendio o il rilevamento di dispersioni termiche in macchinari ed edifici.
- Imaging multispettrale e iperspettrale: Utile per attività che richiedono un'analisi dettagliata dei materiali, come monitoraggio agricolo, controllo qualità farmaceutico o telerilevamento. Questi metodi forniscono approfondimenti più dettagliati catturando dati su un'ampia gamma di lunghezze d'onda oltre la luce visibile.
- Imaging radar e sonar: Preferiti in ambienti a bassa visibilità. Il radar utilizza onde radio ed è utile nell'aviazione e nella navigazione, mentre il sonar utilizza onde sonore per operare nel rilevamento subacqueo.
- Dati visivi sintetici e simulati: È ideale per training AI models quando i dati del mondo reale sono limitati, non disponibili o difficili da etichettare. Questi elementi visivi artificiali aiutano a costruire dataset diversificati per scenari complessi come eventi rari o condizioni critiche per la sicurezza.
A volte, un singolo tipo di dati potrebbe non fornire abbastanza accuratezza o contesto in situazioni reali. È qui che la fusione di sensori multimodali diventa fondamentale. Combinando RGB con altri tipi di dati come termico, profondità o LiDAR, i sistemi possono superare i limiti individuali, migliorando affidabilità e adattabilità.
Ad esempio, nell'warehouse automation, l'uso di RGB per il riconoscimento degli oggetti, la profondità per la misurazione della distanza e la termografia per il rilevamento di apparecchiature surriscaldate rende le operazioni più efficienti e sicure. In definitiva, i risultati migliori derivano dalla selezione o dalla combinazione di tipi di dati in base alle esigenze specifiche della tua applicazione.
Punti chiave#
Quando costruisci modelli di vision AI, scegliere il tipo giusto di dati visivi è cruciale. Attività come il rilevamento di oggetti, la segmentazione e il tracciamento del movimento non si basano solo sugli algoritmi ma anche sulla qualità dei dati di input. Dataset puliti, diversificati e accurati aiutano a ridurre il rumore e migliorare le prestazioni.
Combinando tipi di dati come RGB, profondità, termico e LiDAR, i sistemi AI ottengono una visione più completa dell'ambiente, rendendoli più affidabili in varie condizioni. Con il continuo miglioramento tecnologico, è probabile che la vision AI diventi più veloce, più adattabile e più incisiva in tutti i settori.
Unisciti alla nostra community ed esplora il nostro GitHub repository per saperne di più sulla computer vision. Scopri varie applicazioni relative a AI in healthcare e computer vision in retail sulle nostre pagine delle soluzioni. Dai un'occhiata alle nostre licensing options per iniziare con la vision AI.






