Una storia dei modelli di visione
Esplora la storia, i traguardi, le sfide e le prospettive future dei modelli di visione.

Che cos'è la visione artificiale#
Immagina di entrare in un negozio in cui una fotocamera identifica il tuo volto, analizza il tuo stato d'animo e suggerisce prodotti personalizzati in base alle tue preferenze, tutto in tempo reale. Non è fantascienza, ma una realtà resa possibile dai moderni modelli di visione. Secondo un rapporto di Fortune Business Insight, nel 2023 il valore del mercato globale della visione artificiale era pari a 20,31 miliardi di dollari e si prevede che crescerà da 25,41 miliardi di dollari nel 2024 a 175,72 miliardi di dollari entro il 2032, riflettendo i rapidi progressi e la crescente adozione di questa tecnologia in vari settori.
Il campo della visione artificiale consente ai computer di rilevare, identificare e analizzare gli oggetti all'interno delle immagini. Come altri ambiti dell'IA, la visione artificiale ha subito una rapida evoluzione negli ultimi decenni, raggiungendo progressi notevoli.
La storia della visione artificiale è lunga. Agli inizi, i modelli di visione artificiale erano in grado di rilevare forme e bordi semplici, spesso limitati ad attività di base come riconoscere motivi geometrici o distinguere tra aree chiare e scure. Oggi, invece, i modelli possono svolgere attività complesse come il rilevamento degli oggetti in tempo reale, il riconoscimento facciale e persino l'interpretazione delle emozioni dalle espressioni del volto, con precisione ed efficienza eccezionali. Questa straordinaria evoluzione evidenzia gli enormi progressi compiuti nella potenza di calcolo, nella sofisticazione degli algoritmi e nella disponibilità di grandi quantità di dati per l'addestramento.
In questo articolo esploreremo le principali tappe dell'evoluzione della visione artificiale. Ripercorreremo gli inizi, analizzeremo l'impatto trasformativo delle reti neurali convoluzionali (CNNs) ed esamineremo i progressi significativi che ne sono seguiti.
Gli inizi della visione artificiale#
Come in altri ambiti dell'IA, lo sviluppo iniziale della visione artificiale è iniziato con ricerche di base e lavori teorici. Una tappa importante fu il lavoro pionieristico di Lawrence G. Roberts sul riconoscimento di oggetti 3D, documentato nella sua tesi "Machine Perception of Three-Dimensional Solids" nei primi anni '60. I suoi contributi gettarono le basi per i futuri progressi del settore.
I primi algoritmi: rilevamento dei bordi#
Le prime ricerche sulla visione artificiale si concentravano sulle tecniche di elaborazione delle immagini, come il rilevamento dei bordi e l'estrazione delle caratteristiche. Algoritmi come l'operatore di Sobel, sviluppato alla fine degli anni '60, furono tra i primi a rilevare i bordi calcolando il gradiente dell'intensità dell'immagine.

Fig. 1. Un'immagine che mostra il rilevamento dei bordi, in cui il lato sinistro mostra l'oggetto originale e quello destro la versione con i bordi rilevati.
Tecniche come i rilevatori di bordi di Sobel e Canny hanno svolto un ruolo fondamentale nell'identificazione dei contorni all'interno delle immagini, essenziali per riconoscere gli oggetti e comprendere le scene.
Apprendimento automatico e visione artificiale#
Riconoscimento dei modelli#
Negli anni '70, il riconoscimento dei modelli emerse come area chiave della visione artificiale. I ricercatori svilupparono metodi per riconoscere forme, texture e oggetti nelle immagini, aprendo la strada ad attività di visione più complesse.

Fig. 2. Riconoscimento dei modelli.
Uno dei primi metodi per il riconoscimento dei modelli prevedeva il template matching, in cui un'immagine viene confrontata con un insieme di template per trovare la corrispondenza migliore. Questo approccio era limitato dalla sua sensibilità alle variazioni di scala, rotazione e rumore.

Fig. 3. Un template sul lato sinistro individuato nell'immagine a destra.
I primi sistemi di visione artificiale erano limitati dalla ridotta potenza di calcolo dell'epoca. I computer degli anni '60 e '70 erano ingombranti, costosi e disponevano di capacità di elaborazione limitate.
La svolta del Deep Learning#
Deep Learning e reti neurali convoluzionali#
Il Deep Learning e le reti neurali convoluzionali (CNNs) hanno segnato un momento decisivo nel campo della visione artificiale. Questi progressi hanno trasformato radicalmente il modo in cui i computer interpretano e analizzano i dati visivi, consentendo un'ampia gamma di applicazioni precedentemente ritenute impossibili.
Come funzionano le CNNs?#

Fig. 4. Architettura di una rete neurale convoluzionale (CNN).
- Livelli convoluzionali: le CNNs utilizzano livelli convoluzionali, un tipo di modello di Deep Learning progettato per elaborare dati strutturati a griglia, come immagini o sequenze, apprendendo automaticamente pattern gerarchici per analizzare un'immagine tramite filtri o kernel. Questi filtri rilevano diverse caratteristiche, come bordi, texture e colori, scorrendo sull'immagine e calcolando prodotti scalari. Ogni filtro si attiva in corrispondenza di pattern specifici nell'immagine, consentendo al modello di apprendere caratteristiche gerarchiche.
- Funzioni di attivazione: dopo la convoluzione, funzioni di attivazione come ReLU (Rectified Linear Unit), una popolare funzione di attivazione nel Deep Learning che restituisce direttamente l'input se positivo e zero altrimenti, aiutano le reti neurali ad apprendere in modo efficiente le relazioni non lineari nei dati. Questo aiuta la rete ad apprendere pattern e rappresentazioni complesse.
- Livelli di pooling: i livelli di pooling eseguono un'operazione di sottocampionamento che riduce la dimensionalità della mappa delle caratteristiche, contribuendo a estrarre le caratteristiche più rilevanti e a ridurre al contempo il costo computazionale e l'overfitting.
- Livelli completamente connessi: i livelli finali di una CNN sono livelli completamente connessi che interpretano le caratteristiche estratte dai livelli convoluzionali e di pooling per effettuare previsioni. Questi livelli sono simili a quelli delle reti neurali tradizionali.
Evoluzione dei modelli di visione basati su CNN#
Il percorso dei modelli di visione è stato lungo e ha incluso alcuni tra i più importanti:
-
LeNet (1989): LeNet è stata una delle prime architetture CNN, utilizzata principalmente per il riconoscimento di cifre su assegni scritti a mano. Il suo successo ha gettato le basi per CNN più complesse, dimostrando il potenziale del Deep Learning nell'elaborazione delle immagini.
-
AlexNet (2012): AlexNet ha superato nettamente i modelli esistenti nella competizione ImageNet, mostrando la potenza del Deep Learning. Questo modello utilizzava attivazioni ReLU, dropout e data augmentation, stabilendo nuovi standard nella classificazione delle immagini e suscitando un interesse diffuso per le CNNs.
-
VGGNet (2014): utilizzando filtri convoluzionali più piccoli (3x3), VGGNet ha ottenuto risultati impressionanti nelle attività di classificazione delle immagini, rafforzando l'importanza della profondità della rete per raggiungere una maggiore accuratezza.
-
ResNet (2015): ResNet ha affrontato il problema del degrado nelle reti profonde introducendo l'apprendimento residuo. Questa innovazione ha permesso di addestrare reti molto più profonde, portando a prestazioni all'avanguardia in varie attività di visione artificiale.
-
YOLO (Guardi una sola volta): YOLO ha rivoluzionato il rilevamento degli oggetti formulandolo come un unico problema di regressione, prevedendo direttamente le bounding box e le probabilità delle classi da immagini complete in un'unica valutazione. Questo approccio ha consentito il rilevamento degli oggetti in tempo reale con velocità e accuratezza senza precedenti, rendendolo adatto ad applicazioni che richiedono un'elaborazione istantanea, come la guida autonoma e la sorveglianza.
Applicazioni della visione artificiale#
Sanità#
Gli impieghi della visione artificiale sono numerosi. Ad esempio, modelli di visione come Ultralytics YOLOv8 vengono utilizzati nell'imaging medico per rilevare malattie come il cancro e la retinopatia diabetica. Analizzano radiografie, risonanze magnetiche e scansioni CT con elevata precisione, identificando tempestivamente le anomalie. Questa capacità di rilevamento precoce consente interventi tempestivi e migliori risultati per i pazienti.

Fig. 5. Rilevamento di tumori cerebrali con Ultralytics YOLOv8.
Tutela dell'ambiente#
I modelli di visione artificiale contribuiscono a monitorare e proteggere le specie a rischio analizzando immagini e video provenienti dagli habitat naturali. Identificano e tracciano il comportamento degli animali, fornendo dati sulla loro popolazione e sui loro spostamenti. Questa tecnologia orienta le strategie di conservazione e le decisioni politiche per proteggere specie come tigri ed elefanti.
Con l'aiuto dell'IA per la visione, è possibile monitorare anche altre minacce ambientali, come gli incendi boschivi e la deforestazione, garantendo tempi di risposta rapidi da parte delle autorità locali.

Fig. 6. Un'immagine satellitare di un incendio boschivo.
Sfide e prospettive future#
Sebbene abbiano già raggiunto risultati significativi, i modelli di visione devono affrontare numerose sfide che richiedono ricerca continua e progressi futuri, a causa della loro estrema complessità e della natura impegnativa del loro sviluppo.
Interpretabilità e spiegabilità#
I modelli di visione, soprattutto quelli di Deep Learning, sono spesso considerati "scatole nere" con trasparenza limitata. Ciò è dovuto alla loro straordinaria complessità. La mancanza di interpretabilità ostacola la fiducia e la responsabilità, soprattutto in applicazioni critiche come, ad esempio, l'assistenza sanitaria.
Requisiti computazionali#
L'addestramento e la distribuzione di modelli di IA all'avanguardia richiedono notevoli risorse computazionali. Ciò vale in particolare per i modelli di visione, che spesso devono elaborare grandi quantità di dati di immagini e video. Le immagini e i video ad alta definizione, tra gli input di addestramento più intensivi in termini di dati, aumentano ulteriormente il carico computazionale. Ad esempio, una singola immagine HD può occupare diversi megabyte di spazio di archiviazione, rendendo il processo di addestramento dispendioso in termini di risorse e tempo.
Ciò rende necessario disporre di hardware potente e algoritmi di visione artificiale ottimizzati per gestire l'ampia quantità di dati e i complessi calcoli coinvolti nello sviluppo di modelli di visione efficaci. La ricerca su architetture più efficienti, compressione dei modelli e acceleratori hardware come GPU e TPU costituisce un'area chiave per il progresso futuro dei modelli di visione.
Questi miglioramenti mirano a ridurre le esigenze computazionali e ad aumentare l'efficienza di elaborazione. Inoltre, sfruttare modelli preaddestrati avanzati come Ultralytics YOLOv8 può ridurre significativamente la necessità di un addestramento esteso, semplificando il processo di sviluppo e migliorandone l'efficienza.
Un panorama in continua evoluzione#
Oggi le applicazioni dei modelli di visione sono diffuse in molti ambiti, dall'assistenza sanitaria, ad esempio per il rilevamento dei tumori, agli usi quotidiani come il monitoraggio del traffico. Questi modelli avanzati hanno portato innovazione in innumerevoli settori, offrendo accuratezza, efficienza e capacità superiori a quelle che in precedenza sembravano inimmaginabili.
Con il continuo progresso della tecnologia, il potenziale dei modelli di visione per innovare e migliorare vari aspetti della vita e dell'industria rimane illimitato. Questa evoluzione costante sottolinea l'importanza di proseguire la ricerca e lo sviluppo nel campo della visione artificiale.
Sei curioso di conoscere il futuro dell'IA per la visione? Per ulteriori informazioni sugli ultimi progressi, esplora la documentazione di Ultralytics e scopri i relativi progetti su Ultralytics GitHub e YOLOv8 GitHub. Inoltre, per approfondire le applicazioni dell'IA nei vari settori, le pagine delle soluzioni dedicate alle auto a guida autonoma e alla produzione offrono informazioni particolarmente utili.









