Tipi di tecniche di apprendimento dell'AI utilizzate nella visione artificiale
Esplora i diversi tipi di tecniche di machine learning e deep learning utilizzate nelle applicazioni di visione artificiale, dall'apprendimento supervisionato al transfer learning.

Machine learning è un tipo di intelligenza artificiale (AI) che aiuta i computer a imparare dai dati in modo da poter prendere decisioni in autonomia, senza bisogno di una programmazione dettagliata per ogni singola attività. Comporta la creazione di modelli algoritmici in grado di identificare pattern nei dati. Identificando pattern nei dati e imparando da essi, questi algoritmi possono migliorare gradualmente le loro prestazioni nel corso del tempo.
Un'area in cui il machine learning gioca un ruolo cruciale è la computer vision, un campo dell'AI che si concentra sui dati visivi. La computer vision utilizza il machine learning per aiutare i computer a rilevare e riconoscere pattern in immagini e video. Spinto dai progressi nel machine learning, si stima che il valore di mercato globale della computer vision raggiungerà circa 175,72 miliardi di dollari entro il 2032.
In questo articolo esamineremo i diversi tipi di machine learning utilizzati nella computer vision, inclusi l'apprendimento supervisionato, non supervisionato, per rinforzo e transfer learning, e come ciascuno di essi svolga un ruolo in diverse applicazioni. Iniziamo!
Panoramica del machine learning nella computer vision#
La computer vision si basa sul machine learning, in particolare su tecniche come il deep learning e le reti neurali, per interpretare e analizzare le informazioni visive. Questi metodi consentono ai computer di eseguire attività di computer vision come il rilevamento di oggetti nelle immagini, la classificazione delle immagini per categoria e il riconoscimento facciale. Il machine learning è essenziale anche per applicazioni di computer vision in tempo reale come il controllo qualità nella produzione e la diagnostica per immagini nella sanità. In questi casi, le reti neurali aiutano i computer a interpretare dati visivi complessi, come l'analisi di scansioni cerebrali per rilevare tumori.
In effetti, molti modelli avanzati di computer vision, come Ultralytics YOLO11, sono basati su reti neurali.

Fig 1. Segmentazione di scansioni cerebrali usando Ultralytics YOLO11.
Esistono diversi tipi di metodi di apprendimento nel machine learning, come l'apprendimento supervisionato, non supervisionato, transfer learning e apprendimento per rinforzo, che stanno spingendo i confini di ciò che è possibile nella computer vision. Nelle sezioni seguenti, esploreremo ognuno di questi tipi per capire come contribuiscono alla computer vision.
Esplorazione dell'apprendimento supervisionato#
L'apprendimento supervisionato è il tipo di machine learning più comunemente utilizzato. Nell'apprendimento supervisionato, i modelli vengono addestrati utilizzando dati etichettati. Ogni input è contrassegnato con l'output corretto, il che aiuta il modello a imparare. Similmente a uno studente che impara da un insegnante, questi dati etichettati agiscono come una guida o un supervisore.
Durante l'addestramento, al modello vengono forniti sia i dati di input (le informazioni che deve elaborare) sia i dati di output (le risposte corrette). Questa configurazione aiuta il modello a comprendere la connessione tra input e output. L'obiettivo principale dell'apprendimento supervisionato è fare in modo che il modello scopra una regola o un pattern che colleghi accuratamente ciascun input al rispettivo output corretto. Con questa mappatura, il modello può fare previsioni accurate quando incontra nuovi dati. Ad esempio, il riconoscimento facciale nella computer vision si basa sull'apprendimento supervisionato per identificare i volti in base a questi pattern appresi.
Un uso comune di questo processo è lo sblocco del tuo smartphone tramite riconoscimento facciale. Il modello viene addestrato su immagini etichettate del tuo viso in modo che, quando provi a sbloccare il telefono, l'immagine dal vivo venga confrontata con ciò che il modello ha appreso. Se viene rilevata una corrispondenza, il telefono si sblocca.

Fig 2. Il riconoscimento facciale può essere utilizzato per sbloccare il tuo smartphone.
Come funziona l'apprendimento non supervisionato nell'IA?#
L'apprendimento non supervisionato è un tipo di machine learning che utilizza dati non etichettati: al modello non viene fornita alcuna guida o risposta corretta durante l'addestramento. Al contrario, impara a scoprire pattern e approfondimenti in autonomia.
L'apprendimento non supervisionato identifica pattern utilizzando tre metodi principali:
- Clustering: raggruppa punti di dati simili. È utile per attività come la segmentazione della clientela, in cui clienti simili possono essere raggruppati in base ai loro comportamenti o attributi.
- Associazione: viene utilizzata per identificare relazioni tra elementi, aiutando a scoprire connessioni all'interno dei dati (ad esempio, trovando prodotti spesso acquistati insieme nell'analisi del carrello).
- Riduzione della dimensionalità: semplifica i set di dati rimuovendo le feature ridondanti, il che facilita la visualizzazione e l'elaborazione.
Un'applicazione chiave dell'apprendimento non supervisionato è la compressione delle immagini, in cui tecniche come il k-means clustering riducono le dimensioni dell'immagine senza compromettere la qualità visiva. I pixel vengono raggruppati in cluster e ciascun cluster è rappresentato da un colore medio, ottenendo un'immagine con meno colori e dimensioni di file inferiori.

Fig 3. Un esempio di compressione delle immagini non supervisionata.
Tuttavia, l'apprendimento non supervisionato presenta alcune limitazioni. In assenza di risposte predefinite, può riscontrare difficoltà nell'accuratezza e nella valutazione delle prestazioni. Spesso richiede un lavoro manuale per interpretare i risultati ed etichettare i gruppi, ed è sensibile a problemi come valori mancanti e rumore, che possono influire sulla qualità dei risultati.
Spiegazione dell'apprendimento per rinforzo#
A differenza dell'apprendimento supervisionato e non supervisionato, l'apprendimento per rinforzo non si basa su dati di addestramento. Al contrario, utilizza agenti di reti neurali per interagire con un ambiente al fine di raggiungere uno scopo specifico.
Il processo coinvolge tre componenti principali:
- Agente: lo studente o il decisore.
- Ambiente: tutto ciò con cui l'agente interagisce, che può essere reale o virtuale.
- Segnale di ricompensa: un valore numerico fornito dopo ogni azione, che guida l'agente verso l'obiettivo.
Mentre l'agente intraprende azioni, influisce sull'ambiente, che poi risponde con un feedback. Il feedback aiuta l'agente a valutare le sue scelte e ad adattare il suo comportamento. Il segnale di ricompensa aiuta l'agente a capire quali azioni lo avvicinano al raggiungimento del suo obiettivo.
L'apprendimento per rinforzo è fondamentale per casi d'uso come la guida autonoma e la robotica. Nella guida autonoma, attività come i comandi del veicolo, il rilevamento degli oggetti e l'evitamento degli ostacoli apprendono tramite feedback. I modelli vengono addestrati utilizzando agenti di reti neurali per rilevare pedoni o altri oggetti e intraprendere l'azione appropriata per evitare la collisione. Allo stesso modo, nella robotica, l'apprendimento per rinforzo consente attività come la manipolazione di oggetti e il controllo del movimento.
Un ottimo esempio di apprendimento per rinforzo in azione è un progetto di OpenAI, in cui i ricercatori hanno addestrato agenti AI a giocare al popolare videogioco multiplayer Dota 2. Utilizzando reti neurali, questi agenti hanno elaborato enormi quantità di informazioni provenienti dall'ambiente di gioco per prendere decisioni rapide e strategiche. Tramite un feedback continuo, gli agenti hanno imparato e migliorato le proprie capacità nel tempo, raggiungendo infine un livello di abilità tale da battere alcuni dei migliori giocatori del gioco.

Fig 4. Interpretazione della Dota Matrix da parte di un essere umano rispetto all'AI.
Capire le basi del transfer learning#
Il transfer learning è diverso dagli altri tipi di apprendimento. Invece di addestrare un modello da zero, si utilizza un modello pre-addestrato su un grande dataset e lo si mette a punto (fine-tuning) per un'attività nuova ma correlata. La conoscenza acquisita durante l'addestramento iniziale viene utilizzata per migliorare le prestazioni sulla nuova attività. Il transfer learning riduce il tempo necessario per l'addestramento su una nuova attività, a seconda della sua complessità. Funziona mantenendo i layer iniziali del modello che catturano le feature generali e sostituendo i layer finali con quelli della nuova attività specifica.
Il trasferimento dello stile artistico è un'applicazione interessante del transfer learning nella computer vision. Questa tecnica consente a un modello di trasformare un'immagine affinché corrisponda allo stile di diverse opere d'arte. Per ottenere ciò, una rete neurale viene prima addestrata su un ampio dataset di immagini abbinate ai rispettivi stili artistici. Attraverso questo processo, il modello impara a identificare le feature generali dell'immagine e i pattern di stile.
Una volta addestrato il modello, può essere perfezionato per applicare lo stile di un dipinto specifico a una nuova immagine. La rete si adatta alla nuova immagine preservando le caratteristiche di stile apprese, permettendole di creare un risultato unico che combina il contenuto originale con lo stile artistico selezionato. Ad esempio, potresti scattare una foto di una catena montuosa e applicare lo stile de L'urlo di Edvard Munch, ottenendo un'immagine che cattura la scena ma con lo stile audace ed espressivo del dipinto.

Fig 5. Un esempio di trasferimento dello stile artistico tramite transfer learning.
Uno sguardo alle differenze tra i tipi di machine learning#
Ora che abbiamo coperto i principali tipi di machine learning, diamo un'occhiata più da vicino a ciascuno per aiutarti a capire la soluzione migliore per diverse applicazioni.
- Apprendimento supervisionato: questo tipo è altamente accurato quando si lavora con dati etichettati, ma richiede molti dati e può essere sensibile al rumore.
- Apprendimento non supervisionato: è utile per esplorare dati non etichettati alla ricerca di pattern nascosti, sebbene i risultati possano essere meno precisi e più difficili da interpretare.
- Apprendimento per rinforzo: addestra gli agenti a prendere decisioni passo dopo passo in ambienti complessi, ma spesso richiede una potenza di calcolo significativa.
- Transfer learning: questo approccio utilizza modelli pre-addestrati per velocizzare l'addestramento e migliorare le prestazioni su nuovi compiti, specialmente quando i dati sono limitati.

Fig 6. Un confronto di tutti i tipi di machine learning. Immagine dell'autore.
La scelta del tipo di machine learning corretto dipende da diversi fattori. L'apprendimento supervisionato funziona bene se disponi di abbondanti dati etichettati e di un'attività chiara. L'apprendimento non supervisionato è utile per l'esplorazione dei dati o quando gli esempi etichettati sono scarsi. L'apprendimento per rinforzo è ideale per attività complesse che richiedono un processo decisionale passo dopo passo, mentre il transfer learning è ottimo quando i dati sono limitati o le risorse sono scarse. Considerando questi fattori, puoi selezionare l'approccio più adatto per il tuo progetto di computer vision.
In conclusione#
Le tecniche di machine learning possono affrontare una varietà di sfide, specialmente in aree come la computer vision. Comprendendo i diversi tipi, supervisionato, non supervisionato, per rinforzo e transfer learning, puoi scegliere l'approccio migliore per le tue esigenze.
L'apprendimento supervisionato è ottimo per compiti che richiedono un'elevata precisione e dati etichettati, mentre l'apprendimento non supervisionato è ideale per trovare pattern in dati non etichettati. L'apprendimento per rinforzo funziona bene in contesti complessi basati su decisioni, e il transfer learning è utile quando vuoi costruire su modelli pre-addestrati con dati limitati.
Ogni metodo ha punti di forza e applicazioni uniche, dal riconoscimento facciale alla robotica, fino al trasferimento dello stile artistico. Scegliere il tipo giusto può sbloccare nuove possibilità in settori come l'assistenza sanitaria, l'automotive e l'intrattenimento.
Per saperne di più, visita il nostro GitHub repository e interagisci con la nostra community. Esplora le applicazioni di IA nelle self-driving cars e nell'agriculture sulle nostre pagine delle soluzioni. 🚀






