Che cos’è ResNet-50 e qual è la sua rilevanza nella computer vision?
Scopri come l’architettura di ResNet-50 consenta la classificazione delle immagini in applicazioni reali nei settori sanitario e manifatturiero e nei sistemi autonomi.

L'analisi automatizzata delle immagini è sempre più comune in applicazioni come il rilevamento delle auto che superano i limiti di velocità o l'analisi delle immagini mediche. La tecnologia alla base di queste innovazioni è la computer vision, o IA per la visione. È un ramo dell'intelligenza artificiale (AI) che consente alle macchine di interpretare e comprendere immagini e video, proprio come fanno gli esseri umani.
Per creare queste soluzioni di computer vision, gli sviluppatori si affidano a modelli di IA per la visione in grado di apprendere da grandi quantità di dati visivi. Nel corso degli anni, i ricercatori hanno sviluppato modelli più recenti e avanzati, con prestazioni impressionanti in attività di IA per la visione come la classificazione delle immagini (assegnazione di etichette alle immagini), il rilevamento degli oggetti (individuazione e identificazione degli oggetti nelle immagini) e la segmentazione delle istanze (rilevamento degli oggetti e definizione dei loro contorni esatti).
Tuttavia, esaminare i modelli precedenti e comprenderli può aiutare a capire come funzionano gli attuali sistemi di computer vision. Un esempio fondamentale è ResNet-50, un modello influente che ha introdotto il concetto di connessioni shortcut, ovvero semplici percorsi che aiutano il modello ad apprendere più velocemente e con maggiore precisione.
Questa innovazione ha reso possibile addestrare in modo efficace reti neurali molto più profonde, portando a miglioramenti significativi nella classificazione delle immagini e influenzando la progettazione di molti modelli successivi. In questo articolo esploreremo ResNet-50, il suo funzionamento e la sua rilevanza nell'evoluzione della computer vision. Iniziamo!
Che cos'è ResNet-50?#
ResNet-50 è un modello di computer vision basato su un tipo di rete neurale chiamata rete neurale convoluzionale (CNN). Le CNN sono progettate per aiutare i computer a comprendere le informazioni visive apprendendo i pattern presenti nelle immagini, come bordi, colori o forme, e utilizzando tali pattern per riconoscere e classificare gli oggetti.
Presentato nel 2015 da ricercatori di Microsoft Research, ResNet-50 è diventato rapidamente uno dei modelli più influenti nel settore grazie alla sua accuratezza ed efficienza nelle attività di riconoscimento di immagini su larga scala.
Una caratteristica fondamentale di ResNet-50 è l'uso delle connessioni residue, note anche come connessioni shortcut. Si tratta di semplici percorsi che consentono al modello di saltare alcuni passaggi del processo di apprendimento. In altre parole, invece di costringere il modello a far passare le informazioni attraverso ogni singolo livello, queste scorciatoie gli permettono di trasferire i dettagli importanti in modo più diretto. Questo rende l'apprendimento più rapido e affidabile.

Fig 1. Uno sguardo alle connessioni residue nell'architettura ResNet.
Questa progettazione aiuta a risolvere un problema comune del deep learning chiamato problema del gradiente evanescente. Nei modelli molto profondi, le informazioni importanti possono perdersi mentre attraversano numerosi livelli, rendendo difficile l'apprendimento per il modello.
Le connessioni residue aiutano a prevenire questo problema mantenendo il flusso delle informazioni chiaro dall'inizio alla fine. Ecco perché il modello si chiama ResNet-50: ResNet sta per Residual Network, mentre "50" si riferisce al numero di livelli utilizzati per elaborare un'immagine.
Panoramica del funzionamento di ResNet-50#
ResNet-50 ha una struttura ben organizzata che consente al modello di essere profondo senza perdere informazioni importanti. Segue uno schema semplice e ripetibile che mantiene l'efficienza, consentendo al tempo stesso prestazioni elevate.
Ecco uno sguardo più dettagliato al funzionamento dell'architettura ResNet-50:
- Estrazione delle caratteristiche di base: Il modello inizia applicando un'operazione matematica chiamata convoluzione. Questa consiste nello spostare piccoli filtri (chiamati kernel) sull'immagine per produrre mappe delle caratteristiche, ovvero nuove versioni dell'immagine che evidenziano pattern di base come bordi o texture. In questo modo il modello inizia a individuare informazioni visive utili.
- Apprendimento di caratteristiche complesse: Man mano che i dati attraversano la rete, le dimensioni delle mappe delle caratteristiche si riducono. Questo avviene tramite tecniche come il pooling o l'uso di filtri con passi più ampi (chiamati stride). Allo stesso tempo, la rete crea un numero maggiore di mappe delle caratteristiche, aiutandosi a catturare pattern sempre più complessi, come forme, parti di oggetti o texture.
- Compressione ed espansione dei dati: Ogni fase comprime i dati, li elabora e poi li espande nuovamente. Questo aiuta il modello ad apprendere risparmiando memoria.
- Connessioni shortcut: Sono percorsi semplici che permettono alle informazioni di saltare in avanti invece di attraversare ogni livello. Rendono l'apprendimento più stabile ed efficiente.
- Generazione di una predizione: Alla fine della rete, tutte le informazioni apprese vengono combinate e passate attraverso una funzione softmax. Questa restituisce una distribuzione di probabilità sulle possibili classi, indicando il livello di confidenza del modello in ogni predizione, ad esempio 90% gatto, 9% cane, 1% automobile.

Fig 2. L'architettura ResNet-50.
Caratteristiche principali di ResNet-50#
Sebbene ResNet-50 sia stato progettato originariamente per la classificazione delle immagini, la sua struttura flessibile lo ha reso utile in molte aree della computer vision. Vediamo alcune delle caratteristiche che distinguono ResNet-50.
Utilizzo di ResNet-50 per la classificazione delle immagini#
ResNet-50 viene utilizzato principalmente per la classificazione delle immagini, il cui obiettivo è assegnare un'unica etichetta a un'immagine. Ad esempio, data una fotografia, il modello può classificarla come cane, gatto o aeroplano in base all'oggetto principale che rileva.
La sua struttura affidabile e la disponibilità in librerie di deep learning ampiamente utilizzate, come PyTorch e TensorFlow, hanno reso ResNet-50 una scelta iniziale popolare per l'addestramento su grandi dataset di immagini. Uno degli esempi più noti è ImageNet, un'enorme raccolta di immagini etichettate utilizzata per valutare e confrontare i modelli di computer vision.
Sebbene i modelli più recenti, come Ultralytics YOLO11, offrano prestazioni superiori, ResNet-50 è ancora comunemente utilizzato come benchmark grazie al suo solido equilibrio tra accuratezza, velocità e semplicità.

Fig 3. Un esempio di utilizzo di ResNet-50 per classificare un cane.
Rilevamento degli oggetti abilitato dai backbone ResNet-50#
Mentre la classificazione delle immagini consiste nell'identificare l'oggetto principale in una fotografia, il rilevamento degli oggetti fa un passo avanti individuando ed etichettando più oggetti nella stessa immagine. Ad esempio, in un'immagine di una strada trafficata, un modello potrebbe dover rilevare automobili, autobus e persone, oltre a determinare la posizione di ciascuno di essi.
ResNet-50 viene utilizzato come backbone in alcuni di questi modelli. Ciò significa che gestisce la prima parte del lavoro: analizzare l'immagine ed estrarre i dettagli importanti che descrivono cosa contiene e dove si trovano gli elementi. Questi dettagli vengono quindi passati alla parte successiva del modello, chiamata detection head, che prende le decisioni finali sugli oggetti presenti nell'immagine e sulla loro posizione.
Modelli di rilevamento diffusi come Faster R-CNN e DETR utilizzano ResNet-50 per questa fase di estrazione delle caratteristiche. Poiché è in grado di catturare bene sia i dettagli più fini sia la disposizione complessiva di un'immagine, aiuta questi modelli a produrre predizioni accurate, anche in scene complesse.
Transfer learning con ResNet-50#
Un altro aspetto interessante del modello ResNet-50 è la sua capacità di supportare il transfer learning. Ciò significa che il modello, addestrato originariamente su un grande dataset come ImageNet per la classificazione delle immagini, può essere adattato a nuove attività con una quantità di dati molto inferiore.
Invece di partire da zero, la maggior parte dei livelli del modello viene riutilizzata e solo il livello finale di classificazione viene sostituito e riaddestrato per la nuova attività. Questo consente di risparmiare tempo ed è particolarmente utile quando i dati etichettati sono limitati.
Applicazioni di computer vision di ResNet-50#
L'architettura di ResNet-50 lo ha reso utile in un'ampia gamma di applicazioni di computer vision. È stato particolarmente importante agli inizi del deep learning, contribuendo a trasferire la tecnologia di IA per la visione dalla ricerca all'uso nel mondo reale. Risolvendo sfide fondamentali, ha contribuito a spianare la strada ai modelli più avanzati che vediamo nelle applicazioni odierne.
Imaging medico basato su ResNet-50#
ResNet-50 è stato uno dei primi modelli utilizzati nell'imaging medico basato sul deep learning. I ricercatori lo hanno impiegato per identificare pattern patologici in radiografie, risonanze magnetiche e altre scansioni diagnostiche. Ad esempio, ha contribuito a rilevare tumori e a classificare immagini retiniche diabetiche per supportare la diagnosi in oftalmologia.
Sebbene oggi negli strumenti clinici vengano utilizzati modelli più avanzati, ResNet-50 ha svolto un ruolo fondamentale nelle prime ricerche sull'IA medica. La sua facilità d'uso e la struttura modulare lo hanno reso una scelta adatta per creare prototipi di sistemi diagnostici.

Fig 4. Rilevamento di tumori cerebrali basato su ResNet-50.
Automazione industriale basata su ResNet-50#
Analogamente, ResNet-50 è stato applicato anche in contesti industriali. Ad esempio, nel settore manifatturiero è stato utilizzato in sistemi di ricerca e pilota per rilevare difetti superficiali nei materiali come acciaio, cemento e componenti verniciati.
È stato inoltre testato in configurazioni per identificare cavità, crepe o depositi che si formano durante la fusione o l'assemblaggio. ResNet-50 è particolarmente adatto a queste attività perché è in grado di rilevare differenze sottili nella texture delle superfici, una capacità importante per il controllo qualità.
Sebbene oggi nei sistemi di produzione vengano comunemente utilizzati modelli più avanzati come Ultralytics YOLO11, ResNet-50 continua a svolgere un ruolo importante nella ricerca accademica e nel benchmarking, in particolare per le attività di classificazione delle immagini.

Fig 5. Ispezione delle superfici mediante ResNet-50.
Vantaggi e limitazioni di ResNet-50#
Ecco alcuni dei vantaggi di ResNet-50:
- Solide prestazioni di base: ResNet-50 offre una buona accuratezza in un'ampia gamma di attività, rendendolo un benchmark affidabile sia nella ricerca sia nei progetti applicati.
- Ben documentato e ampiamente studiato: La sua architettura è ben compresa e documentata in modo approfondito, il che facilita la risoluzione dei problemi e l'apprendimento per sviluppatori e ricercatori.
- Versatile in diversi ambiti: Dall'imaging medico alla produzione industriale, ResNet-50 è stato applicato con successo a numerosi problemi del mondo reale, dimostrando la sua flessibilità.
Ecco invece una panoramica delle limitazioni di ResNet-50:
- Elevato utilizzo di risorse: ResNet-50 richiede più memoria e potenza di calcolo rispetto ai modelli leggeri, il che può renderlo meno adatto ai dispositivi mobili o alle applicazioni in tempo reale.
- Overfitting su dataset di piccole dimensioni: A causa della sua profondità e complessità, ResNet-50 può incorrere nell'overfitting quando viene addestrato su dati limitati senza adeguate tecniche di regolarizzazione.
- Dimensioni di input fisse: ResNet-50 generalmente si aspetta immagini di dimensioni specifiche, ad esempio 224×224 pixel, quindi spesso è necessario ridimensionare o ritagliare le immagini, con il rischio di rimuovere talvolta dettagli importanti.
Punti chiave#
ResNet-50 ha dimostrato che le reti molto profonde potevano essere addestrate in modo efficace mantenendo prestazioni elevate nelle attività visive. La sua architettura ha offerto un framework chiaro e pratico per costruire modelli più profondi e affidabili.
Dopo il suo rilascio, i ricercatori hanno ampliato il progetto creando versioni più profonde come ResNet-101 e ResNet-152. Nel complesso, ResNet-50 è un modello fondamentale che ha contribuito a plasmare il modo in cui oggi il deep learning viene utilizzato nella computer vision.
Unisciti alla nostra community in crescita! Esplora il nostro repository GitHub per saperne di più sull'IA. Vuoi iniziare i tuoi progetti di computer vision? Dai un'occhiata alle nostre opzioni di licenza. Scopri l'IA in agricoltura e la computer vision nell'assistenza sanitaria visitando le nostre pagine dedicate alle soluzioni!









