Che cos’è Mask R-CNN e come funziona?
Scopri come Mask R-CNN può essere utilizzato per segmentare con precisione gli oggetti in immagini e video per diverse applicazioni in vari settori.

Innovazioni come i robot nei magazzini, le auto a guida autonoma che si muovono in sicurezza su strade trafficate, i droni che controllano le colture e i sistemi di IA che ispezionano i prodotti nelle fabbriche stanno diventando sempre più comuni con la diffusione dell'IA. Una tecnologia fondamentale alla base di queste innovazioni è la computer vision, un ramo dell'IA che consente alle macchine di comprendere e interpretare i dati visivi.
Ad esempio, il rilevamento degli oggetti è un'attività di computer vision che aiuta a identificare e localizzare gli oggetti nelle immagini utilizzando riquadri di delimitazione. Sebbene i riquadri di delimitazione forniscano informazioni utili, offrono solo una stima approssimativa della posizione di un oggetto e non riescono a catturarne la forma o i confini esatti. Questo li rende meno efficaci nelle applicazioni che richiedono un'identificazione precisa.
Per risolvere questo problema, i ricercatori hanno sviluppato modelli di segmentazione che catturano i contorni esatti degli oggetti, fornendo dettagli a livello di pixel per un rilevamento e un'analisi più accurati.
Mask R-CNN è uno di questi modelli. Introdotto nel 2017 da Facebook AI Research (FAIR), si basa su modelli precedenti come R-CNN, Fast R-CNN e Faster R-CNN. In quanto importante traguardo nella storia della computer vision, Mask R-CNN ha aperto la strada a modelli più avanzati, come Ultralytics YOLO11.
In questo articolo analizzeremo cos'è Mask R-CNN, come funziona, quali sono le sue applicazioni e quali miglioramenti sono stati introdotti in seguito, fino ad arrivare a Ultralytics YOLO11.
Panoramica di Mask R-CNN#
Mask R-CNN, acronimo di rete neurale convoluzionale basata su regioni per le maschere, è un modello di deep learning progettato per attività di computer vision come il rilevamento degli oggetti e la segmentazione delle istanze.
La segmentazione delle istanze va oltre il rilevamento tradizionale degli oggetti: non si limita a identificare gli oggetti in un'immagine, ma delinea accuratamente ciascuno di essi. Assegna un'etichetta univoca a ogni oggetto rilevato e ne cattura la forma esatta a livello di pixel. Questo approccio dettagliato consente di distinguere chiaramente tra oggetti sovrapposti e di gestire con precisione forme complesse.
Mask R-CNN si basa su Faster R-CNN, che rileva ed etichetta gli oggetti ma non ne definisce le forme esatte. Mask R-CNN migliora questo approccio identificando i pixel esatti che compongono ciascun oggetto, consentendo un'analisi delle immagini molto più dettagliata e accurata.

Fig. 1. Confronto tra rilevamento degli oggetti e segmentazione delle istanze.
Uno sguardo all'architettura di Mask R-CNN e al suo funzionamento#
Mask R-CNN adotta un approccio graduale per rilevare e segmentare accuratamente gli oggetti. Inizia estraendo le caratteristiche principali con una rete neurale profonda (un modello a più livelli che apprende dai dati), quindi identifica le potenziali aree degli oggetti con una rete di proposta delle regioni (un componente che suggerisce le probabili regioni contenenti oggetti) e infine perfeziona queste aree creando maschere di segmentazione dettagliate (contorni precisi degli oggetti) che catturano la forma esatta di ciascun oggetto.
Ora analizzeremo ogni passaggio per comprendere meglio come funziona Mask R-CNN.

Fig. 2. Panoramica dell'architettura di Mask R-CNN (Fonte: researchgate.net).
A partire dall'estrazione delle caratteristiche#
Il primo passaggio nell'architettura di Mask R-CNN consiste nel scomporre l'immagine nelle sue parti principali, così che il modello possa comprenderne il contenuto. È simile a quando guardi una foto e noti spontaneamente dettagli come forme, colori e bordi. Il modello fa qualcosa di analogo utilizzando una rete neurale profonda chiamata "backbone" (spesso ResNet-50 o ResNet-101), che funziona come i suoi occhi per analizzare l'immagine e individuare i dettagli principali.
Poiché gli oggetti nelle immagini possono essere molto piccoli o molto grandi, Mask R-CNN utilizza una Feature Pyramid Network. È come avere diverse lenti d'ingrandimento che consentono al modello di vedere sia i dettagli più fini sia l'immagine nel suo insieme, assicurando che vengano notati oggetti di tutte le dimensioni.
Una volta estratte le caratteristiche importanti, il modello passa a individuare i potenziali oggetti nell'immagine, preparando il terreno per l'analisi successiva.
Suggerire le potenziali aree dell'immagine contenenti oggetti#
Dopo che l'immagine è stata elaborata per estrarne le caratteristiche principali, entra in azione la Region Proposal Network. Questa parte del modello esamina l'immagine e suggerisce le aree che probabilmente contengono oggetti.
Lo fa generando diverse possibili posizioni degli oggetti chiamate ancore. La rete valuta quindi queste ancore e seleziona quelle più promettenti per l'analisi successiva. In questo modo, il modello si concentra solo sulle aree con maggiori probabilità di essere interessanti, invece di controllare ogni singolo punto dell'immagine.

Fig. 3. Un esempio di Region Proposal Network.
Migliorare le caratteristiche estratte#
Dopo aver identificato le aree principali, il passaggio successivo consiste nel perfezionare i dettagli estratti da queste regioni. I modelli precedenti utilizzavano un metodo chiamato ROI Pooling (pooling delle regioni di interesse) per estrarre le caratteristiche da ogni area, ma questa tecnica talvolta causava lievi disallineamenti durante il ridimensionamento delle regioni, risultando meno efficace, soprattutto con oggetti più piccoli o sovrapposti.
Mask R-CNN migliora questo approccio utilizzando una tecnica chiamata ROI Align (allineamento delle regioni di interesse). Invece di arrotondare le coordinate come fa ROI Pooling, ROI Align utilizza l'interpolazione bilineare per stimare i valori dei pixel con maggiore precisione. L'interpolazione bilineare è un metodo che calcola il valore di un nuovo pixel facendo la media dei valori dei suoi quattro vicini più prossimi, creando transizioni più uniformi. In questo modo le caratteristiche restano correttamente allineate con l'immagine originale, producendo un rilevamento e una segmentazione degli oggetti più accurati.
Ad esempio, durante una partita di calcio, due giocatori vicini potrebbero essere scambiati l'uno per l'altro perché i loro riquadri di delimitazione si sovrappongono. ROI Align aiuta a separarli mantenendo distintive le loro forme.

Fig. 4. Mask R-CNN utilizza ROI Align.
Classificare gli oggetti e prevederne le maschere#
Dopo che ROI Align ha elaborato l'immagine, il passaggio successivo consiste nel classificare gli oggetti e perfezionarne le posizioni. Il modello esamina ogni regione estratta e determina quale oggetto contiene. Assegna un punteggio di probabilità alle diverse categorie e seleziona la corrispondenza migliore.
Contemporaneamente, regola i riquadri di delimitazione per adattarli meglio agli oggetti. I riquadri iniziali potrebbero non essere posizionati in modo ideale; questa operazione contribuisce quindi a migliorare la precisione, assicurando che ogni riquadro circondi strettamente l'oggetto rilevato.
Infine, Mask R-CNN compie un ulteriore passaggio: genera in parallelo una maschera di segmentazione dettagliata per ogni oggetto.
Mask R-CNN e le sue applicazioni in tempo reale#
Quando questo modello è stato introdotto, ha suscitato grande entusiasmo nella comunità dell'IA e presto è stato utilizzato in diverse applicazioni. La sua capacità di rilevare e segmentare gli oggetti in tempo reale ha rappresentato una svolta in vari settori.
Ad esempio, monitorare gli animali in via di estinzione in natura è un'attività impegnativa. Molte specie si muovono in foreste fitte, rendendo difficile per gli ambientalisti tenerne traccia. I metodi tradizionali utilizzano fototrappole, droni e immagini satellitari, ma esaminare manualmente tutti questi dati richiede molto tempo. Le identificazioni errate e gli avvistamenti mancati possono rallentare gli sforzi di conservazione.
Riconoscendo caratteristiche uniche come le strisce delle tigri, le macchie delle giraffe o la forma delle orecchie degli elefanti, Mask R-CNN può rilevare e segmentare gli animali in immagini e video con maggiore precisione. Anche quando gli animali sono parzialmente nascosti dagli alberi o si trovano vicini, il modello può separarli e identificarli individualmente, rendendo il monitoraggio della fauna selvatica più rapido e affidabile.

Fig. 5. Rilevamento e segmentazione degli animali con Mask R-CNN.
Limiti di Mask R-CNN#
Nonostante la sua importanza storica nel rilevamento e nella segmentazione degli oggetti, Mask R-CNN presenta anche alcuni svantaggi significativi. Ecco alcune difficoltà associate a Mask R-CNN:
- Elevato fabbisogno computazionale: dipende da GPU potenti, il che può rendere costosa l'esecuzione e rallentare l'elaborazione di grandi quantità di dati.
- Velocità di elaborazione inferiore: il suo processo articolato in più fasi lo rende più lento rispetto a modelli in tempo reale più veloci come YOLO, che potrebbero quindi non essere ideali per le attività sensibili al fattore tempo.
- Dipendenza da dati di alta qualità: il modello offre le prestazioni migliori con immagini nitide e correttamente etichettate. Immagini sfocate o scarsamente illuminate possono ridurne significativamente la precisione.
- Implementazione complessa: l'architettura a più fasi può essere difficile da configurare e ottimizzare, soprattutto quando si lavora con dataset di grandi dimensioni o risorse limitate.
Da Mask R-CNN a Ultralytics YOLO11#
Mask R-CNN era efficace per le attività di segmentazione, ma molti settori cercavano di adottare la computer vision dando priorità alla velocità e alle prestazioni in tempo reale. Questa esigenza ha portato i ricercatori a sviluppare modelli a singola fase che rilevano gli oggetti in un unico passaggio, migliorando notevolmente l'efficienza.
A differenza del processo a più fasi di Mask R-CNN, i modelli di computer vision a singola fase come YOLO (You Only Look Once) si concentrano sulle attività di computer vision in tempo reale. Invece di gestire separatamente il rilevamento e la segmentazione, i modelli YOLO possono analizzare un'immagine in un'unica volta. Questo li rende ideali per applicazioni come la guida autonoma, la sanità, la produzione e la robotica, dove è fondamentale prendere decisioni rapidamente.
In particolare, Ultralytics YOLO11 fa un ulteriore passo avanti, combinando velocità e precisione. Utilizza il 22% di parametri in meno rispetto a YOLOv8m, ma raggiunge comunque una precisione media media (mAP) superiore sul dataset COCO, rilevando quindi gli oggetti con maggiore precisione. La sua velocità di elaborazione migliorata lo rende una scelta valida per le applicazioni in tempo reale, dove ogni millisecondo conta.

Fig. 6. Prestazioni di YOLO11 a confronto con altri modelli.
Punti chiave#
Ripercorrendo la storia della computer vision, Mask R-CNN è riconosciuto come una svolta importante nel rilevamento e nella segmentazione degli oggetti. Offre risultati estremamente precisi anche in contesti complessi, grazie al suo processo dettagliato in più fasi.
Tuttavia, questo stesso processo lo rende più lento rispetto ai modelli in tempo reale come YOLO. Con la crescente necessità di velocità ed efficienza, molte applicazioni utilizzano oggi modelli a singola fase come Ultralytics YOLO11, che offrono un rilevamento degli oggetti rapido e accurato. Sebbene Mask R-CNN sia importante per comprendere l'evoluzione della computer vision, la tendenza verso le soluzioni in tempo reale evidenzia la crescente domanda di soluzioni di computer vision più rapide ed efficienti.
Unisciti alla nostra community in crescita! Esplora il nostro repository GitHub per saperne di più sull'IA. Vuoi iniziare i tuoi progetti di computer vision? Dai un'occhiata alle nostre opzioni di licenza. Scopri l'IA in agricoltura e la computer vision nell'assistenza sanitaria visitando le nostre pagine dedicate alle soluzioni!









