Applicazioni di Segment Anything Model 2 (SAM 2) di Meta AI
Scopri con noi Segment Anything Model 2 (SAM 2) di Meta AI e comprendi per quali applicazioni in tempo reale può essere utilizzato nei diversi settori.

Il 29 luglio 2024, Meta AI ha rilasciato la seconda versione del suo Modello Segment Anything, SAM 2. Il nuovo modello è in grado di individuare quali pixel appartengono a un oggetto target sia nelle immagini che nei video! L'aspetto migliore è che il modello riesce a seguire costantemente un oggetto attraverso tutti i fotogrammi di un video in tempo reale. SAM 2 apre possibilità interessanti per il montaggio video, le esperienze di realtà mista e l'annotazione più rapida dei dati visivi per l'addestramento di sistemi di visione artificiale.
Basandosi sul successo del SAM originale, utilizzato in ambiti come la scienza marina, le immagini satellitari e la medicina, SAM 2 affronta sfide come gli oggetti in rapido movimento e i cambiamenti nell'aspetto. La sua maggiore accuratezza ed efficienza lo rendono uno strumento versatile per un'ampia gamma di applicazioni. In questo articolo ci concentreremo su dove è possibile applicare SAM 2 e sul perché sia importante per la comunità dell'AI.
Che cos'è SAM 2?#
Il Modello Segment Anything 2 è un foundation model avanzato che supporta la segmentazione visiva basata su prompt, o PVS, sia nelle immagini che nei video. La PVS è una tecnica in cui un modello può segmentare o identificare diverse parti di un'immagine o di un video in base a prompt o input specifici forniti dall'utente. Questi prompt possono assumere la forma di clic, riquadri o maschere che evidenziano l'area di interesse. Il modello genera quindi una maschera di segmentazione che delinea l'area specificata.
L'architettura di SAM 2 si basa sul SAM originale, estendendo la segmentazione delle immagini per includere anche quella dei video. Include un decoder di maschere leggero che utilizza dati delle immagini e prompt per creare maschere di segmentazione. Per i video, SAM 2 introduce un sistema di memoria che lo aiuta a ricordare le informazioni dei fotogrammi precedenti, garantendo un tracciamento accurato nel tempo. Il sistema di memoria include componenti che memorizzano e recuperano i dettagli sugli oggetti segmentati. SAM 2 è inoltre in grado di gestire le occlusioni, tracciare gli oggetti attraverso più fotogrammi e gestire prompt ambigui generando diverse maschere possibili. L'architettura avanzata di SAM 2 lo rende altamente efficace in ambienti visivi statici e dinamici.
In particolare, per quanto riguarda la segmentazione video, SAM 2 raggiunge una maggiore accuratezza con un numero di interazioni dell'utente tre volte inferiore rispetto ai metodi precedenti. Per la segmentazione delle immagini, SAM 2 supera il Modello Segment Anything (SAM) originale, essendo sei volte più veloce e accurato. Questo miglioramento è stato illustrato nell'articolo di ricerca su SAM 2 attraverso 37 diversi dataset, inclusi 23 su cui SAM era già stato testato.

Fig. 1. Confronto tra SAM e SAM 2.
È interessante notare che SAM 2 di Meta AI è stato sviluppato creando il più grande dataset di segmentazione video mai realizzato, il dataset SA-V. L'ampio dataset include oltre 50.000 video e 35,5 milioni di maschere di segmentazione ed è stato raccolto tramite contributi interattivi degli utenti. Gli annotatori hanno fornito prompt e correzioni per aiutare il modello ad apprendere da un'ampia varietà di scenari e tipi di oggetti.
Applicazioni del Modello Segment Anything 2#
Grazie alle sue capacità avanzate nella segmentazione di immagini e video, SAM 2 può essere utilizzato in diversi settori. Esploriamo alcune di queste applicazioni.
SAM 2 abilita la realtà aumentata (AR) e la realtà virtuale (VR)#
Il nuovo modello di segmentazione di Meta AI può essere utilizzato per applicazioni di realtà aumentata (AR) e realtà virtuale (VR). Ad esempio, SAM 2 può identificare e segmentare con precisione gli oggetti del mondo reale, rendendo più realistica l'interazione con gli oggetti virtuali. Può essere utile in vari ambiti, come i videogiochi, l'istruzione e la formazione, dove è essenziale un'interazione realistica tra elementi virtuali e reali.
Con dispositivi come gli occhiali AR sempre più avanzati, le capacità di SAM 2 potrebbero presto essere integrate al loro interno. Immagina di indossare gli occhiali e guardarti intorno nel soggiorno. Quando gli occhiali segmentano e rilevano la ciotola dell'acqua del tuo cane, potrebbero ricordarti di riempirla, come mostrato nell'immagine qui sotto. Oppure, se stai cucinando una nuova ricetta, gli occhiali potrebbero identificare gli ingredienti sul piano di lavoro e fornire istruzioni e suggerimenti passo passo, migliorando la tua esperienza in cucina e assicurandoti di avere a portata di mano tutto il necessario.

Fig. 2. SAM 2 potrebbe presto essere utilizzato negli occhiali AR.
Imaging sonar con il Modello Segment Anything 2#
La ricerca condotta utilizzando il modello SAM ha dimostrato che può essere applicato in ambiti specializzati come l'imaging sonar. L'imaging sonar presenta sfide uniche a causa della bassa risoluzione, degli elevati livelli di rumore e delle forme complesse degli oggetti nelle immagini. Attraverso il fine-tuning di SAM per le immagini sonar, i ricercatori hanno dimostrato la sua capacità di segmentare con precisione diversi oggetti sottomarini, come detriti marini, formazioni geologiche e altri elementi di interesse. Immagini sottomarine precise e affidabili possono essere utilizzate nella ricerca marina, nell'archeologia subacquea, nella gestione della pesca e nella sorveglianza per attività come la mappatura degli habitat, la scoperta di reperti e il rilevamento delle minacce.

Fig. 3. Un esempio di utilizzo di SAM sottoposto a fine-tuning per la segmentazione di immagini sonar.
Poiché SAM 2 si basa sulle numerose difficoltà affrontate da SAM e le migliora, ha il potenziale per migliorare ulteriormente l'analisi delle immagini sonar. Le sue capacità di segmentazione precisa possono supportare diverse applicazioni marine, tra cui la ricerca scientifica e la pesca. Ad esempio, SAM 2 può delineare efficacemente le strutture sottomarine, rilevare i detriti marini e identificare gli oggetti nelle immagini sonar front-looking, contribuendo a un'esplorazione e a un monitoraggio sottomarini più accurati ed efficienti.
Ecco i potenziali vantaggi dell'utilizzo di SAM 2 per analizzare le immagini sonar:
- Efficienza: riduce il tempo e lo sforzo necessari per la segmentazione manuale, consentendo ai professionisti di concentrarsi maggiormente sull'analisi e sul processo decisionale.
- Coerenza: fornisce risultati di segmentazione coerenti e riproducibili, essenziali per la ricerca e il monitoraggio marini su larga scala.
- Versatilità: è in grado di gestire un'ampia gamma di immagini sonar, risultando utile per diverse applicazioni nella scienza e nell'industria marina.
Integrando SAM 2 nei processi di imaging sonar, l'industria marina può ottenere maggiore efficienza, accuratezza e affidabilità nell'esplorazione e nell'analisi sottomarine, arrivando in definitiva a risultati migliori nella ricerca marina.
Utilizzo di SAM 2 nei veicoli autonomi#
Un'altra applicazione di SAM 2 riguarda i veicoli autonomi. SAM 2 può identificare con precisione oggetti come pedoni, altri veicoli, segnali stradali e ostacoli in tempo reale. Il livello di dettaglio che SAM 2 è in grado di fornire è essenziale per prendere decisioni di navigazione sicura e di prevenzione delle collisioni. Elaborando con precisione i dati visivi, SAM 2 contribuisce a creare una mappa dettagliata e affidabile dell'ambiente, favorendo decisioni migliori.

Fig. 4. Utilizzo della segmentazione per comprendere il traffico.
La capacità di SAM 2 di funzionare bene in diverse condizioni di illuminazione, con cambiamenti meteorologici e in ambienti dinamici lo rende affidabile per i veicoli autonomi. Che si tratti di una strada urbana trafficata o di un'autostrada nebbiosa, SAM 2 è in grado di identificare e segmentare costantemente gli oggetti con precisione, permettendo al veicolo di reagire correttamente alle diverse situazioni.
Tuttavia, è importante tenere presenti alcune limitazioni. Nel caso di oggetti complessi e in rapido movimento, SAM 2 può talvolta perdere i dettagli più fini e le sue previsioni possono diventare instabili tra i fotogrammi. Inoltre, SAM 2 può confondere talvolta diversi oggetti dall'aspetto simile nelle scene affollate. Queste difficoltà spiegano perché l'integrazione di sensori e tecnologie aggiuntivi sia fondamentale nelle applicazioni di guida autonoma.
Monitoraggio ambientale con l'aiuto di SAM 2#
Il monitoraggio ambientale tramite visione artificiale può essere complesso, soprattutto quando mancano dati annotati, ma è proprio questo a renderlo un'interessante applicazione per SAM 2. SAM 2 può essere utilizzato per monitorare e analizzare i cambiamenti nei paesaggi naturali segmentando e identificando con precisione diverse caratteristiche ambientali, come foreste, corpi idrici, aree urbane e terreni agricoli, a partire da immagini satellitari o riprese da droni. In particolare, una segmentazione precisa aiuta a monitorare la deforestazione, l'urbanizzazione e i cambiamenti nell'uso del suolo nel tempo, fornendo dati preziosi per la conservazione ambientale e la pianificazione.

Ecco alcuni dei vantaggi dell'utilizzo di un modello come SAM 2 per analizzare i cambiamenti ambientali nel tempo:
- Rilevamento precoce: identifica i primi segnali di degrado ambientale, consentendo interventi tempestivi per prevenire ulteriori danni.
- Gestione delle risorse: aiuta a gestire in modo efficiente le risorse naturali fornendo informazioni dettagliate sullo stato delle diverse caratteristiche ambientali.
- Conservazione della biodiversità: aiuta a monitorare la fauna selvatica e la biodiversità, contribuendo agli sforzi di conservazione e alla protezione delle specie in pericolo.
- Risposta alle catastrofi: contribuisce a valutare l'impatto di disastri naturali come alluvioni, incendi boschivi e uragani, consentendo una risposta rapida ed efficace alle catastrofi e la pianificazione della ripresa.
Montaggio video con SAM 2: provalo tu stesso#
La demo di Segment Anything 2 è un ottimo modo per provare il modello su un video. Utilizzando le capacità PVS di SAM 2, abbiamo preso un vecchio video di Ultralytics su YouTube e siamo riusciti a segmentare tre oggetti o persone nel video e a pixelarli. Tradizionalmente, modificare un video per rimuovere tre persone in questo modo richiederebbe molto tempo e sarebbe noioso, oltre a richiedere la creazione manuale di maschere fotogramma per fotogramma. SAM 2 semplifica però questo processo. Con pochi clic nella demo, puoi proteggere l'identità di tre oggetti di interesse in pochi secondi.

Fig. 6. Prova della demo di SAM 2.
La demo ti consente anche di provare diversi effetti visivi, come mettere sotto i riflettori gli oggetti selezionati per il tracciamento e cancellare gli oggetti tracciati. Se la demo ti è piaciuta e sei pronto a iniziare a innovare con SAM 2, consulta la pagina della documentazione del modello SAM 2 di Ultralytics per istruzioni dettagliate su come provare concretamente il modello. Esplora le funzionalità, i passaggi di installazione e gli esempi per sfruttare appieno il potenziale di SAM 2 nei tuoi progetti!
Conclusioni#
Il Modello Segment Anything 2 di Meta AI (SAM 2) sta trasformando la segmentazione di video e immagini. Con il miglioramento di attività come il tracciamento degli oggetti, stiamo scoprendo nuove opportunità nel montaggio video, nella realtà mista, nella ricerca scientifica e nell'imaging medico. Semplificando le attività complesse e velocizzando le annotazioni, SAM 2 si prepara a diventare uno strumento importante per la comunità dell'AI. Continuando a esplorare e innovare con modelli come SAM 2, possiamo aspettarci applicazioni e progressi ancora più rivoluzionari in diversi ambiti!
Scopri di più sull'AI esplorando il nostro repository GitHub e unendoti alla nostra community. Consulta le nostre pagine sulle soluzioni per approfondire l'AI nella produzione e nell'assistenza sanitaria. 🚀









