Ultralytics YOLO27:
AI per la visione

Alla scoperta di SAM 3: il nuovo Segment Anything Model di Meta AI

Scopri come SAM 3, il nuovo Segment Anything Model di Meta AI, facilita il rilevamento, la segmentazione e il tracciamento degli oggetti in immagini e video del mondo reale.

ABAbirami Vina12 min read
Il Segment Anything Model SAM 3 di Meta AI

Il 19 novembre 2025, Meta AI ha rilasciato Segment Anything Model 3, noto anche come SAM 3. Questa versione più recente del Segment Anything Model introduce nuovi modi per rilevare, segmentare e tracciare oggetti in immagini e video del mondo reale utilizzando prompt testuali, prompt visivi ed esempi di immagini.

Il modello SAM 3 si basa su SAM e SAM 2 e introduce nuovi progressi e funzionalità, come la segmentazione per concetti, il rilevamento a vocabolario aperto e il tracking video in tempo reale. È in grado di comprendere brevi sintagmi nominali, seguire gli oggetti tra i fotogrammi e identificare concetti dettagliati o rari che i modelli precedenti non riuscivano a gestire con la stessa affidabilità.

Come parte del rilascio di SAM 3, Meta ha introdotto anche SAM 3D. Questa suite di modelli di nuova generazione ricostruisce oggetti, scene e corpi umani completi a partire da una singola immagine, estendendo l'ecosistema Segment Anything alla comprensione 3D. Queste aggiunte aprono nuove applicazioni nella computer vision, nella robotica, nell'editing multimediale e nei flussi di lavoro creativi.

In questo articolo esploreremo cos'è SAM 3, cosa lo distingue da SAM 2, come funziona il modello e quali sono le sue applicazioni nel mondo reale. Iniziamo!

Cos'è SAM 3? Uno sguardo al Segment Anything Model 3 di Meta#

SAM 3 è un modello di computer vision all'avanguardia in grado di identificare, separare e tracciare oggetti in immagini e video sulla base di semplici istruzioni. Invece di affidarsi a un elenco fisso di etichette, SAM 3 comprende il linguaggio naturale e gli indizi visivi, rendendo semplice indicare al modello cosa vuoi trovare.

Ad esempio, con SAM 3 puoi digitare una breve frase come “yellow school bus” o “a striped cat”, fare clic su un oggetto oppure evidenziare un esempio in un'immagine. Il modello rileverà quindi ogni oggetto corrispondente e genererà maschere di segmentazione precise (un contorno visivo che mostra esattamente quali pixel appartengono a un oggetto). SAM 3 può anche seguire questi oggetti tra i fotogrammi video, mantenendone la coerenza mentre si muovono.

SAM 3D abilita la ricostruzione 3D da una singola immagine#

Un'altra parte interessante dell'annuncio di Meta AI è SAM 3D, che estende il progetto Segment Anything alla comprensione 3D. SAM 3D può acquisire una singola immagine 2D e ricostruire la forma, la posa o la struttura di un oggetto o di un corpo umano in tre dimensioni. In altre parole, il modello può stimare come qualcosa occupa lo spazio anche quando è disponibile un solo punto di vista.

SAM 3D è stato rilasciato come due modelli distinti: SAM 3D Objects, che ricostruisce oggetti di uso quotidiano con geometria e texture, e SAM 3D Body, che stima la forma e la posa del corpo umano a partire da una singola immagine. Entrambi i modelli utilizzano l'output di segmentazione di SAM 3 e generano quindi una rappresentazione 3D allineata all'aspetto e alla posizione dell'oggetto nella foto originale.

Un esempio di utilizzo di SAM 3D

Fig. 1. Un esempio di utilizzo di SAM 3D. (Fonte: creato utilizzando il playground segment anything di Meta AI)

SAM 3: nuove funzionalità per unificare rilevamento, segmentazione e tracking#

Ecco alcuni degli aggiornamenti principali introdotti da SAM 3 per riunire rilevamento, segmentazione e tracking in un unico modello unificato:

  • Attività di segmentazione per concetti: In SAM e SAM 2, la segmentazione degli oggetti dipendeva da prompt visivi come clic o riquadri. SAM 3 aggiunge la possibilità di segmentare gli oggetti sulla base di una breve frase di testo o di un ritaglio di esempio dell'immagine. Ciò significa che il modello può identificare tutte le istanze corrispondenti senza richiedere un clic per ciascuna.
  • Prompt testuali a vocabolario aperto: A differenza delle versioni precedenti, SAM 3 può interpretare brevi frasi in linguaggio naturale. Questo elimina la necessità di un elenco fisso di etichette e consente al modello di lavorare con concetti più specifici o meno comuni.
  • Un unico modello per rilevamento, segmentazione e tracking: SAM 3 unifica rilevamento, segmentazione e tracking in un solo modello, eliminando la necessità di sistemi separati per trovare gli oggetti, generare maschere di segmentazione e seguirli tra i fotogrammi video. Il risultato è un flusso di lavoro più coerente e lineare per immagini e video; sebbene anche SAM 2 offrisse alcune funzionalità di tracking, SAM 3 garantisce prestazioni significativamente più elevate e affidabili.
  • Risultati più stabili nelle scene complesse: Poiché SAM 3 può combinare testo, immagini di esempio e prompt visivi, gestisce le scene affollate o ripetitive in modo più affidabile rispetto alle versioni precedenti, che si basavano esclusivamente sui clic visivi.

Segmentazione per concetti di SAM 3 con testo o esempi di immagini

Fig. 2. SAM 3 introduce la segmentazione per concetti con testo o esempi di immagini. (Fonte)

Confronto tra SAM 3, SAM 2 e SAM 1#

Immagina di guardare un video di un safari con molti animali diversi e di voler rilevare e segmentare solo gli elefanti. Come si svolgerebbe questa attività nelle diverse versioni di SAM?

Con SAM dovresti fare manualmente clic su ogni elefante in ogni fotogramma per generare una maschera di segmentazione. Non è disponibile il tracking, quindi ogni nuovo fotogramma richiede nuovi clic.

Con SAM 2 potresti fare clic una volta su un elefante, ottenere la relativa maschera e lasciare che il modello segua lo stesso elefante nel video. Tuttavia, dovresti comunque fornire clic separati se volessi segmentare più elefanti (oggetti specifici), perché SAM 2 non comprende autonomamente categorie come “elephant”.

Con SAM 3, il flusso di lavoro diventa molto più semplice. Puoi digitare “elephant” oppure disegnare un riquadro di delimitazione intorno a un singolo elefante come esempio, e il modello troverà automaticamente ogni elefante nel video, li segmenterà e li seguirà in modo coerente tra i fotogrammi. Supporta ancora i prompt basati su clic e riquadri utilizzati nelle versioni precedenti, ma ora può anche rispondere a prompt testuali e immagini esemplificative, cosa che SAM e SAM 2 non potevano fare.

Come funziona il modello SAM 3#

Ora esaminiamo più da vicino come funziona il modello SAM 3 e come è stato addestrato.

Panoramica dell'architettura del modello SAM 3#

SAM 3 riunisce diversi componenti per supportare prompt concettuali e prompt visivi in un unico sistema. Al centro del modello si trova il Meta Perception Encoder, l'encoder open source unificato di immagini e testo di Meta.

Questo encoder può elaborare sia immagini sia brevi sintagmi nominali. In parole semplici, ciò consente a SAM 3 di collegare le caratteristiche linguistiche e visive in modo più efficace rispetto alle versioni precedenti del Segment Anything Model.

Oltre a questo encoder, SAM 3 include un rilevatore basato sulla famiglia di modelli Transformer DETR. Questo rilevatore identifica gli oggetti nell'immagine e aiuta il sistema a determinare quali corrispondono al prompt dell'utente.

In particolare, per la segmentazione video, SAM 3 utilizza un componente di tracking che si basa sul memory bank e sul memory encoder di SAM 2. Ciò consente al modello di conservare informazioni sugli oggetti tra i fotogrammi, così da poterli reidentificare e seguire nel tempo.

Come funziona la segmentazione di qualsiasi elemento tramite concetti

Fig. 3. Come funziona la segmentazione di qualsiasi elemento tramite concetti (Fonte: scontent)

Il motore di dati scalabile alla base del Segment Anything Model 3#

Per addestrare SAM 3, Meta aveva bisogno di molti più dati annotati di quelli attualmente disponibili su Internet. Le maschere di segmentazione e le etichette testuali di alta qualità sono difficili da creare su larga scala, mentre delineare completamente ogni istanza di un concetto nelle immagini e nei video è lento e costoso.

Per risolvere questo problema, Meta ha creato un nuovo motore di dati che combina SAM 3 stesso, ulteriori modelli di AI e annotatori umani che lavorano insieme. Il flusso di lavoro inizia con una pipeline di sistemi di AI, tra cui SAM 3 e un modello di captioning basato su Llama.

Questi sistemi analizzano grandi raccolte di immagini e video, generano didascalie, convertono tali didascalie in etichette testuali e producono le prime candidate per le maschere di segmentazione. Gli annotatori umani e quelli basati sull'AI esaminano quindi queste candidate.

Gli annotatori basati sull'AI, addestrati per raggiungere o persino superare l'accuratezza umana in attività come il controllo della qualità delle maschere e la verifica della copertura dei concetti, filtrano i casi semplici. Gli esseri umani intervengono solo per gli esempi più complessi, in cui il modello può avere ancora difficoltà.

Motore di dati di SAM 3

Fig. 4. Motore di dati di SAM 3 (Fonte)

Questo approccio offre a Meta un notevole incremento nella velocità di annotazione. Affidando i casi semplici agli annotatori basati sull'AI, la pipeline diventa circa cinque volte più veloce con i prompt negativi e il 36% più veloce con i prompt positivi nei domini dettagliati.

Questa efficienza ha reso possibile portare il dataset a oltre quattro milioni di concetti unici. Il ciclo continuo di proposte dell'AI, correzioni umane e previsioni aggiornate del modello migliora inoltre la qualità delle etichette nel tempo e aiuta SAM 3 ad apprendere un insieme molto più ampio di concetti visivi e testuali.

I miglioramenti delle prestazioni di SAM 3#

Per quanto riguarda le prestazioni, SAM 3 offre un miglioramento evidente rispetto ai modelli precedenti. Sul nuovo benchmark SA-Co di Meta, che valuta il rilevamento e la segmentazione di concetti a vocabolario aperto, SAM 3 raggiunge prestazioni circa doppie rispetto ai sistemi precedenti, sia nelle immagini sia nei video.

Inoltre, eguaglia o supera SAM 2 nelle attività visive interattive, come point-to-mask e mask-to-masklet. Meta segnala ulteriori miglioramenti in valutazioni più difficili, come LVIS zero-shot (in cui i modelli devono riconoscere categorie rare senza esempi di addestramento) e il conteggio degli oggetti (che misura se tutte le istanze di un oggetto vengono rilevate), evidenziando una generalizzazione più efficace tra i domini.

Oltre a questi miglioramenti in termini di accuratezza, SAM 3 è efficiente: elabora un'immagine con più di 100 oggetti rilevati in circa 30 millisecondi su una GPU H200 e mantiene velocità quasi in tempo reale durante il tracking di più oggetti nei video.

Applicazioni del Segment Anything Model 3#

Ora che abbiamo compreso meglio SAM 3, vediamo come viene utilizzato nelle applicazioni reali, dal ragionamento avanzato guidato dal testo alla ricerca scientifica e ai prodotti di Meta.

Gestire query testuali complesse con SAM 3 Agent#

SAM 3 può essere utilizzato anche come strumento all'interno di un modello linguistico multimodale più ampio, che Meta chiama SAM 3 Agent. Invece di fornire a SAM 3 una breve frase come “elephant”, l'agente può scomporre una domanda più complessa in prompt più piccoli che SAM 3 comprende.

Ad esempio, se l'utente chiede “What object in the picture is used for controlling and guiding a horse?”, l'agente prova diversi sintagmi nominali, li invia a SAM 3 e verifica quali maschere sono plausibili. Continua a perfezionare la ricerca finché non trova l'oggetto corretto.

Anche senza essere stato addestrato su dataset specializzati per il ragionamento, SAM 3 Agent offre buone prestazioni nei benchmark progettati per query testuali complesse, come ReasonSeg e OmniLabel. Ciò dimostra che SAM 3 può supportare sistemi che richiedono sia comprensione del linguaggio sia segmentazione visiva dettagliata.

Applicazioni scientifiche e di conservazione di SAM 3#

È interessante notare che SAM 3 viene già utilizzato in contesti di ricerca in cui le etichette visive dettagliate sono importanti. Meta ha collaborato con Conservation X Labs e Osa Conservation per creare SA-FARI, un dataset pubblico per il monitoraggio della fauna selvatica con oltre 10.000 video acquisiti da fototrappole.

Ogni animale in ogni fotogramma è etichettato con riquadri e maschere di segmentazione, un'attività che richiederebbe moltissimo tempo se svolta manualmente. Analogamente, nella ricerca oceanografica, SAM 3 viene utilizzato insieme a FathomNet e MBARI per creare maschere di segmentazione delle istanze per le immagini subacquee e supportare nuovi benchmark di valutazione.

Questi dataset aiutano gli scienziati ad analizzare i filmati in modo più efficiente e a studiare animali e habitat che sono solitamente difficili da monitorare su larga scala. I ricercatori possono inoltre utilizzare queste risorse per creare i propri modelli di identificazione delle specie, analisi del comportamento e monitoraggio ecologico automatizzato.

Come Meta sta implementando SAM 3 nei suoi prodotti#

Oltre agli utilizzi nella ricerca, SAM 3 alimenta anche nuove funzionalità e casi d'uso nei prodotti consumer di Meta. Ecco una panoramica di alcuni dei modi in cui è già stato integrato:

  • Modifiche su Instagram: i creator possono applicare effetti a una persona o a un oggetto specifico in un video senza intervenire manualmente fotogramma per fotogramma.
  • App Meta AI e meta.ai sul web: SAM 3 supporta nuovi strumenti per modificare, migliorare e remixare immagini e video.
  • “View in Room” di Facebook Marketplace: SAM 3 funziona con SAM 3D per consentire alle persone di visualizzare in anteprima mobili o decorazioni nelle proprie case utilizzando una singola foto.
  • Occhiali per la ricerca Aria Gen 2: il Segment Anything Model 3 aiuta a segmentare e tracciare mani e oggetti da una prospettiva in prima persona, supportando la ricerca sulla realtà aumentata (AR), sulla robotica e sull'AI contestuale.

Punti chiave#

SAM 3 rappresenta un importante passo avanti per la segmentazione. Introduce la segmentazione per concetti, prompt testuali a vocabolario aperto e un tracking migliorato. Grazie a prestazioni sensibilmente superiori sia nelle immagini sia nei video, e all'aggiunta di SAM 3D, la suite di modelli apre nuove possibilità per la vision AI, gli strumenti creativi, la ricerca scientifica e i prodotti del mondo reale.

Unisciti alla nostra community ed esplora il nostro repository GitHub per scoprire di più sull'AI. Se vuoi creare il tuo progetto di vision AI, consulta le nostre opzioni di licenza. Scopri di più su applicazioni come l'AI nel settore sanitario e la Vision AI nel commercio al dettaglio visitando le nostre pagine dedicate alle soluzioni.

Explore solutions

Visione artificiale per immagini aeree

Visione artificiale per immagini aeree

Traduci immagini di droni e aeree in informazioni in tempo reale per agricoltura, acquacoltura, monitoraggio ambientale, conservazione e analisi geospaziale con Ultralytics YOLO.
Scopri di più
Computer vision nel settore aerospaziale

Computer vision nel settore aerospaziale

Porta la visione artificiale al monitoraggio aereo con i modelli Ultralytics YOLO. Potenzia droni, flussi di lavoro aerospaziali, conservazione ambientale e industrie geospaziali con soluzioni di computer vision.
Scopri di più

Proteggi ogni sito con i modelli Ultralytics YOLO. La visione artificiale alimenta il monitoraggio del perimetro, il rilevamento delle minacce, il riconoscimento delle targhe e la sicurezza sul lavoro.
Scopri di più
Computer vision nella robotica

Computer vision nella robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica abilita la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Computer vision nella logistica

Computer vision nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza nei magazzini in tempo reale.
Scopri di più
Computer vision nel commercio al dettaglio

Computer vision nel commercio al dettaglio

Reinventa il commercio al dettaglio con i modelli Ultralytics YOLO. La Vision AI potenzia il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e analisi più intelligenti dei clienti.
Scopri di più
Computer vision nel settore sanitario

Computer vision nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La Vision AI nel settore sanitario abilita imaging medico più rapido, diagnosi più intelligenti e monitoraggio dei pazienti.
Scopri di più
Computer vision nella produzione

Computer vision nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI supporta il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione delle linee di assemblaggio.
Scopri di più
Computer vision nel settore automobilistico

Computer vision nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, i sistemi di assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Computer vision in agricoltura

Computer vision in agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Abilita il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per raccolti più abbondanti e intelligenti.
Scopri di più
Visione artificiale per immagini aeree

Visione artificiale per immagini aeree

Traduci immagini di droni e aeree in informazioni in tempo reale per agricoltura, acquacoltura, monitoraggio ambientale, conservazione e analisi geospaziale con Ultralytics YOLO.
Scopri di più
Computer vision nel settore aerospaziale

Computer vision nel settore aerospaziale

Porta la visione artificiale al monitoraggio aereo con i modelli Ultralytics YOLO. Potenzia droni, flussi di lavoro aerospaziali, conservazione ambientale e industrie geospaziali con soluzioni di computer vision.
Scopri di più

Proteggi ogni sito con i modelli Ultralytics YOLO. La visione artificiale alimenta il monitoraggio del perimetro, il rilevamento delle minacce, il riconoscimento delle targhe e la sicurezza sul lavoro.
Scopri di più
Computer vision nella robotica

Computer vision nella robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica abilita la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Computer vision nella logistica

Computer vision nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza nei magazzini in tempo reale.
Scopri di più
Computer vision nel commercio al dettaglio

Computer vision nel commercio al dettaglio

Reinventa il commercio al dettaglio con i modelli Ultralytics YOLO. La Vision AI potenzia il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e analisi più intelligenti dei clienti.
Scopri di più
Computer vision nel settore sanitario

Computer vision nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La Vision AI nel settore sanitario abilita imaging medico più rapido, diagnosi più intelligenti e monitoraggio dei pazienti.
Scopri di più
Computer vision nella produzione

Computer vision nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI supporta il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione delle linee di assemblaggio.
Scopri di più
Computer vision nel settore automobilistico

Computer vision nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, i sistemi di assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Computer vision in agricoltura

Computer vision in agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Abilita il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per raccolti più abbondanti e intelligenti.
Scopri di più
Visione artificiale per immagini aeree

Visione artificiale per immagini aeree

Traduci immagini di droni e aeree in informazioni in tempo reale per agricoltura, acquacoltura, monitoraggio ambientale, conservazione e analisi geospaziale con Ultralytics YOLO.
Scopri di più
Computer vision nel settore aerospaziale

Computer vision nel settore aerospaziale

Porta la visione artificiale al monitoraggio aereo con i modelli Ultralytics YOLO. Potenzia droni, flussi di lavoro aerospaziali, conservazione ambientale e industrie geospaziali con soluzioni di computer vision.
Scopri di più

Proteggi ogni sito con i modelli Ultralytics YOLO. La visione artificiale alimenta il monitoraggio del perimetro, il rilevamento delle minacce, il riconoscimento delle targhe e la sicurezza sul lavoro.
Scopri di più
Computer vision nella robotica

Computer vision nella robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica abilita la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Computer vision nella logistica

Computer vision nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza nei magazzini in tempo reale.
Scopri di più
Computer vision nel commercio al dettaglio

Computer vision nel commercio al dettaglio

Reinventa il commercio al dettaglio con i modelli Ultralytics YOLO. La Vision AI potenzia il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e analisi più intelligenti dei clienti.
Scopri di più
Computer vision nel settore sanitario

Computer vision nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La Vision AI nel settore sanitario abilita imaging medico più rapido, diagnosi più intelligenti e monitoraggio dei pazienti.
Scopri di più
Computer vision nella produzione

Computer vision nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI supporta il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione delle linee di assemblaggio.
Scopri di più
Computer vision nel settore automobilistico

Computer vision nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, i sistemi di assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Computer vision in agricoltura

Computer vision in agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Abilita il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per raccolti più abbondanti e intelligenti.
Scopri di più

Costruiamo insieme il futuro dell'AI!

Inizia il tuo percorso verso il futuro del machine learning