Ultralytics YOLO27:
AI per la visione

Aggiornamenti della ricerca sull’AI di Meta FAIR: SAM 2.1 e CoTracker3

Esplora gli ultimi modelli di AI di Meta FAIR, SAM 2.1 e CoTracker3, che offrono funzionalità avanzate di segmentazione e tracking per diverse applicazioni nel mondo reale.

ABAbirami Vina9 min read
Ricerca sull’AI di Meta FAIR: SAM 2.1 e CoTracker3

L'intelligenza artificiale (AI) è un campo di ricerca che recentemente ha suscitato grande entusiasmo ed energia, con nuove innovazioni e scoperte che emergono più rapidamente che mai. Nelle ultime settimane, il team Fundamental AI Research (FAIR) di Meta ha presentato una serie di strumenti e modelli pensati per affrontare sfide in diverse aree dell'AI. Questi rilasci includono aggiornamenti che potrebbero avere un impatto su settori tanto diversi quanto la sanità, la robotica e la realtà aumentata.

Ad esempio, il modello SAM 2.1 aggiornato migliora la segmentazione degli oggetti, semplificando l'identificazione e la separazione accurata degli oggetti nelle immagini e nei video. Nel frattempo, CoTracker3 si concentra sul tracking dei punti, aiutando a seguire i punti nei fotogrammi video anche quando gli oggetti si muovono o vengono parzialmente occlusi.

Meta ha inoltre introdotto versioni più leggere e veloci del suo modello linguistico Llama per un efficiente utilizzo sul dispositivo, insieme a una nuova tecnologia di rilevamento tattile per la robotica. In questo articolo analizzeremo questi ultimi rilasci di Meta FAIR, esaminando ciò che offre ciascuno strumento. Iniziamo!

Il Segment Anything Model potenziato di Meta: SAM 2.1#

La segmentazione degli oggetti, un'attività fondamentale di computer vision, consente di identificare e separare oggetti distinti all'interno di un'immagine o di un video, semplificando l'analisi di specifiche aree di interesse. Dal suo rilascio, il Segment Anything Model 2 (SAM 2) di Meta è stato utilizzato per la segmentazione degli oggetti in diversi ambiti, come l'imaging medico e la meteorologia. Sulla base dei feedback della community, Meta ha ora introdotto SAM 2.1, una versione migliorata progettata per affrontare alcune delle difficoltà riscontrate con il modello originale e offrire prestazioni complessivamente superiori.

Benchmark delle prestazioni del modello SAM 2.1

Fig. 1 Benchmark delle prestazioni del modello SAM 2.1.

SAM 2.1 include aggiornamenti per gestire meglio gli oggetti visivamente simili e più piccoli, grazie a nuove tecniche di data augmentation. Migliora inoltre il modo in cui il modello gestisce l'occlusione (quando parti di un oggetto sono nascoste alla vista), addestrandolo su sequenze video più lunghe e consentendogli di "ricordare" e riconoscere gli oggetti nel tempo, anche quando sono temporaneamente nascosti. Ad esempio, se qualcuno sta filmando un video di una persona che cammina dietro un albero, SAM 2.1 può seguire la persona quando riappare dall'altro lato, usando la memoria della posizione dell'oggetto e del suo movimento per colmare le lacune quando la visuale viene brevemente interrotta.

Insieme a questi aggiornamenti, Meta ha rilasciato la SAM 2 Developer Suite, che fornisce codice di addestramento open-source e un'infrastruttura completa per le demo, così gli sviluppatori possono eseguire il fine-tuning di SAM 2.1 con i propri dati e integrarlo in un'ampia gamma di applicazioni.

CoTracker3: il modello di tracking di Meta, con funzionalità e aggiornamenti#

Un'altra interessante attività di computer vision è il tracking dei punti. Consiste nel seguire punti o caratteristiche specifici attraverso più fotogrammi di un video. Immagina un video di un ciclista che percorre una pista: il tracking dei punti consente al modello di tenere traccia dei punti sul ciclista, come il casco o le ruote, anche se vengono nascosti per un momento da alcuni ostacoli.

Il tracking dei punti è essenziale per applicazioni come la ricostruzione 3D, la robotica e il montaggio video. I modelli tradizionali spesso si basano su configurazioni complesse e grandi dataset sintetici, il che ne limita l'efficacia negli scenari del mondo reale.

Il modello di tracking CoTracker3 di Meta affronta questi limiti semplificando l'architettura del modello. Introduce inoltre una tecnica di pseudo-labeling che consente al modello di apprendere da video reali non annotati, rendendo CoTracker3 più efficiente e scalabile per l'uso pratico.

Confronto tra CoTracker3 e altri modelli di tracking

Fig. 2 Confronto tra CoTracker3 e altri modelli di tracking.

Una delle caratteristiche che distingue CoTracker3 è la sua capacità di gestire efficacemente le occlusioni. Utilizzando la cross-track attention, una tecnica che consente al modello di condividere informazioni tra più punti tracciati, CoTracker3 può dedurre le posizioni dei punti nascosti facendo riferimento a quelli visibili. In questo modo, CoTracker3 è progettato per essere altamente efficace in ambienti dinamici, ad esempio nel seguire una persona attraverso una scena affollata.

CoTracker3 offre anche modalità online e offline. La modalità online fornisce il tracking in tempo reale, mentre quella offline può essere utilizzata per un tracking più completo lungo intere sequenze video, ideale per attività come il montaggio video o l'animazione.

Altri aggiornamenti e ricerche di Meta FAIR#

Sebbene SAM 2.1 e CoTracker3 mostrino gli ultimi progressi di Meta nella computer vision, ci sono aggiornamenti interessanti anche in altre aree dell'AI, come l'elaborazione del linguaggio naturale (NLP) e la robotica. Diamo un'occhiata ad alcuni di questi recenti sviluppi di Meta FAIR.

Spirit LM di Meta: innovazioni nell'AI e nei modelli multimodali#

Spirit LM di Meta è un nuovo modello linguistico multimodale che combina le capacità di testo e parlato, rendendo le interazioni con l'AI più naturali. A differenza dei modelli tradizionali, che gestiscono solo testo o solo parlato, Spirit LM può passare senza soluzione di continuità dall'uno all'altro.

Spirit LM è in grado di comprendere e generare il linguaggio in modo più simile a quello umano. Ad esempio, può potenziare assistenti virtuali capaci di ascoltare e rispondere sia in forma parlata sia scritta, oppure supportare strumenti di accessibilità che convertono il parlato in testo e viceversa.

Un esempio di sintesi vocale con Meta Spirit LM

Fig. 3 Un esempio di sintesi vocale con Meta Spirit LM.

Inoltre, Meta ha sviluppato tecniche per rendere più efficienti i modelli linguistici di grandi dimensioni. Una di queste, chiamata Layer Skip, contribuisce a ridurre le necessità computazionali e i costi energetici attivando solo i livelli necessari per una determinata attività. È particolarmente utile per le applicazioni sui dispositivi con memoria e potenza limitate.

Per soddisfare ulteriormente la necessità di implementare applicazioni di AI su questi dispositivi, Meta ha anche distribuito versioni quantizzate dei suoi modelli Llama. Questi modelli sono compressi per funzionare più velocemente sui dispositivi mobili senza sacrificare la precisione.

Uno sguardo al futuro dell'ottimizzazione con Meta Lingua#

Con la crescita delle dimensioni e della complessità dei modelli di AI, ottimizzare il loro processo di addestramento è diventato fondamentale. In termini di ottimizzazione, Meta ha introdotto Meta Lingua, una codebase flessibile ed efficiente che semplifica l'addestramento dei modelli linguistici di grandi dimensioni. Il design modulare di Meta Lingua consente ai ricercatori di personalizzare e ampliare rapidamente i propri esperimenti.

I ricercatori possono dedicare meno tempo alla configurazione tecnica e più tempo alla ricerca vera e propria. La codebase è inoltre leggera e facile da integrare, risultando adatta sia a piccoli esperimenti sia a progetti su larga scala. Eliminando questi ostacoli tecnici, Meta Lingua aiuta i ricercatori a progredire più rapidamente e a testare nuove idee con maggiore facilità.

Panoramica di Meta Lingua

Fig. 4 Una panoramica di Meta Lingua.

I miglioramenti di Meta nella sicurezza dell'AI#

Con l'avanzare della tecnologia del calcolo quantistico, emergono nuove sfide per la sicurezza dei dati. A differenza dei computer odierni, è probabile che i computer quantistici siano in grado di risolvere calcoli complessi molto più velocemente. Ciò significa che potrebbero potenzialmente violare i metodi di crittografia attualmente utilizzati per proteggere le informazioni sensibili. Per questo la ricerca in questo campo sta diventando sempre più importante: sviluppare nuovi modi per proteggere i dati è essenziale mentre ci prepariamo al futuro del calcolo quantistico.

Per affrontare questo problema, Meta ha sviluppato Salsa, uno strumento pensato per rafforzare la sicurezza crittografica post-quantistica. Salsa aiuta i ricercatori a testare attacchi basati sull'AI e a identificare potenziali punti deboli, consentendo loro di comprendere e affrontare meglio le vulnerabilità dei sistemi crittografici. Simulando scenari di attacco avanzati, Salsa fornisce informazioni preziose che possono guidare lo sviluppo di misure di sicurezza più solide e resilienti per l'era quantistica.

L'AI di Meta: le ultime innovazioni nella robotica#

Il lavoro più recente di Meta nella robotica si concentra sull'aiutare l'AI a interagire più naturalmente con il mondo fisico, migliorando la percezione tattile, la destrezza e la collaborazione con gli esseri umani. In particolare, Meta Digit 360 è un sensore tattile avanzato che offre ai robot una percezione raffinata del tatto. I sensori aiutano i robot a rilevare dettagli come la consistenza, la pressione e persino la forma degli oggetti. Grazie a queste informazioni, i robot possono manipolare gli oggetti con maggiore precisione, un aspetto fondamentale in settori come la sanità e la produzione.

Ecco alcune delle funzionalità principali incluse in Meta Digit 360:

  • È dotato di 18 funzionalità di rilevamento distinte, che gli consentono di acquisire un'ampia gamma di dettagli tattili.
  • Il sensore può rilevare variazioni di pressione fino a 1 millinewton, consentendo ai robot di rispondere a consistenze fini e movimenti impercettibili.
  • Include oltre 8 milioni di taxel (piccoli punti di rilevamento) distribuiti sulla superficie del polpastrello, fornendo una mappa ad alta risoluzione delle informazioni tattili.

Un'estensione di Meta Digit 360 è Meta Digit Plexus, una piattaforma che integra diversi sensori tattili su un'unica mano robotica. Questa configurazione consente ai robot di elaborare simultaneamente le informazioni tattili provenienti da più punti, in modo simile a come le mani umane raccolgono i dati sensoriali.

La piattaforma di rilevamento tattile Meta Digit Plexus

Fig. 5 Meta Digit Plexus.

Preparare il terreno per il prossimo capitolo dell'AI#

Gli ultimi aggiornamenti di Meta sull'AI, dai progressi nella computer vision con SAM 2.1 e CoTracker3 ai nuovi sviluppi nei modelli linguistici e nella robotica, mostrano come l'AI si stia spostando gradualmente dalla teoria a soluzioni pratiche e di grande impatto.

Questi strumenti sono progettati per rendere l'AI più adattabile e utile in diversi settori, aiutando in attività che vanno dalla segmentazione di immagini complesse alla comprensione del linguaggio umano, fino alla collaborazione con noi negli spazi fisici.

Dando priorità all'accessibilità e alle applicazioni nel mondo reale, Meta FAIR ci avvicina a un futuro in cui l'AI può affrontare le sfide concrete e migliorare le nostre vite quotidiane in modi significativi.

Sei curioso di scoprire l'AI? Unisciti alla nostra community per ricevere gli ultimi aggiornamenti e approfondimenti, e dai un'occhiata al nostro repository GitHub. Puoi anche esplorare come utilizzare la computer vision in settori come le auto a guida autonoma e l'agricoltura!

Explore solutions

Visione artificiale per immagini aeree

Visione artificiale per immagini aeree

Traduci immagini di droni e aeree in informazioni in tempo reale per agricoltura, acquacoltura, monitoraggio ambientale, conservazione e analisi geospaziale con Ultralytics YOLO.
Scopri di più
Computer vision nel settore aerospaziale

Computer vision nel settore aerospaziale

Porta la visione artificiale al monitoraggio aereo con i modelli Ultralytics YOLO. Potenzia droni, flussi di lavoro aerospaziali, conservazione ambientale e industrie geospaziali con soluzioni di computer vision.
Scopri di più

Proteggi ogni sito con i modelli Ultralytics YOLO. La visione artificiale alimenta il monitoraggio del perimetro, il rilevamento delle minacce, il riconoscimento delle targhe e la sicurezza sul lavoro.
Scopri di più
Computer vision nella robotica

Computer vision nella robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica abilita la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Computer vision nella logistica

Computer vision nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza nei magazzini in tempo reale.
Scopri di più
Computer vision nel commercio al dettaglio

Computer vision nel commercio al dettaglio

Reinventa il commercio al dettaglio con i modelli Ultralytics YOLO. La Vision AI potenzia il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e analisi più intelligenti dei clienti.
Scopri di più
Computer vision nel settore sanitario

Computer vision nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La Vision AI nel settore sanitario abilita imaging medico più rapido, diagnosi più intelligenti e monitoraggio dei pazienti.
Scopri di più
Computer vision nella produzione

Computer vision nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI supporta il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione delle linee di assemblaggio.
Scopri di più
Computer vision nel settore automobilistico

Computer vision nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, i sistemi di assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Computer vision in agricoltura

Computer vision in agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Abilita il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per raccolti più abbondanti e intelligenti.
Scopri di più
Visione artificiale per immagini aeree

Visione artificiale per immagini aeree

Traduci immagini di droni e aeree in informazioni in tempo reale per agricoltura, acquacoltura, monitoraggio ambientale, conservazione e analisi geospaziale con Ultralytics YOLO.
Scopri di più
Computer vision nel settore aerospaziale

Computer vision nel settore aerospaziale

Porta la visione artificiale al monitoraggio aereo con i modelli Ultralytics YOLO. Potenzia droni, flussi di lavoro aerospaziali, conservazione ambientale e industrie geospaziali con soluzioni di computer vision.
Scopri di più

Proteggi ogni sito con i modelli Ultralytics YOLO. La visione artificiale alimenta il monitoraggio del perimetro, il rilevamento delle minacce, il riconoscimento delle targhe e la sicurezza sul lavoro.
Scopri di più
Computer vision nella robotica

Computer vision nella robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica abilita la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Computer vision nella logistica

Computer vision nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza nei magazzini in tempo reale.
Scopri di più
Computer vision nel commercio al dettaglio

Computer vision nel commercio al dettaglio

Reinventa il commercio al dettaglio con i modelli Ultralytics YOLO. La Vision AI potenzia il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e analisi più intelligenti dei clienti.
Scopri di più
Computer vision nel settore sanitario

Computer vision nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La Vision AI nel settore sanitario abilita imaging medico più rapido, diagnosi più intelligenti e monitoraggio dei pazienti.
Scopri di più
Computer vision nella produzione

Computer vision nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI supporta il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione delle linee di assemblaggio.
Scopri di più
Computer vision nel settore automobilistico

Computer vision nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, i sistemi di assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Computer vision in agricoltura

Computer vision in agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Abilita il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per raccolti più abbondanti e intelligenti.
Scopri di più
Visione artificiale per immagini aeree

Visione artificiale per immagini aeree

Traduci immagini di droni e aeree in informazioni in tempo reale per agricoltura, acquacoltura, monitoraggio ambientale, conservazione e analisi geospaziale con Ultralytics YOLO.
Scopri di più
Computer vision nel settore aerospaziale

Computer vision nel settore aerospaziale

Porta la visione artificiale al monitoraggio aereo con i modelli Ultralytics YOLO. Potenzia droni, flussi di lavoro aerospaziali, conservazione ambientale e industrie geospaziali con soluzioni di computer vision.
Scopri di più

Proteggi ogni sito con i modelli Ultralytics YOLO. La visione artificiale alimenta il monitoraggio del perimetro, il rilevamento delle minacce, il riconoscimento delle targhe e la sicurezza sul lavoro.
Scopri di più
Computer vision nella robotica

Computer vision nella robotica

Potenzia macchine più intelligenti con i modelli Ultralytics YOLO. La Vision AI nella robotica abilita la navigazione autonoma, la percezione, il tracciamento degli oggetti e il controllo in tempo reale.
Scopri di più
Computer vision nella logistica

Computer vision nella logistica

Semplifica la logistica con i modelli Ultralytics YOLO. La Vision AI abilita l'ispezione dei pacchi, lo smistamento, il tracciamento dei veicoli e il monitoraggio della sicurezza nei magazzini in tempo reale.
Scopri di più
Computer vision nel commercio al dettaglio

Computer vision nel commercio al dettaglio

Reinventa il commercio al dettaglio con i modelli Ultralytics YOLO. La Vision AI potenzia il tracciamento dell'inventario, il monitoraggio degli scaffali, la gestione delle code e analisi più intelligenti dei clienti.
Scopri di più
Computer vision nel settore sanitario

Computer vision nel settore sanitario

Crea soluzioni sanitarie con i modelli Ultralytics YOLO. La Vision AI nel settore sanitario abilita imaging medico più rapido, diagnosi più intelligenti e monitoraggio dei pazienti.
Scopri di più
Computer vision nella produzione

Computer vision nella produzione

Ottimizza la produzione con i modelli Ultralytics YOLO. La Vision AI supporta il controllo qualità, il rilevamento dei difetti, la conformità ai DPI e l'automazione delle linee di assemblaggio.
Scopri di più
Computer vision nel settore automobilistico

Computer vision nel settore automobilistico

Applica la computer vision al settore automobilistico con i modelli Ultralytics YOLO. La vision AI migliora la sicurezza stradale, i sistemi di assistenza alla guida e l'automazione dei veicoli per strade più intelligenti.
Scopri di più
Computer vision in agricoltura

Computer vision in agricoltura

Porta la vision AI nell'agricoltura intelligente con i modelli Ultralytics YOLO. Abilita il monitoraggio delle colture, il tracciamento del bestiame e l'agricoltura di precisione per raccolti più abbondanti e intelligenti.
Scopri di più

Costruiamo insieme il futuro dell'AI!

Inizia il tuo percorso verso il futuro del machine learning