Aggiornamenti di ricerca sull'AI da Meta FAIR: SAM 2.1 e CoTracker3
Esplora gli ultimi modelli di AI di Meta FAIR, SAM 2.1 e CoTracker3, che offrono funzionalità avanzate di segmentazione e tracciamento per diverse applicazioni nel mondo reale.

L'intelligenza artificiale (AI) è un campo di ricerca che ultimamente sta registrando grande entusiasmo ed energia, con new innovations e scoperte che compaiono più velocemente che mai. Nelle ultime settimane, il team Fundamental AI Research (FAIR) di Meta ha presentato una serie di strumenti e models pensati per affrontare le sfide in diversi ambiti dell'AI. Questi rilasci includono aggiornamenti che potrebbero avere un impatto su settori diversi come healthcare, robotics e augmented reality.
Ad esempio, il modello aggiornato SAM 2.1 migliora la object segmentation, rendendo più semplice identificare e separare con precisione gli oggetti in images e video. Nel frattempo, CoTracker3 si concentra sul tracking dei punti, aiutando a tenere traccia dei punti nei fotogrammi video anche quando gli oggetti si muovono o vengono parzialmente nascosti.
Meta ha anche introdotto versioni più leggere e veloci del proprio Llama language model per un efficiente on-device use, insieme a una nuova tecnologia di rilevamento tattile per la robotics. In questo articolo analizzeremo questi ultimi rilasci di Meta FAIR, esaminando ciò che ciascuno strumento offre. Iniziamo!
Il Segment Anything Model potenziato di Meta: SAM 2.1#
La Object segmentation, una fondamentale computer vision task, consente di identificare e separare oggetti distinti all'interno di un'immagine o di un video, semplificando l'analisi di specifiche aree di interesse. Fin dalla sua uscita, il Segment Anything Model 2 (SAM 2) di Meta è stato utilizzato per la segmentazione degli oggetti in vari campi come il medical imaging e la meteorology. Sulla base dei feedback della community, Meta ha ora introdotto SAM 2.1, una versione migliorata progettata per affrontare alcune delle sfide incontrate con il modello originale e offrire una performance complessivamente superiore.

Fig 1. Benchmark delle prestazioni del modello SAM 2.1.
SAM 2.1 include aggiornamenti per gestire meglio oggetti visivamente simili e più piccoli, grazie a nuove tecniche di data augmentation. Migliora anche la gestione delle occlusioni da parte del modello (quando parti di un oggetto sono nascoste alla vista) addestrandolo su sequenze video più lunghe, consentendogli di "ricordare" e riconoscere gli oggetti nel tempo, anche se vengono temporaneamente bloccati. Ad esempio, se qualcuno sta filming a video di una persona che cammina dietro un tree, SAM 2.1 può track la persona mentre riappare dall'altro lato, utilizzando la memoria della object’s position e del movement per colmare i vuoti quando la visuale viene brevemente interrotta.
Insieme a questi aggiornamenti, Meta ha rilasciato la SAM 2 Developer Suite, che fornisce codice di addestramento open-source e un'infrastruttura demo completa in modo che gli sviluppatori possano fine-tune SAM 2.1 con i propri data e integrarlo in una serie di applications.
CoTracker3: il modello di tracciamento di Meta, le sue funzionalità e gli aggiornamenti#
Un'altra interessante attività di computer vision è il tracking dei punti. Comporta il seguire punti o caratteristiche specifici attraverso più fotogrammi in un video. Immagina il video di un cyclist che pedala lungo una pista: il tracciamento dei punti consente al modello di mantenere il track of points sul ciclista, come il casco o le ruote, anche se sono nascosti da ostacoli per un momento.
Il tracciamento dei punti è essenziale per applicazioni come 3D reconstruction, robotics e video editing. I modelli tradizionali spesso si affidano a configurazioni complesse e ampi set di dati sintetici, il che ne limita l'efficacia quando applicati a scenari del mondo reale.
Il modello CoTracker3 tracking di Meta risolve queste limitazioni semplificando l'architettura del modello. Introduce inoltre una tecnica di pseudo-labeling technique che consente al modello di apprendere da video reali e non annotati, rendendo CoTracker3 più efficiente e scalabile per l'uso pratico.

Fig 2. Confronto di CoTracker3 con altri modelli di tracciamento.
Una delle caratteristiche che fa risaltare CoTracker3 è la sua capacità di gestire bene le occlusioni. Utilizzando l'attenzione cross-track, una tecnica che consente al modello di condividere informazioni su più punti tracciati, CoTracker3 può dedurre le posizioni dei punti nascosti facendo riferimento a quelli visibili. In questo modo, CoTracker3 è progettato per essere estremamente efficace in ambienti dinamici, come following a person attraverso una scena affollata.
CoTracker3 offre anche modalità online e offline. La modalità online fornisce tracciamento in tempo reale, mentre la modalità offline può essere utilizzata per un tracciamento più completo su intere sequenze video, ideale per attività come il video editing o l'animation.
Altri aggiornamenti e ricerche da Meta FAIR#
Mentre SAM 2.1 e CoTracker3 mostrano gli ultimi progressi di Meta nella computer vision, ci sono anche entusiasmanti aggiornamenti in altri settori dell'AI, come il natural language processing (NLP) e la robotics. Diamo un'occhiata ad alcuni di questi altri recenti sviluppi di Meta FAIR.
Spirit LM di Meta: innovazioni AI nei modelli linguistici e multimodali#
Spirit LM di Meta è un nuovo multimodal language model che combina le capacità di text and speech, facendo sembrare le interactions with AI più naturali. A differenza dei modelli tradizionali che gestiscono solo testo o solo voce, Spirit LM può passare senza problemi dall'uno all'altro.
Spirit LM è in grado di comprendere e generate language in modi che sembrano più umani. Ad esempio, può migliorare i virtual assistants che possono sia ascoltare che rispondere in lingua parlata o scritta, oppure supportare gli accessibility tools che convertono tra voce e testo.

Fig 3. Un esempio di sintesi vocale tramite Meta Spirit LM.
Inoltre, Meta ha sviluppato tecniche per rendere i modelli linguistici di grandi dimensioni più efficienti. Una di queste, chiamata Layer Skip, aiuta a ridurre i computational needs e i costi energetici (energy costs) attivando solo i livelli necessari per una determinata attività. Questo è particolarmente utile per le applicazioni on devices con memoria e potenza limitate.
Spingendo ulteriormente la necessità di deploy AI applicazioni su tali dispositivi, Meta ha anche lanciato versioni quantized dei suoi Llama models. Questi modelli sono compressi per funzionare più velocemente sui mobile devices senza sacrificare la accuracy.
Uno sguardo al futuro dell'ottimizzazione con Meta Lingua#
Man mano che i AI models crescono in dimensioni e complessità, ottimizzare il loro processo di training è diventato cruciale. Per quanto riguarda l'optimization, Meta ha introdotto Meta Lingua, una base di codice flessibile ed efficiente che semplifica l'addestramento dei large language models. Il design modulare di Meta Lingua consente ai researchers di personalizzare e scalare rapidamente i propri esperimenti.
I ricercatori possono dedicare meno tempo alla configurazione tecnica e più tempo alla ricerca effettiva. Il codice è anche leggero e facile da integrate, il che lo rende adatto sia a piccoli esperimenti che a progetti su larga scala. Rimuovendo questi ostacoli tecnici, Meta Lingua aiuta i ricercatori a fare progressi più rapidi e a testare new ideas con maggiore facilità.

Fig 4. Panoramica di Meta Lingua.
Miglioramenti di Meta nella sicurezza AI#
Con il progredire della tecnologia di calcolo quantistico, emergono nuove sfide per la data security. A differenza dei computer odierni, è probabile che i computer quantistici saranno in grado di risolvere calcoli complessi molto più rapidamente. Ciò significa che potrebbero potenzialmente break the encryption metodi attualmente utilizzati per protect informazioni sensibili. Ecco perché la ricerca in questo campo sta diventando sempre più importante: sviluppare nuovi modi per proteggere i dati è essenziale mentre ci prepariamo per il futuro del calcolo quantistico.
Per affrontare questo problema, Meta ha sviluppato Salsa, uno strumento volto a rafforzare la sicurezza crittografica post-quantistica. Salsa aiuta i ricercatori a testare attacchi guidati dall'AI e a identificare potenziali punti deboli, consentendo loro di comprendere e affrontare meglio le vulnerabilità nei sistemi crittografici. Simulando scenari di attacco avanzati, Salsa fornisce preziose informazioni in grado di guidare lo sviluppo di security measures più forti e resilienti per l'era quantistica.
AI in Meta: ultime innovazioni nella robotica#
L'ultimo lavoro di Meta nella robotics si concentra sull'aiutare l'AI a interagire in modo più naturale con il mondo fisico migliorando la percezione tattile, la destrezza e la collaborazione con gli esseri umani. In particolare, Meta Digit 360 è un sensore tattile avanzato che offre ai robot un senso del tatto raffinato. I sensori aiutano i robot a rilevare dettagli come consistenza, pressione e persino la forma degli oggetti. Da queste intuizioni, i robot possono manipolare gli oggetti con maggiore precisione; qualcosa di cruciale in settori come l'healthcare e la manufacturing.
Ecco alcune delle caratteristiche chiave incluse in Meta Digit 360:
- È dotato di 18 distinte funzioni di rilevamento per poter catturare una vasta gamma di dettagli tattili.
- Il sensore può rilevare cambiamenti di pressione piccoli fino a 1 millinewton, consentendo ai robot di rispondere a consistenze sottili e movimenti delicati.
- Include oltre 8 milioni di taxel (minuscoli punti di rilevamento) sulla superficie della punta delle dita, fornendo una mappa ad alta risoluzione delle informazioni tattili.
Un'estensione di Meta Digit 360 è il Meta Digit Plexus, una piattaforma che integra vari sensori tattili su una singola mano robotica. Questa configurazione consente ai robot di elaborare informazioni tattili da più punti contemporaneamente, in modo simile a come le mani umane raccolgono dati sensoriali.

Fig 5. Il Meta Digit Plexus.
Preparare il terreno per il prossimo capitolo dell'AI#
Gli ultimi aggiornamenti AI di Meta, che spaziano dai progressi nella computer vision con SAM 2.1 e CoTracker3 ai nuovi sviluppi nei modelli linguistici e nella robotica, mostrano come l'AI si stia costantemente spostando dalla teoria a soluzioni pratiche e di grande impatto.
Questi strumenti sono progettati per rendere l'AI più adattabile e utile in diversi settori, aiutando in tutto, dalla segmentazione di immagini complesse alla comprensione del linguaggio umano e persino lavorando al nostro fianco in spazi fisici.
Dando priorità all'accessibilità e all'applicazione nel mondo reale, Meta FAIR ci sta avvicinando a un futuro in cui l'AI può affrontare le sfide del mondo reale e migliorare le nostre vite quotidiane in modi significativi.
Sei curioso riguardo all'AI? Unisciti a our community per gli ultimi aggiornamenti e approfondimenti, e dai un'occhiata al nostro GitHub repository. Puoi anche scoprire come la computer vision può essere utilizzata in settori come i self-driving cars e l'agriculture!






