Atualizações de investigação de IA da Meta FAIR: SAM 2.1 e CoTracker3
Explora os modelos de IA mais recentes da Meta FAIR, o SAM 2.1 e o CoTracker3, que oferecem capacidades avançadas de segmentação e rastreio para diversas aplicações reais.

A inteligência artificial (IA) é um campo de pesquisa que tem agitado recentemente com entusiasmo e energia, com new innovations e descobertas surgindo mais rápido do que nunca. Nas últimas semanas, a equipa Fundamental AI Research (FAIR) da Meta revelou um conjunto de ferramentas e models com o objetivo de enfrentar desafios em diferentes áreas da IA. Estes lançamentos incluem atualizações que podem impactar campos tão diversos como healthcare, robotics e augmented reality.
Por exemplo, o modelo atualizado SAM 2.1 melhora a object segmentation, tornando mais fácil identificar e separar com precisão objetos em images e vídeos. Enquanto isso, o CoTracker3 foca-se no tracking de pontos, ajudando a acompanhar pontos em fotogramas de vídeo mesmo quando os objetos se movem ou ficam parcialmente bloqueados.
A Meta também introduziu versões mais leves e rápidas do seu Llama language model para uma on-device use eficiente, juntamente com nova tecnologia de deteção tátil para robotics. Neste artigo, vamos detalhar estes lançamentos mais recentes da Meta FAIR, analisando o que cada ferramenta oferece. Vamos começar!
Segment Anything Model aprimorado da Meta: SAM 2.1#
A Object segmentation, uma computer vision task fundamental, torna possível identificar e separar objetos distintos dentro de uma imagem ou vídeo, facilitando a análise de áreas de interesse específicas. Desde o seu lançamento, o Segment Anything Model 2 (SAM 2) da Meta tem sido utilizado para a segmentação de objetos em diferentes campos, como medical imaging e meteorology. Com base no feedback da comunidade, a Meta introduziu agora o SAM 2.1, uma versão melhorada desenhada para enfrentar alguns dos desafios encontrados no modelo original e proporcionar um performance global mais forte.

Fig 1. Testes comparativos de desempenho do modelo SAM 2.1.
O SAM 2.1 inclui atualizações para lidar melhor com objetos visualmente semelhantes e mais pequenos, graças a novas técnicas de data augmentation. Também melhora a forma como o modelo lida com a oclusão (quando partes de um objeto ficam ocultas) ao treiná-lo em sequências de vídeo mais longas, permitindo-lhe "lembrar-se" e reconhecer objetos ao longo do tempo, mesmo que fiquem temporariamente bloqueados. Por exemplo, se alguém estiver a filming a video de uma pessoa a caminhar por trás de uma tree, o SAM 2.1 consegue track a pessoa à medida que ela reaparece do outro lado, utilizando a sua memória da object’s position e do movement para preencher lacunas quando a vista é brevemente interrompida.
Juntamente com estas atualizações, a Meta lançou o SAM 2 Developer Suite, fornecendo código de treino open-source e infraestrutura de demonstração completa para que os programadores possam fine-tune o SAM 2.1 com os seus próprios data e integrá-lo numa variedade de applications.
CoTracker3: modelo de rastreamento da Meta e seus recursos e atualizações#
Outra tarefa de visão por computador interessante é o tracking de pontos. Consiste em seguir pontos ou caraterísticas específicas ao longo de vários fotogramas num vídeo. Considera um vídeo de um cyclist a andar numa pista - o seguimento de pontos permite que o modelo mantenha track of points no ciclista, como o capacete ou as rodas, mesmo que fiquem escondidos por obstáculos durante um momento.
O seguimento de pontos é essencial para aplicações como 3D reconstruction, robotics e edição de vídeo. Os modelos tradicionais dependem frequentemente de configurações complexas e de grandes conjuntos de dados sintéticos, o que limita a sua eficácia quando aplicados a cenários do mundo real.
O modelo de tracking CoTracker3 da Meta aborda estas limitações ao simplificar a arquitetura do modelo. Também introduz uma técnica de pseudo-labeling technique que permite ao modelo aprender a partir de vídeos reais e não anotados, tornando o CoTracker3 mais eficiente e dimensionável para uso prático.

Fig 2. Comparação do CoTracker3 com outros modelos de seguimento.
Uma das caraterísticas que faz o CoTracker3 destacar-se é a sua capacidade de lidar bem com oclusões. Utilizando a atenção de rastreio cruzado (cross-track attention), uma técnica que permite ao modelo partilhar informação por vários pontos rastreados, o CoTracker3 consegue inferir as posições de pontos escondidos fazendo referência aos visíveis. Desta forma, o CoTracker3 foi concebido para ser altamente eficaz em ambientes dinâmicos, tais como following a person através de uma cena cheia de gente.
O CoTracker3 também oferece modos online e offline. O modo online fornece rastreio em tempo real, enquanto o modo offline pode ser usado para um rastreio mais abrangente em sequências de vídeo inteiras, ideal para tarefas como edição de vídeo ou animation.
Outras atualizações e pesquisas da Meta FAIR#
Embora o SAM 2.1 e o CoTracker3 demonstrem os avanços mais recentes da Meta em computer vision, existem também atualizações empolgantes noutras áreas da AI, tais como o natural language processing (NLP) e a robotics. Vamos dar uma vista de olhos a alguns destes outros desenvolvimentos recentes da Meta FAIR.
Spirit LM da Meta: Inovações de IA em Linguagem e Modelos Multimodais#
O Spirit LM da Meta é um novo multimodal modelo de linguagem que combina capacidades de text and speech, tornando as interactions with AI mais naturais. Ao contrário dos modelos tradicionais que lidam apenas com texto ou apenas com voz, o Spirit LM consegue alternar perfeitamente entre os dois.
O Spirit LM consegue compreender e generate language de formas que parecem mais humanas. Por exemplo, pode melhorar virtual assistants que conseguem ouvir e responder em linguagem falada ou escrita, ou apoiar accessibility tools que convertem entre fala e texto.

Fig 3. Um exemplo de conversão de texto em voz utilizando o Meta Spirit LM.
Além disso, a Meta desenvolveu técnicas para tornar os grandes modelos de linguagem mais eficientes. Uma delas, chamada Layer Skip, ajuda a reduzir as computational needs e os energy costs, ativando apenas as camadas necessárias para uma determinada tarefa. Isto é especialmente útil para aplicações on devices com memória e energia limitadas.
Levando a necessidade de deploy AI aplicações nesses dispositivos ainda mais longe, a Meta também lançou versões quantized dos seus Llama models. Estes modelos são comprimidos para correr mais rapidamente em mobile devices sem sacrificar a accuracy.
Um olhar sobre o futuro da otimização com o Meta Lingua#
À medida que os AI models crescem em tamanho e complexidade, otimizar o seu processo de training tornou-se crucial. No que respeita à optimization, a Meta introduziu o Meta Lingua, uma base de código flexível e eficiente que facilita o treino de large language models. O design modular do Meta Lingua permite que os researchers personalizem e dimensionem rapidamente as suas experiências.
Os investigadores podem gastar menos tempo na configuração técnica e mais tempo na investigação real. A base de código também é leve e fácil de integrate, tornando-a adequada tanto para pequenas experiências como para projetos em grande escala. Ao remover estes obstáculos técnicos, o Meta Lingua ajuda os investigadores a progredir mais rapidamente e a testar new ideas com maior facilidade.

Fig 4. Uma visão geral do Meta Lingua.
Aprimoramentos da Meta na segurança de IA#
À medida que a tecnologia de computação quântica avança, traz novos desafios para a data security. Ao contrário dos computadores de hoje, é provável que os computadores quânticos consigam resolver cálculos complexos muito mais rapidamente. Isto significa que podem potencialmente break the encryption métodos atualmente utilizados para protect informação sensível. É por isso que a investigação neste campo se está a tornar cada vez mais importante - desenvolver novas formas de proteger os dados é essencial à medida que nos preparamos para o futuro da computação quântica.
Para resolver isto, a Meta desenvolveu o Salsa, uma ferramenta destinada a reforçar a segurança criptográfica pós-quântica. O Salsa ajuda os investigadores a testar ataques orientados por IA e a identificar potenciais pontos fracos, permitindo-lhes compreender e resolver melhor as vulnerabilidades nos sistemas criptográficos. Ao simular cenários de ataque avançados, o Salsa fornece informações valiosas que podem orientar o desenvolvimento de security measures mais fortes e resilientes para a era quântica.
IA na Meta: Últimas inovações em robótica#
O trabalho mais recente da Meta em robotics foca-se em ajudar a IA a interagir de forma mais natural com o mundo físico, melhorando a perceção do tato, a destreza e a colaboração com os humanos. Em particular, o Meta Digit 360 é um sensor tátil avançado que dá aos robôs um sentido de tato refinado. Os sensores ajudam os robôs a detetar detalhes como textura, pressão e até formas de objetos. A partir destes conhecimentos, os robôs podem manusear objetos com mais precisão; algo que é crucial em áreas como healthcare e manufacturing.
Aqui estão alguns dos principais recursos que o Meta Digit 360 inclui:
- Ele é equipado com 18 recursos de detecção distintos para poder capturar uma ampla gama de detalhes táteis.
- O sensor pode detectar mudanças de pressão tão pequenas quanto 1 milinewton, permitindo que os robôs respondam a texturas finas e movimentos sutis.
- Inclui mais de 8 milhões de taxels (pequenos pontos de detecção) em toda a superfície da ponta do dedo, fornecendo um mapa de alta resolução das informações de toque.
Uma extensão do Meta Digit 360 é o Meta Digit Plexus, uma plataforma que integra vários sensores de toque em uma única mão robótica. Essa configuração permite que os robôs processem informações de toque de vários pontos ao mesmo tempo, de forma semelhante a como as mãos humanas coletam dados sensoriais.

Fig 5. O Meta Digit Plexus.
Preparando o cenário para o próximo capítulo da IA#
As mais recentes atualizações de IA da Meta, que variam de avanços em visão computacional com o SAM 2.1 e CoTracker3 a novos desenvolvimentos em modelos de linguagem e robótica, mostram como a IA está passando constantemente da teoria para soluções práticas e impactantes.
Essas ferramentas são projetadas para tornar a IA mais adaptável e útil em diferentes campos, ajudando em tudo, desde segmentar imagens complexas até entender a linguagem humana e até mesmo trabalhar ao nosso lado em espaços físicos.
Ao priorizar a acessibilidade e a aplicação no mundo real, a Meta FAIR está nos aproximando de um futuro onde a IA pode enfrentar desafios reais e melhorar nossas vidas diárias de maneiras significativas.
Tens curiosidade sobre IA? Junta-te a our community para receber as últimas atualizações e opiniões, e consulta o nosso GitHub repository. Também podes explorar como a visão por computador pode ser utilizada em indústrias como self-driving cars e agriculture!






