Ultralytics YOLO27:
IA para visão

Atualizações da investigação em IA da Meta FAIR: SAM 2.1 e CoTracker3

Explora os mais recentes modelos de IA da Meta FAIR, SAM 2.1 e CoTracker3, que oferecem capacidades avançadas de segmentação e tracking para diversas aplicações do mundo real.

ABAbirami Vina9 min read
Investigação em IA da Meta FAIR: SAM 2.1 e CoTracker3

A inteligência artificial (IA) é uma área de investigação que tem despertado recentemente entusiasmo e energia, com novas inovações e avanços a surgir mais depressa do que nunca. Nas últimas semanas, a equipa de Investigação Fundamental em Inteligência Artificial (FAIR) da Meta apresentou um conjunto de ferramentas e modelos destinados a enfrentar desafios em diferentes áreas da IA. Estas versões incluem atualizações que podem ter impacto em áreas tão diversas como os cuidados de saúde, a robótica e a realidade aumentada.

Por exemplo, o modelo SAM 2.1 atualizado melhora a segmentação de objetos, facilitando a identificação e separação precisas de objetos em imagens e vídeos. Entretanto, o CoTracker3 centra-se no rastreamento de pontos, ajudando a acompanhar pontos em fotogramas de vídeo mesmo quando os objetos se movem ou ficam parcialmente bloqueados.

A Meta também apresentou versões mais leves e rápidas do seu modelo de linguagem Llama para uma utilização eficiente no dispositivo, juntamente com uma nova tecnologia de deteção tátil para a robótica. Neste artigo, vamos analisar estas versões mais recentes da Meta FAIR, explicando o que cada ferramenta oferece. Vamos começar!

O Segment Anything Model melhorado da Meta: SAM 2.1#

A segmentação de objetos, uma tarefa essencial de visão computacional, permite identificar e separar objetos distintos numa imagem ou vídeo, facilitando a análise de áreas específicas de interesse. Desde o seu lançamento, o Modelo Segmentar Tudo 2 (SAM 2) da Meta tem sido utilizado para segmentação de objetos em diferentes áreas, como imagiologia médica e meteorologia. Com base no feedback da comunidade, a Meta apresentou agora o SAM 2.1, uma versão melhorada concebida para enfrentar alguns dos desafios encontrados no modelo original e proporcionar uma performance geral superior.

Avaliação comparativa da performance do modelo SAM 2.1

Fig. 1. Avaliação comparativa da performance do modelo SAM 2.1.

O SAM 2.1 inclui atualizações para lidar melhor com objetos visualmente semelhantes e mais pequenos, graças a novas técnicas de aumento de dados. Também melhora a forma como o modelo lida com a oclusão (quando partes de um objeto ficam ocultas) ao treiná-lo com sequências de vídeo mais longas, permitindo-lhe "lembrar-se" e reconhecer objetos ao longo do tempo, mesmo quando ficam temporariamente bloqueados. Por exemplo, se alguém estiver a gravar um vídeo de uma pessoa a caminhar atrás de uma árvore, o SAM 2.1 pode rastrear a pessoa quando ela reaparece do outro lado, utilizando a memória da posição do objeto e do seu movimento para preencher as lacunas quando a imagem é brevemente interrompida.

Juntamente com estas atualizações, a Meta lançou o SAM 2 Developer Suite, disponibilizando código de treino open source e uma infraestrutura de demonstração completa para que os programadores possam fazer fine-tuning do SAM 2.1 com os seus próprios dados e integrá-lo numa variedade de aplicações.

CoTracker3: o modelo de rastreamento da Meta, as suas funcionalidades e atualizações#

Outra tarefa interessante de visão computacional é o rastreamento de pontos. Consiste em seguir pontos ou características específicos ao longo de vários fotogramas de um vídeo. Imagina um vídeo de um ciclista a percorrer uma pista: o rastreamento de pontos permite ao modelo manter o rastreio dos pontos do ciclista, como o capacete ou as rodas, mesmo que fiquem ocultos por obstáculos durante alguns instantes.

O rastreamento de pontos é essencial para aplicações como reconstrução 3D, robótica e edição de vídeo. Os modelos tradicionais dependem frequentemente de configurações complexas e de grandes conjuntos de dados sintéticos, o que limita a sua eficácia quando aplicados a cenários do mundo real.

O modelo de rastreamento CoTracker3 da Meta resolve estas limitações ao simplificar a arquitetura do modelo. Também introduz uma técnica de pseudo-rotulagem que permite ao modelo aprender com vídeos reais não anotados, tornando o CoTracker3 mais eficiente e escalável para utilização prática.

Comparação do CoTracker3 com outros modelos de rastreamento

Fig. 2. Comparação do CoTracker3 com outros modelos de rastreamento.

Uma das funcionalidades que distingue o CoTracker3 é a sua capacidade de lidar bem com oclusões. Utilizando atenção entre rastreamentos, uma técnica que permite ao modelo partilhar informação entre vários pontos rastreados, o CoTracker3 consegue inferir as posições dos pontos ocultos consultando os pontos visíveis. Desta forma, o CoTracker3 foi concebido para ser altamente eficaz em ambientes dinâmicos, como ao seguir uma pessoa numa cena com muita gente.

O CoTracker3 também oferece modos online e offline. O modo online proporciona rastreamento em tempo real, enquanto o modo offline pode ser utilizado para um rastreamento mais abrangente ao longo de sequências de vídeo inteiras, sendo ideal para tarefas como edição de vídeo ou animação.

Outras atualizações e investigações da Meta FAIR#

Embora o SAM 2.1 e o CoTracker3 apresentem os avanços mais recentes da Meta em visão computacional, também existem atualizações interessantes noutras áreas da IA, como o processamento de linguagem natural (NLP) e a robótica. Vejamos alguns destes desenvolvimentos recentes da Meta FAIR.

Spirit LM da Meta: inovações de IA em modelos de linguagem e multimodais#

O Spirit LM da Meta é um novo modelo de linguagem multimodal que combina capacidades de texto e voz, tornando as interações com a IA mais naturais. Ao contrário dos modelos tradicionais, que lidam apenas com texto ou apenas com voz, o Spirit LM pode alternar facilmente entre os dois.

O Spirit LM consegue compreender e gerar linguagem de formas mais semelhantes às humanas. Por exemplo, pode melhorar assistentes virtuais capazes de ouvir e responder em linguagem falada ou escrita, ou apoiar ferramentas de acessibilidade que convertem voz em texto e texto em voz.

Um exemplo de conversão de texto em voz com o Meta Spirit LM

Fig. 3. Um exemplo de conversão de texto em voz com o Meta Spirit LM.

Além disso, a Meta desenvolveu técnicas para tornar os modelos de linguagem grandes mais eficientes. Uma delas, denominada Layer Skip, ajuda a reduzir as necessidades computacionais e os custos energéticos ao ativar apenas as camadas necessárias para uma determinada tarefa. Isto é especialmente útil para aplicações em dispositivos com memória e energia limitadas.

Para responder ainda melhor à necessidade de implementar aplicações de IA nesses dispositivos, a Meta também lançou versões quantizadas dos seus modelos Llama. Estes modelos são comprimidos para funcionarem mais rapidamente em dispositivos móveis sem sacrificarem a precisão.

Uma perspetiva sobre o futuro da otimização com o Meta Lingua#

À medida que os modelos de IA aumentam de dimensão e complexidade, otimizar o seu processo de treino tornou-se crucial. No que diz respeito à otimização, a Meta apresentou o Meta Lingua, uma base de código flexível e eficiente que facilita o treino de modelos de linguagem grandes. O design modular do Meta Lingua permite aos investigadores personalizar e expandir rapidamente as suas experiências.

Os investigadores podem passar menos tempo na configuração técnica e mais tempo na investigação propriamente dita. A base de código também é leve e fácil de integrar, sendo adequada tanto para pequenas experiências como para projetos de grande escala. Ao remover estes obstáculos técnicos, o Meta Lingua ajuda os investigadores a progredir mais rapidamente e a testar novas ideias com maior facilidade.

Uma visão geral do Meta Lingua

Fig. 4. Uma visão geral do Meta Lingua.

Os avanços da Meta na segurança da IA#

À medida que a tecnologia de computação quântica avança, surgem novos desafios para a segurança dos dados. Ao contrário dos computadores atuais, é provável que os computadores quânticos consigam resolver cálculos complexos muito mais rapidamente. Isto significa que poderão potencialmente quebrar os métodos de encriptação atualmente utilizados para proteger informações sensíveis. Por isso, a investigação neste campo está a tornar-se cada vez mais importante: desenvolver novas formas de proteger os dados é essencial enquanto nos preparamos para o futuro da computação quântica.

Para responder a este desafio, a Meta desenvolveu o Salsa, uma ferramenta destinada a reforçar a segurança criptográfica pós-quântica. O Salsa ajuda os investigadores a testar ataques baseados em IA e a identificar potenciais fragilidades, permitindo-lhes compreender e resolver melhor as vulnerabilidades dos sistemas criptográficos. Ao simular cenários de ataque avançados, o Salsa fornece informações valiosas que podem orientar o desenvolvimento de medidas de segurança mais fortes e resilientes para a era quântica.

IA na Meta: últimas inovações em robótica#

O trabalho mais recente da Meta em robótica centra-se em ajudar a IA a interagir de forma mais natural com o mundo físico, melhorando a perceção tátil, a destreza e a colaboração com os seres humanos. Em particular, o Meta Digit 360 é um sensor tátil avançado que proporciona aos robôs uma perceção refinada do tato. Os sensores ajudam os robôs a detetar detalhes como textura, pressão e até a forma dos objetos. Com base nestas informações, os robôs conseguem manusear objetos com maior precisão, algo crucial em áreas como os cuidados de saúde e a indústria.

Eis algumas das principais funcionalidades incluídas no Meta Digit 360:

  • Está equipado com 18 funcionalidades de deteção distintas, permitindo captar uma vasta gama de detalhes táteis.
  • O sensor consegue detetar alterações de pressão tão pequenas como 1 milinewton, permitindo aos robôs responder a texturas finas e movimentos subtis.
  • Inclui mais de 8 milhões de taxels (pequenos pontos de deteção) em toda a superfície da ponta do dedo, fornecendo um mapa de alta resolução das informações táteis.

Uma extensão do Meta Digit 360 é o Meta Digit Plexus, uma plataforma que integra vários sensores táteis numa única mão robótica. Esta configuração permite aos robôs processar simultaneamente informações táteis provenientes de vários pontos, de forma semelhante à maneira como as mãos humanas recolhem dados sensoriais.

A plataforma de deteção tátil Meta Digit Plexus

Fig. 5. O Meta Digit Plexus.

Preparar o caminho para o próximo capítulo da IA#

As atualizações mais recentes da Meta em IA, que vão desde os avanços em visão computacional com o SAM 2.1 e o CoTracker3 até aos novos desenvolvimentos em modelos de linguagem e robótica, mostram como a IA está a passar gradualmente da teoria para soluções práticas e com impacto.

Estas ferramentas foram concebidas para tornar a IA mais adaptável e útil em diferentes áreas, ajudando em tudo, desde a segmentação de imagens complexas à compreensão da linguagem humana e até à colaboração connosco em espaços físicos.

Ao dar prioridade à acessibilidade e à aplicação no mundo real, a Meta FAIR aproxima-nos de um futuro em que a IA poderá enfrentar desafios reais e melhorar as nossas vidas quotidianas de formas significativas.

Tens curiosidade sobre IA? Junta-te à nossa comunidade para receber as atualizações e informações mais recentes e consulta o nosso repositório no GitHub. Também podes explorar como a visão computacional pode ser utilizada em setores como os veículos autónomos e a agricultura!

Explore solutions

Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais
Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais
Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais

Vamos construir juntos o futuro da IA!

Começa a tua jornada com o futuro da aprendizagem automática