Aplicações do Segment Anything Model 2 (SAM 2) da Meta AI
Acompanha-nos enquanto exploramos o Segment Anything Model 2 (SAM 2) da Meta AI e compreendemos para que aplicações em tempo real pode ser utilizado em vários setores.

Em 29 de julho de 2024, a Meta AI lançou a segunda versão do seu Modelo Segment Anything, SAM 2. O novo modelo consegue identificar quais píxeis pertencem a um objeto-alvo tanto em imagens como em vídeos! O melhor é que o modelo consegue seguir um objeto ao longo de todos os fotogramas de um vídeo de forma consistente e em tempo real. O SAM 2 abre possibilidades entusiasmantes para a edição de vídeo, experiências de realidade mista e anotação mais rápida de dados visuais para treinar sistemas de visão computacional.
Com base no sucesso do SAM original, que tem sido utilizado em áreas como ciência marinha, imagens de satélite e medicina, o SAM 2 enfrenta desafios como objetos em movimento rápido e alterações na aparência. A sua maior precisão e eficiência fazem dele uma ferramenta versátil para uma ampla variedade de aplicações. Neste artigo, vamos concentrar-nos em onde o SAM 2 pode ser aplicado e por que razão isso é importante para a comunidade de IA.
O que é o SAM 2?#
O Modelo Segment Anything 2 é um modelo de base avançado que oferece segmentação visual orientável por prompts, ou PVS, tanto em imagens como em vídeos. A PVS é uma técnica na qual um modelo pode segmentar ou identificar diferentes partes de uma imagem ou vídeo com base em prompts ou entradas específicas fornecidos pelo utilizador. Esses prompts podem assumir a forma de cliques, caixas ou máscaras que destacam a área de interesse. Em seguida, o modelo gera uma máscara de segmentação que delimita a área especificada.
A arquitetura do SAM 2 baseia-se no SAM original, expandindo a segmentação de imagens para incluir também a segmentação de vídeos. Inclui um descodificador de máscaras leve que utiliza dados de imagem e prompts para criar máscaras de segmentação. Para vídeos, o SAM 2 introduz um sistema de memória que o ajuda a recordar informações de fotogramas anteriores, garantindo um seguimento preciso ao longo do tempo. O sistema de memória inclui componentes que armazenam e recuperam detalhes sobre os objetos que estão a ser segmentados. O SAM 2 também consegue lidar com oclusões, seguir objetos ao longo de vários fotogramas e gerir prompts ambíguos através da geração de várias máscaras possíveis. A arquitetura avançada do SAM 2 torna-o altamente capaz tanto em ambientes visuais estáticos como dinâmicos.
Especificamente no que diz respeito à segmentação de vídeos, o SAM 2 alcança uma maior precisão com três vezes menos interações do utilizador em comparação com métodos anteriores. Na segmentação de imagens, o SAM 2 supera o Modelo Segment Anything (SAM) original, sendo seis vezes mais rápido e preciso. Esta melhoria foi demonstrada no artigo de investigação sobre o SAM 2 em 37 conjuntos de dados diferentes, incluindo 23 nos quais o SAM tinha sido testado anteriormente.

Fig. 1. Comparação entre o SAM e o SAM 2.
Curiosamente, o SAM 2 da Meta AI foi desenvolvido através da criação do maior conjunto de dados de segmentação de vídeos até à data, o conjunto de dados SA-V. Este extenso conjunto de dados inclui mais de 50 000 vídeos e 35,5 milhões de máscaras de segmentação, tendo sido recolhido através de contribuições interativas dos utilizadores. Os anotadores forneceram prompts e correções para ajudar o modelo a aprender com uma grande variedade de cenários e tipos de objetos.
Aplicações do Modelo Segment Anything 2#
Graças às suas capacidades avançadas de segmentação de imagens e vídeos, o SAM 2 pode ser utilizado em vários setores. Vamos explorar algumas destas aplicações.
O SAM 2 permite aplicações de Realidade Aumentada (AR) e Realidade Virtual (VR)#
O novo modelo de segmentação da Meta AI pode ser utilizado em aplicações de Realidade Aumentada (AR) e Realidade Virtual (VR). Por exemplo, o SAM 2 consegue identificar e segmentar objetos do mundo real com precisão, tornando a interação com objetos virtuais mais realista. Pode ser útil em várias áreas, como jogos, educação e formação, nas quais uma interação realista entre elementos virtuais e reais é essencial.
À medida que dispositivos como óculos de AR se tornam mais avançados, as capacidades do SAM 2 poderão em breve ser integradas neles. Imagina colocar os óculos e olhar à tua volta na sala de estar. Quando os óculos segmentarem e detetarem a tigela de água do teu cão, poderão lembrar-te de a encher, como mostrado na imagem abaixo. Ou, se estiveres a cozinhar uma receita nova, os óculos poderão identificar os ingredientes na bancada e fornecer instruções e sugestões passo a passo, melhorando a tua experiência culinária e garantindo que tens todos os itens necessários à mão.

Fig. 2. O SAM 2 poderá em breve ser utilizado em óculos de AR.
Imagens de sonar com o Modelo Segment Anything 2#
A investigação com o modelo SAM demonstrou que ele pode ser aplicado em domínios especializados, como imagens de sonar. As imagens de sonar apresentam desafios únicos devido à sua baixa resolução, aos elevados níveis de ruído e às formas complexas dos objetos presentes nas imagens. Ao ajustar o SAM para imagens de sonar, os investigadores demonstraram a sua capacidade de segmentar com precisão vários objetos subaquáticos, como detritos marinhos, formações geológicas e outros elementos de interesse. Imagens subaquáticas precisas e fiáveis podem ser utilizadas na investigação marinha, na arqueologia subaquática, na gestão das pescas e na vigilância para tarefas como o mapeamento de habitats, a descoberta de artefactos e a deteção de ameaças.

Fig. 3. Exemplo de utilização do SAM ajustado para a segmentação de imagens de sonar.
Como o SAM 2 se baseia no SAM e melhora muitos dos desafios que este enfrenta, tem potencial para melhorar ainda mais a análise de imagens de sonar. As suas capacidades de segmentação precisa podem ajudar em várias aplicações marinhas, incluindo a investigação científica e as pescas. Por exemplo, o SAM 2 consegue delimitar eficazmente estruturas subaquáticas, detetar detritos marinhos e identificar objetos em imagens de sonar de visão frontal, contribuindo para uma exploração e monitorização subaquáticas mais precisas e eficientes.
Eis alguns dos potenciais benefícios da utilização do SAM 2 para analisar imagens de sonar:
- Eficiência: Reduz o tempo e o esforço necessários para a segmentação manual, permitindo que os profissionais se concentrem mais na análise e na tomada de decisões.
- Consistência: Fornece resultados de segmentação consistentes e reproduzíveis, essenciais para a investigação e a monitorização marinhas em grande escala.
- Versatilidade: É capaz de lidar com uma ampla variedade de imagens de sonar, sendo útil para diversas aplicações na ciência e na indústria marinhas.
Ao integrar o SAM 2 nos processos de imagens de sonar, a indústria marinha pode alcançar maior eficiência, precisão e fiabilidade na exploração e análise subaquáticas, conduzindo, em última análise, a melhores resultados na investigação marinha.
Utilização do SAM 2 em veículos autónomos#
Outra aplicação do SAM 2 é em veículos autónomos. O SAM 2 consegue identificar com precisão objetos como peões, outros veículos, sinais de trânsito e obstáculos em tempo real. O nível de detalhe que o SAM 2 fornece é essencial para tomar decisões de navegação segura e evitar colisões. Ao processar dados visuais com precisão, o SAM 2 ajuda a criar um mapa detalhado e fiável do ambiente, conduzindo a melhores decisões.

Fig. 4. Utilização da segmentação para compreender o trânsito.
A capacidade do SAM 2 de funcionar bem em diferentes condições de iluminação, alterações meteorológicas e ambientes dinâmicos torna-o fiável para veículos autónomos. Quer se trate de uma rua urbana movimentada ou de uma autoestrada com nevoeiro, o SAM 2 consegue identificar e segmentar objetos com precisão e de forma consistente, para que o veículo possa responder corretamente a várias situações.
No entanto, há algumas limitações a ter em conta. Em objetos complexos e que se movem rapidamente, o SAM 2 pode por vezes não detetar detalhes finos, e as suas previsões podem tornar-se instáveis entre fotogramas. Além disso, o SAM 2 pode por vezes confundir vários objetos semelhantes em cenas povoadas. Estes desafios explicam por que razão a integração de sensores e tecnologias adicionais é fundamental nas aplicações de condução autónoma.
Monitorização ambiental com a ajuda do SAM 2#
A monitorização ambiental com recurso à visão computacional pode ser difícil, especialmente quando há falta de dados anotados, mas é precisamente isso que torna esta uma aplicação interessante para o SAM 2. O SAM 2 pode ser utilizado para acompanhar e analisar alterações em paisagens naturais, segmentando e identificando com precisão várias características ambientais, como florestas, massas de água, áreas urbanas e terrenos agrícolas, a partir de imagens de satélite ou de drones. Mais especificamente, a segmentação precisa ajuda a monitorizar a desflorestação, a urbanização e as alterações na utilização dos terrenos ao longo do tempo, fornecendo dados valiosos para a conservação ambiental e o planeamento.

Eis alguns dos benefícios da utilização de um modelo como o SAM 2 para analisar alterações ambientais ao longo do tempo:
- Deteção precoce: Identifica sinais iniciais de degradação ambiental, permitindo intervenções atempadas para evitar danos adicionais.
- Gestão de recursos: Ajuda a gerir os recursos naturais de forma eficiente, fornecendo informações detalhadas sobre o estado de várias características ambientais.
- Conservação da biodiversidade: Ajuda a acompanhar a fauna e a monitorizar a biodiversidade, contribuindo para os esforços de conservação e a proteção de espécies ameaçadas.
- Resposta a catástrofes: Ajuda a avaliar o impacto de catástrofes naturais, como inundações, incêndios florestais e furacões, permitindo uma resposta rápida e eficaz e o planeamento da recuperação.
Edição de vídeo com o SAM 2: experimenta por ti próprio#
A Demonstração do Segment Anything 2 é uma excelente forma de experimentares o modelo num vídeo. Utilizando as capacidades de PVS do SAM 2, pegámos num antigo vídeo do YouTube da Ultralytics e conseguimos segmentar três objetos ou pessoas no vídeo e pixelizá-los. Tradicionalmente, editar três pessoas num vídeo deste tipo seria demorado e trabalhoso, exigindo a criação manual de máscaras fotograma a fotograma. No entanto, o SAM 2 simplifica este processo. Com alguns cliques na demonstração, podes proteger a identidade de três objetos de interesse em questão de segundos.

Fig. 6. Experimentar a demonstração do SAM 2.
A demonstração também permite experimentar alguns efeitos visuais diferentes, como colocar um foco de luz sobre os objetos selecionados para seguimento e apagar os objetos que estão a ser seguidos. Se gostaste da demonstração e estás pronto para começar a inovar com o SAM 2, consulta a página da documentação do modelo SAM 2 da Ultralytics para obter instruções detalhadas sobre como trabalhar com o modelo. Explora as funcionalidades, os passos de instalação e os exemplos para tirar o máximo partido do potencial do SAM 2 nos teus projetos!
Conclusão#
O Modelo Segment Anything 2 (SAM 2) da Meta AI está a transformar a segmentação de vídeos e imagens. À medida que tarefas como o seguimento de objetos melhoram, estamos a descobrir novas oportunidades na edição de vídeo, na realidade mista, na investigação científica e na imagiologia médica. Ao tornar as tarefas complexas mais fáceis e acelerar as anotações, o SAM 2 está preparado para se tornar uma ferramenta importante para a comunidade de IA. À medida que continuamos a explorar e a inovar com modelos como o SAM 2, podemos antecipar ainda mais aplicações inovadoras e avanços em vários domínios!
Fica a saber mais sobre IA explorando o nosso repositório no GitHub e juntando-te à nossa comunidade. Consulta as nossas páginas de soluções para obter informações detalhadas sobre IA na indústria transformadora e nos cuidados de saúde. 🚀









