Ultralytics YOLO27:
IA para visão

A explorar o SAM 3: o novo Segment Anything Model da Meta AI

Descobre como o SAM 3, o novo Segment Anything Model da Meta AI, facilita a deteção, a segmentação e o rastreamento de objetos em imagens e vídeos do mundo real.

ABAbirami Vina12 min read
O Segment Anything Model SAM 3 da Meta AI

Em 19 de novembro de 2025, a Meta AI lançou o Segment Anything Model 3, também conhecido como SAM 3. Esta versão mais recente do Segment Anything Model introduz novas formas de detetar, segmentar e acompanhar objetos em imagens e vídeos do mundo real usando prompts de texto, prompts visuais e exemplos de imagens.

O modelo SAM 3 baseia-se no SAM e no SAM 2 e traz novos avanços e funcionalidades, como segmentação por conceitos, deteção de vocabulário aberto e acompanhamento de vídeo em tempo real. Consegue compreender frases nominais curtas, acompanhar objetos entre frames e identificar conceitos específicos ou raros que os modelos anteriores não conseguiam tratar de forma tão consistente.

Como parte do lançamento do SAM 3, a Meta também apresentou o SAM 3D. Este conjunto de modelos de próxima geração reconstrói objetos, cenas e corpos humanos completos a partir de uma única imagem, expandindo o ecossistema Segment Anything para a compreensão 3D. Estas novidades abrem caminho a novas aplicações em visão computacional, robótica, edição multimédia e fluxos de trabalho criativos.

Neste artigo, vamos explorar o que é o SAM 3, o que o distingue do SAM 2, como o modelo funciona e quais são as suas aplicações no mundo real. Vamos começar!

O que é o SAM 3? Uma análise ao Segment Anything Model 3 da Meta#

O SAM 3 é um modelo de visão computacional de última geração que consegue identificar, separar e acompanhar objetos em imagens e vídeos com base em instruções simples. Em vez de depender de uma lista fixa de rótulos, o SAM 3 compreende linguagem natural e pistas visuais, o que facilita indicar ao modelo o que queres encontrar.

Por exemplo, com o SAM 3, podes escrever uma frase curta como “yellow school bus” ou “a striped cat”, clicar num objeto ou destacar um exemplo numa imagem. O modelo deteta então todos os objetos correspondentes e gera máscaras de segmentação limpas (um contorno visual que mostra exatamente que píxeis pertencem a um objeto). O SAM 3 também consegue acompanhar esses objetos entre frames de vídeo, mantendo a sua consistência à medida que se movem.

O SAM 3D permite a reconstrução 3D a partir de uma única imagem#

Outra parte interessante do anúncio da Meta AI é o SAM 3D, que expande o projeto Segment Anything para a compreensão 3D. O SAM 3D pode receber uma única imagem 2D e reconstruir a forma, a pose ou a estrutura de um objeto ou corpo humano em três dimensões. Por outras palavras, o modelo consegue estimar como algo ocupa o espaço mesmo quando só está disponível um ponto de vista.

O SAM 3D foi lançado como dois modelos diferentes: o SAM 3D Objects, que reconstrói objetos do dia a dia com geometria e textura, e o SAM 3D Body, que estima a forma e a pose do corpo humano a partir de uma única imagem. Ambos os modelos usam a saída de segmentação do SAM 3 e geram depois uma representação 3D alinhada com a aparência e a posição do objeto na fotografia original.

Um exemplo da utilização do SAM 3D

Fig. 1. Um exemplo da utilização do SAM 3D. (Fonte: criado com o playground segment anything da Meta AI)

SAM 3: novas funcionalidades para unificar deteção, segmentação e acompanhamento#

Eis algumas das principais atualizações introduzidas pelo SAM 3 para reunir a deteção, a segmentação e o acompanhamento num único modelo unificado:

  • Tarefas de segmentação por conceitos: No SAM e no SAM 2, a segmentação de objetos dependia de prompts visuais, como cliques ou caixas. O SAM 3 acrescenta a capacidade de segmentar objetos com base numa frase de texto curta ou num recorte de exemplo da imagem. Isto significa que o modelo consegue identificar todas as instâncias correspondentes sem exigir um clique em cada uma.
  • Prompts de texto de vocabulário aberto: Ao contrário das versões anteriores, o SAM 3 consegue interpretar frases curtas em linguagem natural. Isto elimina a necessidade de uma lista fixa de rótulos e permite ao modelo trabalhar com conceitos mais específicos ou menos comuns.
  • Um modelo para deteção, segmentação e acompanhamento: O SAM 3 unifica a deteção, a segmentação e o acompanhamento num único modelo, eliminando a necessidade de sistemas separados para encontrar objetos, gerar máscaras de segmentação e acompanhá-los entre frames de vídeo. Isto cria um fluxo de trabalho mais consistente e simplificado tanto para imagens como para vídeo. Embora o SAM 2 também oferecesse algumas capacidades de acompanhamento, o SAM 3 proporciona um desempenho significativamente mais forte e fiável.
  • Resultados mais estáveis em cenas complexas: Como o SAM 3 consegue combinar texto, imagens de exemplo e prompts visuais, lida com cenas desorganizadas ou repetitivas de forma mais fiável do que as versões anteriores, que dependiam apenas de cliques visuais.

Segmentação por conceitos do SAM 3 com texto ou exemplos de imagens

Fig. 2. O SAM 3 introduz a segmentação por conceitos com texto ou exemplos de imagens. (Fonte)

Comparação entre SAM 3, SAM 2 e SAM 1#

Imagina que estás a assistir a um vídeo de um safari com muitos animais diferentes e queres detetar e segmentar apenas os elefantes. Como seria esta tarefa nas diferentes versões do SAM?

Com o SAM, terias de clicar manualmente em cada elefante em cada frame para gerar uma máscara de segmentação. Não existe acompanhamento, por isso cada novo frame exige novos cliques.

Com o SAM 2, poderias clicar uma vez num elefante, obter a sua máscara e o modelo acompanharia esse mesmo elefante ao longo do vídeo. No entanto, continuarias a ter de fornecer cliques separados se quisesses segmentar vários elefantes (objetos específicos), uma vez que o SAM 2 não compreende categorias como “elefante” por si só.

Com o SAM 3, o fluxo de trabalho torna-se muito mais simples. Podes escrever “elefante” ou desenhar uma caixa delimitadora em torno de um único elefante para fornecer um exemplo, e o modelo encontrará automaticamente todos os elefantes no vídeo, segmentá-los-á e acompanhá-los-á de forma consistente entre frames. Continua a suportar os prompts de clique e de caixa usados nas versões anteriores, mas agora também consegue responder a prompts de texto e imagens exemplificativas, algo que o SAM e o SAM 2 não conseguiam fazer.

Como funciona o modelo SAM 3#

De seguida, vamos analisar mais atentamente como funciona o modelo SAM 3 e como foi treinado.

Uma visão geral da arquitetura do modelo SAM 3#

O SAM 3 reúne vários componentes para suportar prompts de conceitos e prompts visuais num único sistema. No seu núcleo, o modelo utiliza o Meta Perception Encoder, o codificador unificado de imagens e texto de código aberto da Meta.

Este codificador consegue processar tanto imagens como frases nominais curtas. Em termos simples, isto permite ao SAM 3 relacionar características linguísticas e visuais de forma mais eficaz do que as versões anteriores do Segment Anything Model.

Sobre este codificador, o SAM 3 inclui um detetor baseado na família de modelos Transformer DETR. Este detetor identifica objetos na imagem e ajuda o sistema a determinar quais correspondem ao prompt do utilizador.

Especificamente, para a segmentação de vídeo, o SAM 3 utiliza um componente de acompanhamento que se baseia no banco de memória e no codificador de memória do SAM 2. Isto permite ao modelo manter informações sobre os objetos entre frames, para que os possa voltar a identificar e acompanhar ao longo do tempo.

Como funciona a segmentação de qualquer objeto com conceitos

Fig. 3. Como funciona a segmentação de qualquer objeto com conceitos (Fonte: scontent)

O motor de dados escalável por trás do Segment Anything Model 3#

Para treinar o SAM 3, a Meta precisava de muito mais dados anotados do que os atualmente existentes na Internet. As máscaras de segmentação e os rótulos de texto de alta qualidade são difíceis de criar em grande escala, e delinear completamente todas as instâncias de um conceito em imagens e vídeos é um processo lento e dispendioso.

Para resolver este problema, a Meta criou um novo motor de dados que combina o próprio SAM 3, modelos de IA adicionais e anotadores humanos a trabalhar em conjunto. O fluxo de trabalho começa com um pipeline de sistemas de IA, incluindo o SAM 3 e um modelo de legendagem baseado em Llama.

Estes sistemas analisam grandes coleções de imagens e vídeos, geram legendas, convertem-nas em rótulos de texto e produzem candidatos iniciais a máscaras de segmentação. Os anotadores humanos e de IA analisam depois estes candidatos.

Os anotadores de IA, treinados para igualar ou até superar a precisão humana em tarefas como verificar a qualidade das máscaras e confirmar a cobertura dos conceitos, filtram os casos simples. Os humanos intervêm apenas nos exemplos mais desafiantes, nos quais o modelo ainda pode ter dificuldades.

Motor de dados do SAM 3

Fig. 4. Motor de dados do SAM 3 (Fonte)

Esta abordagem proporciona à Meta um grande aumento na velocidade de anotação. Ao permitir que os anotadores de IA tratem dos casos fáceis, o pipeline torna-se cerca de cinco vezes mais rápido com prompts negativos e 36% mais rápido com prompts positivos em domínios de granularidade fina.

Esta eficiência tornou possível ampliar o conjunto de dados para mais de quatro milhões de conceitos únicos. O ciclo constante de propostas de IA, correções humanas e previsões atualizadas do modelo também melhora a qualidade dos rótulos ao longo do tempo e ajuda o SAM 3 a aprender um conjunto muito mais amplo de conceitos visuais e baseados em texto.

Melhorias de desempenho do SAM 3#

Em termos de desempenho, o SAM 3 proporciona uma melhoria clara em relação aos modelos anteriores. No novo benchmark SA-Co da Meta, que avalia a deteção e a segmentação de conceitos de vocabulário aberto, o SAM 3 alcança aproximadamente o dobro do desempenho dos sistemas anteriores, tanto em imagens como em vídeo.

Também iguala ou supera o SAM 2 em tarefas visuais interativas, como point-to-mask e mask-to-masklet. A Meta relata ganhos adicionais em avaliações mais difíceis, como LVIS zero-shot (nas quais os modelos têm de reconhecer categorias raras sem exemplos de treino) e contagem de objetos (que mede se todas as instâncias de um objeto são detetadas), destacando uma generalização mais forte entre domínios.

Além destas melhorias de precisão, o SAM 3 é eficiente: processa uma imagem com mais de 100 objetos detetados em cerca de 30 milissegundos numa GPU H200 e mantém velocidades quase em tempo real ao acompanhar vários objetos em vídeo.

Aplicações do Segment Anything Model 3#

Agora que compreendemos melhor o SAM 3, vamos analisar como está a ser utilizado em aplicações reais, desde raciocínio avançado orientado por texto até investigação científica e aos próprios produtos da Meta.

Tratamento de consultas de texto complexas com o SAM 3 Agent#

O SAM 3 também pode ser utilizado como uma ferramenta dentro de um modelo de linguagem multimodal maior, ao qual a Meta chama SAM 3 Agent. Em vez de fornecer ao SAM 3 uma frase curta como “elefante”, o agente pode dividir uma pergunta mais complexa em prompts menores que o SAM 3 compreende.

Por exemplo, se o utilizador perguntar “Que objeto na imagem é utilizado para controlar e guiar um cavalo?”, o agente experimenta diferentes frases nominais, envia-as para o SAM 3 e verifica quais máscaras fazem sentido. Continua a aperfeiçoar o processo até encontrar o objeto correto.

Mesmo sem ter sido treinado em conjuntos de dados específicos para raciocínio, o SAM 3 Agent tem um bom desempenho em benchmarks concebidos para consultas de texto complexas, como ReasonSeg e OmniLabel. Isto mostra que o SAM 3 pode suportar sistemas que precisam tanto de compreensão linguística como de segmentação visual de granularidade fina.

Aplicações científicas e de conservação do SAM 3#

Curiosamente, o SAM 3 já está a ser utilizado em contextos de investigação nos quais os rótulos visuais detalhados são importantes. A Meta colaborou com a Conservation X Labs e a Osa Conservation para criar o SA-FARI, um conjunto de dados público de monitorização da vida selvagem com mais de 10 000 vídeos de armadilhas fotográficas.

Todos os animais em todos os frames são identificados com caixas e máscaras de segmentação, algo que demoraria imenso tempo a anotar manualmente. De forma semelhante, na investigação oceânica, o SAM 3 está a ser utilizado juntamente com a FathomNet e o MBARI para criar máscaras de segmentação de instâncias para imagens subaquáticas e apoiar novos benchmarks de avaliação.

Estes conjuntos de dados ajudam os cientistas a analisar imagens de vídeo de forma mais eficiente e a estudar animais e habitats que normalmente são difíceis de acompanhar em grande escala. Os investigadores também podem utilizar estes recursos para criar os seus próprios modelos de identificação de espécies, análise comportamental e monitorização ecológica automatizada.

Como a Meta está a implementar o SAM 3 nos seus produtos#

Para além das utilizações em investigação, o SAM 3 também está a impulsionar novas funcionalidades e casos de utilização nos produtos de consumo da Meta. Eis uma breve visão de algumas das formas como já está a ser integrado:

  • Edições no Instagram: Os criadores podem aplicar efeitos a uma pessoa ou objeto específico num vídeo sem terem de trabalhar manualmente frame a frame.
  • Aplicação Meta AI e meta.ai na Web: O SAM 3 suporta novas ferramentas para modificar, melhorar e remixar imagens e vídeos.
  • “View in Room” do Facebook Marketplace: O SAM 3 trabalha com o SAM 3D para permitir que as pessoas visualizem móveis ou decoração nas suas casas utilizando uma única fotografia.
  • Óculos de investigação Aria Gen 2: O Segment Anything Model 3 ajuda a segmentar e acompanhar mãos e objetos a partir de uma perspetiva na primeira pessoa, apoiando a realidade aumentada (AR), a robótica e a investigação em IA contextual.

Principais conclusões#

O SAM 3 representa um avanço entusiasmante na segmentação. Introduz segmentação por conceitos, prompts de texto de vocabulário aberto e um acompanhamento melhorado. Com um desempenho visivelmente superior tanto em imagens como em vídeo, e com a adição do SAM 3D, o conjunto de modelos abre novas possibilidades para a IA de visão, ferramentas criativas, investigação científica e produtos do mundo real.

Junta-te à nossa comunidade e explora o nosso repositório do GitHub para descobrires mais sobre IA. Se estás a pensar criar o teu próprio projeto de IA de visão, consulta as nossas opções de licenciamento. Descobre mais sobre aplicações como IA na área da saúde e IA de visão no retalho visitando as nossas páginas de soluções.

Explore solutions

Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais
Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais
Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais

Vamos construir juntos o futuro da IA!

Começa a tua jornada com o futuro da aprendizagem automática