YOLO Vision 2026:
Voltar para o Glossário da Ultralytics

Vision Mamba

Explora Vision Mamba, uma alternativa de complexidade linear aos Transformers. Aprende como State Space Models (SSMs) aumentam a eficiência para visão computacional de alta resolução.

O Vision Mamba representa uma mudança significativa nas arquiteturas de deep learning para computer vision, afastando-se do domínio dos mecanismos baseados em atenção encontrados nos Transformers. É uma adaptação da arquitetura Mamba — originalmente concebida para modelagem eficiente de sequências em processamento de linguagem natural — adaptada especificamente para tarefas visuais. Ao aproveitar Modelos de Espaço de Estados (SSMs), o Vision Mamba oferece uma alternativa de complexidade linear à complexidade quadrática das camadas tradicionais de autoatenção. Isso permite que ele processe imagens de alta resolução com mais eficiência, tornando-o particularmente valioso para aplicações onde os recursos computacionais são limitados ou onde dependências de longo alcance em dados visuais devem ser capturadas sem o alto consumo de memória típico dos Vision Transformers (ViT).

Como o Vision Mamba funciona#

No núcleo do Vision Mamba está o conceito de escaneamento seletivo de dados. As tradicionais Convolutional Neural Networks (CNNs) processam imagens usando janelas deslizantes locais, que são excelentes para detectar texturas e bordas, mas têm dificuldades com o contexto global. Por outro lado, os Transformers usam atenção global para relacionar cada pixel (ou patch) a todos os outros pixels, o que fornece um contexto excelente, mas se torna computacionalmente caro à medida que a resolução da imagem aumenta. O Vision Mamba preenche essa lacuna achatando imagens em sequências e processando-as usando espaços de estados seletivos. Isso permite que o modelo comprima informações visuais em um estado de tamanho fixo, retendo detalhes relevantes em longas distâncias na sequência de imagens enquanto descarta ruídos irrelevantes.

A arquitetura normalmente envolve um mecanismo de escaneamento bidimensional. Como as imagens são estruturas 2D e não inerentemente sequenciais como o texto, o Vision Mamba escaneia os patches de imagem nasdireções para frente e para trás (e às vezes em caminhos variados) para garantir que as relações espaciais sejam compreendidas independentemente da ordem de escaneamento. Essa abordagem permite que o modelo atinja receptive fields globais semelhantes aos dos Transformers, mas com velocidades de inferência mais rápidas e menor uso de memória, muitas vezes rivalizando com resultados de última geração em benchmarks como o ImageNet.

Aplicações no Mundo Real#

A eficiência do Vision Mamba o torna altamente relevante para ambientes com recursos limitados e tarefas de alta resolução.

  • Análise de Imagens Médicas: Em áreas como a radiologia, a análise de exames de ressonância magnética ou tomografia computadorizada de alta resolução exige a detecção de anomalias sutis que podem estar espacialmente distantes dentro de uma imagem grande. O Vision Mamba pode processar esses arquivos grandes de medical image analysis de forma eficaz, sem os gargalos de memória que frequentemente afetam os Transformers padrão, auxiliando os médicos na identificação de tumores ou fraturas com alta precisão.
  • Navegação Autônoma em Dispositivos Edge: Carros autônomos e drones dependem da edge computing para processar feeds de vídeo em tempo real. O dimensionamento linear do Vision Mamba permite que esses sistemas lidem com entradas de vídeo de alta taxa de quadros para object detection e semantic segmentation de forma mais eficiente do que modelos Transformer pesados, garantindo tempos de reação mais rápidos para decisões críticas de segurança.

Vision Mamba vs. Vision Transformers (ViT)#

Embora ambas as arquiteturas visem capturar o contexto global, elas diferem fundamentalmente na operação.

  • Vision Transformer (ViT): Baseia-se no attention mechanism, que calcula a relação entre cada par de patches de imagem. Isso resulta em complexidade quadrática ($O(N^2)$), o que significa que dobrar o tamanho da imagem quadruplica o custo computacional.
  • Vision Mamba: Utiliza Modelos de Espaço de Estados (SSMs) para processar tokens visuais linearmente ($O(N)$). Ele mantém um estado de execução que é atualizado à medida que vê novos patches, permitindo que ele escale muito melhor com resoluções mais altas enquanto mantém uma accuracy comparável.

Exemplo: Fluxo de Trabalho de Inferência Eficiente#

Embora o Vision Mamba seja uma arquitetura específica, seus princípios de eficiência se alinham com os objetivos de modelos modernos em tempo real como o Ultralytics YOLO26. Usuários que buscam tarefas de visão otimizadas podem aproveitar a Ultralytics Platform para treinamento e implantação. Abaixo está um exemplo usando o pacote ultralytics para executar a inferência, demonstrando a facilidade de usar modelos de visão altamente otimizados.

from ultralytics import YOLO

# Load a pre-trained YOLO26 model (optimized for speed and accuracy)
model = YOLO("yolo26n.pt")  # 'n' for nano, emphasizing efficiency

# Run inference on an image
results = model.predict("path/to/image.jpg")

# Display the results
results[0].show()

Principais Benefícios e Perspectivas Futuras#

A introdução de arquiteturas baseadas em Mamba na computer vision sinaliza uma mudança em direção a uma IA mais consciente do hardware. Ao reduzir a sobrecarga computacional associada à global attention, os pesquisadores estão abrindo portas para a implantação de AI agents avançados em dispositivos menores.

Pesquisas recentes, como o VMamba paper e desenvolvimentos em efficient deep learning, destacam o potencial desses modelos para substituir backbones tradicionais em tarefas que vão desde video understanding até 3D object detection. À medida que a comunidade continua a refinar estratégias de escaneamento e a integração com convolutional layers, o Vision Mamba está preparado para se tornar um componente padrão na caixa de ferramentas de deep learning ao lado de CNNs e Transformers.

Explore solutions

Real-time AI that works with your team

IA em robótica

Potencialize máquinas mais inteligentes com modelos Ultralytics YOLO. A IA de visão em robótica impulsiona a navegação autônoma, percepção, rastreamento de objetos e controle em tempo real.
Sabe mais
Real-time AI that works with your team

IA na Logística

Otimize a logística com modelos Ultralytics YOLO. A IA de visão permite a inspeção de pacotes, triagem, rastreamento de veículos e monitoramento de segurança em armazéns em tempo real.
Sabe mais
Real-time AI that works with your team

IA no varejo

Reinvente o varejo com modelos Ultralytics YOLO. A IA de visão impulsiona o rastreamento de inventário, monitoramento de prateleiras, gerenciamento de filas e percepções mais inteligentes sobre o cliente.
Sabe mais
Real-time AI that works with your team

IA na Saúde

Constrói soluções de saúde com modelos Ultralytics YOLO. A visão AI na saúde impulsiona imagens médicas mais rápidas, diagnósticos mais inteligentes e monitorização do paciente.
Sabe mais
Real-time AI that works with your team

IA na Fabricação

Otimize a fabricação com modelos Ultralytics YOLO. A IA de visão impulsiona o controle de qualidade, detecção de defeitos, conformidade com EPI e automação de linhas de montagem.
Sabe mais
Real-time AI that works with your operation

IA no Setor Automóvel

Aplica visão computacional no setor automóvel com modelos Ultralytics YOLO. A visão AI eleva a segurança rodoviária, a assistência ao condutor e a automação de veículos para estradas mais inteligentes.
Sabe mais
Real-time AI tailored to your operation

IA na Agricultura

Leva a visão AI para a agricultura inteligente com os modelos Ultralytics YOLO. Potencia a monitorização de culturas, o seguimento de gado e a agricultura de precisão para colheitas maiores e mais inteligentes.
Sabe mais
Real-time AI that works with your team

IA em robótica

Potencialize máquinas mais inteligentes com modelos Ultralytics YOLO. A IA de visão em robótica impulsiona a navegação autônoma, percepção, rastreamento de objetos e controle em tempo real.
Sabe mais
Real-time AI that works with your team

IA na Logística

Otimize a logística com modelos Ultralytics YOLO. A IA de visão permite a inspeção de pacotes, triagem, rastreamento de veículos e monitoramento de segurança em armazéns em tempo real.
Sabe mais
Real-time AI that works with your team

IA no varejo

Reinvente o varejo com modelos Ultralytics YOLO. A IA de visão impulsiona o rastreamento de inventário, monitoramento de prateleiras, gerenciamento de filas e percepções mais inteligentes sobre o cliente.
Sabe mais
Real-time AI that works with your team

IA na Saúde

Constrói soluções de saúde com modelos Ultralytics YOLO. A visão AI na saúde impulsiona imagens médicas mais rápidas, diagnósticos mais inteligentes e monitorização do paciente.
Sabe mais
Real-time AI that works with your team

IA na Fabricação

Otimize a fabricação com modelos Ultralytics YOLO. A IA de visão impulsiona o controle de qualidade, detecção de defeitos, conformidade com EPI e automação de linhas de montagem.
Sabe mais
Real-time AI that works with your operation

IA no Setor Automóvel

Aplica visão computacional no setor automóvel com modelos Ultralytics YOLO. A visão AI eleva a segurança rodoviária, a assistência ao condutor e a automação de veículos para estradas mais inteligentes.
Sabe mais
Real-time AI tailored to your operation

IA na Agricultura

Leva a visão AI para a agricultura inteligente com os modelos Ultralytics YOLO. Potencia a monitorização de culturas, o seguimento de gado e a agricultura de precisão para colheitas maiores e mais inteligentes.
Sabe mais
Real-time AI that works with your team

IA em robótica

Potencialize máquinas mais inteligentes com modelos Ultralytics YOLO. A IA de visão em robótica impulsiona a navegação autônoma, percepção, rastreamento de objetos e controle em tempo real.
Sabe mais
Real-time AI that works with your team

IA na Logística

Otimize a logística com modelos Ultralytics YOLO. A IA de visão permite a inspeção de pacotes, triagem, rastreamento de veículos e monitoramento de segurança em armazéns em tempo real.
Sabe mais
Real-time AI that works with your team

IA no varejo

Reinvente o varejo com modelos Ultralytics YOLO. A IA de visão impulsiona o rastreamento de inventário, monitoramento de prateleiras, gerenciamento de filas e percepções mais inteligentes sobre o cliente.
Sabe mais
Real-time AI that works with your team

IA na Saúde

Constrói soluções de saúde com modelos Ultralytics YOLO. A visão AI na saúde impulsiona imagens médicas mais rápidas, diagnósticos mais inteligentes e monitorização do paciente.
Sabe mais
Real-time AI that works with your team

IA na Fabricação

Otimize a fabricação com modelos Ultralytics YOLO. A IA de visão impulsiona o controle de qualidade, detecção de defeitos, conformidade com EPI e automação de linhas de montagem.
Sabe mais
Real-time AI that works with your operation

IA no Setor Automóvel

Aplica visão computacional no setor automóvel com modelos Ultralytics YOLO. A visão AI eleva a segurança rodoviária, a assistência ao condutor e a automação de veículos para estradas mais inteligentes.
Sabe mais
Real-time AI tailored to your operation

IA na Agricultura

Leva a visão AI para a agricultura inteligente com os modelos Ultralytics YOLO. Potencia a monitorização de culturas, o seguimento de gado e a agricultura de precisão para colheitas maiores e mais inteligentes.
Sabe mais

Vamos construir o futuro da IA juntos!

Começa a tua jornada com o futuro da aprendizagem automática