YOLO Vision 2026:
Volver al glosario de Ultralytics

Vision Mamba

Explora Vision Mamba, una alternativa de complejidad lineal a los Transformers. Aprende cómo los modelos de espacio de estados (SSM) mejoran la eficiencia para la visión artificial de alta resolución.

Vision Mamba representa un cambio significativo en las arquitecturas de aprendizaje profundo para visión artificial, alejándose del dominio de los mecanismos basados en atención presentes en los Transformers. Es una adaptación de la arquitectura Mamba —diseñada originalmente para el modelado eficiente de secuencias en el procesamiento de lenguaje natural— adaptada específicamente para tareas visuales. Al aprovechar los modelos de espacio de estados (SSMs), Vision Mamba ofrece una alternativa de complejidad lineal frente a la complejidad cuadrática de las capas tradicionales de autoatención. Esto le permite procesar imágenes de alta resolución de manera más eficiente, lo que la hace especialmente valiosa para aplicaciones donde los recursos computacionales son limitados o donde es necesario capturar dependencias de largo alcance en los datos visuales sin el fuerte consumo de memoria típico de Vision Transformers (ViT).

Cómo funciona Vision Mamba#

En el núcleo de Vision Mamba se encuentra el concepto de escanear datos de forma selectiva. Las Convolutional Neural Networks (CNNs) tradicionales procesan imágenes utilizando ventanas deslizantes locales, las cuales son excelentes para detectar texturas y bordes, pero tienen dificultades con el contexto global. Por el contrario, los Transformers utilizan atención global para relacionar cada píxel (o parche) con todos los demás, lo que proporciona un contexto excelente pero se vuelve computacionalmente costoso a medida que aumenta la resolución de la imagen. Vision Mamba cierra esta brecha aplanando las imágenes en secuencias y procesándolas mediante espacios de estados selectivos. Esto permite que el modelo comprima la información visual en un estado de tamaño fijo, reteniendo detalles relevantes a largas distancias en la secuencia de imagen mientras descarta el ruido irrelevante.

La arquitectura normalmente implica un mecanismo de escaneo bidireccional. Dado que las imágenes son estructuras en 2D y no son inherentemente secuenciales como el texto, Vision Mamba escanea los parches de imagen en direcciones hacia adelante y hacia atrás (y a veces en rutas variadas) para garantizar que las relaciones espaciales se comprendan independientemente del orden de escaneo. Este enfoque permite que el modelo logre receptive fields globales similares a los de los Transformers, pero con velocidades de inferencia más rápidas y un menor uso de memoria, compitiendo a menudo con los mejores resultados en benchmarks como ImageNet.

Aplicaciones en el mundo real#

La eficiencia de Vision Mamba lo hace altamente relevante para entornos con recursos limitados y tareas de alta resolución.

  • Análisis de imágenes médicas: En campos como la radiología, el análisis de exploraciones por resonancia magnética (RM) o tomografía computarizada (TC) de alta resolución requiere detectar anomalías sutiles que pueden estar espacialmente distantes dentro de una imagen grande. Vision Mamba puede procesar estos grandes archivos de medical image analysis de manera eficaz sin los cuellos de botella de memoria que a menudo afectan a los Transformers estándar, ayudando a los médicos a identificar tumores o fracturas con alta precisión.
  • Navegación autónoma en dispositivos de borde: Los coches autónomos y los drones dependen de la edge computing para procesar fuentes de video en tiempo real. El escalado lineal de Vision Mamba permite a estos sistemas gestionar entradas de video de alta velocidad de fotogramas para la object detection y la semantic segmentation de forma más eficiente que los modelos pesados de Transformers, garantizando tiempos de reacción más rápidos para decisiones críticas de seguridad.

Vision Mamba vs. Vision Transformers (ViT)#

Aunque ambas arquitecturas pretenden capturar el contexto global, difieren fundamentalmente en su funcionamiento.

  • Vision Transformer (ViT): Se basa en el attention mechanism, que calcula la relación entre cada par de parches de imagen. Esto da como resultado una complejidad cuadrática ($O(N^2)$), lo que significa que duplicar el tamaño de la imagen cuadruplica el costo computacional.
  • Vision Mamba: Utiliza modelos de espacio de estados (SSMs) para procesar tokens visuales de forma lineal ($O(N)$). Mantiene un estado dinámico que se actualiza a medida que observa nuevos parches, lo que le permite escalar mucho mejor con resoluciones más altas mientras mantiene una accuracy comparable.

Ejemplo: Flujo de trabajo de inferencia eficiente#

Aunque Vision Mamba es una arquitectura específica, sus principios de eficiencia se alinean con los objetivos de los modelos modernos en tiempo real como Ultralytics YOLO26. Los usuarios que buscan tareas de visión optimizadas pueden aprovechar la Ultralytics Platform para el entrenamiento y el despliegue. A continuación se muestra un ejemplo que utiliza el paquete ultralytics para ejecutar inferencia, demostrando la facilidad de usar modelos de visión altamente optimizados.

from ultralytics import YOLO

# Load a pre-trained YOLO26 model (optimized for speed and accuracy)
model = YOLO("yolo26n.pt")  # 'n' for nano, emphasizing efficiency

# Run inference on an image
results = model.predict("path/to/image.jpg")

# Display the results
results[0].show()

Beneficios clave y perspectivas de futuro#

La introducción de arquitecturas basadas en Mamba en la visión artificial señala una transición hacia una IA más consciente del hardware. Al reducir la sobrecarga computacional asociada con la global attention, los investigadores están abriendo puertas para desplegar AI agents avanzados en dispositivos más pequeños.

Las investigaciones recientes, como el VMamba paper y los desarrollos en efficient deep learning, destacan el potencial de estos modelos para reemplazar las espinas dorsales tradicionales en tareas que van desde la video understanding hasta la 3D object detection. A medida que la comunidad continúa perfeccionando las estrategias de escaneo y la integración con las convolutional layers, Vision Mamba se posiciona para convertirse en un componente estándar en la caja de herramientas de deep learning junto con las CNNs y los Transformers.

Explore solutions

Real-time AI that works with your team

IA en robótica

Potencia máquinas más inteligentes con modelos Ultralytics YOLO. La IA de visión en robótica impulsa la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Real-time AI that works with your team

IA en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La visión artificial por IA permite la inspección de paquetes, clasificación, seguimiento de vehículos y monitoreo de seguridad en almacenes en tiempo real.
Más información
Real-time AI that works with your team

IA en el sector minorista

Reimagina el comercio minorista con los modelos de Ultralytics YOLO. La visión artificial por IA potencia el seguimiento de inventario, el monitoreo de estantes, la gestión de colas y mejores perspectivas sobre los clientes.
Más información
Real-time AI that works with your team

IA en la atención sanitaria

Crea soluciones de salud con los modelos de Ultralytics YOLO. La IA de visión en la sanidad potencia imágenes médicas más rápidas, diagnósticos más inteligentes y supervisión de pacientes.
Más información
Real-time AI that works with your team

IA en la fabricación

Optimiza la fabricación con los modelos de Ultralytics YOLO. La visión artificial por IA impulsa el control de calidad, la detección de defectos, el cumplimiento del uso de PPE y la automatización de la línea de montaje.
Más información
Real-time AI that works with your operation

IA en automoción

Aplica la visión artificial en el sector automotriz con los modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para carreteras más inteligentes.
Más información
Real-time AI tailored to your operation

IA en agricultura

Lleva la visión artificial a la agricultura inteligente con los modelos de Ultralytics YOLO. Potencia el seguimiento de cultivos, el control del ganado y la agricultura de precisión para obtener rendimientos mayores y más inteligentes.
Más información
Real-time AI that works with your team

IA en robótica

Potencia máquinas más inteligentes con modelos Ultralytics YOLO. La IA de visión en robótica impulsa la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Real-time AI that works with your team

IA en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La visión artificial por IA permite la inspección de paquetes, clasificación, seguimiento de vehículos y monitoreo de seguridad en almacenes en tiempo real.
Más información
Real-time AI that works with your team

IA en el sector minorista

Reimagina el comercio minorista con los modelos de Ultralytics YOLO. La visión artificial por IA potencia el seguimiento de inventario, el monitoreo de estantes, la gestión de colas y mejores perspectivas sobre los clientes.
Más información
Real-time AI that works with your team

IA en la atención sanitaria

Crea soluciones de salud con los modelos de Ultralytics YOLO. La IA de visión en la sanidad potencia imágenes médicas más rápidas, diagnósticos más inteligentes y supervisión de pacientes.
Más información
Real-time AI that works with your team

IA en la fabricación

Optimiza la fabricación con los modelos de Ultralytics YOLO. La visión artificial por IA impulsa el control de calidad, la detección de defectos, el cumplimiento del uso de PPE y la automatización de la línea de montaje.
Más información
Real-time AI that works with your operation

IA en automoción

Aplica la visión artificial en el sector automotriz con los modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para carreteras más inteligentes.
Más información
Real-time AI tailored to your operation

IA en agricultura

Lleva la visión artificial a la agricultura inteligente con los modelos de Ultralytics YOLO. Potencia el seguimiento de cultivos, el control del ganado y la agricultura de precisión para obtener rendimientos mayores y más inteligentes.
Más información
Real-time AI that works with your team

IA en robótica

Potencia máquinas más inteligentes con modelos Ultralytics YOLO. La IA de visión en robótica impulsa la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Real-time AI that works with your team

IA en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La visión artificial por IA permite la inspección de paquetes, clasificación, seguimiento de vehículos y monitoreo de seguridad en almacenes en tiempo real.
Más información
Real-time AI that works with your team

IA en el sector minorista

Reimagina el comercio minorista con los modelos de Ultralytics YOLO. La visión artificial por IA potencia el seguimiento de inventario, el monitoreo de estantes, la gestión de colas y mejores perspectivas sobre los clientes.
Más información
Real-time AI that works with your team

IA en la atención sanitaria

Crea soluciones de salud con los modelos de Ultralytics YOLO. La IA de visión en la sanidad potencia imágenes médicas más rápidas, diagnósticos más inteligentes y supervisión de pacientes.
Más información
Real-time AI that works with your team

IA en la fabricación

Optimiza la fabricación con los modelos de Ultralytics YOLO. La visión artificial por IA impulsa el control de calidad, la detección de defectos, el cumplimiento del uso de PPE y la automatización de la línea de montaje.
Más información
Real-time AI that works with your operation

IA en automoción

Aplica la visión artificial en el sector automotriz con los modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para carreteras más inteligentes.
Más información
Real-time AI tailored to your operation

IA en agricultura

Lleva la visión artificial a la agricultura inteligente con los modelos de Ultralytics YOLO. Potencia el seguimiento de cultivos, el control del ganado y la agricultura de precisión para obtener rendimientos mayores y más inteligentes.
Más información

¡Construyamos juntos el futuro de la IA!

Comienza tu viaje con el futuro del aprendizaje automático