Ultralytics YOLO27:
返回 Ultralytics 术语表

Vision Mamba

探索 Vision Mamba——一种复杂度为线性的 Transformer 替代方案。了解状态空间模型(SSM)如何提升高分辨率计算机视觉的效率。

Vision Mamba 标志着计算机视觉深度学习架构的一项重大转变,不再由 Transformer 中的注意力机制主导。它是 Mamba 架构的改编版本,Mamba 最初是为自然语言处理中的高效序列建模而设计的,Vision Mamba 则专为视觉任务量身打造。借助状态空间模型 (SSM),Vision Mamba 提供了一种线性复杂度方案,可替代传统自注意力层的二次复杂度方案。这样一来,它能更高效地处理高分辨率图像,尤其适用于计算资源受限,或需要捕捉视觉数据中长程依赖关系、又不想承受典型视觉 Transformer (ViT)庞大内存开销的应用场景。

Vision Mamba 的工作原理#

Vision Mamba 的核心概念是选择性扫描数据。传统的卷积神经网络 (CNN)使用局部滑动窗口处理图像,擅长检测纹理和边缘,却难以捕捉全局上下文。相反,Transformer 使用全局注意力建立每个像素(或图像块)与其他所有像素之间的关联,能够有效捕捉上下文,但图像分辨率越高,计算成本也越高。Vision Mamba 将图像展平为序列,并使用选择性状态空间处理,从而弥合这一差距。模型可以将视觉信息压缩到固定大小的状态中,在图像序列的长距离范围内保留相关细节,同时丢弃无关噪声。

该架构通常采用双向扫描机制。图像是二维结构,并不像文本那样天然具有序列性,因此 Vision Mamba 会沿正向和反向(有时还会沿不同路径)扫描图像块,确保无论扫描顺序如何,都能理解空间关系。这种方法使模型能够实现与 Transformer 类似的全局感受野,同时推理速度更快、内存用量更低,在 ImageNet 等基准测试上通常可与最先进的结果相媲美。

实际应用#

Vision Mamba 的高效率使其非常适用于资源受限环境和高分辨率任务。

  • 医学图像分析:在放射学等领域,分析高分辨率 MRI 或 CT 扫描图像时,需要检测大型图像中可能相距甚远的细微异常。Vision Mamba 能高效处理这些大型医学图像分析文件,不会受到标准 Transformer 常见的内存瓶颈影响,帮助医生高精度地识别肿瘤或骨折。
  • 边缘设备上的自主导航:自动驾驶汽车和无人机依靠边缘计算实时处理视频流。Vision Mamba 的线性扩展特性让这些系统能够比大型 Transformer 模型更高效地处理高帧率视频输入,用于目标检测和语义分割,从而加快安全关键决策的响应速度。

Vision Mamba 与视觉 Transformer (ViT)#

这两种架构都旨在捕捉全局上下文,但其运作方式有本质区别。

  • 视觉 Transformer (ViT):依靠注意力机制计算图像块两两之间的关系。这会带来二次复杂度($O(N^2)$),也就是说,图像尺寸翻倍,计算成本就会变为四倍。
  • Vision Mamba:使用状态空间模型 (SSM) 以线性方式处理视觉词元($O(N)$)。模型会维护一个运行状态,并在看到新图像块时更新该状态,因此能够更好地扩展到更高分辨率,同时保持相当的准确率。

示例:高效推理工作流#

Vision Mamba 虽是一种特定架构,但其高效原则与 Ultralytics YOLO26 等现代实时模型的目标一致。需要优化视觉任务的用户可以使用 Ultralytics Platform进行训练和部署。下面的示例使用 ultralytics 包运行推理,展示了使用高度优化视觉模型的便捷性。

from ultralytics import YOLO

# 加载预训练的 YOLO26 模型(针对速度和准确率进行了优化)
model = YOLO("yolo26n.pt")  # 'n' 表示 nano,突出其高效性

# 对图像运行推理
results = model.predict("path/to/image.jpg")

# 显示结果
results[0].show()

主要优势与未来展望#

将基于 Mamba 的架构引入计算机视觉,标志着 AI 正朝着更注重硬件特性的方向发展。通过降低全局注意力带来的计算开销,研究人员正为在小型设备上部署先进的AI 智能体开辟道路。

近期研究(如 VMamba 论文)以及高效深度学习领域的进展,凸显了这些模型取代传统主干网络的潜力,适用任务涵盖视频理解到3D 目标检测等。随着社区不断改进扫描策略以及与卷积层的集成,Vision Mamba 有望与 CNN 和 Transformer 一起,成为深度学习工具箱中的标准组件。

Explore solutions

航空影像计算机视觉

航空影像计算机视觉

借助 Ultralytics YOLO,将无人机和航空影像转化为实时洞察,应用于农业、水产养殖、环境监测、自然保护和地理空间分析。
了解详情
航空航天中的计算机视觉

航空航天中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 应用于航空监测。借助计算机视觉解决方案,赋能无人机、航空航天工作流、环境保护和地理空间行业。
了解详情
安防领域的计算机视觉

安防领域的计算机视觉

使用 Ultralytics YOLO 模型守护每个场所。视觉 AI 可用于周界监控、威胁检测、车牌识别和工作场所安全。
了解详情
机器人领域的计算机视觉

机器人领域的计算机视觉

使用 Ultralytics YOLO 模型提升智能机器的能力。机器人领域的视觉 AI 可用于自主导航、感知、目标跟踪和实时控制。
了解详情
物流中的计算机视觉

物流中的计算机视觉

借助 Ultralytics YOLO 模型优化物流流程。视觉 AI 可用于包裹检查、分拣、车辆跟踪和仓库安全实时监控。
了解详情
零售中的计算机视觉

零售中的计算机视觉

借助 Ultralytics YOLO 模型重新构想零售。视觉 AI 可用于库存跟踪、货架监控、排队管理和更深入的客户洞察。
了解详情
医疗领域的计算机视觉

医疗领域的计算机视觉

借助 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可加快医学影像处理、优化诊断并监测患者。
了解详情
制造业中的计算机视觉

制造业中的计算机视觉

利用 Ultralytics YOLO 模型优化制造流程。视觉 AI 可用于质量控制、缺陷检测、个人防护装备合规检查和装配线自动化。
了解详情
汽车领域的计算机视觉

汽车领域的计算机视觉

利用 Ultralytics YOLO 模型在汽车领域应用计算机视觉。视觉 AI 可提升道路安全、驾驶辅助和车辆自动化水平,让道路更智能。
了解详情
农业中的计算机视觉

农业中的计算机视觉

借助 Ultralytics YOLO 模型,将视觉 AI 引入智慧农业。为作物监测、牲畜追踪和精准农业提供支持,从而提高产量并实现更智能的生产。
了解详情
航空影像计算机视觉

航空影像计算机视觉

借助 Ultralytics YOLO,将无人机和航空影像转化为实时洞察,应用于农业、水产养殖、环境监测、自然保护和地理空间分析。
了解详情
航空航天中的计算机视觉

航空航天中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 应用于航空监测。借助计算机视觉解决方案,赋能无人机、航空航天工作流、环境保护和地理空间行业。
了解详情
安防领域的计算机视觉

安防领域的计算机视觉

使用 Ultralytics YOLO 模型守护每个场所。视觉 AI 可用于周界监控、威胁检测、车牌识别和工作场所安全。
了解详情
机器人领域的计算机视觉

机器人领域的计算机视觉

使用 Ultralytics YOLO 模型提升智能机器的能力。机器人领域的视觉 AI 可用于自主导航、感知、目标跟踪和实时控制。
了解详情
物流中的计算机视觉

物流中的计算机视觉

借助 Ultralytics YOLO 模型优化物流流程。视觉 AI 可用于包裹检查、分拣、车辆跟踪和仓库安全实时监控。
了解详情
零售中的计算机视觉

零售中的计算机视觉

借助 Ultralytics YOLO 模型重新构想零售。视觉 AI 可用于库存跟踪、货架监控、排队管理和更深入的客户洞察。
了解详情
医疗领域的计算机视觉

医疗领域的计算机视觉

借助 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可加快医学影像处理、优化诊断并监测患者。
了解详情
制造业中的计算机视觉

制造业中的计算机视觉

利用 Ultralytics YOLO 模型优化制造流程。视觉 AI 可用于质量控制、缺陷检测、个人防护装备合规检查和装配线自动化。
了解详情
汽车领域的计算机视觉

汽车领域的计算机视觉

利用 Ultralytics YOLO 模型在汽车领域应用计算机视觉。视觉 AI 可提升道路安全、驾驶辅助和车辆自动化水平,让道路更智能。
了解详情
农业中的计算机视觉

农业中的计算机视觉

借助 Ultralytics YOLO 模型,将视觉 AI 引入智慧农业。为作物监测、牲畜追踪和精准农业提供支持,从而提高产量并实现更智能的生产。
了解详情
航空影像计算机视觉

航空影像计算机视觉

借助 Ultralytics YOLO,将无人机和航空影像转化为实时洞察,应用于农业、水产养殖、环境监测、自然保护和地理空间分析。
了解详情
航空航天中的计算机视觉

航空航天中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 应用于航空监测。借助计算机视觉解决方案,赋能无人机、航空航天工作流、环境保护和地理空间行业。
了解详情
安防领域的计算机视觉

安防领域的计算机视觉

使用 Ultralytics YOLO 模型守护每个场所。视觉 AI 可用于周界监控、威胁检测、车牌识别和工作场所安全。
了解详情
机器人领域的计算机视觉

机器人领域的计算机视觉

使用 Ultralytics YOLO 模型提升智能机器的能力。机器人领域的视觉 AI 可用于自主导航、感知、目标跟踪和实时控制。
了解详情
物流中的计算机视觉

物流中的计算机视觉

借助 Ultralytics YOLO 模型优化物流流程。视觉 AI 可用于包裹检查、分拣、车辆跟踪和仓库安全实时监控。
了解详情
零售中的计算机视觉

零售中的计算机视觉

借助 Ultralytics YOLO 模型重新构想零售。视觉 AI 可用于库存跟踪、货架监控、排队管理和更深入的客户洞察。
了解详情
医疗领域的计算机视觉

医疗领域的计算机视觉

借助 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可加快医学影像处理、优化诊断并监测患者。
了解详情
制造业中的计算机视觉

制造业中的计算机视觉

利用 Ultralytics YOLO 模型优化制造流程。视觉 AI 可用于质量控制、缺陷检测、个人防护装备合规检查和装配线自动化。
了解详情
汽车领域的计算机视觉

汽车领域的计算机视觉

利用 Ultralytics YOLO 模型在汽车领域应用计算机视觉。视觉 AI 可提升道路安全、驾驶辅助和车辆自动化水平,让道路更智能。
了解详情
农业中的计算机视觉

农业中的计算机视觉

借助 Ultralytics YOLO 模型,将视觉 AI 引入智慧农业。为作物监测、牲畜追踪和精准农业提供支持,从而提高产量并实现更智能的生产。
了解详情

让我们携手构建 AI 的未来!

开启你的旅程,迎接机器学习的未来