YOLO Vision 2026:
返回 Ultralytics 术语表

Masked Autoencoders (MAE)

探索掩码自编码器(MAE)如何革新自监督学习。了解 MAE 重建如何提升 Ultralytics YOLO26 的性能与效率。

掩码自编码器(MAE)代表了更广泛的计算机视觉领域中一种高效且可扩展的自监督学习方法。作为一种无需大规模标注数据集即可训练参数量很大的神经网络的方法,MAE 会有意遮挡输入图像中大面积的随机区域,并训练模型重建缺失的像素。通过成功预测隐藏的视觉信息,网络能够自然地学习形状、纹理和空间关系的深层语义理解。

这项技术深受文本系统中掩码语言建模成功经验的启发,但针对图像数据的高维特性进行了调整。其架构依赖广受欢迎的 Transformer框架,并采用非对称编码器-解码器结构。

掩码自编码器的工作原理#

MAE 的核心创新在于其处理效率。训练期间,输入图像会被划分为由多个图像块组成的网格。其中很大比例的图像块(通常最高可达 75%)会被随机遮挡并丢弃。编码器通常采用视觉 Transformer (ViT),只处理可见且未被遮挡的图像块。由于编码器完全跳过被遮挡的部分,因此所需的计算和内存显著减少,使训练过程非常快速。

编码器为可见图像块生成潜在表示后,轻量级解码器会接手处理。解码器接收编码后的可见图像块以及“掩码标记”(缺失数据的占位符),并尝试重建原始图像。由于解码器仅在预训练阶段使用,因此可以设计得非常小,从而进一步降低计算开销。预训练完成后,解码器会被丢弃,而功能强大的编码器则会保留用于下游应用。

区分相关术语#

要全面理解 MAE,了解它与较早出现或更广泛的深度学习概念之间的差异会很有帮助:

  • 自编码器 传统自编码器会将完整输入压缩到更小的潜在空间中,然后再将其重建,以学习高效的数据编码。而 MAE 则迫使网络预测缺失的数据,而不仅仅是对完整输入进行压缩和解压缩。
  • 自监督学习 这是一种总体训练范式,模型从数据本身中学习,而无需人工标注的标签。MAE 是这一概念的一种具体架构实现。
  • 基础模型 MAE 通常用于预训练视觉基础模型,然后再针对专门任务进行微调。

实际应用#

由于 MAE 能够学习视觉数据极其稳健的表示,因此非常适合作为复杂现实世界 AI 系统的起点。

  • 高级目标检测的预训练: 通过 MAE 预训练学习到的丰富特征提取能力,可以显著提升下游目标检测系统的性能。例如,在标注数据稀缺的定制小众数据集上训练 Ultralytics YOLO26 等模型时,可以利用通过 MAE 学习到的特征。
  • 医学图像分析 在放射学等领域,收集大量带标注的 MRI 或 CT 扫描数据集成本高昂,并且受到隐私法律的限制。研究人员会使用 MAE 在大规模未标注医学图像集合上预训练模型,这些图像研究成果已发表在近期 arXiv 学术文献中,然后再对模型进行微调,以便使用极少量的标注样本检测肿瘤或异常。

数据管理与部署#

使用 MAE 方法预训练骨干网络后,下一步是针对特定任务(例如图像分类图像分割)对模型进行微调和部署。现代云生态系统让这一过渡变得十分顺畅。例如,团队可以利用 Ultralytics Platform轻松标注特定任务的数据集、编排云端训练,并将最终可用于生产的模型部署到边缘设备或服务器上。这消除了通常与机器学习运维 (MLOps)相关的大量基础设施样板工作。

代码示例:模拟图像块遮挡#

虽然训练完整的 MAE 需要完整的 Transformer 架构,但使用 PyTorch 张量操作可以轻松演示图像块遮挡的核心概念。以下简单代码片段展示了如何从输入张量中随机选择可见图像块。

import torch


def create_random_mask(batch_size, num_patches, mask_ratio=0.75):
    """Generates a random mask to simulate MAE patch dropping."""
    # Calculate how many patches to keep visible
    num_keep = int(num_patches * (1 - mask_ratio))

    # Generate random noise to determine patch shuffling
    noise = torch.rand(batch_size, num_patches)

    # Sort noise to get random indices
    ids_shuffle = torch.argsort(noise, dim=1)

    # Select the indices of the patches that remain visible
    ids_keep = ids_shuffle[:, :num_keep]

    return ids_keep


# Simulate a batch of 4 images, each divided into 196 patches
visible_patches = create_random_mask(batch_size=4, num_patches=196)
print(f"Visible patch indices shape: {visible_patches.shape}")

对于希望将强大的预训练视觉能力集成到工作流程中、又不想从头编写架构的开发者来说,探索丰富的 Ultralytics 文档可以为将最先进的视觉模型应用于独特挑战提供良好起点。此外,TensorFlow等主要框架也提供了稳健的生态系统,可将前沿的机器学习研究实现到可扩展的生产环境中。

Explore solutions

用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多

让我们共同构建 AI 的未来!

开启你的机器学习未来之旅