Ultralytics YOLO27:
返回 Ultralytics 术语表

Swin Transformer

了解 Swin Transformer 架构如何使用移位窗口实现高效计算机视觉,并探索 Ultralytics Platform 上的工作流。

该架构由 Microsoft 的研究人员在具有里程碑意义的 2021 年论文 《Swin Transformer:使用移位窗口的分层视觉 Transformer》 中提出,通过调整 注意力机制 来处理高分辨率视觉数据的复杂性,属于一种 深度学习(DL) 架构。不同于处理长度统一的文本词元的 自然语言处理 模型,该架构认识到视觉元素的尺度差异极大。通过构建分层表示并采用独特的窗口化技术,它实现了相对于图像大小的 线性计算复杂度,因此成为适用于各种 计算机视觉(CV) 任务的高效骨干网络。

移位窗口和分层设计的工作原理#

其主要创新在于模型组织特征提取的方式。模型首先将输入图像划分为不重叠的小图块。不过,与早期模型不同,它会在更深的层中逐步将相邻图块合并为更大的区域。这种分层方法使网络能够提取丰富的特征图,在不同尺度上表示全局上下文,从微小的视觉细节到大型物体。

为保持计算效率,自注意力仅在局部、相互隔离的窗口内计算,而不是覆盖整幅图像。为确保信息能够跨越这些边界流动,窗口会在连续层之间进行“移位”。这种移位窗口方案有效连接了相互独立的区域,无需承担全局注意力带来的高昂计算开销,就能提供完整的多尺度空间层次结构。

Swin Transformer 与 Vision Transformer (ViT) 的对比#

比较现代架构时,务必将该模型与标准的视觉 Transformer (ViT)区分开来。原始 ViT 将图像视为固定大小图块组成的序列,并同时对所有图块计算全局注意力。虽然准确率很高,但这会导致二次计算复杂度,意味着随着图像分辨率提高,处理时间和内存需求会急剧增加。

相比之下,Swin 架构的分层窗口设计使复杂度保持线性。这让它更适合需要高分辨率输入和输出的密集预测任务。因此,在多尺度目标检测的 COCO 测试开发数据集以及精确图像分割的 ADE20K 语义分割数据集等基准测试中,它取得了业界领先的结果。

现代 AI 中的实际应用#

凭借灵活性和效率,官方的 Microsoft Research GitHub 代码库实现已被应用于多个复杂且高风险的行业。

  • 医学图像分析:在临床环境中,Swin-Unet 等网络利用这一架构处理体积式 3D MRI 扫描和高分辨率组织病理学分析。该模型保留密集空间层次结构的能力有助于识别早期肿瘤等微小异常。你可以进一步了解近期的医学成像研究突破。
  • 卫星图像分析:对于环境监测和遥感而言,捕获大范围地理上下文至关重要。其分层结构能够高效处理海量航空数据集,用于跟踪森林砍伐、城市规划和作物健康监测。

与 PyTorch 和 Ultralytics 集成#

对于构建自定义神经网络的开发者而言,使用官方 PyTorch 文档实现这一架构非常简单。torchvision 库包含预训练版本,例如针对 ImageNet优化的轻量级 Tiny 变体。

import torch
from torchvision.models import Swin_T_Weights, swin_t

# Load a pre-trained Tiny variant with ImageNet weights
weights = Swin_T_Weights.IMAGENET1K_V1
model = swin_t(weights=weights)
model.eval()

# Run a single batch containing a 3-channel, 224x224 dummy image tensor
dummy_image = torch.randn(1, 3, 224, 224)
output = model(dummy_image)

# The output shape is [1, 1000], representing the 1000 ImageNet classes
print(f"Prediction tensor shape: {output.shape}")

虽然基于 Transformer 的骨干网络能够提供出色的多尺度表示,但现代应用通常需要针对边缘 AI 设备进行纯端到端优化。例如,Ultralytics YOLO26提供了原生端到端架构,开箱即用即可实现更小的体积、更快的速度和极高的准确率,在实时边缘环境中表现出色。无论使用以 Transformer 为主的架构还是快速卷积模型,开发者都可以通过 Ultralytics Platform管理从数据标注到训练的完整工作流。这套全面的云工具链让模型部署和持续模型监控变得简单高效。

Explore solutions

用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多
安全领域的计算机视觉

安全领域的计算机视觉

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多
安全领域的计算机视觉

安全领域的计算机视觉

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多
安全领域的计算机视觉

安全领域的计算机视觉

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多

让我们共同构建 AI 的未来!

开启你的机器学习未来之旅