YOLO Vision 2026:
返回 Ultralytics 术语表

Sliding Window Attention

了解滑动窗口注意力如何通过降低计算成本来优化 Transformer 的效率。探索它在 NLP 和视觉领域结合 Ultralytics YOLO26 的作用。

滑动窗口注意力是标准注意力机制的一种优化变体,应用于现代Transformer 架构,可显著提升计算效率。在传统的自注意力机制中,序列中的每个令牌都必须处理其他每个令牌,导致内存和计算成本随序列长度呈平方级增长。滑动窗口注意力通过将令牌的关注范围限制在周围令牌组成的固定大小局部邻域(即“窗口”)内,解决了这一瓶颈。该方法将复杂度从平方级降低为线性,使其成为扩展大规模人工智能(AI)模型上下文窗口的关键组件。

通过堆叠多个使用该技术的神经网络层,模型可以逐步构建对输入数据的全局理解,因为局部窗口会相互重叠,并在网络更深层共享信息。这一基础概念得到了Google DeepMind 研究的广泛支持,并已积极应用于 PyTorch 等现代框架。

实际应用#

无需耗尽计算内存即可处理海量数据序列的能力,为各种人工智能领域解锁了高级功能:

区分相关术语#

为了了解网络架构如何优化数据处理,有必要将滑动窗口注意力与类似机制区分开来:

  • 滑动窗口注意力与可变形注意力 滑动窗口注意力根据序列邻近性使用严格的连续令牌块,而可变形注意力允许网络学习动态采样点。可变形注意力根据实际视觉内容关注任意稀疏位置,而不是固定网格。
  • 滑动窗口注意力与稀疏注意力 滑动窗口是稀疏注意力的一个特定子集。稀疏注意力是一个广义术语,包含随机、步幅或全局令牌模式,用于减少内存占用;而滑动窗口方法则严格将注意力限制在相邻的空间或时间令牌上。

实现高效架构#

对于构建高速目标检测系统的开发者而言,采用高度优化的架构至关重要。原始注意力机制虽然功能强大,但像 Ultralytics YOLO26 这样的端到端模型通过平衡先进的特征提取能力与边缘设备效率,提供了业界领先的性能。

from ultralytics import YOLO

# Load the recommended YOLO26 model for high-resolution vision tasks
model = YOLO("yolo26x.pt")

# Perform inference on a large image, utilizing optimized internal processing
results = model.predict(source="large_aerial_map.jpg", imgsz=1024, show=True)

# Output the number of detected instances
print(f"Detected {len(results[0].boxes)} objects in the high-resolution input.")

要将这些复杂的流水线从本地原型扩展到企业级生产环境,需要稳健的基础设施。Ultralytics Platform 通过提供直观的自动化数据集标注、无缝云端训练和实时模型监控,全面简化了这一过程。这使团队能够在各种硬件环境中无缝利用高效大上下文模型的优势。

Explore solutions

让我们共同构建 AI 的未来!

开启你的机器学习未来之旅