Ultralytics YOLO27:
返回 Ultralytics 术语表

Longformer

探索 Longformer 架构如何高效处理长数据序列。了解稀疏注意力如何克服 NLP 和计算机视觉中的内存限制。

Longformer 是一种专门的 深度学习 架构,旨在高效处理长数据序列,克服传统模型的局限性。Longformer 最初是为了解决标准 Transformer 的限制而提出的,因为标准 Transformer 通常受内存限制,难以处理超过 512 个 token 的序列。Longformer 采用了改进的 注意力机制。通过将计算复杂度从二次降低到线性,这种架构使 AI 系统能够在单次处理中分析完整文档、冗长的文字记录或复杂的遗传序列,而无需截断输入。

注意力瓶颈问题#

要理解 Longformer 的重要性,必须审视 BERT 和早期 GPT-3 模型等前代模型的局限性。标准 Transformer 使用一种“自注意力”操作,其中每个标记(单词或单词的一部分)都会关注序列中的其他所有标记。这会产生二次方计算成本;序列长度加倍时,GPU 所需的内存会增加到原来的四倍。因此,大多数标准模型都会对输入大小施加严格限制,通常迫使数据科学家将文档切分成更小且彼此不连贯的片段,从而导致上下文信息丢失。

Longformer 通过引入 稀疏注意力 解决了这一问题。它不采用完整的全连接方式,而是结合了窗口化局部注意力和全局注意力:

  • 滑动窗口注意力: 每个 token 只关注其紧邻的 token。它能够捕捉局部上下文和句法结构,类似于 卷积神经网络(CNN) 处理图像的方式。
  • 膨胀滑动窗口: 为了在不增加计算量的情况下扩大 感受野,窗口可以加入间隔,使模型能够看到文本中距离更远的内容。
  • 全局注意力: 特定的预选 token(例如分类 token [CLS])会关注序列中的所有其他 token,同时所有 token 也会关注这些预选 token。这确保模型能够保留对整个输入的高层理解,以完成 文本摘要 等任务。

实际应用#

同时处理数千个 token 的能力为 自然语言处理(NLP) 及其他领域开辟了新的可能性。

1. 法律和医疗文档分析#

在法律和医疗等行业,文档很少篇幅短小。法律合同或患者的病历可能长达数十页。传统的 大型语言模型(LLM) 需要将这些文档拆分,这可能导致模型错过第 1 页中的条款与第 30 页中的定义之间的重要关联。Longformer 能够一次性对完整文档执行 命名实体识别(NER) 和分类,确保全局上下文影响对特定术语的解读。

2. 长文本问答(QA)#

当问题的答案需要综合一篇长文章中分散的信息时,标准 问答 系统往往难以应对。通过将完整文本保留在内存中,基于 Longformer 的模型可以执行多跳推理,将不同段落中的事实联系起来,生成全面的答案。这对于自动化技术支持系统和学术研究工具至关重要。

关键术语辨析#

  • Longformer 与 Transformer 的比较: 标准 Transformer 使用完整的 $N^2$ 注意力机制,精确度高,但处理长输入时计算成本昂贵。Longformer 使用稀疏的 $N$ 注意力机制,以极少的理论容量损失换取巨大的效率提升,从而支持 4,096 个或更多 token 的输入。
  • Longformer 与 Transformer-XL 的比较: 两者都能处理长序列,但 Transformer-XL 依靠循环机制(缓存之前的状态)来记忆过去的片段。Longformer 原生地一次性处理整个长序列,从而简化了在 Ultralytics Platform 等平台上的并行训练。
  • Longformer 与 BigBird 的比较: 这两种架构非常相似,开发时间也大致相同。两者都使用稀疏注意力机制来实现线性扩展。BigBird 除滑动窗口外,还引入了特定的随机注意力组件。

实现概念#

虽然 Longformer 是一种架构,而不是特定的函数,但了解如何为长上下文模型准备数据至关重要。在 PyTorch 等现代框架中,这通常涉及管理超出标准限制的 嵌入

以下示例演示了如何为长上下文场景创建一个模拟输入张量,并将其与 YOLO26 等标准检测模型中通常使用的尺寸进行对比。

import torch

# Standard BERT-like models typically cap at 512 tokens
standard_input = torch.randint(0, 30000, (1, 512))

# Longformer architectures can handle significantly larger inputs (e.g., 4096)
# This allows the model to "see" the entire sequence at once.
long_context_input = torch.randint(0, 30000, (1, 4096))

print(f"Standard Input Shape: {standard_input.shape}")
print(f"Long Context Input Shape: {long_context_input.shape}")

# In computer vision, a similar concept applies when processing high-res images
# without downsampling, preserving fine-grained details.

与计算机视觉的相关性#

Longformer 最初是为文本设计的,但其背后的原理也影响了 计算机视觉。将注意力限制在局部邻域内的概念,与视觉任务中的局部化操作类似。Vision Transformer(ViT)也面临类似的扩展问题,因为高分辨率图像中的像素数量(或图像块数量)可能非常庞大。源自 Longformer 稀疏注意力的技术被用于提升 图像分类目标检测 的效率,帮助 YOLO26 等模型在处理细致视觉数据时保持较高速度。

如需进一步了解架构细节,AllenAI 发布的 Longformer 原始论文 提供了深入的基准测试和理论依据。此外,这类大型模型的高效训练通常受益于 混合精度 和先进的 优化算法 等技术。

Explore solutions

用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多

让我们共同构建 AI 的未来!

开启你的机器学习未来之旅