Ultralytics YOLO27:
返回 Ultralytics 术语表

Transformer-XL

探索 Transformer-XL 及其片段级递归机制。了解该架构如何解决 AI 模型中的固定上下文问题,以处理长距离依赖关系。

Transformer-XL(超长 Transformer)是一种专门的神经网络架构,旨在解决标准 Transformer 模型中的一个关键限制:处理序列数据中的长距离依赖关系。该架构由 Google AI 研究人员提出,使语言模型能够突破传统方法(如 BERT 或原始 Transformer)所受固定长度上下文窗口的限制,查看远超其范围的内容。通过引入分段级递归机制和新型位置编码方案,Transformer-XL 能够处理极长的文本序列,同时不会丢失上下文信息,这使其成为现代大型语言模型(LLMs)和生成式 AI 应用的基础概念。

克服上下文限制#

Transformer-XL 背后的主要动机是“固定上下文问题”。标准 Transformer 会以固定大小的片段处理数据(例如 512 个 token)。信息通常无法跨越这些片段传递,这意味着模型会忘记前一个片段中发生的内容。这会破坏长文档中的连贯性。

Transformer-XL 通过两项关键创新解决了这一问题:

  1. **分段级递归:**与逐个独立处理片段的原生 Transformer 不同,Transformer-XL 会将前一个片段的隐藏状态缓存到内存中。在处理当前片段时,模型可以关注这些缓存状态。这实际上连接了各个片段,使信息能够传播到更远的距离,在一定程度上类似于循环神经网络(RNN),同时具备注意力机制的并行化优势。

  2. **相对位置编码:**由于递归机制会复用前一片段的状态,标准的绝对位置编码(为每个位置分配唯一 ID)会产生混淆。Transformer-XL 使用相对位置编码,帮助模型理解 token 之间的距离(例如“词 A 位于词 B 之前 5 步”),而不是它们在文档中的绝对位置。

与 RNN 和标准 Transformer 等前代模型相比,这种架构显著提升了语言建模任务中的困惑度得分。

与标准 Transformer 的区别#

区分 Transformer-XL 与标准的视觉 Transformer(ViT)或文本 Transformer 很有帮助。标准 Transformer 在每个片段处理完毕后都会重置状态,从而造成“上下文碎片化”;而 Transformer-XL 会保留过去激活值的记忆。这使其能够建模比固定上下文模型长数百倍的依赖关系。对于需要深入自然语言理解(NLU)的任务而言,这一点尤为重要,因为问题的答案可能位于距离查询内容数个段落之外。

实际应用#

维持长期上下文的能力使 Transformer-XL 在多个高影响力领域具有价值:

  • **长篇文本生成:**在文本生成应用中,例如写作小说或生成长篇报告,保持主题一致性十分困难。Transformer-XL 能够记住文本早期引入的人物姓名、情节点或技术定义,确保输出始终保持连贯。
  • **DNA 序列分析:**这种架构并不局限于人类语言。在生物信息学中,研究人员会使用 Transformer-XL 的变体来分析长 DNA 链。理解相距较远的基因序列之间的关系,有助于识别遗传标记和预测蛋白质结构,类似于医疗保健中的 AI如何辅助分析医学影像。
  • **聊天机器人和虚拟助手:**现代聊天机器人需要记住用户偏好以及对话早期提到的细节。Transformer-XL 的机制有助于扩展上下文窗口,避免出现令人沮丧的情况:助手忘记了几分钟前讨论的主题。

内存与效率#

Transformer-XL 在长序列上具有更出色的性能,但也带来了特定的内存方面考量。缓存隐藏状态需要额外的 GPU 内存,如果管理不当,可能会影响推理延迟。不过,对于长期上下文准确性至关重要的应用而言,这种权衡通常是合理的。

现代目标检测模型(如 YOLO26)专注于视觉数据的速度和效率。相比之下,Transformer-XL 等架构优先考虑序列数据的记忆保留能力。有趣的是,该领域正朝着多模态 AI发展:高效的视觉骨干网络(如 YOLO26 中的骨干网络)可能会与长上下文语言解码器结合,用于分析长视频,并回答有关随时间发生的事件的复杂问题。

示例:管理推理中的上下文#

虽然 Transformer-XL 的内部机制很复杂,但使用高级模型通常需要管理输入,以遵守上下文限制。下面使用 torch 的 Python 示例演示了将“记忆”(隐藏状态)传递给模型的概念,从而在多个步骤之间维持上下文,模拟 Transformer-XL 等架构中的递归行为。

import torch
import torch.nn as nn

# Define a simple RNN to demonstrate passing hidden states (memory)
# This mimics the core concept of recurrence used in Transformer-XL
rnn = nn.RNN(input_size=10, hidden_size=20, num_layers=2, batch_first=True)

# Initial input: Batch size 1, sequence length 5, feature size 10
input_seq1 = torch.randn(1, 5, 10)

# Run first segment, receiving output and the hidden state (memory)
output1, memory = rnn(input_seq1)

# Run second segment, PASSING the memory from the previous step
# This connects the two segments, allowing context to flow
input_seq2 = torch.randn(1, 5, 10)
output2, new_memory = rnn(input_seq2, memory)

print(f"Output shape with context: {output2.shape}")

对于希望高效训练和部署最先进模型的团队,Ultralytics Platform 提供了用于管理数据集和简化模型训练流程的工具,无论你是在使用视觉模型,还是在集成复杂的序列架构。

Explore solutions

用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多
用于航拍影像的计算机视觉

用于航拍影像的计算机视觉

使用 Ultralytics YOLO 将无人机和航拍影像转化为针对农业、水产养殖、环境监测、自然保护及地理空间分析的实时洞察。
了解更多
航空航天中的计算机视觉

航空航天中的计算机视觉

借助 Ultralytics YOLO 模型将视觉 AI 引入空中监测。使用计算机视觉解决方案赋能无人机、航空航天工作流、环境保护与地理空间行业。
了解更多

使用 Ultralytics YOLO 模型保护每个站点。视觉 AI 赋能周界监控、威胁检测、车牌识别和工作场所安全。
了解更多
机器人计算机视觉

机器人计算机视觉

借助 Ultralytics YOLO 模型打造更智能的机器。机器人技术中的视觉 AI 可实现自主导航、感知、目标跟踪和实时控制。
了解更多
物流计算机视觉

物流计算机视觉

使用 Ultralytics YOLO 模型提升物流效率。视觉 AI 可实现包裹检测、分拣、车辆跟踪和仓库安全实时监控。
了解更多
零售计算机视觉

零售计算机视觉

使用 Ultralytics YOLO 模型重新构想零售。视觉 AI 为库存跟踪、货架监控、队列管理和更智能的客户洞察提供支持。
了解更多
医疗领域的计算机视觉

医疗领域的计算机视觉

使用 Ultralytics YOLO 模型构建医疗解决方案。医疗领域的视觉 AI 可实现更快的医学影像处理、更智能的诊断和患者监护。
了解更多
制造业中的计算机视觉

制造业中的计算机视觉

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 可推动质量控制、缺陷检测、PPE 合规和装配线自动化。
了解更多
汽车行业中的计算机视觉

汽车行业中的计算机视觉

使用 Ultralytics YOLO 模型在汽车行业应用计算机视觉。视觉 AI 提升道路安全、驾驶辅助和车辆自动化水平,让道路更加智能。
了解更多
农业中的计算机视觉

农业中的计算机视觉

使用 Ultralytics YOLO 模型将视觉 AI 带入智能农业。为作物监测、牲畜追踪和精准农业提供支持,提升产量与智能化水平。
了解更多

让我们共同构建 AI 的未来!

开启你的机器学习未来之旅