Transformer
探索 Transformer 架构和自注意力机制。学习它们如何驱动 RT-DETR 和 Ultralytics YOLO26 等 AI 模型实现卓越精度。
Transformer 是一种依赖于自注意力机制来处理序列输入数据(如自然语言或视觉特征)的深度学习架构。Transformer 最初由 Google 研究人员在具有里程碑意义的论文 Attention Is All You Need 中提出,它摒弃了早期 循环神经网络 (RNN) 的顺序处理局限性,彻底革新了 人工智能 (AI) 领域。相反,Transformer 可以同时分析整个数据序列,从而实现大规模并行化,并在 GPU 等现代硬件上显著加快训练速度。
Transformer 的工作原理#
自注意力机制是 Transformer 的核心创新。这使得模型能够权衡输入数据不同部分彼此相对的重要程度。例如,在一个句子中,模型可以根据周围的上下文了解到“bank”这个词与“money”的关系比与“river”的关系更紧密。
该架构通常由两个主要组件组成:
- Encoder: 将输入数据处理为丰富的数值表示或嵌入。
- 解码器 (Decoder): 使用编码器的输出生成最终结果,例如翻译后的句子或预测的边界框 (bounding box)。
在计算机视觉 (CV) 领域,模型通常采用一种名为视觉 Transformer (ViT) 的变体。图像不会被处理为文本 token,而是被分割成固定大小的图块(例如 16x16 像素)。这些图块被展平并视为一个序列,使模型能够比标准的卷积神经网络 (CNN) 更有效地捕获“全局上下文”——即理解图像遥远部分之间的关系。
Transformer 与相关概念的对比#
区分 Transformer 架构与相关术语非常重要:
- 注意力机制: 这是关注数据特定部分的通用概念。Transformer 是一种完全围绕注意力层构建的具体架构,而其他模型可能仅将注意力用作小型附加组件。
- 大语言模型 (LLM): 诸如 “GPT” 之类的术语指的是在大量文本上训练的特定模型。几乎所有现代 LLM 都将 Transformer 架构用作其底层引擎。
实际应用#
Transformer 的多功能性使其在各个行业中得到了应用:
-
医学影像: 在医疗 AI 中,Transformer 用于诸如医学图像分析等复杂任务。它们理解全局空间关系的能力有助于检测高分辨率 MRI 或 CT 扫描中的微妙异常,而这是专注于局部特征的 CNN 可能会漏掉的。
-
自动驾驶系统: 对于自动驾驶汽车而言,理解行和其他车辆的轨迹至关重要。Transformer 通过跨时间帧跟踪对象来擅长视频理解,预测未来的移动以确保安全导航。
使用 Transformer 进行目标检测#
虽然 CNN 传统上在目标检测中占据主导地位,但像实时检测 Transformer (RT-DETR) 这样基于 Transformer 的模型已经成为强大的替代方案。RT-DETR 结合了 CNN 主干网的速度和 Transformer 解码头的高精度。
然而,纯 Transformer 模型在计算上可能很重。对于许多边缘应用,高度优化的混合模型(例如YOLO26,它将高效的注意力机制与快速的卷积处理相集成)提供了速度和准确性的卓越平衡。你可以通过 Ultralytics Platform 轻松管理这些模型的训练和部署,这简化了从数据集标注到模型导出的工作流。
Python 示例:使用 RT-DETR#
以下示例演示了如何在使用 ultralytics 包的基于 Transformer 的模型中执行推理。此代码加载预训练的 RT-DETR 模型并检测图像中的对象。
from ultralytics import RTDETR
# Load a pre-trained Real-Time Detection Transformer (RT-DETR) model
model = RTDETR("rtdetr-l.pt")
# Run inference on an image URL
# The model uses self-attention to identify objects with high accuracy
results = model("https://ultralytics.com/images/bus.jpg")
# Display the detection results with bounding boxes
results[0].show()有关数学基础的进一步阅读,PyTorch Transformer 层文档提供了技术深度,而IBM 的 Transformer 指南则提供了高水平的业务视角。






