Transformer
探索 Transformer 架构和自注意力机制。了解它们如何为 RT-DETR 和 Ultralytics YOLO26 等 AI 模型提供支持,以实现更高准确率。
Transformer 是一种深度学习架构,依赖一种称为自注意力的机制来处理序列输入数据,例如自然语言或视觉特征。它最初由 Google 研究人员在具有里程碑意义的论文 Attention Is All You Need 中提出,通过摒弃早期循环神经网络 (RNNs)的顺序处理限制,彻底改变了人工智能 (AI)领域。相反,Transformer 会同时分析完整的数据序列,从而实现大规模并行化,并显著缩短在现代硬件(如 GPU)上的训练时间。
Transformer 的工作原理#
Transformer 的核心创新是自注意力机制。它允许模型根据输入数据不同部分之间的相对关系来衡量其重要性。例如,在一个句子中,模型可以根据周围的上下文学习到,单词 "bank" 与 "money" 的关系比与 "river" 的关系更密切。
该架构通常由两个主要组件组成:
- **编码器:**将输入数据处理为丰富的数值表示或嵌入。
- **解码器:**利用编码器的输出生成最终结果,例如翻译后的句子或预测的边界框。
在计算机视觉 (CV)领域,模型通常采用一种称为视觉 Transformer (ViT)的变体。图像不会被处理为文本标记,而是被拆分为固定大小的图像块(例如 16x16 像素)。这些图像块会被展平并作为序列处理,使模型能够比标准的卷积神经网络 (CNN)更有效地捕捉“全局上下文”——理解图像中相距较远部分之间的关系。
Transformer 与相关概念的比较#
区分 Transformer 架构与相关术语非常重要:
- **注意力机制:**这是关注数据特定部分的一般概念。Transformer 是一种完全围绕注意力层构建的特定架构,而其他模型可能只将注意力作为一个小型附加组件。
- 大语言模型 (LLM):“GPT”等术语指的是在海量文本上训练的特定模型。几乎所有现代 LLM 都使用 Transformer 架构作为底层引擎。
实际应用#
Transformer 的多功能性促使其在各个行业得到应用:
-
**医学影像:**在医疗保健领域的人工智能中,Transformer 被用于医学图像分析等复杂任务。它们理解全局空间关系的能力有助于在高分辨率 MRI 或 CT 扫描中检测细微异常,而这些异常可能会被侧重局部特征的 CNN 忽略。
-
**自动驾驶系统:**对于自动驾驶汽车而言,理解行人和其他车辆的运动轨迹至关重要。Transformer 通过跨时间帧跟踪对象并预测未来运动,在视频理解方面表现出色,从而确保安全导航。
使用 Transformer 进行目标检测#
虽然 CNN 长期以来一直主导目标检测领域,但基于 Transformer 的模型(如实时检测 Transformer (RT-DETR))已成为强大的替代方案。RT-DETR 将 CNN 主干网络的速度与 Transformer 解码头的精度结合起来。
不过,纯 Transformer 模型的计算开销可能很大。对于许多边缘应用,高度优化的混合模型(如 YOLO26)将高效的注意力机制与快速卷积处理相结合,在速度和精度之间实现了更优的平衡。你可以通过 Ultralytics Platform轻松管理这些模型的训练和部署,该平台简化了从数据集标注到模型导出的整个工作流程。
Python 示例:使用 RT-DETR#
以下示例演示了如何在 ultralytics 包中使用基于 Transformer 的模型执行推理。此代码会加载一个预训练的 RT-DETR 模型,并检测图像中的对象。
from ultralytics import RTDETR
# Load a pre-trained Real-Time Detection Transformer (RT-DETR) model
model = RTDETR("rtdetr-l.pt")
# Run inference on an image URL
# The model uses self-attention to identify objects with high accuracy
results = model("https://ultralytics.com/images/bus.jpg")
# Display the detection results with bounding boxes
results[0].show()如需进一步了解数学基础,PyTorch 关于 Transformer 层的文档提供了深入的技术内容,而IBM 的 Transformer 指南则提供了高层次的商业视角。









