Differential Transformer
了解 Differential Transformer 如何通过双重注意力图减少注意力噪声,从而改善语言、视觉和多模态 AI 应用中的信号检索效果。
Differential Transformer,也称为 DIFF Transformer,是一种研究架构,它修改了标准的 Transformer,以减少其注意力机制中分散注意力的或不相关的信息。它于 2024 年引入并在 ICLR 2025 上发表,通过计算两个注意力图之间的差值,帮助模型放大有用信号,同时抵消共享噪声。最初的 Microsoft Research Differential Transformer 项目主要针对语言模型,而不是物理传感器。(microsoft.com)
Differential Attention 的工作原理#
标准的自注意力会比较查询和键,应用softmax 归一化,并使用所得的非负权重来组合值。差分注意力机制创建两个独立的 softmax 映射,并从第一个映射中减去第二个映射的缩放版本:
output = (attention_map_1 - lambda x attention_map_2) x values
在这里,lambda 是通过学习得到的。减法允许出现负的注意力权重,这可以抑制两个映射认为相似的标记。这扩展了最初的 Attention Is All You Need 论文中的原理,并且与具有大上下文窗口的模型尤其相关。(arxiv.org)
这个可运行的 PyTorch softmax 示例说明了核心操作:
import torch
q1, q2, k1, k2 = [torch.randn(4, 8) for _ in range(4)]
values = torch.randn(4, 8)
scale = q1.shape[-1] ** -0.5
map1 = torch.softmax(q1 @ k1.T * scale, dim=-1)
map2 = torch.softmax(q2 @ k2.T * scale, dim=-1)
output = (map1 - 0.8 * map2) @ values
print(output.shape)生产实现可以使用经过优化的 PyTorch 缩放点积注意力内核,并仔细对内存、吞吐量和数值稳定性进行基准测试。
优势与最新进展#
最初的实验报告称,与匹配的常规模型相比,它具有更强的键检索、上下文学习、长序列建模能力,并且大模型幻觉率更低。然而,减少注意力噪声并不能保证输出一定是真实的。
最近的工作包括参数高效的 Shared DIFF Transformer、用于适应预训练模型的 NeurIPS 2025 DEX 方法,以及在微调期间增加差分行为的 ICLR 2026 投稿差分注意力适应。Integral Transformer 研究还警告说,过度的噪声去除可能会丢弃有用的上下文。(arxiv.org)
实际应用#
**文档和对话式 AI:**在自然语言处理中,差分注意力可以帮助问答和摘要系统在冗长、充满噪声的文档中定位关键句子。
**视觉问答:**2025 年的差分多模态 Transformer 研究将该机制应用于文本-图像输入,从而改进了噪声信息的检索。这与多模态学习和视觉语言模型相关。(arxiv.org)
预测与视觉:ADFormer 乘客需求预测探讨了用于时间序列分析的差分注意力,而 2025 年的线性差分视觉 Transformer将对比差分思想适应于视觉 Transformer。基础的视觉 Transformer 研究提供了有用的背景信息。(arxiv.org)
相关术语与最佳实践#
Differential Transformer 不是通过扩散生成图像或其他数据的扩散 Transformer,也不是物理的线性可变差分变压器传感器。
对于计算机视觉,请将差分注意力视为一种新兴的研究选项,并将其与诸如 RT-DETR 和专注于边缘端的 Ultralytics YOLO26 等成熟架构进行比较。使用匹配的参数、训练数据、延迟和内存预算,并在干净和故意加入噪声的输入上评估性能。






