Differential Transformer
Differential Transformerが、デュアルアテンションマップを使用してどのようにアテンションノイズを低減し、言語、ビジョン、およびマルチモーダルAIアプリケーションにおける信号検索を向上させるのかを学びます。
ディファレンシャル・トランスフォーマー(DIFF Transformerとも呼ばれます)は、Transformerの標準構造を改良し、アテンション機構における注意を散漫させる情報や無関係な情報を削減するための研究用アーキテクチャです。2024年に発表されICLR 2025で公開されたこの手法は、2つのアテンションマップの差分を計算することで、共有されるノイズを相殺しながらモデルが有用なシグナルを増幅するのを助けます。オリジナルのMicrosoft Research Differential Transformerプロジェクトは、物理センサーではなく言語モデルを主な対象としています。(microsoft.com)
Differential Attentionの仕組み#
標準的な自己注意機構はクエリとキーを比較し、ソフトマックス正規化を適用し、得られた非負の重みを使用して値を結合します。ディファレンシャル・アテンションでは、2つの独立したソフトマックスマップを作成し、2つ目のマップのスケール調整版を1つ目から差し引きます。
output = (attention_map_1 - lambda x attention_map_2) x values
ここで、lambdaは学習されるパラメータです。引き算を行うことで負のアテンション重みが許容され、両方のマップが同様に考慮するトークンを抑制することができます。これは、オリジナルのAttention Is All You Need論文における原則を拡張したものであり、大規模なコンテキストウィンドウを持つモデルにおいて特に重要です。(arxiv.org)
この実行可能なPyTorchソフトマックスの例は、コアの演算を示しています。
import torch
q1, q2, k1, k2 = [torch.randn(4, 8) for _ in range(4)]
values = torch.randn(4, 8)
scale = q1.shape[-1] ** -0.5
map1 = torch.softmax(q1 @ k1.T * scale, dim=-1)
map2 = torch.softmax(q2 @ k2.T * scale, dim=-1)
output = (map1 - 0.8 * map2) @ values
print(output.shape)本番環境での実装では、最適化されたPyTorch scaled dot-product attentionカーネルを使用し、メモリ、スループット、および数値的安定性を慎重にベンチマークする場合があります。
利点と最近の開発#
初期の実験では、同等の従来モデルと比較して、より優れたキー検索、コンテキスト内学習、長シーケンスのモデリング、およびより低いLLMハルシネーション率が報告されました。ただし、アテンションノイズの低減は事実に基づいた出力を保証するものではありません。
最近の研究には、パラメータ効率の高いShared DIFF Transformer、事前学習済みモデルを適応させるためのNeurIPS 2025 DEX法、およびファインチューニング中に差分動作を追加するICLR 2026採択論文のDifferential Attention Adaptationが含まれます。Integral Transformerの調査でも、過剰なノイズ除去は有用なコンテキストを破棄してしまう可能性があることが警告されています。(arxiv.org)
実社会での応用#
文書および対話型AI: 自然言語処理において、ディファレンシャル・アテンションは、質問応答や要約システムが長くてノイズの多い文書の中から重要な文を見つけ出すのを助けることができます。
ビジュアル質問応答: 2025年のDifferential Multimodal Transformersに関する研究では、このメカニズムをテキストと画像の入力に適用し、ノイズの多い情報の検索を改善しました。これはマルチモーダル学習および視覚言語モデルに関連しています。(arxiv.org)
予測とビジョン: ADFormerによる乗客需要予測では時系列解析におけるディファレンシャル・アテンションが探求されており、2025年のLinear Differential Vision Transformerはコントラスト差分のアイデアをVision Transformerに適応させています。基礎となるVision Transformerの研究は有用なコンテキストを提供します。(arxiv.org)
関連用語とベストプラクティス#
ディファレンシャル・トランスフォーマーは、拡散によって画像やその他のデータを生成する拡散モデル(Diffusion Transformer)でも、物理的な差動変圧器型センサー(linear variable differential transformer sensor)でもありません。
コンピュータビジョンにおいては、ディファレンシャル・アテンションを新たな研究上の選択肢として扱い、RT-DETRやエッジ向けのUltralytics YOLO26といった既存の確立されたアーキテクチャと比較してください。一致させたパラメータ、学習データ、レイテンシ、メモリ予算を使用し、クリーンな入力と意図的にノイズを加えた入力の両方でパフォーマンスを評価してください。






