Differential Transformer
Apprends comment les Differential Transformers réduisent le bruit d'attention avec des cartes d'attention doubles, améliorant la récupération de signal dans les applications d'IA de langage, de vision et multimodales.
Un Differential Transformer, également appelé DIFF Transformer, est une architecture de recherche qui modifie le Transformer standard pour réduire les informations parasites ou non pertinentes dans son mécanisme d'attention. Présenté en 2024 et publié à la conférence ICLR 2025, il calcule la différence entre deux cartes d'attention, aidant le modèle à amplifier les signaux utiles tout en annulant le bruit partagé. Le projet Microsoft Research Differential Transformer d'origine cible principalement les modèles de langage plutôt que les capteurs physiques. (microsoft.com)
Comment fonctionne la Differential Attention#
L'auto-attention standard compare les requêtes et les clés, applique une normalisation softmax et utilise les poids non négatifs obtenus pour combiner les valeurs. L'attention différentielle crée deux cartes softmax distinctes et soustrait une version mise à l'échelle de la seconde de la première :
output = (attention_map_1 - lambda x attention_map_2) x values
Ici, lambda est appris. La soustraction permet d'obtenir des poids d'attention négatifs, ce qui peut supprimer les jetons que les deux cartes considèrent de manière similaire. Cela étend les principes de l'article original Attention Is All You Need et est particulièrement pertinent pour les modèles dotés d'une grande fenêtre de contexte. (arxiv.org)
Cet exemple PyTorch softmax exécutable illustre l'opération principale :
import torch
q1, q2, k1, k2 = [torch.randn(4, 8) for _ in range(4)]
values = torch.randn(4, 8)
scale = q1.shape[-1] ** -0.5
map1 = torch.softmax(q1 @ k1.T * scale, dim=-1)
map2 = torch.softmax(q2 @ k2.T * scale, dim=-1)
output = (map1 - 0.8 * map2) @ values
print(output.shape)Les implémentations de production peuvent utiliser des noyaux d'attention par produit scalaire mis à l'échelle PyTorch optimisés et évaluer soigneusement la mémoire, le débit et la stabilité numérique.
Avantages et développements récents#
Les expériences initiales ont fait état d'une meilleure récupération des clés, d'un meilleur apprentissage en contexte, d'une modélisation de séquences longues et de taux d'hallucination de LLM inférieurs à ceux des modèles conventionnels équivalents. Cependant, un bruit d'attention réduit ne garantit pas des résultats factuels.
Les travaux récents incluent le Shared DIFF Transformer à paramètres efficaces, la méthode DEX de NeurIPS 2025 pour adapter des modèles pré-entraînés, et la Differential Attention Adaptation, une soumission à l'ICLR 2026 qui ajoute un comportement différentiel lors du fine-tuning. L'étude Integral Transformer avertit également qu'une suppression excessive du bruit peut éliminer un contexte utile. (arxiv.org)
Applications concrètes#
IA conversationnelle et documentaire : En traitement automatique du langage naturel, l'attention différentielle peut aider les systèmes de questions-réponses et de résumé à localiser une phrase critique au milieu de documents longs et bruités.
Question-réponse visuelle : L'étude de 2025 sur les Differential Multimodal Transformers a appliqué ce mécanisme à des entrées texte-image, améliorant la récupération d'informations bruitées. Cela est pertinent pour l'apprentissage multimodal et les modèles vision-langage. (arxiv.org)
Prévision et vision : La prévision de la demande des passagers ADFormer explore l'attention différentielle pour l'analyse de séries temporelles, tandis que le Linear Differential Vision Transformer de 2025 adapte les concepts différentiels contrastifs aux Vision Transformers. La recherche fondamentale sur les Vision Transformers fournit un contexte utile. (arxiv.org)
Termes associés et meilleures pratiques#
Un Differential Transformer n'est pas un Diffusion Transformer, qui génère des images ou d'autres données par diffusion, ni un capteur à transformateur différentiel variable linéaire physique.
Pour la vision par ordinateur, considère l'attention différentielle comme une option de recherche émergente et compare-la aux architectures établies telles que RT-DETR et Ultralytics YOLO26 axé sur l'edge. Utilise des paramètres, des données d'entraînement, une latence et des budgets mémoires appariés, et évalue les performances sur des entrées propres et délibérément bruitées.






