Differential Transformer
Aprende cómo los Differential Transformers reducen el ruido de atención con mapas de atención dual, mejorando la recuperación de señales en aplicaciones de IA de lenguaje, visión y multimodal.
Un Differential Transformer, también llamado DIFF Transformer, es una arquitectura de investigación que modifica el Transformer estándar para reducir información distractora o irrelevante en su attention mechanism. Presentado en 2024 y publicado en ICLR 2025, calcula la diferencia entre dos mapas de atención, ayudando al modelo a amplificar señales útiles mientras cancela el ruido compartido. El Microsoft Research Differential Transformer project original se centra principalmente en modelos de lenguaje en lugar de sensores físicos. (microsoft.com)
Cómo funciona la atención diferencial#
El self-attention estándar compara consultas y claves, aplica softmax normalization y utiliza los pesos no negativos resultantes para combinar valores. La atención diferencial crea dos mapas softmax separados y resta una versión escalada del segundo al primero:
output = (attention_map_1 - lambda x attention_map_2) x values
Aquí, lambda se aprende. La resta permite pesos de atención negativos, los cuales pueden suprimir tokens que ambos mapas consideran de manera similar. Esto amplía los principios del Attention Is All You Need paper original y es especialmente relevante para modelos con una gran context window. (arxiv.org)
Este PyTorch softmax example ejecutable ilustra la operación principal:
import torch
q1, q2, k1, k2 = [torch.randn(4, 8) for _ in range(4)]
values = torch.randn(4, 8)
scale = q1.shape[-1] ** -0.5
map1 = torch.softmax(q1 @ k1.T * scale, dim=-1)
map2 = torch.softmax(q2 @ k2.T * scale, dim=-1)
output = (map1 - 0.8 * map2) @ values
print(output.shape)Las implementaciones de producción pueden utilizar kernels optimizados de PyTorch scaled dot-product attention y evaluar cuidadosamente la memoria, el rendimiento y la estabilidad numérica.
Beneficios y desarrollos recientes#
Los experimentos originales informaron una mejor recuperación de claves, aprendizaje en contexto, modelado de secuencias largas y menores tasas de LLM hallucination en comparación con modelos convencionales equivalentes. Sin embargo, un menor ruido de atención no garantiza resultados fácticos.
Trabajos recientes incluyen el eficiente en parámetros Shared DIFF Transformer, el NeurIPS 2025 DEX method para adaptar modelos preentrenados y Differential Attention Adaptation, una propuesta para ICLR 2026 que añade comportamiento diferencial durante el ajuste fino. El Integral Transformer study también advierte que una eliminación excesiva de ruido puede descartar contexto útil. (arxiv.org)
Aplicaciones en el mundo real#
IA conversacional y de documentos: En natural language processing, la atención diferencial puede ayudar a los sistemas de preguntas y respuestas y de resumen a localizar una oración crítica entre documentos largos y ruidosos.
Respuesta visual a preguntas: El estudio Differential Multimodal Transformers study de 2025 aplicó el mecanismo a entradas de texto e imagen, mejorando la recuperación de información ruidosa. Esto es relevante para el multimodal learning y los vision-language models. (arxiv.org)
Predicción y visión: La predicción de demanda de pasajeros ADFormer passenger-demand forecasting explora la atención diferencial para el time-series analysis, mientras que el Linear Differential Vision Transformer de 2025 adapta ideas diferenciales contrastivas a los Vision Transformers. La investigación fundamental Vision Transformer research proporciona un contexto útil. (arxiv.org)
Términos relacionados y mejores prácticas#
Un Differential Transformer no es un Diffusion Transformer, que genera imágenes u otros datos mediante difusión, ni un sensor físico linear variable differential transformer sensor.
Para visión artificial, trate la atención diferencial como una opción de investigación emergente y compárela con arquitecturas establecidas como RT-DETR y Ultralytics YOLO26 enfocado en el borde. Utilice parámetros, datos de entrenamiento, latencia y presupuestos de memoria equivalentes, y evalúe el rendimiento tanto en entradas limpias como en entradas con ruido deliberado.






