Differential Transformer
Aprende como os Differential Transformers reduzem o ruído de atenção com mapas de atenção duais, melhorando a recuperação de sinal em aplicações de linguagem, visão e IA multimodal.
Um Differential Transformer, também chamado de DIFF Transformer, é uma arquitetura de pesquisa que modifica o Transformer padrão para reduzir informações distrativas ou irrelevantes em seu mechanism de atenção. Introduzido em 2024 e publicado no ICLR 2025, ele calcula a diferença entre dois mapas de atenção, ajudando o modelo a amplificar sinais úteis enquanto cancela o ruído compartilhado. O projeto original do Microsoft Research Differential Transformer tem como alvo principal modelos de linguagem em vez de sensores físicos. (microsoft.com)
Como funciona a Differential Attention#
O self-attention padrão compara consultas e chaves, aplica normalização softmax e usa os pesos não negativos resultantes para combinar valores. A atenção diferencial cria dois mapas softmax separados e subtrai uma versão escalada do segundo do primeiro:
output = (attention_map_1 - lambda x attention_map_2) x values
Aqui, lambda é aprendido. A subtração permite pesos de atenção negativos, o que pode suprimir tokens que ambos os mapas consideram semelhantes. Isso estende os princípios do artigo original Attention Is All You Need e é especialmente relevante para modelos com uma grande context window. (arxiv.org)
Este exemplo executável de softmax em PyTorch ilustra a operação central:
import torch
q1, q2, k1, k2 = [torch.randn(4, 8) for _ in range(4)]
values = torch.randn(4, 8)
scale = q1.shape[-1] ** -0.5
map1 = torch.softmax(q1 @ k1.T * scale, dim=-1)
map2 = torch.softmax(q2 @ k2.T * scale, dim=-1)
output = (map1 - 0.8 * map2) @ values
print(output.shape)Implementações de produção podem usar kernels otimizados de PyTorch scaled dot-product attention e avaliar cuidadosamente memória, vazão e estabilidade numérica.
Benefícios e desenvolvimentos recentes#
Os experimentos originais relataram recuperação de chaves mais forte, aprendizado em contexto, modelagem de sequências longas e taxas de alucinação de LLM mais baixas do que modelos convencionais correspondentes. No entanto, o ruído de atenção reduzido não garante uma saída factual.
Trabalhos recentes incluem o eficiente em parâmetros Shared DIFF Transformer, o método DEX do NeurIPS 2025 para adaptar modelos pré-treinados, e a Differential Attention Adaptation, uma submissão ao ICLR 2026 que adiciona comportamento diferencial durante o ajuste fino. O estudo do Integral Transformer também adverte que a remoção excessiva de ruído pode descartar contexto útil. (arxiv.org)
Aplicações no Mundo Real#
IA conversacional e de documentos: No processamento de linguagem natural, a atenção diferencial pode ajudar sistemas de perguntas e respostas e sumarização a localizar uma frase crítica entre documentos longos e com ruído.
Respostas visuais a perguntas: O estudo Differential Multimodal Transformers de 2025 aplicou o mecanismo a entradas de texto-imagem, melhorando a recuperação de informações ruidosas. Isso é relevante para o aprendizado multimodal e modelos de visão-linguagem. (arxiv.org)
Previsão e visão: A previsão de demanda de passageiros ADFormer explora a atenção diferencial para análise de séries temporais, enquanto o Linear Differential Vision Transformer de 2025 adapta ideias diferenciais contrastivas a Vision Transformers. A pesquisa fundamental sobre Vision Transformer fornece contexto útil. (arxiv.org)
Termos relacionados e melhores práticas#
Um Differential Transformer não é um Diffusion Transformer, que gera imagens ou outros dados por meio de difusão, nem um sensor de transformador diferencial variável linear físico.
Para visão computacional, trate a atenção diferencial como uma opção de pesquisa emergente e compare-a com arquiteturas estabelecidas, como RT-DETR e o Ultralytics YOLO26 focado em borda. Use parâmetros equivalentes, dados de treinamento, latência e orçamentos de memória, e avalie o desempenho em entradas limpas e deliberadamente ruidosas.






