Differential Transformer
Differential Transformer가 이중 어텐션 맵을 통해 어떻게 어텐션 노이즈를 줄이고 언어, 비전 및 멀티모달 AI 애플리케이션에서 신호 검색 성능을 향상시키는지 알아보십시오.
DIFF Transformer라고도 불리는 Differential Transformer는 표준 Transformer를 수정하여 attention mechanism의 주의를 산만하게 하거나 관련 없는 정보를 줄이도록 설계된 연구용 아키텍처입니다. 2024년에 도입되어 ICLR 2025에 발표된 이 아키텍처는 두 개의 attention map 간의 차이를 계산하여 모델이 공통된 노이즈를 상쇄하면서 유용한 신호를 증폭할 수 있도록 돕습니다. 원본 Microsoft Research Differential Transformer project는 물리적 센서보다는 주로 언어 모델을 대상으로 합니다. (microsoft.com)
Differential Attention 작동 방식#
표준 self-attention은 쿼리와 키를 비교하고, softmax normalization을 적용하며, 결과로 나온 음수가 아닌 가중치를 사용하여 값을 결합합니다. Differential attention은 두 개의 개별 softmax map을 생성하고 첫 번째 지도에서 두 번째 지도의 스케일링된 버전을 뺍니다:
output = (attention_map_1 - lambda x attention_map_2) x values
여기서 lambda은 학습됩니다. 뺄셈을 통해 음수의 attention weight가 허용되며, 이는 두 지도 모두에서 비슷하게 간주하는 토큰들을 억제할 수 있습니다. 이는 원본 Attention Is All You Need paper의 원칙을 확장하며, 큰 context window를 가진 모델과 특히 관련이 있습니다. (arxiv.org)
이 실행 가능한 PyTorch softmax example은 핵심 연산을 보여줍니다:
import torch
q1, q2, k1, k2 = [torch.randn(4, 8) for _ in range(4)]
values = torch.randn(4, 8)
scale = q1.shape[-1] ** -0.5
map1 = torch.softmax(q1 @ k1.T * scale, dim=-1)
map2 = torch.softmax(q2 @ k2.T * scale, dim=-1)
output = (map1 - 0.8 * map2) @ values
print(output.shape)프로덕션 구현에서는 최적화된 PyTorch scaled dot-product attention 커널을 사용하고 메모리, 처리량, 수치적 안정성을 신중하게 벤치마킹할 수 있습니다.
이점 및 최근 개발 동향#
기존 실험에서는 일치하는 기존 모델에 비해 더 강력한 키 검색, 인컨텍스트 학습, 긴 시퀀스 모델링, 그리고 더 낮은 LLM hallucination 비율이 보고되었습니다. 그러나 attention 노이즈가 줄어들었다고 해서 사실적인 출력이 보장되는 것은 아닙니다.
최근 연구에는 파라미터 효율적인 Shared DIFF Transformer, 사전 학습된 모델을 적응시키기 위한 NeurIPS 2025 DEX method, 그리고 미세 조정 중에 미분 동작을 추가하는 ICLR 2026 제출작인 Differential Attention Adaptation이 포함됩니다. Integral Transformer study 또한 과도한 노이즈 제거가 유용한 컨텍스트를 폐기할 수 있음을 경고합니다. (arxiv.org)
실제 애플리케이션 사례#
문서 및 대화형 AI: natural language processing에서 differential attention은 질의응답 및 요약 시스템이 길고 노이즈가 많은 문서 중에서 중요한 문서를 찾는 데 도움을 줄 수 있습니다.
시각적 질의응답: 2025년 Differential Multimodal Transformers study는 이 메커니즘을 텍스트-이미지 입력에 적용하여 노이즈가 있는 정보 검색을 개선했습니다. 이는 multimodal learning 및 vision-language models와 관련이 있습니다. (arxiv.org)
예측 및 비전: ADFormer passenger-demand forecasting은 time-series analysis를 위해 differential attention을 탐구하며, 2025년 Linear Differential Vision Transformer는 대조적 미분 아이디어를 Vision Transformers에 적용합니다. 기초적인 Vision Transformer research는 유용한 컨텍스트를 제공합니다. (arxiv.org)
관련 용어 및 모범 사례#
Differential Transformer는 확산을 통해 이미지나 기타 데이터를 생성하는 Diffusion Transformer도 아니고, 물리적인 linear variable differential transformer sensor도 아닙니다.
컴퓨터 비전의 경우, differential attention을 새로운 연구 옵션으로 취급하고 RT-DETR 및 엣지 중심의 Ultralytics YOLO26과 같은 기존 아키텍처와 비교하십시오. 일치하는 파라미터, 학습 데이터, 지연 시간 및 메모리 예산을 사용하고, 깨끗한 입력과 의도적으로 노이즈가 있는 입력 모두에서 성능을 평가하십시오.






