Differential Transformer
Узнай, как Differential Transformers уменьшают шум внимания с помощью карт двойного внимания, улучшая извлечение сигналов в языковых, визуальных и мультимодальных приложениях AI.
Differential Transformer, также называемый DIFF Transformer, — это исследовательская архитектура, которая модифицирует стандартный Transformer для уменьшения отвлекающей или нерелевантной информации в своем attention mechanism. Представленный в 2024 году и опубликованный на ICLR 2025, он вычисляет разницу между двумя картами внимания, помогая модели усиливать полезные сигналы и одновременно подавлять общий шум. Оригинальный Microsoft Research Differential Transformer project в первую очередь ориентирован на языковые модели, а не на физические датчики. (microsoft.com)
Как работает Differential Attention#
Стандартный self-attention сравнивает запросы и ключи, применяет softmax normalization и использует полученные неотрицательные веса для объединения значений. Дифференциальное внимание создает две отдельные карты softmax и вычитает из первой масштабированную версию второй:
output = (attention_map_1 - lambda x attention_map_2) x values
Здесь lambda является обучаемым параметром. Вычитание позволяет использовать отрицательные веса внимания, что может подавлять токен, которые обе карты считают одинаковыми. Это расширяет принципы оригинальной Attention Is All You Need paper и особенно актуально для моделей с большим context window. (arxiv.org)
Этот исполняемый PyTorch softmax example иллюстрирует основную операцию:
import torch
q1, q2, k1, k2 = [torch.randn(4, 8) for _ in range(4)]
values = torch.randn(4, 8)
scale = q1.shape[-1] ** -0.5
map1 = torch.softmax(q1 @ k1.T * scale, dim=-1)
map2 = torch.softmax(q2 @ k2.T * scale, dim=-1)
output = (map1 - 0.8 * map2) @ values
print(output.shape)В продакшн-реализациях могут использоваться оптимизированные ядра PyTorch scaled dot-product attention, а также проводиться тщательное бенчмаркирование памяти, пропускной способности и численной стабильности.
Преимущества и последние разработки#
В первоначальных экспериментах сообщалось о более эффективном извлечении ключей, обучении в контексте, моделировании длинных последовательностей и более низких уровнях LLM hallucination по сравнению с сопоставимыми обычными моделями. Тем не менее, сниженный уровень шума в механизме внимания не гарантирует фактическую точность вывода.
Недавние работы включают параметроэффективный Shared DIFF Transformer, NeurIPS 2025 DEX method для адаптации предобученных моделей и Differential Attention Adaptation — заявку на ICLR 2026, которая добавляет дифференциальное поведение при тонкой настройке. В Integral Transformer study также предупреждается, что чрезмерное удаление шума может привести к потере полезного контекста. (arxiv.org)
Реальные приложения#
Документы и разговорный ИИ: В natural language processing дифференциальное внимание может помочь системам вопрос-ответ и суммаризации находить ключевое предложение среди длинных зашумленных документов.
Визуальные ответы на вопросы: В исследовании 2025 года Differential Multimodal Transformers study этот механизм применялся к текстово-изобразительным входам, улучшая извлечение зашумленной информации. Это актуально для multimodal learning и vision-language models. (arxiv.org)
Прогнозирование и зрение: В ADFormer passenger-demand forecasting исследуется дифференциальное внимание для time-series analysis, в то время как Linear Differential Vision Transformer 2025 года адаптирует контрастные дифференциальные идеи для Vision Transformers. Фундаментальное Vision Transformer research предоставляет полезный контекст. (arxiv.org)
Связанные термины и лучшие практики#
Differential Transformer — это не Diffusion Transformer, который генерирует изображения или другие данные с помощью диффузии, и не физический linear variable differential transformer sensor.
Для компьютерного зрения рассматривай дифференциальное внимание как перспективное исследовательское направление и сравнивай его с устоявшимися архитектурами, такими как RT-DETR и ориентированная на периферийные устройства Ultralytics YOLO26. Используй сопоставимые параметры, обучающие данные, задержку и ограничения по памяти, а также оценивай производительность как на чистых, так и на намеренно зашумленных входах.






