Differential Transformer
Tìm hiểu cách Differential Transformer giảm nhiễu chú ý (attention noise) bằng dual attention maps, giúp cải thiện việc truy xuất tín hiệu trong các ứng dụng AI về ngôn ngữ, thị giác và đa phương thức (multimodal).
A Differential Transformer, hay còn gọi là DIFF Transformer, là một kiến trúc nghiên cứu nhằm sửa đổi Transformer tiêu chuẩn để giảm bớt thông tin gây xao lãng hoặc không liên quan trong cơ chế chú ý (attention mechanism) của nó. Được giới thiệu vào năm 2024 và công bố tại ICLR 2025, kiến trúc này tính toán sự khác biệt giữa hai bản đồ chú ý (attention map), giúp mô hình khuếch đại các tín hiệu hữu ích đồng thời loại bỏ nhiễu chung. Dự án Microsoft Research Differential Transformer ban đầu chủ yếu nhắm đến các mô hình ngôn ngữ thay vì các cảm biến vật lý. (microsoft.com)
Differential Attention hoạt động như thế nào#
Cơ chế tự chú ý (self-attention) tiêu chuẩn so sánh các truy vấn (query) và khóa (key), áp dụng chuẩn hóa softmax (softmax normalization), và sử dụng các trọng số không âm kết quả để kết hợp các giá trị. Chú ý vi phân (differential attention) tạo ra hai bản đồ softmax riêng biệt và trừ đi một phiên bản được điều tỷ lệ của bản đồ thứ hai từ bản đồ thứ nhất:
output = (attention_map_1 - lambda x attention_map_2) x values
Ở đây, lambda được học. Phép trừ cho phép các trọng số chú ý âm, có thể triệt tiêu các token mà cả hai bản đồ đều đánh giá là tương tự nhau. Điều này mở rộng các nguyên tắc trong bài báo Attention Is All You Need gốc và đặc biệt có liên quan đến các mô hình có cửa sổ ngữ cảnh (context window) lớn. (arxiv.org)
Ví dụ softmax PyTorch có thể chạy này minh họa thao tác cốt lõi:
import torch
q1, q2, k1, k2 = [torch.randn(4, 8) for _ in range(4)]
values = torch.randn(4, 8)
scale = q1.shape[-1] ** -0.5
map1 = torch.softmax(q1 @ k1.T * scale, dim=-1)
map2 = torch.softmax(q2 @ k2.T * scale, dim=-1)
output = (map1 - 0.8 * map2) @ values
print(output.shape)Các bản triển khai cho môi trường sản xuất có thể sử dụng các kernel chú ý tích chấm được điều tỷ lệ PyTorch (PyTorch scaled dot-product attention) đã được tối ưu hóa và đánh giá kỹ lưỡng về bộ nhớ, thông lượng cũng như độ ổn định số học.
Lợi ích và những phát triển gần đây#
Các thí nghiệm ban đầu ghi nhận khả năng truy xuất khóa, học trong ngữ cảnh (in-context learning), lập mô hình chuỗi dài mạnh mẽ hơn và tỷ lệ ảo giác của LLM (LLM hallucination) thấp hơn so với các mô hình thông thường tương đương. Tuy nhiên, việc giảm nhiễu chú ý không đảm bảo đầu ra hoàn toàn chính xác về mặt sự thật.
Công việc gần đây bao gồm Shared DIFF Transformer tối ưu tham số, phương pháp DEX tại NeurIPS 2025 để thích ứng các mô hình đã được huấn luyện trước, và Differential Attention Adaptation, một bản nộp cho ICLR 2026 bổ sung hành vi vi phân trong quá trình tinh chỉnh (fine-tuning). Nghiên cứu Integral Transformer cũng cảnh báo rằng việc loại bỏ nhiễu quá mức có thể làm mất đi bối cảnh hữu ích. (arxiv.org)
Các ứng dụng trong thực tế#
Tài liệu và AI hội thoại: Trong xử lý ngôn ngữ tự nhiên, chú ý vi phân có thể giúp các hệ thống hỏi đáp và tóm tắt xác định một câu cốt lõi giữa các tài liệu dài và nhiều nhiễu.
Hỏi đáp trực quan (Visual question answering): Nghiên cứu Differential Multimodal Transformers năm 2025 đã áp dụng cơ chế này vào các đầu vào văn bản-hình ảnh, cải thiện việc truy xuất thông tin nhiễu. Điều này có ý nghĩa quan trọng đối với học đa phương thức (multimodal learning) và mô hình thị giác-ngôn ngữ (vision-language models). (arxiv.org)
Dự báo và thị giác máy tính: Dự báo nhu cầu hành khách ADFormer khám phá chú ý vi phân cho phân tích chuỗi thời gian, trong khi Linear Differential Vision Transformer năm 2025 điều chỉnh các ý tưởng vi phân tương phản cho Vision Transformers. Nghiên cứu nền tảng Vision Transformer cung cấp bối cảnh hữu ích. (arxiv.org)
Các thuật ngữ liên quan và thực tiễn tốt nhất#
Differential Transformer không phải là một Diffusion Transformer, vốn tạo ra hình ảnh hoặc dữ liệu khác thông qua quá trình khuếch tán (diffusion), cũng không phải là một cảm biến biến áp vi phân tuyến tính (linear variable differential transformer sensor) vật lý.
Đối với thị giác máy tính, hãy coi chú ý vi phân như một tùy chọn nghiên cứu mới nổi và so sánh nó với các kiến trúc đã được thiết lập như RT-DETR và Ultralytics YOLO26 tập trung vào biên (edge). Sử dụng các tham số, dữ liệu huấn luyện, độ trễ và ngân sách bộ nhớ tương đương, đồng thời đánh giá hiệu suất trên cả dữ liệu sạch và dữ liệu được tạo nhiễu có chủ đích.






