Differential Transformer
تعرف على كيفية قيام Differential Transformers بتقليل ضوضاء الانتباه باستخدام خرائط انتباه مزدوجة، مما يحسن استرجاع الإشارات في تطبيقات الذكاء الاصطناعي اللغوية والبصرية ومتعددة الوسائط.
إن محول التفاضل (Differential Transformer)، الذي يسمى أيضاً محول DIFF، هو بنية بحثية تعدل محول Transformer القياسي لتقليل المعلومات المشتتة أو غير ذات الصلة في آلية الانتباه الخاصة به. تم تقديمه في عام 2024 ونُشر في ICLR 2025، وهو يحسب الفرق بين خارطتي انتباه، مما يساعد النموذج على تضخيم الإشارات المفيدة مع إلغاء الضوضاء المشتركة. يستهدف مشروع Microsoft Research Differential Transformer الأصلي نماذج اللغة في المقام الأول بدلاً من المستشعرات الفيزيائية. (microsoft.com)
كيف يعمل الانتباه التفاضلي#
يقارن الاهتمام الذاتي القياسي بين الاستعلامات والمفاتيح، ويطبق تطبيع softmax، ويستخدم الأوزان الناتجة غير السالبة لتدمج القيم. يخلق الانتباه التفاضلي خارطتي softmax منفصلتين ويطرح نسخة مصغرة من الثانية من الأولى:
output = (attention_map_1 - lambda x attention_map_2) x values
هنا، يتم تعلم lambda. يتيح الطرح أوزان انتباه سالبة، والتي يمكنها قمع الرموز التي تعتبرها كلتا الخريطتين متشابهتين. يوسع هذا المبادئ الواردة في بحث Attention Is All You Need الأصلي وهو ذو صلة خاصة بالنماذج ذات نافذة السياق الكبيرة. (arxiv.org)
يوضح هذا مثال PyTorch softmax القابل للتنفيذ العملية الأساسية:
import torch
q1, q2, k1, k2 = [torch.randn(4, 8) for _ in range(4)]
values = torch.randn(4, 8)
scale = q1.shape[-1] ** -0.5
map1 = torch.softmax(q1 @ k1.T * scale, dim=-1)
map2 = torch.softmax(q2 @ k2.T * scale, dim=-1)
output = (map1 - 0.8 * map2) @ values
print(output.shape)قد تستخدم تطبيقات الإنتاج أنوية انتباه المنتج النقطي المقيس لـ PyTorch المحسنة وتقوم بمقارنة الذاكرة والإنتاجية والاستقرار العددي بعناية.
الفوائد والتطورات الأخيرة#
أبلغت التجارب الأصلية عن استرجاع أفضل للمفاتيح، وتعلم ضمن السياق، ونمذجة التسلسلات الطويلة، ومعدلات هلوسة LLM أقل مقارنة بالنماذج التقليدية المتطابقة. ومع ذلك، فإن تقليل ضوضاء الانتباه لا يضمن مخرجات واقعية.
تشمل الأعمال الحديثة Shared DIFF Transformer الكفء من حيث المعلمات، وطريقة DEX لمؤتمر NeurIPS 2025 لتكييف النماذج المدربة مسبقاً، وDifferential Attention Adaptation، وهو مقال مقدم لمؤتمر ICLR 2026 يضيف سلوكاً تفاضلياً أثناء الضبط الدقيق. يحذر أيضاً دراسة Integral Transformer من أن إزالة الضوضاء المفرطة قد تتخلص من سياق مفيد. (arxiv.org)
تطبيقات العالم الحقيقي#
الذكاء الاصطناعي للمستندات والمحادثة: في معالجة اللغات الطبيعية، يمكن أن يساعد الانتباه التفاضلي أنظمة الإجابة عن الأسئلة والتلخيص في تحديد موقع جملة حرجة بين المستندات الطويلة والمليئة بالضوضاء.
الإجابة المرئية عن الأسئلة: طبقت دراسة Differential Multimodal Transformers لعام 2025 الآلية على مدخلات النصوص والصور، مما أدى إلى تحسين استرجاع المعلومات المليئة بالضوضاء. هذا ذو صلة بـ التعلم متعدد الوسائط ونماذج الرؤية واللغة. (arxiv.org)
التنبؤ والرؤية: يستكشف نظام ADFormer للتنبؤ بطلب الركاب الانتباه التفاضلي لـ تحليل السلاسل الزمنية، بينما يقوم Linear Differential Vision Transformer لعام 2025 بتكييف الأفكار التفاضلية التباينية مع محولات الرؤية (Vision Transformers). يوفر بحث Vision Transformer الأساسي سياقاً مفيداً. (arxiv.org)
المصطلحات ذات الصلة وأفضل الممارسات#
محول التفاضل ليس محول انتشار (Diffusion Transformer)، والذي يولد صوراً أو بيانات أخرى من خلال الانتشار، ولا هو مستشعر محول تفاضلي متغير خطي فيزيائي.
لرؤية الكمبيوتر، تعامل مع الانتباه التفاضلي كخيار بحثي ناشئ وقارنه بالهندسات المعمارية الراسخة مثل RT-DETR وUltralytics YOLO26 الموجه نحو الحافة. استخدم المعلمات المتطابقة، وبيانات التدريب، وزمن الانتقال، وميزانيات الذاكرة، وقيّم الأداء على المدخلات النظيفة والمشوشة عمداً.






