Self-Attention
استكشف أساسيات الانتباه الذاتي (self-attention) في التعلم العميق. تعلم كيف تعمل متجهات الاستعلام (Query)، والمفتاح (Key)، والقيمة (Value) على تشغيل Transformers و Ultralytics YOLO26 للحصول على ذكاء اصطناعي متفوق.
الانتباه الذاتي هو آلية أساسية في التعلم العميق تتيح للنماذج تقييم أهمية العناصر المختلفة داخل تسلسل إدخال بالنسبة لبعضها البعض. على عكس الهندسيات التقليدية التي تعالج البيانات بشكل تسلسلي أو تركز فقط على النطاقات المحلية، يتيح الانتباه الذاتي لـ شبكة عصبية فحص السياق بأكمله في نفس الوقت. تساعد هذه القدرة الأنظمة في تحديد العلاقات المعقدة بين الأجزاء المتباعدة من البيانات، مثل الكلمات في جملة أو المناطق المميزة في صورة. وهي بمثابة لبنة البناء الأساسية لهندسية Transformer، والتي قادت تقدمًا هائلاً في الذكاء الاصطناعي التوليدي وأنظمة الإدراك الحديثة.
كيف يعمل الانتباه الذاتي#
تحاكي هذه الآلية التركيز المعرفي من خلال تعيين وزن، يُسمى غالبًا "درجة الانتباه"، لكل ميزة إدخال. لحساب هذه الدرجات، يقوم النموذج بتحويل بيانات الإدخال — التي يتم تمثيلها عادةً كـ تضمينات — إلى ثلاثة متجهات مميزة: Query وKey وValue.
- الاستعلام (Query): يمثل العنصر الحالي الذي يسعى للحصول على سياق ذي صلة من بقية التسلسل.
- المفتاح (Key): يعمل كملصق أو مُعرف لكل عنصر في التسلسل الذي يتم مطابقة الاستعلام معه.
- القيمة (Value): تحتوي على المحتوى المعلوماتي الفعلي للعنصر الذي سيتم تجميعه.
يقارن النموذج Query الخاص بعنصر واحد مع Keys الخاصة بجميع العناصر الأخرى لتحديد التوافق. يتم تطبيع درجات التوافق هذه باستخدام دالة softmax لإنشاء أوزان تشبه الاحتمالات. يتم بعد ذلك تطبيق هذه الأوزان على Values، مما ينتج عنه تمثيل غني بالسياق. تُمكّن هذه العملية نماذج اللغات الكبيرة (LLMs) وأنظمة الرؤية من إعطاء الأولوية للمعلومات المهمة مع تصفية الضوضاء.
تطبيقات العالم الحقيقي#
أدى تنوع الانتباه الذاتي إلى اعتماده على نطاق واسع عبر مختلف مجالات الذكاء الاصطناعي (AI).
- معالجة اللغات الطبيعية (NLP): في مهام مثل الترجمة الآلية، يحل الانتباه الذاتي الغموض عن طريق ربط الضمائر بمراجعها. على سبيل المثال، في جملة "لم يعبر الحيوان الشارع لأنه كان متعبًا للغاية"، يستخدم النموذج الانتباه الذاتي لربط "لأنه" بقوة بـ "الحيوان" بدلاً من "الشارع". هذا الوعي بالسياق يدعم أدوات مثل Google Translate.
- سياق الصورة العامة: في رؤية الكمبيوتر (CV)، تقسم هندسيات مثل Vision Transformer (ViT) الصور إلى أجزاء وتطبق الانتباه الذاتي لفهم المشهد بشكل عام. هذا أمر حيوي لـ اكتشاف الكائنات في البيئات المعقدة حيث يعتمد تحديد الكائن على فهم محيطه.
التمييز بين المصطلحات ذات الصلة#
على الرغم من مناقشتها غالباً جنباً إلى جنب مع مفاهيم مماثلة، إلا أن لهذه المصطلحات تعريفات تقنية متميزة:
- آلية الانتباه: الفئة الواسعة من التقنيات التي تسمح للنماذج بالتركيز على أجزاء بيانات محددة. وهي تشمل الانتباه المتبادل (Cross-Attention)، حيث يستخدم النموذج تسلسلاً واحدًا (مثل إخراج فك التشفير) للاستعلام عن تسلسل مختلف (مثل إدخال مُشفر).
- الانتباه الذاتي (Self-Attention): نوع محدد من الانتباه حيث تنشأ كل من الاستعلام والمفتاح والقيمة من نفس تسلسل الإدخال. وهي مصممة لتعلم التبعيات الداخلية ضمن مجموعة بيانات واحدة.
- Flash Attention: خوارزمية تحسين تم تطويرها بواسطة باحثين في جامعة ستانفورد تجعل حساب الانتباه الذاتي أسرع بكثير وأكثر كفاءة في استخدام الذاكرة على GPUs دون تغيير الإخراج الرياضي.
مثال برمجي#
يوضح نموذج Python التالي كيفية استخدام RTDETR، وهو كاشف كائنات مستند إلى Transformer متضمن في حزمة ultralytics. على عكس الشبكات التلافيفية القياسية، يعتمد هذا النموذج بشكل كبير على الانتباه الذاتي لمعالجة الميزات المرئية.
from ultralytics import RTDETR
# Load the RT-DETR model which utilizes self-attention for detection
model = RTDETR("rtdetr-l.pt")
# Perform inference on an image to detect objects with global context
# Self-attention helps the model understand relationships between distant objects
results = model("https://ultralytics.com/images/bus.jpg")
# Print the number of objects detected
print(f"Detected {len(results[0].boxes)} objects using Transformer attention.")التطور والتأثير المستقبلي#
حلت آلية الانتباه الذاتي بفعالية مشكلة تلاشي التدرج التي أعاقت الشبكات العصبية المتكررة (RNNs) السابقة، مما مكن من تدريب النماذج الأساسية الضخمة. على الرغم من كونها فعالة للغاية، إلا أن التكلفة الحسابية للانتباه الذاتي القياسي تنمو بشكل تربيعي مع طول التسلسل. لمعالجة هذه المشكلة، تركز الأبحاث الحالية على آليات الانتباه الخطي الكفؤة.
تدمج Ultralytics هذه التطورات في نماذج متطورة مثل YOLO26، والتي تجمع بين سرعة CNNs والقوة السياقية للانتباه من أجل استدلال في الوقت الفعلي فائق. يمكن تدريب هذه النماذج المحسنة ونشرها بسهولة عبر منصة Ultralytics Platform، مما يبسط سير العمل للمطورين الذين يبנים الجيل القادم من التطبيقات الذكية.






