Self-Attention
استكشف أساسيات الانتباه الذاتي في التعلم العميق. تعرّف على كيفية تشغيل متجهات الاستعلام والمفتاح والقيمة لـ Transformers وUltralytics YOLO26 لتحقيق ذكاء اصطناعي متفوق.
الانتباه الذاتي هو آلية أساسية في التعلم العميق تُمكّن النماذج من ترجيح أهمية العناصر المختلفة ضمن تسلسل الإدخال مقارنةً بعضها ببعض. وعلى خلاف البنى التقليدية التي تعالج البيانات بالتتابع أو تركّز فقط على المناطق المحلية، يتيح الانتباه الذاتي لـالشبكة العصبية فحص السياق بأكمله في الوقت نفسه. وتساعد هذه القدرة الأنظمة على تحديد العلاقات المعقدة بين الأجزاء المتباعدة من البيانات، مثل الكلمات في جملة أو المناطق المتميزة في صورة. وهي تمثّل اللبنة الأساسية لبنية Transformer، التي قادت إلى تطورات هائلة في الذكاء الاصطناعي التوليدي وأنظمة الإدراك الحديثة.
كيفية عمل الانتباه الذاتي#
تحاكي هذه الآلية التركيز الإدراكي من خلال إسناد وزن، يُسمّى غالبًا «درجة الانتباه»، إلى كل سمة من سمات الإدخال. ولحساب هذه الدرجات، يحوّل النموذج بيانات الإدخال—المُمثّلة عادةً على هيئة تضمينات—إلى ثلاثة متجهات متميزة: الاستعلام، والمفتاح، والقيمة.
- الاستعلام (Q): يمثّل العنصر الحالي الذي يبحث عن سياق ذي صلة من بقية التسلسل.
- المفتاح (K): يعمل كتسمية أو معرّف لكل عنصر في التسلسل يُطابَق معه الاستعلام.
- القيمة (V): تحتوي على المحتوى المعلوماتي الفعلي للعنصر الذي سيُجمّع.
يقارن النموذج استعلام أحد العناصر بمفاتيح جميع العناصر الأخرى لتحديد مدى التوافق. وتُطبَّع درجات التوافق هذه باستخدام دالة softmax لإنشاء أوزان شبيهة بالاحتمالات. ثم تُطبَّق هذه الأوزان على القيم، مما يولّد تمثيلًا غنيًا بالسياق. وتتيح هذه العملية لـنماذج اللغة الكبيرة (LLMs) وأنظمة الرؤية إعطاء الأولوية للمعلومات المهمة مع تصفية الضوضاء.
التطبيقات الواقعية#
أدّت مرونة الانتباه الذاتي إلى اعتماده على نطاق واسع في مجالات مختلفة من الذكاء الاصطناعي (AI).
- معالجة اللغة الطبيعية (NLP): في مهام مثل الترجمة الآلية، يحلّ الانتباه الذاتي الغموض من خلال ربط الضمائر بمرجعياتها. فعلى سبيل المثال، في الجملة «لم يعبر الحيوان الشارع لأنه كان متعبًا جدًا»، يستخدم النموذج الانتباه الذاتي لربط «هو» بقوة بـ«الحيوان» بدلًا من «الشارع». ويتيح هذا الوعي بالسياق أدوات مثل Google Translate.
- السياق العالمي للصورة: في الرؤية الحاسوبية (CV)، تقسّم بنيات مثل Transformer للرؤية (ViT) الصور إلى رقع وتطبّق الانتباه الذاتي لفهم المشهد على نحو شامل. ويُعدّ ذلك ضروريًا لـاكتشاف الأجسام في البيئات المعقدة، حيث يعتمد تحديد جسم ما على فهم محيطه.
التمييز بين المصطلحات ذات الصلة#
مع أن هذه المصطلحات تُناقش غالبًا إلى جانب مفاهيم مشابهة، فإن لها تعريفات تقنية متميزة:
- آلية الانتباه: الفئة العامة من التقنيات التي تتيح للنماذج التركيز على أجزاء محددة من البيانات. وهي تشمل الانتباه المتقاطع، حيث يستخدم النموذج تسلسلًا واحدًا، مثل مخرجات وحدة فك الترميز، للاستعلام عن تسلسل مختلف، مثل إدخال وحدة الترميز.
- الانتباه الذاتي: نوع محدد من الانتباه ينشأ فيه الاستعلام والمفتاح والقيمة جميعًا من تسلسل الإدخال نفسه. وقد صُمّم لتعلّم التبعيات الداخلية ضمن مجموعة بيانات واحدة.
- Flash Attention: خوارزمية تحسين طوّرها باحثون في جامعة ستانفورد، وتجعل حساب الانتباه الذاتي أسرع بكثير وأكثر كفاءة من حيث الذاكرة على وحدات معالجة الرسومات (GPUs)، من دون تغيير الناتج الرياضي.
مثال على التعليمات البرمجية#
يوضّح مقتطف Python التالي كيفية استخدام RTDETR، وهو كاشف أجسام قائم على Transformer ومضمّن في الحزمة ultralytics. وعلى خلاف الشبكات الالتفافية القياسية، يعتمد هذا النموذج بدرجة كبيرة على الانتباه الذاتي لمعالجة السمات المرئية.
from ultralytics import RTDETR
# Load the RT-DETR model which utilizes self-attention for detection
model = RTDETR("rtdetr-l.pt")
# Perform inference on an image to detect objects with global context
# Self-attention helps the model understand relationships between distant objects
results = model("https://ultralytics.com/images/bus.jpg")
# Print the number of objects detected
print(f"Detected {len(results[0].boxes)} objects using Transformer attention.")التطور والأثر المستقبلي#
حلّ الانتباه الذاتي بفاعلية مشكلة تلاشي التدرج التي أعاقت الشبكات العصبية المتكررة (RNNs) الأسبق، مما أتاح تدريب النماذج الأساسية الضخمة. وعلى الرغم من فعاليته العالية، تزداد التكلفة الحسابية للانتباه الذاتي القياسي تربيعيًا مع طول التسلسل. ولمعالجة ذلك، يركّز البحث الحالي على آليات الانتباه الخطي الفعّالة.
تدمج Ultralytics هذه التطورات في نماذج متطورة مثل YOLO26، الذي يجمع بين سرعة CNNs والقوة السياقية للانتباه لتحقيق استدلال فوري فائق. ويمكن تدريب هذه النماذج المحسّنة ونشرها بسهولة عبر منصة Ultralytics، مما يبسط سير العمل أمام المطورين الذين يبنون الجيل التالي من التطبيقات الذكية.









