Deformable Attention
استكشف كيف يحسّن الانتباه القابل للتشوه معالجة البيانات المكانية. تعلّم كيف تعزّز هذه الآلية المتناثرة مهام الرؤية الحاسوبية ونماذج Ultralytics YOLO26.
الانتباه القابل للتشوه هو آلية انتباه متقدمة صُممت لتحسين طريقة معالجة الشبكات العصبية للبيانات المكانية، ولا سيما في مهام الرؤية الحاسوبية (CV). تقيّم وحدات الانتباه التقليدية التفاعلات بين جميع النقاط الممكنة في الصورة، مما يؤدي إلى عبء حسابي هائل عند التعامل مع المدخلات عالية الدقة. ويعالج الانتباه القابل للتشوه هذه المشكلة من خلال التركيز فقط على مجموعة صغيرة وديناميكية من نقاط أخذ العينات الرئيسية حول بكسل مرجعي. وبالسماح للشبكة بتعلّم المكان الذي ينبغي النظر إليه بدقة، بدلًا من مسح الشبكة بأكملها على نحو صارم، فإنه يقلل استخدام الذاكرة بدرجة كبيرة ويسرّع التدريب مع الحفاظ على قدرات التعلّم العميق القوية.
التمييز بين أنماط الانتباه#
يتطلب فهم كيفية توافق هذه التقنية مع البنى الحديثة تمييزها عن المفاهيم ذات الصلة. ففي حين يحسب الانتباه القياسي تعيينًا كثيفًا وعالميًا لجميع وحدات البكسل، يعتمد الانتباه القابل للتشوه على آليات الانتباه المتناثر لأخذ عينات انتقائية من مناطق الاهتمام. علاوة على ذلك، فإنه يختلف عن Flash Attention. إذ إن Flash Attention هو تحسين على مستوى العتاد يسرّع الانتباه القياسي الدقيق من خلال تقليل عمليات القراءة والكتابة في ذاكرة GPU. وعلى النقيض من ذلك، يغيّر الانتباه القابل للتشوه العملية الرياضية جوهريًا عبر تغيير السمات البصرية التي يركّز عليها النموذج.
تُستكشف هذه المفاهيم بنشاط في أبحاث Google DeepMind المتطورة، وتطورات OpenAI في مجال الرؤية، كما تُطبّق أصليًا ضمن منظومة PyTorch وبنى TensorFlow. ومع ذلك، قد تعاني النماذج القائمة على الانتباه حصريًا أحيانًا من تعقيدات النشر. وبالنسبة إلى المشاريع التي تتطلب استدلالًا عالي السرعة دون عبء طبقات Transformer المعقدة، يظل Ultralytics YOLO26 المعيار الموصى به للكشف عن الأجسام مع إعطاء الأولوية للحافة.
التطبيقات الواقعية#
أتاحت الطبيعة المتناثرة والفعّالة لهذا المفهوم تحقيق اختراقات مهمة في مختلف القطاعات التي تتطلب تحليلًا آنيًا للصور الكثيفة.
- المركبات ذاتية القيادة وأنظمة القيادة: تعتمد السيارات ذاتية القيادة على كاميرات عالية الدقة للتنقل في البيئات المعقدة. ويتيح الانتباه القابل للتشوه للأنظمة الموجودة على متن المركبة عزل السمات المهمة بسرعة—مثل المشاة البعيدين أو إشارات المرور المحجوبة جزئيًا—دون إهدار القدرة الحاسوبية في تحليل السماء الخالية. وتُنشر الرؤى المتعلقة بهذه الأنظمة بانتظام في أبحاث IEEE في مجال الرؤية الحاسوبية والمكتبة الرقمية لـ ACM.
- تحليل الصور الطبية والتشخيص: يستخدم اختصاصيو علم الأمراض التصوير التشخيصي عالي الدقة لاكتشاف الشذوذات الخلوية. ومن خلال استخدام أخذ عينات مكانية ذكية، تستطيع نماذج الرؤية تحديد الشذوذات المجهرية بدقة في عمليات المسح التي تبلغ دقتها عدة مليارات من البكسلات، دون تصغير الصورة وفقدان بيانات تشخيصية مهمة. وكثيرًا ما تتردد منهجيات مماثلة قائمة على الانتباه في نهج Anthropic تجاه سلامة الذكاء الاصطناعي ودقته.
- أنظمة المراقبة الذكية: تعالج كاميرات الأمن الحديثة تدفقات فيديو متعددة الميغابكسلات. وتساعد آليات الانتباه على عزل الأفراد المتحركين أو الأمتعة المتروكة دون مراقبة بسرعة في المشاهد المزدحمة، مما يقلل النتائج الإيجابية الكاذبة أثناء التشغيل على أجهزة الحافة محدودة الموارد.
مثال على التعليمات البرمجية#
يمكنك بسلاسة إجراء تجارب على النماذج التي تستخدم آليات الانتباه هذه، مثل RT-DETR (محوّل الكشف في الوقت الحقيقي)، باستخدام الحزمة ultralytics. يوضح المثال التالي كيفية تحميل نموذج وإجراء الاستدلال على صورة عالية الدقة.
from ultralytics import RTDETR
# Load a pre-trained RT-DETR model which utilizes specialized attention mechanisms
model = RTDETR("rtdetr-l.pt")
# Perform inference on an image to detect and locate objects
results = model("https://ultralytics.com/images/bus.jpg")
# Print the bounding box coordinates for the detected objects
for box in results[0].boxes:
print(f"Object found at coordinates: {box.xyxy[0].tolist()}")لتبسيط سير عمل تعلّم الآلة، توفر منصة Ultralytics أدوات سهلة الاستخدام من أجل التدريب والنشر المستندين إلى السحابة. وهي تبسّط خط الأنابيب بأكمله—بدءًا من وسم مجموعة البيانات ووصولًا إلى تصدير النماذج المحسّنة للغاية—مما يضمن تمكّن المطورين من التركيز على بناء الحلول بدلًا من إدارة البنية التحتية المعقدة.









