Vision Mamba
استكشف Vision Mamba، البديل ذا التعقيد الخطي لـ Transformer. تعرّف على كيفية تحسين نماذج فضاء الحالة (SSMs) للكفاءة في الرؤية الحاسوبية عالية الدقة.
يمثل Vision Mamba تحولًا مهمًا في بنى التعلّم العميق للرؤية الحاسوبية، إذ يبتعد عن هيمنة آليات الانتباه الموجودة في Transformers. وهو تكييف لبنية Mamba، التي صُممت أصلًا لنمذجة التسلسلات بكفاءة في معالجة اللغة الطبيعية، مع تخصيصها للمهام المرئية. ومن خلال الاستفادة من نماذج فضاء الحالة (SSMs)، يقدم Vision Mamba بديلًا ذا تعقيد خطي للتعقيد التربيعي لطبقات الانتباه الذاتي التقليدية. ويتيح له ذلك معالجة الصور عالية الدقة بكفاءة أكبر، ما يجعله ذا قيمة خاصة للتطبيقات التي تكون فيها الموارد الحاسوبية محدودة أو يلزم فيها التقاط التبعيات بعيدة المدى في البيانات المرئية دون البصمة الذاكرية الكبيرة المعتادة في محولات الرؤية (ViT).
كيفية عمل Vision Mamba#
يكمن جوهر Vision Mamba في مفهوم المسح الانتقائي للبيانات. تعالج الشبكات العصبية الالتفافية (CNNs) التقليدية الصور باستخدام نوافذ منزلقة محلية، وهي ممتازة لاكتشاف الأنسجة والحواف لكنها تواجه صعوبة في فهم السياق الشامل. وعلى النقيض، تستخدم Transformers الانتباه الشامل لربط كل بكسل (أو رقعة) بكل بكسل آخر، ما يوفر سياقًا ممتازًا لكنه يصبح مكلفًا حسابيًا مع زيادة دقة الصورة. ويسد Vision Mamba هذه الفجوة بتسطيح الصور إلى تسلسلات ومعالجتها باستخدام فضاءات حالة انتقائية. ويسمح ذلك للنموذج بضغط المعلومات المرئية في حالة ذات حجم ثابت، مع الاحتفاظ بالتفاصيل ذات الصلة عبر مسافات طويلة في تسلسل الصورة واستبعاد الضوضاء غير المهمة.
تتضمن البنية عادةً آلية مسح ثنائية الاتجاه. وبما أن الصور بنى ثنائية الأبعاد وليست متسلسلة بطبيعتها مثل النص، يمسح Vision Mamba رقع الصورة في الاتجاهين الأمامي والخلفي (وأحيانًا في مسارات مختلفة) لضمان فهم العلاقات المكانية بصرف النظر عن ترتيب المسح. ويتيح هذا النهج للنموذج تحقيق مجالات استقبال شاملة شبيهة بتلك الموجودة في Transformers، لكن بسرعات استدلال أعلى واستخدام أقل للذاكرة، وغالبًا ما يضاهي النتائج المتطورة في معايير مثل ImageNet.
تطبيقات عملية#
تجعل كفاءة Vision Mamba منه خيارًا مهمًا للبيئات محدودة الموارد والمهام عالية الدقة.
- تحليل الصور الطبية: في مجالات مثل الأشعة، يتطلب تحليل صور MRI أو CT عالية الدقة اكتشاف شذوذ دقيق قد يكون بعيدًا مكانيًا داخل صورة كبيرة. ويستطيع Vision Mamba معالجة ملفات تحليل الصور الطبية الكبيرة هذه بفعالية، دون اختناقات الذاكرة التي تعاني منها غالبًا Transformers التقليدية، ما يساعد الأطباء على تحديد الأورام أو الكسور بدقة عالية.
- الملاحة الذاتية على الأجهزة الطرفية: تعتمد السيارات ذاتية القيادة والطائرات المسيّرة على الحوسبة الطرفية لمعالجة تدفقات الفيديو آنيًا. ويتيح التوسع الخطي لـ Vision Mamba لهذه الأنظمة التعامل بكفاءة أكبر مع مدخلات الفيديو ذات معدل الإطارات العالي لمهام اكتشاف الكائنات والتجزئة الدلالية مقارنة بنماذج Transformer الثقيلة، ما يضمن سرعة استجابة أكبر للقرارات الحساسة للسلامة.
Vision Mamba مقابل محولات الرؤية (ViT)#
رغم أن كلتا البنيتين تهدفان إلى التقاط السياق الشامل، فإنهما تختلفان جوهريًا في طريقة العمل.
- محول الرؤية (ViT): يعتمد على آلية الانتباه، التي تحسب العلاقة بين كل زوج من رقع الصورة. وينتج عن ذلك تعقيد تربيعي ($O(N^2)$)، ما يعني أن مضاعفة حجم الصورة تزيد التكلفة الحاسوبية إلى أربعة أمثالها.
- Vision Mamba: يستخدم نماذج فضاء الحالة (SSMs) لمعالجة الرموز المرئية خطيًا ($O(N)$). ويحافظ على حالة متجددة تُحدّث مع ظهور رقع جديدة، ما يمكّنه من التوسع بكفاءة أكبر مع الدقات الأعلى مع الحفاظ على دقة مماثلة.
مثال: سير عمل استدلال فعّال#
مع أن Vision Mamba بنية محددة، فإن مبادئ الكفاءة فيه تتوافق مع أهداف النماذج الحديثة الآنية مثل Ultralytics YOLO26. ويمكن للمستخدمين الراغبين في مهام رؤية محسّنة الاستفادة من منصة Ultralytics للتدريب والنشر. فيما يلي مثال يستخدم الحزمة ultralytics لتنفيذ الاستدلال، ويوضح سهولة استخدام نماذج الرؤية عالية التحسين.
from ultralytics import YOLO
# حمّل نموذج YOLO26 مدرّبًا مسبقًا (محسّنًا للسرعة والدقة)
model = YOLO("yolo26n.pt") # يشير 'n' إلى إصدار nano، مع التركيز على الكفاءة
# تشغيل الاستدلال على صورة
results = model.predict("path/to/image.jpg")
# اعرض النتائج
results[0].show()الفوائد الرئيسية والتطلعات المستقبلية#
يشير إدخال البنى القائمة على Mamba إلى الرؤية الحاسوبية إلى التوجه نحو ذكاء اصطناعي أكثر مراعاةً للأجهزة. ومن خلال خفض العبء الحاسوبي المرتبط بـالانتباه الشامل، يفتح الباحثون آفاقًا لنشر وكلاء الذكاء الاصطناعي المتقدمة على أجهزة أصغر.
تسلط الأبحاث الحديثة، مثل ورقة VMamba والتطورات في التعلّم العميق الفعّال، الضوء على إمكانية أن تحل هذه النماذج محل الشبكات الأساسية التقليدية في مهام تتراوح من فهم الفيديو إلى اكتشاف الكائنات ثلاثية الأبعاد. ومع استمرار المجتمع في تحسين استراتيجيات المسح ودمجها مع الطبقات الالتفافية، يُتوقع أن يصبح Vision Mamba مكوّنًا قياسيًا في أدوات التعلّم العميق إلى جانب CNNs وTransformers.









