Vision Transformer (ViT)
استكشف قوة Vision Transformers (ViT). تعرّف على كيفية إحداث الانتباه الذاتي وتقسيم الرموز إلى رقع ثورةً في الرؤية الحاسوبية بما يتجاوز CNNs مع Ultralytics.
محوّل الرؤية (ViT) هو بنية للتعلّم العميق تكيّف آليات الانتباه الذاتي المصممة أصلاً من أجل معالجة اللغة الطبيعية (NLP) لحلّ المهام البصرية. وعلى خلاف الشبكة العصبية الالتفافية (CNN) التقليدية، التي تعالج الصور عبر تسلسل هرمي من شبكات البكسلات المحلية، يتعامل ViT مع الصورة باعتبارها سلسلة من الرقع المنفصلة. وقد شاعت هذه المنهجية بفضل الورقة البحثية الرائدة "الصورة تساوي 16×16 كلمة"، التي أثبتت أن بنيات Transformer الخالصة يمكنها تحقيق أداء متقدم في الرؤية الحاسوبية (CV) من دون الاعتماد على طبقات التفاف. ومن خلال الاستفادة من الانتباه العالمي، تستطيع ViTs التقاط الاعتماديات بعيدة المدى عبر الصورة بأكملها منذ الطبقة الأولى.
كيفية عمل محوّلات الرؤية#
يتمثل الابتكار الأساسي في ViT في طريقة تنظيمه لبيانات الإدخال. ولجعل الصورة متوافقة مع Transformer قياسي، يقسم النموذج المعلومات البصرية إلى سلسلة من المتجهات، محاكياً الطريقة التي يعالج بها نموذج اللغة جملةً مؤلفة من كلمات.
-
تجزئة الصورة إلى رموز: تُقسَّم صورة الإدخال إلى شبكة من المربعات ذات الحجم الثابت، ويبلغ حجمها عادةً 16x16 بكسلاً. ويُحوَّل كل مربع إلى متجه، ليصبح فعلياً رمزاً بصرياً.
-
الإسقاط الخطي: تمرَّر هذه الرقع المسطحة عبر طبقة خطية قابلة للتدريب لإنشاء تضمينات كثيفة. وتحوّل هذه الخطوة قيم البكسلات الخام إلى فضاء عالي الأبعاد يستطيع النموذج معالجته.
-
الترميز الموضعي: بما أن البنية تعالج السلاسل بالتوازي وتفتقر إلى فهم متأصل للترتيب أو المكان، تُضاف ترميزات موضعية قابلة للتعلّم إلى تضمينات الرقع. ويتيح ذلك للنموذج الاحتفاظ بالمعلومات المكانية المتعلقة بموضع كل رقعة في الصورة الأصلية.
-
آلية الانتباه الذاتي: تدخل السلسلة إلى مُرمِّز Transformer، حيث يتيح الانتباه الذاتي لكل رقعة التفاعل مع جميع الرقع الأخرى في الوقت نفسه. ويمكّن ذلك الشبكة من تعلّم السياق العالمي وفهم العلاقة بين بكسل في الزاوية العلوية اليسرى وآخر في الزاوية السفلية اليمنى.
-
رأس التصنيف: في مهام مثل تصنيف الصور، غالباً ما يُضاف "رمز الفئة" إلى مقدمة السلسلة. وتمثل الحالة النهائية لإخراج هذا الرمز التمثيل التجميعي للصورة، ثم تُمرَّر إلى مصنّف، مثل المدرك متعدد الطبقات (MLP).
محوّلات الرؤية في مقابل CNNs#
على الرغم من أن كلتا البنيتين تهدفان إلى فهم البيانات البصرية، فإنهما تختلفان اختلافاً كبيراً في فلسفة عملهما. تتمتع CNNs بـ"انحياز استقرائي" قوي يُعرف بثبات الترجمة، ما يعني أنها تفترض بطبيعتها أن السمات المحلية، مثل الحواف والأنسجة، مهمة بغض النظر عن موضعها. ويجعل ذلك CNNs فعّالة جداً من حيث استخدام البيانات وذات أداء جيد على مجموعات البيانات الأصغر.
وعلى العكس، تتمتع محوّلات الرؤية بانحياز أقل ارتباطاً بالصور. إذ يتعين عليها تعلّم العلاقات المكانية من الصفر باستخدام كميات هائلة من بيانات التدريب، مثل JFT-300M أو مجموعات بيانات ImageNet الكاملة. وبينما يجعل ذلك التدريب أكثر استهلاكاً للموارد الحوسبية، فإنه يتيح لـ ViTs التوسع بكفاءة ملحوظة؛ فمع توفر بيانات كافية وقدرة حوسبية، يمكنها التفوق على CNNs من خلال التقاط البنى العالمية المعقدة التي قد تفوتها عمليات الالتفاف المحلية.
التطبيقات الواقعية#
تجعل القدرة على فهم السياق العالمي ViTs مفيدة بوجه خاص في البيئات المعقدة عالية المخاطر.
- تحليل الصور الطبية: في الذكاء الاصطناعي في الرعاية الصحية، تُستخدم ViTs لتحليل المسوحات عالية الدقة، مثل صور التصوير بالرنين المغناطيسي أو شرائح الأنسجة المرضية. فعلى سبيل المثال، في اكتشاف الأورام، يستطيع ViT ربط الشذوذات النسيجية الدقيقة في الأنسجة بالتغيرات البنيوية الأوسع نطاقاً عبر الشريحة، محدداً الأنماط الخبيثة التي قد يتجاهلها المعالجة المحلية.
- الصور الساتلية والاستشعار عن بُعد: تتفوق ViTs في تحليل الصور الساتلية، حيث تمتد العلاقات بين الكائنات عبر مسافات شاسعة. فعلى سبيل المثال، يتطلب الربط بين موقع لإزالة الغابات وطريق قطع أخشاب بعيد فهماً لـ"الصورة الكبرى" للمشهد الطبيعي، وهي مهمة يتفوق فيها الانتباه العالمي لـ ViT على المجال الاستقبالي المحدود لـ CNNs القياسية.
استخدام Transformer مع Ultralytics#
تدعم مكتبة ultralytics البنى القائمة على Transformer، وأبرزها RT-DETR (محوّل الكشف في الوقت الفعلي). وبينما يُفضَّل YOLO26 الرائد غالباً لتحقيقه توازناً بين السرعة والدقة على الأجهزة الطرفية، يوفر RT-DETR بديلاً قوياً للسيناريوهات التي تعطي الأولوية للسياق العالمي.
يوضح مثال Python التالي كيفية تحميل نموذج قائم على Transformer ومدرَّب مسبقاً وتشغيل الاستدلال عليه:
from ultralytics import RTDETR
# Load a pre-trained RT-DETR model (Vision Transformer-based)
model = RTDETR("rtdetr-l.pt")
# Run inference on an image source
# The model uses self-attention to detect objects globally
results = model("https://ultralytics.com/images/bus.jpg")
# Display the detection results
results[0].show()التوقعات المستقبلية#
يتطور البحث بسرعة لمعالجة التكلفة الحوسبية العالية لـ ViTs. وتجعل تقنيات مثل FlashAttention هذه النماذج أسرع وأكثر كفاءة في استخدام الذاكرة. وعلاوة على ذلك، أصبحت البنى الهجينة التي تجمع بين كفاءة CNNs وانتباه Transformers شائعة. وبالنسبة إلى الفرق التي تسعى إلى إدارة مسارات العمل المتقدمة هذه، توفر منصة Ultralytics بيئة موحّدة لوسم البيانات، وتدريب النماذج المعقدة عبر السحابة، ونشرها على نقاط نهاية متنوعة.









