Swin Transformer
اكتشف كيف تستخدم بنية Swin Transformer نوافذ مزاحة لتحقيق رؤية حاسوبية فعّالة، واستكشف مسارات العمل على منصة Ultralytics.
قدّم باحثون في Microsoft هذه البنية في الورقة البحثية البارزة لعام 2021 "Swin Transformer: Hierarchical Vision Transformer using Shifted Windows"، وهي تكيّف آلية الانتباه الخاصة بـالتعلم العميق (DL) للتعامل مع تعقيدات البيانات المرئية عالية الدقة. وعلى خلاف نماذج معالجة اللغة الطبيعية التي تعالج رموزًا نصية ذات أطوال موحّدة، تقرّ هذه البنية بأن العناصر المرئية تختلف اختلافًا كبيرًا في مقياسها. ومن خلال بناء تمثيل هرمي واستخدام تقنية فريدة لتقسيم النوافذ، تحقق تعقيدًا حسابيًا خطيًا بالنسبة إلى حجم الصورة، مما يجعلها نموذجًا أساسيًا عالي الكفاءة لمجموعة متنوعة من مهام الرؤية الحاسوبية (CV).
كيفية عمل النوافذ المُزاحة والتصميم الهرمي#
يكمن الابتكار الأساسي في كيفية تنظيم النموذج لـاستخراج السمات. إذ يبدأ بتقسيم صورة الإدخال إلى رقع صغيرة غير متداخلة. لكن، على خلاف النماذج السابقة، يدمج هذه الرقع المتجاورة تدريجيًا في مناطق أكبر ضمن الطبقات الأعمق. ويتيح هذا النهج الهرمي للشبكة استخراج خرائط سمات غنية تمثّل السياق العام بمقاييس متعددة، بدءًا من التفاصيل المرئية الدقيقة ووصولًا إلى الأجسام الكبيرة.
للحفاظ على الكفاءة الحسابية، يُحسب الانتباه الذاتي داخل نوافذ محلية ومعزولة فقط، بدلًا من حسابه عبر الصورة بأكملها. ولضمان تدفق المعلومات عبر هذه الحدود، تُزاح النوافذ بين الطبقات المتعاقبة. ويعمل مخطط النوافذ المُزاحة هذا على وصل المناطق المستقلة بفاعلية، موفّرًا تدرجات مكانية هرمية متعددة المقاييس من دون العبء الحسابي الكبير المرتبط بالانتباه العام.
Swin Transformer مقابل محوّل الرؤية (ViT)#
عند مقارنة البنى الحديثة، من المهم التمييز بين هذا النموذج ومحوّل الرؤية القياسي (ViT). إذ يتعامل ViT الأصلي مع الصور بوصفها تسلسلًا من الرقع ذات الحجم الثابت، ويحسب الانتباه العام عليها جميعًا في الوقت نفسه. ورغم دقته العالية، يؤدي ذلك إلى تعقيد حسابي تربيعي، ما يعني أن متطلبات المعالجة والذاكرة تتزايد بسرعة هائلة مع ارتفاع دقة الصورة.
في المقابل، يحافظ التصميم الهرمي والقائم على النوافذ في بنية Swin على التعقيد الخطي. وهذا يجعله أكثر عملية بكثير لمهام التنبؤ الكثيف التي تتطلب مدخلات ومخرجات عالية الدقة. ونتيجة لذلك، يحقق نتائج متقدمة على مستوى أحدث التقنيات في معايير مثل مجموعة بيانات COCO test-dev الخاصة بـاكتشاف الأجسام متعدد المقاييس، ومجموعة بيانات التجزئة الدلالية ADE20K الخاصة بـتجزئة الصور الدقيقة.
التطبيقات الواقعية في الذكاء الاصطناعي الحديث#
بفضل مرونتها وكفاءتها، جرى تكييف تطبيق مستودع Microsoft Research على GitHub الرسمي عبر صناعات معقدة وحساسة.
- تحليل الصور الطبية: في البيئات السريرية، تستفيد شبكات مثل Swin-Unet من هذه البنية لمعالجة فحوصات التصوير بالرنين المغناطيسي (MRI) الحجمية ثلاثية الأبعاد وتحليل الأنسجة المرضية عالي الدقة. وتساعد قدرة النموذج على الاحتفاظ بالتدرجات المكانية الهرمية الكثيفة في تحديد الشذوذات الدقيقة، مثل الأورام في مراحلها المبكرة. ويمكنك قراءة المزيد عن أحدث الإنجازات في أبحاث التصوير الطبي.
- تحليل صور الأقمار الصناعية: بالنسبة إلى الرصد البيئي والاستشعار عن بُعد، يُعد التقاط السياق الجغرافي واسع النطاق أمرًا بالغ الأهمية. وتعالج البنية الهرمية مجموعات البيانات الجوية الضخمة بكفاءة لتتبع إزالة الغابات، والتخطيط الحضري، ومراقبة صحة المحاصيل.
التكامل مع PyTorch وUltralytics#
بالنسبة إلى المطورين الذين يبنون شبكات عصبية مخصصة، يُعد تنفيذ هذه البنية أمرًا مباشرًا باستخدام وثائق PyTorch الرسمية. وتتضمن مكتبة torchvision إصدارات مدرّبة مسبقًا، مثل الإصدار الخفيف Tiny، والمُحسّنة باستخدام ImageNet.
import torch
from torchvision.models import Swin_T_Weights, swin_t
# Load a pre-trained Tiny variant with ImageNet weights
weights = Swin_T_Weights.IMAGENET1K_V1
model = swin_t(weights=weights)
model.eval()
# Run a single batch containing a 3-channel, 224x224 dummy image tensor
dummy_image = torch.randn(1, 3, 224, 224)
output = model(dummy_image)
# The output shape is [1, 1000], representing the 1000 ImageNet classes
print(f"Prediction tensor shape: {output.shape}")رغم أن النماذج الأساسية القائمة على Transformer توفر تمثيلًا ممتازًا متعدد المقاييس، تتطلب التطبيقات الحديثة غالبًا تحسينات شاملة من البداية إلى النهاية لـأجهزة الذكاء الاصطناعي الطرفية. فعلى سبيل المثال، توفر Ultralytics YOLO26 بنية أصلية شاملة من البداية إلى النهاية، أصغر حجمًا وأسرع وأكثر دقة، وتتميز بأدائها في البيئات الطرفية الفورية. وسواء استخدم المطورون بنى كثيفة الاعتماد على Transformer أو نماذج التفافية سريعة، فيمكنهم إدارة سير العمل بالكامل—بدءًا من وسم البيانات وصولًا إلى التدريب—عبر Ultralytics Platform. وتبسّط سلسلة الأدوات السحابية الشاملة هذه نشر النماذج والمراقبة المستمرة للنماذج وتجعلها أكثر كفاءة.









