Diffusion Transformer (DiT)
يستبدل محوّل الانتشار (DiT) شبكة U-Net في نماذج الانتشار بمحوّل، ما يتيح توسيع نطاق توليد الصور والفيديو في نماذج مثل Sora.
محوّل الانتشار (DiT) بنية توليدية متقدمة تدمج قدرة المحولات على المعالجة التسلسلية مع قدرات نماذج الانتشار على توليد الصور عالية الدقة. اعتمدت الأنظمة القائمة على الانتشار تقليديًا اعتمادًا كبيرًا على بنى U-Net الالتفافية لإزالة الضوضاء من المدخلات تكراريًا وتوليد الصور. وتستبدل DiT العمود الفقري لـU-Net ببنية محوّل قابلة للتوسع، وتعالج البيانات المرئية على هيئة سلسلة من الرقع، على نحو مشابه لتحليل محوّل الرؤية (ViT) للصور. ويتيح هذا التحول النموذجي توسيع نطاق النماذج بمزيد من القدرة على التنبؤ، والاستفادة من زيادة الموارد الحاسوبية لإنتاج مخرجات أكثر واقعية واتساقًا.
التمييز بين DiT ونماذج الانتشار التقليدية#
مع أن نماذج الانتشار التقليدية تشكّل أساسًا لـالذكاء الاصطناعي التوليدي الحديث، فإن أعمدتها الفقرية من نوع U-Net غالبًا ما تواجه اختناقات عند توسيعها إلى أعداد هائلة من المعلمات. وعلى النقيض، ترث محولات الانتشار بطبيعتها قوانين التوسع المُلاحظة في نماذج اللغة الكبيرة (LLMs). ومن خلال إزالة تحيزات خفض الأبعاد المكانية واستخدام آليات الانتباه الذاتي الشامل، تتعلم DiT العلاقات المكانية المعقدة عبر صورة كاملة أو إطار فيديو كامل. وأظهرت ورقة DiT الأصلية التي أعدها Peebles وXie أن جودة الصور تتحسن باستمرار مع زيادة الحوسبة المخصصة للمحوّل.
تطبيقات عملية#
أفضت مرونة Diffusion Transformers وقابليتها للتوسع إلى إنجازات مهمة في قطاعات متنوعة من الرؤية الحاسوبية:
-
توليد الفيديو عالي الدقة: يظهر أبرز تطبيق لبنية DiT في نماذج تحويل النص إلى فيديو، مثل نموذج Sora من OpenAI. وبفضل فهم الاتساق الزمني والفضاء ثلاثي الأبعاد، تستطيع DiT توليد مقاطع فيديو فائقة الواقعية تمتد لدقائق وتحافظ على المنطق الفيزيائي إطارًا بإطار، ما يُحدث تحولًا في إنشاء المحتوى الرقمي والمؤثرات البصرية.
-
تركيب الصور المتقدم: توفر DiT دقة غير مسبوقة في تحويل النص إلى صورة في التصميم التجاري وتوليد الأعمال الفنية باستخدام الذكاء الاصطناعي. وتستخدمها الوكالات الإبداعية لإنشاء مواد تسويقية بالغة الدقة، وتجسيد المطالبات المعقدة بطباعة دقيقة وواقعية في التكوين، وهو ما عجزت نماذج U-Net الأقدم عن تحقيقه.
تطبيق مفاهيم Transformer#
مع أن DiT تُستخدم أساسًا في مهام التوليد كثيفة المتطلبات الحاسوبية، يمكنك استكشاف آليات الانتباه الذاتي الأساسية التي تعتمد عليها باستخدام مكتبات التعلّم العميق القياسية. يستخدم مقتطف Python التالي PyTorch لشرح كيفية معالجة رقع الصور المسطّحة عبر طبقة Transformer، وهي عملية أساسية داخل شبكة DiT.
import torch
import torch.nn as nn
# Define a standard Transformer layer acting as a DiT building block
transformer_layer = nn.TransformerEncoderLayer(d_model=256, nhead=8)
# Simulate flattened latent image patches (Sequence Length, Batch Size, Features)
latent_patches = torch.rand(196, 1, 256)
# Apply self-attention to process and relate patches globally
output_features = transformer_layer(latent_patches)
print(f"Processed feature shape: {output_features.shape}")تُعد nn.TransformerEncoderLayer واحدة من عدة طبقات المحوّل في PyTorch، وتجمع كل منها بين الانتباه الذاتي متعدد الرؤوس وشبكة تغذية أمامية.
الجمع بين التوليد والكشف#
تمثل Diffusion Transformers أحدث ما توصل إليه توليد المحتوى، لكن كثيرًا من مسارات العمل المؤسسية تتطلب تحليلًا بصريًا آنيًا بدلًا من التركيب. أما المهام التي تتطلب استدلالًا عالي السرعة، مثل اكتشاف الأجسام وتجزئة الصور، فما تزال النماذج خفيفة الوزن والمحسّنة للأجهزة الطرفية هي المعيار في القطاع.
صُممت Ultralytics YOLO26 خصيصًا لهذه مهام الرؤية الحاسوبية التحليلية. فهي توفر سرعة ودقة لا مثيل لهما مباشرةً، وتتجنب العبء الحاسوبي الكبير الذي تتطلبه المحولات التوليدية الضخمة. وللانتقال بسهولة من إنشاء مجموعات البيانات إلى النشر بمستوى المؤسسات، يعتمد المطورون على منصة Ultralytics، وهي حل متكامل لإدارة مسارات عمل الذكاء الاصطناعي المرئي المتينة.










