Visual Autoregressive Modeling (VAR)
استكشف النمذجة البصرية ذاتية الانحدار (VAR). تعرّف على كيفية تحسين التنبؤ بالمقياس التالي لسرعة إنشاء الصور وجودتها مقارنةً بالأساليب التقليدية والانتشار.
النمذجة البصرية ذاتية الانحدار (VAR) نهج متقدم في الرؤية الحاسوبية، يكيّف استراتيجيات التعلم ذاتي الانحدار التي اشتهرت بها نماذج اللغة الكبيرة (LLMs) لتناسب مهام توليد الصور. ترمّز الأساليب البصرية التقليدية ذاتية الانحدار الصورة إلى تسلسل أحادي البعد، ثم تتنبأ بها رمزًا بعد رمز وفق ترتيب المسح النقطي، ما يتطلب حسابات مكلفة ويتجاهل البنية الطبيعية ثنائية الأبعاد للبيانات المرئية. وعلى النقيض، تقدم VAR نهج «التنبؤ بالمقياس التالي» من الخشن إلى الدقيق. فهي تولد الصور بالتنبؤ تدريجيًا بخرائط السمات أو المقاييس الأعلى دقةً، بدلًا من التنبؤ بالرموز الفردية صفًا بعد صف. ويحافظ هذا النهج على السلامة البنيوية، مع تحسين جودة الصور وسرعة الاستدلال بدرجة كبيرة.
كيفية عمل النمذجة البصرية ذاتية الانحدار#
تستبدل VAR، في جوهرها، التنبؤ التقليدي بالرمز التالي بالتنبؤ بالمقياس التالي. وتُضغط الصورة أولًا إلى خرائط رموز متقطعة متعددة المقاييس باستخدام معمارية مشابهة لـالمشفّر التلقائي التبايني ذي التكميم المتجهي (VQ-VAE). وأثناء مرحلة التوليد، يتنبأ نموذج Transformer بخرائط الرموز هذه بالتتابع، بدءًا من أصغر دقة (مثل شبكة 1x1) وصولًا إلى الدقة المستهدفة (مثل شبكة 16x16 أو 32x32). ولأنها تعالج البنى المكانية في آنٍ واحد عند كل مقياس، تحافظ VAR بنجاح على الارتباطات ثنائية الاتجاه المتأصلة في الصور ثنائية الأبعاد.
يتيح هذا النهج الجديد لنماذج VAR ترسيخ قوانين التوسع القابلة للتنبؤ، والمقارنة بالمعماريات النصية مثل OpenAI GPT-4. ويتحسن الأداء باستمرار كلما زاد الباحثون عدد معلمات النموذج. ووفقًا لـورقة NeurIPS لعام 2024 حول النمذجة البصرية ذاتية الانحدار، تتفوق VAR بنجاح على المعماريات المنافسة في معيار ImageNet الصعب. كما تحقق مقاييس أفضل في كل من مسافة فرشيه لبدء التشغيل (FID) ودرجات Inception، مع تنفيذ أسرع بكثير.
VAR مقابل نماذج الانتشار#
من المهم التمييز بين VAR والذكاء الاصطناعي التوليدي القائم على الانتشار. تتعلم نماذج الانتشار توليد الصور بإزالة الضوضاء المستمرة من لوحة البداية تكراريًا. أما VAR فتعمل على الرموز المتقطعة. وبدلًا من إزالة الضوضاء، تبني الصورة ذاتيًا انحداريًا، دقةً بعد دقة. وعلى الرغم من أن محوّل الانتشار (DiT) كان معيارًا رائدًا في التوليف المرئي، فإن نهج VAR القائم على الرموز يستفيد مباشرةً من أبحاث التحسين التي أُجريت على نماذج Transformer، ما يمكّنه من التفوق على DiT في قابلية التوسع وكفاءة البيانات.
تطبيقات عملية#
تتيح النمذجة البصرية ذاتية الانحدار، من خلال الجمع بين قدرات الاستدلال لدى نماذج LLMs والرؤية عالية الدقة، إمكانات عملية متعددة:
- تحرير الصور والاستكمال الداخلي دون أمثلة مسبقة: تدعم VAR المعالجة دون أمثلة مسبقة دعمًا أصيلًا. فمن خلال إخفاء مقاييس أو مناطق معينة، يستطيع المطورون تحرير الصور أو تمديدها بسلاسة من دون إعادة تدريب المعمارية الأساسية أو ضبطها ضبطًا دقيقًا.
- توليد أصول قابل للتوسع لقطاع التجزئة: تتيح سرعة الاستدلال الفائقة لـVAR توليف الصور عالية الجودة في الوقت الفعلي، ما يسمح بتوليد خلفيات ديناميكية للمنتجات وأصول تسويقية مخصصة على نطاق واسع.
تنفيذ مسارات العمل ذاتية الانحدار#
تركز نماذج VAR على توليد المحتوى، لكن يمكن إقرانها بنماذج إدراك قوية مثل Ultralytics YOLO26 لإنشاء مسارات عمل شاملة متعددة الوسائط. فعلى سبيل المثال، يمكن استخدام YOLO26 لإجراء اكتشاف دقيق للكائنات وعزل العناصر، ثم تمرير مناطق محددة إلى نموذج ذاتي الانحدار لتحسينها أو إعادة تصميم أسلوبها.
فيما يلي مقتطف مفاهيمي من PyTorch، يوضّح كيف تتنبأ حلقة ذاتية الانحدار متعددة المقاييس تكراريًا بالمقياس التالي لخريطة الرموز، لمحاكاة المنطق الأساسي لـVAR باستخدام وحدات Transformer في PyTorch القياسية:
import torch
import torch.nn as nn
# Conceptual VAR Next-Scale Prediction Loop
class SimpleVARGenerator(nn.Module):
def __init__(self):
super().__init__()
# Simulated transformer to predict next resolution token map
self.transformer = nn.TransformerEncoderLayer(d_model=256, nhead=8)
def forward(self, initial_scale_token):
current_tokens = initial_scale_token
# Iteratively generate next scales (e.g., 1x1 -> 2x2 -> 4x4)
for scale in [1, 2, 4]:
# Model predicts the structural layout for the higher resolution
next_scale_tokens = self.transformer(current_tokens)
# Expand and update tokens for the next iteration
current_tokens = torch.cat((current_tokens, next_scale_tokens), dim=1)
return current_tokens
model = SimpleVARGenerator()
seed_token = torch.randn(1, 1, 256) # 1x1 starting scale
final_output = model(seed_token)
print(f"Generated multi-scale tokens shape: {final_output.shape}")للباحثين الراغبين في إنشاء مسارات عمل للرؤية من البداية إلى النهاية — بدءًا من تنسيق مجموعات البيانات ووصولًا إلى تقييم المعماريات المعقدة — توفر منصة Ultralytics أدوات فعالة للتعليق التلقائي والتتبع والنشر السحابي. وسواء أكان العمل على تحسين نموذج الرؤية واللغة (VLM) أم تجربة التنبؤ بالمقياس التالي، فإن منظومات الذكاء المرئي الموحدة تسرّع الابتكار في حالات الاستخدام الواقعية.









