Visual Autoregressive Modeling (VAR)
Görsel Otoregresif Modelleme'yi (VAR) keşfet. Bir sonraki ölçek tahmininin, görüntü oluşturma hızını ve kalitesini geleneksel yöntemlere ve difüzyona kıyasla nasıl iyileştirdiğini öğren.
Görsel Otoregresif Modelleme (VAR), büyük dil modelleri (LLM) tarafından popülerleştirilen otoregresif öğrenme stratejilerini görüntü üretimi görevlerine uyarlayan gelişmiş bir bilgisayarlı görü paradigmasıdır. Geleneksel görsel otoregresif yöntemler, bir görüntüyü 1B diziye kodlar ve bunu hesaplama açısından maliyetli olan ve görsel verilerin doğal 2B yapısını göz ardı eden bir tarama sırasıyla token token tahmin eder. Buna karşın VAR, kabadan inceye "sonraki ölçek tahmini" yaklaşımını sunar. Bireysel tokenleri satır satır tahmin etmek yerine, daha yüksek çözünürlüklü özellik haritalarını veya ölçekleri kademeli olarak tahmin ederek görüntüler üretir. Bu metodoloji, yapısal bütünlüğü korurken hem görüntü kalitesini hem de çıkarım hızını önemli ölçüde artırır.
Görsel Otoregresif Modelleme Nasıl Çalışır#
Özünde VAR, geleneksel sonraki token tahmininin yerini sonraki ölçek tahmini ile alır. Bir görüntü, ilk olarak Vektör Kantolu Varyasyonel Otokodlayıcı (VQ-VAE) benzeri bir mimari kullanılarak çok ölçekli ayrık token haritalarına sıkıştırılır. Üretim aşamasında bir transformer modeli, en küçük çözünürlükten (1x1 ızgara gibi) hedef çözünürlüğe (16x16 veya 32x32 ızgara gibi) kadar bu token haritalarını sırayla tahmin eder. Her ölçekte uzamsal yapıları aynı anda işlediği için VAR, 2B görüntülere özgü çift yönlü korelasyonları başarıyla korur.
Bu yenilikçi yaklaşım, VAR modellerinin OpenAI GPT-4 gibi metin tabanlı mimarilerle karşılaştırılabilir öngörülebilir ölçeklendirme yasaları oluşturmasını sağlar. Araştırmacılar model parametrelerini ölçeklendirdikçe performans tutarlı bir şekilde artar. Görsel Otoregresif Modelleme üzerine NeurIPS 2024 makalesine göre VAR, zorlu ImageNet kıyaslamasında rakip mimarileri başarıyla geride bırakmaktadır. Çok daha hızlı çalışırken hem Frechet Inception Mesafesi (FID) hem de inception skorlarında daha iyi metrikler elde eder.
VAR ve Difüzyon Modelleri Karşılaştırması#
VAR'ı difüzyon tabanlı üretken yapay zekadan ayırmak önemlidir. Difüzyon modelleri, bir başlangıç tuvalinden sürekli gürültüyü yinelemeli olarak kaldırarak görüntüler üretmeyi öğrenir. Ancak VAR, ayrık tokenler üzerinde çalışır. Gürültü giderme yerine, görüntü çözünürlüğünü çözünürlük üzerine otoregresif olarak inşa eder. Difüzyon Transformer (DiT) görsel sentez için önde gelen bir standart olmuş olsa da, VAR'ın token tabanlı yaklaşımı transformer modellerine aktarılan optimizasyon araştırma çalışmalarından doğrudan yararlanarak DiT'i hem ölçeklenebilirlik hem de veri verimliliğinde geride bırakmasını sağlar.
Gerçek Dünya Uygulamaları#
Görsel Otoregresif Modelleme, LLM'lerin akıl yürütme yeteneklerini yüksek sadakatli görü ile birleştirerek çeşitli pratik yeteneklerin kilidini açar:
- Sıfır Örnekle Görüntü Düzenleme ve İyileştirme: VAR, sıfır örnekle manipülasyonu yerel olarak destekler. Geliştiriciler, belirli ölçekleri veya bölgeleri maskeleyerek taban mimariyi yeniden eğitmeden veya ince ayar yapmadan görüntüleri sorunsuz bir şekilde düzenleyebilir veya genişletebilir.
- Perakende için Ölçeklenebilir Varlık Üretimi: VAR'ın olağanüstü çıkarım hızı, gerçek zamanlı, yüksek kaliteli görüntü sentezine olanak tanıyarak dinamik ürün arka planı oluşturmaya ve kişiselleştirilmiş pazarlama varlıklarını ölçekli bir şekilde üretmeye imkan tanır.
Otoregresif İş Akışlarını Uygulama#
VAR modelleri içerik üretimine odaklanırken, kapsamlı çok modlu boru hatları oluşturmak için Ultralytics YOLO26 gibi güçlü algılama modelleriyle eşleştirilebilirler. Örneğin, konuları izole etmek için hassas nesne algılamada YOLO26'yı kullanabilir ve ardından bu belirli bölgeleri geliştirme veya yeniden biçimlendirme için otoregresif bir modele geçirebilirsin.
Aşağıda, çok ölçekli otoregresif bir döngünün standart PyTorch Transformer modüllerini kullanarak VAR'ın altta yatan mantığını simüle eden, bir token haritasının sonraki ölçeğini yinelemeli olarak nasıl tahmin ettiğini gösteren kavramsal bir PyTorch kod parçacığı bulunmaktadır:
import torch
import torch.nn as nn
# Conceptual VAR Next-Scale Prediction Loop
class SimpleVARGenerator(nn.Module):
def __init__(self):
super().__init__()
# Simulated transformer to predict next resolution token map
self.transformer = nn.TransformerEncoderLayer(d_model=256, nhead=8)
def forward(self, initial_scale_token):
current_tokens = initial_scale_token
# Iteratively generate next scales (e.g., 1x1 -> 2x2 -> 4x4)
for scale in [1, 2, 4]:
# Model predicts the structural layout for the higher resolution
next_scale_tokens = self.transformer(current_tokens)
# Expand and update tokens for the next iteration
current_tokens = torch.cat((current_tokens, next_scale_tokens), dim=1)
return current_tokens
model = SimpleVARGenerator()
seed_token = torch.randn(1, 1, 256) # 1x1 starting scale
final_output = model(seed_token)
print(f"Generated multi-scale tokens shape: {final_output.shape}")Veri kümelerini derlemekten karmaşık mimarileri değerlendirmeye kadar uçtan uca görü boru hatları oluşturmak isteyen araştırmacılar için Ultralytics Platformu, otomatik etiketleme, izleme ve buluta dağıtım için güçlü araçlar sunar. İster bir Görüş Dil Modeli (VLM) optimize ediyor ol ister sonraki ölçek tahminiyle deneyler yapıyor ol, birleştirilmiş görsel zeka ekosistemleri gerçek dünya kullanım senaryolarında inovasyonu hızlandırır.






