Visual Autoregressive Modeling (VAR)
Görsel Otoregresif Modellemeyi (VAR) keşfet. Sonraki ölçeği tahmin etmenin, geleneksel yöntemlere ve difüzyona kıyasla görüntü üretim hızını ve kalitesini nasıl artırdığını öğren.
Görsel Otoregresif Modellemesi (VAR), Büyük Dil Modellerinin (LLM'ler) yaygınlaştırdığı otoregresif öğrenme stratejilerini görüntü üretimi görevlerine uyarlayan gelişmiş bir bilgisayarlı görü paradigmasıdır. Geleneksel görsel otoregresif yöntemler bir görüntüyü 1B diziye kodlar ve hesaplama açısından maliyetli olan ve görsel verilerin doğal 2B yapısını göz ardı eden raster tarama sırasıyla belirteç belirteç tahmin eder. Buna karşılık VAR, kabadan inceye ilerleyen bir "sonraki ölçeği tahmin etme" yaklaşımı sunar. Görüntüleri satır satır tek tek belirteçleri tahmin etmek yerine, daha yüksek çözünürlüklü özellik haritalarını veya ölçekleri aşamalı olarak tahmin ederek oluşturur. Bu metodoloji, yapısal bütünlüğü korurken hem görüntü kalitesini hem de çıkarım hızını önemli ölçüde iyileştirir.
Görsel Otoregresif Modellemesi Nasıl Çalışır?#
VAR, temelinde geleneksel sonraki belirteç tahmininin yerini sonraki ölçek tahminiyle değiştirir. Görüntü ilk olarak Vektör Kuantizasyonlu Varyasyonel Otokodlayıcıya (VQ-VAE) benzer bir mimari kullanılarak çok ölçekli ayrık belirteç haritalarına sıkıştırılır. Üretim aşamasında bir transformer modeli, en düşük çözünürlükten (örneğin 1x1 ızgaradan) hedef çözünürlüğe (örneğin 16x16 veya 32x32 ızgaraya) kadar bu belirteç haritalarını sıralı biçimde tahmin eder. Her ölçekte uzamsal yapıları eşzamanlı işlediğinden VAR, 2B görüntülerin doğasında bulunan çift yönlü bağıntıları başarıyla korur.
Bu yeni yaklaşım, VAR modellerinin OpenAI GPT-4 gibi metin tabanlı mimarilerle karşılaştırılabilir, öngörülebilir ölçeklendirme yasaları ortaya koymasını sağlar. Araştırmacılar model parametrelerinin sayısını artırdıkça performans tutarlı biçimde iyileşir. Görsel Otoregresif Modellemesi üzerine NeurIPS 2024 makalesine göre VAR, zorlu ImageNet kıyaslamasında rakip mimarileri başarıyla geride bırakıyor. Çok daha hızlı çalışırken hem Fréchet Başlangıç Mesafesi (FID) hem de başlangıç puanlarında daha iyi ölçümler elde ediyor.
VAR ve Difüzyon Modelleri#
VAR'ı difüzyon tabanlı Üretken Yapay Zeka yaklaşımlarından ayırmak önemlidir. Difüzyon modelleri, başlangıçtaki tuvalden sürekli gürültüyü yinelemeli olarak kaldırarak görüntü üretmeyi öğrenir. VAR ise ayrık belirteçler üzerinde çalışır. Gürültüyü gidermek yerine görüntü çözünürlüğünü adım adım otoregresif biçimde oluşturur. Difüzyon Transformer'ı (DiT) görsel sentezde önde gelen bir standart olsa da VAR'ın belirteç tabanlı yaklaşımı, transformer modelleri için yapılan optimizasyon araştırmalarından doğrudan yararlanarak ölçeklenebilirlik ve veri verimliliği açısından DiT'yi geride bırakmasını sağlar.
Gerçek Dünya Uygulamaları#
Görsel Otoregresif Modellemesi, LLM'lerin akıl yürütme yeteneklerini yüksek aslına uygunlukta görüntülerle birleştirerek birçok pratik yeteneğin önünü açıyor:
- Sıfır Örnekli Görüntü Düzenleme ve Görüntü İçi Doldurma: VAR, sıfır örnekli manipülasyonu doğal olarak destekler. Geliştiriciler, belirli ölçekleri veya bölgeleri maskeleyerek temel mimariyi yeniden eğitmeden ya da ince ayardan geçirmeden görüntüleri sorunsuz biçimde düzenleyebilir veya genişletebilir.
- Perakende İçin Ölçeklenebilir Varlık Üretimi: VAR'ın olağanüstü çıkarım hızı, gerçek zamanlı ve yüksek kaliteli görüntü sentezine olanak tanıyarak dinamik ürün arka planlarının ve kişiselleştirilmiş pazarlama varlıklarının geniş ölçekte üretilmesini sağlar.
Otoregresif İş Akışlarını Uygulama#
VAR modelleri içerik üretmeye odaklansa da kapsamlı çok modlu işlem hatları oluşturmak için Ultralytics YOLO26 gibi güçlü algılama modelleriyle eşleştirilebilir. Örneğin, nesneleri ayırmak için YOLO26 ile hassas nesne algılama yapabilir, ardından bu belirli bölgeleri iyileştirme veya yeniden biçimlendirme amacıyla otoregresif bir modele aktarabilirsin.
Aşağıda, standart PyTorch Transformer modüllerini kullanarak VAR'ın temel mantığını simüle eden, çok ölçekli otoregresif bir döngünün belirteç haritasının sonraki ölçeğini yinelemeli olarak nasıl tahmin ettiğini gösteren kavramsal bir PyTorch kod örneği yer alıyor:
import torch
import torch.nn as nn
# Conceptual VAR Next-Scale Prediction Loop
class SimpleVARGenerator(nn.Module):
def __init__(self):
super().__init__()
# Simulated transformer to predict next resolution token map
self.transformer = nn.TransformerEncoderLayer(d_model=256, nhead=8)
def forward(self, initial_scale_token):
current_tokens = initial_scale_token
# Iteratively generate next scales (e.g., 1x1 -> 2x2 -> 4x4)
for scale in [1, 2, 4]:
# Model predicts the structural layout for the higher resolution
next_scale_tokens = self.transformer(current_tokens)
# Expand and update tokens for the next iteration
current_tokens = torch.cat((current_tokens, next_scale_tokens), dim=1)
return current_tokens
model = SimpleVARGenerator()
seed_token = torch.randn(1, 1, 256) # 1x1 starting scale
final_output = model(seed_token)
print(f"Generated multi-scale tokens shape: {final_output.shape}")Veri kümelerini düzenlemekten karmaşık mimarileri değerlendirmeye kadar uçtan uca görüntü işlem hatları oluşturmak isteyen araştırmacılar için Ultralytics Platform, otomatik etiketleme, izleme ve bulut dağıtımı için güçlü araçlar sunar. İster bir Görüntü-Dil Modelini (VLM) optimize et ister sonraki ölçek tahminini dene, birleşik görsel zekâ ekosistemleri gerçek dünya kullanım alanlarında yeniliği hızlandırır.









