Visual Autoregressive Modeling (VAR)
Explore la modélisation autorégressive visuelle (VAR). Apprends comment la prédiction à l'échelle suivante améliore la vitesse et la qualité de génération d'images par rapport aux méthodes traditionnelles et à la diffusion.
La modélisation visuelle autorégressive (VAR) est un paradigme avancé de vision par ordinateur qui adapte les stratégies d'apprentissage autorégressif popularisées par les grands modèles de langage (LLM) aux tâches de génération d'images. Les méthodes visuelles autorégressives traditionnelles encodent une image en une séquence 1D et la prédisent jeton par jeton dans un ordre de balayage tramé, ce qui est coûteux en calcul et ignore la structure 2D naturelle des données visuelles. En revanche, VAR introduit une approche de « prédiction à l'échelle suivante » du grossier au fin. Il génère des images en prédisant progressivement des cartes de caractéristiques ou des échelles de plus haute résolution, plutôt que de prédire des jetons individuels ligne par ligne. Cette méthodologie préserve l'intégrité structurelle tout en améliorant considérablement à la fois la qualité d'image et la vitesse d'inférence.
Comment fonctionne la modélisation visuelle autorégressive#
Dans son principe, VAR remplace la prédiction traditionnelle du jeton suivant par la prédiction de l'échelle suivante. Une image est d'abord compressée en cartes de jetons discrets multi-échelles à l'aide d'une architecture similaire à un auto-encodeur variationnel quantifié par vecteur (VQ-VAE). Pendant la phase de génération, un modèle de type Transformer prédit ces cartes de jetons séquentiellement, en commençant par la plus petite résolution (comme une grille 1x1) jusqu'à la résolution cible (telle qu'une grille 16x16 ou 32x32). Parce qu'il traite les structures spatiales simultanément à chaque échelle, VAR préserve avec succès les corrélations bidirectionnelles inhérentes aux images 2D.
Cette nouvelle approche permet aux modèles VAR d'établir des lois d'échelle prévisibles comparables aux architectures textuelles telles que OpenAI GPT-4. À mesure que les chercheurs augmentent les paramètres du modèle, les performances s'améliorent constamment. Selon le document NeurIPS 2024 sur la modélisation visuelle autorégressive, VAR surpasse avec succès les architectures concurrentes sur le benchmark ImageNet exigeant. Il obtient de meilleures métriques à la fois en termes de distance d'inception de Fréchet (FID) et de scores d'inception tout en s'exécutant beaucoup plus rapidement.
VAR vs. Modèles de diffusion#
Il est important de différencier VAR de l'intelligence artificielle générative basée sur la diffusion. Les modèles de diffusion apprennent à générer des images en supprimant de manière itérative le bruit continu d'une toile de départ. VAR, cependant, opère sur des jetons discrets. Au lieu de débruiter, il construit autorégressivement la résolution de l'image par résolution. Bien que le Transformer de diffusion (DiT) ait été une référence de premier plan pour la synthèse visuelle, l'approche basée sur les jetons de VAR bénéficie directement de la recherche en optimisation consacrée aux modèles Transformer, lui permettant de surpasse DiT à la fois en termes de passage à l'échelle et d'efficacité des données.
Applications concrètes#
En fusionnant les capacités de raisonnement des LLM avec une vision haute fidélité, la modélisation visuelle autorégressive débloque plusieurs capacités pratiques :
- Édition d'images et retouche sans entraînement (Zero-Shot) : VAR prend en charge nativement la manipulation zero-shot. En masquant certaines échelles ou régions, tu peux éditer ou étendre des images de manière transparente sans réentraîner ni affiner l'architecture de base.
- Génération d'actifs évolutive pour le secteur de la vente au détail : L'extrême vitesse d'inférence de VAR permet une synthèse d'images en temps réel de haute qualité, permettant la génération dynamique de fonds de produits et des actifs marketing personnalisés à grande échelle.
Implémentation de flux de travail autorégressifs#
Bien que les modèles VAR se concentrent sur la génération de contenu, ils peuvent être associés à des modèles de perception puissants tels que Ultralytics YOLO26 pour créer des pipelines multimodaux complets. Par exemple, tu peux utiliser YOLO26 pour une détection d'objets précise afin d'isoler des sujets, puis transmettre ces régions spécifiques à un modèle autorégressif pour les améliorer ou les restyler.
Voici un extrait conceptuel PyTorch montrant comment une boucle autorégressive multi-échelle prédit de manière itérative la prochaine échelle d'une carte de jetons, simulant la logique sous-jacente de VAR à l'aide de modules Transformer PyTorch standard :
import torch
import torch.nn as nn
# Conceptual VAR Next-Scale Prediction Loop
class SimpleVARGenerator(nn.Module):
def __init__(self):
super().__init__()
# Simulated transformer to predict next resolution token map
self.transformer = nn.TransformerEncoderLayer(d_model=256, nhead=8)
def forward(self, initial_scale_token):
current_tokens = initial_scale_token
# Iteratively generate next scales (e.g., 1x1 -> 2x2 -> 4x4)
for scale in [1, 2, 4]:
# Model predicts the structural layout for the higher resolution
next_scale_tokens = self.transformer(current_tokens)
# Expand and update tokens for the next iteration
current_tokens = torch.cat((current_tokens, next_scale_tokens), dim=1)
return current_tokens
model = SimpleVARGenerator()
seed_token = torch.randn(1, 1, 256) # 1x1 starting scale
final_output = model(seed_token)
print(f"Generated multi-scale tokens shape: {final_output.shape}")Pour les chercheurs qui cherchent à construire des pipelines de vision de bout en bout — de la curation de jeux de données à l'évaluation d'architectures complexes —, la plateforme Ultralytics offre des outils robustes pour l'annotation automatique, le suivi et le déploiement sur le cloud. Qu'il s'agisse d'optimiser un modèle de vision-langage (VLM) ou d'expérimenter la prédiction à l'échelle suivante, les écosystèmes d'intelligence visuelle unifiés accélèrent l'innovation à travers des cas d'utilisation du monde réel.






