Visual Autoregressive Modeling (VAR)
Explora el modelado autorregresivo visual (VAR). Aprende cómo la predicción de la siguiente escala mejora la velocidad y la calidad de la generación de imágenes frente a los métodos tradicionales y la difusión.
El modelado visual autorregresivo (VAR) es un paradigma avanzado de visión artificial que adapta a las tareas de generación de imágenes las estrategias de aprendizaje autorregresivo popularizadas por los modelos de lenguaje grandes (LLM). Los métodos visuales autorregresivos tradicionales codifican una imagen en una secuencia unidimensional y la predicen token a token siguiendo un orden de barrido ráster, un proceso costoso desde el punto de vista computacional que ignora la estructura bidimensional natural de los datos visuales. En cambio, VAR introduce un enfoque de «predicción de la siguiente escala», de lo más general a lo más detallado. Genera imágenes prediciendo progresivamente mapas de características o escalas de mayor resolución, en lugar de predecir tokens individuales fila por fila. Esta metodología preserva la integridad estructural y mejora considerablemente tanto la calidad de imagen como la velocidad de inferencia.
Cómo funciona el modelado visual autorregresivo#
En esencia, VAR sustituye la predicción tradicional del siguiente token por la predicción de la siguiente escala. Primero, una imagen se comprime en mapas de tokens discretos multiescala mediante una arquitectura similar a un autoencoder variacional cuantizado vectorial (VQ-VAE). Durante la fase de generación, un modelo Transformer predice estos mapas de tokens secuencialmente, desde la resolución más pequeña (como una cuadrícula de 1x1) hasta la resolución objetivo (como una cuadrícula de 16x16 o 32x32). Como procesa simultáneamente las estructuras espaciales de cada escala, VAR preserva correctamente las correlaciones bidireccionales propias de las imágenes bidimensionales.
Este novedoso enfoque permite a los modelos VAR establecer leyes de escalado predecibles, comparables a las arquitecturas basadas en texto, como OpenAI GPT-4. A medida que los investigadores aumentan los parámetros de los modelos, el rendimiento mejora de forma constante. Según el artículo de NeurIPS 2024 sobre modelado visual autorregresivo, VAR supera con éxito a las arquitecturas competidoras en el exigente benchmark ImageNet. Obtiene mejores métricas tanto en la distancia de Inception de Fréchet (FID) como en las puntuaciones de Inception, y se ejecuta mucho más rápido.
VAR frente a los modelos de difusión#
Es importante distinguir VAR de la IA generativa basada en difusión. Los modelos de difusión aprenden a generar imágenes eliminando iterativamente el ruido continuo de un lienzo inicial. VAR, en cambio, trabaja con tokens discretos. En lugar de eliminar ruido, construye la imagen de forma autorregresiva, resolución a resolución. Aunque el Transformer de difusión (DiT) ha sido un estándar destacado para la síntesis visual, el enfoque de VAR basado en tokens se beneficia directamente de la investigación sobre optimización de modelos Transformer, lo que le permite superar a DiT tanto en escalabilidad como en eficiencia de datos.
Aplicaciones en el mundo real#
Al combinar las capacidades de razonamiento de los LLM con una visión de alta fidelidad, el modelado visual autorregresivo ofrece varias capacidades prácticas:
- Edición de imágenes y relleno generativos zero-shot: VAR admite de forma nativa la manipulación zero-shot. Al enmascarar determinadas escalas o regiones, los desarrolladores pueden editar o ampliar imágenes fácilmente sin volver a entrenar ni ajustar la arquitectura base.
- Generación de recursos escalable para el comercio minorista: La velocidad de inferencia extraordinaria de VAR permite sintetizar imágenes de alta calidad en tiempo real y generar dinámicamente fondos de productos y recursos de marketing personalizados a gran escala.
Implementación de flujos de trabajo autorregresivos#
Aunque los modelos VAR se centran en generar contenido, pueden combinarse con potentes modelos de percepción como Ultralytics YOLO26 para crear canalizaciones multimodales completas. Por ejemplo, puedes utilizar YOLO26 para realizar una detección de objetos precisa y aislar los sujetos, y después pasar esas regiones concretas a un modelo autorregresivo para mejorarlas o cambiar su estilo.
A continuación se muestra un fragmento conceptual de PyTorch que explica cómo un bucle autorregresivo multiescala predice iterativamente la siguiente escala de un mapa de tokens, simulando la lógica subyacente de VAR con los módulos Transformer de PyTorch estándar:
import torch
import torch.nn as nn
# Conceptual VAR Next-Scale Prediction Loop
class SimpleVARGenerator(nn.Module):
def __init__(self):
super().__init__()
# Simulated transformer to predict next resolution token map
self.transformer = nn.TransformerEncoderLayer(d_model=256, nhead=8)
def forward(self, initial_scale_token):
current_tokens = initial_scale_token
# Iteratively generate next scales (e.g., 1x1 -> 2x2 -> 4x4)
for scale in [1, 2, 4]:
# Model predicts the structural layout for the higher resolution
next_scale_tokens = self.transformer(current_tokens)
# Expand and update tokens for the next iteration
current_tokens = torch.cat((current_tokens, next_scale_tokens), dim=1)
return current_tokens
model = SimpleVARGenerator()
seed_token = torch.randn(1, 1, 256) # 1x1 starting scale
final_output = model(seed_token)
print(f"Generated multi-scale tokens shape: {final_output.shape}")Para los investigadores que quieran crear canalizaciones de visión de extremo a extremo, desde la selección de conjuntos de datos hasta la evaluación de arquitecturas complejas, la plataforma Ultralytics ofrece herramientas sólidas para la anotación automática, el seguimiento y la implementación en la nube. Tanto si optimizas un modelo de visión y lenguaje (VLM) como si experimentas con la predicción de la siguiente escala, los ecosistemas unificados de inteligencia visual aceleran la innovación en casos de uso reales.









