Visual Autoregressive Modeling (VAR)
Explora el modelado autorregresivo visual (VAR). Aprende cómo la predicción a la siguiente escala mejora la velocidad y calidad de generación de imágenes frente a métodos tradicionales y de difusión.
La modelización visual autorregresiva (Visual Autoregressive Modeling o VAR) es un paradigma avanzado de visión por computador que adapta las estrategias de aprendizaje autorregresivo popularizadas por los Grandes Modelos de Lenguaje (LLM) a las tareas de generación de imágenes. Los métodos visuales autorregresivos tradicionales codifican una imagen en una secuencia unidimensional y la predicen token por token en un orden de exploración ráster, lo cual resulta costoso desde el punto de vista computacional e ignora la estructura bidimensional natural de los datos visuales. En contraste, VAR introduce un enfoque de "predicción de la siguiente escala" de curso a fino. Genera imágenes prediciendo progresivamente mapas de características o escalas de mayor resolución, en lugar de predecir tokens individuales fila por fila. Esta metodología preserva la integridad estructural al tiempo que mejora significativamente tanto la calidad de la imagen como la velocidad de inferencia.
Cómo funciona el Modelado Autorregresivo Visual#
En su núcleo, VAR reemplaza la predicción tradicional del siguiente token por la predicción de la siguiente escala. Una imagen se comprime primero en mapas de tokens discretos multiescala utilizando una arquitectura similar a un codificador automático variacional cuantizado por vectores (VQ-VAE). Durante la fase de generación, un modelo de tipo Transformer predice estos mapas de tokens de forma secuencial, empezando desde la resolución más pequeña (como una cuadrícula de 1x1) hasta la resolución de destino (como una cuadrícula de 16x16 o 32x32). Debido a que procesa estructuras espaciales de manera simultánea en cada escala, VAR preserva con éxito las correlaciones bidimensionales inherentes a las imágenes en 2D.
Este enfoque novedoso permite que los modelos VAR establezcan leyes de escala predecibles comparables a las arquitecturas basadas en texto como OpenAI GPT-4. A medida que los investigadores aumentan los parámetros del modelo, el rendimiento mejora de manera constante. Según el artículo de NeurIPS 2024 sobre modelización visual autorregresiva, VAR supera con éxito a las arquitecturas de la competencia en el exigente conjunto de datos de referencia ImageNet. Logra mejores métricas tanto en la distancia de Inception de Fréchet (FID) como en las puntuaciones de Inception, al tiempo que se ejecuta mucho más rápido.
VAR frente a los Modelos de Difusión#
Es importante diferenciar VAR de la IA generativa basada en difusión. Los modelos de difusión aprenden a generar imágenes eliminando de forma iterativa ruido continuo de un lienzo inicial. VAR, sin embargo, opera con tokens discretos. En lugar de eliminar el ruido, construye la imagen de manera autorregresiva resolución por resolución. Si bien el Transformer de difusión (DiT) ha sido un estándar líder para la síntesis visual, el enfoque basado en tokens de VAR se beneficia directamente de la investigación de optimización invertida en los modelos Transformer, lo que le permite superar a DiT tanto en escalabilidad como en eficiencia de datos.
Aplicaciones en el mundo real#
Al combinar las capacidades de razonamiento de los LLM con una visión de alta fidelidad, el Modelado Autorregresivo Visual permite varias capacidades prácticas:
- Edición de imágenes de cero disparos (Zero-Shot) y relleno (In-painting): VAR admite de forma nativa la manipulación de cero disparos. Al enmascarar determinadas escalas o regiones, puedes editar o ampliar imágenes sin problemas ni necesidad de reentrenar o ajustar la arquitectura base.
- Generación de recursos escalables para el comercio minorista: La extrema velocidad de inferencia de VAR permite una síntesis de imágenes en tiempo real y de alta calidad, lo que facilita la generación dinámica de fondos para productos y la creación de recursos de marketing personalizados a escala.
Implementación de flujos de trabajo autorregresivos#
Aunque los modelos VAR se centran en generar contenido, se pueden combinar con potentes modelos de percepción como Ultralytics YOLO26 para crear canales multimodales completos. Por ejemplo, puedes utilizar YOLO26 para la detección de objetos precisa con el fin de aislar sujetos, y luego pasar esas regiones específicas a un modelo autorregresivo para su mejora o cambio de estilo.
A continuación se muestra un fragmento conceptual de PyTorch que demuestra cómo un bucle autorregresivo multiescala predice de forma iterativa la siguiente escala de un mapa de tokens, simulando la lógica subyacente de VAR mediante módulos Transformer de PyTorch estándar:
import torch
import torch.nn as nn
# Conceptual VAR Next-Scale Prediction Loop
class SimpleVARGenerator(nn.Module):
def __init__(self):
super().__init__()
# Simulated transformer to predict next resolution token map
self.transformer = nn.TransformerEncoderLayer(d_model=256, nhead=8)
def forward(self, initial_scale_token):
current_tokens = initial_scale_token
# Iteratively generate next scales (e.g., 1x1 -> 2x2 -> 4x4)
for scale in [1, 2, 4]:
# Model predicts the structural layout for the higher resolution
next_scale_tokens = self.transformer(current_tokens)
# Expand and update tokens for the next iteration
current_tokens = torch.cat((current_tokens, next_scale_tokens), dim=1)
return current_tokens
model = SimpleVARGenerator()
seed_token = torch.randn(1, 1, 256) # 1x1 starting scale
final_output = model(seed_token)
print(f"Generated multi-scale tokens shape: {final_output.shape}")Para los investigadores que buscan construir canales de visión de extremo a extremo —desde la selección de conjuntos de datos hasta la evaluación de arquitecturas complejas—, la Ultralytics Platform ofrece herramientas robustas para la anotación automática, el seguimiento y el despliegue en la nube. Ya sea que optimices un modelo de lenguaje visual (VLM) o experimentes con la predicción de la siguiente escala, los ecosistemas de inteligencia visual unificada aceleran la innovación en casos de uso del mundo real.






