Visual Autoregressive Modeling (VAR)
Explore a modelagem visual autorregressiva (VAR). Saiba como a previsão na próxima escala melhora a velocidade e a qualidade da geração de imagens em comparação com métodos tradicionais e de difusão.
A Modelação Visual Autorregressiva (VAR) é um paradigma avançado de visão computacional que adapta as estratégias de aprendizagem autorregressiva popularizadas pelos Grandes Modelos de Linguagem (LLMs) a tarefas de geração de imagens. Os métodos visuais autorregressivos tradicionais codificam uma imagem numa sequência 1D e preveem-na token a token numa ordem de varrimento raster, o que é computacionalmente dispendioso e ignora a estrutura 2D natural dos dados visuais. Em contrapartida, a VAR introduz uma abordagem de «previsão da escala seguinte», das escalas mais grosseiras para as mais finas. Gera imagens ao prever progressivamente mapas de características ou escalas de resolução superior, em vez de prever tokens individuais linha a linha. Esta metodologia preserva a integridade estrutural e melhora significativamente a qualidade da imagem e a velocidade de inferência.
Como funciona a Modelação Visual Autorregressiva#
Na sua essência, a VAR substitui a previsão do token seguinte pela previsão da escala seguinte. Primeiro, uma imagem é comprimida em mapas de tokens discretos multiescala, utilizando uma arquitetura semelhante a um Autoencoder Variacional Quantizado Vetorialmente (VQ-VAE). Durante a geração, um modelo Transformer prevê estes mapas de tokens sequencialmente, começando pela resolução mais pequena (como uma grelha de 1x1) e aumentando até à resolução pretendida (como uma grelha de 16x16 ou 32x32). Como processa simultaneamente as estruturas espaciais em cada escala, a VAR preserva as correlações bidirecionais inerentes às imagens 2D.
Esta nova abordagem permite aos modelos VAR estabelecer leis de escala previsíveis, comparáveis às de arquiteturas baseadas em texto, como o OpenAI GPT-4. À medida que os investigadores aumentam os parâmetros dos modelos, o desempenho melhora de forma consistente. De acordo com o artigo da NeurIPS 2024 sobre Modelação Visual Autorregressiva, a VAR supera com sucesso arquiteturas concorrentes no exigente benchmark ImageNet. Alcança métricas melhores tanto na Distância de Inception de Fréchet (FID) como nas pontuações de Inception, executando-se ao mesmo tempo muito mais depressa.
VAR vs. Modelos de Difusão#
É importante distinguir a VAR da IA Generativa baseada em difusão. Os modelos de difusão aprendem a gerar imagens removendo iterativamente o ruído contínuo de uma tela inicial. A VAR, por sua vez, opera sobre tokens discretos. Em vez de remover ruído, constrói autorregressivamente a imagem, resolução a resolução. Embora o Transformer de Difusão (DiT) tenha sido um padrão de referência na síntese visual, a abordagem baseada em tokens da VAR beneficia diretamente da investigação sobre a otimização de modelos Transformer, permitindo-lhe superar o DiT em escalabilidade e eficiência de dados.
Aplicações no mundo real#
Ao combinar as capacidades de raciocínio dos LLMs com a visão de alta fidelidade, a Modelação Visual Autorregressiva abre caminho a várias aplicações práticas:
- Edição de imagens e preenchimento de áreas em modo zero-shot: A VAR permite nativamente a manipulação zero-shot. Ao mascarar determinadas escalas ou regiões, os programadores podem editar ou ampliar imagens sem problemas, sem voltar a treinar ou ajustar a arquitetura base.
- Geração escalável de elementos visuais para o retalho: A velocidade de inferência extraordinária da VAR permite sintetizar imagens de alta qualidade em tempo real, possibilitando a geração dinâmica de fundos para produtos e de conteúdos de marketing personalizados em grande escala.
Implementação de fluxos de trabalho autorregressivos#
Embora os modelos VAR se centrem na geração de conteúdos, podem ser combinados com modelos de perceção poderosos, como o Ultralytics YOLO26, para criar pipelines multimodais completos. Por exemplo, podes usar o YOLO26 para realizar uma deteção de objetos precisa e isolar os objetos; em seguida, podes enviar essas regiões específicas para um modelo autorregressivo, que as melhora ou lhes aplica um novo estilo.
O excerto conceptual de PyTorch abaixo demonstra como um ciclo autorregressivo multiescala prevê iterativamente a escala seguinte de um mapa de tokens, simulando a lógica subjacente à VAR com os módulos Transformer do PyTorch padrão:
import torch
import torch.nn as nn
# Conceptual VAR Next-Scale Prediction Loop
class SimpleVARGenerator(nn.Module):
def __init__(self):
super().__init__()
# Simulated transformer to predict next resolution token map
self.transformer = nn.TransformerEncoderLayer(d_model=256, nhead=8)
def forward(self, initial_scale_token):
current_tokens = initial_scale_token
# Iteratively generate next scales (e.g., 1x1 -> 2x2 -> 4x4)
for scale in [1, 2, 4]:
# Model predicts the structural layout for the higher resolution
next_scale_tokens = self.transformer(current_tokens)
# Expand and update tokens for the next iteration
current_tokens = torch.cat((current_tokens, next_scale_tokens), dim=1)
return current_tokens
model = SimpleVARGenerator()
seed_token = torch.randn(1, 1, 256) # 1x1 starting scale
final_output = model(seed_token)
print(f"Generated multi-scale tokens shape: {final_output.shape}")Para investigadores que pretendem criar pipelines de visão de ponta a ponta — desde a seleção de conjuntos de dados até à avaliação de arquiteturas complexas —, a Ultralytics Platform oferece ferramentas robustas para anotação automática, acompanhamento e implementação na nuvem. Quer estejas a otimizar um Modelo de Visão e Linguagem (VLM) ou a experimentar a previsão da escala seguinte, os ecossistemas unificados de inteligência visual aceleram a inovação em aplicações do mundo real.









