Visual Autoregressive Modeling (VAR)
Изучи визуальное авторегрессионное моделирование (VAR). Узнай, как предсказание на следующем масштабе повышает скорость и качество генерации изображений по сравнению с традиционными методами и диффузионными моделями.
Визуальное авторегрессионное моделирование (VAR) — это продвинутая парадигма компьютерного зрения, в которой стратегии авторегрессионного обучения, ставшие популярными благодаря большим языковым моделям (LLMs), применяются к задачам генерации изображений. Традиционные визуальные авторегрессионные методы кодируют изображение в одномерную последовательность и предсказывают его по токенам в порядке растровой развёртки. Это требует больших вычислительных затрат и не учитывает естественную двумерную структуру визуальных данных. VAR, напротив, использует подход «предсказания следующего масштаба» — от грубого к точному. Изображения создаются путём последовательного предсказания карт признаков feature maps более высокого разрешения или масштаба, а не отдельных токенов строка за строкой. Такая методология сохраняет целостность структуры и значительно улучшает как качество изображений, так и скорость инференса.
Как работает визуальное авторегрессионное моделирование#
В основе VAR лежит замена традиционного предсказания следующего токена предсказанием следующего масштаба. Сначала изображение сжимается в многомасштабные дискретные карты токенов с помощью архитектуры, похожей на вариационный автокодировщик с векторным квантованием (VQ-VAE). На этапе генерации модель-трансформер последовательно предсказывает эти карты токенов, начиная с наименьшего разрешения, например сетки 1x1, и постепенно переходя к целевому разрешению, например сетке 16x16 или 32x32. Поскольку VAR одновременно обрабатывает пространственные структуры на каждом масштабе, модель успешно сохраняет двунаправленные взаимосвязи, присущие двумерным изображениям.
Этот новый подход позволяет моделям VAR демонстрировать предсказуемые законы масштабирования, сопоставимые с текстовыми архитектурами, такими как OpenAI GPT-4. При увеличении числа параметров модели её производительность стабильно улучшается. Согласно статье о визуальном авторегрессионном моделировании на NeurIPS 2024, VAR превосходит конкурирующие архитектуры на сложном тесте ImageNet. Она показывает лучшие результаты как по метрике расстояния Фреше—Инцепшн (FID), так и по показателям Inception, выполняя вычисления значительно быстрее.
VAR и диффузионные модели#
Важно отличать VAR от генеративного ИИ на основе диффузии. Диффузионные модели учатся создавать изображения, итеративно удаляя непрерывный шум с исходного холста. VAR же работает с дискретными токенами. Вместо удаления шума она авторегрессионно строит изображение, последовательно повышая его разрешение. Хотя диффузионный трансформер (DiT) стал одним из ведущих стандартов синтеза визуальных данных, токеновый подход VAR напрямую использует результаты исследований по оптимизации моделей-трансформеров и превосходит DiT по масштабируемости и эффективности использования данных.
Примеры применения в реальных условиях#
Объединяя способности LLM к рассуждению с высокоточным компьютерным зрением, визуальное авторегрессионное моделирование открывает несколько практических возможностей:
- Редактирование изображений без примеров и заполнение областей: VAR изначально поддерживает манипуляции без примеров. Маскируя отдельные масштабы или области, разработчики могут легко редактировать изображения или расширять их без повторного обучения или дообучения базовой архитектуры.
- Масштабируемая генерация ресурсов для розничной торговли: Исключительно высокая скорость инференса VAR позволяет синтезировать качественные изображения в реальном времени, массово создавая динамичные фоны для товаров и персонализированные маркетинговые материалы.
Реализация авторегрессионных рабочих процессов#
Модели VAR сосредоточены на генерации контента, но их можно объединить с мощными моделями восприятия, такими как Ultralytics YOLO26, чтобы создавать комплексные мультимодальные конвейеры. Например, можно использовать YOLO26 для точного обнаружения объектов, чтобы выделить нужные объекты, а затем передать эти области авторегрессионной модели для улучшения или изменения стиля.
Ниже приведён концептуальный фрагмент кода на PyTorch, демонстрирующий, как многомасштабный авторегрессионный цикл последовательно предсказывает следующий масштаб карты токенов и имитирует основную логику VAR с помощью стандартных модулей Transformer в PyTorch:
import torch
import torch.nn as nn
# Conceptual VAR Next-Scale Prediction Loop
class SimpleVARGenerator(nn.Module):
def __init__(self):
super().__init__()
# Simulated transformer to predict next resolution token map
self.transformer = nn.TransformerEncoderLayer(d_model=256, nhead=8)
def forward(self, initial_scale_token):
current_tokens = initial_scale_token
# Iteratively generate next scales (e.g., 1x1 -> 2x2 -> 4x4)
for scale in [1, 2, 4]:
# Model predicts the structural layout for the higher resolution
next_scale_tokens = self.transformer(current_tokens)
# Expand and update tokens for the next iteration
current_tokens = torch.cat((current_tokens, next_scale_tokens), dim=1)
return current_tokens
model = SimpleVARGenerator()
seed_token = torch.randn(1, 1, 256) # 1x1 starting scale
final_output = model(seed_token)
print(f"Generated multi-scale tokens shape: {final_output.shape}")Для исследователей, которые хотят создавать сквозные конвейеры компьютерного зрения — от составления наборов данных до оценки сложных архитектур, — платформа Ultralytics предлагает надёжные инструменты для автоматической разметки, отслеживания и облачного развёртывания. Независимо от того, оптимизируешь ли ты визуально-языковую модель (VLM) или экспериментируешь с предсказанием следующего масштаба, единые экосистемы визуального интеллекта ускоряют инновации в реальных задачах.









