Visual Autoregressive Modeling (VAR)
Khám phá Mô hình hóa Tự hồi quy Trực quan (VAR). Tìm hiểu cách dự đoán ở quy mô tiếp theo cải thiện tốc độ và chất lượng tạo ảnh so với các phương pháp truyền thống và diffusion.
Mô hình hóa tự hồi quy thị giác (VAR) là một mô hình thị giác máy tính tiên tiến, điều chỉnh các chiến lược học tự hồi quy do Mô hình ngôn ngữ lớn (LLMs) phổ biến hóa cho các tác vụ tạo ảnh. Các phương pháp tự hồi quy thị giác truyền thống mã hóa ảnh thành chuỗi 1D và dự đoán từng token theo thứ tự quét raster, vốn tốn kém tính toán và bỏ qua cấu trúc 2D tự nhiên của dữ liệu thị giác. Ngược lại, VAR giới thiệu phương pháp "dự đoán thang độ phân giải tiếp theo" từ thô đến tinh. Phương pháp này tạo ảnh bằng cách dự đoán dần các bản đồ đặc trưng hoặc thang độ phân giải cao hơn, thay vì dự đoán từng token theo từng hàng. Phương pháp này duy trì tính toàn vẹn cấu trúc đồng thời cải thiện đáng kể cả chất lượng ảnh lẫn tốc độ suy luận.
Cách hoạt động của mô hình hóa tự hồi quy thị giác#
Về cốt lõi, VAR thay thế dự đoán token tiếp theo truyền thống bằng dự đoán thang độ phân giải tiếp theo. Trước tiên, ảnh được nén thành các bản đồ token rời rạc đa thang bằng kiến trúc tương tự Bộ mã hóa tự động biến phân lượng tử hóa vector (VQ-VAE). Trong giai đoạn tạo sinh, model Transformer dự đoán tuần tự các bản đồ token này, bắt đầu từ độ phân giải nhỏ nhất (chẳng hạn lưới 1x1) đến độ phân giải mục tiêu (chẳng hạn lưới 16x16 hoặc 32x32). Vì xử lý đồng thời các cấu trúc không gian ở mỗi thang, VAR bảo toàn hiệu quả các tương quan hai chiều vốn có trong ảnh 2D.
Phương pháp mới này giúp model VAR thiết lập các quy luật mở rộng quy mô có thể dự đoán được, tương đương với các kiến trúc dựa trên văn bản như OpenAI GPT-4. Khi nhà nghiên cứu tăng quy mô tham số model, hiệu suất cải thiện ổn định. Theo bài báo NeurIPS 2024 về Mô hình hóa tự hồi quy thị giác, VAR vượt qua các kiến trúc cạnh tranh trên benchmark ImageNet đầy thách thức. Model đạt chỉ số tốt hơn cả về Khoảng cách Inception Fréchet (FID) lẫn điểm Inception, đồng thời thực thi nhanh hơn nhiều.
VAR so với mô hình khuếch tán#
Điều quan trọng là phải phân biệt VAR với AI tạo sinh dựa trên khuếch tán. Mô hình khuếch tán học cách tạo ảnh bằng cách lặp đi lặp lại việc loại bỏ nhiễu liên tục khỏi canvas ban đầu. Tuy nhiên, VAR hoạt động trên các token rời rạc. Thay vì khử nhiễu, VAR xây dựng ảnh theo kiểu tự hồi quy, lần lượt tăng độ phân giải. Dù Transformer khuếch tán (DiT) là tiêu chuẩn dẫn đầu trong tổng hợp thị giác, phương pháp dựa trên token của VAR trực tiếp hưởng lợi từ nghiên cứu tối ưu hóa dành cho model Transformer, giúp VAR vượt DiT cả về khả năng mở rộng lẫn hiệu quả dữ liệu.
Ứng dụng thực tế#
Bằng cách kết hợp năng lực suy luận của LLM với thị giác có độ trung thực cao, mô hình hóa tự hồi quy thị giác mở ra một số năng lực thực tiễn:
- Chỉnh sửa ảnh zero-shot và tô vùng khuyết: VAR hỗ trợ xử lý zero-shot nguyên bản. Bằng cách che một số thang độ phân giải hoặc vùng nhất định, nhà phát triển có thể dễ dàng chỉnh sửa hoặc mở rộng ảnh mà không cần huấn luyện lại hay tinh chỉnh kiến trúc nền tảng.
- Tạo tài nguyên mở rộng quy mô cho ngành bán lẻ: Tốc độ suy luận cực nhanh của VAR cho phép tổng hợp ảnh chất lượng cao theo thời gian thực, hỗ trợ tạo nền sản phẩm động và tài nguyên tiếp thị cá nhân hóa ở quy mô lớn.
Triển khai quy trình tự hồi quy#
Dù model VAR tập trung vào tạo nội dung, chúng có thể kết hợp với các model nhận thức mạnh như Ultralytics YOLO26 để tạo pipeline đa phương thức toàn diện. Chẳng hạn, bạn có thể sử dụng YOLO26 để phát hiện đối tượng chính xác nhằm cô lập chủ thể, sau đó chuyển các vùng cụ thể đó cho model tự hồi quy để nâng cao chất lượng hoặc thay đổi phong cách.
Đoạn mã PyTorch mang tính khái niệm dưới đây minh họa cách vòng lặp tự hồi quy đa thang lặp lại việc dự đoán thang tiếp theo của bản đồ token, mô phỏng logic cơ bản của VAR bằng các module Transformer của PyTorch tiêu chuẩn:
import torch
import torch.nn as nn
# Conceptual VAR Next-Scale Prediction Loop
class SimpleVARGenerator(nn.Module):
def __init__(self):
super().__init__()
# Simulated transformer to predict next resolution token map
self.transformer = nn.TransformerEncoderLayer(d_model=256, nhead=8)
def forward(self, initial_scale_token):
current_tokens = initial_scale_token
# Iteratively generate next scales (e.g., 1x1 -> 2x2 -> 4x4)
for scale in [1, 2, 4]:
# Model predicts the structural layout for the higher resolution
next_scale_tokens = self.transformer(current_tokens)
# Expand and update tokens for the next iteration
current_tokens = torch.cat((current_tokens, next_scale_tokens), dim=1)
return current_tokens
model = SimpleVARGenerator()
seed_token = torch.randn(1, 1, 256) # 1x1 starting scale
final_output = model(seed_token)
print(f"Generated multi-scale tokens shape: {final_output.shape}")Đối với nhà nghiên cứu muốn xây dựng pipeline thị giác end-to-end—từ tuyển chọn tập dữ liệu đến đánh giá kiến trúc phức tạp—Nền tảng Ultralytics cung cấp các công cụ mạnh mẽ cho tự động chú thích, theo dõi và triển khai trên cloud. Dù tối ưu hóa Model ngôn ngữ thị giác (VLM) hay thử nghiệm dự đoán thang độ phân giải tiếp theo, các hệ sinh thái trí tuệ thị giác hợp nhất đều thúc đẩy đổi mới trong những ứng dụng thực tế.









