YOLO Vision 2026:
Ultralytics 용어집으로 돌아가기

Visual Autoregressive Modeling (VAR)

시각적 자기회귀 모델링(VAR)을 탐색합니다. 차세대 스케일 예측이 기존 방식 및 확산 모델보다 이미지 생성 속도와 품질을 어떻게 향상하는지 배웁니다.

Visual Autoregressive Modeling (VAR)은 Large Language Models (LLMs)에서 대중화된 자기회귀 학습 전략을 image generation 작업에 적응시킨 고급 computer vision 패러다임입니다. 전통적인 시각적 자기회귀 방법은 이미지를 1D 시퀀스로 인코딩하고 raster-scan order로 토큰별로 예측하므로 계산 비용이 많이 들고 시각 데이터의 자연스러운 2D 구조를 무시합니다. 이와 대조적으로 VAR은 조잡한 것에서 세밀한 것으로 나아가는 "다음 스케일 예측(next-scale prediction)" 접근 방식을 도입합니다. 이 방식은 개별 토큰을 행별로 예측하는 대신, 더 높은 해상도의 feature maps 또는 스케일을 점진적으로 예측하여 이미지를 생성합니다. 이 방법론은 구조적 무결성을 유지하면서 이미지 품질과 inference speed를 모두 크게 향상시킵니다.

Visual Autoregressive Modeling의 작동 원리#

핵심적으로 VAR은 전통적인 다음 토큰 예측을 다음 스케일 예측으로 대체합니다. 이미지는 먼저 Vector Quantized Variational AutoEncoder (VQ-VAE)와 유사한 아키텍처를 사용하여 다중 스케일 이산 토큰 맵으로 압축됩니다. 생성 단계에서 transformer 모델은 가장 작은 해상도(1x1 그리드 등)에서 시작하여 대상 해상도(16x16 또는 32x32 그리드 등)에 이르기까지 이러한 토큰 맵을 순차적으로 예측합니다. 각 스케일에서 공간 구조를 동시에 처리하기 때문에 VAR은 2D 이미지에 내재된 양방향 상관관계를 성공적으로 유지합니다.

이 새로운 접근 방식을 통해 VAR 모델은 OpenAI GPT-4와 같은 텍스트 기반 아키텍처에 비견되는 예측 가능한 scaling laws를 확립할 수 있습니다. 연구원들이 모델 파라미터를 확장함에 따라 성능이 지속적으로 향상됩니다. NeurIPS 2024 paper on Visual Autoregressive Modeling에 따르면, VAR은 까다로운 ImageNet benchmark 전반에서 경쟁 아키텍처를 성공적으로 능가합니다. 훨씬 더 빠르게 실행되면서도 Frechet Inception Distance (FID) 및 inception 점수 모두에서 더 나은 지표를 달성합니다.

VAR 대 디퓨전 모델#

VAR을 확산 기반 Generative AI와 구분하는 것은 중요합니다. Diffusion models은 시작 캔버스에서 연속적인 노이즈를 반복적으로 제거하여 이미지를 생성하는 방법을 학습합니다. 그러나 VAR은 이산 토큰에서 작동합니다. 디노이징 대신 해상도별로 이미지 해상도를 자기회귀 방식으로 구축합니다. Diffusion Transformer (DiT)가 시각 합성의 주요 표준이었지만, VAR의 토큰 기반 접근 방식은 transformer 모델에 투입된 최적화 연구의 혜택을 직접 받아 확장성과 데이터 효율성 모두에서 DiT를 능가할 수 있게 해줍니다.

실제 애플리케이션 사례#

LLM의 추론 능력과 고충실도 비전을 결합함으로써 Visual Autoregressive Modeling은 다음과 같은 실용적인 기능을 제공합니다:

  • Zero-Shot Image Editing and In-painting: VAR은 제로샷 조작을 기본적으로 지원합니다. 특정 스케일나 영역을 마스킹함으로써 개발자는 기본 아키텍처를 재학습하거나 미세 조정하지 않고도 이미지를 원활하게 편집하거나 확장할 수 있습니다.
  • Scalable Asset Generation for Retail: VAR의 극도로 빠른 추론 속도는 실시간 고품질 이미지 합성을 가능하게 하여 대규모로 동적 제품 배경 생성 및 개인화된 마케팅 자산을 구현할 수 있게 해줍니다.

자기회귀 워크플로 구현#

VAR 모델은 콘텐츠 생성에 초점을 맞추지만, Ultralytics YOLO26과 같은 강력한 인지 모델과 페어링하여 포괄적인 멀티모달 파이프라인을 만들 수 있습니다. 예를 들어, YOLO26을 사용하여 정확한 object detection으로 피사체를 격리한 다음, 해당 특정 영역을 자기회귀 모델에 전달하여 향상시키거나 재스타일링할 수 있습니다.

아래는 다중 스케일 자기회귀 루프가 토큰 맵의 다음 스케일을 반복적으로 예측하여 표준 PyTorch Transformer modules를 사용하여 VAR의 기본 로직을 시뮬레이션하는 방식을 보여주는 개념적인 PyTorch 코드 조각입니다:

import torch
import torch.nn as nn


# Conceptual VAR Next-Scale Prediction Loop
class SimpleVARGenerator(nn.Module):
    def __init__(self):
        super().__init__()
        # Simulated transformer to predict next resolution token map
        self.transformer = nn.TransformerEncoderLayer(d_model=256, nhead=8)

    def forward(self, initial_scale_token):
        current_tokens = initial_scale_token
        # Iteratively generate next scales (e.g., 1x1 -> 2x2 -> 4x4)
        for scale in [1, 2, 4]:
            # Model predicts the structural layout for the higher resolution
            next_scale_tokens = self.transformer(current_tokens)
            # Expand and update tokens for the next iteration
            current_tokens = torch.cat((current_tokens, next_scale_tokens), dim=1)
        return current_tokens


model = SimpleVARGenerator()
seed_token = torch.randn(1, 1, 256)  # 1x1 starting scale
final_output = model(seed_token)
print(f"Generated multi-scale tokens shape: {final_output.shape}")

데이터셋 큐레이션부터 복잡한 아키텍처 평가에 이르기까지 엔드투엔드 비전 파이프라인을 구축하려는 연구원을 위해 Ultralytics Platform은 자동 주석, 추적, 클라우드 배포를 위한 강력한 도구를 제공합니다. Vision Language Model (VLM)을 최적화하든 다음 스케일 예측을 실험하든, 통합된 시각적 지능 생태계는 실제 사용 사례 전반에서 혁신을 가속화합니다.

Explore solutions

Real-time AI that works with your team

로봇 공학에서의 AI

Ultralytics YOLO 모델로 더 스마트한 기기를 구동하십시오. 로봇 공학의 비전 AI는 자율 주행, 인식, 객체 추적 및 실시간 제어를 촉진합니다.
더 알아보기
Real-time AI that works with your team

물류 분야의 AI

Ultralytics YOLO 모델로 물류 프로세스를 간소화하십시오. 비전 AI를 통해 패키지 검사, 분류, 차량 추적 및 실시간 창고 안전 모니터링이 가능합니다.
더 알아보기
Real-time AI that works with your team

소매업에서의 AI

Ultralytics YOLO 모델로 소매업을 재구상하십시오. 비전 AI는 재고 추적, 선반 모니터링, 대기열 관리 및 더 스마트한 고객 인사이트를 지원합니다.
더 알아보기
Real-time AI that works with your team

의료 분야의 AI

Ultralytics YOLO 모델로 의료 솔루션을 구축하십시오. 의료 분야의 비전 AI는 더 빠른 의료 영상 분석, 더 스마트한 진단 및 환자 모니터링을 지원합니다.
더 알아보기
Real-time AI that works with your team

제조 분야의 AI

Ultralytics YOLO 모델로 제조 공정을 최적화하십시오. 비전 AI는 품질 관리, 결함 탐지, PPE 규정 준수 및 조립 라인 자동화를 주도합니다.
더 알아보기
Real-time AI that works with your operation

자동차 분야의 AI

Ultralytics YOLO 모델을 통해 자동차 분야에 컴퓨터 비전을 적용하십시오. 비전 AI는 도로 안전, 운전자 보조 및 차량 자동화를 향상하여 더 스마트한 도로를 만듭니다.
더 알아보기
Real-time AI tailored to your operation

농업 분야의 AI

Ultralytics YOLO 모델을 통해 스마트 농업에 비전 AI를 도입하십시오. 작물 모니터링, 가축 추적 및 정밀 농업을 강화하여 더 높고 스마트한 생산량을 달성하십시오.
더 알아보기
Real-time AI that works with your team

로봇 공학에서의 AI

Ultralytics YOLO 모델로 더 스마트한 기기를 구동하십시오. 로봇 공학의 비전 AI는 자율 주행, 인식, 객체 추적 및 실시간 제어를 촉진합니다.
더 알아보기
Real-time AI that works with your team

물류 분야의 AI

Ultralytics YOLO 모델로 물류 프로세스를 간소화하십시오. 비전 AI를 통해 패키지 검사, 분류, 차량 추적 및 실시간 창고 안전 모니터링이 가능합니다.
더 알아보기
Real-time AI that works with your team

소매업에서의 AI

Ultralytics YOLO 모델로 소매업을 재구상하십시오. 비전 AI는 재고 추적, 선반 모니터링, 대기열 관리 및 더 스마트한 고객 인사이트를 지원합니다.
더 알아보기
Real-time AI that works with your team

의료 분야의 AI

Ultralytics YOLO 모델로 의료 솔루션을 구축하십시오. 의료 분야의 비전 AI는 더 빠른 의료 영상 분석, 더 스마트한 진단 및 환자 모니터링을 지원합니다.
더 알아보기
Real-time AI that works with your team

제조 분야의 AI

Ultralytics YOLO 모델로 제조 공정을 최적화하십시오. 비전 AI는 품질 관리, 결함 탐지, PPE 규정 준수 및 조립 라인 자동화를 주도합니다.
더 알아보기
Real-time AI that works with your operation

자동차 분야의 AI

Ultralytics YOLO 모델을 통해 자동차 분야에 컴퓨터 비전을 적용하십시오. 비전 AI는 도로 안전, 운전자 보조 및 차량 자동화를 향상하여 더 스마트한 도로를 만듭니다.
더 알아보기
Real-time AI tailored to your operation

농업 분야의 AI

Ultralytics YOLO 모델을 통해 스마트 농업에 비전 AI를 도입하십시오. 작물 모니터링, 가축 추적 및 정밀 농업을 강화하여 더 높고 스마트한 생산량을 달성하십시오.
더 알아보기
Real-time AI that works with your team

로봇 공학에서의 AI

Ultralytics YOLO 모델로 더 스마트한 기기를 구동하십시오. 로봇 공학의 비전 AI는 자율 주행, 인식, 객체 추적 및 실시간 제어를 촉진합니다.
더 알아보기
Real-time AI that works with your team

물류 분야의 AI

Ultralytics YOLO 모델로 물류 프로세스를 간소화하십시오. 비전 AI를 통해 패키지 검사, 분류, 차량 추적 및 실시간 창고 안전 모니터링이 가능합니다.
더 알아보기
Real-time AI that works with your team

소매업에서의 AI

Ultralytics YOLO 모델로 소매업을 재구상하십시오. 비전 AI는 재고 추적, 선반 모니터링, 대기열 관리 및 더 스마트한 고객 인사이트를 지원합니다.
더 알아보기
Real-time AI that works with your team

의료 분야의 AI

Ultralytics YOLO 모델로 의료 솔루션을 구축하십시오. 의료 분야의 비전 AI는 더 빠른 의료 영상 분석, 더 스마트한 진단 및 환자 모니터링을 지원합니다.
더 알아보기
Real-time AI that works with your team

제조 분야의 AI

Ultralytics YOLO 모델로 제조 공정을 최적화하십시오. 비전 AI는 품질 관리, 결함 탐지, PPE 규정 준수 및 조립 라인 자동화를 주도합니다.
더 알아보기
Real-time AI that works with your operation

자동차 분야의 AI

Ultralytics YOLO 모델을 통해 자동차 분야에 컴퓨터 비전을 적용하십시오. 비전 AI는 도로 안전, 운전자 보조 및 차량 자동화를 향상하여 더 스마트한 도로를 만듭니다.
더 알아보기
Real-time AI tailored to your operation

농업 분야의 AI

Ultralytics YOLO 모델을 통해 스마트 농업에 비전 AI를 도입하십시오. 작물 모니터링, 가축 추적 및 정밀 농업을 강화하여 더 높고 스마트한 생산량을 달성하십시오.
더 알아보기

미래의 AI를 함께 구축합시다!

머신 러닝의 미래와 함께 여정을 시작하십시오.