Ultralytics YOLO27:
Ultralytics用語集に戻る

Visual Autoregressive Modeling (VAR)

視覚的自己回帰モデリング(VAR)について解説します。次スケール予測が、従来の手法や拡散モデルよりも画像生成の速度と品質を高める仕組みを学びましょう。

視覚自己回帰モデリング(VAR)は、大規模言語モデル(LLMs)によって広まった自己回帰学習戦略を画像生成タスクに応用する、先進的なコンピュータービジョンのパラダイムです。従来の視覚自己回帰手法では、画像を1次元の系列にエンコードし、ラスタースキャン順にトークンを1つずつ予測しますが、これは計算コストが高く、視覚データの自然な2次元構造を無視しています。一方、VARでは粗いものから細かいものへと進む「次スケール予測」アプローチを導入します。個々のトークンを行ごとに予測するのではなく、より高解像度の特徴マップまたはスケールを段階的に予測して画像を生成します。この手法は構造的な整合性を保ちながら、画像品質と推論速度の両方を大幅に向上させます。

視覚自己回帰モデリングの仕組み#

VARの中核となるのは、従来の次トークン予測を次スケール予測に置き換えることです。まず、画像をベクトル量子化変分オートエンコーダー(VQ-VAE)に似たアーキテクチャを使用して、マルチスケールの離散トークンマップに圧縮します。生成段階では、トランスフォーマーモデルが最小解像度(1x1グリッドなど)から目標解像度(16x16や32x32グリッドなど)まで、これらのトークンマップを順次予測します。各スケールで空間構造を同時に処理するため、VARは2次元画像に本来備わっている双方向の相関関係を適切に保持します。

この新しいアプローチにより、VARモデルはOpenAI GPT-4のようなテキストベースのアーキテクチャに匹敵する、予測可能なスケーリング則を確立できます。研究者がモデルのパラメーター数を増やすと、性能は一貫して向上します。視覚自己回帰モデリングに関するNeurIPS 2024の論文によると、VARは難易度の高いImageNetベンチマークで競合アーキテクチャを上回りました。フレシェ開始距離(FID)とInceptionスコアの両方で優れた指標を達成しながら、はるかに高速に実行できます。

VARと拡散モデルの比較#

VARと拡散ベースの生成AIを区別することが重要です。拡散モデルは、初期キャンバスから連続的なノイズを反復的に除去して画像を生成するよう学習します。一方、VARは離散トークンを処理します。ノイズ除去を行う代わりに、解像度を段階的に上げながら自己回帰的に画像を構築します。拡散トランスフォーマー(DiT)は視覚的合成の主要な標準となっていますが、VARのトークンベースのアプローチは、トランスフォーマーモデルの最適化研究の成果を直接活用できるため、スケーラビリティとデータ効率の両面でDiTを上回ります。

実際のアプリケーション#

LLMの推論能力と高忠実度のビジョンを融合させることで、視覚自己回帰モデリングは実用的な複数の機能を実現します。

  • ゼロショット画像編集とインペインティング: VARはゼロショット操作にネイティブで対応しています。特定のスケールや領域をマスクすることで、開発者はベースアーキテクチャを再学習またはファインチューニングすることなく、画像をシームレスに編集したり拡張したりできます。
  • 小売業向けのスケーラブルなアセット生成: VARの非常に高速な推論により、高品質な画像をリアルタイムで合成できるため、商品背景やパーソナライズされたマーケティングアセットを大規模に動的生成できます。

自己回帰ワークフローの実装#

VARモデルはコンテンツ生成に重点を置いていますが、Ultralytics YOLO26のような強力な知覚モデルと組み合わせて、包括的なマルチモーダルパイプラインを構築できます。たとえば、YOLO26で正確な物体検出を行って対象を切り分け、その領域を自己回帰モデルに渡して強調やスタイル変更を行えます。

以下は、標準のPyTorch Transformerモジュールを使用してVARの基本ロジックをシミュレーションし、マルチスケールの自己回帰ループでトークンマップの次のスケールを反復的に予測する方法を示す、概念的なPyTorchのコード例です。

import torch
import torch.nn as nn


# Conceptual VAR Next-Scale Prediction Loop
class SimpleVARGenerator(nn.Module):
    def __init__(self):
        super().__init__()
        # Simulated transformer to predict next resolution token map
        self.transformer = nn.TransformerEncoderLayer(d_model=256, nhead=8)

    def forward(self, initial_scale_token):
        current_tokens = initial_scale_token
        # Iteratively generate next scales (e.g., 1x1 -> 2x2 -> 4x4)
        for scale in [1, 2, 4]:
            # Model predicts the structural layout for the higher resolution
            next_scale_tokens = self.transformer(current_tokens)
            # Expand and update tokens for the next iteration
            current_tokens = torch.cat((current_tokens, next_scale_tokens), dim=1)
        return current_tokens


model = SimpleVARGenerator()
seed_token = torch.randn(1, 1, 256)  # 1x1 starting scale
final_output = model(seed_token)
print(f"Generated multi-scale tokens shape: {final_output.shape}")

データセットのキュレーションから複雑なアーキテクチャの評価まで、エンドツーエンドのビジョンパイプラインを構築する研究者向けに、Ultralytics Platformは自動アノテーション、トラッキング、クラウドデプロイのための堅牢なツールを提供します。ビジョン言語モデル(VLM)の最適化でも、次スケール予測の実験でも、統合された視覚インテリジェンスのエコシステムが現実世界のユースケース全体でイノベーションを加速します。

Explore solutions

航空画像向けコンピュータービジョン

航空画像向けコンピュータービジョン

Ultralytics YOLOを活用して、ドローンや航空画像をリアルタイムの知見に変換し、農業、水産養殖、環境モニタリング、自然保護、地理空間分析に役立てましょう。
詳しく見る
航空宇宙分野のコンピュータービジョン

航空宇宙分野のコンピュータービジョン

Ultralytics YOLOモデルで航空モニタリングにビジョンAIを導入しましょう。コンピュータービジョンソリューションで、ドローン、航空宇宙のワークフロー、環境保全、地理空間業界を支援します。
詳しく見る
セキュリティ分野のコンピュータービジョン

セキュリティ分野のコンピュータービジョン

Ultralytics YOLOモデルであらゆる施設を保護しましょう。ビジョンAIは、周辺監視、脅威検知、ナンバープレート認識、職場の安全管理を支援します。
詳しく見る
ロボティクス分野のコンピュータービジョン

ロボティクス分野のコンピュータービジョン

Ultralytics YOLOモデルで、よりスマートなマシンを実現しましょう。ロボティクスにおけるビジョンAIは、自律ナビゲーション、認識、物体追跡、リアルタイム制御を支援します。
詳しく見る
物流におけるコンピュータービジョン

物流におけるコンピュータービジョン

Ultralytics YOLOモデルで物流を効率化しましょう。ビジョンAIにより、荷物検査、仕分け、車両追跡、倉庫のリアルタイム安全監視を実現します。
詳しく見る
小売業におけるコンピュータービジョン

小売業におけるコンピュータービジョン

Ultralytics YOLOモデルで小売のあり方を変革しましょう。ビジョンAIにより、在庫追跡、棚の監視、行列管理、より高度な顧客インサイトを実現します。
詳しく見る
医療分野におけるコンピュータービジョン

医療分野におけるコンピュータービジョン

Ultralytics YOLOモデルで医療ソリューションを構築しましょう。医療分野のビジョンAIは、医用画像処理の高速化、より高度な診断、患者モニタリングを実現します。
詳しく見る
製造業におけるコンピュータービジョン

製造業におけるコンピュータービジョン

Ultralytics YOLOモデルで製造を最適化しましょう。ビジョンAIは、品質管理、欠陥検出、PPE準拠、組立ラインの自動化を推進します。
詳しく見る
自動車分野におけるコンピュータービジョン

自動車分野におけるコンピュータービジョン

Ultralytics YOLOモデルで自動車分野にコンピュータービジョンを導入しましょう。ビジョンAIは、道路の安全性、運転支援、車両の自動化を向上させ、よりスマートな道路を実現します。
詳しく見る
農業におけるコンピュータービジョン

農業におけるコンピュータービジョン

Ultralytics YOLOモデルでスマート農業にビジョンAIを導入しましょう。作物のモニタリング、家畜の追跡、精密農業を支援し、より高く効率的な収量を実現します。
詳しく見る
航空画像向けコンピュータービジョン

航空画像向けコンピュータービジョン

Ultralytics YOLOを活用して、ドローンや航空画像をリアルタイムの知見に変換し、農業、水産養殖、環境モニタリング、自然保護、地理空間分析に役立てましょう。
詳しく見る
航空宇宙分野のコンピュータービジョン

航空宇宙分野のコンピュータービジョン

Ultralytics YOLOモデルで航空モニタリングにビジョンAIを導入しましょう。コンピュータービジョンソリューションで、ドローン、航空宇宙のワークフロー、環境保全、地理空間業界を支援します。
詳しく見る
セキュリティ分野のコンピュータービジョン

セキュリティ分野のコンピュータービジョン

Ultralytics YOLOモデルであらゆる施設を保護しましょう。ビジョンAIは、周辺監視、脅威検知、ナンバープレート認識、職場の安全管理を支援します。
詳しく見る
ロボティクス分野のコンピュータービジョン

ロボティクス分野のコンピュータービジョン

Ultralytics YOLOモデルで、よりスマートなマシンを実現しましょう。ロボティクスにおけるビジョンAIは、自律ナビゲーション、認識、物体追跡、リアルタイム制御を支援します。
詳しく見る
物流におけるコンピュータービジョン

物流におけるコンピュータービジョン

Ultralytics YOLOモデルで物流を効率化しましょう。ビジョンAIにより、荷物検査、仕分け、車両追跡、倉庫のリアルタイム安全監視を実現します。
詳しく見る
小売業におけるコンピュータービジョン

小売業におけるコンピュータービジョン

Ultralytics YOLOモデルで小売のあり方を変革しましょう。ビジョンAIにより、在庫追跡、棚の監視、行列管理、より高度な顧客インサイトを実現します。
詳しく見る
医療分野におけるコンピュータービジョン

医療分野におけるコンピュータービジョン

Ultralytics YOLOモデルで医療ソリューションを構築しましょう。医療分野のビジョンAIは、医用画像処理の高速化、より高度な診断、患者モニタリングを実現します。
詳しく見る
製造業におけるコンピュータービジョン

製造業におけるコンピュータービジョン

Ultralytics YOLOモデルで製造を最適化しましょう。ビジョンAIは、品質管理、欠陥検出、PPE準拠、組立ラインの自動化を推進します。
詳しく見る
自動車分野におけるコンピュータービジョン

自動車分野におけるコンピュータービジョン

Ultralytics YOLOモデルで自動車分野にコンピュータービジョンを導入しましょう。ビジョンAIは、道路の安全性、運転支援、車両の自動化を向上させ、よりスマートな道路を実現します。
詳しく見る
農業におけるコンピュータービジョン

農業におけるコンピュータービジョン

Ultralytics YOLOモデルでスマート農業にビジョンAIを導入しましょう。作物のモニタリング、家畜の追跡、精密農業を支援し、より高く効率的な収量を実現します。
詳しく見る
航空画像向けコンピュータービジョン

航空画像向けコンピュータービジョン

Ultralytics YOLOを活用して、ドローンや航空画像をリアルタイムの知見に変換し、農業、水産養殖、環境モニタリング、自然保護、地理空間分析に役立てましょう。
詳しく見る
航空宇宙分野のコンピュータービジョン

航空宇宙分野のコンピュータービジョン

Ultralytics YOLOモデルで航空モニタリングにビジョンAIを導入しましょう。コンピュータービジョンソリューションで、ドローン、航空宇宙のワークフロー、環境保全、地理空間業界を支援します。
詳しく見る
セキュリティ分野のコンピュータービジョン

セキュリティ分野のコンピュータービジョン

Ultralytics YOLOモデルであらゆる施設を保護しましょう。ビジョンAIは、周辺監視、脅威検知、ナンバープレート認識、職場の安全管理を支援します。
詳しく見る
ロボティクス分野のコンピュータービジョン

ロボティクス分野のコンピュータービジョン

Ultralytics YOLOモデルで、よりスマートなマシンを実現しましょう。ロボティクスにおけるビジョンAIは、自律ナビゲーション、認識、物体追跡、リアルタイム制御を支援します。
詳しく見る
物流におけるコンピュータービジョン

物流におけるコンピュータービジョン

Ultralytics YOLOモデルで物流を効率化しましょう。ビジョンAIにより、荷物検査、仕分け、車両追跡、倉庫のリアルタイム安全監視を実現します。
詳しく見る
小売業におけるコンピュータービジョン

小売業におけるコンピュータービジョン

Ultralytics YOLOモデルで小売のあり方を変革しましょう。ビジョンAIにより、在庫追跡、棚の監視、行列管理、より高度な顧客インサイトを実現します。
詳しく見る
医療分野におけるコンピュータービジョン

医療分野におけるコンピュータービジョン

Ultralytics YOLOモデルで医療ソリューションを構築しましょう。医療分野のビジョンAIは、医用画像処理の高速化、より高度な診断、患者モニタリングを実現します。
詳しく見る
製造業におけるコンピュータービジョン

製造業におけるコンピュータービジョン

Ultralytics YOLOモデルで製造を最適化しましょう。ビジョンAIは、品質管理、欠陥検出、PPE準拠、組立ラインの自動化を推進します。
詳しく見る
自動車分野におけるコンピュータービジョン

自動車分野におけるコンピュータービジョン

Ultralytics YOLOモデルで自動車分野にコンピュータービジョンを導入しましょう。ビジョンAIは、道路の安全性、運転支援、車両の自動化を向上させ、よりスマートな道路を実現します。
詳しく見る
農業におけるコンピュータービジョン

農業におけるコンピュータービジョン

Ultralytics YOLOモデルでスマート農業にビジョンAIを導入しましょう。作物のモニタリング、家畜の追跡、精密農業を支援し、より高く効率的な収量を実現します。
詳しく見る

AIの未来を一緒に築きましょう!

機械学習の未来に向けた歩みを始めましょう