YOLO Vision 2026:
Ultralytics用語集に戻る

Masked Autoencoders (MAE)

Masked Autoencoders(MAE)が自己教師あり学習を革新する方法を解説します。MAEによる再構成がUltralytics YOLO26の性能と効率を向上させる仕組みを学びます。

マスクオートエンコーダ(MAE)は、より広範なコンピュータビジョン分野における、非常に効率的でスケーラブルな自己教師あり学習のアプローチです。大規模なラベル付きデータセットを必要とせずに、パラメータ数の多いニューラルネットワークをトレーニングする手法として導入されました。MAEは、入力画像の大部分を意図的かつランダムに隠し、欠損したピクセルを再構成するようにモデルをトレーニングします。隠された視覚情報を正確に予測することで、ネットワークは形状、テクスチャ、空間的関係を深く意味的に理解できるようになります。

この手法は、テキストベースのシステムにおけるマスク言語モデリングの成功から大きな影響を受けていますが、画像データの高次元性に合わせて適応されています。アーキテクチャには、非常に広く利用されているトランスフォーマーフレームワークが採用されており、非対称なエンコーダー・デコーダー構造を使用します。

マスクオートエンコーダ(MAE)の仕組み#

MAEの中核となる革新は、処理効率にあります。トレーニング時には、入力画像をパッチのグリッドに分割します。これらのパッチの大部分(多くの場合、最大75%)をランダムにマスクして破棄します。エンコーダーは、通常Vision Transformer(ViT)で構成され、可視状態にあるマスクされていないパッチのみを処理します。エンコーダーはマスクされた部分を完全にスキップするため、必要な計算量とメモリが大幅に少なく、トレーニングプロセスを非常に高速化できます。

エンコーダーが可視パッチの潜在表現を生成した後は、軽量なデコーダーが処理を引き継ぎます。デコーダーは、エンコードされた可視パッチと「マスクトークン」(欠損データのプレースホルダー)を受け取り、元の画像の再構築を試みます。デコーダーはこの事前トレーニング段階でのみ使用されるため、非常に小規模に保つことができ、計算オーバーヘッドをさらに削減できます。事前トレーニングが完了すると、デコーダーは破棄され、強力なエンコーダーが下流タスク向けに保持されます。

関連用語との違い#

MAEを十分に理解するには、従来の、またはより広範なディープラーニングの概念との違いを把握すると役立ちます。

  • **オートエンコーダー:**従来のオートエンコーダーは、入力全体をより小さな潜在空間に圧縮してから再構成し、効率的なデータ符号化を学習します。一方、MAEでは、入力全体を単に圧縮・復元するのではなく、ネットワークに欠損したデータの予測を強制します。
  • **自己教師あり学習:**これは、人手でアノテーションされたラベルを使わず、データ自体からモデルが学習する包括的なトレーニングパラダイムです。MAEは、この概念を具体的なアーキテクチャとして実装したものです。
  • **基盤モデル:**MAEは、視覚基盤モデルの事前トレーニングに使用されることが多く、その後、専門的なタスク向けにファインチューニングされます。

実世界での利用例#

MAEは視覚データの非常に堅牢な表現を学習するため、複雑な実環境のAIシステムに最適な出発点となります。

  • **高度な物体検出のための事前トレーニング:**MAEの事前トレーニングによって学習された豊富な特徴抽出能力は、下流の物体検出システムの性能を大幅に向上させます。たとえば、MAEを通じて学習した特徴は、ラベル付きデータが少ない、カスタムのニッチなデータセットでUltralytics YOLO26などのモデルをトレーニングする際に利用できます。
  • **医用画像解析:**放射線医学などの分野では、アノテーション済みのMRIやCTスキャンの大規模なデータセットを収集するには多額の費用がかかり、プライバシー法による制約も受けます。研究者は、arXivで公開された最新の学術文献でも報告されているように、ラベルのない医用画像の大規模なプールでMAEを使ってモデルを事前トレーニングしてから、わずかなラベル付きサンプルで腫瘍や異常を検出できるようにファインチューニングします。

データ管理とデプロイ#

MAEアプローチを使用してバックボーンの事前トレーニングを行った後は、画像分類画像セグメンテーションなどの特定のタスク向けにモデルをファインチューニングしてデプロイします。最新のクラウドエコシステムにより、この移行をシームレスに行えます。たとえば、チームはUltralytics Platformを活用して、タスク固有のデータセットへのアノテーション、クラウドトレーニングのオーケストレーション、完成した本番環境対応モデルのエッジデバイスやサーバーへのデプロイを容易に実行できます。これにより、通常は機械学習オペレーション(MLOps)に伴う定型的なインフラストラクチャ作業の多くを排除できます。

コード例:パッチマスキングのシミュレーション#

完全なMAEをトレーニングするには完全なトランスフォーマーアーキテクチャが必要ですが、パッチマスキングの中核概念は、PyTorchテンソル演算を使用して簡単に可視化できます。このシンプルなコードスニペットでは、入力テンソルから可視パッチをランダムに選択する方法を示します。

import torch


def create_random_mask(batch_size, num_patches, mask_ratio=0.75):
    """Generates a random mask to simulate MAE patch dropping."""
    # Calculate how many patches to keep visible
    num_keep = int(num_patches * (1 - mask_ratio))

    # Generate random noise to determine patch shuffling
    noise = torch.rand(batch_size, num_patches)

    # Sort noise to get random indices
    ids_shuffle = torch.argsort(noise, dim=1)

    # Select the indices of the patches that remain visible
    ids_keep = ids_shuffle[:, :num_keep]

    return ids_keep


# Simulate a batch of 4 images, each divided into 196 patches
visible_patches = create_random_mask(batch_size=4, num_patches=196)
print(f"Visible patch indices shape: {visible_patches.shape}")

アーキテクチャをゼロから記述せずに、強力な事前トレーニング済み視覚機能をワークフローに統合したい開発者にとって、広範なUltralyticsドキュメントを調べることは、最先端のビジョンモデルを独自の課題に適用するための優れた出発点となります。さらに、TensorFlowなどの主要なフレームワークも、最先端の機械学習研究をスケーラブルな本番環境に実装するための堅牢なエコシステムを提供しています。

Explore solutions

航空画像向けコンピュータービジョン

航空画像向けコンピュータービジョン

Ultralytics YOLOを使用して、ドローンや航空画像から農業、水産業、環境モニタリング、保全、地理空間分析向けのリアルタイムなインサイトを生成します。
詳細を見る
航空宇宙におけるコンピュータビジョン

航空宇宙におけるコンピュータビジョン

Ultralytics YOLOモデルを使用して、ビジョンAIを空中モニタリングに導入します。コンピュータビジョンソリューションで、ドローン、航空宇宙ワークフロー、環境保護、および地理空間産業を強力にサポートします。
詳細を見る

Ultralytics YOLOモデルであらゆるサイトを保護します。ビジョンAIは、境界モニタリング、脅威検出、ナンバープレート認識、職場安全をサポートします。
詳細を見る
ロボティクスのコンピュータービジョン

ロボティクスのコンピュータービジョン

Ultralytics YOLOモデルで、よりスマートなマシンを実現します。ロボティクスのVision AIにより、自律ナビゲーション、認識、物体追跡、リアルタイム制御を実現します。
詳細を見る
物流のコンピュータービジョン

物流のコンピュータービジョン

Ultralytics YOLOモデルで物流を効率化します。Vision AIにより、荷物検査、仕分け、車両追跡、倉庫の安全性に関するリアルタイム監視を実現します。
詳細を見る
小売のコンピュータービジョン

小売のコンピュータービジョン

Ultralytics YOLOモデルで小売を再構築します。Vision AIにより、在庫追跡、棚監視、待ち行列管理、より高度な顧客インサイトを実現します。
詳細を見る
ヘルスケア向けコンピュータービジョン

ヘルスケア向けコンピュータービジョン

Ultralytics YOLOモデルでヘルスケアソリューションを構築しましょう。ヘルスケア向けVision AIは、医用画像処理の高速化、より高度な診断、患者モニタリングを実現します。
詳細を見る
製造業向けコンピュータービジョン

製造業向けコンピュータービジョン

Ultralytics YOLOモデルで製造業を最適化しましょう。Vision AIは、品質管理、欠陥検出、PPE遵守、組立ラインの自動化を推進します。
詳細を見る
自動車分野のコンピュータビジョン

自動車分野のコンピュータビジョン

Ultralytics YOLOモデルで自動車分野にコンピュータビジョンを適用します。ビジョンAIにより、道路の安全性、運転支援、車両自動化を向上させ、よりスマートな道路を実現します。
詳細を見る
農業分野のコンピュータビジョン

農業分野のコンピュータビジョン

Ultralytics YOLOモデルでスマート農業にビジョンAIを導入します。作物のモニタリング、家畜の追跡、精密農業を支援し、より高くスマートな収穫量を実現します。
詳細を見る
航空画像向けコンピュータービジョン

航空画像向けコンピュータービジョン

Ultralytics YOLOを使用して、ドローンや航空画像から農業、水産業、環境モニタリング、保全、地理空間分析向けのリアルタイムなインサイトを生成します。
詳細を見る
航空宇宙におけるコンピュータビジョン

航空宇宙におけるコンピュータビジョン

Ultralytics YOLOモデルを使用して、ビジョンAIを空中モニタリングに導入します。コンピュータビジョンソリューションで、ドローン、航空宇宙ワークフロー、環境保護、および地理空間産業を強力にサポートします。
詳細を見る

Ultralytics YOLOモデルであらゆるサイトを保護します。ビジョンAIは、境界モニタリング、脅威検出、ナンバープレート認識、職場安全をサポートします。
詳細を見る
ロボティクスのコンピュータービジョン

ロボティクスのコンピュータービジョン

Ultralytics YOLOモデルで、よりスマートなマシンを実現します。ロボティクスのVision AIにより、自律ナビゲーション、認識、物体追跡、リアルタイム制御を実現します。
詳細を見る
物流のコンピュータービジョン

物流のコンピュータービジョン

Ultralytics YOLOモデルで物流を効率化します。Vision AIにより、荷物検査、仕分け、車両追跡、倉庫の安全性に関するリアルタイム監視を実現します。
詳細を見る
小売のコンピュータービジョン

小売のコンピュータービジョン

Ultralytics YOLOモデルで小売を再構築します。Vision AIにより、在庫追跡、棚監視、待ち行列管理、より高度な顧客インサイトを実現します。
詳細を見る
ヘルスケア向けコンピュータービジョン

ヘルスケア向けコンピュータービジョン

Ultralytics YOLOモデルでヘルスケアソリューションを構築しましょう。ヘルスケア向けVision AIは、医用画像処理の高速化、より高度な診断、患者モニタリングを実現します。
詳細を見る
製造業向けコンピュータービジョン

製造業向けコンピュータービジョン

Ultralytics YOLOモデルで製造業を最適化しましょう。Vision AIは、品質管理、欠陥検出、PPE遵守、組立ラインの自動化を推進します。
詳細を見る
自動車分野のコンピュータビジョン

自動車分野のコンピュータビジョン

Ultralytics YOLOモデルで自動車分野にコンピュータビジョンを適用します。ビジョンAIにより、道路の安全性、運転支援、車両自動化を向上させ、よりスマートな道路を実現します。
詳細を見る
農業分野のコンピュータビジョン

農業分野のコンピュータビジョン

Ultralytics YOLOモデルでスマート農業にビジョンAIを導入します。作物のモニタリング、家畜の追跡、精密農業を支援し、より高くスマートな収穫量を実現します。
詳細を見る
航空画像向けコンピュータービジョン

航空画像向けコンピュータービジョン

Ultralytics YOLOを使用して、ドローンや航空画像から農業、水産業、環境モニタリング、保全、地理空間分析向けのリアルタイムなインサイトを生成します。
詳細を見る
航空宇宙におけるコンピュータビジョン

航空宇宙におけるコンピュータビジョン

Ultralytics YOLOモデルを使用して、ビジョンAIを空中モニタリングに導入します。コンピュータビジョンソリューションで、ドローン、航空宇宙ワークフロー、環境保護、および地理空間産業を強力にサポートします。
詳細を見る

Ultralytics YOLOモデルであらゆるサイトを保護します。ビジョンAIは、境界モニタリング、脅威検出、ナンバープレート認識、職場安全をサポートします。
詳細を見る
ロボティクスのコンピュータービジョン

ロボティクスのコンピュータービジョン

Ultralytics YOLOモデルで、よりスマートなマシンを実現します。ロボティクスのVision AIにより、自律ナビゲーション、認識、物体追跡、リアルタイム制御を実現します。
詳細を見る
物流のコンピュータービジョン

物流のコンピュータービジョン

Ultralytics YOLOモデルで物流を効率化します。Vision AIにより、荷物検査、仕分け、車両追跡、倉庫の安全性に関するリアルタイム監視を実現します。
詳細を見る
小売のコンピュータービジョン

小売のコンピュータービジョン

Ultralytics YOLOモデルで小売を再構築します。Vision AIにより、在庫追跡、棚監視、待ち行列管理、より高度な顧客インサイトを実現します。
詳細を見る
ヘルスケア向けコンピュータービジョン

ヘルスケア向けコンピュータービジョン

Ultralytics YOLOモデルでヘルスケアソリューションを構築しましょう。ヘルスケア向けVision AIは、医用画像処理の高速化、より高度な診断、患者モニタリングを実現します。
詳細を見る
製造業向けコンピュータービジョン

製造業向けコンピュータービジョン

Ultralytics YOLOモデルで製造業を最適化しましょう。Vision AIは、品質管理、欠陥検出、PPE遵守、組立ラインの自動化を推進します。
詳細を見る
自動車分野のコンピュータビジョン

自動車分野のコンピュータビジョン

Ultralytics YOLOモデルで自動車分野にコンピュータビジョンを適用します。ビジョンAIにより、道路の安全性、運転支援、車両自動化を向上させ、よりスマートな道路を実現します。
詳細を見る
農業分野のコンピュータビジョン

農業分野のコンピュータビジョン

Ultralytics YOLOモデルでスマート農業にビジョンAIを導入します。作物のモニタリング、家畜の追跡、精密農業を支援し、より高くスマートな収穫量を実現します。
詳細を見る

AIの未来を一緒に築きましょう!

機械学習の未来への歩みを始めましょう