Diffusion Policies
Diffusion Policiesが現代のロボティクスをどのように形成しているかを探ります。ノイズ除去を介してアクションをモデル化し、スマートな知覚のためにUltralytics YOLO26と統合する方法を学びます。
Diffusion Policiesは、roboticsとmachine learningにおけるパラダイムシフトを表しており、AI agentの視覚運動ポリシーが条件付きノイズ除去拡散プロセスとしてモデル化されます。imitation learningの一形態である従来のbehavior cloningは、直接回帰に依存して感覚入力から単一の決定的アクションを予測します。単純なタスクでは機能しますが、直接回帰は複数の有効なアクションが存在する場合に失敗することが多く、不安定または安全ではない平均化された動作につながります。Diffusion policiesは、アクション生成をシーケンス改良タスクとして構成することでこれを解決します。純粋なランダムノイズから始めて、アルゴリズムは画像や空間状態データなどの感覚観測を条件として、信号を反復的にノイズ除去し、高精度、堅牢、かつマルチモーダルなアクションシーケンスを生成します。
Diffusion Policiesの仕組み#
generative modelingに見られる数学的基礎に依存しており、original visuomotor diffusion policy paperにおける高忠実度画像合成向けに元々開発されたテクニックを適応させています。フォワードプロセスとして知られるトレーニングフェーズでは、最適なエキスパートアクション軌跡に少量のノイズが段階的に追加されます。その後、neural networkがトレーニングされ、指定された観測コンテキストに基づいてこのノイズを予測して逆転させます。
推論中、ロボットが環境と対話するとき、周囲を観測し、ランダムなアクションシーケンスを初期化し、確率的Langevin dynamicsを使用してノイズを除去します。この反復的な最適化により、複雑で高次元のアクションスペースを処理できる、きめ細かくスムーズなモーターコマンドが生成されます。
実社会での応用#
mode collapseなしで複雑な分布を正確に表現することにより、Diffusion policiesは現代の物理的artificial intelligenceを積極的に再形作しています。
- Robotic Manipulation: 産業環境では、ロボットアームは、不規則な形状のオブジェクトの把持、複雑な電子機器の組み立て、または流動的な注ぎ動作の実行などの器用で接触の多いタスクにこれらのポリシーを利用します。
- Autonomous Navigation: 自動運転システムやドローンは、depth estimationとDiffusion policiesを組み合わせて、動的な環境を通じて安全で連続的な軌跡を計画し、標準的なreinforcement learningモデルを混乱させるような突然の障害物に優雅に適応します。
主要な用語の区別#
Diffusion Policiesの具体的な機能を明確にするため、密接に関連する生成アーキテクチャと区別することが役立ちます。
- Diffusion Policies vs. Diffusion Models: Diffusion Modelsは、テキストから画像への合成などの静的データを作成するために使用される、基礎となる生成アーキテクチャを大まかに指します。Diffusion Policiesは、この特定のメカニズムを適用して、アクティブなロボットの連続的な時系列モーターコマンドを予測します。
- Diffusion Policies vs. Diffusion Forcing: Diffusion Forcingは、トークンごとに異なるノイズレベルを使用してcausal transformersをトレーニングする一般的なシーケンス生成フレームワークです。関連はしていますが、Diffusion forcingは自己回帰予測に強く焦点を当てているのに対し、Diffusion policiesは視覚運動制御のための模倣学習戦略を厳密に示しています。
ポリシー学習における最近の進歩#
OpenAI research initiativesやGoogle DeepMind roboticsを含むトップ機関からの研究は、これらのアルゴリズムが達成できることの限界を押し広げ続けています。特に、published on arXiv in 2024の3D Diffusion Policy (DP3)は、単純な2D画像ではなくコンパクトな3D point cloud representationsにポリシーを条件付けることで、ブレークスルーを導入しました。これにより、専門家のデモンストレーションを劇的に少なくしながら、ロボットの空間認識が大幅に向上しました。D3P: Dynamic Denoising Diffusion Policyのようなさらなるイノベーションは、ルーチンアクションのノイズ除去ステップを動的にスキップすることで標準拡散の遅い推論速度に対処し始め、リアルタイムの応答性を解放しました。
コンピュータビジョンによる実践的な実装#
ディフュージョンポリシーがアクションを生成する前に、環境についての明確で構造化された理解が必要です。エンジニアは、堅牢なオブジェクト検出モデルとポリシーアルゴリズムを頻繁に組み合わせて、完全なコンピュータビジョンパイプラインを構築します。たとえば、Ultralytics YOLO26のような高速な知覚モデルは、リアルタイムでターゲットオブジェクトを切り出し、空間座標をPyTorchライブラリベースのディフュージョンポリシーにフィードします。
import torch
from ultralytics import YOLO
# Load the Ultralytics YOLO26 Nano model for high-speed robotic perception
model = YOLO("yolo26n.pt")
# Predict bounding boxes on the robot's active camera feed
results = model.predict("robot_camera_feed.jpg")
# Condition the policy by extracting the bounding box center coordinate
if len(results[0].boxes) > 0:
box = results[0].boxes[0].xyxy.squeeze()
center_x = (box[0] + box[2]) / 2.0
center_y = (box[1] + box[3]) / 2.0
# Create a spatial observation tensor to condition the PyTorch Diffusion Policy.
# This directly guides the denoising process to generate accurate motor actions.
observation_state = torch.tensor([center_x, center_y])
print(f"Conditioning action trajectory on object center: {observation_state}")このワークフローを合理化するために、開発者はUltralytics Platformを使用して、カスタマイズされたデータセット向けの高速auto-annotation toolsを活用できます。このエンドツーエンドのサポートにより、生のカメラフィードから実用的なロボット知能へのmodel deploymentが加速されます。






