Markov Decision Process (MDP)
マルコフ決定過程(MDP)の基礎を解説します。MDPが強化学習を支える仕組みと、Ultralytics YOLO26がリアルタイムの状態データを提供する方法を学びます。
マルコフ意思決定過程(MDP)は、結果の一部がランダムであり、一部が意思決定者の制御下にある状況での意思決定をモデル化するために使用される数学的フレームワークです。これは、強化学習(RL)の基本的な設計図であり、AIエージェントが特定の目標を達成するために環境と相互作用する構造化された方法を提供します。静的なラベル付きデータセットに依存する標準的な教師あり学習とは異なり、MDPは、現在のアクションが将来の可能性に影響を与える逐次的な意思決定に焦点を当てています。
MDPの主要コンポーネント#
MDPの動作を理解するには、エージェントと環境の相互作用をサイクルとして可視化すると役立ちます。このサイクルは、次の5つの主要コンポーネントによって定義されます。
- 状態: 環境の現在の状況または構成です。自動運転車では、状態に車の速度、位置、コンピュータビジョン(CV)センサーによって検出された周辺の障害物などが含まれる場合があります。
- アクション: エージェントが利用できるすべての可能な動作または選択肢の集合です。これはアクション空間と呼ばれることが多く、離散的(例:左に移動、右に移動)または連続的(例:ステアリング角度の調整)になります。
- 遷移確率: 特定のアクションを実行した後に、ある状態から別の状態へ移行する可能性を定義します。現実世界の不確実性とダイナミクスを考慮するため、MDPと決定論的なシステムを区別する要素となります。
- 報酬: 各アクションの後に受け取る数値信号です。報酬関数は、エージェントの行動を導くため重要です。正の報酬は望ましいアクションを促し、負の報酬(ペナルティ)はミスを抑制します。
- 割引係数: 即時の報酬と比較した将来の報酬の重要度を決定する値です。エージェントが短期的な満足よりも長期的な計画を優先するのに役立ち、戦略的最適化の中心となる概念です。
実世界での利用例#
MDPは多くの先進技術の意思決定エンジンとして機能し、システムが複雑で動的な環境をナビゲートできるようにします。
- ロボット制御: ロボティクスにおけるAIでは、MDPによって機械が複雑な運動スキルを学習できます。例えば、ロボットアームはMDPを使用して、衝突を回避しながら物体を把持するための最適な経路を決定します。状態は、3D物体検出から得られる関節角度と物体の位置であり、報酬は把持の成功速度に基づきます。
- 在庫管理: 小売業者は在庫最適化にMDPを使用します。ここでは、状態が現在の在庫水準を表し、アクションは再発注の判断を示し、報酬は利益率から保管コストと欠品コストを差し引いて算出されます。
- 医療における治療: 個別化医療では、MDPが動的な治療計画の設計に役立ちます。患者の健康指標を状態として、薬剤をアクションとしてモデル化することで、医師は予測モデリングを使用して患者の長期的な健康状態を最大化できます。
強化学習との関係#
MDPと強化学習は密接に関連していますが、両者を区別することが重要です。MDPは形式的な問題設定、つまり環境の数学的モデルです。強化学習は、内部のダイナミクス(遷移確率)が完全にはわかっていない場合に、その問題を解決するために使用される手法です。Q学習などのRLアルゴリズムはMDPと相互作用し、試行錯誤を通じて最適な方策を学習します。
MDPにおける視覚的観測#
最新のAIアプリケーションでは、MDPの「状態」は視覚データから得られることがよくあります。高速な知覚モデルはシステムの目として機能し、未加工のカメラ映像をMDPが処理できる構造化データに変換します。例えば、Ultralytics YOLO26は、リアルタイムの物体座標を提供でき、それらが意思決定エージェントの状態入力として機能します。
次の例では、Pythonを使用して画像から状態表現(バウンディングボックス)を抽出する方法を示します。抽出した状態表現は、その後MDPの方策に入力できます。
from ultralytics import YOLO
# Load the YOLO26 model to serve as the perception layer
model = YOLO("yolo26n.pt")
# Perform inference to observe the current 'state' of the environment
results = model("https://ultralytics.com/images/bus.jpg")
# Extract bounding box coordinates to form the state vector
# This structured data tells the agent where objects are located
for box in results[0].boxes:
print(f"State Object: Class {int(box.cls)} at {box.xywh.tolist()}")堅牢なビジョンモデルをMDPフレームワークと統合することで、開発者は世界を認識するだけでなく、その中でインテリジェントかつ適応的な意思決定を行うシステムを構築できます。この相乗効果は、自律システムとスマートマニュファクチャリングの発展に不可欠です。









