Deep Reinforcement Learning
ディープ強化学習(DRL)と、AIによる意思決定とディープラーニングを組み合わせる仕組みを解説します。Ultralytics YOLO26を知覚レイヤーとして活用する方法を学びます。
深層強化学習(DRL)は、強化学習の意思決定能力と、深層学習(DL)の知覚能力を組み合わせた、人工知能(AI)の高度なサブセットです。従来の強化学習は、状況と行動を対応付けるために表形式の手法に依存していますが、環境が複雑または視覚的になると、これらの手法では対応が難しくなります。DRLは、ニューラルネットワークを使用して、動画フレームやセンサーの読み取り値などの高次元入力データを解釈することでこの課題を克服し、明示的な人間の指示なしに、生の経験から効果的な戦略を直接学習できるようにします。
DRLの中核メカニズム#
DRLシステムでは、AIエージェントが離散的な時間ステップで環境と相互作用します。各ステップで、エージェントは現在の「状態」を観測し、方策に基づいて行動を選択し、その行動の成功または失敗を示す報酬信号を受け取ります。主な目標は、時間の経過に伴う累積報酬を最大化することです。
「深層」という要素は、方策(行動の戦略)または価値関数(将来の報酬の推定値)を近似するために、深層ニューラルネットワークを使用することを指します。これにより、エージェントは非構造化データを処理し、コンピュータービジョン(CV)を利用して、人間と同じように環境を「見る」ことができます。この機能は、こうした複雑なネットワークのトレーニングを容易にするPyTorchやTensorFlowなどのフレームワークによって実現されています。
実世界での利用例#
DRLは理論研究の段階を越え、さまざまな業界で実用的かつ大きな影響をもたらすアプリケーションに利用されています。
- 高度なロボティクス: ロボティクスにおけるAIの分野では、DRLによって、ハードコードが難しい複雑な運動スキルを機械が習得できるようになります。ロボットは、NVIDIA Isaac Simなどの物理エンジン内で動きを洗練させることで、不規則な形状の物体をつかんだり、起伏のある地形を移動したりする方法を学習できます。多くの場合、方策を物理ハードウェアにデプロイする前に、合成データを使ってトレーニングします。
- 自動運転: 自動運転車は、予測困難な交通状況でリアルタイムに意思決定を行うためにDRLを活用します。物体検出モデルが歩行者や標識を識別する一方で、DRLアルゴリズムはその情報を使用して、車線変更、交差点の通過、速度制御のための安全な運転方策を決定し、安全性に必要な推論レイテンシを効果的に管理します。
状態オブザーバーとしてのビジョン#
多くのDRLアプリケーションでは、「状態」は視覚的なものです。高速モデルはエージェントの目として機能し、生の画像を、方策ネットワークが利用できる構造化データに変換します。次の例では、YOLO26モデルがエージェントの知覚レイヤーとして機能し、環境から観測結果(例: 障害物の数)を抽出する方法を示します。
from ultralytics import YOLO
# Load YOLO26n to serve as the perception layer for a DRL agent
model = YOLO("yolo26n.pt")
# Simulate an observation from the environment (e.g., a robot's camera feed)
observation_frame = "https://ultralytics.com/images/bus.jpg"
# Perform inference to extract the state (detected objects)
results = model(observation_frame)
# The detection count serves as a simplified state feature for the agent's policy
print(f"State Observation: {len(results[0].boxes)} objects detected.")DRLと関連概念の違い#
AIの領域における独自の位置付けを理解するには、深層強化学習と類似した用語を区別すると役立ちます。
- 強化学習(RL): 標準的なRLは基礎となる概念ですが、通常はルックアップテーブル(Qテーブルなど)に依存しており、状態空間が大きくなると実用的ではなくなります。DRLは、深層学習を使用して関数を近似することでこの問題を解決し、画像のような複雑な入力を処理できるようにします。
- 人間のフィードバックによる強化学習(RLHF): DRLは通常、数学的に定義された報酬関数(例: ゲーム内のポイント)を最適化しますが、RLHFは主観的な人間の好みを使用してモデル、特に大規模言語モデル(LLMs)を改良し、AIの行動を人間の価値観に適合させます。この技術は、OpenAIなどの研究グループによって広く知られるようになりました。
- 教師なし学習: 教師なし手法は、明示的なフィードバックなしにデータ内の隠れたパターンを探します。これに対して、DRLは目標指向であり、報酬信号によって駆動され、エージェントを特定の目的に向けて積極的に導きます。この点は、Sutton and Bartoによる基礎的な文献でも説明されています。
DRLシステムの知覚レイヤーに必要なデータセットを管理したい開発者は、アノテーションとクラウドトレーニングのワークフローを簡素化するUltralytics Platformを利用できます。さらに、研究者は確立されたベースラインに対してDRLアルゴリズムをベンチマークするために、Gymnasiumなどの標準化された環境をよく使用します。









