YOLO Vision 2026:
Ultralytics用語集に戻る

Deep Reinforcement Learning

ディープ強化学習 (DRL) を探索し、AIの意思決定とディープラーニングをどのように組み合わせるかを学びましょう。Ultralytics YOLO26を知覚レイヤーとして使用する方法を解説します。

ディープ強化学習(DRL)は、人工知能(AI)の高度なサブセットであり、強化学習の意思決定能力とディープラーニング(DL)の知覚能力を組み合わせたものです。従来の強化学習は状況をアクションにマッピングするために表形式の手法に依存していましたが、環境が複雑であるか視覚的な場合、これらの手法は困難に直面します。DRLは、ビデオフレームやセンサーの読み取り値などの高次元の入力データを解釈するためにニューラルネットワークを使用することでこれを克服し、機械が明示的な人間の指導なしに生の経験から直接効果的な戦略を学習できるようにします。

DRLの核心的なメカニズム#

DRLシステムでは、AIエージェントが離散的なタイムステップで環境と相互作用します。各ステップで、エージェントは現在の「状態」を観察し、ポリシーに基づいてアクションを選択し、そのアクションの成功または失敗を示す報酬シグナルを受け取ります。主な目標は、時間経過に伴う累積報酬を最大化することです。

「ディープ」というコンポーネントは、ポリシー(行動戦略)またはバリュー関数(推定される将来の報酬)を近似するためにディープニューラルネットワークを使用することを指します。これにより、エージェントは非構造化データを処理し、コンピュータビジョン(CV)を利用して人間と同じように環境を「見る」ことができます。この機能は、PyTorchTensorFlowなどのフレームワークによって駆動され、これらの複雑なネットワークのトレーニングを容易にします。

実社会での応用#

DRLは理論研究の枠を超え、様々な業界で大きな影響力を持つ実用的なアプリケーションへと進化しています。

  • 高度なロボティクス: ロボティクスにおけるAIの分野において、DRLは機械がハードコーディングが困難な複雑な運動スキルを習得できるようにします。ロボットは、NVIDIA Isaac Simのような物理エンジン内で動きを洗練させることで、不規則な物体を掴んだり、起伏の多い地形を移動したりすることを学習できます。これには通常、ポリシーを物理ハードウェアにデプロイする前に合成データでのトレーニングが含まれます。
  • 自動運転: 自動運転車はDRLを活用して、予測不可能な交通シナリオでリアルタイムの意思決定を行います。オブジェクト検出モデルが歩行者や標識を識別する一方で、DRLアルゴリズムはその情報を使用して車線合流、交差点のナビゲーション、速度制御のための安全な運転ポリシーを決定し、安全に求められる推論レイテンシを効果的に管理します。

状態観察者としてのビジョン#

多くのDRLアプリケーションにおいて、「状態」は視覚的なものです。高速モデルがエージェントの目として機能し、生の画像をポリシーネットワークが処理できる構造化データに変換します。次の例は、YOLO26モデルがエージェントの知覚レイヤーとして機能し、環境から観察結果(障害物の数など)を抽出する方法を示しています。

from ultralytics import YOLO

# Load YOLO26n to serve as the perception layer for a DRL agent
model = YOLO("yolo26n.pt")

# Simulate an observation from the environment (e.g., a robot's camera feed)
observation_frame = "https://ultralytics.com/images/bus.jpg"

# Perform inference to extract the state (detected objects)
results = model(observation_frame)

# The detection count serves as a simplified state feature for the agent's policy
print(f"State Observation: {len(results[0].boxes)} objects detected.")

DRLと関連概念の区別#

AI環境におけるDRLの独自の立ち位置を理解するため、類似の用語と区別することが役立ちます。

  • 強化学習(RL) 標準的なRLは基礎となる概念ですが、通常は大規模な状態空間に対して実用的でなくなるルックアップテーブル(Qテーブルなど)に依存しています。DRLは、ディープラーニングを使用して関数を近似することでこれを解決し、画像などの複雑な入力を処理できるようにします。
  • 人間のフィードバックによる強化学習(RLHF) DRLは通常、数学的に定義された報酬関数(ゲーム内のポイントなど)を最適化しますが、RLHFは主観的な人間の好みを使用してモデル(特に大規模言語モデル(LLMs))を洗練させ、AIの動作を人間の価値観に合わせます。これはOpenAIなどの研究グループによって普及した手法です。
  • 教師なし学習 教師なし手法は、明示的なフィードバックなしでデータ内の隠れたパターンを探します。対照的に、DRLは目標指向型であり、Sutton and Bartoによる基礎的なテキストで議論されているように、エージェントを特定の目的に向けて積極的に導く報酬シグナルによって駆動されます。

DRLシステムの知覚レイヤーに必要なデータセットの管理を目指す開発者は、Ultralytics Platformを利用できます。これにより、アノテーションとクラウドトレーニングのワークフローが簡素化されます。さらに、研究者は、確立されたベースラインに対してDRLアルゴリズムをベンチマークするために、Gymnasiumなどの標準化された環境をよく使用します。

Explore solutions

Real-time AI that works with your team

ロボティクスにおけるAI

Ultralytics YOLOモデルで、よりスマートなマシンを実現しましょう。ロボティクスにおけるビジョンAIは、自律航行、認識、物体追跡、リアルタイム制御を推進します。
詳細はこちら
Real-time AI that works with your team

物流におけるAI

Ultralytics YOLOモデルで物流を効率化しましょう。ビジョンAIにより、荷物の検査、仕分け、車両追跡、リアルタイムの倉庫安全モニタリングが可能になります。
詳細はこちら
Real-time AI that works with your team

小売業界におけるAI

Ultralytics YOLOモデルで小売を再定義しましょう。ビジョンAIは、在庫追跡、棚のモニタリング、キュー管理、そしてより賢明な顧客インサイトを促進します。
詳細はこちら
Real-time AI that works with your team

ヘルスケアにおけるAI

Ultralytics YOLOモデルを使用してヘルスケアソリューションを構築しましょう。ヘルスケア分野におけるビジョンAIは、より高速な医療画像診断、よりスマートな診断、患者モニタリングを推進します。
詳細はこちら
Real-time AI that works with your team

製造におけるAI

Ultralytics YOLOモデルで製造を最適化しましょう。ビジョンAIは、品質管理、欠陥検出、PPEコンプライアンス、組立ラインの自動化を促進します。
詳細はこちら
Real-time AI that works with your operation

自動車におけるAI

Ultralytics YOLOモデルを使用して、自動車分野にコンピュータビジョンを適用しましょう。ビジョンAIは、道路の安全性、運転支援、車両の自動化を向上させ、よりスマートな道路を実現します。
詳細はこちら
Real-time AI tailored to your operation

農業におけるAI

Ultralytics YOLOモデルを使用して、スマート農業にビジョンAIを導入しましょう。作物モニタリング、家畜のトラッキング、精密農業を強化し、より高くスマートな収穫を実現します。
詳細はこちら
Real-time AI that works with your team

ロボティクスにおけるAI

Ultralytics YOLOモデルで、よりスマートなマシンを実現しましょう。ロボティクスにおけるビジョンAIは、自律航行、認識、物体追跡、リアルタイム制御を推進します。
詳細はこちら
Real-time AI that works with your team

物流におけるAI

Ultralytics YOLOモデルで物流を効率化しましょう。ビジョンAIにより、荷物の検査、仕分け、車両追跡、リアルタイムの倉庫安全モニタリングが可能になります。
詳細はこちら
Real-time AI that works with your team

小売業界におけるAI

Ultralytics YOLOモデルで小売を再定義しましょう。ビジョンAIは、在庫追跡、棚のモニタリング、キュー管理、そしてより賢明な顧客インサイトを促進します。
詳細はこちら
Real-time AI that works with your team

ヘルスケアにおけるAI

Ultralytics YOLOモデルを使用してヘルスケアソリューションを構築しましょう。ヘルスケア分野におけるビジョンAIは、より高速な医療画像診断、よりスマートな診断、患者モニタリングを推進します。
詳細はこちら
Real-time AI that works with your team

製造におけるAI

Ultralytics YOLOモデルで製造を最適化しましょう。ビジョンAIは、品質管理、欠陥検出、PPEコンプライアンス、組立ラインの自動化を促進します。
詳細はこちら
Real-time AI that works with your operation

自動車におけるAI

Ultralytics YOLOモデルを使用して、自動車分野にコンピュータビジョンを適用しましょう。ビジョンAIは、道路の安全性、運転支援、車両の自動化を向上させ、よりスマートな道路を実現します。
詳細はこちら
Real-time AI tailored to your operation

農業におけるAI

Ultralytics YOLOモデルを使用して、スマート農業にビジョンAIを導入しましょう。作物モニタリング、家畜のトラッキング、精密農業を強化し、より高くスマートな収穫を実現します。
詳細はこちら
Real-time AI that works with your team

ロボティクスにおけるAI

Ultralytics YOLOモデルで、よりスマートなマシンを実現しましょう。ロボティクスにおけるビジョンAIは、自律航行、認識、物体追跡、リアルタイム制御を推進します。
詳細はこちら
Real-time AI that works with your team

物流におけるAI

Ultralytics YOLOモデルで物流を効率化しましょう。ビジョンAIにより、荷物の検査、仕分け、車両追跡、リアルタイムの倉庫安全モニタリングが可能になります。
詳細はこちら
Real-time AI that works with your team

小売業界におけるAI

Ultralytics YOLOモデルで小売を再定義しましょう。ビジョンAIは、在庫追跡、棚のモニタリング、キュー管理、そしてより賢明な顧客インサイトを促進します。
詳細はこちら
Real-time AI that works with your team

ヘルスケアにおけるAI

Ultralytics YOLOモデルを使用してヘルスケアソリューションを構築しましょう。ヘルスケア分野におけるビジョンAIは、より高速な医療画像診断、よりスマートな診断、患者モニタリングを推進します。
詳細はこちら
Real-time AI that works with your team

製造におけるAI

Ultralytics YOLOモデルで製造を最適化しましょう。ビジョンAIは、品質管理、欠陥検出、PPEコンプライアンス、組立ラインの自動化を促進します。
詳細はこちら
Real-time AI that works with your operation

自動車におけるAI

Ultralytics YOLOモデルを使用して、自動車分野にコンピュータビジョンを適用しましょう。ビジョンAIは、道路の安全性、運転支援、車両の自動化を向上させ、よりスマートな道路を実現します。
詳細はこちら
Real-time AI tailored to your operation

農業におけるAI

Ultralytics YOLOモデルを使用して、スマート農業にビジョンAIを導入しましょう。作物モニタリング、家畜のトラッキング、精密農業を強化し、より高くスマートな収穫を実現します。
詳細はこちら

AIの未来を共に築き上げましょう!

機械学習の未来とともに旅を始めましょう