Ultralytics YOLO27:
Ultralytics用語集に戻る

Reinforcement Learning from Human Feedback (RLHF)

人間のフィードバックによる強化学習(RLHF)がAIを人間の価値観に適合させる方法を説明します。その中核コンポーネントとUltralytics YOLO26との統合について紹介します。

人間のフィードバックによる強化学習 (RLHF) は、直接的な人間の入力をトレーニングループに組み込むことで、人工知能モデルを改良する高度な機械学習手法です。静的なラベル付きデータセットのみに依存する標準的な教師あり学習とは異なり、RLHFでは、人間の評価者がモデルの出力を順位付けまたは評価する動的なフィードバックメカニズムを導入します。このプロセスにより、AIは、単純な数学的損失関数では定義が難しい「有用性」、「安全性」、「創造性」などの複雑で主観的、または微妙なニュアンスを含む目標を捉えられるようになります。RLHFは、現代の大規模言語モデル (LLMs)や生成AIの開発における基盤となっており、高性能な基盤モデルが人間の価値観やユーザーの意図に効果的に沿うようにします。

RLHFの主要コンポーネント#

RLHFのプロセスは通常、生の予測能力と人間の意図に沿った動作とのギャップを埋めるよう設計された、3段階のパイプラインに従います。

  1. 教師ありファインチューニング (SFT): ワークフローは通常、事前学習済みの基盤モデルから始まります。開発者は、専門家が作成した質問と回答のペアなど、少量で高品質なデモンストレーションデータセットを使用して初期のファインチューニングを実行します。このステップで基本方策を確立し、タスクに期待される一般的な形式とトーンをモデルに学習させます。

  2. 報酬モデルのトレーニング: このフェーズはRLHFの特徴的な要素です。人間のアノテーターは、同じ入力に対してモデルが生成した複数の出力を確認し、最良から最悪まで順位付けします。このデータラベリング作業によって、選好データセットが生成されます。報酬モデルと呼ばれる別のニューラルネットワークをこの比較データでトレーニングし、人間の判断を反映するスカラー値のスコアを予測します。Ultralytics Platformで利用できるツールにより、このようなアノテーションワークフローの管理を効率化できます。

  3. 強化学習の最適化: 最後に、元のモデルが強化学習環境内のAIエージェントとして機能します。報酬モデルを指針として使用し、近接方策最適化 (PPO) などの最適化アルゴリズムでモデルのパラメーターを調整し、期待報酬を最大化します。このステップにより、モデルの方策が学習した人間の選好に沿うようになり、有用で安全な動作を促進するとともに、有害または無意味な出力を抑制します。

実世界での利用例#

RLHFは、高い安全基準と人間とのインタラクションに対する繊細な理解が求められるAIシステムの導入において、極めて重要であることが実証されています。

  • 会話型AIとチャットボット: RLHFの最も代表的な用途は、チャットボットを有用で無害かつ誠実なものに調整することです。偏りがある、事実と異なる、または危険な出力にペナルティを課すことで、RLHFはLLMsのハルシネーションの軽減に役立ち、アルゴリズムバイアスのリスクを低減します。これにより、バーチャルアシスタントは、正当な問い合わせには有用でありながら、有害な指示を拒否できるようになります。
  • ロボティクスと物理制御: RLHFはテキストの領域を超えてロボティクスにおけるAIにも適用されます。複雑な物理タスクに対して完璧な報酬関数を定義することは困難だからです。たとえば、混雑した倉庫内の移動を学習するロボットは、どの軌道が安全で、どの軌道が混乱を引き起こしたかについて、人間の監督者からフィードバックを受けることがあります。このフィードバックにより、単に目標の達成だけに基づく深層強化学習よりも効果的に、ロボットの制御方策を改良できます。

RLHFと標準的な強化学習の比較#

RLHFの具体的な有用性を理解するには、従来の強化学習 (RL)との違いを明確にすることが有用です。

  • 標準的なRL: 従来の設定では、報酬関数は環境によってハードコードされていることが多くあります。たとえば、ビデオゲームでは、環境が明確なシグナル(勝利には+1、敗北には-1)を提供します。エージェントは、定義されたマルコフ決定過程 (MDP)内で行動を最適化します。
  • RLHF: 創作的な物語の執筆や礼儀正しい運転など、多くの現実世界のシナリオでは、「成功」は主観的です。RLHFは、人間の選好から導出された学習済み報酬モデルでハードコードされた報酬を置き換えることで、この問題を解決します。これにより、「品質」や「適切性」など、明示的にプログラムすることが不可能な抽象的概念を最適化できます。

知覚とフィードバックループの統合#

視覚アプリケーションでは、RLHFで調整されたエージェントは、行動する前に環境の状態を認識するため、コンピュータビジョン (CV)に依存することがよくあります。YOLO26のような堅牢な検出器は知覚レイヤーとして機能し、ポリシーネットワークがアクションを選択するために使用する構造化された観測結果(「3メートル先に障害物を検出」など)を提供します。

次のPythonの例では、YOLOモデルが環境の状態を提供する簡略化された概念を示します。完全なRLHFループでは、「報酬」シグナルは、この検出データに基づくエージェントの意思決定に関する人間のフィードバックでトレーニングされたモデルから得られます。

from ultralytics import YOLO

# Load YOLO26n to act as the perception layer for an intelligent agent
model = YOLO("yolo26n.pt")

# The agent observes the environment (an image) to determine its state
results = model("https://ultralytics.com/images/bus.jpg")

# In an RL context, the 'state' is derived from detections
# A reward model (trained via RLHF) would evaluate the action taken based on this state
detected_objects = len(results[0].boxes)

print(f"Agent Observation: Detected {detected_objects} objects.")
# Example output: Agent Observation: Detected 4 objects.

高性能な知覚モデルと、人間のフィードバックによって改良された方策を組み合わせることで、開発者はインテリジェントであるだけでなく、AIの安全性の原則にも厳密に沿ったシステムを構築できます。Constitutional AIなど、スケーラブルな監視に関する継続的な研究により、高いモデル性能を維持しながら、大規模な人間によるアノテーションのボトルネックを軽減することを目指して、この分野は発展を続けています。

Explore solutions

航空画像向けコンピュータービジョン

航空画像向けコンピュータービジョン

Ultralytics YOLOを使用して、ドローンや航空画像から農業、水産業、環境モニタリング、保全、地理空間分析向けのリアルタイムなインサイトを生成します。
詳細を見る
航空宇宙におけるコンピュータビジョン

航空宇宙におけるコンピュータビジョン

Ultralytics YOLOモデルを使用して、ビジョンAIを空中モニタリングに導入します。コンピュータビジョンソリューションで、ドローン、航空宇宙ワークフロー、環境保護、および地理空間産業を強力にサポートします。
詳細を見る

Ultralytics YOLOモデルであらゆるサイトを保護します。ビジョンAIは、境界モニタリング、脅威検出、ナンバープレート認識、職場安全をサポートします。
詳細を見る
ロボティクスのコンピュータービジョン

ロボティクスのコンピュータービジョン

Ultralytics YOLOモデルで、よりスマートなマシンを実現します。ロボティクスのVision AIにより、自律ナビゲーション、認識、物体追跡、リアルタイム制御を実現します。
詳細を見る
物流のコンピュータービジョン

物流のコンピュータービジョン

Ultralytics YOLOモデルで物流を効率化します。Vision AIにより、荷物検査、仕分け、車両追跡、倉庫の安全性に関するリアルタイム監視を実現します。
詳細を見る
小売のコンピュータービジョン

小売のコンピュータービジョン

Ultralytics YOLOモデルで小売を再構築します。Vision AIにより、在庫追跡、棚監視、待ち行列管理、より高度な顧客インサイトを実現します。
詳細を見る
ヘルスケア向けコンピュータービジョン

ヘルスケア向けコンピュータービジョン

Ultralytics YOLOモデルでヘルスケアソリューションを構築しましょう。ヘルスケア向けVision AIは、医用画像処理の高速化、より高度な診断、患者モニタリングを実現します。
詳細を見る
製造業向けコンピュータービジョン

製造業向けコンピュータービジョン

Ultralytics YOLOモデルで製造業を最適化しましょう。Vision AIは、品質管理、欠陥検出、PPE遵守、組立ラインの自動化を推進します。
詳細を見る
自動車分野のコンピュータビジョン

自動車分野のコンピュータビジョン

Ultralytics YOLOモデルで自動車分野にコンピュータビジョンを適用します。ビジョンAIにより、道路の安全性、運転支援、車両自動化を向上させ、よりスマートな道路を実現します。
詳細を見る
農業分野のコンピュータビジョン

農業分野のコンピュータビジョン

Ultralytics YOLOモデルでスマート農業にビジョンAIを導入します。作物のモニタリング、家畜の追跡、精密農業を支援し、より高くスマートな収穫量を実現します。
詳細を見る
航空画像向けコンピュータービジョン

航空画像向けコンピュータービジョン

Ultralytics YOLOを使用して、ドローンや航空画像から農業、水産業、環境モニタリング、保全、地理空間分析向けのリアルタイムなインサイトを生成します。
詳細を見る
航空宇宙におけるコンピュータビジョン

航空宇宙におけるコンピュータビジョン

Ultralytics YOLOモデルを使用して、ビジョンAIを空中モニタリングに導入します。コンピュータビジョンソリューションで、ドローン、航空宇宙ワークフロー、環境保護、および地理空間産業を強力にサポートします。
詳細を見る

Ultralytics YOLOモデルであらゆるサイトを保護します。ビジョンAIは、境界モニタリング、脅威検出、ナンバープレート認識、職場安全をサポートします。
詳細を見る
ロボティクスのコンピュータービジョン

ロボティクスのコンピュータービジョン

Ultralytics YOLOモデルで、よりスマートなマシンを実現します。ロボティクスのVision AIにより、自律ナビゲーション、認識、物体追跡、リアルタイム制御を実現します。
詳細を見る
物流のコンピュータービジョン

物流のコンピュータービジョン

Ultralytics YOLOモデルで物流を効率化します。Vision AIにより、荷物検査、仕分け、車両追跡、倉庫の安全性に関するリアルタイム監視を実現します。
詳細を見る
小売のコンピュータービジョン

小売のコンピュータービジョン

Ultralytics YOLOモデルで小売を再構築します。Vision AIにより、在庫追跡、棚監視、待ち行列管理、より高度な顧客インサイトを実現します。
詳細を見る
ヘルスケア向けコンピュータービジョン

ヘルスケア向けコンピュータービジョン

Ultralytics YOLOモデルでヘルスケアソリューションを構築しましょう。ヘルスケア向けVision AIは、医用画像処理の高速化、より高度な診断、患者モニタリングを実現します。
詳細を見る
製造業向けコンピュータービジョン

製造業向けコンピュータービジョン

Ultralytics YOLOモデルで製造業を最適化しましょう。Vision AIは、品質管理、欠陥検出、PPE遵守、組立ラインの自動化を推進します。
詳細を見る
自動車分野のコンピュータビジョン

自動車分野のコンピュータビジョン

Ultralytics YOLOモデルで自動車分野にコンピュータビジョンを適用します。ビジョンAIにより、道路の安全性、運転支援、車両自動化を向上させ、よりスマートな道路を実現します。
詳細を見る
農業分野のコンピュータビジョン

農業分野のコンピュータビジョン

Ultralytics YOLOモデルでスマート農業にビジョンAIを導入します。作物のモニタリング、家畜の追跡、精密農業を支援し、より高くスマートな収穫量を実現します。
詳細を見る
航空画像向けコンピュータービジョン

航空画像向けコンピュータービジョン

Ultralytics YOLOを使用して、ドローンや航空画像から農業、水産業、環境モニタリング、保全、地理空間分析向けのリアルタイムなインサイトを生成します。
詳細を見る
航空宇宙におけるコンピュータビジョン

航空宇宙におけるコンピュータビジョン

Ultralytics YOLOモデルを使用して、ビジョンAIを空中モニタリングに導入します。コンピュータビジョンソリューションで、ドローン、航空宇宙ワークフロー、環境保護、および地理空間産業を強力にサポートします。
詳細を見る

Ultralytics YOLOモデルであらゆるサイトを保護します。ビジョンAIは、境界モニタリング、脅威検出、ナンバープレート認識、職場安全をサポートします。
詳細を見る
ロボティクスのコンピュータービジョン

ロボティクスのコンピュータービジョン

Ultralytics YOLOモデルで、よりスマートなマシンを実現します。ロボティクスのVision AIにより、自律ナビゲーション、認識、物体追跡、リアルタイム制御を実現します。
詳細を見る
物流のコンピュータービジョン

物流のコンピュータービジョン

Ultralytics YOLOモデルで物流を効率化します。Vision AIにより、荷物検査、仕分け、車両追跡、倉庫の安全性に関するリアルタイム監視を実現します。
詳細を見る
小売のコンピュータービジョン

小売のコンピュータービジョン

Ultralytics YOLOモデルで小売を再構築します。Vision AIにより、在庫追跡、棚監視、待ち行列管理、より高度な顧客インサイトを実現します。
詳細を見る
ヘルスケア向けコンピュータービジョン

ヘルスケア向けコンピュータービジョン

Ultralytics YOLOモデルでヘルスケアソリューションを構築しましょう。ヘルスケア向けVision AIは、医用画像処理の高速化、より高度な診断、患者モニタリングを実現します。
詳細を見る
製造業向けコンピュータービジョン

製造業向けコンピュータービジョン

Ultralytics YOLOモデルで製造業を最適化しましょう。Vision AIは、品質管理、欠陥検出、PPE遵守、組立ラインの自動化を推進します。
詳細を見る
自動車分野のコンピュータビジョン

自動車分野のコンピュータビジョン

Ultralytics YOLOモデルで自動車分野にコンピュータビジョンを適用します。ビジョンAIにより、道路の安全性、運転支援、車両自動化を向上させ、よりスマートな道路を実現します。
詳細を見る
農業分野のコンピュータビジョン

農業分野のコンピュータビジョン

Ultralytics YOLOモデルでスマート農業にビジョンAIを導入します。作物のモニタリング、家畜の追跡、精密農業を支援し、より高くスマートな収穫量を実現します。
詳細を見る

AIの未来を一緒に築きましょう!

機械学習の未来への歩みを始めましょう