YOLO Vision 2026:
Ultralytics用語集に戻る

Process Reward Model (PRM)

Process Reward Models(PRM)がAIの推論をどのように向上させるかを探求します。RLHFにおけるステップレベルのフィードバックが、LLMとUltralytics YOLO26にとってどのように論理的で安全な経路を確保するかを学びましょう。

複雑な artificial intelligence モデルの評価には、最終的な答えが正しいかどうかを確認するだけでは不十分です。高度に特化した reinforcement learning 技術により、AIがタスクの実行中に取る各中間ステップに数値スコアが割り当てられ、dense, step-level feedback が提供されます。この粒度の細かいアプローチにより、モデルが正しい目的地に到達するだけでなく、そこにたどり着くまでに論理的で安全かつ検証可能なパスをたどることが保証されます。

プロセス報酬モデルと結果報酬モデルの比較#

Reward Modeling のより広い文脈において、プロセスベースのスーパービジョンとアウトカムベースのスーパービジョンを区別することが重要です。従来のアウトカム報酬モデル(ORM)は、生成の最後に単一のスパースな報酬を提供します。ORMはトレーニングが容易である一方、複雑なタスクにおいて大きな欠点があります。つまり、欠陥のある論理や hallucinations を通じて正しい答えにたどり着いたモデルに、誤って報酬を与えてしまう可能性があるのです。

プロセス報酬モデル(PRM)は、推論の軌跡全体を評価することでこの問題を解決します。Let's Verify Step by Step などの論文における基礎的な OpenAI research によって普及したように、PRMは各思考やアクションに stepwise supervision を適用します。これは高度な Reinforcement Learning from Human Feedback (RLHF) パイプラインの重要なコンポーネントであり、Proximal Policy Optimization (PPO) などのアルゴリズムを使用してポリシーの最適化を積極的にガイドします。

実社会での応用#

PRMは、Large Language Models (LLMs) や自律システムが高リスクの環境で動作する方法を変革しています。

  • Mathematical Reasoning: 方程式を1行ずつ評価することで、PRMはモデルが Best-of-N (BoN) samplingMonte Carlo Tree Search (MCTS) などのアルゴリズムを使用して複数のソリューションパスを探索し、最も論理的に妥当なシーケンスを選択できるようにします。
  • Code Generation: ソフトウェアを生成する際、最終的なスクリプトが実行されるかどうかを確認するだけでは不十分です。PRMはプロセスのスーパービジョンを提供し、個々の関数やロジックブロックをスコア化して、コードが効率的で安全かつ保守可能であることを保証します。
  • Operations Research and Visual Agents: 2025年および2026年の最近の進歩により、PRMはテキストを超えて拡張されました。たとえば、オペレーションズリサーチでは現在、複雑なスケジュール作成アルゴリズムを検証するためにPRMが利用されています。同様に、Ultralytics YOLO26 のような堅牢な computer vision エンジンを備えた視覚的な AI agents は、単に目的地に到達したことに対する報酬だけでなく、物理環境を移動するためのステップバイステップの報酬を受け取ります。

ステップレベルのフィードバックの実装#

PRMのトレーニングには、人間またはより強力なAIモデルによって各サブステップが評価される大規模なデータセットの管理が必要です。こうした集中的な data annotation ワークフローの管理は、プロジェクトの整理とデプロイを合理化する Ultralytics Platform のようなクラウドベースのツールを使用することで簡素化されます。

推論または model optimization の際、PRMはステップの連鎖に基づいて累積損失または報酬を計算します。torch を使用した以下の概念的な Python スニペットは、中間ステップが失敗した場合にステップレベルの報酬がどのようにペナルティを受けるかを示しており、これはシーケンススコアリングに関する PyTorch documentation に見られる一般的なアプローチです。

import torch

# Simulate reward scores from a PRM for 3 consecutive reasoning steps
# Scores represent the probability of correctness for each step (0.0 to 1.0)
step_rewards = torch.tensor([0.95, 0.80, 0.15], requires_grad=True)

# The PRM aggregates the scores, heavily penalizing the poor 3rd step
# Negative log-likelihood is commonly used to optimize the trajectory
prm_loss = -torch.log(step_rewards).mean()

print(f"Calculated PRM Loss: {prm_loss.item():.4f}")
# During RLHF, this loss would guide hyperparameter tuning and model updates

すべてのの中間ステップが期待される動作と一致していることを確認することで、開発者は信頼性の高いシステムをデプロイできます。プロセスレベルのスーパービジョンと継続的な hyperparameter tuning を組み合わせることで、次世代モデルは問題を安全かつ効果的に真に推論できるようになります。

Explore solutions

Real-time AI that works with your team

ロボティクスにおけるコンピュータビジョン

Ultralytics YOLOモデルで、よりスマートなマシンを実現しましょう。ロボティクスにおけるビジョンAIは、自律航行、認識、物体追跡、リアルタイム制御を推進します。
詳細はこちら
Real-time AI that works with your team

物流におけるコンピュータビジョン

Ultralytics YOLOモデルで物流を効率化しましょう。ビジョンAIにより、荷物の検査、仕分け、車両追跡、リアルタイムの倉庫安全モニタリングが可能になります。
詳細はこちら
Real-time AI that works with your team

小売におけるコンピュータビジョン

Ultralytics YOLOモデルで小売を再定義しましょう。ビジョンAIは、在庫追跡、棚のモニタリング、キュー管理、そしてより賢明な顧客インサイトを促進します。
詳細はこちら
Real-time AI that works with your team

ヘルスケアにおけるコンピュータビジョン

Ultralytics YOLOモデルを使用してヘルスケアソリューションを構築しましょう。ヘルスケア分野におけるビジョンAIは、より高速な医療画像診断、よりスマートな診断、患者モニタリングを推進します。
詳細はこちら
Real-time AI that works with your team

製造におけるコンピュータビジョン

Ultralytics YOLOモデルで製造を最適化しましょう。ビジョンAIは、品質管理、欠陥検出、PPEコンプライアンス、組立ラインの自動化を促進します。
詳細はこちら
Real-time AI that works with your operation

自動車におけるコンピュータビジョン

Ultralytics YOLOモデルを使用して、自動車分野にコンピュータビジョンを適用しましょう。ビジョンAIは、道路の安全性、運転支援、車両の自動化を向上させ、よりスマートな道路を実現します。
詳細はこちら
Real-time AI tailored to your operation

農業におけるコンピュータビジョン

Ultralytics YOLOモデルを使用して、スマート農業にビジョンAIを導入しましょう。作物モニタリング、家畜のトラッキング、精密農業を強化し、より高くスマートな収穫を実現します。
詳細はこちら
Real-time AI that works with your team

ロボティクスにおけるコンピュータビジョン

Ultralytics YOLOモデルで、よりスマートなマシンを実現しましょう。ロボティクスにおけるビジョンAIは、自律航行、認識、物体追跡、リアルタイム制御を推進します。
詳細はこちら
Real-time AI that works with your team

物流におけるコンピュータビジョン

Ultralytics YOLOモデルで物流を効率化しましょう。ビジョンAIにより、荷物の検査、仕分け、車両追跡、リアルタイムの倉庫安全モニタリングが可能になります。
詳細はこちら
Real-time AI that works with your team

小売におけるコンピュータビジョン

Ultralytics YOLOモデルで小売を再定義しましょう。ビジョンAIは、在庫追跡、棚のモニタリング、キュー管理、そしてより賢明な顧客インサイトを促進します。
詳細はこちら
Real-time AI that works with your team

ヘルスケアにおけるコンピュータビジョン

Ultralytics YOLOモデルを使用してヘルスケアソリューションを構築しましょう。ヘルスケア分野におけるビジョンAIは、より高速な医療画像診断、よりスマートな診断、患者モニタリングを推進します。
詳細はこちら
Real-time AI that works with your team

製造におけるコンピュータビジョン

Ultralytics YOLOモデルで製造を最適化しましょう。ビジョンAIは、品質管理、欠陥検出、PPEコンプライアンス、組立ラインの自動化を促進します。
詳細はこちら
Real-time AI that works with your operation

自動車におけるコンピュータビジョン

Ultralytics YOLOモデルを使用して、自動車分野にコンピュータビジョンを適用しましょう。ビジョンAIは、道路の安全性、運転支援、車両の自動化を向上させ、よりスマートな道路を実現します。
詳細はこちら
Real-time AI tailored to your operation

農業におけるコンピュータビジョン

Ultralytics YOLOモデルを使用して、スマート農業にビジョンAIを導入しましょう。作物モニタリング、家畜のトラッキング、精密農業を強化し、より高くスマートな収穫を実現します。
詳細はこちら
Real-time AI that works with your team

ロボティクスにおけるコンピュータビジョン

Ultralytics YOLOモデルで、よりスマートなマシンを実現しましょう。ロボティクスにおけるビジョンAIは、自律航行、認識、物体追跡、リアルタイム制御を推進します。
詳細はこちら
Real-time AI that works with your team

物流におけるコンピュータビジョン

Ultralytics YOLOモデルで物流を効率化しましょう。ビジョンAIにより、荷物の検査、仕分け、車両追跡、リアルタイムの倉庫安全モニタリングが可能になります。
詳細はこちら
Real-time AI that works with your team

小売におけるコンピュータビジョン

Ultralytics YOLOモデルで小売を再定義しましょう。ビジョンAIは、在庫追跡、棚のモニタリング、キュー管理、そしてより賢明な顧客インサイトを促進します。
詳細はこちら
Real-time AI that works with your team

ヘルスケアにおけるコンピュータビジョン

Ultralytics YOLOモデルを使用してヘルスケアソリューションを構築しましょう。ヘルスケア分野におけるビジョンAIは、より高速な医療画像診断、よりスマートな診断、患者モニタリングを推進します。
詳細はこちら
Real-time AI that works with your team

製造におけるコンピュータビジョン

Ultralytics YOLOモデルで製造を最適化しましょう。ビジョンAIは、品質管理、欠陥検出、PPEコンプライアンス、組立ラインの自動化を促進します。
詳細はこちら
Real-time AI that works with your operation

自動車におけるコンピュータビジョン

Ultralytics YOLOモデルを使用して、自動車分野にコンピュータビジョンを適用しましょう。ビジョンAIは、道路の安全性、運転支援、車両の自動化を向上させ、よりスマートな道路を実現します。
詳細はこちら
Real-time AI tailored to your operation

農業におけるコンピュータビジョン

Ultralytics YOLOモデルを使用して、スマート農業にビジョンAIを導入しましょう。作物モニタリング、家畜のトラッキング、精密農業を強化し、より高くスマートな収穫を実現します。
詳細はこちら

AIの未来を共に築き上げましょう!

機械学習の未来とともに旅を始めましょう