Reinforcement Learning with Verifiable Rewards (RLVR)
Verifiable Rewards (RLVR) による強化学習について学びましょう。確定的なフィードバックと Ultralytics YOLO26 を使用して高度な AI をトレーニングする方法を解説します。
人工知能 (AI)モデルの推論および問題解決能力を向上させるために使用される高度なトレーニングパラダイムが、検証可能な報酬による強化学習(RLVR)です。人間のアノテーションによる選好データに依存する従来のトレーニング手法とは異なり、RLVRは決定論的なルールベースシステムを利用してモデルの出力を評価します。生成されたコードがコンパイルされるか、数学の方程式が正しく解かれたかといった、客観的なバイナリ報酬を提供することで、RLVRはモデルが制限のない探索を通じて学習できるようにします。この客観的なフィードバックループは、高度な推論モデルにおける最近のブレイクスルーの主要な推進力であり、継続的な人間の介入なしに、最適で複雑なロジックパスを発見することを可能にしています。
RLVR の基本原則#
標準的な機械学習 (ML)環境では、AIエージェントは報酬シグナルを最大化することで学習します。RLVRでは、この報酬シグナルは主観的な人間の判断ではなく、厳密なプログラミングシステムによって生成されます。学習プロセスは、いくつかの基本的なステップに依存しています。
- 探索戦略: モデルは、複雑なタスクを分解するためにチェーンオブソートプロンプティングを頻繁に利用しながら、与えられたプロンプトに対して複数の潜在的な解決策や推論パスを生成します。
- 決定論的検証: Pythonコンパイラ、電卓、またはコンピュータビジョン (CV)知覚システムなどの外部ツールが、客観的な成功基準に対して最終出力をチェックします。
- ポリシー最適化: 出力が検証可能に正しい場合、モデルは正の報酬を受け取ります。その後、モデルのポリシーは、Group Relative Policy Optimization (GRPO)やProximal Policy Optimization (PPO)などの最適化アルゴリズムを使用して更新され、成功した推論パスが優遇されます。
このアプローチは、トレーニング時のモデルの推論レイテンシ効率を大幅に向上させ、 emergent(創発的)な推論能力を促進します。この手法は、DeepSeek-R1のような高度な能力を持つモデルのトレーニングに最近使用されました。
RLVR と RLHF および PRM の比較#
AI エコシステムにおける他のアライメントおよび学習パラダイムと RLVR を区別することが重要です。
- 人間フィードバックからの強化学習 (RLHF) との比較: RLHFは、主観的な人間の選好に基づいてトレーニングされた学習済みの報酬モデリングシステムに依存しています。RLVRは、客観的でプログラム的な真実に厳密に依存することにより、ヒューマン・イン・ザ・ループのボトルネックを排除し、明確な正解または不正解があるタスクに対して非常にスケーラブルにします。
- プロセス報酬モデル (PRM) との比較: PRMはモデルの推論軌道全体を通じて粒度の細かい段階的なフィードバックを提供しますが、RLVRは通常、プロセスの終了時における検証可能な成果に焦点を当てています。しかし、最近の2025年の研究によると、RLVRで最終的な検証可能な報酬を最適化することは、中間の中間的な推論ステップの正確さも暗黙的に促すことが示されています。
実社会での応用#
RLVR は、決定論的なドメイン全体において、複雑な AI システムの学習方法を変化させています。
- 数学的推論: OpenAI oシリーズのような大規模推論モデルは、RLVRを活用して複雑な数学の定理を解決します。検証器は、モデル導出の答えが正しいかどうかを決定的に証明するエンジンとして機能し、ベンチマークデータセットのパフォーマンスを大幅に向上させます。
- ソフトウェアエンジニアリングとコード生成: AIコーディングアシスタントは、RLVRを使用してコードの記述、デバッグ、および最適化を行います。検証可能な報酬は、生成されたコードが正常にコンパイルされ、一連の自動単体テストに合格したときに達成されます。
- 自律型ビジョンエージェント: 物理環境において、自律エージェントはターゲットの目的地に到達するか、オブジェクトを正常に操作したときに検証可能な報酬を受け取ります。ビジョンモデルは、これらの空間において検証可能な条件チェッカーとして機能します。
ビジョン AI における検証可能な報酬の実装#
物理環境および視覚環境において、Ultralytics YOLO26のような知覚モデルは、RLVRループ内のプログラム的な検証器として機能します。たとえば、AIエージェントの目標がオブジェクトを特定のゾーンに移動することである場合、YOLOモデルはそのゾーン内でのオブジェクトの存在を検出することで成功を検証できます。
次のPythonスニペットは、ultralyticsパッケージを使用した概念的なプログラム的検証器を示しています。
from ultralytics import YOLO
# Load a YOLO26 model to act as the programmatic verifier
verifier_model = YOLO("yolo26n.pt")
def get_verifiable_reward(image_path: str, target_class: int) -> float:
"""Returns a verifiable reward of 1.0 if the target object is detected."""
results = verifier_model(image_path)
# Check if the desired class (e.g., 0 for 'person') exists in the detections
detected_classes = results[0].boxes.cls.tolist()
if target_class in detected_classes:
return 1.0 # Verifiable success
return 0.0 # Verifiable failure
# Simulate an agent's environment state check
reward = get_verifiable_reward("https://ultralytics.com/images/bus.jpg", target_class=0)
print(f"RLVR Reward Signal: {reward}")これらの知覚検証器をデプロイするためにUltralytics Platformのようなクラウドプラットフォームを活用することで、開発者は次世代の自律エージェントや推論エージェントをトレーニングする、堅牢でスケーラブルなRLVRパイプラインを構築できます。






