Group Relative Policy Optimization (GRPO)
グループ相対方策最適化(GRPO)は、回答をグループ内で相対評価することでLLMの推論を強化する、クリティックを必要としないRL手法です。PPOと比較します。
グループ相対ポリシー最適化(GRPO)は、強化学習におけるメモリ効率の高いアルゴリズムであり、大規模言語モデル(LLM)や、より幅広い人工知能(AI)システムの推論能力を高めるために開発されました。2024年のDeepSeekMath論文で初めて紹介されたGRPOは、独立した価値ネットワーク(批評モデル)を不要にすることで、従来の最適化手法を改良しています。その代わり、同じプロンプトから生成された応答のグループに対する報酬を正規化します。グループ内の他の応答との相対評価によって、GRPOは計算オーバーヘッドを大幅に削減し、最新のディープラーニング(DL)アーキテクチャにおける複雑な推論タスクの性能を高めます。
GRPOとPPOの違い#
GRPOは、強化学習による人間のフィードバック(RLHF)でよく使われる標準的な最適化アルゴリズムである近接ポリシー最適化(PPO)と類似していますが、アーキテクチャには大きな違いがあります。PPOでは、特定の状態の価値を推定するため、メインのポリシーネットワークと並行して動作する第2の「批評」モデルが必要です。このため、トレーニング段階で必要となるメモリはほぼ2倍になります。
一方、GRPOはクリティックを必要としないアルゴリズムです。1つのプロンプトに対して複数の出力をサンプリングし、ルールベースの報酬システムや検証器を使って採点することで、GRPOはそのグループ内でスコアを正規化してアドバンテージを計算します。この相対比較がベースラインの役割を果たし、価値ネットワークに必要だった膨大なメモリーを節約するとともに、全体的なモデル学習を高速化します。GRPOの1回の更新は、次の手順で行われます。
GRPOの実世界での応用#
GRPOは、生成AIと自然言語処理における近年の複数のブレークスルーを支えてきました。代表的な応用例を2つ紹介します。
- 数学的な推論モデル: 広く引用されているDeepSeek-R1のリリースとDeepSeekMathでは、GRPOを使ってモデルに長い思考の連鎖による推論と自己検証を促し、OpenAIのo1のようなプロプライエタリモデルに匹敵する性能を実現しました。正しい最終回答や書式に報酬を与えることで、このアルゴリズムは、人間がアノテーションしたデータで大規模なファインチューニングを行わなくても、モデルが高度な問題解決戦略を自律的に発見できるようにしました。
- コード生成とエージェント型ロジック:コードを記述するモデルや、自律型のエージェントワークフローを支えるモデルでは、絶対的な正しさの評価が困難です。GRPOでは、コードのさまざまなバリエーションを実行し、コンパイルの成功やテストケースの合格状況に基づいて相対的にスコアを付けることで、モデルが学習できます。その結果、信頼性の高いAIコーディングアシスタントのデプロイを加速できます。
PyTorchでGRPOの概念を実装する#
GRPOは基本的に、報酬を正規化して応答の相対的なアドバンテージを計算します。次に示す基本的なPyTorchの実装では、標準的なテンソル演算を使った正規化を示します。
def compute_grpo_advantages(rewards):
# 「rewards」はshape (batch_size, group_size)のテンソルです
group_mean = rewards.mean(dim=1, keepdim=True)
group_std = rewards.std(dim=1, keepdim=True)
# グループ内で報酬を正規化し、相対的な優位性を計算します
advantages = (rewards - group_mean) / (group_std + 1e-8)
return advantagesスマートな最適化でAIを前進させる#
GRPOがテキスト生成の効率性を再定義するのと同様に、高度な機械学習(ML)技術は視覚認識を絶えず変革しています。アーキテクチャと損失関数を最適化すると、あらゆる分野でより軽量かつ高速なモデルを構築できます。
最先端のコンピュータービジョンタスクでは、エンドツーエンドの最適化を検討することも同様に重要です。たとえば、Ultralytics YOLO26は、1対1ヘッド(nms=False)を用いたネイティブなエンドツーエンドのNMSフリー推論に対応しており、LLM研究に着想を得たハイブリッドオプティマイザーで学習するため、エッジへのデプロイが簡単になります。効率的なコンピュータービジョンのワークフローを活用したい開発者は、Ultralytics Platformを使ってモデルの構築、学習、デプロイを簡単に行えます。このクラウドベースのツールは、堅牢なリアルタイムビジョンアプリケーション向けに、複雑なデータセット管理やハイパーパラメーター調整を簡素化します。










