Group Relative Policy Optimization (GRPO)
グループ相対方策最適化(GRPO)を紹介します。このメモリ効率が良く、批評家(Critic)不要な強化学習アルゴリズムが、どのようにLLMの推論を強化し、学習コストを削減するかを学びましょう。
Group Relative Policy Optimization (GRPO) は、Large Language Models (LLMs) やより広範な Artificial Intelligence (AI) システムの推論能力を向上させるために開発された、メモリ効率の高いreinforcement learningアルゴリズムです。2024年の DeepSeekMath paper で初めて導入された GRPO は、独立したバリューネットワーク(批評家モデル)の必要性をなくすことで、従来の最適化手法を改善します。代わりに、同じプロンプトから生成された一連の応答の報酬を正規化します。グループ内のピアに対して応答を相対的に評価することにより、GRPO は現代の Deep Learning (DL) アーキテクチャにおける複雑な推論タスクのパフォーマンスを向上させながら、計算オーバーヘッドを劇的に削減します。
GRPOとPPOの違い#
GRPO は、人間のフィードバックからの強化学習(RLHF)でよく使用される標準的なoptimization algorithmである Proximal Policy Optimization (PPO) と類似点を共有していますが、両者はアーキテクチャにおいて大きく異なります。PPO は、特定の状態の価値を推定するために、メインポリシーネットワークと並行して実行される二次的な「批評家」モデルを必要とします。これにより、training phase で必要なメモリがほぼ倍増します。
対照的に、GRPO は批評家不要のアルゴリズムです。1つのプロンプトに対して複数の出力をサンプリングし、rule-based reward system または検証ツールを使用してそれらをスコアリングすることにより、GRPO はその特定のグループ内のスコアを正規化してアドバンテージを計算します。この相対的な比較がベースラインとして機能し、バリューネットワークによって占められていた膨大な量のメモリを節約し、全体的なmodel trainingを加速します。
GRPOの現実世界での応用#
generative AI およびnatural language processingにおける最近のいくつかのブレイクスルーを推進してきました。注目すべき2つのアプリケーションは次のとおりです。
- Mathematical Reasoning Models: 広く引用されている DeepSeek-R1 release および DeepSeekMath において、GRPO はモデルが長い chain-of-thought 推論と自己検証を開発するよう促すために使用され、OpenAI's o1 などのプロプライエタリモデルのパフォーマンスに匹敵しました。正しい最終回答とフォーマットに報酬を与えることで、このアルゴリズムにより、モデルは人間が注釈を付けたデータに対する広範なfine-tuningなしで、高度な問題解決戦略を自律的に発見できるようになりました。
- Code Generation and Agentic Logic: コードを記述するモデルや自律的なagentic workflowsを動かすモデルの場合、絶対的な正確性を評価することは困難です。GRPO を使用すると、モデルはコードのバリエーションを実行し、コンパイルの成功や渡されたテストケースに基づいて相対的にスコアリングすることで学習できるようになり、信頼性の高い AI コーディングアシスタントの導入が加速します。
PyTorchでのGRPOコンセプトの実装#
その核心において、GRPO は報酬を正規化することによって応答の相対的なアドバンテージを計算します。以下は、標準的なtensor operationsを使用してこの正規化を示す基本的な PyTorch の実装です。
def compute_grpo_advantages(rewards):
# 'rewards' is a tensor of shape (batch_size, group_size)
group_mean = rewards.mean(dim=1, keepdim=True)
group_std = rewards.std(dim=1, keepdim=True)
# Normalize rewards within the group to calculate relative advantages
advantages = (rewards - group_mean) / (group_std + 1e-8)
return advantagesスマートな最適化でAIを進化させる#
GRPO がテキスト生成の効率を再定義するのと同様に、高度な Machine Learning (ML) 技術はvisual perceptionを継続的に再構築します。アーキテクチャとloss functionsを最適化することで、開発者はすべてのドメインでより軽量で高速なモデルを構築できます。
最先端のcomputer vision tasksでは、エンドツーエンドの最適化を探索することも同様に重要です。たとえば、Ultralytics YOLO26 は、LLM の研究にインスパイアされたネイティブな NMS フリーのアーキテクチャとhybrid optimizersを導入し、エッジ展開を劇的に改善します。効率的なcomputer visionワークフローを活用したい開発者は、Ultralytics Platform を使用して、モデルの構築、トレーニング、デプロイを簡単に行うことができます。このクラウドベースのツールは、堅牢でリアルタイムのビジョンアプリケーション向けに、複雑なデータセット管理とhyperparameter tuningを簡素化します。






