YOLO Vision 2026:
Ultralytics用語集に戻る

Group Relative Policy Optimization (GRPO)

グループ相対方策最適化(GRPO)を紹介します。このメモリ効率が良く、批評家(Critic)不要な強化学習アルゴリズムが、どのようにLLMの推論を強化し、学習コストを削減するかを学びましょう。

Group Relative Policy Optimization (GRPO) は、Large Language Models (LLMs) やより広範な Artificial Intelligence (AI) システムの推論能力を向上させるために開発された、メモリ効率の高いreinforcement learningアルゴリズムです。2024年の DeepSeekMath paper で初めて導入された GRPO は、独立したバリューネットワーク(批評家モデル)の必要性をなくすことで、従来の最適化手法を改善します。代わりに、同じプロンプトから生成された一連の応答の報酬を正規化します。グループ内のピアに対して応答を相対的に評価することにより、GRPO は現代の Deep Learning (DL) アーキテクチャにおける複雑な推論タスクのパフォーマンスを向上させながら、計算オーバーヘッドを劇的に削減します。

GRPOとPPOの違い#

GRPO は、人間のフィードバックからの強化学習(RLHF)でよく使用される標準的なoptimization algorithmである Proximal Policy Optimization (PPO) と類似点を共有していますが、両者はアーキテクチャにおいて大きく異なります。PPO は、特定の状態の価値を推定するために、メインポリシーネットワークと並行して実行される二次的な「批評家」モデルを必要とします。これにより、training phase で必要なメモリがほぼ倍増します。

対照的に、GRPO は批評家不要のアルゴリズムです。1つのプロンプトに対して複数の出力をサンプリングし、rule-based reward system または検証ツールを使用してそれらをスコアリングすることにより、GRPO はその特定のグループ内のスコアを正規化してアドバンテージを計算します。この相対的な比較がベースラインとして機能し、バリューネットワークによって占められていた膨大な量のメモリを節約し、全体的なmodel trainingを加速します。

GRPOの現実世界での応用#

generative AI およびnatural language processingにおける最近のいくつかのブレイクスルーを推進してきました。注目すべき2つのアプリケーションは次のとおりです。

  1. Mathematical Reasoning Models: 広く引用されている DeepSeek-R1 release および DeepSeekMath において、GRPO はモデルが長い chain-of-thought 推論と自己検証を開発するよう促すために使用され、OpenAI's o1 などのプロプライエタリモデルのパフォーマンスに匹敵しました。正しい最終回答とフォーマットに報酬を与えることで、このアルゴリズムにより、モデルは人間が注釈を付けたデータに対する広範なfine-tuningなしで、高度な問題解決戦略を自律的に発見できるようになりました。
  2. Code Generation and Agentic Logic: コードを記述するモデルや自律的なagentic workflowsを動かすモデルの場合、絶対的な正確性を評価することは困難です。GRPO を使用すると、モデルはコードのバリエーションを実行し、コンパイルの成功や渡されたテストケースに基づいて相対的にスコアリングすることで学習できるようになり、信頼性の高い AI コーディングアシスタントの導入が加速します。

PyTorchでのGRPOコンセプトの実装#

その核心において、GRPO は報酬を正規化することによって応答の相対的なアドバンテージを計算します。以下は、標準的なtensor operationsを使用してこの正規化を示す基本的な PyTorch の実装です。



def compute_grpo_advantages(rewards):
    # 'rewards' is a tensor of shape (batch_size, group_size)
    group_mean = rewards.mean(dim=1, keepdim=True)
    group_std = rewards.std(dim=1, keepdim=True)

    # Normalize rewards within the group to calculate relative advantages
    advantages = (rewards - group_mean) / (group_std + 1e-8)
    return advantages

スマートな最適化でAIを進化させる#

GRPO がテキスト生成の効率を再定義するのと同様に、高度な Machine Learning (ML) 技術はvisual perceptionを継続的に再構築します。アーキテクチャとloss functionsを最適化することで、開発者はすべてのドメインでより軽量で高速なモデルを構築できます。

最先端のcomputer vision tasksでは、エンドツーエンドの最適化を探索することも同様に重要です。たとえば、Ultralytics YOLO26 は、LLM の研究にインスパイアされたネイティブな NMS フリーのアーキテクチャとhybrid optimizersを導入し、エッジ展開を劇的に改善します。効率的なcomputer visionワークフローを活用したい開発者は、Ultralytics Platform を使用して、モデルの構築、トレーニング、デプロイを簡単に行うことができます。このクラウドベースのツールは、堅牢でリアルタイムのビジョンアプリケーション向けに、複雑なデータセット管理とhyperparameter tuningを簡素化します。

Explore solutions

Real-time AI that works with your team

ロボティクスにおけるコンピュータビジョン

Ultralytics YOLOモデルで、よりスマートなマシンを実現しましょう。ロボティクスにおけるビジョンAIは、自律航行、認識、物体追跡、リアルタイム制御を推進します。
詳細はこちら
Real-time AI that works with your team

物流におけるコンピュータビジョン

Ultralytics YOLOモデルで物流を効率化しましょう。ビジョンAIにより、荷物の検査、仕分け、車両追跡、リアルタイムの倉庫安全モニタリングが可能になります。
詳細はこちら
Real-time AI that works with your team

小売におけるコンピュータビジョン

Ultralytics YOLOモデルで小売を再定義しましょう。ビジョンAIは、在庫追跡、棚のモニタリング、キュー管理、そしてより賢明な顧客インサイトを促進します。
詳細はこちら
Real-time AI that works with your team

ヘルスケアにおけるコンピュータビジョン

Ultralytics YOLOモデルを使用してヘルスケアソリューションを構築しましょう。ヘルスケア分野におけるビジョンAIは、より高速な医療画像診断、よりスマートな診断、患者モニタリングを推進します。
詳細はこちら
Real-time AI that works with your team

製造におけるコンピュータビジョン

Ultralytics YOLOモデルで製造を最適化しましょう。ビジョンAIは、品質管理、欠陥検出、PPEコンプライアンス、組立ラインの自動化を促進します。
詳細はこちら
Real-time AI that works with your operation

自動車におけるコンピュータビジョン

Ultralytics YOLOモデルを使用して、自動車分野にコンピュータビジョンを適用しましょう。ビジョンAIは、道路の安全性、運転支援、車両の自動化を向上させ、よりスマートな道路を実現します。
詳細はこちら
Real-time AI tailored to your operation

農業におけるコンピュータビジョン

Ultralytics YOLOモデルを使用して、スマート農業にビジョンAIを導入しましょう。作物モニタリング、家畜のトラッキング、精密農業を強化し、より高くスマートな収穫を実現します。
詳細はこちら
Real-time AI that works with your team

ロボティクスにおけるコンピュータビジョン

Ultralytics YOLOモデルで、よりスマートなマシンを実現しましょう。ロボティクスにおけるビジョンAIは、自律航行、認識、物体追跡、リアルタイム制御を推進します。
詳細はこちら
Real-time AI that works with your team

物流におけるコンピュータビジョン

Ultralytics YOLOモデルで物流を効率化しましょう。ビジョンAIにより、荷物の検査、仕分け、車両追跡、リアルタイムの倉庫安全モニタリングが可能になります。
詳細はこちら
Real-time AI that works with your team

小売におけるコンピュータビジョン

Ultralytics YOLOモデルで小売を再定義しましょう。ビジョンAIは、在庫追跡、棚のモニタリング、キュー管理、そしてより賢明な顧客インサイトを促進します。
詳細はこちら
Real-time AI that works with your team

ヘルスケアにおけるコンピュータビジョン

Ultralytics YOLOモデルを使用してヘルスケアソリューションを構築しましょう。ヘルスケア分野におけるビジョンAIは、より高速な医療画像診断、よりスマートな診断、患者モニタリングを推進します。
詳細はこちら
Real-time AI that works with your team

製造におけるコンピュータビジョン

Ultralytics YOLOモデルで製造を最適化しましょう。ビジョンAIは、品質管理、欠陥検出、PPEコンプライアンス、組立ラインの自動化を促進します。
詳細はこちら
Real-time AI that works with your operation

自動車におけるコンピュータビジョン

Ultralytics YOLOモデルを使用して、自動車分野にコンピュータビジョンを適用しましょう。ビジョンAIは、道路の安全性、運転支援、車両の自動化を向上させ、よりスマートな道路を実現します。
詳細はこちら
Real-time AI tailored to your operation

農業におけるコンピュータビジョン

Ultralytics YOLOモデルを使用して、スマート農業にビジョンAIを導入しましょう。作物モニタリング、家畜のトラッキング、精密農業を強化し、より高くスマートな収穫を実現します。
詳細はこちら
Real-time AI that works with your team

ロボティクスにおけるコンピュータビジョン

Ultralytics YOLOモデルで、よりスマートなマシンを実現しましょう。ロボティクスにおけるビジョンAIは、自律航行、認識、物体追跡、リアルタイム制御を推進します。
詳細はこちら
Real-time AI that works with your team

物流におけるコンピュータビジョン

Ultralytics YOLOモデルで物流を効率化しましょう。ビジョンAIにより、荷物の検査、仕分け、車両追跡、リアルタイムの倉庫安全モニタリングが可能になります。
詳細はこちら
Real-time AI that works with your team

小売におけるコンピュータビジョン

Ultralytics YOLOモデルで小売を再定義しましょう。ビジョンAIは、在庫追跡、棚のモニタリング、キュー管理、そしてより賢明な顧客インサイトを促進します。
詳細はこちら
Real-time AI that works with your team

ヘルスケアにおけるコンピュータビジョン

Ultralytics YOLOモデルを使用してヘルスケアソリューションを構築しましょう。ヘルスケア分野におけるビジョンAIは、より高速な医療画像診断、よりスマートな診断、患者モニタリングを推進します。
詳細はこちら
Real-time AI that works with your team

製造におけるコンピュータビジョン

Ultralytics YOLOモデルで製造を最適化しましょう。ビジョンAIは、品質管理、欠陥検出、PPEコンプライアンス、組立ラインの自動化を促進します。
詳細はこちら
Real-time AI that works with your operation

自動車におけるコンピュータビジョン

Ultralytics YOLOモデルを使用して、自動車分野にコンピュータビジョンを適用しましょう。ビジョンAIは、道路の安全性、運転支援、車両の自動化を向上させ、よりスマートな道路を実現します。
詳細はこちら
Real-time AI tailored to your operation

農業におけるコンピュータビジョン

Ultralytics YOLOモデルを使用して、スマート農業にビジョンAIを導入しましょう。作物モニタリング、家畜のトラッキング、精密農業を強化し、より高くスマートな収穫を実現します。
詳細はこちら

AIの未来を共に築き上げましょう!

機械学習の未来とともに旅を始めましょう