Group Relative Policy Optimization (GRPO)
探索组相对策略优化 (GRPO)。了解这种内存高效、无需批判器的强化学习算法如何增强 LLM 推理并降低训练成本。
群组相对策略优化 (GRPO) 是一种高效内存的强化学习算法,旨在增强大型语言模型 (LLMs)及更广泛的人工智能 (AI)系统的推理能力。GRPO 最初在 2024 年的DeepSeekMath 论文中提出,它移除了对单独价值网络(评论家模型)的需求,从而改进了传统的优化方法。相反,它对来自同一提示的一组生成响应的奖励进行归一化。通过评估响应相对于组内同行的表现,GRPO 在现代深度学习 (DL)架构中显著降低了计算开销,同时提升了复杂推理任务的性能。
GRPO 与 PPO 的区别#
虽然 GRPO 与近端策略优化 (PPO)(这是一种常用于人类反馈强化学习 (RLHF) 的标准优化算法)有相似之处,但两者在架构上存在显著差异。PPO 需要一个与主策略网络并行运行的辅助“评论家”模型,用于估计给定状态的价值。这几乎使训练阶段所需的内存翻倍。
相比之下,GRPO 是一种无评论家算法。通过为单个提示采样多个输出,并使用基于规则的奖励系统或验证器对其进行评分,GRPO 通过对该特定组内的分数进行归一化来计算优势。这种相对比较作为基准,节省了价值网络原本会占用的海量内存,并加速了整体模型训练。
GRPO 的实际应用#
GRPO 推动了生成式 AI和自然语言处理领域的几项最新突破。两个值得注意的应用包括:
- 数学推理模型: 在广受引用的DeepSeek-R1 发布及 DeepSeekMath 中,GRPO 用于激励模型发展出长的思维链推理和自我验证,其性能可媲美诸如OpenAI 的 o1等专有模型。通过奖励正确的最终答案和格式,该算法使模型能够在没有针对人工标注数据进行大量微调的情况下,自发地探索高级的问题解决策略。
- 代码生成与智能体逻辑: 对于编写代码或驱动自主智能体工作流的模型而言,评估绝对正确性具有挑战性。GRPO 允许模型通过执行代码变体并根据编译成功率或通过的测试用例进行相对打分来学习,从而加速部署高度可靠的 AI 编码助手。
在 PyTorch 中实现 GRPO 概念#
其核心在于,GRPO 通过对响应的奖励进行归一化来计算响应的相对优势。以下是一个基础的PyTorch实现,演示了如何使用标准张量运算进行这种归一化:
def compute_grpo_advantages(rewards):
# 'rewards' is a tensor of shape (batch_size, group_size)
group_mean = rewards.mean(dim=1, keepdim=True)
group_std = rewards.std(dim=1, keepdim=True)
# Normalize rewards within the group to calculate relative advantages
advantages = (rewards - group_mean) / (group_std + 1e-8)
return advantages利用智能优化推进 AI 发展#
正如 GRPO 重新定义了文本生成的效率一样,高级机器学习 (ML)技术也在不断重塑视觉感知。优化架构和损失函数使开发者能够在各个领域构建更轻、更快的模型。
对于最先进的计算机视觉任务,探索端到端优化同样至关重要。例如,Ultralytics YOLO26引入了一种原生无 NMS 架构以及受 LLM 研究启发的混合优化器,显著改善了边缘部署。希望利用高效计算机视觉工作流的开发者可以使用Ultralytics 平台轻松地构建、训练和部署模型。这个基于云的工具简化了复杂的数据集管理和超参数调优,以便构建强大、实时的视觉应用。






