Process Reward Model (PRM)
探索过程奖励模型 (PRM) 如何改善 AI 推理。学习 RLHF 中的步骤级反馈如何确保 LLM 和 Ultralytics YOLO26 遵循逻辑、安全的路径。
评估复杂的artificial intelligence模型不仅需要检查最终答案是否正确。一种高度专业化的reinforcement learning技术会为AI在执行任务期间采取的每个中间步骤分配数学评分,从而提供dense, step-level feedback。这种细粒度的方法可确保模型不仅能到达正确的目的地,还能遵循符合逻辑、安全且可验证的路径到达目的地。
过程奖励模型与结果奖励模型#
在更广泛的Reward Modeling背景下,区分基于过程的监督和基于结果的监督是很重要的。传统的结果奖励模型 (ORM) 在生成的最末端提供单一的、稀疏的奖励。虽然ORM更容易训练,但它们在复杂任务中有一个主要缺点:它们可能会无意中奖励那些通过有缺陷的逻辑或hallucinations得出正确答案的模型。
Process Reward Model (PRM) 通过评估整个推理轨迹来解决这个问题。正如Let's Verify Step by Step等论文中由基础OpenAI research所普及的那样,PRM对每一个思考或行动应用stepwise supervision。这是先进的Reinforcement Learning from Human Feedback (RLHF)管道的关键组成部分,因为它使用诸如Proximal Policy Optimization (PPO)等算法积极指导策略优化。
实际应用#
PRM正在改变Large Language Models (LLMs)和自主系统在高风险环境中的运行方式:
- Mathematical Reasoning: 通过逐行评估方程式,PRM允许模型使用诸如Best-of-N (BoN) sampling或Monte Carlo Tree Search (MCTS)之类的算法来探索多个解决方案路径并选择逻辑上最合理的序列。
- Code Generation: 在生成软件时,仅仅检查最终脚本是否运行是不够的。PRM提供过程监督,对各个函数和逻辑块进行打分,以确保代码高效、安全且可维护。
- Operations Research and Visual Agents: 2025年和2026年的最新进展将PRM扩展到了文本之外。例如,运筹学现在利用PRM来验证复杂的调度算法。同样,配备了诸如Ultralytics YOLO26等强大computer vision引擎的视觉AI agents会因为在物理环境中导航而获得循序渐进的奖励,而不仅仅是因到达目的地而获得单一奖励。
实施步骤级反馈#
训练PRM需要管理大量数据集,其中每个子步骤都由人类或更强大的AI模型进行评估。借助像Ultralytics Platform这样的云端工具,可以更轻松地管理这些密集的data annotation工作流程,从而简化项目组织和部署。
在推理或model optimization期间,PRM根据步骤链计算累积损失或奖励。以下使用 torch 的概念性Python代码片段演示了如果中间步骤失败,如何对步骤级奖励进行惩罚,这是在PyTorch documentation中用于序列评分的常见方法:
import torch
# Simulate reward scores from a PRM for 3 consecutive reasoning steps
# Scores represent the probability of correctness for each step (0.0 to 1.0)
step_rewards = torch.tensor([0.95, 0.80, 0.15], requires_grad=True)
# The PRM aggregates the scores, heavily penalizing the poor 3rd step
# Negative log-likelihood is commonly used to optimize the trajectory
prm_loss = -torch.log(step_rewards).mean()
print(f"Calculated PRM Loss: {prm_loss.item():.4f}")
# During RLHF, this loss would guide hyperparameter tuning and model updates通过确保每个中间步骤都符合预期行为,开发人员可以部署高度可靠的系统。将过程级监督与持续的hyperparameter tuning相结合,使下一代模型能够真正安全、有效地对问题进行推理。






