YOLO Vision 2026:
返回 Ultralytics 词汇表

Process Reward Model (PRM)

探索过程奖励模型 (PRM) 如何改善 AI 推理。学习 RLHF 中的步骤级反馈如何确保 LLM 和 Ultralytics YOLO26 遵循逻辑、安全的路径。

评估复杂的artificial intelligence模型不仅需要检查最终答案是否正确。一种高度专业化的reinforcement learning技术会为AI在执行任务期间采取的每个中间步骤分配数学评分,从而提供dense, step-level feedback。这种细粒度的方法可确保模型不仅能到达正确的目的地,还能遵循符合逻辑、安全且可验证的路径到达目的地。

过程奖励模型与结果奖励模型#

在更广泛的Reward Modeling背景下,区分基于过程的监督和基于结果的监督是很重要的。传统的结果奖励模型 (ORM) 在生成的最末端提供单一的、稀疏的奖励。虽然ORM更容易训练,但它们在复杂任务中有一个主要缺点:它们可能会无意中奖励那些通过有缺陷的逻辑或hallucinations得出正确答案的模型。

Process Reward Model (PRM) 通过评估整个推理轨迹来解决这个问题。正如Let's Verify Step by Step等论文中由基础OpenAI research所普及的那样,PRM对每一个思考或行动应用stepwise supervision。这是先进的Reinforcement Learning from Human Feedback (RLHF)管道的关键组成部分,因为它使用诸如Proximal Policy Optimization (PPO)等算法积极指导策略优化。

实际应用#

PRM正在改变Large Language Models (LLMs)和自主系统在高风险环境中的运行方式:

实施步骤级反馈#

训练PRM需要管理大量数据集,其中每个子步骤都由人类或更强大的AI模型进行评估。借助像Ultralytics Platform这样的云端工具,可以更轻松地管理这些密集的data annotation工作流程,从而简化项目组织和部署。

在推理或model optimization期间,PRM根据步骤链计算累积损失或奖励。以下使用 torch 的概念性Python代码片段演示了如果中间步骤失败,如何对步骤级奖励进行惩罚,这是在PyTorch documentation中用于序列评分的常见方法:

import torch

# Simulate reward scores from a PRM for 3 consecutive reasoning steps
# Scores represent the probability of correctness for each step (0.0 to 1.0)
step_rewards = torch.tensor([0.95, 0.80, 0.15], requires_grad=True)

# The PRM aggregates the scores, heavily penalizing the poor 3rd step
# Negative log-likelihood is commonly used to optimize the trajectory
prm_loss = -torch.log(step_rewards).mean()

print(f"Calculated PRM Loss: {prm_loss.item():.4f}")
# During RLHF, this loss would guide hyperparameter tuning and model updates

通过确保每个中间步骤都符合预期行为,开发人员可以部署高度可靠的系统。将过程级监督与持续的hyperparameter tuning相结合,使下一代模型能够真正安全、有效地对问题进行推理。

Explore solutions

让我们一起构建 AI 的未来!

开启你的机器学习未来之旅