Reinforcement Learning with Verifiable Rewards (RLVR)
探索可验证奖励强化学习(RLVR)。了解如何利用确定性反馈和 Ultralytics YOLO26 训练先进 AI。
可验证奖励强化学习(RLVR)是一种先进的训练范式,用于增强人工智能(AI)模型的推理和问题解决能力。与依赖人工标注偏好数据的传统训练方法不同,RLVR 使用确定性的基于规则的系统来评估模型输出。通过提供客观的二元奖励(例如生成的代码是否编译成功,或数学方程是否正确求解),RLVR 让模型能够通过不受限制的探索进行学习。这种客观反馈循环是近期高能力推理模型取得突破的关键驱动力,使模型无需持续的人工干预,就能发现最优的复杂逻辑路径。
RLVR 的核心原理#
在标准的机器学习(ML)环境中,AI 智能体通过最大化奖励信号来学习。在 RLVR 中,奖励信号由严格的编程系统生成,而非基于主观的人类判断。学习过程依赖几个基本步骤:
- 探索策略: 模型针对给定提示生成多个可能的解决方案或推理路径,通常会使用思维链提示来拆解复杂任务。
- 确定性验证: 外部工具(如 Python 编译器、计算器或计算机视觉(CV)感知系统)会根据客观的成功标准检查最终输出。
- 策略优化: 如果输出经验证正确,模型就会获得正向奖励。随后,模型会使用组相对策略优化(GRPO)或近端策略优化(PPO)等优化算法更新策略,以提高成功推理路径的优先级。
这种方法能显著提升模型在训练时的推理延迟效率,并促进涌现推理能力;近期,研究人员已使用这一技术训练出 DeepSeek-R1等高能力模型。
RLVR 与 RLHF、PRM 的比较#
区分 RLVR 与 AI 生态系统中的其他对齐和训练范式非常重要:
- 与基于人类反馈的强化学习(RLHF)比较: RLHF 依赖在主观人类偏好上训练的奖励建模系统。RLVR 严格依赖客观、程序化的真值,消除了人工参与环节的瓶颈,因此特别适用于有明确对错标准、且易于扩展的任务。
- 与过程奖励模型(PRM)比较: PRM 会在模型的推理过程中提供细致的逐步反馈,而 RLVR 通常关注流程结束时可验证的结果。不过,2025 年的最新研究表明,在 RLVR 中优化最终的可验证奖励,也会隐式鼓励正确的中间推理步骤。
实际应用#
RLVR 正在改变复杂 AI 系统在各种确定性领域中的训练方式:
- 数学推理: OpenAI o 系列等大型推理模型借助 RLVR 求解复杂的数学定理。验证器充当引擎,明确证明模型推导出的答案是否正确,从而显著提升基准数据集上的表现。
- 软件工程与代码生成: AI 编程助手使用 RLVR 编写、调试和优化代码。当生成的代码成功编译并通过一系列自动化单元测试时,就能获得可验证的奖励。
- 自主视觉智能体: 在物理环境中,自主智能体到达目标位置或成功操作物体后,就会获得可验证的奖励。视觉模型在这些场景中充当可验证的条件检查器。
在视觉 AI 中实现可验证奖励#
在物理和视觉环境中,Ultralytics YOLO26等感知模型可以充当 RLVR 循环中的程序化验证器。例如,如果 AI 智能体的目标是将物体移动到特定区域,YOLO 模型就可以通过检测该区域中是否存在物体来验证任务是否成功。
以下 Python 代码片段展示了如何使用 ultralytics 包构建概念性的程序化验证器。
from ultralytics import YOLO
# Load a YOLO26 model to act as the programmatic verifier
verifier_model = YOLO("yolo26n.pt")
def get_verifiable_reward(image_path: str, target_class: int) -> float:
"""Returns a verifiable reward of 1.0 if the target object is detected."""
results = verifier_model(image_path)
# Check if the desired class (e.g., 0 for 'person') exists in the detections
detected_classes = results[0].boxes.cls.tolist()
if target_class in detected_classes:
return 1.0 # Verifiable success
return 0.0 # Verifiable failure
# Simulate an agent's environment state check
reward = get_verifiable_reward("https://ultralytics.com/images/bus.jpg", target_class=0)
print(f"RLVR Reward Signal: {reward}")开发者可以借助用于部署这些感知验证器的 Ultralytics Platform等云平台,构建稳健、可扩展的 RLVR 流水线,训练下一代自主智能体和推理智能体。









