Reinforcement Learning with Verifiable Rewards (RLVR)
探索带可验证奖励的强化学习 (RLVR)。了解如何使用确定性反馈和 Ultralytics YOLO26 训练先进的 AI。
带可验证奖励的强化学习 (RLVR) 是一种先进的训练范式,用于增强人工智能 (AI)模型的推理和问题解决能力。与依赖人类注释偏好数据的传统训练方法不同,RLVR 利用确定的基于规则的系统来评估模型的输出。通过提供客观的二元奖励(例如生成的代码是否通过编译或数学方程是否求解正确),RLVR 允许模型通过不受限制的探索来进行学习。这种客观的反馈循环是推动近期高性能推理模型取得突破的关键驱动因素,使它们能够在没有持续人工干预的情况下发现最优的复杂逻辑路径。
RLVR 的核心原则#
在标准的机器学习 (ML)环境中,AI 智能体通过最大化奖励信号来学习。在 RLVR 中,这个奖励信号是由严格的编程系统生成的,而不是由主观的人类判断生成的。学习过程依赖于几个基本步骤:
- **探索策略:**模型为给定提示生成多个潜在的解决方案或推理路径,通常利用思维链提示来分解复杂的任务。
- **确定性验证:**外部工具(例如 Python 编译器、计算器或计算机视觉 (CV)感知系统)根据客观的成功标准检查最终输出。
- **策略优化:**如果输出经验证是正确的,模型将获得正向奖励。然后,使用群相对策略优化 (GRPO) 或近端策略优化 (PPO)等优化算法更新模型的策略,以青睐成功的推理路径。
这种方法显著提高了模型在训练时的推理延迟效率并激发了涌现推理能力,该技术最近被用于训练诸如 DeepSeek-R1 这样高性能的模型。
RLVR 与 RLHF 及 PRM 的对比#
区分 RLVR 与 AI 生态系统中的其他对齐和训练范式非常重要:
- **对比人类反馈强化学习 (RLHF):**RLHF 依赖于在主观人类偏好上训练的已学习奖励建模系统。RLVR 通过严格依赖客观的、程序化的真理消除了人在回路中的瓶颈,使其对于具有明确对错答案的任务具有高度的可扩展性。
- **对比过程奖励模型 (PRM):**虽然 PRM 在模型的整个推理轨迹中提供精细的、逐步的反馈,但 RLVR 通常侧重于过程结束时的可验证结果。然而,2025 年的最新研究表明,在 RLVR 中优化最终的可验证奖励也会隐式地激励中间推理步骤的正确性。
实际应用#
RLVR 正在改变在各种确定性领域训练复杂 AI 系统的方式:
- **数学推理:**像 OpenAI o 系列这样的大型推理模型利用 RLVR 来解决复杂的数学定理。验证器充当一个引擎,明确证明模型推导出的答案是否正确,从而显著提升基准数据集的性能。
- **软件工程与代码生成:**AI 编码助手使用 RLVR 来编写、调试和优化代码。当生成的代码成功编译并通关一套自动化单元测试时,即可实现可验证的奖励。
- **自主视觉智能体:**在物理环境中,自主智能体在到达目标目的地或成功操纵物体时会获得可验证的奖励。视觉模型在这些空间中充当可验证的条件检查器。
在视觉 AI 中实现可验证奖励#
在物理和视觉环境中,诸如 Ultralytics YOLO26 的感知模型可以充当 RLVR 循环中的程序化验证器。例如,如果 AI 智能体的目标是将物体移动到特定区域,则 YOLO 模型可以通过检测物体在该区域中的存在来验证成功。
以下 Python 片段使用 ultralytics 包演示了一个概念性的程序化验证器。
from ultralytics import YOLO
# Load a YOLO26 model to act as the programmatic verifier
verifier_model = YOLO("yolo26n.pt")
def get_verifiable_reward(image_path: str, target_class: int) -> float:
"""Returns a verifiable reward of 1.0 if the target object is detected."""
results = verifier_model(image_path)
# Check if the desired class (e.g., 0 for 'person') exists in the detections
detected_classes = results[0].boxes.cls.tolist()
if target_class in detected_classes:
return 1.0 # Verifiable success
return 0.0 # Verifiable failure
# Simulate an agent's environment state check
reward = get_verifiable_reward("https://ultralytics.com/images/bus.jpg", target_class=0)
print(f"RLVR Reward Signal: {reward}")通过利用诸如 Ultralytics Platform 这样的云平台来部署这些感知验证器,开发人员可以构建稳健、可扩展的 RLVR 管道,以训练下一代自主智能体和推理智能体。






