YOLO Vision 2026:
返回 Ultralytics 词汇表

Reinforcement Learning with Verifiable Rewards (RLVR)

探索带可验证奖励的强化学习 (RLVR)。了解如何使用确定性反馈和 Ultralytics YOLO26 训练先进的 AI。

带可验证奖励的强化学习 (RLVR) 是一种先进的训练范式,用于增强人工智能 (AI)模型的推理和问题解决能力。与依赖人类注释偏好数据的传统训练方法不同,RLVR 利用确定的基于规则的系统来评估模型的输出。通过提供客观的二元奖励(例如生成的代码是否通过编译或数学方程是否求解正确),RLVR 允许模型通过不受限制的探索来进行学习。这种客观的反馈循环是推动近期高性能推理模型取得突破的关键驱动因素,使它们能够在没有持续人工干预的情况下发现最优的复杂逻辑路径。

RLVR 的核心原则#

在标准的机器学习 (ML)环境中,AI 智能体通过最大化奖励信号来学习。在 RLVR 中,这个奖励信号是由严格的编程系统生成的,而不是由主观的人类判断生成的。学习过程依赖于几个基本步骤:

  • **探索策略:**模型为给定提示生成多个潜在的解决方案或推理路径,通常利用思维链提示来分解复杂的任务。
  • **确定性验证:**外部工具(例如 Python 编译器、计算器或计算机视觉 (CV)感知系统)根据客观的成功标准检查最终输出。
  • **策略优化:**如果输出经验证是正确的,模型将获得正向奖励。然后,使用群相对策略优化 (GRPO) 或近端策略优化 (PPO)等优化算法更新模型的策略,以青睐成功的推理路径。

这种方法显著提高了模型在训练时的推理延迟效率并激发了涌现推理能力,该技术最近被用于训练诸如 DeepSeek-R1 这样高性能的模型。

RLVR 与 RLHF 及 PRM 的对比#

区分 RLVR 与 AI 生态系统中的其他对齐和训练范式非常重要:

  • **对比人类反馈强化学习 (RLHF):**RLHF 依赖于在主观人类偏好上训练的已学习奖励建模系统。RLVR 通过严格依赖客观的、程序化的真理消除了人在回路中的瓶颈,使其对于具有明确对错答案的任务具有高度的可扩展性。
  • **对比过程奖励模型 (PRM):**虽然 PRM 在模型的整个推理轨迹中提供精细的、逐步的反馈,但 RLVR 通常侧重于过程结束时的可验证结果。然而,2025 年的最新研究表明,在 RLVR 中优化最终的可验证奖励也会隐式地激励中间推理步骤的正确性。

实际应用#

RLVR 正在改变在各种确定性领域训练复杂 AI 系统的方式:

  • **数学推理:**像 OpenAI o 系列这样的大型推理模型利用 RLVR 来解决复杂的数学定理。验证器充当一个引擎,明确证明模型推导出的答案是否正确,从而显著提升基准数据集的性能。
  • **软件工程与代码生成:**AI 编码助手使用 RLVR 来编写、调试和优化代码。当生成的代码成功编译并通关一套自动化单元测试时,即可实现可验证的奖励。
  • **自主视觉智能体:**在物理环境中,自主智能体在到达目标目的地或成功操纵物体时会获得可验证的奖励。视觉模型在这些空间中充当可验证的条件检查器。

在视觉 AI 中实现可验证奖励#

在物理和视觉环境中,诸如 Ultralytics YOLO26 的感知模型可以充当 RLVR 循环中的程序化验证器。例如,如果 AI 智能体的目标是将物体移动到特定区域,则 YOLO 模型可以通过检测物体在该区域中的存在来验证成功。

以下 Python 片段使用 ultralytics 包演示了一个概念性的程序化验证器。

from ultralytics import YOLO

# Load a YOLO26 model to act as the programmatic verifier
verifier_model = YOLO("yolo26n.pt")


def get_verifiable_reward(image_path: str, target_class: int) -> float:
    """Returns a verifiable reward of 1.0 if the target object is detected."""
    results = verifier_model(image_path)

    # Check if the desired class (e.g., 0 for 'person') exists in the detections
    detected_classes = results[0].boxes.cls.tolist()
    if target_class in detected_classes:
        return 1.0  # Verifiable success
    return 0.0  # Verifiable failure


# Simulate an agent's environment state check
reward = get_verifiable_reward("https://ultralytics.com/images/bus.jpg", target_class=0)
print(f"RLVR Reward Signal: {reward}")

通过利用诸如 Ultralytics Platform 这样的云平台来部署这些感知验证器,开发人员可以构建稳健、可扩展的 RLVR 管道,以训练下一代自主智能体和推理智能体。

Explore solutions

Real-time AI that works with your team

机器人技术中的 AI

使用 Ultralytics YOLO 模型为智能机器赋能。机器人技术中的视觉 AI 可推动自主导航、感知、物体跟踪和实时控制。
了解更多
Real-time AI that works with your team

物流中的 AI

使用 Ultralytics YOLO 模型简化物流。视觉 AI 可实现包裹检查、分拣、车辆跟踪和实时仓库安全监控。
了解更多
Real-time AI that works with your team

零售业 AI

使用 Ultralytics YOLO 模型重塑零售业。视觉 AI 推动库存跟踪、货架监控、队列管理和更智能的客户洞察。
了解更多
Real-time AI that works with your team

医疗保健中的 AI

利用 Ultralytics YOLO 模型构建医疗保健解决方案。医疗保健中的视觉 AI 可助力更快速的医学影像分析、更智能的诊断和患者监测。
了解更多
Real-time AI that works with your team

制造业中的 AI

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 推动质量控制、缺陷检测、PPE 合规性和装配线自动化。
了解更多
Real-time AI that works with your operation

汽车中的 AI

将计算机视觉应用于汽车行业,并配合 Ultralytics YOLO 模型。汽车视觉 AI 可提升道路安全、辅助驾驶和车辆自动化,打造更智能的道路。
了解更多
Real-time AI tailored to your operation

农业中的 AI

借助 Ultralytics YOLO 模型,将视觉 AI 引入智慧农业。赋能作物监测、牲畜追踪和精准农业,实现更高、更智能的产量。
了解更多
Real-time AI that works with your team

机器人技术中的 AI

使用 Ultralytics YOLO 模型为智能机器赋能。机器人技术中的视觉 AI 可推动自主导航、感知、物体跟踪和实时控制。
了解更多
Real-time AI that works with your team

物流中的 AI

使用 Ultralytics YOLO 模型简化物流。视觉 AI 可实现包裹检查、分拣、车辆跟踪和实时仓库安全监控。
了解更多
Real-time AI that works with your team

零售业 AI

使用 Ultralytics YOLO 模型重塑零售业。视觉 AI 推动库存跟踪、货架监控、队列管理和更智能的客户洞察。
了解更多
Real-time AI that works with your team

医疗保健中的 AI

利用 Ultralytics YOLO 模型构建医疗保健解决方案。医疗保健中的视觉 AI 可助力更快速的医学影像分析、更智能的诊断和患者监测。
了解更多
Real-time AI that works with your team

制造业中的 AI

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 推动质量控制、缺陷检测、PPE 合规性和装配线自动化。
了解更多
Real-time AI that works with your operation

汽车中的 AI

将计算机视觉应用于汽车行业,并配合 Ultralytics YOLO 模型。汽车视觉 AI 可提升道路安全、辅助驾驶和车辆自动化,打造更智能的道路。
了解更多
Real-time AI tailored to your operation

农业中的 AI

借助 Ultralytics YOLO 模型,将视觉 AI 引入智慧农业。赋能作物监测、牲畜追踪和精准农业,实现更高、更智能的产量。
了解更多
Real-time AI that works with your team

机器人技术中的 AI

使用 Ultralytics YOLO 模型为智能机器赋能。机器人技术中的视觉 AI 可推动自主导航、感知、物体跟踪和实时控制。
了解更多
Real-time AI that works with your team

物流中的 AI

使用 Ultralytics YOLO 模型简化物流。视觉 AI 可实现包裹检查、分拣、车辆跟踪和实时仓库安全监控。
了解更多
Real-time AI that works with your team

零售业 AI

使用 Ultralytics YOLO 模型重塑零售业。视觉 AI 推动库存跟踪、货架监控、队列管理和更智能的客户洞察。
了解更多
Real-time AI that works with your team

医疗保健中的 AI

利用 Ultralytics YOLO 模型构建医疗保健解决方案。医疗保健中的视觉 AI 可助力更快速的医学影像分析、更智能的诊断和患者监测。
了解更多
Real-time AI that works with your team

制造业中的 AI

使用 Ultralytics YOLO 模型优化制造业。视觉 AI 推动质量控制、缺陷检测、PPE 合规性和装配线自动化。
了解更多
Real-time AI that works with your operation

汽车中的 AI

将计算机视觉应用于汽车行业,并配合 Ultralytics YOLO 模型。汽车视觉 AI 可提升道路安全、辅助驾驶和车辆自动化,打造更智能的道路。
了解更多
Real-time AI tailored to your operation

农业中的 AI

借助 Ultralytics YOLO 模型,将视觉 AI 引入智慧农业。赋能作物监测、牲畜追踪和精准农业,实现更高、更智能的产量。
了解更多

让我们一起构建 AI 的未来!

开启你的机器学习未来之旅