Reinforcement Learning with Verifiable Rewards (RLVR)
Открой для себя обучение с подкреплением и проверяемыми наградами (RLVR). Узнай, как обучать продвинутый ИИ, используя детерминированную обратную связь и Ultralytics YOLO26.
Обучение с подкреплением на основе проверяемых наград (RLVR) — это передовая парадигма обучения, используемая для повышения возможностей рассуждения и решения проблем у моделей искусственного интеллекта (ИИ). В отличие от традиционных методов обучения, которые полагаются на размеченные людьми данные о предпочтениях, RLVR использует детерминированные системы на основе правил для оценки результатов работы модели. Предоставляя объективную бинарную награду, например, компилируется ли сгенерированный фрагмент кода или правильно ли решено математическое уравнение, RLVR позволяет моделям учиться посредством неограниченного исследования. Этот цикл обратной связи на основе объективных данных является ключевым фактором недавних прорывов в создании высокопроизводительных моделей рассуждения, позволяя им находить оптимальные и сложные логические пути без постоянного вмешательства человека.
Основные принципы RLVR#
В стандартных средах шинного обучения (ML) ИИ-агент учится, максимизируя сигнал вознаграждения. В RLVR этот сигнал вознаграждения генерируется жесткой программной системой, а не субъективным человеческим суждением. Процесс обучения опирается на несколько фундаментальных шагов:
- Стратегия исследования: Модель генерирует несколько потенциальных решений или путей рассуждения для заданного промпта, часто используя пошаговый промптинг (chain-of-thought) для разбиения сложных задач.
- Детерминированная верификация: Внешний инструмент, такой как компилятор Python, калькулятор или система восприятия компьютерного зрения (CV), проверяет конечный результат на соответствие объективным критериям успеха.
- Оптимизация политики: Если результат проверяемо верен, модель получает положительное вознаграждение. Затем политика модели обновляется с использованием алгоритмов оптимизации, таких как Group Relative Policy Optimization (GRPO) или Proximal Policy Optimization (PPO), чтобы отдавать предпочтение успешным путям рассуждения.
Этот подход значительно повышает эффективность задержки инференса модели во время обучения и стимулирует появление новых возможностей рассуждения — метод, который недавно использовался для обучения высокоспособных моделей, таких как DeepSeek-R1.
RLVR против RLHF и PRM#
Важно отличать RLVR от других парадигм выравнивания и обучения в экосистеме ИИ:
- против обучения с подкреплением на основе отзывов человека (RLHF): RLHF опирается на обученную систему моделирования вознаграждений, обученную на субъективных человеческих предпочтениях. RLVR устраняет узкое место в виде участия человека, полагаясь исключительно на объективные программные истины, что делает ее высокомасштабируемой для задач с однозначно правильными или неправильными ответами.
- против модели вознаграждения процессов (PRM): В то время как PRM предоставляют детализированную пошаговую обратную связь на протяжении всей траектории рассуждения модели, RLVR обычно фокусируется на проверяемом результате в конце процесса. Тем не менее недавние исследования 2025 года показывают, что оптимизация конечной проверяемой награды в RLVR также неявно стимулирует правильные промежуточные шаги рассуждения.
Реальные приложения#
RLVR меняет способы обучения сложных ИИ-систем в различных детерминированных областях:
- Математические рассуждения: Большие модели рассуждений, такие как серия o от OpenAI, используют RLVR для решения сложных математических теорем. Верификатор выступает в роли движка, который окончательно доказывает правильность полученного моделью ответа, значительно повышая производительность на наборах данных для бенчмаркинга.
- Разработка программного обеспечения и генерация кода: ИИ-ассистенты по кодингу используют RLVR для написания, отладки и оптимизации кода. Проверяемая награда достигается, когда сгенерированный код успешно компилируется и проходит набор автоматизированных модульных тестов.
- Автономные визуальные агенты: В физических средах автономные агенты получают проверяемые награды по достижении целевого пункта назначения или при успешном манипулировании объектом. Модели компьютерного зрения действуют как проверяющие условия в этих пространствах.
Реализация проверяемой награды в Vision AI#
В физических и визуальных средах модели восприятия, такие как Ultralytics YOLO26, могут служить программным верификатором в цикле RLVR. Например, если целью ИИ-агента является перемещение объекта в определенную зону, модель YOLO может подтвердить успех, обнаружив присутствие объекта в этой зоне.
Следующий фрагмент кода на Python демонстрирует концептуальный программный верификатор с использованием пакета ultralytics.
from ultralytics import YOLO
# Load a YOLO26 model to act as the programmatic verifier
verifier_model = YOLO("yolo26n.pt")
def get_verifiable_reward(image_path: str, target_class: int) -> float:
"""Returns a verifiable reward of 1.0 if the target object is detected."""
results = verifier_model(image_path)
# Check if the desired class (e.g., 0 for 'person') exists in the detections
detected_classes = results[0].boxes.cls.tolist()
if target_class in detected_classes:
return 1.0 # Verifiable success
return 0.0 # Verifiable failure
# Simulate an agent's environment state check
reward = get_verifiable_reward("https://ultralytics.com/images/bus.jpg", target_class=0)
print(f"RLVR Reward Signal: {reward}")Используя облачные платформы, такие как Ultralytics Platform, для развертывания этих верификаторов восприятия, разработчики могут создавать надежные и масштабируемые конвейеры RLVR, которые обучают следующее поколение автономных агентов и агентов рассуждения.






