Reinforcement Learning with Verifiable Rewards (RLVR)
Изучи обучение с подкреплением с проверяемыми вознаграждениями (RLVR). Узнай, как обучать продвинутый ИИ с помощью детерминированной обратной связи и Ultralytics YOLO26.
Обучение с подкреплением с проверяемыми вознаграждениями (RLVR) — это продвинутый подход к обучению, который повышает способность моделей искусственного интеллекта (AI) рассуждать и решать задачи. В отличие от традиционных методов обучения, основанных на данных о предпочтениях, размеченных людьми, RLVR использует детерминированные системы на основе правил для оценки результатов модели. Объективное бинарное вознаграждение — например, проверка того, компилируется ли сгенерированный код или правильно ли решено математическое уравнение, — позволяет моделям учиться посредством неограниченного исследования. Этот цикл объективной обратной связи стал одним из ключевых факторов недавнего прорыва в создании мощных моделей рассуждения: он помогает им находить оптимальные сложные цепочки логических выводов без постоянного вмешательства человека.
Основные принципы RLVR#
В стандартных средах машинного обучения (ML) ИИ-агент учится, максимизируя сигнал вознаграждения. В RLVR этот сигнал формируется строгой программной системой, а не субъективной оценкой человека. Процесс обучения состоит из нескольких основных этапов:
- Стратегия исследования: Модель генерирует несколько возможных решений или цепочек рассуждений для заданного запроса, часто используя подсказки с пошаговым рассуждением, чтобы разбить сложные задачи на части.
- Детерминированная проверка: Внешний инструмент — например, компилятор Python, калькулятор или система восприятия в области компьютерного зрения (CV) — проверяет итоговый результат на соответствие объективным критериям успешного выполнения.
- Оптимизация политики: Если результат можно подтвердить как правильный, модель получает положительное вознаграждение. Затем политика модели обновляется с помощью алгоритмов оптимизации, таких как относительная групповая оптимизация политики (GRPO) или проксимальная оптимизация политики (PPO), чтобы отдавать предпочтение успешным цепочкам рассуждений.
Этот подход значительно повышает эффективность задержки вывода модели во время обучения и способствует появлению новых способностей к рассуждению. Недавно его использовали для обучения таких мощных моделей, как DeepSeek-R1.
RLVR, RLHF и PRM#
Важно отличать RLVR от других подходов к выравниванию и обучению в экосистеме ИИ:
- В сравнении с обучением с подкреплением на основе отзывов людей (RLHF): RLHF опирается на систему моделирования вознаграждения, обученную на субъективных предпочтениях людей. RLVR устраняет узкое место, связанное с участием человека, поскольку основывается только на объективных программно проверяемых фактах. Благодаря этому RLVR хорошо масштабируется для задач с однозначно правильными или неправильными ответами.
- В сравнении с моделью вознаграждения за процесс (PRM): PRM предоставляет подробную пошаговую обратную связь на протяжении всего процесса рассуждения модели, а RLVR обычно оценивает проверяемый итоговый результат. Однако недавние исследования 2025 года показывают, что оптимизация итогового проверяемого вознаграждения в RLVR косвенно поощряет и правильные промежуточные шаги рассуждения.
Примеры применения в реальных условиях#
RLVR меняет подход к обучению сложных систем ИИ в различных детерминированных областях:
- Математические рассуждения: Крупные модели рассуждения, например серия OpenAI o, используют RLVR для решения сложных математических теорем. Проверяющий модуль однозначно определяет, верен ли полученный моделью ответ, что значительно повышает результаты на эталонных наборах данных.
- Разработка ПО и генерация кода: ИИ-помощники для программирования используют RLVR, чтобы писать, отлаживать и оптимизировать код. Вознаграждение начисляется, если сгенерированный код успешно компилируется и проходит набор автоматизированных модульных тестов.
- Автономные агенты зрения: В физических средах автономные агенты получают проверяемое вознаграждение, когда достигают заданной точки или успешно манипулируют объектом. В таких средах модели зрения проверяют выполнение условий.
Реализация проверяемого вознаграждения в ИИ для компьютерного зрения#
В физических и визуальных средах модели восприятия, например Ultralytics YOLO26, могут выступать программным проверяющим модулем в цикле RLVR. Например, если цель ИИ-агента — переместить объект в заданную зону, модель YOLO может проверить успех, обнаружив объект в этой зоне.
Следующий фрагмент кода на Python демонстрирует концептуальный программный проверяющий модуль с использованием пакета ultralytics.
from ultralytics import YOLO
# Load a YOLO26 model to act as the programmatic verifier
verifier_model = YOLO("yolo26n.pt")
def get_verifiable_reward(image_path: str, target_class: int) -> float:
"""Returns a verifiable reward of 1.0 if the target object is detected."""
results = verifier_model(image_path)
# Check if the desired class (e.g., 0 for 'person') exists in the detections
detected_classes = results[0].boxes.cls.tolist()
if target_class in detected_classes:
return 1.0 # Verifiable success
return 0.0 # Verifiable failure
# Simulate an agent's environment state check
reward = get_verifiable_reward("https://ultralytics.com/images/bus.jpg", target_class=0)
print(f"RLVR Reward Signal: {reward}")Используя облачные платформы, например платформу Ultralytics, для развертывания таких проверяющих модулей восприятия, разработчики могут создавать надежные и масштабируемые конвейеры RLVR для обучения следующего поколения автономных агентов и агентов рассуждения.









