YOLO Vision 2026:
Назад к глоссарию Ultralytics

Reinforcement Learning with Verifiable Rewards (RLVR)

Открой для себя обучение с подкреплением и проверяемыми наградами (RLVR). Узнай, как обучать продвинутый ИИ, используя детерминированную обратную связь и Ultralytics YOLO26.

Обучение с подкреплением на основе проверяемых наград (RLVR) — это передовая парадигма обучения, используемая для повышения возможностей рассуждения и решения проблем у моделей искусственного интеллекта (ИИ). В отличие от традиционных методов обучения, которые полагаются на размеченные людьми данные о предпочтениях, RLVR использует детерминированные системы на основе правил для оценки результатов работы модели. Предоставляя объективную бинарную награду, например, компилируется ли сгенерированный фрагмент кода или правильно ли решено математическое уравнение, RLVR позволяет моделям учиться посредством неограниченного исследования. Этот цикл обратной связи на основе объективных данных является ключевым фактором недавних прорывов в создании высокопроизводительных моделей рассуждения, позволяя им находить оптимальные и сложные логические пути без постоянного вмешательства человека.

Основные принципы RLVR#

В стандартных средах шинного обучения (ML) ИИ-агент учится, максимизируя сигнал вознаграждения. В RLVR этот сигнал вознаграждения генерируется жесткой программной системой, а не субъективным человеческим суждением. Процесс обучения опирается на несколько фундаментальных шагов:

  • Стратегия исследования: Модель генерирует несколько потенциальных решений или путей рассуждения для заданного промпта, часто используя пошаговый промптинг (chain-of-thought) для разбиения сложных задач.
  • Детерминированная верификация: Внешний инструмент, такой как компилятор Python, калькулятор или система восприятия компьютерного зрения (CV), проверяет конечный результат на соответствие объективным критериям успеха.
  • Оптимизация политики: Если результат проверяемо верен, модель получает положительное вознаграждение. Затем политика модели обновляется с использованием алгоритмов оптимизации, таких как Group Relative Policy Optimization (GRPO) или Proximal Policy Optimization (PPO), чтобы отдавать предпочтение успешным путям рассуждения.

Этот подход значительно повышает эффективность задержки инференса модели во время обучения и стимулирует появление новых возможностей рассуждения — метод, который недавно использовался для обучения высокоспособных моделей, таких как DeepSeek-R1.

RLVR против RLHF и PRM#

Важно отличать RLVR от других парадигм выравнивания и обучения в экосистеме ИИ:

Реальные приложения#

RLVR меняет способы обучения сложных ИИ-систем в различных детерминированных областях:

  • Математические рассуждения: Большие модели рассуждений, такие как серия o от OpenAI, используют RLVR для решения сложных математических теорем. Верификатор выступает в роли движка, который окончательно доказывает правильность полученного моделью ответа, значительно повышая производительность на наборах данных для бенчмаркинга.
  • Разработка программного обеспечения и генерация кода: ИИ-ассистенты по кодингу используют RLVR для написания, отладки и оптимизации кода. Проверяемая награда достигается, когда сгенерированный код успешно компилируется и проходит набор автоматизированных модульных тестов.
  • Автономные визуальные агенты: В физических средах автономные агенты получают проверяемые награды по достижении целевого пункта назначения или при успешном манипулировании объектом. Модели компьютерного зрения действуют как проверяющие условия в этих пространствах.

Реализация проверяемой награды в Vision AI#

В физических и визуальных средах модели восприятия, такие как Ultralytics YOLO26, могут служить программным верификатором в цикле RLVR. Например, если целью ИИ-агента является перемещение объекта в определенную зону, модель YOLO может подтвердить успех, обнаружив присутствие объекта в этой зоне.

Следующий фрагмент кода на Python демонстрирует концептуальный программный верификатор с использованием пакета ultralytics.

from ultralytics import YOLO

# Load a YOLO26 model to act as the programmatic verifier
verifier_model = YOLO("yolo26n.pt")


def get_verifiable_reward(image_path: str, target_class: int) -> float:
    """Returns a verifiable reward of 1.0 if the target object is detected."""
    results = verifier_model(image_path)

    # Check if the desired class (e.g., 0 for 'person') exists in the detections
    detected_classes = results[0].boxes.cls.tolist()
    if target_class in detected_classes:
        return 1.0  # Verifiable success
    return 0.0  # Verifiable failure


# Simulate an agent's environment state check
reward = get_verifiable_reward("https://ultralytics.com/images/bus.jpg", target_class=0)
print(f"RLVR Reward Signal: {reward}")

Используя облачные платформы, такие как Ultralytics Platform, для развертывания этих верификаторов восприятия, разработчики могут создавать надежные и масштабируемые конвейеры RLVR, которые обучают следующее поколение автономных агентов и агентов рассуждения.

Explore solutions

Real-time AI that works with your team

ИИ в робототехнике

Делай свои машины умнее с помощью моделей Ultralytics YOLO. ИИ машинного зрения в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI позволяет инспектировать посылки, сортировать их, отслеживать транспортные средства и контролировать безопасность на складе в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в розничной торговле

Переосмысли ритейл с помощью моделей Ultralytics YOLO. Vision AI расширяет возможности отслеживания запасов, мониторинга полок, управления очередями и более глубокого понимания клиентов.
Узнать больше
Real-time AI that works with your team

ИИ в здравоохранении

Создавай решения для здравоохранения с помощью моделей Ultralytics YOLO. ИИ для зрения в медицине ускоряет анализ медицинских изображений, делает диагностику более точной, а мониторинг пациентов — эффективнее.
Узнать больше
Real-time AI that works with your team

ИИ в производстве

Оптимизируй производство с помощью моделей Ultralytics YOLO. Vision AI управляет контролем качества, обнаружением дефектов, соблюдением СИЗ и автоматизацией сборочных линий.
Узнать больше
Real-time AI that works with your operation

ИИ в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. ИИ для зрения повышает безопасность дорожного движения, помогает водителю и способствует автоматизации транспортных средств для создания более «умных» дорог.
Узнать больше
Real-time AI tailored to your operation

ИИ в сельском хозяйстве

Внедряй ИИ в «умное» сельское хозяйство с помощью моделей Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание скота и точное земледелие для получения более высоких и «умных» урожаев.
Узнать больше
Real-time AI that works with your team

ИИ в робототехнике

Делай свои машины умнее с помощью моделей Ultralytics YOLO. ИИ машинного зрения в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI позволяет инспектировать посылки, сортировать их, отслеживать транспортные средства и контролировать безопасность на складе в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в розничной торговле

Переосмысли ритейл с помощью моделей Ultralytics YOLO. Vision AI расширяет возможности отслеживания запасов, мониторинга полок, управления очередями и более глубокого понимания клиентов.
Узнать больше
Real-time AI that works with your team

ИИ в здравоохранении

Создавай решения для здравоохранения с помощью моделей Ultralytics YOLO. ИИ для зрения в медицине ускоряет анализ медицинских изображений, делает диагностику более точной, а мониторинг пациентов — эффективнее.
Узнать больше
Real-time AI that works with your team

ИИ в производстве

Оптимизируй производство с помощью моделей Ultralytics YOLO. Vision AI управляет контролем качества, обнаружением дефектов, соблюдением СИЗ и автоматизацией сборочных линий.
Узнать больше
Real-time AI that works with your operation

ИИ в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. ИИ для зрения повышает безопасность дорожного движения, помогает водителю и способствует автоматизации транспортных средств для создания более «умных» дорог.
Узнать больше
Real-time AI tailored to your operation

ИИ в сельском хозяйстве

Внедряй ИИ в «умное» сельское хозяйство с помощью моделей Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание скота и точное земледелие для получения более высоких и «умных» урожаев.
Узнать больше
Real-time AI that works with your team

ИИ в робототехнике

Делай свои машины умнее с помощью моделей Ultralytics YOLO. ИИ машинного зрения в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI позволяет инспектировать посылки, сортировать их, отслеживать транспортные средства и контролировать безопасность на складе в реальном времени.
Узнать больше
Real-time AI that works with your team

ИИ в розничной торговле

Переосмысли ритейл с помощью моделей Ultralytics YOLO. Vision AI расширяет возможности отслеживания запасов, мониторинга полок, управления очередями и более глубокого понимания клиентов.
Узнать больше
Real-time AI that works with your team

ИИ в здравоохранении

Создавай решения для здравоохранения с помощью моделей Ultralytics YOLO. ИИ для зрения в медицине ускоряет анализ медицинских изображений, делает диагностику более точной, а мониторинг пациентов — эффективнее.
Узнать больше
Real-time AI that works with your team

ИИ в производстве

Оптимизируй производство с помощью моделей Ultralytics YOLO. Vision AI управляет контролем качества, обнаружением дефектов, соблюдением СИЗ и автоматизацией сборочных линий.
Узнать больше
Real-time AI that works with your operation

ИИ в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. ИИ для зрения повышает безопасность дорожного движения, помогает водителю и способствует автоматизации транспортных средств для создания более «умных» дорог.
Узнать больше
Real-time AI tailored to your operation

ИИ в сельском хозяйстве

Внедряй ИИ в «умное» сельское хозяйство с помощью моделей Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание скота и точное земледелие для получения более высоких и «умных» урожаев.
Узнать больше

Давай строить будущее ИИ вместе!

Начни свой путь в будущее машинного обучения