YOLO Vision 2026:
Назад к глоссарию Ultralytics

Process Reward Model (PRM)

Исследуй, как модели вознаграждения процесса (PRM) улучшают рассуждения ИИ. Узнай, как пошаговая обратная связь в RLHF обеспечивает логические, безопасные пути для LLM и Ultralytics YOLO26.

Оценка сложных моделей artificial intelligence требует большего, чем просто проверка правильности окончательного ответа. Высокоспециализированный метод reinforcement learning присваивает математические оценки каждому промежуточному шагу, который делает ИИ во время выполнения задачи, обеспечивая dense, step-level feedback. Такой детальный подход гарантирует, что модель не только приходит к правильному результату, но и следует логичным, безопасным и проверяемым путям для его достижения.

Process Reward Models vs. Outcome Reward Models#

В более широком контексте Reward Modeling важно различать надзор на основе процесса и на основе результатов. Традиционные модели Outcome Reward Models (ORMs) выдают единую разреженную награду в самом конце генерации. Хотя ORMs проще в обучении, они имеют серьезный недостаток в сложных задачах: они могут непреднамеренно поощрять модели, которые приходят к правильному ответу с помощью ошибочной логики или hallucinations.

Процессная модель вознаграждения Process Reward Model (PRM) решает эту проблему путем оценки всей траектории рассуждений. Как популяризировано в фундаментальных исследованиях OpenAI research в таких работах, как Let's Verify Step by Step, PRM применяет stepwise supervision к каждой мысли или действию. Это критически важный компонент передовых конвейеров Reinforcement Learning from Human Feedback (RLHF), так как он активно направляет оптимизацию политики с помощью таких алгоритмов, как Proximal Policy Optimization (PPO).

Реальные приложения#

PRM меняют то, как работают Large Language Models (LLMs) и автономные системы в критически важных средах:

  • Mathematical Reasoning: Оценивая уравнения строка за строкой, PRM позволяют моделям использовать такие алгоритмы, как Best-of-N (BoN) sampling или Monte Carlo Tree Search (MCTS), чтобы исследовать множество путей решения и выбирать наиболее логически обоснованную последовательность.
  • Code Generation: При создании программного обеспечения простой проверки работоспособности финального скрипта недостаточно. PRM обеспечивают процессный надзор, оценивая отдельные функции и блоки логики, чтобы гарантировать эффективность, безопасность и поддерживаемость кода.
  • Operations Research and Visual Agents: Недавние достижения в 2025 и 2026 годах вывели PRM за рамки текста. Например, исследование операций теперь использует PRM для проверки сложных алгоритмов планирования. Аналогичным образом, визуальные AI agents, оснащенные надежными движками computer vision, такими как Ultralytics YOLO26, получают пошаговые вознаграждения за навигацию в физическом пространстве, а не просто единовременную награду за достижение пункта назначения.

Реализация обратной связи на уровне шагов#

Обучение PRM требует работы с обширными наборами данных, где каждый подшаг оценивается людьми или более сильными моделями ИИ. Управление такими интенсивными рабочими процессами data annotation упрощается с помощью облачных инструментов, таких как Ultralytics Platform, которые оптимизируют организацию проектов и развертывание.

Во время инференса или model optimization PRM вычисляет кумулятивную потерю или награду на основе цепочки шагов. Следующий концептуальный фрагмент Python с использованием torch демонстрирует, как поощрения на уровне шагов штрафуются в случае сбоя промежуточного шага — это распространенный подход, описанный в PyTorch documentation для оценки последовательностей:

import torch

# Simulate reward scores from a PRM for 3 consecutive reasoning steps
# Scores represent the probability of correctness for each step (0.0 to 1.0)
step_rewards = torch.tensor([0.95, 0.80, 0.15], requires_grad=True)

# The PRM aggregates the scores, heavily penalizing the poor 3rd step
# Negative log-likelihood is commonly used to optimize the trajectory
prm_loss = -torch.log(step_rewards).mean()

print(f"Calculated PRM Loss: {prm_loss.item():.4f}")
# During RLHF, this loss would guide hyperparameter tuning and model updates

Гарантируя, что каждый промежуточный шаг соответствует ожидаемому поведению, разработчики могут развертывать высоко надежные системы. Сочетание процессного надзора с непрерывной hyperparameter tuning позволяет моделям нового поколения по-настоящему безопасно и эффективно рассуждать при решении задач.

Explore solutions

Real-time AI that works with your team

Компьютерное зрение в робототехнике

Делай свои машины умнее с помощью моделей Ultralytics YOLO. ИИ машинного зрения в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI позволяет инспектировать посылки, сортировать их, отслеживать транспортные средства и контролировать безопасность на складе в реальном времени.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в ритейле

Переосмысли ритейл с помощью моделей Ultralytics YOLO. Vision AI расширяет возможности отслеживания запасов, мониторинга полок, управления очередями и более глубокого понимания клиентов.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в здравоохранении

Создавай решения для здравоохранения с помощью моделей Ultralytics YOLO. ИИ для зрения в медицине ускоряет анализ медицинских изображений, делает диагностику более точной, а мониторинг пациентов — эффективнее.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в производстве

Оптимизируй производство с помощью моделей Ultralytics YOLO. Vision AI управляет контролем качества, обнаружением дефектов, соблюдением СИЗ и автоматизацией сборочных линий.
Узнать больше
Real-time AI that works with your operation

Компьютерное зрение в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. ИИ для зрения повышает безопасность дорожного движения, помогает водителю и способствует автоматизации транспортных средств для создания более «умных» дорог.
Узнать больше
Real-time AI tailored to your operation

Компьютерное зрение в сельском хозяйстве

Внедряй ИИ в «умное» сельское хозяйство с помощью моделей Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание скота и точное земледелие для получения более высоких и «умных» урожаев.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в робототехнике

Делай свои машины умнее с помощью моделей Ultralytics YOLO. ИИ машинного зрения в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI позволяет инспектировать посылки, сортировать их, отслеживать транспортные средства и контролировать безопасность на складе в реальном времени.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в ритейле

Переосмысли ритейл с помощью моделей Ultralytics YOLO. Vision AI расширяет возможности отслеживания запасов, мониторинга полок, управления очередями и более глубокого понимания клиентов.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в здравоохранении

Создавай решения для здравоохранения с помощью моделей Ultralytics YOLO. ИИ для зрения в медицине ускоряет анализ медицинских изображений, делает диагностику более точной, а мониторинг пациентов — эффективнее.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в производстве

Оптимизируй производство с помощью моделей Ultralytics YOLO. Vision AI управляет контролем качества, обнаружением дефектов, соблюдением СИЗ и автоматизацией сборочных линий.
Узнать больше
Real-time AI that works with your operation

Компьютерное зрение в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. ИИ для зрения повышает безопасность дорожного движения, помогает водителю и способствует автоматизации транспортных средств для создания более «умных» дорог.
Узнать больше
Real-time AI tailored to your operation

Компьютерное зрение в сельском хозяйстве

Внедряй ИИ в «умное» сельское хозяйство с помощью моделей Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание скота и точное земледелие для получения более высоких и «умных» урожаев.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в робототехнике

Делай свои машины умнее с помощью моделей Ultralytics YOLO. ИИ машинного зрения в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI позволяет инспектировать посылки, сортировать их, отслеживать транспортные средства и контролировать безопасность на складе в реальном времени.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в ритейле

Переосмысли ритейл с помощью моделей Ultralytics YOLO. Vision AI расширяет возможности отслеживания запасов, мониторинга полок, управления очередями и более глубокого понимания клиентов.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в здравоохранении

Создавай решения для здравоохранения с помощью моделей Ultralytics YOLO. ИИ для зрения в медицине ускоряет анализ медицинских изображений, делает диагностику более точной, а мониторинг пациентов — эффективнее.
Узнать больше
Real-time AI that works with your team

Компьютерное зрение в производстве

Оптимизируй производство с помощью моделей Ultralytics YOLO. Vision AI управляет контролем качества, обнаружением дефектов, соблюдением СИЗ и автоматизацией сборочных линий.
Узнать больше
Real-time AI that works with your operation

Компьютерное зрение в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. ИИ для зрения повышает безопасность дорожного движения, помогает водителю и способствует автоматизации транспортных средств для создания более «умных» дорог.
Узнать больше
Real-time AI tailored to your operation

Компьютерное зрение в сельском хозяйстве

Внедряй ИИ в «умное» сельское хозяйство с помощью моделей Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание скота и точное земледелие для получения более высоких и «умных» урожаев.
Узнать больше

Давай строить будущее ИИ вместе!

Начни свой путь в будущее машинного обучения