YOLO Vision 2026:
Volver al glosario de Ultralytics

Process Reward Model (PRM)

Explora cómo los modelos de recompensa de procesos (PRM) mejoran el razonamiento de la IA. Aprende cómo la retroalimentación a nivel de paso en RLHF asegura caminos lógicos y seguros para los LLM y Ultralytics YOLO26.

Evaluar modelos complejos de artificial intelligence requiere más que simplemente comprobar si la respuesta final es correcta. Una técnica altamente especializada de reinforcement learning asigna puntuaciones matemáticas a cada paso intermedio que toma una IA durante una tarea, proporcionando dense, step-level feedback. Este enfoque granular garantiza que el modelo no solo llegue al destino correcto, sino que también siga rutas lógicas, seguras y verificables para llegar hasta allí.

Modelos de recompensa de proceso frente a modelos de recompensa de resultado#

En el contexto más amplio de Reward Modeling, es importante distinguir entre la supervisión basada en procesos y la basada en resultados. Los Outcome Reward Models (ORMs) tradicionales proporcionan una única recompensa dispersa al final de una generación. Aunque los ORMs son más fáciles de entrenar, sufren de un inconveniente importante en tareas complejas: pueden recompensar inadvertidamente a modelos que llegan a la respuesta correcta mediante una lógica defectuosa o hallucinations.

Un Process Reward Model (PRM) resuelve esto evaluando toda la trayectoria de razonamiento. Como se popularizó en la investigación fundamental de OpenAI research en artículos como Let's Verify Step by Step, un PRM aplica stepwise supervision a cada pensamiento o acción. Este es un componente crítico de las canalizaciones avanzadas de Reinforcement Learning from Human Feedback (RLHF), ya que guía activamente la optimización de políticas utilizando algoritmos como Proximal Policy Optimization (PPO).

Aplicaciones en el mundo real#

Los PRM están transformando la forma en que los Large Language Models (LLMs) y los sistemas autónomos operan en entornos de alto riesgo:

  • Mathematical Reasoning: Al evaluar ecuaciones línea por línea, los PRM permiten a los modelos utilizar algoritmos como Best-of-N (BoN) sampling o Monte Carlo Tree Search (MCTS) para explorar múltiples rutas de solución y seleccionar la secuencia más sólida lógicamente.
  • Code Generation: Al generar software, simplemente comprobar si el script final se ejecuta es insuficiente. Los PRM proporcionan supervisión de procesos, puntuando funciones individuales y bloques lógicos para garantizar que el código sea eficiente, seguro y fácil de mantener.
  • Operations Research and Visual Agents: Los avances recientes en 2025 y 2026 han ampliado los PRM más allá del texto. Por ejemplo, la investigación de operaciones ahora utiliza PRMs para validar algoritmos de programación complejos. De manera similar, los AI agents visuales equipados con motores robustos de computer vision como Ultralytics YOLO26 reciben recompensas paso a paso para navegar por entornos físicos, en lugar de una sola recompensa por llegar a un destino.

Implementación de la retroalimentación a nivel de paso#

Entrenar un PRM requiere gestionar extensos conjuntos de datos donde cada subpaso es evaluado por humanos o modelos de IA más fuertes. Gestionar estos flujos de trabajo intensivos de data annotation se hace más sencillo con herramientas basadas en la nube como la Ultralytics Platform, que optimizan la organización y el despliegue de proyectos.

Durante la inferencia o la model optimization, el PRM calcula una pérdida o recompensa acumulativa basada en la cadena de pasos. El siguiente fragmento conceptual de Python que utiliza torch demuestra cómo se penalizan las recompensas a nivel de paso si un paso intermedio falla, un enfoque común que se encuentra en la PyTorch documentation para la puntuación de secuencias:

import torch

# Simulate reward scores from a PRM for 3 consecutive reasoning steps
# Scores represent the probability of correctness for each step (0.0 to 1.0)
step_rewards = torch.tensor([0.95, 0.80, 0.15], requires_grad=True)

# The PRM aggregates the scores, heavily penalizing the poor 3rd step
# Negative log-likelihood is commonly used to optimize the trajectory
prm_loss = -torch.log(step_rewards).mean()

print(f"Calculated PRM Loss: {prm_loss.item():.4f}")
# During RLHF, this loss would guide hyperparameter tuning and model updates

Al garantizar que cada paso intermedio esté alineado con el comportamiento esperado, los desarrolladores pueden desplegar sistemas altamente confiables. Combinar la supervisión a nivel de proceso con la hyperparameter tuning continua permite que los modelos de próxima generación razonen verdaderamente a través de los problemas de forma segura y eficaz.

Explore solutions

Real-time AI that works with your team

Visión por computador en robótica

Potencia máquinas más inteligentes con modelos Ultralytics YOLO. La IA de visión en robótica impulsa la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Real-time AI that works with your team

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La visión artificial por IA permite la inspección de paquetes, clasificación, seguimiento de vehículos y monitoreo de seguridad en almacenes en tiempo real.
Más información
Real-time AI that works with your team

Visión artificial en el comercio minorista

Reimagina el comercio minorista con los modelos de Ultralytics YOLO. La visión artificial por IA potencia el seguimiento de inventario, el monitoreo de estantes, la gestión de colas y mejores perspectivas sobre los clientes.
Más información
Real-time AI that works with your team

Visión artificial en la sanidad

Crea soluciones de salud con los modelos de Ultralytics YOLO. La IA de visión en la sanidad potencia imágenes médicas más rápidas, diagnósticos más inteligentes y supervisión de pacientes.
Más información
Real-time AI that works with your team

Visión artificial en la fabricación

Optimiza la fabricación con los modelos de Ultralytics YOLO. La visión artificial por IA impulsa el control de calidad, la detección de defectos, el cumplimiento del uso de PPE y la automatización de la línea de montaje.
Más información
Real-time AI that works with your operation

Visión artificial en el sector automotriz

Aplica la visión artificial en el sector automotriz con los modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para carreteras más inteligentes.
Más información
Real-time AI tailored to your operation

Visión artificial en la agricultura

Lleva la visión artificial a la agricultura inteligente con los modelos de Ultralytics YOLO. Potencia el seguimiento de cultivos, el control del ganado y la agricultura de precisión para obtener rendimientos mayores y más inteligentes.
Más información
Real-time AI that works with your team

Visión por computador en robótica

Potencia máquinas más inteligentes con modelos Ultralytics YOLO. La IA de visión en robótica impulsa la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Real-time AI that works with your team

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La visión artificial por IA permite la inspección de paquetes, clasificación, seguimiento de vehículos y monitoreo de seguridad en almacenes en tiempo real.
Más información
Real-time AI that works with your team

Visión artificial en el comercio minorista

Reimagina el comercio minorista con los modelos de Ultralytics YOLO. La visión artificial por IA potencia el seguimiento de inventario, el monitoreo de estantes, la gestión de colas y mejores perspectivas sobre los clientes.
Más información
Real-time AI that works with your team

Visión artificial en la sanidad

Crea soluciones de salud con los modelos de Ultralytics YOLO. La IA de visión en la sanidad potencia imágenes médicas más rápidas, diagnósticos más inteligentes y supervisión de pacientes.
Más información
Real-time AI that works with your team

Visión artificial en la fabricación

Optimiza la fabricación con los modelos de Ultralytics YOLO. La visión artificial por IA impulsa el control de calidad, la detección de defectos, el cumplimiento del uso de PPE y la automatización de la línea de montaje.
Más información
Real-time AI that works with your operation

Visión artificial en el sector automotriz

Aplica la visión artificial en el sector automotriz con los modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para carreteras más inteligentes.
Más información
Real-time AI tailored to your operation

Visión artificial en la agricultura

Lleva la visión artificial a la agricultura inteligente con los modelos de Ultralytics YOLO. Potencia el seguimiento de cultivos, el control del ganado y la agricultura de precisión para obtener rendimientos mayores y más inteligentes.
Más información
Real-time AI that works with your team

Visión por computador en robótica

Potencia máquinas más inteligentes con modelos Ultralytics YOLO. La IA de visión en robótica impulsa la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Real-time AI that works with your team

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La visión artificial por IA permite la inspección de paquetes, clasificación, seguimiento de vehículos y monitoreo de seguridad en almacenes en tiempo real.
Más información
Real-time AI that works with your team

Visión artificial en el comercio minorista

Reimagina el comercio minorista con los modelos de Ultralytics YOLO. La visión artificial por IA potencia el seguimiento de inventario, el monitoreo de estantes, la gestión de colas y mejores perspectivas sobre los clientes.
Más información
Real-time AI that works with your team

Visión artificial en la sanidad

Crea soluciones de salud con los modelos de Ultralytics YOLO. La IA de visión en la sanidad potencia imágenes médicas más rápidas, diagnósticos más inteligentes y supervisión de pacientes.
Más información
Real-time AI that works with your team

Visión artificial en la fabricación

Optimiza la fabricación con los modelos de Ultralytics YOLO. La visión artificial por IA impulsa el control de calidad, la detección de defectos, el cumplimiento del uso de PPE y la automatización de la línea de montaje.
Más información
Real-time AI that works with your operation

Visión artificial en el sector automotriz

Aplica la visión artificial en el sector automotriz con los modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para carreteras más inteligentes.
Más información
Real-time AI tailored to your operation

Visión artificial en la agricultura

Lleva la visión artificial a la agricultura inteligente con los modelos de Ultralytics YOLO. Potencia el seguimiento de cultivos, el control del ganado y la agricultura de precisión para obtener rendimientos mayores y más inteligentes.
Más información

¡Construyamos juntos el futuro de la IA!

Comienza tu viaje con el futuro del aprendizaje automático