Reinforcement Learning with Verifiable Rewards (RLVR)
Descubre el aprendizaje por refuerzo con recompensas verificables (RLVR). Aprende a entrenar IA avanzada con retroalimentación determinista y Ultralytics YOLO26.
El aprendizaje por refuerzo con recompensas verificables (RLVR) es un paradigma de entrenamiento avanzado que se utiliza para mejorar las capacidades de razonamiento y resolución de problemas de los modelos de inteligencia artificial (AI). A diferencia de los métodos de entrenamiento tradicionales, que se basan en datos de preferencias anotados por personas, RLVR utiliza sistemas basados en reglas deterministas para evaluar las respuestas de un modelo. Al proporcionar una recompensa binaria objetiva —por ejemplo, si el código generado compila o si una ecuación matemática se resuelve correctamente—, RLVR permite que los modelos aprendan mediante una exploración sin restricciones. Este ciclo de retroalimentación objetivo es uno de los principales impulsores de los recientes avances en modelos de razonamiento muy capaces, ya que les permite descubrir vías lógicas complejas y óptimas sin intervención humana continua.
Principios fundamentales de RLVR#
En los entornos estándar de aprendizaje automático (ML), un agente de IA aprende maximizando una señal de recompensa. En RLVR, esta señal la genera un sistema de programación rígido, no el juicio subjetivo de una persona. El proceso de aprendizaje se basa en unos pocos pasos fundamentales:
- Estrategia de exploración: El modelo genera varias soluciones posibles o vías de razonamiento para una instrucción determinada, a menudo mediante instrucciones de cadena de pensamiento para desglosar tareas complejas.
- Verificación determinista: Una herramienta externa —como un compilador de Python, una calculadora o un sistema de percepción de visión artificial (CV)— comprueba el resultado final con respecto a criterios objetivos de éxito.
- Optimización de la política: Si se verifica que el resultado es correcto, el modelo recibe una recompensa positiva. A continuación, la política del modelo se actualiza mediante algoritmos de optimización como la optimización de políticas relativas de grupo (GRPO) o la optimización de políticas proximales (PPO) para favorecer las vías de razonamiento que han tenido éxito.
Este enfoque mejora significativamente la eficiencia de la latencia de inferencia de un modelo durante el entrenamiento y fomenta la aparición de capacidades de razonamiento; es una técnica utilizada recientemente para entrenar modelos muy capaces como DeepSeek-R1.
RLVR frente a RLHF y PRM#
Es importante distinguir RLVR de otros paradigmas de alineamiento y entrenamiento del ecosistema de la IA:
- Frente al aprendizaje por refuerzo a partir de retroalimentación humana (RLHF): RLHF se basa en un sistema de modelado de recompensas aprendido a partir de preferencias humanas subjetivas. RLVR elimina el cuello de botella de la intervención humana al basarse exclusivamente en verdades objetivas y programáticas, lo que lo hace muy escalable para tareas con respuestas definitivamente correctas o incorrectas.
- Frente al modelo de recompensa de procesos (PRM): Mientras que los PRM ofrecen retroalimentación detallada paso a paso a lo largo de la trayectoria de razonamiento de un modelo, RLVR suele centrarse en el resultado verificable al final del proceso. Sin embargo, la investigación reciente de 2025 indica que optimizar una recompensa final verificable en RLVR también incentiva implícitamente que los pasos intermedios de razonamiento sean correctos.
Aplicaciones en el mundo real#
RLVR está transformando la forma de entrenar sistemas complejos de IA en distintos ámbitos deterministas:
- Razonamiento matemático: Los grandes modelos de razonamiento, como los de la serie o de OpenAI, utilizan RLVR para resolver teoremas matemáticos complejos. El verificador actúa como un motor que demuestra de forma concluyente si la respuesta derivada por el modelo es correcta, lo que mejora significativamente el rendimiento en conjuntos de datos de referencia.
- Ingeniería de software y generación de código: Los asistentes de programación con IA utilizan RLVR para escribir, depurar y optimizar código. La recompensa verificable se obtiene cuando el código generado compila correctamente y supera una batería de pruebas unitarias automatizadas.
- Agentes autónomos de visión: En entornos físicos, los agentes autónomos reciben recompensas verificables al llegar a un destino o manipular un objeto correctamente. En estos entornos, los modelos de visión actúan como verificadores de las condiciones.
Implementar una recompensa verificable en la IA de visión#
En entornos físicos y visuales, los modelos de percepción como Ultralytics YOLO26 pueden actuar como verificadores programáticos dentro de un ciclo de RLVR. Por ejemplo, si el objetivo de un agente de IA es mover un objeto a una zona concreta, el modelo YOLO puede verificar el éxito detectando la presencia del objeto en esa zona.
El siguiente fragmento de Python muestra un verificador programático conceptual que utiliza el paquete ultralytics.
from ultralytics import YOLO
# Load a YOLO26 model to act as the programmatic verifier
verifier_model = YOLO("yolo26n.pt")
def get_verifiable_reward(image_path: str, target_class: int) -> float:
"""Returns a verifiable reward of 1.0 if the target object is detected."""
results = verifier_model(image_path)
# Check if the desired class (e.g., 0 for 'person') exists in the detections
detected_classes = results[0].boxes.cls.tolist()
if target_class in detected_classes:
return 1.0 # Verifiable success
return 0.0 # Verifiable failure
# Simulate an agent's environment state check
reward = get_verifiable_reward("https://ultralytics.com/images/bus.jpg", target_class=0)
print(f"RLVR Reward Signal: {reward}")Al utilizar plataformas en la nube como la plataforma Ultralytics para desplegar estos verificadores de percepción, los desarrolladores pueden crear flujos de trabajo de RLVR robustos y escalables para entrenar la próxima generación de agentes autónomos y de razonamiento.









