Reinforcement Learning with Verifiable Rewards (RLVR)
Descubre el aprendizaje por refuerzo con recompensas verificables (RLVR). Aprende a entrenar IA avanzada mediante retroalimentación determinista y Ultralytics YOLO26.
El aprendizaje por refuerzo con recompensas verificables (RLVR) es un paradigma de entrenamiento avanzado utilizado para mejorar las capacidades de razonamiento y resolución de problemas de los modelos de inteligencia artificial (IA). A diferencia de los métodos de entrenamiento tradicionales que dependen de datos de preferencias anotados por humanos, el RLVR utiliza sistemas deterministas basados en reglas para evaluar la salida de un modelo. Al proporcionar una recompensa objetiva binaria, como determinar si un fragmento de código generado se compila o si una ecuación matemática se resuelve correctamente, el RLVR permite que los modelos aprendan mediante una exploración sin restricciones. Este bucle de retroalimentación objetiva es un impulsor clave detrás de los avances recientes en modelos de razonamiento altamente capaces, lo que les permite descubrir rutas lógicas óptimas y complejas sin la intervención humana continua.
Principios fundamentales de RLVR#
En los entornos estándar de aprendizaje automático (ML), un agente de IA aprende maximizando una señal de recompensa. En el RLVR, esta señal de recompensa es generada por un sistema de programación rígido en lugar de un juicio humano subjetivo. El proceso de aprendizaje se basa en unos pocos pasos fundamentales:
- Estrategia de exploración: El modelo genera múltiples soluciones potenciales o rutas de razonamiento para un aviso dado, a menudo utilizando indicaciones de cadena de pensamiento para desglosar tareas complejas.
- Verificación determinista: Una herramienta externa, como un compilador de Python, una calculadora o un sistema de percepción de visión artificial (CV), comprueba la salida final frente a criterios de éxito objetivos.
- Optimización de políticas: Si la salida es verificablemente correcta, el modelo recibe una recompensa positiva. La política del modelo se actualiza utilizando algoritmos de optimización como la optimización de políticas relativas de grupo (GRPO) o la optimización de políticas próxima (PPO) para favorecer las rutas de razonamiento exitosas.
Este enfoque mejora significativamente la eficiencia de la latencia de inferencia de un modelo en el momento del entrenamiento y fomenta capacidades de razonamiento emergentes, una técnica utilizada recientemente para entrenar modelos altamente capaces como DeepSeek-R1.
RLVR frente a RLHF y PRM#
Es importante diferenciar RLVR de otros paradigmas de alineación y entrenamiento en el ecosistema de IA:
- Frente al aprendizaje por refuerzo a partir de retroalimentación humana (RLHF): El RLHF se basa en un sistema de modelado de recompensas aprendido que se entrena con preferencias humanas subjetivas. El RLVR elimina el cuello de botella del factor humano al basarse estrictamente en verdades programáticas y objetivas, lo que lo hace altamente escalable para tareas con respuestas definitivas correctas o incorrectas.
- Frente al modelo de recompensa de procesos (PRM): Si bien los PRM proporcionan comentarios granulares paso a paso a lo largo de la trayectoria de razonamiento de un modelo, el RLVR normalmente se centra en el resultado verificable al final de un proceso. Sin embargo, la investigación reciente de 2025 indica que la optimización para una recompensa verificable final en el RLVR incentiva implícitamente también los pasos de razonamiento intermedios correctos.
Aplicaciones en el mundo real#
RLVR está transformando cómo se entrenan sistemas de IA complejos en varios dominios deterministas:
- Razonamiento matemático: Los grandes modelos de razonamiento como la serie o de OpenAI aprovechan el RLVR para resolver teoremas matemáticos complejos. El verificador actúa como un motor que demuestra de forma definitiva si la respuesta derivada del modelo es correcta, lo que impulsa significativamente el rendimiento del conjunto de datos de referencia.
- Ingeniería de software y generación de código: Los asistentes de codificación de IA utilizan el RLVR para escribir, depurar y optimizar código. La recompensa verificable se logra cuando el código generado se compila con éxito y pasa un conjunto de pruebas unitarias automatizadas.
- Agentes de visión autónomos: En entornos físicos, los agentes autónomos reciben recompensas verificables al llegar a un destino objetivo o al manipular con éxito un objeto. Los modelos de visión actúan como el comprobador de condiciones verificables en estos espacios.
Implementación de una recompensa verificable en IA de visión#
En entornos físicos y visuales, los modelos de percepción como Ultralytics YOLO26 pueden servir como verificadores programáticos en un bucle de RLVR. Por ejemplo, si el objetivo de un agente de IA es mover un objeto a una zona específica, el modelo YOLO puede verificar el éxito detectando la presencia del objeto en dicha zona.
El siguiente fragmento de Python demuestra un verificador programático conceptual que utiliza el paquete ultralytics.
from ultralytics import YOLO
# Load a YOLO26 model to act as the programmatic verifier
verifier_model = YOLO("yolo26n.pt")
def get_verifiable_reward(image_path: str, target_class: int) -> float:
"""Returns a verifiable reward of 1.0 if the target object is detected."""
results = verifier_model(image_path)
# Check if the desired class (e.g., 0 for 'person') exists in the detections
detected_classes = results[0].boxes.cls.tolist()
if target_class in detected_classes:
return 1.0 # Verifiable success
return 0.0 # Verifiable failure
# Simulate an agent's environment state check
reward = get_verifiable_reward("https://ultralytics.com/images/bus.jpg", target_class=0)
print(f"RLVR Reward Signal: {reward}")Al aprovechar las plataformas en la nube como Ultralytics Platform para implementar estos verificadores de percepción, los desarrolladores pueden construir canales de RLVR sólidos y escalables que entrenan a la próxima generación de agentes autónomos y de razonamiento.






