YOLO Vision 2026:
Volver al glosario de Ultralytics

Reinforcement Learning with Verifiable Rewards (RLVR)

Descubre el aprendizaje por refuerzo con recompensas verificables (RLVR). Aprende a entrenar IA avanzada mediante retroalimentación determinista y Ultralytics YOLO26.

El aprendizaje por refuerzo con recompensas verificables (RLVR) es un paradigma de entrenamiento avanzado utilizado para mejorar las capacidades de razonamiento y resolución de problemas de los modelos de inteligencia artificial (IA). A diferencia de los métodos de entrenamiento tradicionales que dependen de datos de preferencias anotados por humanos, el RLVR utiliza sistemas deterministas basados en reglas para evaluar la salida de un modelo. Al proporcionar una recompensa objetiva binaria, como determinar si un fragmento de código generado se compila o si una ecuación matemática se resuelve correctamente, el RLVR permite que los modelos aprendan mediante una exploración sin restricciones. Este bucle de retroalimentación objetiva es un impulsor clave detrás de los avances recientes en modelos de razonamiento altamente capaces, lo que les permite descubrir rutas lógicas óptimas y complejas sin la intervención humana continua.

Principios fundamentales de RLVR#

En los entornos estándar de aprendizaje automático (ML), un agente de IA aprende maximizando una señal de recompensa. En el RLVR, esta señal de recompensa es generada por un sistema de programación rígido en lugar de un juicio humano subjetivo. El proceso de aprendizaje se basa en unos pocos pasos fundamentales:

  • Estrategia de exploración: El modelo genera múltiples soluciones potenciales o rutas de razonamiento para un aviso dado, a menudo utilizando indicaciones de cadena de pensamiento para desglosar tareas complejas.
  • Verificación determinista: Una herramienta externa, como un compilador de Python, una calculadora o un sistema de percepción de visión artificial (CV), comprueba la salida final frente a criterios de éxito objetivos.
  • Optimización de políticas: Si la salida es verificablemente correcta, el modelo recibe una recompensa positiva. La política del modelo se actualiza utilizando algoritmos de optimización como la optimización de políticas relativas de grupo (GRPO) o la optimización de políticas próxima (PPO) para favorecer las rutas de razonamiento exitosas.

Este enfoque mejora significativamente la eficiencia de la latencia de inferencia de un modelo en el momento del entrenamiento y fomenta capacidades de razonamiento emergentes, una técnica utilizada recientemente para entrenar modelos altamente capaces como DeepSeek-R1.

RLVR frente a RLHF y PRM#

Es importante diferenciar RLVR de otros paradigmas de alineación y entrenamiento en el ecosistema de IA:

Aplicaciones en el mundo real#

RLVR está transformando cómo se entrenan sistemas de IA complejos en varios dominios deterministas:

  • Razonamiento matemático: Los grandes modelos de razonamiento como la serie o de OpenAI aprovechan el RLVR para resolver teoremas matemáticos complejos. El verificador actúa como un motor que demuestra de forma definitiva si la respuesta derivada del modelo es correcta, lo que impulsa significativamente el rendimiento del conjunto de datos de referencia.
  • Ingeniería de software y generación de código: Los asistentes de codificación de IA utilizan el RLVR para escribir, depurar y optimizar código. La recompensa verificable se logra cuando el código generado se compila con éxito y pasa un conjunto de pruebas unitarias automatizadas.
  • Agentes de visión autónomos: En entornos físicos, los agentes autónomos reciben recompensas verificables al llegar a un destino objetivo o al manipular con éxito un objeto. Los modelos de visión actúan como el comprobador de condiciones verificables en estos espacios.

Implementación de una recompensa verificable en IA de visión#

En entornos físicos y visuales, los modelos de percepción como Ultralytics YOLO26 pueden servir como verificadores programáticos en un bucle de RLVR. Por ejemplo, si el objetivo de un agente de IA es mover un objeto a una zona específica, el modelo YOLO puede verificar el éxito detectando la presencia del objeto en dicha zona.

El siguiente fragmento de Python demuestra un verificador programático conceptual que utiliza el paquete ultralytics.

from ultralytics import YOLO

# Load a YOLO26 model to act as the programmatic verifier
verifier_model = YOLO("yolo26n.pt")


def get_verifiable_reward(image_path: str, target_class: int) -> float:
    """Returns a verifiable reward of 1.0 if the target object is detected."""
    results = verifier_model(image_path)

    # Check if the desired class (e.g., 0 for 'person') exists in the detections
    detected_classes = results[0].boxes.cls.tolist()
    if target_class in detected_classes:
        return 1.0  # Verifiable success
    return 0.0  # Verifiable failure


# Simulate an agent's environment state check
reward = get_verifiable_reward("https://ultralytics.com/images/bus.jpg", target_class=0)
print(f"RLVR Reward Signal: {reward}")

Al aprovechar las plataformas en la nube como Ultralytics Platform para implementar estos verificadores de percepción, los desarrolladores pueden construir canales de RLVR sólidos y escalables que entrenan a la próxima generación de agentes autónomos y de razonamiento.

Explore solutions

Real-time AI that works with your team

IA en robótica

Potencia máquinas más inteligentes con modelos Ultralytics YOLO. La IA de visión en robótica impulsa la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Real-time AI that works with your team

IA en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La visión artificial por IA permite la inspección de paquetes, clasificación, seguimiento de vehículos y monitoreo de seguridad en almacenes en tiempo real.
Más información
Real-time AI that works with your team

IA en el sector minorista

Reimagina el comercio minorista con los modelos de Ultralytics YOLO. La visión artificial por IA potencia el seguimiento de inventario, el monitoreo de estantes, la gestión de colas y mejores perspectivas sobre los clientes.
Más información
Real-time AI that works with your team

IA en la atención sanitaria

Crea soluciones de salud con los modelos de Ultralytics YOLO. La IA de visión en la sanidad potencia imágenes médicas más rápidas, diagnósticos más inteligentes y supervisión de pacientes.
Más información
Real-time AI that works with your team

IA en la fabricación

Optimiza la fabricación con los modelos de Ultralytics YOLO. La visión artificial por IA impulsa el control de calidad, la detección de defectos, el cumplimiento del uso de PPE y la automatización de la línea de montaje.
Más información
Real-time AI that works with your operation

IA en automoción

Aplica la visión artificial en el sector automotriz con los modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para carreteras más inteligentes.
Más información
Real-time AI tailored to your operation

IA en agricultura

Lleva la visión artificial a la agricultura inteligente con los modelos de Ultralytics YOLO. Potencia el seguimiento de cultivos, el control del ganado y la agricultura de precisión para obtener rendimientos mayores y más inteligentes.
Más información
Real-time AI that works with your team

IA en robótica

Potencia máquinas más inteligentes con modelos Ultralytics YOLO. La IA de visión en robótica impulsa la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Real-time AI that works with your team

IA en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La visión artificial por IA permite la inspección de paquetes, clasificación, seguimiento de vehículos y monitoreo de seguridad en almacenes en tiempo real.
Más información
Real-time AI that works with your team

IA en el sector minorista

Reimagina el comercio minorista con los modelos de Ultralytics YOLO. La visión artificial por IA potencia el seguimiento de inventario, el monitoreo de estantes, la gestión de colas y mejores perspectivas sobre los clientes.
Más información
Real-time AI that works with your team

IA en la atención sanitaria

Crea soluciones de salud con los modelos de Ultralytics YOLO. La IA de visión en la sanidad potencia imágenes médicas más rápidas, diagnósticos más inteligentes y supervisión de pacientes.
Más información
Real-time AI that works with your team

IA en la fabricación

Optimiza la fabricación con los modelos de Ultralytics YOLO. La visión artificial por IA impulsa el control de calidad, la detección de defectos, el cumplimiento del uso de PPE y la automatización de la línea de montaje.
Más información
Real-time AI that works with your operation

IA en automoción

Aplica la visión artificial en el sector automotriz con los modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para carreteras más inteligentes.
Más información
Real-time AI tailored to your operation

IA en agricultura

Lleva la visión artificial a la agricultura inteligente con los modelos de Ultralytics YOLO. Potencia el seguimiento de cultivos, el control del ganado y la agricultura de precisión para obtener rendimientos mayores y más inteligentes.
Más información
Real-time AI that works with your team

IA en robótica

Potencia máquinas más inteligentes con modelos Ultralytics YOLO. La IA de visión en robótica impulsa la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Real-time AI that works with your team

IA en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La visión artificial por IA permite la inspección de paquetes, clasificación, seguimiento de vehículos y monitoreo de seguridad en almacenes en tiempo real.
Más información
Real-time AI that works with your team

IA en el sector minorista

Reimagina el comercio minorista con los modelos de Ultralytics YOLO. La visión artificial por IA potencia el seguimiento de inventario, el monitoreo de estantes, la gestión de colas y mejores perspectivas sobre los clientes.
Más información
Real-time AI that works with your team

IA en la atención sanitaria

Crea soluciones de salud con los modelos de Ultralytics YOLO. La IA de visión en la sanidad potencia imágenes médicas más rápidas, diagnósticos más inteligentes y supervisión de pacientes.
Más información
Real-time AI that works with your team

IA en la fabricación

Optimiza la fabricación con los modelos de Ultralytics YOLO. La visión artificial por IA impulsa el control de calidad, la detección de defectos, el cumplimiento del uso de PPE y la automatización de la línea de montaje.
Más información
Real-time AI that works with your operation

IA en automoción

Aplica la visión artificial en el sector automotriz con los modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para carreteras más inteligentes.
Más información
Real-time AI tailored to your operation

IA en agricultura

Lleva la visión artificial a la agricultura inteligente con los modelos de Ultralytics YOLO. Potencia el seguimiento de cultivos, el control del ganado y la agricultura de precisión para obtener rendimientos mayores y más inteligentes.
Más información

¡Construyamos juntos el futuro de la IA!

Comienza tu viaje con el futuro del aprendizaje automático