Reinforcement Learning with Verifiable Rewards (RLVR)
Découvre l'apprentissage par renforcement avec récompenses vérifiables (RLVR). Apprends comment entraîner une IA avancée en utilisant des retours déterministes et Ultralytics YOLO26.
L'apprentissage par renforcement avec récompenses vérifiables (RLVR) est un paradigme d'entraînement avancé utilisé pour améliorer les capacités de raisonnement et de résolution de problèmes des modèles d'intelligence artificielle (IA). Contrairement aux méthodes d'entraînement traditionnelles qui reposent sur des données de préférence annotées par des humains, le RLVR utilise des systèmes basés sur des règles déterministes pour évaluer la sortie d'un modèle. En fournissant une récompense objective et binaire — telle que la compilation réussie d'un code généré ou la résolution correcte d'une équation mathématique —, le RLVR permet aux modèles d'apprendre par une exploration sans restriction. Cette boucle de rétroaction objective est un moteur clé des récentes avancées dans les modèles de raisonnement hautement performants, leur permettant de découvrir des chemins logiques optimaux et complexes sans intervention humaine continue.
Principes fondamentaux du RLVR#
Dans les environnements d'apprentissage automatique (ML) standard, un agent IA apprend en maximisant un signal de récompense. En RLVR, ce signal de récompense est généré par un système de programmation rigide plutôt que par un jugement humain subjectif. Le processus d'apprentissage repose sur quelques étapes fondamentales :
- Stratégie d'exploration : Le modèle génère plusieurs solutions potentielles ou chemins de raisonnement pour une consigne donnée, en utilisant souvent un prompt avec chaîne de pensée (chain-of-thought) pour décomposer des tâches complexes.
- Vérification déterministe : Un outil externe — tel qu'un compilateur Python, une calculatrice ou un système de perception par vision par ordinateur (CV) — vérifie la sortie finale par rapport à des critères de réussite objectifs.
- Optimisation de politique : Si la sortie est vérifiable et correcte, le modèle reçoit une récompense positive. La politique du modèle est ensuite mise à jour à l'aide d'algorithmes d'optimisation tels que le Group Relative Policy Optimization (GRPO) ou le Proximal Policy Optimization (PPO) afin de privilégier les chemins de raisonnement fructueux.
Cette approche améliore considérablement l'efficacité de la latence d'inférence d'un modèle au moment de l'entraînement et favorise des capacités de raisonnement émergentes, une technique récemment utilisée pour entraîner des modèles hautement performants comme DeepSeek-R1.
RLVR vs RLHF et PRM#
Il est important de distinguer le RLVR des autres paradigmes d'alignement et d'entraînement dans l'écosystème de l'IA :
- vs. Apprentissage par renforcement à partir de rétroaction humaine (RLHF) : Le RLHF repose sur un système de modélisation de récompense appris, entraîné sur des préférences humaines subjectives. Le RLVR élimine le goulet d'étranglement de l'intervention humaine en s'appuyant strictement sur des vérités objectives et programmatiques, ce qui le rend hautement évolutif pour les tâches comportant des réponses définitives, justes ou fausses.
- vs. Modèle de récompense de processus (PRM) : Alors que les PRM fournissent des retours granulaires étape par étape tout au long de la trajectoire de raisonnement d'un modèle, le RLVR se concentre généralement sur le résultat vérifiable à la fin d'un processus. Cependant, des recherches récentes de 2025 indiquent que l'optimisation en vue d'une récompense vérifiable finale en RLVR incite également implicitement à adopter des étapes de raisonnement intermédiaires correctes.
Applications concrètes#
Le RLVR transforme la manière dont les systèmes d'IA complexes sont entraînés dans divers domaines déterministes :
- Raisonnement mathématique : Les grands modèles de raisonnement tels que la série o d'OpenAI exploitent le RLVR pour résoudre des théorèmes mathématiques complexes. Le vérificateur agit comme un moteur qui prouve de manière définitive si la réponse dérivée par le modèle est correcte, ce qui stimule considérablement les performances des ensembles de données de référence.
- Génie logiciel et génération de code : Les assistants de codage IA utilisent le RLVR pour écrire, déboguer et optimiser le code. La récompense vérifiable est obtenue lorsque le code généré compile avec succès et réussit une suite de tests unitaires automatisés.
- Agents de vision autonomes : Dans les environnements physiques, les agents autonomes reçoivent des récompenses vérifiables lorsqu'ils atteignent une destination cible ou manipulent avec succès un objet. Les modèles de vision agissent comme le vérificateur de condition vérifiable dans ces espaces.
Implémentation d'une récompense vérifiable dans la vision par IA#
Dans les environnements physiques et visuels, les modèles de perception tels qu'Ultralytics YOLO26 peuvent servir de vérificateur programmatique dans une boucle RLVR. Par exemple, si l'objectif d'un agent IA est de déplacer un objet dans une zone spécifique, le modèle YOLO peut vérifier le succès en détectant la présence de l'objet dans cette zone.
L'extrait Python suivant démontre un vérificateur programmatique conceptuel utilisant le paquet ultralytics.
from ultralytics import YOLO
# Load a YOLO26 model to act as the programmatic verifier
verifier_model = YOLO("yolo26n.pt")
def get_verifiable_reward(image_path: str, target_class: int) -> float:
"""Returns a verifiable reward of 1.0 if the target object is detected."""
results = verifier_model(image_path)
# Check if the desired class (e.g., 0 for 'person') exists in the detections
detected_classes = results[0].boxes.cls.tolist()
if target_class in detected_classes:
return 1.0 # Verifiable success
return 0.0 # Verifiable failure
# Simulate an agent's environment state check
reward = get_verifiable_reward("https://ultralytics.com/images/bus.jpg", target_class=0)
print(f"RLVR Reward Signal: {reward}")En tirant parti des plates-formes cloud telles que la plate-forme Ultralytics pour déployer ces vérificateurs de perception, tu peux créer des pipelines RLVR robustes et évolutifs qui entraînent la prochaine génération d'agents autonomes et de raisonnement.






