Reinforcement Learning with Verifiable Rewards (RLVR)
Découvre l’apprentissage par renforcement avec récompenses vérifiables (RLVR). Apprends comment entraîner une IA avancée à l’aide de retours d’information déterministes et d’Ultralytics YOLO26.
L’apprentissage par renforcement avec récompenses vérifiables (RLVR) est un paradigme d’entraînement avancé qui améliore les capacités de raisonnement et de résolution de problèmes des modèles d'intelligence artificielle (IA). Contrairement aux méthodes d’entraînement traditionnelles fondées sur des données de préférence annotées par des humains, le RLVR utilise des systèmes fondés sur des règles déterministes pour évaluer les résultats d’un modèle. En fournissant une récompense binaire objective — par exemple, selon qu’un code généré compile ou qu’une équation mathématique est correctement résolue —, le RLVR permet aux modèles d’apprendre par exploration libre. Cette boucle de rétroaction objective est un moteur essentiel des récentes avancées des modèles de raisonnement très performants, car elle leur permet de découvrir des chemins logiques complexes et optimaux sans intervention humaine continue.
Principes fondamentaux du RLVR#
Dans les environnements classiques d'apprentissage automatique (ML), un agent d’IA apprend en maximisant un signal de récompense. Avec le RLVR, ce signal est généré par un système de programmation rigide plutôt que par un jugement humain subjectif. Le processus d’apprentissage repose sur quelques étapes fondamentales :
- Stratégie d’exploration : Le modèle génère plusieurs solutions possibles ou chemins de raisonnement pour une invite donnée, souvent en utilisant un raisonnement en chaîne pour décomposer les tâches complexes.
- Vérification déterministe : Un outil externe — comme un compilateur Python, une calculatrice ou un système de perception en vision par ordinateur (CV) — vérifie le résultat final par rapport à des critères de réussite objectifs.
- Optimisation de la politique : Si le résultat est vérifié comme correct, le modèle reçoit une récompense positive. La politique du modèle est ensuite mise à jour à l’aide d’algorithmes d’optimisation comme l’optimisation de politique relative au groupe (GRPO) ou l'optimisation de politique proximale (PPO), afin de privilégier les chemins de raisonnement efficaces.
Cette approche améliore considérablement l’efficacité de la latence d’inférence d’un modèle pendant l’entraînement et favorise l’émergence de capacités de raisonnement, une technique récemment utilisée pour entraîner des modèles très performants comme DeepSeek-R1.
RLVR vs RLHF et PRM#
Il est important de distinguer le RLVR des autres paradigmes d’alignement et d’entraînement de l’écosystème de l’IA :
- Vs l’apprentissage par renforcement à partir de retours humains (RLHF) : Le RLHF s’appuie sur un système de modélisation des récompenses appris à partir de préférences humaines subjectives. Le RLVR élimine le goulot d’étranglement de l’intervention humaine en s’appuyant uniquement sur des vérités objectives établies par programmation, ce qui le rend très évolutif pour les tâches ayant des réponses incontestablement justes ou fausses.
- Vs le modèle de récompense de processus (PRM) : Les PRM fournissent un retour détaillé à chaque étape du raisonnement d’un modèle, tandis que le RLVR se concentre généralement sur le résultat vérifiable en fin de processus. Toutefois, de récentes recherches de 2025 indiquent que l’optimisation d’une récompense finale vérifiable dans le RLVR incite aussi implicitement à effectuer correctement les étapes de raisonnement intermédiaires.
Applications concrètes#
Le RLVR transforme l’entraînement des systèmes d’IA complexes dans différents domaines déterministes :
- Raisonnement mathématique : De grands modèles de raisonnement comme ceux de la série o d’OpenAI utilisent le RLVR pour résoudre des théorèmes mathématiques complexes. Le vérificateur agit comme un moteur qui prouve de manière concluante si la réponse déduite par le modèle est correcte, ce qui améliore considérablement les performances sur les jeux de données de référence.
- Ingénierie logicielle et génération de code : Les assistants de programmation basés sur l’IA utilisent le RLVR pour écrire, déboguer et optimiser du code. La récompense vérifiable est accordée lorsque le code généré compile correctement et réussit une suite de tests unitaires automatisés.
- Agents visuels autonomes : Dans les environnements physiques, les agents autonomes reçoivent des récompenses vérifiables lorsqu’ils atteignent une destination cible ou manipulent correctement un objet. Dans ces espaces, les modèles de vision servent de vérificateurs de conditions.
Mettre en œuvre une récompense vérifiable en IA visuelle#
Dans les environnements physiques et visuels, les modèles de perception comme Ultralytics YOLO26 peuvent servir de vérificateurs programmatiques dans une boucle RLVR. Par exemple, si un agent d’IA doit déplacer un objet dans une zone donnée, le modèle YOLO peut vérifier la réussite en détectant la présence de l’objet dans cette zone.
L’extrait Python suivant présente un exemple conceptuel de vérificateur programmatique utilisant le package ultralytics.
from ultralytics import YOLO
# Load a YOLO26 model to act as the programmatic verifier
verifier_model = YOLO("yolo26n.pt")
def get_verifiable_reward(image_path: str, target_class: int) -> float:
"""Returns a verifiable reward of 1.0 if the target object is detected."""
results = verifier_model(image_path)
# Check if the desired class (e.g., 0 for 'person') exists in the detections
detected_classes = results[0].boxes.cls.tolist()
if target_class in detected_classes:
return 1.0 # Verifiable success
return 0.0 # Verifiable failure
# Simulate an agent's environment state check
reward = get_verifiable_reward("https://ultralytics.com/images/bus.jpg", target_class=0)
print(f"RLVR Reward Signal: {reward}")En s’appuyant sur des plateformes cloud comme l’Ultralytics Platform pour déployer ces vérificateurs de perception, les développeurs peuvent créer des pipelines RLVR robustes et évolutifs qui entraînent la prochaine génération d’agents autonomes et capables de raisonner.









