Ultralytics YOLO27 :
Retour au glossaire Ultralytics

Reinforcement Learning with Verifiable Rewards (RLVR)

Découvre l’apprentissage par renforcement avec récompenses vérifiables (RLVR). Apprends comment entraîner une IA avancée à l’aide de retours d’information déterministes et d’Ultralytics YOLO26.

L’apprentissage par renforcement avec récompenses vérifiables (RLVR) est un paradigme d’entraînement avancé qui améliore les capacités de raisonnement et de résolution de problèmes des modèles d'intelligence artificielle (IA). Contrairement aux méthodes d’entraînement traditionnelles fondées sur des données de préférence annotées par des humains, le RLVR utilise des systèmes fondés sur des règles déterministes pour évaluer les résultats d’un modèle. En fournissant une récompense binaire objective — par exemple, selon qu’un code généré compile ou qu’une équation mathématique est correctement résolue —, le RLVR permet aux modèles d’apprendre par exploration libre. Cette boucle de rétroaction objective est un moteur essentiel des récentes avancées des modèles de raisonnement très performants, car elle leur permet de découvrir des chemins logiques complexes et optimaux sans intervention humaine continue.

Principes fondamentaux du RLVR#

Dans les environnements classiques d'apprentissage automatique (ML), un agent d’IA apprend en maximisant un signal de récompense. Avec le RLVR, ce signal est généré par un système de programmation rigide plutôt que par un jugement humain subjectif. Le processus d’apprentissage repose sur quelques étapes fondamentales :

  • Stratégie d’exploration : Le modèle génère plusieurs solutions possibles ou chemins de raisonnement pour une invite donnée, souvent en utilisant un raisonnement en chaîne pour décomposer les tâches complexes.
  • Vérification déterministe : Un outil externe — comme un compilateur Python, une calculatrice ou un système de perception en vision par ordinateur (CV) — vérifie le résultat final par rapport à des critères de réussite objectifs.
  • Optimisation de la politique : Si le résultat est vérifié comme correct, le modèle reçoit une récompense positive. La politique du modèle est ensuite mise à jour à l’aide d’algorithmes d’optimisation comme l’optimisation de politique relative au groupe (GRPO) ou l'optimisation de politique proximale (PPO), afin de privilégier les chemins de raisonnement efficaces.

Cette approche améliore considérablement l’efficacité de la latence d’inférence d’un modèle pendant l’entraînement et favorise l’émergence de capacités de raisonnement, une technique récemment utilisée pour entraîner des modèles très performants comme DeepSeek-R1.

RLVR vs RLHF et PRM#

Il est important de distinguer le RLVR des autres paradigmes d’alignement et d’entraînement de l’écosystème de l’IA :

  • Vs l’apprentissage par renforcement à partir de retours humains (RLHF) : Le RLHF s’appuie sur un système de modélisation des récompenses appris à partir de préférences humaines subjectives. Le RLVR élimine le goulot d’étranglement de l’intervention humaine en s’appuyant uniquement sur des vérités objectives établies par programmation, ce qui le rend très évolutif pour les tâches ayant des réponses incontestablement justes ou fausses.
  • Vs le modèle de récompense de processus (PRM) : Les PRM fournissent un retour détaillé à chaque étape du raisonnement d’un modèle, tandis que le RLVR se concentre généralement sur le résultat vérifiable en fin de processus. Toutefois, de récentes recherches de 2025 indiquent que l’optimisation d’une récompense finale vérifiable dans le RLVR incite aussi implicitement à effectuer correctement les étapes de raisonnement intermédiaires.

Applications concrètes#

Le RLVR transforme l’entraînement des systèmes d’IA complexes dans différents domaines déterministes :

  • Raisonnement mathématique : De grands modèles de raisonnement comme ceux de la série o d’OpenAI utilisent le RLVR pour résoudre des théorèmes mathématiques complexes. Le vérificateur agit comme un moteur qui prouve de manière concluante si la réponse déduite par le modèle est correcte, ce qui améliore considérablement les performances sur les jeux de données de référence.
  • Ingénierie logicielle et génération de code : Les assistants de programmation basés sur l’IA utilisent le RLVR pour écrire, déboguer et optimiser du code. La récompense vérifiable est accordée lorsque le code généré compile correctement et réussit une suite de tests unitaires automatisés.
  • Agents visuels autonomes : Dans les environnements physiques, les agents autonomes reçoivent des récompenses vérifiables lorsqu’ils atteignent une destination cible ou manipulent correctement un objet. Dans ces espaces, les modèles de vision servent de vérificateurs de conditions.

Mettre en œuvre une récompense vérifiable en IA visuelle#

Dans les environnements physiques et visuels, les modèles de perception comme Ultralytics YOLO26 peuvent servir de vérificateurs programmatiques dans une boucle RLVR. Par exemple, si un agent d’IA doit déplacer un objet dans une zone donnée, le modèle YOLO peut vérifier la réussite en détectant la présence de l’objet dans cette zone.

L’extrait Python suivant présente un exemple conceptuel de vérificateur programmatique utilisant le package ultralytics.

from ultralytics import YOLO

# Load a YOLO26 model to act as the programmatic verifier
verifier_model = YOLO("yolo26n.pt")


def get_verifiable_reward(image_path: str, target_class: int) -> float:
    """Returns a verifiable reward of 1.0 if the target object is detected."""
    results = verifier_model(image_path)

    # Check if the desired class (e.g., 0 for 'person') exists in the detections
    detected_classes = results[0].boxes.cls.tolist()
    if target_class in detected_classes:
        return 1.0  # Verifiable success
    return 0.0  # Verifiable failure


# Simulate an agent's environment state check
reward = get_verifiable_reward("https://ultralytics.com/images/bus.jpg", target_class=0)
print(f"RLVR Reward Signal: {reward}")

En s’appuyant sur des plateformes cloud comme l’Ultralytics Platform pour déployer ces vérificateurs de perception, les développeurs peuvent créer des pipelines RLVR robustes et évolutifs qui entraînent la prochaine génération d’agents autonomes et capables de raisonner.

Explore solutions

Vision par ordinateur pour les images aériennes

Vision par ordinateur pour les images aériennes

Transforme les images de drones et les prises de vue aériennes en informations exploitables en temps réel pour l’agriculture, l’aquaculture, la surveillance environnementale, la conservation et l’analyse géospatiale avec Ultralytics YOLO.
En savoir plus
Vision par ordinateur dans l’aérospatiale

Vision par ordinateur dans l’aérospatiale

Déploie l’IA visuelle pour la surveillance aérienne avec les modèles Ultralytics YOLO. Donne de la puissance aux drones, aux workflows aéronautiques, à la conservation de l’environnement et aux secteurs géospatiaux grâce à des solutions de vision par ordinateur.
En savoir plus
La vision par ordinateur dans la sécurité

La vision par ordinateur dans la sécurité

Protège chaque site avec les modèles Ultralytics YOLO. L’IA visuelle permet la surveillance des périmètres, la détection des menaces, la reconnaissance des plaques d’immatriculation et la sécurité au travail.
En savoir plus
La vision par ordinateur en robotique

La vision par ordinateur en robotique

Donne plus de capacités à tes machines grâce aux modèles Ultralytics YOLO. Dans la robotique, l’IA visuelle permet la navigation autonome, la perception, le suivi des objets et le contrôle en temps réel.
En savoir plus
La vision par ordinateur dans la logistique

La vision par ordinateur dans la logistique

Optimise la logistique avec les modèles Ultralytics YOLO. La vision par IA permet d’inspecter les colis, de les trier, de suivre les véhicules et de surveiller la sécurité des entrepôts en temps réel.
En savoir plus
La vision par ordinateur dans le commerce de détail

La vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. La vision par IA permet de suivre les stocks, de surveiller les rayons, de gérer les files d’attente et de mieux comprendre les clients.
En savoir plus
La vision par ordinateur dans le secteur de la santé

La vision par ordinateur dans le secteur de la santé

Crée des solutions de santé avec les modèles Ultralytics YOLO. La vision par IA dans le secteur de la santé accélère l’imagerie médicale, améliore les diagnostics et facilite la surveillance des patients.
En savoir plus
La vision par ordinateur dans l’industrie manufacturière

La vision par ordinateur dans l’industrie manufacturière

Optimise la fabrication avec les modèles Ultralytics YOLO. La vision par IA améliore le contrôle qualité, la détection des défauts, le respect des règles concernant les EPI et l’automatisation des chaînes de montage.
En savoir plus
La vision par ordinateur dans l’automobile

La vision par ordinateur dans l’automobile

Mets la vision par ordinateur au service de l’automobile avec les modèles Ultralytics YOLO. La vision par IA renforce la sécurité routière, l’aide à la conduite et l’automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Vision par ordinateur dans l’agriculture

Vision par ordinateur dans l’agriculture

Fais entrer l’IA de vision dans l’agriculture intelligente avec les modèles Ultralytics YOLO. Optimise le suivi des cultures et du bétail ainsi que l’agriculture de précision pour obtenir des rendements plus élevés et plus intelligents.
En savoir plus
Vision par ordinateur pour les images aériennes

Vision par ordinateur pour les images aériennes

Transforme les images de drones et les prises de vue aériennes en informations exploitables en temps réel pour l’agriculture, l’aquaculture, la surveillance environnementale, la conservation et l’analyse géospatiale avec Ultralytics YOLO.
En savoir plus
Vision par ordinateur dans l’aérospatiale

Vision par ordinateur dans l’aérospatiale

Déploie l’IA visuelle pour la surveillance aérienne avec les modèles Ultralytics YOLO. Donne de la puissance aux drones, aux workflows aéronautiques, à la conservation de l’environnement et aux secteurs géospatiaux grâce à des solutions de vision par ordinateur.
En savoir plus
La vision par ordinateur dans la sécurité

La vision par ordinateur dans la sécurité

Protège chaque site avec les modèles Ultralytics YOLO. L’IA visuelle permet la surveillance des périmètres, la détection des menaces, la reconnaissance des plaques d’immatriculation et la sécurité au travail.
En savoir plus
La vision par ordinateur en robotique

La vision par ordinateur en robotique

Donne plus de capacités à tes machines grâce aux modèles Ultralytics YOLO. Dans la robotique, l’IA visuelle permet la navigation autonome, la perception, le suivi des objets et le contrôle en temps réel.
En savoir plus
La vision par ordinateur dans la logistique

La vision par ordinateur dans la logistique

Optimise la logistique avec les modèles Ultralytics YOLO. La vision par IA permet d’inspecter les colis, de les trier, de suivre les véhicules et de surveiller la sécurité des entrepôts en temps réel.
En savoir plus
La vision par ordinateur dans le commerce de détail

La vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. La vision par IA permet de suivre les stocks, de surveiller les rayons, de gérer les files d’attente et de mieux comprendre les clients.
En savoir plus
La vision par ordinateur dans le secteur de la santé

La vision par ordinateur dans le secteur de la santé

Crée des solutions de santé avec les modèles Ultralytics YOLO. La vision par IA dans le secteur de la santé accélère l’imagerie médicale, améliore les diagnostics et facilite la surveillance des patients.
En savoir plus
La vision par ordinateur dans l’industrie manufacturière

La vision par ordinateur dans l’industrie manufacturière

Optimise la fabrication avec les modèles Ultralytics YOLO. La vision par IA améliore le contrôle qualité, la détection des défauts, le respect des règles concernant les EPI et l’automatisation des chaînes de montage.
En savoir plus
La vision par ordinateur dans l’automobile

La vision par ordinateur dans l’automobile

Mets la vision par ordinateur au service de l’automobile avec les modèles Ultralytics YOLO. La vision par IA renforce la sécurité routière, l’aide à la conduite et l’automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Vision par ordinateur dans l’agriculture

Vision par ordinateur dans l’agriculture

Fais entrer l’IA de vision dans l’agriculture intelligente avec les modèles Ultralytics YOLO. Optimise le suivi des cultures et du bétail ainsi que l’agriculture de précision pour obtenir des rendements plus élevés et plus intelligents.
En savoir plus
Vision par ordinateur pour les images aériennes

Vision par ordinateur pour les images aériennes

Transforme les images de drones et les prises de vue aériennes en informations exploitables en temps réel pour l’agriculture, l’aquaculture, la surveillance environnementale, la conservation et l’analyse géospatiale avec Ultralytics YOLO.
En savoir plus
Vision par ordinateur dans l’aérospatiale

Vision par ordinateur dans l’aérospatiale

Déploie l’IA visuelle pour la surveillance aérienne avec les modèles Ultralytics YOLO. Donne de la puissance aux drones, aux workflows aéronautiques, à la conservation de l’environnement et aux secteurs géospatiaux grâce à des solutions de vision par ordinateur.
En savoir plus
La vision par ordinateur dans la sécurité

La vision par ordinateur dans la sécurité

Protège chaque site avec les modèles Ultralytics YOLO. L’IA visuelle permet la surveillance des périmètres, la détection des menaces, la reconnaissance des plaques d’immatriculation et la sécurité au travail.
En savoir plus
La vision par ordinateur en robotique

La vision par ordinateur en robotique

Donne plus de capacités à tes machines grâce aux modèles Ultralytics YOLO. Dans la robotique, l’IA visuelle permet la navigation autonome, la perception, le suivi des objets et le contrôle en temps réel.
En savoir plus
La vision par ordinateur dans la logistique

La vision par ordinateur dans la logistique

Optimise la logistique avec les modèles Ultralytics YOLO. La vision par IA permet d’inspecter les colis, de les trier, de suivre les véhicules et de surveiller la sécurité des entrepôts en temps réel.
En savoir plus
La vision par ordinateur dans le commerce de détail

La vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. La vision par IA permet de suivre les stocks, de surveiller les rayons, de gérer les files d’attente et de mieux comprendre les clients.
En savoir plus
La vision par ordinateur dans le secteur de la santé

La vision par ordinateur dans le secteur de la santé

Crée des solutions de santé avec les modèles Ultralytics YOLO. La vision par IA dans le secteur de la santé accélère l’imagerie médicale, améliore les diagnostics et facilite la surveillance des patients.
En savoir plus
La vision par ordinateur dans l’industrie manufacturière

La vision par ordinateur dans l’industrie manufacturière

Optimise la fabrication avec les modèles Ultralytics YOLO. La vision par IA améliore le contrôle qualité, la détection des défauts, le respect des règles concernant les EPI et l’automatisation des chaînes de montage.
En savoir plus
La vision par ordinateur dans l’automobile

La vision par ordinateur dans l’automobile

Mets la vision par ordinateur au service de l’automobile avec les modèles Ultralytics YOLO. La vision par IA renforce la sécurité routière, l’aide à la conduite et l’automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Vision par ordinateur dans l’agriculture

Vision par ordinateur dans l’agriculture

Fais entrer l’IA de vision dans l’agriculture intelligente avec les modèles Ultralytics YOLO. Optimise le suivi des cultures et du bétail ainsi que l’agriculture de précision pour obtenir des rendements plus élevés et plus intelligents.
En savoir plus

Construisons ensemble l’avenir de l’IA !

Commence ton parcours vers l’avenir de l’apprentissage automatique