YOLO Vision 2026 :
Retour au glossaire Ultralytics

Reward Modeling

Explore la modélisation des récompenses en machine learning. Découvre comment elle utilise le feedback humain pour aligner les agents d’IA et les modèles Ultralytics YOLO26 afin d’obtenir des performances plus sûres et plus précises.

La modélisation des récompenses est une technique d’apprentissage automatique utilisée pour apprendre aux systèmes d’intelligence artificielle à évaluer et à hiérarchiser leurs propres comportements en fonction des préférences humaines. Dans les environnements traditionnels d’apprentissage par renforcement, un agent d’IA apprend en maximisant une fonction de récompense prédéfinie et mathématiquement rigide, comme le score dans un jeu vidéo. Cependant, pour les tâches complexes du monde réel où un comportement « bon » est subjectif ou nuancé — comme rédiger un e-mail poli ou traverser une intersection en toute sécurité — il est presque impossible de concevoir manuellement une fonction de récompense parfaite. La modélisation des récompenses résout ce problème en entraînant un réseau neuronal secondaire (le modèle de récompense) afin qu’il serve de proxy au jugement humain. Ce modèle évalue les sorties de l’IA principale et leur attribue des scores scalaires, orientant dynamiquement le modèle principal vers des comportements sûrs, utiles et précis.

Fonctionnement de la modélisation des récompenses#

Le pipeline de création d’un modèle de récompense repose largement sur la collecte de retours humains de haute qualité.

  • Étiquetage des données et préférences : Des annotateurs humains reçoivent des prompts accompagnés de plusieurs réponses générées par un modèle d’IA. Les évaluateurs classent ces réponses de la meilleure à la moins bonne selon des critères tels que l’utilité, l’innocuité et la précision. La gestion de ces workflows d’annotation à grande échelle peut être assurée de manière fluide avec l’Ultralytics Platform.
  • Entraînement du réseau proxy : Un réseau neuronal spécialisé est entraîné sur ce jeu de données de comparaisons humaines. Grâce à un processus d’optimisation, il apprend à prédire quelle sortie un humain préférerait, en mappant les représentations vectorielles d’une action ou d’une réponse textuelle vers une seule valeur de récompense scalaire. Tu peux en savoir plus sur la création d’architectures de réseaux neuronaux dans la documentation de l’API PyTorch.
  • Optimisation de la politique : Le modèle principal utilise les retours continus du modèle de récompense pour affiner ses actions, généralement à l’aide d’algorithmes tels que l’optimisation proximale de politique (PPO). Cette étape aligne itérativement la politique du modèle sur l’intention humaine apprise.

Modélisation des récompenses et RLHF#

Il est important de distinguer la modélisation des récompenses de l’apprentissage par renforcement à partir de retours humains (RLHF). Bien que ces deux termes soient souvent abordés ensemble, ils ne sont pas synonymes. Le RLHF est le pipeline complet de bout en bout utilisé pour aligner les modèles ; il englobe l’affinage supervisé, la collecte de données et les mises à jour de la politique. La modélisation des récompenses est un composant spécifique et essentiel du pipeline RLHF. Elle sert de pont en transformant les classements humains discrets en un signal mathématique continu que l’algorithme d’apprentissage par renforcement peut optimiser.

Applications concrètes#

La modélisation des récompenses joue un rôle essentiel dans le développement de systèmes d’IA modernes qui interagissent directement avec les humains et le monde physique.

  • Grands modèles de langage (LLMs) : Les assistants conversationnels d’IA s’appuient sur des modèles de récompense pour garantir que leurs réponses sont non seulement factuellement correctes, mais aussi polies, pertinentes et exemptes de langage toxique. Les organisations qui étudient la sécurité de l’IA font continuellement progresser la modélisation des récompenses afin de créer des systèmes reflétant un alignement de l’IA utile et inoffensive.
  • Véhicules autonomes et robotique : Dans l’automatisation physique, les modèles de récompense aident les robots à comprendre les règles complexes de conduite ou les stratégies de manipulation d’objets. Un système de perception reposant sur Ultralytics YOLO26 peut détecter les piétons et les panneaux de signalisation, tandis qu’un modèle de récompense évalue la trajectoire planifiée du véhicule, garantissant que l’IA donne la priorité au confort et à la sécurité des passagers plutôt qu’à une navigation agressive strictement de point à point.

Mise en œuvre d’un concept élémentaire de modèle de récompense#

L’exemple Python suivant utilise torch pour présenter la structure fondamentale d’un modèle de récompense. En pratique, ce réseau apprend à attribuer un score scalaire plus élevé à une sortie conforme aux préférences humaines.

import torch
import torch.nn as nn


# Define a simplified reward model architecture
class SimpleRewardModel(nn.Module):
    def __init__(self):
        super().__init__()
        # Maps the AI's output embedding to a single reward score
        self.fc = nn.Linear(768, 1)

    def forward(self, embeddings):
        return self.fc(embeddings)


# Initialize the model
reward_model = SimpleRewardModel()

# Simulated embeddings for a human-preferred action and a rejected action
chosen_action = torch.randn(1, 768)
rejected_action = torch.randn(1, 768)

# The model predicts scalar scores to guide the primary agent
print(f"Chosen Action Reward: {reward_model(chosen_action).item():.4f}")
print(f"Rejected Action Reward: {reward_model(rejected_action).item():.4f}")

Pour approfondir l’impact de l’alignement sur les modèles fondamentaux open source, consulte les recherches fondamentales sur l’alignement des modèles de langage avec l’intention humaine et découvre comment les systèmes de vision par ordinateur (CV) exploitent des boucles de rétroaction avancées pour interagir en toute sécurité avec des environnements dynamiques.

Explore solutions

Real-time AI that works with your team

Vision par ordinateur en robotique

Donne plus d’intelligence à tes machines avec les modèles Ultralytics YOLO. L’IA visuelle en robotique permet la navigation autonome, la perception, le suivi d’objets et le contrôle en temps réel.
En savoir plus
Real-time AI that works with your team

Vision par ordinateur en logistique

Optimise la logistique avec les modèles Ultralytics YOLO. L’IA visuelle permet l’inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Real-time AI that works with your team

Vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. L’IA visuelle permet le suivi des stocks, la surveillance des rayons, la gestion des files d’attente et l’obtention d’informations plus pertinentes sur les clients.
En savoir plus
Real-time AI that works with your team

La vision par ordinateur dans le secteur de la santé

Développe des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans le secteur de la santé accélère l'imagerie médicale, améliore les diagnostics et renforce la surveillance des patients.
En savoir plus
Real-time AI that works with your team

La vision par ordinateur dans l'industrie manufacturière

Optimise la production industrielle avec les modèles Ultralytics YOLO. L'IA de vision améliore le contrôle qualité, la détection des défauts, le respect des règles relatives aux EPI et l'automatisation des lignes d'assemblage.
En savoir plus
Real-time AI that works with your operation

Vision par ordinateur dans l’automobile

Applique la vision par ordinateur à l’automobile avec les modèles Ultralytics YOLO. L’IA de vision améliore la sécurité routière, l’aide à la conduite et l’automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Real-time AI tailored to your operation

Vision par ordinateur dans l’agriculture

Apporte l’IA de vision à l’agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l’agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus
Real-time AI that works with your team

Vision par ordinateur en robotique

Donne plus d’intelligence à tes machines avec les modèles Ultralytics YOLO. L’IA visuelle en robotique permet la navigation autonome, la perception, le suivi d’objets et le contrôle en temps réel.
En savoir plus
Real-time AI that works with your team

Vision par ordinateur en logistique

Optimise la logistique avec les modèles Ultralytics YOLO. L’IA visuelle permet l’inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Real-time AI that works with your team

Vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. L’IA visuelle permet le suivi des stocks, la surveillance des rayons, la gestion des files d’attente et l’obtention d’informations plus pertinentes sur les clients.
En savoir plus
Real-time AI that works with your team

La vision par ordinateur dans le secteur de la santé

Développe des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans le secteur de la santé accélère l'imagerie médicale, améliore les diagnostics et renforce la surveillance des patients.
En savoir plus
Real-time AI that works with your team

La vision par ordinateur dans l'industrie manufacturière

Optimise la production industrielle avec les modèles Ultralytics YOLO. L'IA de vision améliore le contrôle qualité, la détection des défauts, le respect des règles relatives aux EPI et l'automatisation des lignes d'assemblage.
En savoir plus
Real-time AI that works with your operation

Vision par ordinateur dans l’automobile

Applique la vision par ordinateur à l’automobile avec les modèles Ultralytics YOLO. L’IA de vision améliore la sécurité routière, l’aide à la conduite et l’automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Real-time AI tailored to your operation

Vision par ordinateur dans l’agriculture

Apporte l’IA de vision à l’agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l’agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus
Real-time AI that works with your team

Vision par ordinateur en robotique

Donne plus d’intelligence à tes machines avec les modèles Ultralytics YOLO. L’IA visuelle en robotique permet la navigation autonome, la perception, le suivi d’objets et le contrôle en temps réel.
En savoir plus
Real-time AI that works with your team

Vision par ordinateur en logistique

Optimise la logistique avec les modèles Ultralytics YOLO. L’IA visuelle permet l’inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Real-time AI that works with your team

Vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. L’IA visuelle permet le suivi des stocks, la surveillance des rayons, la gestion des files d’attente et l’obtention d’informations plus pertinentes sur les clients.
En savoir plus
Real-time AI that works with your team

La vision par ordinateur dans le secteur de la santé

Développe des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans le secteur de la santé accélère l'imagerie médicale, améliore les diagnostics et renforce la surveillance des patients.
En savoir plus
Real-time AI that works with your team

La vision par ordinateur dans l'industrie manufacturière

Optimise la production industrielle avec les modèles Ultralytics YOLO. L'IA de vision améliore le contrôle qualité, la détection des défauts, le respect des règles relatives aux EPI et l'automatisation des lignes d'assemblage.
En savoir plus
Real-time AI that works with your operation

Vision par ordinateur dans l’automobile

Applique la vision par ordinateur à l’automobile avec les modèles Ultralytics YOLO. L’IA de vision améliore la sécurité routière, l’aide à la conduite et l’automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Real-time AI tailored to your operation

Vision par ordinateur dans l’agriculture

Apporte l’IA de vision à l’agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l’agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus

Construisons ensemble l'avenir de l'IA !

Commence ton parcours vers l'avenir de l'apprentissage automatique