Ultralytics YOLO27 :
Retour au glossaire Ultralytics

Reinforcement Learning from Human Feedback (RLHF)

Découvre comment l’apprentissage par renforcement à partir de feedback humain (RLHF) aligne l’IA sur les valeurs humaines. Explore ses composants fondamentaux et son intégration avec Ultralytics YOLO26.

L’apprentissage par renforcement à partir des retours humains (RLHF) est une technique avancée d’apprentissage automatique qui affine les modèles d’intelligence artificielle en intégrant directement les contributions humaines dans la boucle d’entraînement. Contrairement à l’apprentissage supervisé standard, qui repose uniquement sur des jeux de données statiques annotés, le RLHF introduit un mécanisme de retour dynamique dans lequel des évaluateurs humains classent ou notent les résultats produits par le modèle. Ce processus permet à l’IA de prendre en compte des objectifs complexes, subjectifs ou nuancés — tels que l’« utilité », la « sécurité » ou la « créativité » — difficiles à définir avec une simple fonction de perte mathématique. Le RLHF est devenu un élément fondamental du développement des grands modèles de langage (LLMs) modernes et de l’IA générative, garantissant que les puissants modèles de base s’alignent efficacement sur les valeurs humaines et les intentions des utilisateurs.

Les composants essentiels du RLHF#

Le processus de RLHF suit généralement un pipeline en trois étapes, conçu pour combler l’écart entre les capacités prédictives brutes et un comportement aligné sur les valeurs humaines.

  1. Ajustement fin supervisé (SFT) : Le processus commence généralement par un modèle de base préentraîné. Les développeurs effectuent un ajustement fin initial à l’aide d’un jeu de données plus restreint et de haute qualité composé de démonstrations (par exemple, des paires question-réponse rédigées par des experts). Cette étape établit une politique de référence et enseigne au modèle le format général ainsi que le ton attendus pour la tâche.

  2. Entraînement du modèle de récompense : Cette phase constitue la caractéristique distinctive du RLHF. Des annotateurs humains examinent plusieurs résultats générés par le modèle pour une même entrée et les classent du meilleur au moins bon. Cet effort d’annotation des données produit un jeu de données de préférences. Un réseau neuronal distinct, appelé modèle de récompense, est entraîné sur ces données de comparaison afin de prédire un score scalaire reflétant le jugement humain. Les outils disponibles sur l’Ultralytics Platform peuvent simplifier la gestion de tels workflows d’annotation.

  3. Optimisation par apprentissage par renforcement : Enfin, le modèle d’origine agit comme un agent d’IA au sein d’un environnement d’apprentissage par renforcement. En utilisant le modèle de récompense comme guide, des algorithmes d’optimisation tels que l’optimisation proximale de politique (PPO) ajustent les paramètres du modèle afin de maximiser la récompense attendue. Cette étape aligne la politique du modèle sur les préférences humaines apprises, en encourageant les comportements utiles et sûrs tout en décourageant les résultats toxiques ou dénués de sens.

Applications concrètes#

Le RLHF s’est révélé essentiel pour déployer des systèmes d’IA qui exigent des normes de sécurité élevées et une compréhension nuancée des interactions humaines.

  • IA conversationnelle et chatbots : L’application la plus connue du RLHF consiste à aligner les chatbots afin qu’ils soient utiles, inoffensifs et honnêtes. En pénalisant les résultats biaisés, factuellement incorrects ou dangereux, le RLHF contribue à limiter les hallucinations dans les LLMs et à réduire le risque de biais algorithmique. Les assistants virtuels peuvent ainsi refuser les instructions nuisibles tout en restant utiles pour les demandes légitimes.
  • Robotique et commande physique : Le RLHF va au-delà du texte et s’étend à l’IA dans la robotique, où il est difficile de définir une fonction de récompense parfaite pour des tâches physiques complexes. Par exemple, un robot qui apprend à se déplacer dans un entrepôt très fréquenté pourrait recevoir des retours de superviseurs humains indiquant quelles trajectoires étaient sûres et lesquelles provoquaient des perturbations. Ces retours affinent la politique de commande du robot plus efficacement qu’un simple apprentissage profond par renforcement fondé uniquement sur l’atteinte de l’objectif.

RLHF et apprentissage par renforcement standard#

Il est utile de distinguer le RLHF de l’apprentissage par renforcement (RL) traditionnel afin de comprendre son utilité spécifique.

  • RL standard : Dans les contextes traditionnels, la fonction de récompense est souvent définie en dur par l’environnement. Par exemple, dans un jeu vidéo, l’environnement fournit un signal clair (+1 en cas de victoire, -1 en cas de défaite). L’agent optimise ses actions au sein de ce processus décisionnel de Markov (MDP) défini.
  • RLHF : Dans de nombreux scénarios réels, comme écrire une histoire créative ou conduire avec courtoisie, la « réussite » est subjective. Le RLHF résout ce problème en remplaçant la récompense définie en dur par un modèle de récompense appris à partir des préférences humaines. Cela permet d’optimiser des concepts abstraits tels que la « qualité » ou la « pertinence », impossibles à programmer explicitement.

Intégrer la perception aux boucles de retour#

Dans les applications visuelles, les agents alignés par RLHF s’appuient souvent sur la vision par ordinateur (CV) pour percevoir l’état de leur environnement avant d’agir. Un détecteur robuste, tel que YOLO26, joue le rôle de couche de perception et fournit des observations structurées (par exemple, « obstacle détecté à 3 mètres ») que le réseau de politique utilise pour sélectionner une action.

L’exemple Python suivant illustre un concept simplifié dans lequel un modèle YOLO fournit l’état de l’environnement. Dans une boucle RLHF complète, le signal de « récompense » proviendrait d’un modèle entraîné à partir de retours humains concernant les décisions de l’agent fondées sur ces données de détection.

from ultralytics import YOLO

# Load YOLO26n to act as the perception layer for an intelligent agent
model = YOLO("yolo26n.pt")

# The agent observes the environment (an image) to determine its state
results = model("https://ultralytics.com/images/bus.jpg")

# In an RL context, the 'state' is derived from detections
# A reward model (trained via RLHF) would evaluate the action taken based on this state
detected_objects = len(results[0].boxes)

print(f"Agent Observation: Detected {detected_objects} objects.")
# Example output: Agent Observation: Detected 4 objects.

En combinant de puissants modèles de perception avec des politiques affinées grâce aux retours humains, les développeurs peuvent créer des systèmes non seulement intelligents, mais aussi rigoureusement alignés sur les principes de sécurité de l’IA. Les recherches en cours sur la supervision évolutive, comme l’IA constitutionnelle, continuent de faire progresser ce domaine, avec pour objectif de réduire le goulot d’étranglement lié à l’annotation humaine à grande échelle tout en maintenant des performances élevées des modèles.

Explore solutions

Vision par ordinateur pour l'imagerie aérienne

Vision par ordinateur pour l'imagerie aérienne

Transforme les images de drones et aériennes en informations en temps réel pour l'agriculture, l'aquaculture, la surveillance environnementale, la conservation et l'analyse géospatiale avec Ultralytics YOLO.
En savoir plus
Vision par ordinateur dans l'aérospatiale

Vision par ordinateur dans l'aérospatiale

Apporte l'IA de vision à la surveillance aérienne grâce aux modèles Ultralytics YOLO. Alimente les drones, les flux de travail aérospatiaux, la conservation de l'environnement et les industries géospatiales avec des solutions de vision par ordinateur.
En savoir plus

Protège chaque site avec les modèles Ultralytics YOLO. L'IA de vision alimente la surveillance du périmètre, la détection des menaces, la reconnaissance des plaques d'immatriculation et la sécurité au travail.
En savoir plus
Vision par ordinateur en robotique

Vision par ordinateur en robotique

Donne plus d’intelligence à tes machines avec les modèles Ultralytics YOLO. L’IA visuelle en robotique permet la navigation autonome, la perception, le suivi d’objets et le contrôle en temps réel.
En savoir plus
Vision par ordinateur en logistique

Vision par ordinateur en logistique

Optimise la logistique avec les modèles Ultralytics YOLO. L’IA visuelle permet l’inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Vision par ordinateur dans le commerce de détail

Vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. L’IA visuelle permet le suivi des stocks, la surveillance des rayons, la gestion des files d’attente et l’obtention d’informations plus pertinentes sur les clients.
En savoir plus
La vision par ordinateur dans le secteur de la santé

La vision par ordinateur dans le secteur de la santé

Développe des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans le secteur de la santé accélère l'imagerie médicale, améliore les diagnostics et renforce la surveillance des patients.
En savoir plus
La vision par ordinateur dans l'industrie manufacturière

La vision par ordinateur dans l'industrie manufacturière

Optimise la production industrielle avec les modèles Ultralytics YOLO. L'IA de vision améliore le contrôle qualité, la détection des défauts, le respect des règles relatives aux EPI et l'automatisation des lignes d'assemblage.
En savoir plus
Vision par ordinateur dans l’automobile

Vision par ordinateur dans l’automobile

Applique la vision par ordinateur à l’automobile avec les modèles Ultralytics YOLO. L’IA de vision améliore la sécurité routière, l’aide à la conduite et l’automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Vision par ordinateur dans l’agriculture

Vision par ordinateur dans l’agriculture

Apporte l’IA de vision à l’agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l’agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus
Vision par ordinateur pour l'imagerie aérienne

Vision par ordinateur pour l'imagerie aérienne

Transforme les images de drones et aériennes en informations en temps réel pour l'agriculture, l'aquaculture, la surveillance environnementale, la conservation et l'analyse géospatiale avec Ultralytics YOLO.
En savoir plus
Vision par ordinateur dans l'aérospatiale

Vision par ordinateur dans l'aérospatiale

Apporte l'IA de vision à la surveillance aérienne grâce aux modèles Ultralytics YOLO. Alimente les drones, les flux de travail aérospatiaux, la conservation de l'environnement et les industries géospatiales avec des solutions de vision par ordinateur.
En savoir plus

Protège chaque site avec les modèles Ultralytics YOLO. L'IA de vision alimente la surveillance du périmètre, la détection des menaces, la reconnaissance des plaques d'immatriculation et la sécurité au travail.
En savoir plus
Vision par ordinateur en robotique

Vision par ordinateur en robotique

Donne plus d’intelligence à tes machines avec les modèles Ultralytics YOLO. L’IA visuelle en robotique permet la navigation autonome, la perception, le suivi d’objets et le contrôle en temps réel.
En savoir plus
Vision par ordinateur en logistique

Vision par ordinateur en logistique

Optimise la logistique avec les modèles Ultralytics YOLO. L’IA visuelle permet l’inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Vision par ordinateur dans le commerce de détail

Vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. L’IA visuelle permet le suivi des stocks, la surveillance des rayons, la gestion des files d’attente et l’obtention d’informations plus pertinentes sur les clients.
En savoir plus
La vision par ordinateur dans le secteur de la santé

La vision par ordinateur dans le secteur de la santé

Développe des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans le secteur de la santé accélère l'imagerie médicale, améliore les diagnostics et renforce la surveillance des patients.
En savoir plus
La vision par ordinateur dans l'industrie manufacturière

La vision par ordinateur dans l'industrie manufacturière

Optimise la production industrielle avec les modèles Ultralytics YOLO. L'IA de vision améliore le contrôle qualité, la détection des défauts, le respect des règles relatives aux EPI et l'automatisation des lignes d'assemblage.
En savoir plus
Vision par ordinateur dans l’automobile

Vision par ordinateur dans l’automobile

Applique la vision par ordinateur à l’automobile avec les modèles Ultralytics YOLO. L’IA de vision améliore la sécurité routière, l’aide à la conduite et l’automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Vision par ordinateur dans l’agriculture

Vision par ordinateur dans l’agriculture

Apporte l’IA de vision à l’agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l’agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus
Vision par ordinateur pour l'imagerie aérienne

Vision par ordinateur pour l'imagerie aérienne

Transforme les images de drones et aériennes en informations en temps réel pour l'agriculture, l'aquaculture, la surveillance environnementale, la conservation et l'analyse géospatiale avec Ultralytics YOLO.
En savoir plus
Vision par ordinateur dans l'aérospatiale

Vision par ordinateur dans l'aérospatiale

Apporte l'IA de vision à la surveillance aérienne grâce aux modèles Ultralytics YOLO. Alimente les drones, les flux de travail aérospatiaux, la conservation de l'environnement et les industries géospatiales avec des solutions de vision par ordinateur.
En savoir plus

Protège chaque site avec les modèles Ultralytics YOLO. L'IA de vision alimente la surveillance du périmètre, la détection des menaces, la reconnaissance des plaques d'immatriculation et la sécurité au travail.
En savoir plus
Vision par ordinateur en robotique

Vision par ordinateur en robotique

Donne plus d’intelligence à tes machines avec les modèles Ultralytics YOLO. L’IA visuelle en robotique permet la navigation autonome, la perception, le suivi d’objets et le contrôle en temps réel.
En savoir plus
Vision par ordinateur en logistique

Vision par ordinateur en logistique

Optimise la logistique avec les modèles Ultralytics YOLO. L’IA visuelle permet l’inspection des colis, le tri, le suivi des véhicules et la surveillance de la sécurité des entrepôts en temps réel.
En savoir plus
Vision par ordinateur dans le commerce de détail

Vision par ordinateur dans le commerce de détail

Réinvente le commerce de détail avec les modèles Ultralytics YOLO. L’IA visuelle permet le suivi des stocks, la surveillance des rayons, la gestion des files d’attente et l’obtention d’informations plus pertinentes sur les clients.
En savoir plus
La vision par ordinateur dans le secteur de la santé

La vision par ordinateur dans le secteur de la santé

Développe des solutions de santé avec les modèles Ultralytics YOLO. L'IA de vision dans le secteur de la santé accélère l'imagerie médicale, améliore les diagnostics et renforce la surveillance des patients.
En savoir plus
La vision par ordinateur dans l'industrie manufacturière

La vision par ordinateur dans l'industrie manufacturière

Optimise la production industrielle avec les modèles Ultralytics YOLO. L'IA de vision améliore le contrôle qualité, la détection des défauts, le respect des règles relatives aux EPI et l'automatisation des lignes d'assemblage.
En savoir plus
Vision par ordinateur dans l’automobile

Vision par ordinateur dans l’automobile

Applique la vision par ordinateur à l’automobile avec les modèles Ultralytics YOLO. L’IA de vision améliore la sécurité routière, l’aide à la conduite et l’automatisation des véhicules pour des routes plus intelligentes.
En savoir plus
Vision par ordinateur dans l’agriculture

Vision par ordinateur dans l’agriculture

Apporte l’IA de vision à l’agriculture intelligente avec les modèles Ultralytics YOLO. Optimise la surveillance des cultures, le suivi du bétail et l’agriculture de précision pour des rendements plus élevés et plus intelligents.
En savoir plus

Construisons ensemble l'avenir de l'IA !

Commence ton parcours vers l'avenir de l'apprentissage automatique