Reinforcement Learning
Explore les concepts fondamentaux de l’apprentissage par renforcement (RL). Découvre comment les agents utilisent le feedback pour maîtriser des tâches et comment Ultralytics YOLO26 alimente les systèmes de vision par RL.
L’apprentissage par renforcement (RL) est un sous-ensemble orienté vers les objectifs de l’apprentissage automatique (ML), dans lequel un système autonome, appelé agent, apprend à prendre des décisions en effectuant des actions et en recevant des retours de son environnement. Contrairement à l’apprentissage supervisé, qui repose sur des jeux de données statiques étiquetés avec les bonnes réponses, les algorithmes de RL apprennent grâce à un processus dynamique d’essais et d’erreurs. L’agent interagit avec une simulation ou le monde réel et observe les conséquences de ses actions afin de déterminer quelles stratégies produisent les récompenses à long terme les plus élevées. Cette approche reproduit étroitement le concept psychologique de conditionnement opérant, dans lequel le comportement est façonné au fil du temps par le renforcement positif (récompenses) et le renforcement négatif (punitions).
Concepts clés de la boucle de RL#
Pour comprendre le fonctionnement du RL, il est utile de le visualiser comme un cycle continu d’interactions. Ce cadre est souvent formalisé mathématiquement comme un processus décisionnel de Markov (MDP), qui structure la prise de décision dans des situations où les résultats sont en partie aléatoires et en partie contrôlés par le décideur.
Les principaux composants de cette boucle d’apprentissage sont les suivants :
- Agent d’IA : Entité responsable de l’apprentissage et de la prise de décision. Il perçoit l’environnement et effectue des actions afin de maximiser son succès cumulé.
- Environnement : Monde extérieur dans lequel l’agent évolue. Il peut s’agir d’un jeu vidéo complexe, d’une simulation de marché financier ou d’un entrepôt physique dans le domaine de l’IA dans la logistique.
- État : Instantané ou représentation de la situation actuelle. Dans les applications visuelles, cela implique souvent de traiter des flux vidéo provenant de caméras à l’aide de la vision par ordinateur (CV) afin de détecter les objets et les obstacles.
- Action : Mouvement ou choix spécifique effectué par l’agent. L’ensemble complet de tous les mouvements possibles est appelé l’espace des actions.
- Récompense : Signal numérique envoyé par l’environnement à l’agent après une action. Une fonction de récompense bien conçue attribue des valeurs positives aux actions bénéfiques et des pénalités aux actions nuisibles.
- Politique : Stratégie ou ensemble de règles utilisé par l’agent pour déterminer l’action suivante à partir de l’état actuel. Des algorithmes comme l’apprentissage Q définissent la manière dont cette politique est mise à jour et optimisée.
Applications concrètes#
L’apprentissage par renforcement est passé de la recherche théorique à des déploiements pratiques à fort impact dans divers secteurs.
- Robotique avancée : Dans le domaine de l’IA dans la robotique, le RL permet aux machines de maîtriser des compétences motrices complexes difficiles à programmer manuellement. Les robots peuvent apprendre à saisir des objets irréguliers ou à se déplacer sur des terrains accidentés en s’entraînant dans des moteurs physiques comme NVIDIA Isaac Sim avant leur déploiement dans le monde réel.
- Systèmes autonomes : Les véhicules autonomes utilisent le RL pour prendre des décisions en temps réel dans des situations de circulation imprévisibles. Alors que les modèles de détection d’objets identifient les piétons et les panneaux, les algorithmes de RL contribuent à déterminer des politiques de conduite sûres pour les insertions sur voie et la navigation aux intersections.
- Optimisation stratégique : Le RL a attiré l’attention du monde entier lorsque des systèmes comme AlphaGo de Google DeepMind ont vaincu des champions du monde humains dans des jeux de plateau complexes. Au-delà du jeu, ces agents optimisent la logistique industrielle, par exemple en contrôlant les systèmes de refroidissement des centres de données afin de réduire la consommation d’énergie.
Intégration de la vision au RL#
Dans de nombreuses applications modernes, l’« état » observé par un agent est visuel. Des modèles performants comme YOLO26 servent de couche de perception pour les agents de RL et convertissent les images brutes en données structurées. Ces informations traitées, telles que l’emplacement et la classe des objets, deviennent l’état que la politique de RL utilise pour choisir une action.
L’exemple suivant montre comment utiliser le package ultralytics pour traiter une image d’un environnement et créer une représentation de l’état (par exemple, le nombre d’objets) pour une boucle de RL théorique.
from ultralytics import YOLO
# Load the YOLO26 model to serve as the agent's vision system
model = YOLO("yolo26n.pt")
# Simulate the agent observing the environment (an image frame)
observation_frame = "https://ultralytics.com/images/bus.jpg"
# Process the frame to extract the current 'state'
results = model(observation_frame)
# The agent uses detection data to inform its next action
# For example, an autonomous delivery robot might stop if it sees people
num_objects = len(results[0].boxes)
print(f"Agent Observation: {num_objects} objects detected. Calculating next move...")Différencier les termes associés#
Il est important de distinguer l’apprentissage par renforcement des autres paradigmes de l’apprentissage automatique :
- Par rapport à l’apprentissage supervisé : L’apprentissage supervisé nécessite qu’un superviseur externe compétent fournisse des données d’entraînement étiquetées (par exemple, « cette image contient un chat »). En revanche, le RL apprend des conséquences de ses propres actions sans étiquettes explicites et découvre les chemins optimaux par l’exploration.
- Par rapport à l’apprentissage non supervisé : L’apprentissage non supervisé vise à trouver des structures ou des motifs cachés dans des données non étiquetées (par exemple, regrouper des clients). Le RL s’en distingue parce qu’il est explicitement orienté vers les objectifs et cherche à maximiser un signal de récompense plutôt qu’à simplement décrire la structure des données.
À mesure que la puissance de calcul augmente, des techniques comme l’apprentissage par renforcement à partir des retours humains (RLHF) affinent davantage la manière dont les agents apprennent et alignent plus étroitement leurs objectifs sur des valeurs humaines complexes et des normes de sécurité. Les chercheurs utilisent souvent des environnements standardisés comme Gymnasium pour évaluer et améliorer ces algorithmes. Pour les équipes qui cherchent à gérer les jeux de données nécessaires aux couches de perception de ces agents, l’Ultralytics Platform propose des outils complets d’annotation et de gestion des modèles.









