Deep Reinforcement Learning
Découvre le deep reinforcement learning (DRL) et comment il combine la prise de décision de l’IA avec le deep learning. Apprends à utiliser Ultralytics YOLO26 dès aujourd’hui comme couche de perception.
L’apprentissage profond par renforcement (DRL) est un sous-domaine avancé de l’intelligence artificielle (AI) qui combine les capacités décisionnelles de l’apprentissage par renforcement avec les capacités perceptives de l’apprentissage profond (DL). Alors que l’apprentissage par renforcement traditionnel s’appuie sur des méthodes tabulaires pour associer des situations à des actions, ces méthodes peinent à gérer les environnements complexes ou visuels. Le DRL surmonte cette limite en utilisant des réseaux neuronaux pour interpréter des données d’entrée de grande dimension, comme des images vidéo ou des relevés de capteurs, ce qui permet aux machines d’apprendre des stratégies efficaces directement à partir de l’expérience brute, sans instructions humaines explicites.
Le mécanisme fondamental du DRL#
Dans un système de DRL, un agent d’IA interagit avec un environnement selon des pas de temps discrets. À chaque étape, l’agent observe l’« état » actuel, sélectionne une action en fonction d’une politique et reçoit un signal de récompense indiquant le succès ou l’échec de cette action. L’objectif principal est de maximiser la récompense cumulée au fil du temps.
Le composant « profond » fait référence à l’utilisation de réseaux neuronaux profonds pour approximer la politique (la stratégie d’action) ou la fonction de valeur (la récompense future estimée). Cela permet à l’agent de traiter des données non structurées en utilisant la vision par ordinateur (CV) pour « voir » l’environnement d’une manière comparable à un être humain. Cette capacité repose sur des frameworks comme PyTorch ou TensorFlow, qui facilitent l’entraînement de ces réseaux complexes.
Applications concrètes#
Le DRL est passé de la recherche théorique à des applications concrètes et à fort impact dans divers secteurs :
- Robotique avancée : Dans le domaine de l’IA en robotique, le DRL permet aux machines de maîtriser des compétences motrices complexes difficiles à programmer explicitement. Les robots peuvent apprendre à saisir des objets irréguliers ou à parcourir des terrains accidentés en affinant leurs mouvements dans des moteurs physiques comme NVIDIA Isaac Sim. Cela implique souvent un entraînement sur des données synthétiques avant le déploiement de la politique sur du matériel physique.
- Conduite autonome : Les véhicules autonomes s’appuient sur le DRL pour prendre des décisions en temps réel dans des situations de circulation imprévisibles. Alors que les modèles de détection d’objets identifient les piétons et les panneaux, les algorithmes de DRL utilisent ces informations pour déterminer des politiques de conduite sûres concernant les changements de voie, la navigation aux intersections et le contrôle de la vitesse, tout en gérant efficacement la latence d’inférence nécessaire à la sécurité.
La vision comme observateur de l’état#
Pour de nombreuses applications de DRL, l’« état » est visuel. Des modèles rapides jouent le rôle des yeux de l’agent en convertissant des images brutes en données structurées sur lesquelles le réseau de politique peut agir. L’exemple suivant montre comment le modèle YOLO26 sert de couche de perception pour un agent en extrayant des observations (par exemple, le nombre d’obstacles) de l’environnement.
from ultralytics import YOLO
# Load YOLO26n to serve as the perception layer for a DRL agent
model = YOLO("yolo26n.pt")
# Simulate an observation from the environment (e.g., a robot's camera feed)
observation_frame = "https://ultralytics.com/images/bus.jpg"
# Perform inference to extract the state (detected objects)
results = model(observation_frame)
# The detection count serves as a simplified state feature for the agent's policy
print(f"State Observation: {len(results[0].boxes)} objects detected.")Distinguer le DRL des concepts connexes#
Il est utile de différencier l’apprentissage profond par renforcement des termes similaires afin de comprendre sa position particulière dans le paysage de l’IA :
- Apprentissage par renforcement (RL) : Le RL standard est le concept fondamental, mais il s’appuie généralement sur des tables de recherche (comme les tables Q), qui deviennent impraticables pour les grands espaces d’états. Le DRL résout ce problème en utilisant l’apprentissage profond pour approximer des fonctions, ce qui lui permet de gérer des entrées complexes comme des images.
- Apprentissage par renforcement à partir de retours humains (RLHF) : Alors que le DRL optimise généralement une fonction de récompense définie mathématiquement (par exemple, des points dans un jeu), le RLHF affine les modèles, en particulier les grands modèles de langage (LLMs), à l’aide de préférences humaines subjectives afin d’aligner le comportement de l’IA sur les valeurs humaines, une technique popularisée par des groupes de recherche comme OpenAI.
- Apprentissage non supervisé : Les méthodes non supervisées recherchent des schémas cachés dans les données sans retour explicite. En revanche, le DRL est orienté vers un objectif et guidé par un signal de récompense qui dirige activement l’agent vers un objectif précis, comme l’expliquent les ouvrages fondamentaux de Sutton et Barto.
Les développeurs qui souhaitent gérer les jeux de données nécessaires aux couches de perception des systèmes de DRL peuvent utiliser l’Ultralytics Platform, qui simplifie les workflows d’annotation et d’entraînement dans le cloud. Par ailleurs, les chercheurs utilisent souvent des environnements standardisés comme Gymnasium pour évaluer leurs algorithmes de DRL par rapport à des références établies.









